Tin ngành
John Platt và tầm nhìn về AI trong khoa học: Từ giải Oscar đến giải mã biến đổi khí hậu
(giờ Việt Nam)
Tóm tắt AI
Cuộc trò chuyện với 'siêu mọt sách' từng đoạt giải Oscar của Google về việc tự động hóa nghiên cứu khoa học, giải quyết khủng hoảng khí hậu và vai trò của con người trong kỷ nguyên AI siêu thông minh.
Bản dịch AI

Bạn có thường xuyên được trò chuyện với một vị khách vừa đoạt giải Oscar, vừa là người phát minh ra các thuật toán học máy kinh điển không? John Platt sở hữu một giải Oscar, hai thuật toán kinh điển, hai tiểu hành tinh được đặt theo tên ông và chỉ số Erdos-Bacon là 6. Đây chắc chắn là bản tiểu sử thú vị nhất trong số tất cả các vị khách mà chúng tôi từng đọc từ trước đến nay. Kết quả là một cuộc trò chuyện đầy cảm hứng và thú vị về Empirical Research Assistance (ERA) của Google, cách AI có thể giúp chống lại biến đổi khí hậu, cùng vô số câu chuyện tuyệt vời về sự đồng tiến hóa giữa khoa học và AI.
Đồng nghiệp của John, Dave Bacon, thích trêu chọc rằng sự nghiệp của John được định hình bởi việc ông luôn đi trước thời đại hai mươi năm. Đó có thể là mạng thần kinh tích chập (một số người cho rằng ông là người đồng đặt tên cho thuật ngữ này), nghiên cứu nhiệt hạch, hay điện toán lượng tử. John và Google đã làm việc để giải quyết một số vấn đề khó khăn nhất của nhân loại bằng AI và tính toán trong hơn một thập kỷ qua. Gần đây, John và nhóm của ông đã đặt mục tiêu sử dụng AI để giải quyết bất kỳ vấn đề khoa học nào có thể được biểu diễn dưới dạng một hàm điểm số (score).
Nhóm của John đã giải quyết nhiều vấn đề khoa học hóc búa trong suốt nhiều năm. Khi giải quyết chúng, họ nhận thấy một mô hình chung: nhiều vấn đề khoa học có thể được quy về cái mà John gọi là "tác vụ có thể chấm điểm" (scoreable task). Một khi bạn có hàm điểm số, mục tiêu là tìm ra mã nguồn giúp tối đa hóa điểm số đó. Phần khó nằm ở việc xây dựng hàm điểm, nhưng ngay cả khi đã có nó, việc tìm ra bộ tối ưu hóa vẫn đòi hỏi rất nhiều nỗ lực.
Nhóm của John bắt đầu tự động hóa các giải pháp cho vấn đề tổng quát này. Ý tưởng này xuất phát từ khái niệm một AI "auto-Kaggle", có khả năng giải quyết bất kỳ bài toán Kaggle nào mà bạn đưa ra. Kaggle thuộc sở hữu của Google, vì vậy tất cả dữ liệu đều sẵn sàng và dễ dàng tiếp cận đối với họ!
Kết quả là Empirical Research Assistance hay ERA của Google (bài báo, github, blog). ERA có khái niệm đơn giản đến bất ngờ. Gemini (hoặc LLM tùy chọn của bạn) duy trì một cây các thí nghiệm (notebook) đã thực hiện và hướng đi của chúng. Nó là một "người anh em" gần gũi với Monte Carlo Tree Search: tại mỗi lần lặp, quy tắc Upper Confidence Bound sẽ chọn ra những notebook hứa hẹn nhất để đột biến. Cách tiếp cận này mang tính lạc quan chứ không phải tham lam (greedy), vì vậy đôi khi ngay cả notebook xếp thứ năm cũng được chọn. Sau đó, Gemini đề xuất các đột biến cho từng notebook, khoảng mười cái mỗi lần. Lịch sử của mỗi nhánh được chia sẻ, giúp các nhánh khác nhau có thể học hỏi lẫn nhau.
"Nó gần giống như việc có một sinh viên cao học cực kỳ hăng hái, người không bao giờ ngủ."
Các thuật toán tiến hóa đã xuất hiện từ những năm 70, nhưng phương pháp này hiệu quả vì Gemini thực sự biết phải tìm kiếm ở đâu! Điều thú vị hơn nữa là đã có một bước nhảy vọt giữa Gemini 2.0 và 2.5, giúp hệ thống từ chỗ không hoạt động trở nên hoạt động cực kỳ hiệu quả.
ERA mạnh mẽ đến mức John và nhóm của ông đã giải quyết được nhiều vấn đề tồn đọng với nó, dẫn đến ít nhất mười bài báo khoa học. Một số trong đó liên quan đến biến đổi khí hậu, điều mà chúng tôi sẽ thảo luận trong phần tiếp theo.
Vì vậy, chúng tôi phải hỏi: nếu bạn có một vị thần tối ưu hóa, làm thế nào để không tự lừa dối chính mình? Câu trả lời của John là ERA cung cấp các mô hình dự đoán. Việc đảm bảo chúng thực sự mang tính mô tả hay không phụ thuộc vào nhà khoa học. Một phần trong đó chỉ đơn giản là khoa học học máy cẩn trọng kiểu cũ. "Nó là một công cụ mạnh. Nó có thể cắt đứt ngón tay của bạn." Điều này dẫn đến một cuộc thảo luận thú vị về các cuộc thi trên Kaggle và những cách hài hước mà mọi người có thể quá khớp (overfit) với tập dữ liệu mà không thực sự giải quyết vấn đề cốt lõi: cuộc thi phát hiện vệt ngưng tụ (contrail) của Google đã bị các thí sinh thắng cuộc "hack" bằng cách phát hiện ra sai số nửa pixel trong nhãn (gốc tọa độ nằm ở góc hay tâm của pixel?) và đây hóa ra lại là một phần trong "bí kíp" chiến thắng. Tuyệt vời để giành 15.000 đô la, nhưng không hữu ích nếu bạn thực sự muốn giải quyết vấn đề vệt ngưng tụ.
"Bản thân con người cũng sẽ hành động giống như những LLM này và cố gắng tìm cách gian lận phần thưởng. Điều này quay trở lại với định luật Goodhart: bất kỳ chỉ số nào trở thành mục tiêu thì nó không còn là một chỉ số tốt nữa."
Lời khuyên của ông về việc nên bắt đầu từ đâu?
"Luôn luôn chỉ cần khớp hồi quy tuyến tính (linear regression). Cứ làm đi. Cứ làm đi. Cứ làm đi. Hoặc SVM."
John và nhóm của ông đã làm việc rất nhiều để giảm thiểu tác động của biến đổi khí hậu. Chúng tôi đã thảo luận về một số sáng kiến của họ.
Có lẽ kết quả thú vị nhất mà chúng tôi thảo luận là giảm thiểu tác động của các vệt ngưng tụ (contrails) từ máy bay. Những vệt nhỏ mà bạn thấy phía sau máy bay bằng cách nào đó chiếm tới 1% tổng số sự nóng lên toàn cầu do con người gây ra?!? Một số vệt tinh thể băng này có thể tồn tại trong nhiều ngày. Những tinh thể này có màu đen trong dải hồng ngoại, hoạt động như một tấm chăn nhiệt giữ nhiệt cả ngày lẫn đêm.
Rất dễ hiểu chuyện gì đang xảy ra ở đây: một vùng khí quyển trở nên "bão hòa băng" (ice supersaturated), và một chút khí thải nhỏ đóng vai trò là hạt nhân cho hơi nước kết tinh ngay lập tức. Quy mô ở đây thật đáng kinh ngạc, chỉ một gam khí thải có thể tạo ra mười kilôgam tinh thể băng.
Về nguyên tắc, giải pháp cho tất cả những điều này khá đơn giản! Chúng ta biết những phần nào của khí quyển có khả năng hình thành các vệt này nhất. Chỉ cần cho máy bay hạ độ cao một hoặc hai tầng bay. Vấn đề được giải quyết, phải không? Chà, phần khó là tính toán xem bao nhiêu sự nóng lên đã được ngăn chặn. Đây là một bài toán phản thực tế (counterfactual), một phần trong đó đã làm khó nhóm của John trong hơn hai năm. Họ có một mô hình hoạt động cho phần giữ nhiệt, nhưng không có cho phần phản xạ ánh sáng mặt trời. ERA đã tìm ra một mô hình đơn giản với một số biến gây nhiễu mà họ chưa từng cân nhắc. Đã giải mã được!
Mô hình hóa khí hậu nói chung là một vấn đề khó. Khí hậu được hiểu rõ nhất như một bộ hút (attractor) của nhiều kết quả thời tiết khả thi khác nhau. Điều này làm cho việc mô hình hóa trở nên khó khăn hơn nhiều.
"Thời tiết là nơi bạn đang đứng trên bộ hút, còn khí hậu là các thống kê của bộ hút đó. Vấn đề với khí hậu là chúng ta đang thay đổi nó. Bản thân bộ hút đang thay đổi, nó đang dịch chuyển."
John và nhóm của ông đã làm việc để điều trị cả triệu chứng lẫn căn bệnh biến đổi khí hậu, với một số công trình khác trong lĩnh vực này. Một ví dụ thú vị khác mà chúng tôi đề cập ngắn gọn là FireSat, một cách sử dụng chòm sao vệ tinh để nhanh chóng xác định các đám cháy trước khi chúng quá lớn để dập tắt. Đối với bất kỳ ai sống ở California, bạn sẽ hiểu vấn đề này. Vào những năm khô hạn, một đám cháy nhỏ có thể dẫn đến hàng trăm ngàn mẫu Anh bị thiêu rụi. Nếu bạn có thể tìm thấy đám cháy này khi nó chỉ bằng kích thước một căn phòng, nó có thể được dập tắt. Đến khi nó lan rộng ra một mẫu Anh, chúng ta đã gặp phải một vấn đề khó khăn hơn nhiều.
Đến giờ, có lẽ đã rõ ràng rằng John có một cái nhìn đáng kinh ngạc và độc đáo về sự giao thoa giữa khoa học, tính toán và AI. John đã kể về một lớp học về vật lý tính toán mà ông tham gia cùng Richard Feynman vào năm 1982. Đó là thời điểm điện toán lượng tử là một khái niệm chưa được định nghĩa rõ ràng, không có lý thuyết hay bằng chứng thực nghiệm. John nhớ lại mỗi thứ Ba là một bài giảng của khách mời, và mỗi thứ Năm là Feynman giải thích tại sao vị khách hôm thứ Ba lại sai. John cũng nhớ lại việc làm khoa học vào thời điểm gần như không có máy tính, một triệu phép tính mỗi giây đã là đỉnh cao công nghệ.
Lời khuyên của John là gì: kỹ năng quan trọng nhất là phát triển chuyên môn sâu trong lĩnh vực. Không có cách nào khác để phát triển "gu" thẩm mỹ khoa học ngoài việc giải quyết các vấn đề khó. Một phần đáng ngạc nhiên là John khuyên nên dành thời gian làm mọi thứ theo cách truyền thống. Hãy chơi đùa với các công cụ và tự mình triển khai mọi thứ.
"Bạn có thể lái xe lên núi, hoặc bạn có thể đi bộ leo núi, và có lẽ cũng ổn, thậm chí thú vị, khi thỉnh thoảng đi bộ."
Tóm lại, thông điệp của John gửi tới khán giả là vẫn sẽ có chỗ đứng cho các nhà khoa học, và nếu có bất cứ điều gì, nó sẽ chỉ mở ra nhiều cơ hội hơn cho "những thứ sáng tạo, những thứ đòi hỏi sự nghiêm ngặt, những thứ thuộc về triết học." Nhưng đừng quên dành thời gian làm những công việc lao động chân tay (grunt work).
"Dường như có một động lực mạnh mẽ trên thế giới này để tối ưu hóa và vắt kiệt mọi thứ. Nhưng bạn thực sự mất đi thứ gì đó khi quá tối ưu hóa. Nó là sự quá khớp (overfit)."
Và dù bạn sử dụng công cụ gì đi chăng nữa, lời khuyên của John vẫn giống như lời khuyên mà Feynman đã dành cho ông bốn mươi năm trước: bạn không được tự lừa dối chính mình, và bạn chính là người dễ bị lừa nhất.
Chúng tôi đã có một khoảng thời gian tuyệt vời khi trò chuyện với John. Hy vọng bạn cũng sẽ thích nó!
Nếu hỏi John, nhiệt hạch chỉ còn cách ba năm nữa, chứ không phải ba mươi. Và tại sao tiêu chuẩn Lawson lại khiến mọi phương pháp nhiệt hạch đều có "gót chân Achilles".
Tại sao các qubit siêu dẫn vẫn còn rất khó chiều.
Tiểu hành tinh mà ông đặt theo tên mẹ mình, hóa ra lại có một mặt trăng.
Sự thiếu hụt heli đang cận kề mà không ai nhắc đến.
Cách NeurIPS bắt đầu từ việc mọi người "đột nhập" vào một hội thảo riêng tư tại Snowbird, và tại sao mạng Hopfield là tất cả những gì bạn cần.
Trở thành quản trị viên hệ thống cho Carver Mead trên một chiếc VAX với ổ đĩa 80 MB to bằng một chiếc máy rửa bát.
Tìm kiếm tiểu hành tinh vào năm 1985 bằng phim, kính lập thể và một lá thư gửi cho Brian Marsden. Đài quan sát Vera Rubin đã tìm thấy 11.000 tiểu hành tinh trong sáu tuần.
Hiệu ứng Feynman: sự minh mẫn tuyệt đối trong phòng, nhưng biến mất ngay khi bạn bước ra ngoài.
Tiếng vang lượng tử, kỷ nguyên NISQ, và lý do tại sao ông nghĩ điện toán lượng tử không phải là ba mươi năm nữa, cũng không phải là ngày mai.
Một công ty khởi nghiệp muốn bơm thủy ngân vào lò phản ứng nhiệt hạch và bán số vàng được chuyển hóa. "Nó có thể không hiệu quả."
Quy tắc 20% thời gian của John dành cho nhóm của mình: làm những việc để học hỏi, và bạn thậm chí không cần phải nói cho ông biết đó là việc gì.
Kho lưu trữ GitHub của ERA có một bản triển khai mã nguồn mở chạy Gemini nhưng có thể được sử dụng với bất kỳ LLM nào. ERA hiện không khả dụng dưới dạng sản phẩm của Google.
"Bão hòa băng" (Ice-supersaturated) liên quan đến hơi nước, không phải nước lỏng. Không khí lạnh có thể giữ một lượng hơi nước nhất định, và có hai giới hạn khác nhau: lượng hơi nước cân bằng với nước lỏng, và lượng nhỏ hơn cân bằng với băng. Dưới mức đóng băng, một túi không khí có thể nằm giữa hai giới hạn đó. Nó có nhiều hơi nước hơn mức băng có thể chịu đựng, nhưng không đủ để ngưng tụ thành giọt, và băng sẽ không hình thành trực tiếp từ hơi nước nếu không có hạt nhân. Vì vậy, hơi nước cứ lơ lửng ở đó, ở trạng thái siêu bền, đôi khi trong nhiều ngày, cho đến khi có thứ gì đó kích hoạt nó.

Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.