‹ Quay lạiTinh chọnĐiểm AI 74/100
Anthropic: Research (công bố - Web)
Tinh chọnĐiểm AI 74/100

Hướng dẫn

Claude thực hiện thành công phép tính biên độ 9 vòng N=4 siêu đối xứng Yang-Mills

(giờ Việt Nam)

Tóm tắt AI

Nhà vật lý Matt von Hippel chia sẻ cách đội ngũ Anthropic sử dụng Claude Science (Fable 5.1) để giải quyết bài toán vật lý lý thuyết phức tạp với chi phí chỉ khoảng 1.000 - 2.000 USD.

Chính văn · Bản dịch AI

Claude gives us N=4 super Yang-Mills to nine loops

Trong bài viết khách mời này, nhà vật lý kiêm cây bút khoa học Matt von Hippel chia sẻ những gì đã xảy ra khi ông đưa ra một thách thức cho các công ty AI liên quan đến một vấn đề trong lĩnh vực vật lý lý thuyết cũ của mình.

Illustration of nine-loops

Không thường xuyên khi bạn đưa ra một thách thức mà chỉ một tháng sau đã thấy nó bị chinh phục. Nhưng chúng ta đang sống trong những thời điểm khác thường.

Hãy để tôi tự giới thiệu: Tôi là Matt von Hippel. Tôi từng là một nhà vật lý lý thuyết; hiện nay tôi là một cây bút khoa học. Trong suốt thời gian đó, tôi vẫn là một blogger, viết bài hàng tuần tại 4gravitons.com về vật lý và những người làm công việc này.

Ngày càng nhiều, việc viết blog về vật lý đồng nghĩa với việc viết blog về AI. Đó là một vấn đề, vì tôi chắc chắn không phải là một chuyên gia AI. Tôi có tìm hiểu sơ qua về nó, tất nhiên rồi. Tôi có lẽ biết nhiều hơn bà của bạn. Nhưng tôi chủ yếu phải lùi lại và tin tưởng các chuyên gia. Và thật bực mình, các chuyên gia lại bất đồng ý kiến! Tôi đã nghe từ những người thông minh, am hiểu rằng họ tin chắc AI chỉ còn cách siêu trí tuệ vài năm nữa, và siêu trí tuệ đó sẽ có khả năng làm những điều thực sự đáng sợ. Và tôi cũng nghe từ những người thông minh, am hiểu khác rằng họ tin chắc không kém rằng AI dựa trên LLM đang tiến gần đến giới hạn, rằng các mô hình như Claude thậm chí sẽ không thể thực hiện được những công việc ấn tượng trong vật lý, chứ đừng nói đến việc chinh phục thế giới.

Tôi đã ngần ngại đưa ra những dự đoán của riêng mình. Trước khi hình thành quan điểm, tôi muốn thấy một LLM đạt được tiến bộ trong một việc gì đó quen thuộc, một việc mà tôi biết là khó vì chính tôi đã từng thử làm điều tương tự.

Ngoài ra, tôi muốn thấy một LLM thực hiện một việc mà tôi cho là khó về mặt tính toán. Các LLM chắc chắn đã có những bước tiến ấn tượng trong toán học, và chỉ riêng trong tháng này có lẽ đã thay đổi suy nghĩ của nhiều người. Nhưng tiến bộ trong toán học đến từ những ý tưởng mới, và ý tưởng là những thứ bí ẩn: người ta không bao giờ biết chúng khó tìm đến mức nào cho đến khi chúng được tìm thấy. Tính toán mang lại cảm giác chắc chắn hơn. Tôi muốn thấy một LLM giải quyết một thách thức dường như nằm ngoài tầm với, không phải vì các nhà nghiên cứu không biết cách thực hiện về mặt nguyên tắc, mà vì việc thực hiện nó dường như đòi hỏi nhiều máy tính và thời gian hơn mức mà các nhà nghiên cứu có thể tiếp cận một cách hợp lý. Tôi muốn xem liệu những nhà nghiên cứu đó có sai hay không: liệu một nhà nghiên cứu nhân tạo thông minh hơn có thể sử dụng cùng những chiếc máy tính đó và giải quyết vấn đề hay không.

Vì vậy, tôi đã đưa ra một thách thức:

“Nếu các công ty AI muốn gây ấn tượng với những người như tôi (hoặc làm chúng tôi sợ hãi, nếu xét đến điều đó), thì họ cần phải giải quyết lĩnh vực cũ của tôi. Hãy chứng minh rằng một AI có thể tận dụng các nguồn lực máy tính mà một học giả có thể tiếp cận, và giải quyết một trong những vấn đề lớn chưa có lời giải của lĩnh vực biên độ tán xạ. Hãy chứng minh rằng giới hạn tính toán mà mọi người đều cho là một vấn đề thực ra không quan trọng. Hãy cho chúng tôi N=8 siêu trọng trường đến bảy vòng, hoặc N=4 siêu Yang-Mills đến chín vòng.”

Tóm lại: liệu AI có thể giải quyết một vấn đề tiên phong trong lĩnh vực vật lý hạt lý thuyết cũ của tôi không? Và liệu nó có thể làm điều đó với một ngân sách hạn hẹp không?

Thách thức

Lĩnh vực cũ của tôi là một nhánh của vật lý hạt lý thuyết gọi là amplitudeology (lý thuyết biên độ). Khi các nhà vật lý hạt khác dự đoán các hạt mới, họ đảm bảo rằng họ có thể thực hiện các phép tính để kiểm chứng những dự đoán đó. Họ tính toán các công thức gọi là biên độ tán xạ, cho phép các nhà vật lý sử dụng động lượng và năng lượng của các hạt hạ nguyên tử để tính toán khả năng chúng phản ứng theo những cách cụ thể. Nếu các nhà vật lý có thể đưa ra những dự đoán chính xác hơn cho các phản ứng này, họ có thể kiểm tra xem kết quả từ các thí nghiệm như Máy gia tốc hạt lớn (Large Hadron Collider) có khớp với những dự đoán đó hay không. Một sự sai lệch có thể là bằng chứng cho một lý thuyết mới, một lý thuyết có thể giải thích một số bí ẩn lớn còn tồn tại của vật lý, như bản chất của vật chất tối, hoặc sự cân bằng giữa vật chất và phản vật chất trong vũ trụ.

Các công thức biên độ tán xạ này rất khó tính toán, khó đến mức các nhà vật lý hầu như luôn sử dụng các phép xấp xỉ. Họ thực hiện các phép tính từng phần, cắt bỏ tại một số lượng "vòng" cụ thể, một thước đo mức độ phức tạp của các tương tác giữa các hạt. Họ càng đưa nhiều "vòng" vào các phép tính của mình, họ càng tiến gần đến câu trả lời thực sự, và về mặt tính toán, phép tính đó càng khó thực hiện.

Trên thực tế, hầu hết các công thức biên độ tán xạ mới chỉ được tính toán đến hai vòng. Một số ít có ba vòng. Dự đoán chính xác nhất trong vật lý hạt mà bạn có thể đã nghe nói đến đã sử dụng năm vòng.

Các nhà nghiên cứu lý thuyết biên độ muốn làm tốt hơn. Họ phát triển các kỹ thuật mới mang tính thử nghiệm và kiểm tra chúng trên các lý thuyết "mô hình đồ chơi" (toy model) đặc biệt. Bằng cách thử nghiệm kỹ thuật với một mô hình đồ chơi nơi phép tính dễ dàng hơn, thay vì các hạt thách thức hơn của thế giới thực, các nhà nghiên cứu có thể kiểm tra áp lực các phương pháp mới và xem chúng có thể đi xa đến đâu.

Tôi đã đăng các thách thức cho hai trong số các mô hình đồ chơi đó. Mô hình mà các cộng sự tại Anthropic chọn để giải quyết là tiến tới chín vòng với một lý thuyết mô hình đồ chơi cụ thể, gọi là N=4 siêu Yang-Mills.

"Yang-Mills" là tên kỹ thuật cho một loại lý thuyết giải thích hầu hết thế giới xung quanh chúng ta. Ba trong bốn lực cơ bản của tự nhiên: điện từ, lực hạt nhân mạnh giữ các hạt nhân nguyên tử lại với nhau, và lực hạt nhân yếu gây ra sự phân rã phóng xạ trong những thứ như quả chuối, đều là các lý thuyết Yang-Mills.

"N=4 siêu" bắt nguồn từ siêu đối xứng (supersymmetry). Các nhà vật lý đã suy đoán rằng mỗi hạt đều có một "đối tác siêu đối xứng", một hạt có cùng điện tích nhưng thuộc loại khác, khớp các hạt vật chất như electron với các hạt lực như photon. Đã có lúc họ lạc quan rằng các hạt này có thể giải thích vật chất tối, thông qua các đối tác chưa được khám phá của các hạt quen thuộc hơn. Những suy đoán đó sử dụng siêu đối xứng "N=1". Trong "N=4", mỗi hạt có bốn đối tác siêu đối xứng, thay vì chỉ một.

Sự dư thừa các hạt đó làm cho lý thuyết này rất thiếu thực tế. N=4 siêu Yang-Mills không được sử dụng như một lời giải thích cho vật chất tối, hay cho bất cứ điều gì trong thế giới thực. Thay vào đó, các nhà nghiên cứu lý thuyết biên độ sử dụng nó để trau dồi kỹ thuật của họ, bởi vì N=4 nghịch lý thay lại dễ tính toán hơn. Sự cân bằng tinh tế giữa các hạt khác nhau có nghĩa là chỉ cần các tổ hợp biến số nhất định, giúp hợp lý hóa các phép tính.

Những phép tính này được thực hiện bằng một kỹ thuật thử nghiệm gọi là bootstrap, vốn hóa ra lại cực kỳ phù hợp để sử dụng AI. Để bootstrap một biên độ, bạn không cần phải tính đến mọi tương tác hạt có thể xảy ra. Bạn chỉ cần biết đại khái câu trả lời trông như thế nào, theo dõi mọi khả năng trong các tệp máy tính bằng một bảng chữ cái chuyên dụng. Sau đó, bạn bắt đầu kiểm tra mọi thứ bạn biết: các dự đoán từ các kỹ thuật tính toán khác, các quy tắc mà câu trả lời phải tuân theo, các liên kết đến các vấn đề liên quan nơi câu trả lời dễ tìm hơn. Nó hơi giống Sudoku, nơi bạn bắt đầu với một lưới chứa tất cả các số có thể, sau đó gạch bỏ chúng khi bạn thực hiện. Cuối cùng, bạn hy vọng tìm thấy rằng chỉ có một khả năng thỏa mãn tất cả các kiểm tra, trong khi vẫn còn đủ các kiểm tra dư thừa để đảm bảo rằng bạn không mắc sai lầm.

Điều đó có nghĩa là Lance đã sẵn sàng để kiểm tra xem liệu có ai đó đã đưa cho anh ấy công thức biên độ tiếp theo với chín vòng lặp hay chưa. Đây sẽ là một câu trả lời thú vị, không chỉ như một sự xác nhận cho kỹ thuật bootstrap, mà còn là một ví dụ hiếm hoi về một biên độ có độ phức tạp lên tới nhiều vòng lặp như vậy, một kết quả xứng đáng được nghiên cứu riêng.

Nhưng anh ấy chưa tính toán nó, và cũng chưa có ai khác trong lĩnh vực này làm điều đó. Cách anh ấy tìm ra câu trả lời cho tám vòng lặp vốn đã hơi gián tiếp, thông qua một mối liên hệ đáng ngạc nhiên với một công thức khác nhưng có liên quan gọi là form-factor, một dạng biên độ từng phần liên quan đến các hạt khác nhau mà hóa ra lại dễ tính toán hơn một chút. Anh ấy đã kỳ vọng tìm ra vòng lặp tiếp theo một cách gián tiếp hơn nữa, có khả năng là bằng một loại phương pháp AI khác. Nếu mọi người nghĩ rằng chỉ cần chạy phương pháp bootstrap thông thường thêm một vòng lặp nữa là xong, thì hẳn đã có người làm rồi.

Sau đó, mọi người đã làm được.

Hóa ra, có những người tại Anthropic đọc blog của tôi.

Vào cuối tháng 8, Liam Fitzpatrick và Siddharth Mishra-Sharma, hai nhà vật lý tại Anthropic, đã liên hệ với tôi để nói rằng họ đã giải quyết được một trong những thách thức trong bài đăng của tôi. Sau khi xác minh kết quả với Lance, họ đã giải thích cho tôi cách họ đạt được nó.

Đúng với tinh thần của thử thách, họ không sử dụng hàng triệu đô la cho sức mạnh máy tính. Họ đã sử dụng Fable 5.1, làm việc trong Claude Science, một nền tảng mà các nhà khoa học có thể trả phí để sử dụng. Claude Science là thứ mà những người trong ngành gọi là một "harness" (bộ khung), một chương trình sử dụng Claude LLM với các quy tắc và câu lệnh có cấu trúc để đạt được hành vi mạnh mẽ và hữu ích hơn về mặt khoa học.

Rõ ràng là sau khi hỏi Claude bài toán nào mà nó có khả năng giải quyết cao nhất, họ đã đưa cho nó một câu lệnh đơn giản:

“Bài toán là tính toán biên độ sáu hạt (hình lục giác) trong N=4 SYM phẳng tại chín vòng lặp.”

Từ đó, họ chỉ cần tiếp tục bảo nó làm tiếp với những bình luận như:

“Tôi sắp đi ngủ và sẽ không có mặt trong vài giờ tới. Hãy tiếp tục làm việc này cho đến khi tôi bảo bạn dừng lại. Cập nhật cho tôi mỗi 4-6 giờ.”

Claude cuối cùng đã thực hiện phép tính theo hai cách khác nhau: bootstrap gốc và phương pháp form-factor gián tiếp. Mỗi cách tiếp cận sẽ tiêu tốn của người dùng cuối khoảng một hoặc hai nghìn đô la, chủ yếu do chi phí chạy Claude trong thời gian dài. Phép tính bootstrap, được thực hiện bằng ngôn ngữ lập trình Python với gói SymPy, chiếm khoảng 100 đô la trong ngân sách, tương đương với việc chạy 96 CPU trong một tuần.

Chạy 96 CPU trong một tuần có vẻ là rất nhiều khi tôi làm công việc này mười năm trước, nhưng bây giờ nó khá hợp túi tiền nếu bạn có lý do chính đáng.

Hóa ra, kết quả cũng không quá xa vời đối với con người. Vài ngày sau khi tôi nhận được tin từ Anthropic, chúng tôi nhận được tin từ Song He, một nhà nghiên cứu biên độ tại Viện Hàn lâm Khoa học Trung Quốc ở Bắc Kinh. Nhóm của Song đã đạt được phần lớn kết quả. Họ đã sử dụng một số hỗ trợ từ AI, dựa trên GPT-6, nhưng không phải kiểu tiếp cận một lần gần như không cần con người mà Anthropic đã sử dụng.

Mọi người ở đây đều rất thân thiện, điều này thật nhẹ nhõm. Những con người như Lance, Song và các cộng sự của họ sẽ được công bố kết quả, dành thời gian giải thích và phân tích chúng vì lợi ích của các nhà nghiên cứu tương lai. Vai trò của Claude, hiện tại, đã xong.

Vậy, bài toán đã được giải quyết?

Tôi đặt ra thử thách vì muốn hiểu rõ hơn về những gì AI hiện tại có thể làm và nó có thể tiến xa đến đâu. Vậy tôi đã học được gì?

Tôi đã nghĩ đây có thể là cơ hội để thấy AI vượt qua rào cản tính toán theo một cách đáng ngạc nhiên. Thay vào đó, nó đã làm được điều mà con người cũng có thể làm được. Claude đã sử dụng các phương pháp đã biết, với lượng tính toán nhiều hơn một chút so với những gì mọi người từng thử trước đây. Nó có thể đã được thúc đẩy nhờ sử dụng Python thay vì Maple (chương trình toán học yêu thích của Lance) hay Mathematica (của tôi), và nó có thể đã sử dụng các phương pháp kỹ thuật phần mềm tốt hơn nhiều so với chúng tôi, nhưng không phải là quá thông minh.

Bài học lớn nhất của tôi là có nhiều cơ hội dễ dàng hơn bạn nghĩ. Ngay cả khi một mục tiêu đơn giản và được xác định rõ ràng, đôi khi nó trông có vẻ khó đạt được đối với các chuyên gia hơn là thực tế. Có những người có nền tảng khoa học máy tính đã nói với tôi trong nhiều năm rằng các nhà nghiên cứu biên độ có thể đạt được nhiều tiến bộ hơn chỉ bằng cách thuê vài lập trình viên. Họ nên cảm thấy được minh oan.

Cũng cần lưu ý rằng Claude Science đã hoàn thành việc này trong một lần duy nhất, mà không cần bất kỳ sự giám sát khoa học nào phức tạp hơn việc "tiếp tục làm". Đây là những phép tính khó khăn và lộn xộn. Nếu tôi dành một tuần trên 96 CPU để thực hiện loại phép tính này, thì gần như chắc chắn tôi sẽ mất hai tuần: gần như đảm bảo là tôi sẽ làm sai điều gì đó ngay lần thử đầu tiên. Tôi không biết Claude đã mắc bao nhiêu lỗi bên trong quá trình thực hiện, nhưng bộ khung đã đưa nó đến đích mà không cần sự can thiệp của cộng sự bên ngoài. Tôi không chắc điều đó có làm tôi ngạc nhiên ở thời điểm này hay không. Nhưng nếu bạn không biết nó có thể làm được điều đó vì bạn vẫn nghĩ AI dễ mắc lỗi đến mức không thể sử dụng được, thì đây là điều bạn nên rút ra: Bây giờ nó có thể thực hiện loại công việc này một cách đáng tin cậy.

Bài gốc còn tiếp — xem tiếp tại bài gốc ↗

Claude ScienceFable 5.1Vật lý lý thuyếtNghiên cứu AIAnthropic

Bài viết được AI dịch và tổng hợp tự động từ Anthropic: Research (công bố - Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Claude thực hiện thành công phép tính biên độ 9 vòng N=4 siêu đối xứng Yang-Mills | AIHOT.vn