Thủ thuật
Simon Willison bàn về tranh cãi quanh việc OpenAI giải bài toán thiên niên kỷ Navier-Stokes
(giờ Việt Nam)
Tóm tắt AI
OpenAI gây xôn xao khi dùng mô hình chưa công bố để giải bài toán Navier-Stokes trong 88 giờ và xác thực bằng Lean. Sự kiện này tiêu tốn 300 tỷ token, đặt ra nhiều nghi vấn về tính xác thực trong giới toán học.
Bản dịch AI
Về bài toán giải thưởng Thiên niên kỷ Navier–Stokes. Một kết quả ấn tượng từ OpenAI, đơn vị đã sử dụng một mô hình chưa được công bố để đưa ra lời giải cho bài toán tồn tại và tính trơn của phương trình Navier–Stokes, một trong bảy Bài toán Giải thưởng Thiên niên kỷ vốn đã treo giải thưởng 1.000.000 USD kể từ ngày 24 tháng 5 năm 2000.
Khám phá này phần nào bị lu mờ bởi những cáo buộc về hành vi không minh bạch từ Tristan Buckmaster, một giáo sư toán học tại NYU, người đã hợp tác giải quyết bài toán này cùng Levent Alpöge, một nhà toán học tài năng hiện đang làm việc cho Anthropic.
Khiếu nại của Tristan đi kèm với phiên bản kết quả của họ được công bố một cách vội vã. Đây là tệp PDF mô tả những gì đã xảy ra. Tóm tắt ngắn gọn là Tristan và Levent đã làm việc với bài toán này trong gần một năm, sử dụng rộng rãi Claude và Codex (chủ yếu là bản 5.6 Sol), sau đó đạt được bước đột phá vào ngày 15 tháng 8. Những lời đồn đại trong giới toán học bắt đầu lan truyền và Tristan cùng Levent nghe tin rằng OpenAI đã biết việc Anthropic giải quyết được "một bài toán mở quan trọng", vì vậy họ đã liên hệ và biết được rằng OpenAI cũng có một đội ngũ đang làm việc trên cùng bài toán đó với phương pháp tương tự. Trích lời Tristan:
Tôi đã hỏi họ gửi câu lệnh (prompt) đầu tiên từ khi nào. Câu hỏi này đã không được OpenAI trả lời trực tiếp trong một thời gian. Cuối cùng, họ thừa nhận rằng nó đã được gửi trong vài ngày gần đây, sau khi thông tin về công trình của chúng tôi đến tai OpenAI.
Tôi hỏi liệu mô hình có được huấn luyện trên hoặc có quyền truy cập vào các phiên làm việc của chúng tôi trong Codex hay không, nơi chúng tôi đã đưa tất cả các bản nháp cho toàn bộ dự án này. Tôi được trả lời rằng mô hình không tra cứu dữ liệu người dùng. Tôi hỏi lại về việc huấn luyện, và tôi không nhận được câu trả lời.
Mọi chuyện trở nên phức tạp hơn từ đó. Đội ngũ OpenAI đề nghị đợi Tristan công bố, hoặc để Tristan làm đồng tác giả trong một trong các bài báo của họ, nhưng họ nói rõ rằng Levent sẽ không được mời làm đồng tác giả do mối quan hệ cạnh tranh với đơn vị chủ quản của anh ấy.
Đây là cách OpenAI mô tả công việc của họ:
Vào thứ Ba, ngày 1 tháng 9, chúng tôi nghe tin đồn rằng hai bài toán Giải thưởng Thiên niên kỷ đã được giải quyết. Được truyền cảm hứng từ những tin đồn này và sự thay đổi vượt bậc về hiệu suất của mô hình nội bộ, chúng tôi đã khởi động nỗ lực đánh giá nó trên tất cả các bài toán Giải thưởng Thiên niên kỷ còn mở và một vài bài toán có tác động lớn khác. [...]
Các tác nhân (agents) đã đi đến lời giải vào thứ Bảy, ngày 5 tháng 9, khoảng 88 giờ sau khi các tác nhân đầu tiên được khởi chạy. Việc chính thức hóa và xác minh bằng Lean mất thêm 17 giờ nữa thông qua GPT‑6 Astra.
Trên tất cả các bài toán đã thử nghiệm, các tác nhân đã gửi 4,9 triệu tin nhắn và sử dụng khoảng 300 tỷ token đầu ra. Trong quá trình giải quyết bài toán Navier–Stokes, các tác nhân đã gửi 2,7 triệu tin nhắn và sử dụng khoảng 130 tỷ token đầu ra.
(Chúng tôi không biết cấu trúc chi phí của mô hình nội bộ mà họ đã sử dụng, nhưng 300 tỷ token đầu ra theo giá API công khai của GPT-6 Astra sẽ tiêu tốn 15.000.000 USD.)
Đây là nơi họ đưa ra quan điểm của mình về công trình của Tristan và Levent (tôi nhấn mạnh):
Nỗ lực của chúng tôi bắt đầu vào ngày 1 tháng 9 sau khi nghe một tin đồn mà sau đó chúng tôi nhận ra có liên quan đến Levent Alpöge, một nhân viên của Anthropic, và Tristan Buckmaster, giáo sư toán học tại NYU. Sau khi hoàn thành dự án và xác minh bằng Lean (vào ngày 6 tháng 9), vì tin rằng từ tin đồn là họ cũng có lời giải cho Navier–Stokes, chúng tôi đã liên hệ với họ để đề nghị công bố đồng thời kết quả của chúng tôi và ghi nhận quyền ưu tiên của họ trong một thông báo chung. [...]
Chúng tôi (các nhà nghiên cứu và các tác nhân) đã không nhìn thấy bất kỳ công trình nào của họ bằng bất kỳ phương tiện nào cho đến khi họ công bố công khai — cụ thể là, không có dữ liệu người dùng cụ thể nào được truy cập để giải quyết bài toán này. Mặc dù khó xảy ra, chúng tôi không thể loại trừ khả năng dữ liệu đã khử định danh từ quá trình họ sử dụng sản phẩm của chúng tôi đã giúp cải thiện các mô hình của mình. Tuy nhiên, các chứng minh của chúng tôi khác biệt đáng kể và ngay cả các kết quả chính xác được chứng minh cũng khác nhau trong trường hợp Euler (có lực cưỡng bức so với không có lực cưỡng bức).
Cách tôi diễn giải những gì đã xảy ra ở đây là OpenAI nghe tin các bài toán Giải thưởng Thiên niên kỷ đã được giải bằng LLM và coi đây là cơ hội để chứng minh sức mạnh của mô hình mới nhất của họ, mà không suy nghĩ quá kỹ về hình ảnh nếu họ "nẫng tay trên" một nhóm đã sử dụng chính các mô hình của OpenAI để làm việc trên bài toán này trong gần một năm.
Điều này cũng làm nổi bật một trong những sự thất vọng liên tục của tôi về cách tất cả những thứ này vận hành. Khi một phòng thí nghiệm AI nói rằng dữ liệu của tôi được "sử dụng để cải thiện hiệu suất mô hình", điều đó thực sự có nghĩa là gì?
Hai câu hỏi giả định yêu thích của tôi liên quan đến vấn đề này trước đây là:
Giả định ưa thích mới của tôi cho vấn đề này hiện là:
Bài viết được AI dịch và tổng hợp tự động từ Simon Willison Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.