The Decoder: AI News
88

Mô hình

GPT-6 Astra thống trị bảng xếp hạng ErdosBench, OpenAI khẳng định không tối ưu hóa riêng cho toán học

(giờ Việt Nam)

Tóm tắt AI

GPT-6 Astra vừa chiếm lĩnh vị trí dẫn đầu trên ErdosBench với 106 bài toán được giải quyết, vượt xa các phiên bản tiền nhiệm dù OpenAI cho biết không hề can thiệp để cải thiện khả năng toán học chuyên biệt.

Bản dịch AI

GPT-6 Astra gives mathematicians a breather, and OpenAI says that's by design

Trên ErdosBench của ulam.ai, Astra đã giành vị trí quán quân. Bộ tiêu chuẩn đánh giá này bao gồm 226 bài toán mở lấy cảm hứng từ các bài toán Erdős nổi tiếng. Astra đạt 3,23 điểm và giải được 106 bài toán, trong đó có 43 bài toán được giải quyết hoàn toàn. Nó cũng bác bỏ thêm 27 bài toán khác.

So với Sol, mô hình đã giải được 78 bài toán ở mức suy luận tối đa, Astra cho thấy khả năng viết bài khoa học tốt hơn và ít đưa ra các tuyên bố phóng đại hơn. Trong một số trường hợp, nó thậm chí còn đánh giá thấp kết quả của chính mình. Nhìn chung, nhà phát triển bộ tiêu chuẩn đánh giá Przemek Chojecki gọi đây là "bước tiến vững chắc từ 5%-10% trong các kỹ năng nghiên cứu toán học được kiểm tra", nhưng bộ tiêu chuẩn này vẫn còn lâu mới đạt đến ngưỡng bão hòa.

OpenAI chọn không tối ưu hóa cho toán học

OpenAI hoàn toàn có thể giúp Astra mạnh hơn nhiều trong nghiên cứu toán học nhưng đã quyết định không làm vậy, mặc dù công ty từng đặt các thành tựu toán học làm trọng tâm trong thông báo đầu tiên của mình. Trong bài luận "An Alien Mind", nhà khoa học trưởng của OpenAI, Jakub Pachocki, viết: "[...] chúng tôi tin rằng mình có thể làm cho các mô hình giỏi hơn trong nghiên cứu toán học chuyên biệt nếu tập trung thêm, nhưng chúng tôi không ưu tiên hướng đi này vì sự cấp bách mà chúng tôi cảm nhận được đối với RSI (tự cải thiện đệ quy) và nghiên cứu căn chỉnh tự động, như tôi sẽ thảo luận sau."

Điều đó có nghĩa là mô hình toán học có năng lực nhất hiện nay không phải là kết quả của việc tối ưu hóa có mục tiêu. Nó là sản phẩm phụ của các ưu tiên khác. OpenAI đang dồn nguồn lực vào việc tự cải thiện đệ quy và bảo mật các hệ thống AI trong tương lai, vì "chúng tôi tin rằng đó là cách duy nhất để duy trì vị thế tiên phong trong nghiên cứu AI trong thời gian tới", Pachocki viết. (Lưu ý: Kể từ khi bài luận được xuất bản, OpenAI được cho là đã huấn luyện được các mô hình toán học nội bộ tốt hơn, một câu chuyện phức tạp, và các chủ đề về RSI cũng như an toàn AI đã bùng nổ.)

Tuyên bố của Pachocki cũng thú vị vì một lý do khác: nó cho thấy những đánh đổi tối ưu hóa khó khăn đang được thực hiện tại ranh giới đầy biến động của sự phát triển AI. Một mô hình thống trị lĩnh vực toán học không nhất thiết sẽ thống trị mọi lĩnh vực khác. Điều đó làm tôi nhớ đến một hình ảnh trực quan của nhà nghiên cứu Adam Hunt tại Cambridge, đối chiếu hai con đường khả thi cho AI. Luận điểm "AGI chính thống" giả định rằng các mô hình cải thiện dần dần và trên diện rộng cho đến khi chúng bao phủ tất cả các tác vụ của con người.

Kịch bản thay thế mô tả một quỹ đạo ngày càng "gai góc" (spiky), với sức mạnh cực lớn trong một vài lĩnh vực như lập trình và toán học nhưng lại trì trệ hoặc thậm chí thoái lui trong các lĩnh vực như chất lượng ngôn ngữ, tư duy thông thường hoặc suy luận xã hội. Điều đó sẽ mang lại cho chúng ta một mô hình chuyên biệt hóa cao, chứ không phải thứ mà hầu hết mọi người gọi là Trí tuệ nhân tạo tổng quát (AGI). Tất nhiên, bạn có thể gọi bất cứ thứ gì là AGI nếu bạn muốn.

Quan điểm của Pachocki rằng OpenAI cố tình bỏ qua việc tối ưu hóa toán học cho Astra là bằng chứng cho luận điểm "gai góc". Ngay cả phòng thí nghiệm AI hàng đầu cũng không thể thúc đẩy tiến bộ tối đa theo mọi hướng cùng một lúc. Năng lực phát triển ở nơi bạn tối ưu hóa, và việc làm cho toán học mạnh hơn đồng nghĩa với việc phải cắt giảm ở nơi khác. Tuy nhiên, đằng sau ưu tiên RSI là hy vọng rằng bản thân mô hình cuối cùng sẽ tự thực hiện các tối ưu hóa đó, mở rộng quy mô nhanh hơn trên diện rộng, bao gồm cả toán học.

Toán học đang vật lộn với AI và với chính nó

Bất kể Astra tốt hơn 5 hay 50 phần trăm so với phiên bản tiền nhiệm, câu hỏi sâu sắc hơn vẫn còn đó đối với một lĩnh vực đang phải vật lộn với thế giới mới của sức mạnh tính toán – thứ giúp giải quyết các vấn đề nhưng không nhất thiết giúp hiểu được chúng. Nhà toán học Terence Tao đã đặt ra vấn đề này tại Đại hội Toán học Quốc tế năm 2026: nếu các mô hình AI tiếp tục tạo ra các chứng minh nhanh hơn mức con người có thể kiểm tra, lĩnh vực này có nguy cơ chuyển từ tình trạng khan hiếm chứng minh sang quá tải chứng minh.

Khi đó, nhiệm vụ quan trọng nhất sẽ không còn là giải quyết các bài toán mà là quyết định xem kết quả nào thực sự quan trọng. Tao cho rằng toán học đang đối mặt với một cuộc khủng hoảng về các giá trị và thực tiễn, điều mà ông so sánh với sự biến động nền tảng của đầu thế kỷ 20.

Những bài toán khó nhất trong toán học hiện vẫn chưa có lời giải, điều này sẽ giúp ngành này có thêm thời gian. Tuy nhiên, hướng đi dường như đã được định sẵn, ngay cả khi một số nhà toán học không tin rằng các mô hình ngôn ngữ có thể mang lại những đột phá thực sự vì chúng thiếu sự sáng tạo giống con người. Vì những lý do tương tự, cũng có những nghi ngờ về tiềm năng tự cải thiện thực sự của AI.

OpenAIGPT-6Toán họcAI chuyên biệtHiệu năng AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.