QbitAI
95

Mô hình

Pháo đài cuối cùng của toán học AI đã sụp đổ: GPT-6 Astra chinh phục FrontierMath Tier 4

(giờ Việt Nam)

Tóm tắt AI

GPT-6 Astra đã chính thức vượt qua ngưỡng thử thách khó nhất của FrontierMath Tier 4, đánh dấu bước ngoặt lịch sử khi AI giải quyết thành công các bài toán toán học cấp độ cao.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-09-12 15:33:54 Nguồn: QbitAI

FrontierMath Tier 4 đã bão hòa.

henry đưa tin từ Aofei Temple.

QbitAI | Kênh chính thức QbitAI.

Vừa mới đây, bài toán khó cuối cùng của FrontierMath Tier 4 đã bị GPT-6 Astra chinh phục.

Đến đây, tất cả các câu hỏi trong bộ đề kiểm tra cấp độ nghiên cứu – vốn từng được coi là cơn ác mộng toán học đối với các mô hình ngôn ngữ lớn (LLM) – đều đã được AI giải thành công ít nhất một lần.

Epoch AI cũng chính thức đưa ra kết luận: FrontierMath Tier 4 đã bão hòa.

Mặc dù nhìn vào biểu đồ trên, Astra vẫn chưa đạt trực tiếp đến mức 100%, và kết quả do chính OpenAI công bố cũng là 97,6%.

Tuy nhiên, theo thuật toán của Epoch, "giải quyết toàn bộ" có nghĩa là sau khi tích lũy các nỗ lực từ nhiều mô hình khác nhau và tại các thời điểm khác nhau, mỗi câu hỏi trong Tier 4 đều đã có lời giải thành công.

Và câu hỏi mà Astra vừa giải quyết chính là câu duy nhất trước đó chưa từng bị AI khuất phục.

(Hiểu đơn giản là Astra có thể đã sai trong một lần kiểm tra nào đó, nhưng câu hỏi mà nó làm đúng chính là câu chưa từng được giải trước đây).

Phải nói rằng, tốc độ phát triển này thực sự rất đáng kinh ngạc.

Nếu bạn theo dõi các bài đánh giá mô hình, bạn sẽ biết rằng vào ngày 11 tháng 7 năm 2025, khi Tier 4 vừa ra mắt, điểm số cao nhất trên bảng xếp hạng chỉ đạt khoảng 5%.

Giờ đây, chỉ sau một năm hai tháng, "bức tường cao" năm nào đã trở thành "bậc thang", và câu hỏi cuối cùng vốn khó bị AI vượt qua bằng các lối tắt cũng đã được chinh phục.

Người ra đề, Phó giáo sư Toán học tại Đại học Marquette – Jay Pantone – cũng cho biết, trước đây AI thường tìm các lối tắt bằng số, nhưng lần này, cách giải của AI khá gần với phương pháp của chính ông.

Tuy nhiên, khi GPT-6 Astra gần đây liên tục tấn công vào giới toán học và giải quyết các bài toán thiên niên kỷ như cơm bữa, Pantone cho biết ông đã không còn cảm thấy ngạc nhiên nữa!

Có thể nói, toán học hiện đã trở thành một trong những lĩnh vực mà Astra thể hiện sự hiện diện mạnh mẽ nhất gần đây.

Từ dưới 2% đến việc bổ sung một "tuyến phòng thủ cấp nghiên cứu".

FrontierMath được phát hành lần đầu vào ngày 7 tháng 11 năm 2024, với mục đích ban đầu là ngăn chặn việc các Benchmark toán học bị AI "phá đảo" quá nhanh.

Vào thời điểm đó, các Benchmark toán học truyền thống như GSM8K hay MATH ngày càng khó phân biệt khoảng cách giữa các mô hình hàng đầu, vì vậy Epoch AI đã hợp tác với hơn 60 nhà toán học để thiết kế lại một loạt các câu hỏi gốc chưa từng được công bố trước đây.

Trong số đó có các chủ nhân giải thưởng Fields như Terence Tao, Timothy Gowers, Richard Borcherds, v.v.

Sau khi xem qua một số câu hỏi cấp nghiên cứu, Terence Tao đã thẳng thắn nhận định rằng những câu hỏi này "cực kỳ khó", thậm chí ông còn dự đoán rằng Tier 3 khó nhất có thể khiến AI phải bế tắc thêm vài năm nữa.

Kết quả là sau vòng kiểm tra đầu tiên, đúng như dự đoán, tỷ lệ chính xác của các mô hình hàng đầu chưa đến 2%.

Cụ thể, ban đầu ngân hàng câu hỏi cốt lõi của FrontierMath có 300 câu, được chia thành ba cấp độ theo độ khó: Tier 1, Tier 2 và Tier 3.

Tier 1 tương đương với các bài toán đại học khó và các kỳ thi Olympic toán học, nhưng cho phép sử dụng các công cụ nâng cao hơn; Tier 2 đã đạt đến độ khó của sinh viên cao học; Tier 3 gần với các vấn đề nghiên cứu khám phá mà nghiên cứu sinh tiến sĩ thường gặp phải.

Tuy nhiên, với sự xuất hiện của các mô hình suy luận, ba cấp độ đầu tiên bắt đầu trở nên không đủ dùng, vì vậy vào năm 2025, Epoch đã bổ sung thêm một cấp độ nữa: Tier 4.

Tier 4 chủ yếu do các giáo sư toán học và nghiên cứu sinh sau tiến sĩ thiết kế. Mỗi người dành khoảng vài tuần nghiên cứu ngắn hạn xung quanh hướng nghiên cứu của riêng mình, sau đó nén kết quả thành một câu hỏi có thể được xác thực tự động.

Ban đầu, Tier 4 bao gồm 50 câu hỏi, bao phủ các lĩnh vực như giải tích, lý thuyết số, toán học tổ hợp, tô pô, hình học đại số...

Khi mới phát hành, tổng cộng tất cả các lần kiểm tra của các mô hình chỉ có 3 câu hỏi từng được giải, và những lời giải đó còn phụ thuộc vào một số giả định đúng nhưng chưa được chứng minh đầy đủ.

Vì lý do này, trên trang web chính thức của các câu hỏi mẫu, Epoch từng viết: Một số câu hỏi trong số này có thể sẽ không được AI giải quyết trong vài thập kỷ tới.

(Câu nói này hiện đang bị "đào lại" liên tục).

Tuy nhiên, khi các mô hình ngày càng mạnh mẽ, một vấn đề khác cũng lộ ra: bản thân ngân hàng câu hỏi cũng bắt đầu không chịu nổi sự "tra tấn" của AI.

OpenAI phát hiện trong quá trình kiểm tra rằng FrontierMath có nhiều lỗi hơn dự kiến.

GPT-6Toán học AIFrontierMathĐột phá AISuy luận logic
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.