The Decoder
92

Mô hình

GPT-6 Astra gây tranh cãi về hiệu năng, nhưng đạt cột mốc quan trọng trên ARC-AGI-3

(giờ Việt Nam)

Tóm tắt AI

GPT-6 Astra nhận kết quả trái chiều từ các bộ đo kiểm, nhưng việc vượt qua con người về hiệu suất trên ARC-AGI-3 đã khiến chuyên gia François Chollet phải đẩy nhanh dự báo về AGI.

Bản dịch AI

Astra rõ ràng đắt đỏ hơn so với phiên bản tiền nhiệm của chính nó. OpenAI tính phí cao gấp hai lần rưỡi cho mỗi đơn vị văn bản được xử lý, khiến chi phí cho một tác vụ tăng khoảng 75% so với khi sử dụng Sol. Khi so sánh với Anthropic, bức tranh lại đảo ngược. Đối với các tác vụ lập trình, Astra đạt cùng số điểm với Claude Fable 5 theo Artificial Analysis, nhưng chi phí cho mỗi tác vụ lại chưa bằng một nửa. Lý do nằm ở cách mô hình này tiết kiệm tài nguyên. Nó chỉ cần một phần ba số bước tính toán so với Sol và một phần năm so với Opus 5.

*GPT-6 Astra ở mức nỗ lực suy luận cao (xhigh); ở mức tối đa, nó đạt 97,5%. ARC-AGI-1 hiện được coi là đã bão hòa phần lớn.

Trên chỉ số Coding Agent Index, nó đạt 67 điểm với lượng token sử dụng chỉ bằng khoảng một phần ba so với Sol, trong khi Fable 5.1 dẫn đầu với 70 điểm. Tỷ lệ ảo tưởng (hallucination rate) trên AA-Omniscience giảm từ 92% xuống 51%. Đồng thời, mô hình này mất khoảng 80 điểm Elo trên GDPval-AA v2 và sụt giảm hiệu suất trong các tác vụ hỗ trợ ngân hàng, SciCode và suy luận ngữ cảnh dài.

Epoch AI báo cáo rằng trên FrontierMath Erdős mới, GPT-6 Astra là mô hình duy nhất giải được hai trong số 68 bài toán Erdős mở với các chứng minh được xác thực bởi Lean, với ngân sách 300 USD cho mỗi lần thử. Ba lời giải khác xuất hiện từ các lần chạy bổ sung không tiêu chuẩn, tiêu tốn hơn 220.000 USD chi phí tính toán, nhưng Epoch cho biết những kết quả đó không được tính vào điểm số.

Xem xét kỹ hơn các con số riêng lẻ của Epoch cho thấy GPT-6 Astra và đối thủ Fable 5.1 cho đến nay được đo lường trên các nền tảng khác nhau. Astra dẫn đầu về toán học, kiến thức và giải đố. Fable 5.1 giữ điểm số cao nhất trong hầu hết các bài kiểm tra lập trình. Tuy nhiên, Epoch mới chỉ ghi nhận một điểm số lập trình duy nhất cho Astra, và điểm số đó đến từ một lần chạy ở mức suy luận trung bình.

ARC-AGI-3 cho thấy một bước nhảy vọt lớn.

Bước nhảy vọt rõ ràng nhất nằm ở ARC-AGI-3. Bài kiểm tra này đưa AI vào các thế giới trò chơi xa lạ mà không ai giải thích luật lệ hay mục tiêu cho nó. Mô hình phải tự tìm cách giải quyết thông qua thử và sai. GPT-6 Astra đạt 62,7% với chi phí kiểm tra khoảng 26.000 USD. Phiên bản tiền nhiệm GPT-5.6 Sol chỉ đạt 7,78%, và đối thủ Claude Opus 5 đạt 30,16%. Fable 5 và Fable 5.1 hiện chưa có mặt trên bảng xếp hạng này.

Con số 99,9% mà OpenAI báo cáo đạt được trong các điều kiện khác. Trong thiết lập đó, Astra được sử dụng bộ khung (harness) do OpenAI xây dựng, giúp duy trì các chuỗi suy luận giữa các yêu cầu riêng lẻ và tự động tóm tắt các lần chạy dài. Theo các phép đo của ARC Prize, những lần chạy đó nhanh hơn khoảng 3,66 lần và sử dụng ít hơn 49% token so với các lần chạy trên bộ khung nội bộ, khi so sánh trên 167 cặp suy luận trò chơi mà cả hai thiết lập đều giải được.

Việc sử dụng các bộ khung này, cùng với bước nhảy vọt về hiệu suất đi kèm, vốn đã là một điểm gây tranh cãi giữa ARC Prize và OpenAI với GPT-5.6 Sol. ARC Prize lưu ý rằng chỉ con số thấp hơn là 62,7%, chạy trên bộ khung ARC nội bộ, mới cho phép so sánh công bằng giữa các nhà cung cấp, mặc dù họ dự định sẽ công bố các con số từ bộ khung của nhà cung cấp trong tương lai.

Ở đây, suy nghĩ nhiều hơn giúp giảm hóa đơn.

Mối quan hệ giữa nỗ lực suy nghĩ và chi phí khá bất thường. Thông thường, mức suy luận cao hơn sẽ làm cho một lần chạy thử nghiệm đắt đỏ hơn. Với Astra thì ngược lại. Trên bộ khung ARC tiêu chuẩn, chi phí giảm từ 49.791 USD khi không suy luận xuống còn 26.098 USD ở mức suy luận tối đa, trong khi điểm số tăng từ 35,2 lên 62,7%. Theo ARC Prize, lý do là Astra giải các trò chơi với ít nước đi hơn, đồng nghĩa với việc ít lệnh gọi mô hình và ít token hơn. Một điểm kỳ lạ nổi bật: mức "thấp" đạt 17,5%, tệ hơn cả khi chạy mà không suy luận. ARC Prize không bình luận về trường hợp ngoại lệ này, nhưng GPT-6 Astra trong các bài kiểm tra khác cho thấy nó có thể giải quyết các tác vụ có tầm nhìn xa hơn mà không cần suy luận nhờ kiến trúc mới, có khả năng lặp lại quá trình xử lý nội bộ trước khi tạo ra token đầu tiên.

Để so sánh, những người thử nghiệm là con người nhận được 115 USD cho mỗi phiên 90 phút cộng với 5 USD cho mỗi trò chơi được giải, vì vậy với khoảng chín lần thử, chi phí rơi vào khoảng 12,78 USD mỗi trò chơi. Nhưng số tiền đó chủ yếu trả cho thời gian và sự sẵn lòng tham gia. Nếu chỉ tính năng lượng trao đổi chất của não bộ dưới dạng điện năng, ARC Prize tính ra con số 0,067 xu mỗi trò chơi.

Thú vị hơn cả điểm số thô chính là hiệu suất. Trước khi ra mắt, ARC Prize đã cho khoảng 500 người thử nghiệm chơi mà không cần sàng lọc trước và ghi lại số nước đi trung vị của những người giải được cho từng cấp độ. Trong lần chạy với bộ khung của OpenAI, Astra đã vượt qua 96% các cấp độ với số nước đi ít hơn mức trung vị đó, trung bình chỉ bằng hơn một nửa. Không giống như các thước đo chi phí thông thường, con số này không theo dõi lượng tính toán tiêu thụ. Nó theo dõi mức độ kinh nghiệm với môi trường mà mô hình cần trước khi làm chủ được nó.

Đây chính xác là nơi các nhà tổ chức kỳ vọng con người sẽ giữ được lợi thế lâu dài. Điều đó vẫn đúng với các phương pháp tiếp cận "vét cạn" (brute-force), nhưng với các mô hình hàng đầu, ARC Prize nhận thấy một mô hình gần như nhị phân. Một khi mô hình đã tìm ra cơ chế, khả năng thực thi của nó rơi vào phạm vi hiệu quả của con người.

Astra tự phát minh ra ký hiệu riêng.

Để đạt được điều đó, Astra tự ghi chú và xây dựng một loại tốc ký giống đại số do chính nó phát minh, trong đó nó ghi lại các đối tượng, tọa độ, quy tắc và các kế hoạch mở, ví dụ: extend8 to3; retract10 to2 như một chuỗi nước đi có thứ tự hoặc Turn 5: P=(24,20), empty, facing west như một ghi chú trạng thái. ARC Prize đã thấy hành vi tương tự từ các mô hình khác, nhưng đặc biệt nhấn mạnh Astra vì độ chính xác và mật độ thông tin của nó. Trên bộ khung tiêu chuẩn, đó là một kỹ năng quan trọng, bởi vì mọi thứ mô hình không lưu vào ghi chú hiển thị của chính nó đều sẽ bị mất.

Đồng sáng lập ARC, François Chollet, mô tả nó trên X là "mô hình hóa thế giới bằng ký hiệu hiệu quả cao, tức thời cho từng trò chơi và cấp độ". Mô hình thậm chí còn "phát triển một ngôn ngữ DSL tốc ký riêng để đại diện cho các tình huống trong trò chơi", về cốt lõi, đây "về cơ bản là một ký hiệu đại số dành riêng cho trò chơi". Điều quan trọng nhất đối với Chollet là nguồn gốc của hành vi này: "Astra thể hiện các hành vi mô hình hóa bằng ký hiệu mà trước đây chúng tôi chỉ thấy với các bộ khung phức tạp, vì vậy các khả năng của bộ khung đang dần chuyển dịch vào chính mô hình."

Astra tạo ra một mô hình thế giới bằng ký hiệu dày đặc, nhỏ gọn để hoàn thành các môi trường ARC-AGI-3.

Ví dụ, trong môi trường s5i5, Astra:

- Ghi lại cấp độ hiện tại, hướng của trục và độ dài cơ chế: “L8: hub q2 (8↓). Lengths: 14=1…”

- Nó ánh xạ các thao tác tới các điều khiển chính xác:… pic.twitter.com/tMHP002mkB

— ARC Prize (@arcprize) ngày 3 tháng 9 năm 2026

Một môi trường thử nghiệm thứ ba chứng minh những gì Astra có thể làm với các công cụ bên ngoài. PRO-LONG là một khung tác nhân (agent framework) do bên thứ ba phát triển mà nhóm ARC Prize đã triển khai từ sớm như một đối tác "red-teaming" cho ARC-AGI-3—nghĩa là để khám phá một cách có hệ thống các giới hạn của bài kiểm tra. Không giống như thiết lập tiêu chuẩn, mô hình được cung cấp một môi trường sandbox nơi nó có thể thực thi mã của riêng mình.

Astra đã tận dụng điều này và viết các thư viện chương trình nhỏ cho mỗi trò chơi: trình phân tích cú pháp cho bảng trò chơi, mô hình trạng thái, thuật toán tìm kiếm và lập kế hoạch. Trong một trò chơi mê cung có lính canh, một công cụ tìm đường, một mô-đun quy tắc chiến đấu, một mô hình về các chuyển động tuần tra và một tập lệnh liên tục so sánh các dự đoán của chính nó với các quan sát đã được phát triển lần lượt. ARC Prize không quan sát thấy bất kỳ nỗ lực nào nhằm thoát khỏi sandbox. Những lần chạy này không thể so sánh với điều kiện thử nghiệm của con người, vì các đối tượng thử nghiệm không có trình thông dịch mã cũng như sổ ghi chú. Những gì đang được đo lường ở đây là hiệu suất kết hợp của mô hình và các công cụ tự xây dựng.

Chollet: Chưa có bằng chứng về AGI, nhưng nhanh hơn dự kiến.

ARC Prize khẳng định rõ ràng không coi các kết quả này là bằng chứng về trí tuệ nhân tạo tổng quát (AGI). "Tất cả những gì chúng tôi biết về hệ thống cho đến nay chỉ là điểm số trên bảng xếp hạng của nó," Chollet viết. Khi ARC-AGI-3 được ra mắt, họ đã nhấn mạnh một điểm trong mọi bài thuyết trình: "Giải được nó không phải là bằng chứng về AGI. Nó không nhằm mục đích là vạch đích." Mặc dù bài kiểm tra này đánh giá các đặc tính định tính chính xác được mong đợi ở một hệ thống AGI—cụ thể là khám phá trong điều kiện không chắc chắn, thích ứng mà không cần hướng dẫn và mô hình hóa thế giới nhân quả từ dữ liệu thưa thớt—nhưng nó thực hiện điều đó "ở quy mô nhỏ". Các trò chơi chạy trên thang thời gian ngắn hơn nhiều bậc so với các tác vụ thực tế và do đó đòi hỏi ít dữ liệu hơn, ít độ phức tạp mô hình hóa hơn và ít học tập tức thời hơn.

Khi ARC-AGI-3 được phát hành khoảng sáu tháng trước, Chollet đã trả lời một câu hỏi về sự bão hòa bằng cách nói "khoảng một năm", tùy thuộc vào mức độ tập trung vào cách tiếp cận bài kiểm tra. Do đó, Astra đã đến "nhanh hơn khoảng hai lần" so với dự kiến. "Tôi tin rằng tốc độ tiến bộ sẽ làm nhiều người ngạc nhiên, và những gì các mô hình mới có thể làm được sẽ thách thức nhận thức về AI mà mọi người đã hình thành dựa trên các thế hệ mô hình trước đó." Khi được một người dùng hỏi liệu dự báo AGI trước đó của ông cho năm 2030 còn hiệu lực hay không, Chollet trả lời ngắn gọn: "Sớm hơn, vì tiến bộ đang diễn ra nhanh hơn tôi mong đợi."

Kết quả là một bài kiểm tra khác. Theo Chollet, ARC-AGI-4 đã được phát triển kể từ khi ARC-AGI-3 ra mắt và dự kiến phát hành vào quý đầu tiên của năm 2027. Kiểm tra hiệu năng là một quá trình liên tục phát triển cùng với các mô hình và luôn nhắm vào khoảng cách còn lại giữa AI và trí tuệ con người. Tổ chức này coi bản thân ARC-AGI-3 là khá hạn chế: cơ chế tất định, mục tiêu khép kín và không có sự đại diện của thế giới thực mở. Thế hệ tiếp theo dự kiến sẽ khám phá, trong số những thứ khác, khả năng tự cải thiện đệ quy và đổi mới mở.

GPT-6OpenAIAGIARC-AGIFrançois Chollet
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.