Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
95

Nghiên cứu

GPT-6 Astra của OpenAI thiết lập kỷ lục SOTA mới trên ARC-AGI-3, vượt xa hiệu suất con người

(giờ Việt Nam)

Tóm tắt AI

GPT-6 Astra đạt điểm số ấn tượng 99.9% trên ARC-AGI-3, chính thức xác lập kỷ lục SOTA mới với chi phí tối ưu, đánh dấu bước tiến quan trọng trong khả năng suy luận của AI.

Bản dịch AI

OpenAI's GPT-6 Astra on ARC-AGI-3 | ARC Prize

Đã xuất bản

03 tháng 9 năm 2026

Tóm tắt

ARC-AGI-3

ARC-AGI-3 là một bộ tiêu chuẩn (benchmark) dùng để nghiên cứu trí tuệ tác nhân (agentic intelligence) thông qua các môi trường mới lạ, trừu tượng và theo lượt. Các tác nhân phải khám phá, suy luận mục tiêu và xây dựng mô hình nội tại về môi trường để lập kế hoạch hành động hiệu quả mà không cần hướng dẫn cụ thể. Bạn có thể tự mình trải nghiệm ARC-AGI-3.

Trình duyệt của bạn không hỗ trợ video nhúng.

Các môi trường này chỉ chứa những kiến thức nền tảng cốt lõi và được hiệu chuẩn độ khó thông qua thử nghiệm có kiểm soát với người tham gia. Con người có thể giải quyết 100% các môi trường này.

Mục tiêu của loạt bài ARC-AGI là đo lường "khoảng cách còn lại" giữa trí tuệ nhân tạo hiện tại và AGI. Chúng tôi định nghĩa AGI là khả năng của một hệ thống trong việc tiếp thu bất kỳ kỹ năng nào mà con người có thể làm, với hiệu suất tương đương con người.

ARC-AGI-3 là thế hệ thứ ba của loạt bộ tiêu chuẩn ARC-AGI. Nó kiểm tra các khả năng tác nhân vượt xa ARC-AGI-1 và ARC-AGI-2. Mỗi thế hệ đều mở rộng dựa trên thế hệ trước đó - khi khả năng của AI tiên phong tiến bộ, các bộ tiêu chuẩn của chúng tôi cũng phải tiến bộ theo.

ARC-AGI-3 kiểm tra bốn thành phần của trí tuệ tác nhân:

Kết quả của Astra

Với bộ khung (harness) Standard cho phép mô hình lưu trữ các ghi chú mà nó chọn giữ lại trong suốt quá trình thực hiện môi trường, OpenAI’s Astra (bản max) đạt 62,7% trên ARC-AGI-3 Semi-Private với chi phí 26.000 USD. Với bộ khung The Provider Adapter giúp bảo toàn trạng thái suy luận ẩn giữa các yêu cầu và sử dụng tính năng nén cho các cuộc hội thoại dài hơn, cho phép mô hình tái sử dụng công việc trước đó, Astra (bản high) đạt 99,9% với chi phí 19.000 USD. Cả hai đều là những điểm số dẫn đầu hiện nay. Xem bảng xếp hạng đầy đủ.

Ở mức nỗ lực suy luận tối đa, Astra giải các trò chơi hiệu quả hơn, đòi hỏi ít hành động hơn và do đó giảm tổng chi phí so với các mức nỗ lực suy luận khác.

Để so sánh chi phí, trong quá trình thử nghiệm có kiểm soát của chúng tôi, những người tham gia được trả 115 USD cho mỗi phiên 90 phút, cộng thêm 5 USD cho mỗi trò chơi hoàn thành. Những người tham gia đã thử khoảng chín trò chơi mỗi phiên, tương đương khoảng 12,78 USD cho mỗi trò chơi trước khi tính tiền thưởng.

Phần lớn khoản phí này chi trả cho thời gian và sự sẵn lòng tham gia thử nghiệm của người tham gia, thay vì năng lượng mà não bộ của họ tiêu thụ (một chỉ số gần gũi hơn để so sánh với AI). Nếu chúng ta chỉ xem xét năng lượng của não bộ và tính giá theo điện năng, ước tính giảm xuống còn khoảng 0,6 xu mỗi phiên, hoặc 0,067 xu mỗi trò chơi.

Phân tích

Ngoài các điểm số, các bản phát lại (replay) của Astra cho thấy cách nó biến các cơ chế trò chơi xa lạ thành các mô hình làm việc hữu ích. Ba phát hiện nổi bật là: ký hiệu đại số rút gọn mà nó phát triển, hiệu quả hành động so với con người và các công cụ tùy chỉnh mà nó xây dựng.

Ký hiệu đại số tùy chỉnh

Khi chơi ARC-AGI-3, Astra chọn những ghi chú chiến lược nào mà nó muốn giữ lại. Nó theo dõi các đối tượng, tọa độ, quy tắc và các kế hoạch chưa hoàn thành, đồng thời sử dụng một ký hiệu ngôn ngữ chuyên biệt tùy chỉnh mà nó tạo ra cho các môi trường đó.

Chúng tôi đã thấy hành vi tương tự ở các mô hình khác, nhưng các ghi chú của Astra nổi bật nhờ độ chính xác và mật độ thông tin. Nó chắt lọc khung cảnh thành một mô hình biểu tượng giống như mã code rút gọn: vị trí các đối tượng, cách chúng tương tác và chính xác những hành động nào cần thực hiện theo thứ tự nào. Đây là một dạng viết tắt đại số tức thời thay vì một ngôn ngữ lập trình hoàn chỉnh. Ví dụ:

Hiệu quả hành động so với con người

Trước khi ra mắt ARC-AGI-3, chúng tôi đã thử nghiệm khoảng 500 thành viên công chúng để thiết lập cơ sở dữ liệu (baseline) về hiệu quả hành động của con người, hay đơn giản là con người giải quyết mỗi môi trường nhanh như thế nào. Những người tham gia không được chọn lọc dựa trên kinh nghiệm hay khả năng giải đố.

Đối với mỗi cấp độ, chúng tôi xác định "cơ sở dữ liệu con người" bằng cách sử dụng số lượng hành động trung vị của những người chơi đã hoàn thành nó. Điều này cung cấp cho chúng tôi một tham chiếu để so sánh hiệu suất giữa con người và AI. Một AI cần nhiều hành động hơn thì kém hiệu quả hơn, trong khi AI cần ít hành động hơn thì hiệu quả hơn.

Trong bộ khung The Provider Adapter giúp bảo toàn trạng thái suy luận ẩn giữa các yêu cầu và sử dụng tính năng nén cho các cuộc hội thoại dài hơn, cho phép mô hình tái sử dụng công việc trước đó, Astra (bản max) đã sử dụng ít hành động hơn so với cơ sở dữ liệu con người ở 96,0% các cấp độ và trung bình sử dụng ít hơn 51,7% hành động mỗi cấp độ. Đây là một cột mốc quan trọng. Điều này có nghĩa là theo thước đo hiệu quả hành động của ARC-AGI-3, Astra đã đạt và vượt qua mức ngang bằng với con người.

Ngoài lề, trước khi ra mắt ARC-AGI-3, chúng tôi đã giả định rằng hiệu quả hành động sẽ vẫn là ranh giới phân chia giữa con người và AI. Chúng tôi dự đoán rằng ngay cả khi AI giải được một môi trường, nó có thể cần nhiều sự khám phá (hành động) hơn đáng kể so với con người. Điều đó vẫn đúng với các phương pháp thử sai (brute-force), nhưng AI tiên phong cho thấy một mô hình nhị phân hơn. Một khi AI tiên phong "hiểu" được cơ chế, nó thường thực hiện trong phạm vi hiệu quả của con người.

Hiệu quả hành động của Astra so với con người

Hiệu quả hành động của Astra so với con người

Mỗi dấu chấm đại diện cho một cấp độ mà Astra (bản max) đã hoàn thành. Các điểm nằm dưới đường thẳng biểu thị số hành động ít hơn so với cơ sở dữ liệu con người.

Biểu đồ trên so sánh số lượng hành động Astra đã sử dụng để hoàn thành mỗi cấp độ với cơ sở dữ liệu con người của chúng tôi. Điều này củng cố lý do tại sao ARC-AGI-3 đo lường hiệu quả hành động chứ không chỉ là việc hoàn thành nhiệm vụ. Một điểm số chỉ dựa trên việc hoàn thành sẽ cho chúng ta biết Astra đã hoàn thành môi trường, nhưng không cho biết nó đã học cách giải quyết chúng hiệu quả như thế nào.

Hầu hết các bộ tiêu chuẩn chỉ đo lường hiệu quả chi phí, tức là đo lường tài nguyên tính toán được sử dụng, nhưng hiệu quả hành động đo lường mức độ kinh nghiệm cần thiết với một môi trường.

Kết quả của Astra cho thấy nó cần ít tương tác hơn so với cơ sở dữ liệu con người để thực hiện giải pháp.

Công cụ tùy chỉnh trong bộ khung tác nhân

Chúng tôi cũng đánh giá Astra trong bộ khung PRO-LONG (bài báo), một đối tác thử nghiệm tấn công (red-teaming) sớm của ARC-AGI-3. Trong thiết lập nâng cao này, Astra có quyền truy cập vào một môi trường sandbox nơi nó có thể thực thi mã tùy chỉnh.

Chúng tôi quan sát thấy Astra tạo ra một bộ công cụ tùy chỉnh cho mỗi trò chơi: trình phân tích bảng, mô hình trạng thái trò chơi, thuật toán tìm kiếm, trình lập kế hoạch và các ghi chú bền vững. Đối với các lượt chơi phức tạp hơn, Astra thậm chí còn tạo ra các thư viện phần mềm nhỏ, chuyên biệt cho từng trò chơi.

Ví dụ, trong tu93, một trò chơi giống mê cung với lính canh và các đội tuần tra di động, Astra bắt đầu với việc điều hướng và xây dựng maze_solver.py. Nó thêm các quy tắc chiến đấu vào combat_solver.py, mô hình hóa các đội tuần tra di động trong patrol_solver.py và sử dụng sync_state.py để kiểm tra các dự đoán của nó so với quan sát.

Việc kiểm tra hiệu suất của Astra trong PRO-LONG rất hữu ích vì chúng ta thấy được những gì nó có thể làm với các công cụ bên ngoài. Tuy nhiên, điều này đại diện cho các điều kiện đánh giá khác với thử nghiệm có kiểm soát trên con người của chúng tôi. Những người tham gia thử nghiệm của chúng tôi không có trình thông dịch mã, sổ tay ghi chú, v.v., vì vậy kết quả của PRO-LONG nên được hiểu là hiệu suất kết hợp của mô hình và các công cụ của nó.

Hai bộ khung, hai câu hỏi

Bộ khung Standard của chúng tôi cho ARC-AGI-3 đặt câu hỏi về việc các mô hình so sánh như thế nào dưới cùng một giao diện tối giản, trung lập với nhà cung cấp. Nó cung cấp tất cả thông tin cần thiết để giải mỗi trò chơi, nhưng để mô hình tự quyết định những gì cần lưu giữ trong các ghi chú hiển thị. Chúng tôi tin rằng một AGI trong tương lai sẽ có thể giải quyết ARC-AGI-3 trong những điều kiện này. Giao diện chung cũng mang lại cho chúng tôi sự so sánh nhất quán, công bằng giữa các nhà cung cấp.

Ngoài ra, có một câu hỏi riêng biệt: mô hình hoạt động tốt như thế nào khi nó có thể sử dụng các tính năng quản lý ngữ cảnh mà nhà cung cấp đã thiết kế cho nó? Đối với Astra, điều này có nghĩa là bảo toàn trạng thái suy luận ẩn (mà chúng ta không thấy) giữa các yêu cầu và sử dụng tính năng nén để quản lý các cuộc hội thoại dài hơn.

OpenAIGPT-6ARC-AGISOTATrí tuệ nhân tạo
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.