The Decoder: AI News
92

Thủ thuật

Claude Opus 5 thiết lập kỷ lục mới trên ARC-AGI-3, vượt xa GPT-5.6 Sol

(giờ Việt Nam)

Tóm tắt AI

Claude Opus 5 của Anthropic đạt 30,2% điểm trên chuẩn ARC-AGI-3, gấp gần 4 lần so với kỷ lục 7,8% của GPT-5.6 Sol, cho thấy bước tiến lớn trong khả năng suy luận.

Bản dịch AI

Anthropic's Opus 5 blows past Fable 5 and GPT-5.6 Sol on the benchmark designed to measure real intelligence

Những người tạo ra bộ tiêu chuẩn ARC-AGI cho biết Anthropic Claude Opus 5 đạt được vị thế dẫn đầu vượt trội trên ARC-AGI-3 là nhờ khả năng suy luận thực sự tốt hơn.

Mô hình này đạt 30,2% trên ARC-AGI-3, trở thành người dẫn đầu mới. Kỷ lục trước đó là 7,8%, do GPT-5.6 Sol (Max) của OpenAI thiết lập. Opus 5 đã giải quyết được năm môi trường chưa từng có lời giải trước đây, trong đó bốn môi trường đạt hoặc vượt mức con người. Điều này cũng giúp nó vượt qua các mô hình "lớp Fable" của Anthropic, vốn đạt khoảng 20% theo ARC Prize.

Phân tích của ARC Prize cho rằng vị thế dẫn đầu này đến từ khả năng suy luận logic mạnh mẽ hơn, "điều này cho phép khám phá, lập kế hoạch và thực thi tự chủ hơn trong các môi trường xa lạ". Trong quá trình thử nghiệm, Opus 5 cũng thể hiện những hành vi mà các nhà nghiên cứu chưa từng thấy ở một mô hình nào trước đây. Lần đầu tiên, nó đã chuyển đổi các tác vụ sang ký hiệu đại số và tự xây dựng các phương trình phản tư (reflection equations).

Sáu trong số 25 môi trường demo công khai hiện đã được giải quyết. Kết quả đầy đủ, các bản phát lại và mã kiểm chuẩn đều được công khai. Trên bộ tiêu chuẩn ARC-AGI-2 cũ hơn, Opus 5 đạt 90,4% và đạt 97,5% trên ARC-AGI-1. Theo ARC Prize, cả hai kết quả này đều ngang bằng với các điểm số cao nhất trước đó, mặc dù với chi phí cao hơn một chút.

ARC-AGI-3 đo lường mức độ hiệu quả của các mô hình AI trong việc giải quyết các tác vụ mới mà chúng chưa từng gặp trong quá trình đào tạo, bao gồm cả những tác vụ mà con người thường có thể xử lý dễ dàng. Phiên bản hiện tại hoạt động giống như một trò chơi. Mô hình phải suy luận ra các quy tắc của một môi trường tương tác, lập kế hoạch hành động và thực hiện chúng từng bước. Điều này kiểm tra khả năng suy luận tổng quát thay vì kiến thức được lưu trữ.

Một số hệ thống AI có thể đã vượt qua bộ tiêu chuẩn này, nhưng chúng dựa vào phần mềm bổ sung được gọi là harness. Điểm số chính thức chỉ tính hiệu suất của riêng mô hình ngôn ngữ. ARC Prize lập luận rằng các hệ thống AGI trong tương lai không nên cần sự trợ giúp bên ngoài để giải quyết các tác vụ mới. Opus 5 có khả năng sẽ đạt điểm cao hơn nữa nếu được sử dụng trong Claude Code.

Các thử nghiệm độc lập cho thấy mức tăng trưởng khiêm tốn hơn

Anthropic chưa giải thích về sự cải thiện này, nhưng việc dán nhãn dữ liệu có mục tiêu và học tăng cường (reinforcement learning) là những yếu tố khả thi. Không giống như các mô hình trước đó, Opus 5 được phát triển sau khi ARC-AGI-3 và định dạng của nó được công khai. Điều đó có thể đã cho phép Anthropic nhắm mục tiêu vào các kỹ năng và định dạng câu đố của bộ tiêu chuẩn, mặc dù điều này không chứng minh công ty đã đào tạo trên chính các tác vụ đó. Các chuyên gia dán nhãn có thể đã gắn nhãn các dấu vết suy luận, các hành động hữu ích, các nỗ lực thất bại và các bước phục hồi từ những câu đố tương tự. Học tăng cường sau đó có thể thưởng cho việc khám phá, lập kế hoạch, khám phá quy tắc và tự sửa lỗi.

Các thử nghiệm trên Witness, bộ tiêu chuẩn riêng của Guanghan Ning dành cho các trò chơi giải đố tương tác, cho thấy mức tăng trưởng khiêm tốn hơn. Opus 5 đạt 43,4 điểm, ngang bằng về mặt thống kê với Kimi K3 và Fable 5, trong khi mức cải thiện so với Opus 4.8 thấp hơn nhiều so với trên ARC-AGI-3. Nó đã xác định được các quy tắc ẩn của một câu đố thông thường trước khi thực hiện bất kỳ hành động nào, nhưng lại tụt hậu so với Opus 4.8 trong một trò chơi có cơ chế ít quen thuộc hơn. Ning cho biết mô hình đó phù hợp với việc đào tạo trên dữ liệu theo thể loại, mặc dù Witness không thể xác định Anthropic đã sử dụng dữ liệu gì.

Greg Kamradt, một trong những nhà nghiên cứu đứng sau ARC-AGI-3, cho biết kết quả này không loại trừ khả năng đạt được những bước tiến rộng hơn về suy luận. Một trò chơi dựa trên các cơ chế quen thuộc không kiểm tra khả năng thích ứng với sự mới lạ, trong khi một kết quả yếu không thể phủ nhận sự cải thiện tổng thể của mô hình nếu thiếu điểm số chi tiết cho tác vụ đó. Witness cũng được thiết kế dựa trên các câu đố theo phong cách ARC-AGI-3, vì vậy hiệu suất tốt hơn có thể phản ánh khả năng chuyển đổi thực sự thay vì ghi nhớ.

Sau đó, Ning làm rõ rằng Opus 5 có khả năng tổng quát hóa trên Witness, chỉ là thấp hơn nhiều so với trên ARC-AGI-3. Ông so sánh quá trình này với sự phát triển của các bộ tiêu chuẩn lập trình. Là một mục tiêu chính cho suy luận tương tác, ARC-AGI-3 có khả năng sẽ thu hút nỗ lực đào tạo nhiều nhất trước tiên. Việc bao phủ nhiều trường hợp biên (edge cases) hơn sau đó có thể giúp các mô hình tổng quát hóa sang phạm vi rộng hơn các tác vụ suy luận trừu tượng. Ning cho biết lập trình cũng đi theo con đường tương tự, chuyển từ các bộ tiêu chuẩn đã bão hòa như HumanEval sang các cuộc thi được cập nhật thường xuyên và các tác nhân lập trình (coding agents) ngày nay.

Tin tức AI không cường điệu – Được tuyển chọn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền về công nghệ tiên phong "AI Radar" sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền tham gia phần bình luận của chúng tôi.

Đăng ký ngay

ClaudeAnthropicAGITrí tuệ nhân tạoĐột phá công nghệ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.