Tin ngành
OpenAI gây tranh cãi khi tuyên bố GPT-5.6 Sol vượt mặt Claude Opus 5 trong bài kiểm tra ARC-AGI
(giờ Việt Nam)
Tóm tắt AI
OpenAI khẳng định mô hình GPT-5.6 Sol đạt 38,3% trong bài kiểm tra ARC-AGI-3, vượt qua Claude Opus 5. Tuy nhiên, kết quả này gây tranh cãi do sử dụng các thiết lập API đặc biệt, trong khi kết quả kiểm tra tiêu chuẩn chỉ đạt 7,8%.
Bản dịch AI

Cập nhật:
Đồng sáng lập ARC Prize, François Chollet, đã phản hồi về kết quả của OpenAI bằng cách phân biệt hai loại thiết lập kiểm thử. Ông cho biết, các bộ công cụ (harnesses) được "tùy chỉnh để giải quyết bài kiểm chuẩn hoặc chứa kiến thức về định dạng của bài kiểm chuẩn" là không được phép. Các thiết lập API đa năng "không được phát triển riêng cho ARC-AGI-3 và khả dụng cho tất cả người dùng API" thì được chấp nhận. Trên thực tế, Chollet thừa nhận rằng điểm số GPT-5.6 Sol của chính ARC Prize đã đặt OpenAI vào thế bất lợi.
Ông lưu ý rằng ARC Prize đã có "nhiều cuộc trao đổi qua lại với OpenAI về cách kiểm thử mô hình của họ tốt nhất, đặc biệt là liên quan đến tính năng nén (compaction)," và hoan nghênh việc công ty "bắt đầu tìm ra câu trả lời." Việc các nhà cung cấp khác nhau sử dụng các thiết lập khác nhau thực sự tạo ra "vấn đề tiềm ẩn về tính tương đương," Chollet nói, nhưng ông coi đó là điều có thể chấp nhận được "miễn là các thiết lập và chi phí được báo cáo rõ ràng."
Bài viết gốc:
OpenAI cho biết họ có thể bắt kịp trên ARC-AGI-3. Sau khi Claude Opus 5 của Anthropic tăng gấp bốn lần điểm số kỷ lục trên bài kiểm chuẩn logic, OpenAI hiện đang cho thấy GPT-5.6 Sol đạt 38,3% với hai thiết lập API, vượt qua mức 30,2% của Opus 5.

Tuy nhiên, OpenAI không sử dụng môi trường kiểm thử chính thức. Thay vào đó, họ chạy GPT-5.6 Sol thông qua Responses API của riêng mình với tính năng "Retained Reasoning" (Suy luận được lưu giữ), giúp duy trì chuỗi suy nghĩ của mô hình giữa các bước, và "Compaction" (Nén), giúp tóm tắt ngữ cảnh cũ thay vì cắt bỏ nó. Trong bộ công cụ chính thức, GPT-5.6 Sol chỉ đạt 7,8% vì khả năng suy luận của mô hình bị loại bỏ sau mỗi hành động.
OpenAI lập luận rằng các bài kiểm chuẩn không bao giờ chỉ đo lường mô hình mà còn đo lường cả thiết lập kỹ thuật xung quanh nó. Điều đó đúng, và ARC-AGI-3 được thiết kế để kiểm tra hiệu suất thuần túy của mô hình. ARC Prize cho biết trong phản hồi về kết quả của OpenAI rằng các điểm số ARC chính thức sử dụng phương pháp tiêu chuẩn hóa mà không có các thiết lập riêng biệt của nhà cung cấp để đảm bảo so sánh công bằng. Điểm gây tranh cãi là liệu ARC Prize có sử dụng "OpenAI-style completions API" cũ vốn thiếu các tính năng mà Claude API đã cung cấp hay không, điều này sẽ khiến việc so sánh trở nên không công bằng với OpenAI.
Tin tức AI không thổi phồng – Được tuyển chọn bởi con người
Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo chuyên sâu "AI Radar" độc quyền sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.
Đăng ký ngay
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.