Tin ngành
OpenAI gây tranh cãi khi dùng công cụ riêng để 'thổi phồng' điểm số GPT-5.6 Sol
(giờ Việt Nam)
Tóm tắt AI
GPT-5.6 Sol đạt 38,3% trên ARC-AGI-3 nhờ công cụ tùy chỉnh, nhưng chỉ đạt 7,8% khi dùng bài kiểm tra chuẩn. Sự khác biệt này làm dấy lên nghi vấn về tính minh bạch trong các báo cáo hiệu năng của OpenAI.
Bản dịch AI

OpenAI cho biết họ có thể bắt kịp trên ARC-AGI-3. Sau khi Claude Opus 5 của Anthropic tăng gấp bốn lần điểm số kỷ lục trên tiêu chuẩn đánh giá logic này, OpenAI hiện đang cho thấy GPT-5.6 Sol đạt 38,3% với hai thiết lập API, vượt qua mức 30,2% của Opus 5.

Tuy nhiên, OpenAI không sử dụng môi trường thử nghiệm chính thức. Thay vào đó, họ chạy GPT-5.6 Sol thông qua Responses API của riêng mình với tính năng "Retained Reasoning" (Duy trì suy luận), giúp giữ lại chuỗi suy nghĩ của mô hình giữa các bước, và "Compaction" (Nén), giúp tóm tắt ngữ cảnh cũ thay vì cắt bỏ nó. Trong bộ công cụ kiểm thử chính thức, GPT-5.6 Sol chỉ đạt 7,8% vì khả năng suy luận của mô hình bị loại bỏ sau mỗi hành động.
OpenAI lập luận rằng các tiêu chuẩn đánh giá không bao giờ chỉ đo lường riêng mô hình mà còn cả thiết lập kỹ thuật xung quanh nó. Điều đó cũng hợp lý, và chính vì lý do đó mà ARC-AGI-3 cố tình kiểm tra hiệu suất thuần túy của mô hình mà không có các công cụ hỗ trợ bên ngoài. Opus 5 đã đạt mức 30% dưới cùng những ràng buộc đó và có khả năng sẽ đạt điểm cao hơn nữa nếu chạy trong Claude Code.
Tin tức AI không thổi phồng – Được tuyển chọn bởi con người
Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo chuyên sâu "AI Radar" độc quyền sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.
Đăng ký ngay
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.