IT Home
85

Sản phẩm

OpenAI tối ưu hóa GPT-5.6 Sol: Hiệu suất suy luận ARC-AGI tăng vọt 188%

(giờ Việt Nam)

Tóm tắt AI

Nhờ cải tiến cơ chế lưu giữ suy luận và nén ngữ cảnh, GPT-5.6 Sol đã tăng điểm số trên bài kiểm tra ARC-AGI-3 lên 38,3% đồng thời giảm đáng kể lượng token tiêu thụ.

Bản dịch AI

Theo tin từ IT ngày 31 tháng 7, OpenAI hôm nay (31/7) đã đưa ra thông báo, tuyên bố rằng thông qua việc cải tiến khung làm việc (framework), mô hình GPT-5.6 Sol đã đạt mức tăng trưởng 188% trong bài kiểm tra ARC-AGI-3.

Lưu ý của IT: ARC-AGI-3 là một chuẩn đánh giá suy luận tương tác hoàn toàn mới do đội ngũ ARC Prize ra mắt, hiện được công nhận toàn cầu là chuẩn đánh giá suy luận tương tác khắt khe và hàng đầu để đo lường trí tuệ nhân tạo tổng quát (AGI).

Chuẩn đánh giá này phá vỡ hoàn toàn mô hình kiểm tra tĩnh kiểu "giải đề" và hỏi đáp kiến thức của AI truyền thống, bằng cách đưa AI trực tiếp vào một "môi trường trò chơi" hoàn toàn xa lạ để đánh giá xem nó có khả năng khám phá, học hỏi và thích nghi thời gian thực giống như con người hay không.

Trước khi được tinh chỉnh và tối ưu hóa, GPT-5.6 Sol đạt 7,8% trong bài kiểm tra ARC-AGI-3, trong khi mô hình GPT-5.5 chỉ đạt 0,4%.

Sau khi rà soát lại, OpenAI phát hiện khung làm việc chính thức của dòng mô hình GPT-5.6 tồn tại 2 cơ chế ảnh hưởng đến hiệu suất của GPT-5.6 Sol:

Thứ nhất, sau mỗi hành động trong trò chơi, suy luận riêng (private reasoning) đều bị loại bỏ. Điều này có nghĩa là sau mỗi lần thực hiện hành động, GPT-5.6 Sol đều phải hiểu lại trò chơi từ đầu. Mô hình vẫn có thể thấy lịch sử hành động và các ghi chú ngắn, nhưng không thể thấy các kế hoạch, thông tin chi tiết và quá trình tư duy dẫn đến những hành động đó.

Thứ hai, khung làm việc chính thức sử dụng cửa sổ cắt tỉa cuộn (rolling truncation window). Khi lịch sử kéo dài, các hành động cũ hơn sẽ biến mất khỏi ngữ cảnh. Nói cách khác, GPT-5.6 Sol không chỉ không thể lưu giữ tư duy quá khứ mà còn mất đi ký ức về các hành động trước đó.

Để giải quyết các vấn đề trên, OpenAI đã đề xuất hai giải pháp là bảo lưu suy luận (inference preservation) và nén ngữ cảnh (context compression).

Về bảo lưu suy luận, OpenAI sử dụng Responses API để tái hiện khung kiểm tra ARC-AGI-3. Đối với GPT-5.6, chỉ cần truyền vào ID phản hồi (response ID) trước đó là có thể tự động bảo lưu suy luận trong các lần gọi công cụ và tương tác đa vòng.

OpenAI cho biết sau khi kích hoạt bảo lưu suy luận, GPT-5.6 không cần phải giải thích lại trò chơi sau mỗi vòng, từ đó giảm thời gian dành cho việc suy nghĩ trước mỗi hành động. Khi mô hình lưu giữ được các suy nghĩ trước đó, nó sẽ giỏi hơn trong việc học hỏi theo thời gian và áp dụng các chiến lược nhất quán hơn.

Về nén ngữ cảnh, khung ARC-AGI-3 chính thức sẽ loại bỏ các tin nhắn cũ nhất sau khi ngữ cảnh hội thoại vượt quá 175.000 ký tự. OpenAI cho rằng việc cắt tỉa cuộn có 2 nhược điểm: mô hình sẽ mất đi các quan sát và hành động ban đầu; mô hình phải vận hành với cửa sổ ngữ cảnh đầy hơn trong phần lớn thời gian thực hiện nhiệm vụ, điều này có thể làm giảm nhẹ hiệu suất.

Sau khi kích hoạt nén ngữ cảnh, GPT-5.6 Sol có khả năng lưu giữ thông tin đã học cho mỗi trò chơi tốt hơn trong các nhiệm vụ dài, đồng thời đạt điểm số cao hơn với lượng token đầu ra ít hơn.

Khi sử dụng harness chính thức, GPT-5.6 Sol đạt 13,3% trong bài kiểm tra ARC-AGI-3; sau khi kích hoạt bảo lưu suy luận (inference preservation) và nén ngữ cảnh (context compression), GPT-5.6 Sol đạt 38,3% điểm số trong khi lượng token đầu ra giảm xuống còn một phần sáu, tương đương mức tăng trưởng 188,42%.

Harness (thường được gọi là kỹ thuật điều khiển/cương ngựa) là toàn bộ kiến trúc hệ thống bao bọc bên ngoài các mô hình ngôn ngữ lớn, cung cấp môi trường vận hành, tích hợp công cụ, ràng buộc quy tắc và cơ chế phản hồi cho mô hình.

Nếu ví một mô hình AI mạnh mẽ như một con tuấn mã đầy sức mạnh nhưng dễ mất kiểm soát, thì harness chính là dây cương, yên ngựa và lộ trình của người cưỡi. Nó không thay đổi kiến trúc của bản thân mô hình mà quyết định cách mô hình được điều khiển một cách an toàn, đáng tin cậy để thực sự hoàn thành các công việc phức tạp.

Tuyên bố quảng cáo: Các liên kết ngoài có trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian chọn lọc, kết quả chỉ mang tính chất tham khảo. Tất cả các bài viết của IT đều bao gồm tuyên bố này.

OpenAIGPT-5.6AGISuy luận AIARC-AGI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.