Thủ thuật
Nvidia: 'Dây cương' quan trọng hơn mô hình AI, Claude Opus 5 đạt điểm tuyệt đối nhờ tối ưu hóa
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu của Nvidia cho thấy việc thiết kế 'dây cương' (harness) và cơ chế giám sát giúp Claude Opus 5 đạt 100% điểm ARC-AGI-3, vượt xa mức 30% khi chạy độc lập. Điều này khẳng định hạ tầng điều khiển quan trọng hơn chính mô hình AI trong các tác vụ dài hạn.
Bản dịch AI

Vào thứ Sáu, Nvidia đã công bố một nghiên cứu mới đầy thú vị, cho thấy rằng "harness" (bộ khung điều khiển) đóng vai trò quan trọng hơn nhiều so với mô hình nền tảng khi yêu cầu AI thực hiện các tác vụ dài hạn (long-horizon tasks).
Tóm tắt ngắn gọn: chỉ bằng cách sử dụng một bộ khung tùy chỉnh được tinh chỉnh để quản lý bộ nhớ hiệu quả và bổ sung thêm một thành phần "giám sát" (supervisor), các nhà nghiên cứu đã giúp Claude Opus 5 đạt điểm tuyệt đối 100% trên bộ tiêu chuẩn đánh giá suy luận tương tác ARC-AGI-3. (Đây là bộ tiêu chuẩn vốn đã khiến đối thủ là phòng thí nghiệm tiên phong OpenAI phải đau đầu). Nếu không có bộ khung này, Opus 5 chỉ đạt 30%, vốn đã là kết quả cao nhất trong số tất cả các mô hình được thử nghiệm.
Nghiên cứu của Nvidia là một minh chứng nữa cho thấy, mặc dù việc lựa chọn mô hình đóng vai trò như bộ não của tác nhân (agent) là quan trọng, nhưng nó chỉ là một phần nhỏ trong hệ thống tác nhân hơn nhiều người dùng AI vẫn tưởng, đặc biệt là đối với các tác vụ dài hạn. Bộ khung chính là thứ biến một mô hình thành một tác nhân thực thụ: nó xử lý bộ nhớ, ngữ cảnh và phản hồi.
Adel El Hallack, phó chủ tịch phụ trách sản phẩm tại bộ phận AI của Nvidia (ảnh trên), chia sẻ với TechCrunch: “Nói chung, thế giới thường hiểu tác nhân gần như chỉ là một API của mô hình”. Nhưng thực tế, một tác nhân còn hơn thế nhiều. “Nó là mô hình. Nó là cấu trúc bao quanh mô hình mà chúng tôi gọi là bộ khung (harness), tức là tập hợp các công cụ mà nó sử dụng. Đó là môi trường thực thi (runtime) cùng các kỹ năng và thư viện liên quan mà chúng ta cung cấp cho nó quyền truy cập.”
Các tác vụ dài hạn là những tác vụ đòi hỏi phải kết nối nhiều quyết định lại với nhau, đôi khi kéo dài hàng ngày trời, để tạo ra kết quả công việc hoàn chỉnh. Điều này trái ngược với việc AI chỉ đơn thuần đưa ra phản hồi cho một câu lệnh (prompt). Việc tìm ra cách để AI thực hiện các tác vụ dài hạn mà không bị xao nhãng hay "lạc trôi" là một trong những "chén thánh" trong nghiên cứu về tác nhân (agentic research).
Ví dụ: Microsoft đã công bố một nghiên cứu vào tháng 4, thử nghiệm 19 mô hình ngôn ngữ lớn (LLM) trên các tác vụ dài hạn liên quan đến chỉnh sửa tài liệu và phát hiện ra rằng tất cả các mô hình, kể cả những mô hình tiên tiến nhất, đều làm đầy tài liệu bằng các lỗi sai. (Nếu con người làm việc như vậy, họ sẽ bị sa thải ngay lập tức).
Các mô hình tự kết nối các quyết định với nhau cũng từng bị bắt gặp hành vi xóa tệp tin của người dùng, thậm chí xóa cả cơ sở dữ liệu hoặc chuyển sang các hành vi phạm tội để đạt được mục tiêu, từ thông đồng cho đến tấn công mạng.
Việc các nhà nghiên cứu Nvidia chọn bộ tiêu chuẩn suy luận tương tác này cho các thử nghiệm của họ đặc biệt có ý nghĩa, thậm chí có phần hài hước. Đây là bộ tiêu chuẩn gồm một loạt các trò chơi 2D không có hướng dẫn. Mô hình phải tự tìm cách chơi và giành chiến thắng. Điểm số 100% đồng nghĩa với việc mô hình có thể đánh bại các trò chơi này giỏi như con người.
OpenAI đã rất bối rối trước điểm số thảm hại (dưới 10%) của các mô hình của họ trên ARC-AGI-3 đến mức họ đã thực hiện nghiên cứu riêng vào tháng trước. Giống như Nvidia, OpenAI phát hiện ra rằng chỉ cần tinh chỉnh hai cài đặt trên bộ khung, các mô hình của họ đã tăng gấp ba lần điểm số.
Tuy nhiên, không có mô hình nào đạt gần mức 100% như các nhà nghiên cứu của Nvidia đã làm được. Họ cho thấy rằng các bộ khung cần một thành phần "giám sát" để thúc đẩy tác nhân đi đúng hướng nếu nó bị mắc kẹt.
El Hallack cho biết: “Phần thú vị hơn là việc giới thiệu một tác nhân giám sát bên cạnh tác nhân chính đang thực hiện công việc”. Nó “gần như đóng vai trò như một CEO để thúc đẩy tác nhân khi nó đi chệch hướng, bắt đầu khám phá một con đường có thể dẫn đến ngõ cụt, hoặc khám phá lại một con đường mà nó đã từng đi qua trước đó.”
Mặc dù khái niệm tác nhân giám sát không hoàn toàn mới, nhưng hiện nay hầu hết người dùng tác nhân chỉ dựa vào một lớp duy nhất cho bộ khung của họ, như Claude Code, Codex, Hermes, v.v. Các nhà nghiên cứu Nvidia đã tạo ra bộ khung nâng cấp của riêng họ có tên là Agentic Variation Operators (AVO). Lưu ý rằng đây không phải là một sản phẩm mới của Nvidia. Thay vào đó, Nvidia sản xuất rất nhiều thành phần công nghệ mở để xây dựng các bộ khung dưới thương hiệu Nemo. Một số công nghệ trong đó là thương mại, nhưng phần lớn đều có sẵn công khai.
Dù vậy, kết quả của Nvidia đã bổ sung vào bằng chứng ngày càng tăng cho thấy việc lựa chọn mô hình không phải là yếu tố duy nhất quyết định hiệu suất của tác nhân. Ví dụ, vào tháng 7, Databricks đã công bố một nghiên cứu đáng kinh ngạc cho thấy bộ khung, chứ không phải mô hình, mới là thứ tác động đáng kể đến chi phí AI.
CEO Ali Ghodsi của Databricks chia sẻ với TechCrunch: “Bạn có thể chọn cùng một mô hình nhưng với các bộ khung khác nhau, và bạn sẽ phải trả chi phí cao hơn đáng kể nếu sử dụng sai bộ khung. Vì vậy, bạn nghĩ rằng, ồ, đây là một mô hình đắt tiền, đây là một mô hình rẻ tiền. Nhưng khoan đã, bạn đang sử dụng bộ khung nào? Bản thân điều đó có thể làm tăng gấp đôi chi phí của bạn.”
Điểm mấu chốt mà Nvidia muốn nhấn mạnh là các bộ khung mở, cũng giống như các mô hình mở, giúp người dùng nắm quyền kiểm soát nhiều hơn những gì họ tưởng.
El Hallack nói: “Chúng tôi tin tưởng và đang chứng minh với hệ sinh thái rằng, các bộ khung mở cho phép bạn điều chỉnh nhiều thông số hơn để nâng cao độ chính xác đó”. Điều này liên quan đến việc OpenAI làm chậm quá trình huấn luyện các mô hình của họ, vốn là hệ quả từ việc các mô hình tạo ra các lỗ hổng bảo mật.
Ông nói thêm: “Chúng tôi tin rằng việc sở hữu một ngăn xếp tác nhân mở — nơi bạn có quyền kiểm soát trên toàn bộ khung, cơ sở hạ tầng và môi trường thực thi — là điều cần thiết để chúng ta đưa hệ sinh thái tiến lên phía trước một cách an toàn.”
Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.


Bài viết được AI dịch và tổng hợp tự động từ TechCrunch: AI. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.