Thủ thuật
NVIDIA và cộng sự ra mắt SoL-Pi: Giảm tới 49% lưu lượng token cho AI lập trình
(giờ Việt Nam)
Tóm tắt AI
Nhóm nghiên cứu từ NVIDIA, NTU và MIT giới thiệu SoL-Pi, bộ giải pháp tối ưu hóa giúp giảm đáng kể lượng token tiêu thụ cho các AI lập trình (Coding Agent) thông qua cơ chế tự động hóa thông minh.
Bản dịch AI

Các tác nhân lập trình (coding agents) hiện nay chạy trong nhiều giờ thay vì vài phút. Mọi chỉnh sửa, lượt chạy thử nghiệm và nhật ký đọc đều được đưa ngược lại vào ngữ cảnh của mô hình. Một nhóm các nhà nghiên cứu từ NVIDIA, NTU và MIT đã phát hành SoL-Pi, một bộ gồm 4 cơ chế tối ưu hóa hiệu suất cho tác nhân lập trình mã nguồn mở Pi. Một AI đã tìm ra các cơ chế này bằng cách chạy các vòng lặp tự nghiên cứu ở lớp harness. Trong bài đánh giá 51 tác vụ EdgeBench, SoL-Pi cắt giảm lưu lượng token ghi nhận được từ 44,7% đến 49,0% so với Pi và giảm chi phí API khoảng 33%. Điểm số của nó vẫn duy trì gần với Pi trên cả GPT-5.6 Sol và Opus 5.
Nó có thể triển khai được không? Có. SoL-Pi được phát hành trên GitHub dưới tên NVlabs như một phần mở rộng theo giấy phép MIT, chạy trên bản phát hành Pi nguyên bản. Nó đã được thử nghiệm với Pi 0.85.1 và Node.js 22.19 hoặc mới hơn.
Tại sao lại nhắm vào Harness?
Hầu hết các công trình tối ưu hóa hiệu suất đều giảm chi phí trên mỗi token thông qua các kernel nhanh hơn, lượng tử hóa hoặc các mô hình rẻ hơn. Thay vào đó, SoL-Pi giảm số lượng token mà một tác vụ tiêu thụ. Harness là lớp xử lý các lệnh gọi công cụ, ngữ cảnh, quan sát và ủy quyền.
Việc tinh chỉnh harness thủ công rất chậm và các thành phần của nó có sự liên kết chặt chẽ: một bản sửa lỗi ở một nơi có thể đẩy chi phí sang các bước sau đó. Meta-Harness và các hệ thống tương tự tự động hóa công việc này. Tuy nhiên, một nghiên cứu gần đây cho thấy các harness được tiến hóa có thể bị quá khớp (overfit) với các tác vụ tìm kiếm của chúng và chỉ mang lại lợi ích không đáng kể trên các tác vụ chưa từng thấy.
Cách thức hoạt động của quá trình tìm kiếm
Một AI nghiên cứu quan sát các dấu vết thực thi từ một tác nhân riêng biệt chạy Pi cơ sở. Sau đó, nó đề xuất các thay đổi đối với harness và kiểm tra chúng. Quá trình tìm kiếm bao gồm:
Mỗi lượt tìm kiếm là một vòng lặp biệt lập, dùng một lần. Nó tuân theo chu trình tự nghiên cứu, được mở rộng với một bước triển khai Ralph Loop và một người đánh giá độc lập.
Các quy tắc chấp nhận được cố định trước khi quá trình tìm kiếm bắt đầu và trình tối ưu hóa không thể thay đổi chúng. Mọi chỉ số năng lực phải nằm trong phạm vi sai số đã khai báo trước. Ứng viên cũng phải cải thiện ít nhất 1 chỉ số hiệu suất. EdgeBench được giữ lại để kiểm tra. Trong số 51 tác vụ công khai của nó, 11 tác vụ được sử dụng để chấp nhận một chiều các ứng viên đã đóng băng và 40 tác vụ để đánh giá cuối cùng. Kết quả từ tập dữ liệu giữ lại không bao giờ được đưa ngược lại vào quá trình tìm kiếm.
4 cơ chế đã tồn tại
Kết quả trên EdgeBench
Toàn bộ stack được xây dựng trên GPT-5.6 Sol và chuyển sang Opus 5 mà không cần tìm kiếm thêm. Trên Opus 5, nó giữ lại 94,3% điểm số của Pi trong khi cắt giảm 44,7% lưu lượng token và 33,5% chi phí API. Trên GPT-5.6 Sol, nó giữ lại 93,7% điểm số của Pi với lượng token ít hơn 49,0% và chi phí thấp hơn 33,2%.
Điểm hiệu năng sử dụng cơ chế đơn lẻ tốt nhất cho từng backend: ObservationPack trên GPT-5.6 Sol và Action Fusion trên Opus 5. Nó nâng điểm số lên cao hơn 5,3% và 12,8% so với Pi.
Trên GPT-5.6 Sol, toàn bộ stack làm tăng lưu lượng ghi bộ nhớ đệm từ 0,0141 tỷ lên 0,0316 tỷ token. Tổng chi phí vẫn giảm, từ 1.339 USD xuống 894 USD. Bài báo ước tính mức tiết kiệm hàng giờ từ 8,75 USD đến 13,50 USD so với các harness Codex và Claude Code gốc, và từ 4,36 USD đến 5,71 USD so với Pi.
Ngoài EdgeBench
Nhóm nghiên cứu gọi việc chuyển đổi chéo mô hình này là sơ bộ. Các cơ chế kích hoạt ít thường xuyên hơn trên Opus 5, có thể là do quá trình tìm kiếm chỉ sử dụng các quỹ đạo của GPT-5.6 Sol.
Những điểm chính cần lưu ý
Hãy xem Bài báo, Kho lưu trữ GitHub và Blog kỹ thuật. Mọi công lao đều thuộc về các nhà nghiên cứu của dự án này. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ thành viên của chúng tôi và Đăng ký nhận Bản tin. Chờ đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Cần hợp tác với chúng tôi để quảng bá Kho lưu trữ GitHub, Trang Hugging Face, Sản phẩm phát hành hoặc Hội thảo trực tuyến, v.v. của bạn? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost AI Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.