# Hệ thống SoL-Pi của Nvidia giúp giảm một nửa lượng token cho AI lập trình

- Nguồn: The Decoder: AI News
- Thời gian phát hành: 2026-09-26 17:30 (giờ Việt Nam)
- Điểm AI: 61/100
- Link AIHOT.vn: https://aihot.vn/items/2d7cdcb2a231afcc
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmuia3dtr0b2jrov0w9x40faf
- Link gốc: https://the-decoder.com/nvidias-sol-pi-system-cuts-coding-agent-token-usage-nearly-in-half-by-optimizing-the-harness

## Tóm tắt AI

Nvidia giới thiệu SoL-Pi, hệ thống tự động tối ưu hóa lớp điều khiển (harness) giúp tiết kiệm tới 54,3% lượng token khi thực hiện các tác vụ lập trình mà vẫn duy trì hiệu suất ổn định.

## Thân bài

![Nvidia's SoL-Pi system cuts coding agent token usage nearly in half by optimizing the harness](https://the-decoder.com/wp-content/uploads/2026/09/solpi-agent-harness-optimization-nano-banana-pro.jpg)

Một [nghiên cứu](https://arxiv.org/html/2609.20519v1) mới từ các nhà nghiên cứu tại Nvidia giải quyết các chi phí này không phải ở cấp độ mô hình mà ở [harness](https://the-decoder.com/new-review-paper-argues-code-is-how-ai-agents-think-and-act-not-just-what-they-produce/), lớp điều khiển nằm giữa mô hình và môi trường của nó, được sử dụng bởi các hệ thống như Codex, Claude Code hoặc OpenClaw.

![Diagram of the SoL-Pi auto-research loop showing research environments, a research AI, an idea pool, and four retained mechanisms, alongside bar charts comparing score and API costs for Codex, Claude ](https://the-decoder.com/wp-content/uploads/2026/09/sol-pi-01-overview.jpg)

Harness kiểm soát cách một tác nhân (agent) quan sát trạng thái, thực thi hành động và xử lý phản hồi. Hầu hết các phương pháp tối ưu hóa hiệu suất cho đến nay đều tập trung vào việc cắt giảm chi phí trên mỗi token thông qua các nhân chú ý (attention kernels) nhanh hơn và cơ sở hạ tầng phục vụ, nén mô hình như lượng tử hóa (quantization), hoặc thay thế bằng các mô hình rẻ hơn.

### AI khám phá 152 hướng đi để tìm ra logic điều khiển tinh gọn hơn

Việc tối ưu hóa harness trong thực tế rất khó khăn vì việc sử dụng công cụ, quản lý ngữ cảnh, xác minh và logic hủy bỏ đều gắn kết chặt chẽ với nhau. Một thay đổi giúp tiết kiệm token ở nơi này có thể gây ra lỗi ở nơi khác hoặc chỉ đơn giản là đẩy chi phí sang giai đoạn sau. Thông thường, con người phải sàng lọc qua các dấu vết thực thi dài và chuyển đổi các kiểu lỗi lặp đi lặp lại thành mã nguồn.

Hệ thống có tên SoL-Pi giúp tự động hóa công việc đó. Một tác nhân nghiên cứu sẽ quan sát dấu vết của tác nhân khác, đề xuất các thay đổi và kiểm thử chúng trong các môi trường được chuẩn bị sẵn. Các kiểm tra về năng lực và hiệu suất sẽ quyết định ứng viên nào được giữ lại. Theo các tác giả, phương pháp này dựa trên [tự cải thiện đệ quy](https://the-decoder.com/top-ai-lab-researchers-warned-about-automated-ai-research-and-several-of-their-predicted-milestones-have-already-fallen/).

![Flowchart of the search pipeline from trajectory rollouts through map-reduce analysis, mechanism proposal, candidate implementation, independent review, and development validation to a separate held-o](https://the-decoder.com/wp-content/uploads/2026/09/sol-pi-02-search-pipeline.jpg)

Trên 535 môi trường có thể thực thi, hệ thống đã khám phá 152 hướng đi, bao gồm 495 tác vụ bắt nguồn từ các cặp issue-pull-request trên GitHub và 40 trường hợp kiểm thử tổng hợp. Tổng cộng, quy trình đã tạo ra hơn 3.000 lượt chạy và hơn 60.000 tương tác giữa tác nhân và môi trường. Theo các nhà nghiên cứu, quy mô này cho thấy phạm vi tìm kiếm rộng lớn của hệ thống, nhưng tìm kiếm nhiều hơn không tự động mang lại kết quả tốt hơn. Đây là một rủi ro, vì các nghiên cứu trước đây cho thấy các harness được tối ưu hóa tự động có xu hướng quá khớp (overfit) với các tác vụ huấn luyện và mang lại ít lợi ích cho các tác vụ lạ.

SoL-Pi giải quyết vấn đề này bằng cách tách biệt nghiêm ngặt phản hồi tìm kiếm khỏi quá trình đánh giá. Các nhà nghiên cứu đã sử dụng EdgeBench làm chuẩn kiểm thử và tách biệt hoàn toàn nó khỏi quá trình tìm kiếm. Trong số 51 tác vụ công khai, họ sử dụng 11 tác vụ để xác thực một lần các ứng viên đã hoàn thiện. 40 tác vụ còn lại được dành riêng cho đánh giá cuối cùng và các kết quả đó không bao giờ được đưa ngược lại vào quá trình tìm kiếm.

### Bốn cơ chế giúp loại bỏ công việc lãng phí

Quá trình tìm kiếm đã tạo ra bốn cơ chế. Action Fusion hợp nhất hai bước liên tiếp thành một, chẳng hạn như chỉnh sửa mã nguồn theo sau là chạy kiểm thử, giúp loại bỏ hoàn toàn một lệnh gọi mô hình ngôn ngữ. Online Context Compact chạy sau mỗi bước lập kế hoạch và cắt giảm ngữ cảnh tích lũy bất cứ khi nào có thể mà không làm mất thông tin quan trọng.

ObservationPack lưu trữ các đầu ra công cụ dài và chèn một bản tóm tắt ngắn vào các bước sau thay vì gửi lại toàn bộ văn bản mỗi lần. Evidence-Preserving Reducer định tuyến các nhật ký lỗi và kiểm thử lớn đến một mô hình rẻ hơn để chưng cất chúng thành các kết quả chính, với một bước xác minh tự động để bắt các manh mối quan trọng bị bỏ sót.

![Four-panel diagram showing how Action Fusion merges consecutive API calls, Online Context Compact trims context after subtask completion, ObservationPack archives large tool outputs with short summari](https://the-decoder.com/wp-content/uploads/2026/09/sol-pi-04-mechanisms.jpg)

Trên 51 tác vụ công khai của EdgeBench, SoL-Pi hoạt động hiệu quả tương đương với harness Pi gốc, theo các nhà nghiên cứu. Mức độ giảm sử dụng token phụ thuộc vào cấu hình. Biến thể hiệu quả nhất kết hợp cả bốn cơ chế, sử dụng ít hơn 49% token và đạt 93,7% điểm số của Pi. Người dùng ưu tiên hiệu suất và chỉ chọn cơ chế đơn lẻ mạnh nhất sẽ vượt điểm số của Pi 5,3% trong khi vẫn tiết kiệm được token. Trên cả hai biến thể, mức sử dụng token giảm từ 44,7% đến 49%.

![Comparison table of Codex, OpenSquilla, Oh-My-Pi, OpenCode, Oh-My-Opencode, Pi, and two SoL-Pi variants running GPT-5.6 Sol, showing token traffic, costs, average score, and token efficiency.](https://the-decoder.com/wp-content/uploads/2026/09/sol-pi-05-harness-comparison.jpg)

Tính theo đô la, các tác giả ước tính mức tiết kiệm từ 8,75 USD đến 13,50 USD mỗi giờ so với các harness Codex và Claude Code gốc, và từ 4,36 USD đến 5,71 USD mỗi giờ so với Pi, dựa trên giá API hiện tại.

Các nhà nghiên cứu đã xây dựng hệ thống này chỉ với [GPT-5.6 Sol](https://the-decoder.com/openais-claude-mythos-competitor-gpt-5-6-sol-launches-under-government-controlled-access-it-calls-unsustainable/) và sau đó áp dụng nó cho [Opus 5](https://the-decoder.com/anthropic-claims-its-new-claude-opus-5-delivers-near-fable-5-performance-at-half-the-token-price/) mà không có bất kỳ thay đổi nào. Tại đó, nó giữ lại 94,3% hiệu suất của Pi với mức tiết kiệm tương tự. Tuy nhiên, các cơ chế được kích hoạt ít thường xuyên hơn và ít quyết liệt hơn trên Opus 5, điều mà các nhà nghiên cứu cho là do harness chỉ được tối ưu hóa trên các quỹ đạo của GPT-5.6 Sol.

### Kết quả trở nên phức tạp hơn trên các chuẩn đánh giá khác

Ngoài EdgeBench, bức tranh đa dạng hơn. Trên 63 tác vụ CPU từ Terminal-Bench 4, SoL-Pi chỉ giải được 15 tác vụ trong khi Codex và Pi mỗi bên giải được 18. Tổng chi phí vẫn thấp hơn khoảng một phần tư so với Pi.

Trên các tác vụ Lean 4 được xác minh hình thức từ Olympic Toán học 2026 (IMO 2026), hệ thống đã giải được ba trong sáu bài toán với chi phí thấp nhất trên mỗi bài toán được giải. Trong một thí nghiệm tối ưu hóa nhân (kernel), một nhóm gồm 20 tác nhân SoL-Pi đã cắt giảm chi phí 26,8% so với một nhóm Pi tương đương.

![Architecture of an agent swarm with a Codex coordinator and five groups of four workers, alongside progress curves and bar charts comparing cycle counts and model costs.](https://the-decoder.com/wp-content/uploads/2026/09/sol-pi-06-agent-swarm.jpg)

Những cải thiện về hiệu suất đi kèm với sự đánh đổi, vì ngữ cảnh ngắn hơn có thể làm giảm khả năng tái sử dụng [bộ nhớ đệm prompt](https://the-decoder.com/anthropics-prompt-caching-makes-your-long-prompts-much-cheaper/). Tổng chi phí trong một lần chạy kiểm thử vẫn giảm từ 1.339 USD xuống 894 USD. Nhìn về tương lai, các tác giả đề xuất huấn luyện trước harness trên nhiều tác vụ, tương tự như cách các mô hình được huấn luyện trước, và sử dụng một harness đã tinh gọn để giúp việc tìm kiếm phiên bản kế nhiệm rẻ hơn. Họ gọi sự cải thiện hiệu suất đệ quy này là một tầm nhìn, không phải là kết quả từ nghiên cứu hiện tại.

Mức độ ảnh hưởng của harness đến chi phí của một tác nhân đã trở nên rõ ràng trong một thử nghiệm vào tháng 8 bởi công ty công cụ Composio, khi họ chạy [Deepseek V4 Flash trên bốn khung tác nhân](https://the-decoder.com/claude-code-is-the-fastest-agent-framework-but-costs-nearly-three-times-more-than-the-cheapest-rival/) bao gồm Claude Code và Oh My Pi dựa trên Pi. Chi phí cho mỗi tác vụ được giải quyết chênh lệch gần 3 lần mặc dù cùng một mô hình thực hiện công việc.

Áp lực về giá cả và tối ưu hóa ngày càng tăng vì các tác nhân tiêu thụ ngày càng nhiều token hơn. Theo nhà phân tích Peter Walker của OpenRouter, [mức sử dụng token của tác nhân đã tăng 14 lần kể từ tháng 2 năm 2026](https://the-decoder.com/ai-is-becoming-ais-biggest-customer-as-agentic-token-usage-jumps-14x-on-openrouter/), và gần 70% trong số đó đến từ các prompt được lưu trong bộ nhớ đệm.

Tuy nhiên, việc nén ngữ cảnh theo cách SoL-Pi sử dụng có thể gây ra tác dụng phụ. Một nghiên cứu cho thấy việc nén [chỉ bảo tồn trung bình 17% hướng dẫn của người dùng](https://the-decoder.com/ai-systems-quietly-drop-user-instructions-when-they-compress-context/). Các tác nhân song song cũng làm tăng chi phí. Nhà phát triển Codex, Eric Provencher, gần đây đã cảnh báo rằng [hơn hai tác nhân phụ hầu như luôn đốt token](https://the-decoder.com/ai-agent-swarms-are-a-massive-waste-of-tokens-with-zero-quality-gain-says-openai-codex-developer/) mà không cải thiện chất lượng, vì chúng dành phần lớn thời gian để kiểm tra công việc của nhau.
