# TokenCast: Dự báo mức tiêu thụ token khi vận hành AI Agent

- Nguồn: HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
- Thời gian phát hành: 2026-09-28 07:00 (giờ Việt Nam)
- Điểm AI: 42/100
- Link AIHOT.vn: https://aihot.vn/items/5d635ee823b7d8b3
- Nguồn dữ liệu AI HOT: https://aihot.news/items/d4d01yf5mmuv0gmeu3h5e6rzl
- Link gốc: https://arxiv.org/abs/2609.35760

## Tóm tắt AI

TokenCast giúp dự báo thời gian thực lượng token tiêu thụ của AI Agent mà không cần gọi thêm LLM, với tốc độ xử lý trung bình chỉ 32,8 ms trên SWE-bench Verified.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.35760) [HTML (thử nghiệm)](https://arxiv.org/html/2609.35760v1)

> Tóm tắt: Khi một tác nhân mô hình ngôn ngữ lớn (LLM) thực hiện cùng một tác vụ, mức tiêu thụ token có thể thay đổi hơn một bậc độ lớn giữa các lần chạy. Tác nhân chọn các bước tiếp theo dựa trên phản hồi từ công cụ và kết quả trung gian, trong khi ngữ cảnh ngày càng tăng dần làm phình to kích thước đầu vào của mọi lệnh gọi sau đó. Do đó, tổng mức tiêu thụ của một tác vụ rất khó dự đoán trước khi thực thi và dự đoán này phải được điều chỉnh khi quá trình chạy diễn ra. Trong bài báo này, chúng tôi đề xuất TokenCast, một phương pháp học cách biểu diễn chi phí có thể kết hợp cho từng phân đoạn thực thi, ghi lại mức tiêu thụ của chính nó và sự tăng trưởng ngữ cảnh mà nó tạo ra. Việc kết hợp các phân đoạn liền kề mang lại ước tính tích lũy, nắm bắt được chi phí đầu vào bổ sung phát sinh khi ngữ cảnh từ các phân đoạn trước đó bị đọc lại bởi mọi lệnh gọi sau này. Khi quá trình thực thi diễn ra, các bằng chứng mới được quan sát sẽ làm mới dự báo mà không cần thêm bất kỳ lệnh gọi LLM nào, với thời gian dự đoán tích lũy trung bình là 32,8 ms mỗi lần chạy trên SWE-bench Verified. Trên 4 bộ tác vụ và 6 mô hình tác nhân, mức giảm sai số tuyệt đối trung bình của TokenCast so với mô hình so sánh mạnh nhất đạt trung bình 14,5% trên 96 tổ hợp được đánh giá. Trong quá trình phát lại kiểm soát ngân sách ngoại tuyến, TokenCast sử dụng ít hơn trung bình 21,3% token so với chính sách ngân sách cố định khi hoàn thành cùng một dấu vết. Mã nguồn có sẵn tại [địa chỉ URL này](https://github.com/DEFENSE-SEU/TokenCast).

| Chủ đề: | Học máy (cs.LG); Trí tuệ nhân tạo (cs.AI); Kỹ thuật phần mềm (cs.SE) |
| --- | --- |
| Trích dẫn là: | arXiv:2609.35760 [cs.LG] |
|  | (hoặc arXiv:2609.35760v1 [cs.LG] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.35760 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Chaoqian Ouyang [xem email](https://arxiv.org/show-email/9eb34ca9/2609.35760)] [v1] Thứ Hai, 28 tháng 9 năm 2026 17:59:09 UTC (1.159 KB)
