HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Điểm AI 39/100

Nghiên cứu

KVCMAS: Khung tối ưu hóa KV cache hiệu quả cho hệ thống đa tác nhân (Multi-Agent)

(giờ Việt Nam)

Tóm tắt AI

KVCMAS là khung sửa lỗi KV cache trực tuyến dành cho hệ thống đa tác nhân, sử dụng biểu diễn trạng thái hạng thấp để hiệu chỉnh sai lệch bộ nhớ đệm xuyên suốt quy trình làm việc mà không cần tiền xử lý bổ sung.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

Tóm tắt: Các hệ thống đa tác nhân chuyên biệt hóa theo prompt cho phép nhiều tác nhân chia sẻ cùng một mô hình trong khi thực hiện các vai trò bổ trợ để giải quyết các tác vụ phức tạp. Tuy nhiên, các tiền tố (prefix) dành riêng cho từng tác nhân làm thay đổi KV cache được tạo ra cho cùng một ngữ cảnh chia sẻ, khiến mỗi tác nhân phải liên tục thực hiện prefill cho ngữ cảnh đang tăng dần và xây dựng một bộ nhớ đệm riêng biệt, dẫn đến chi phí tính toán và bộ nhớ cao. Việc tính toán lại có chọn lọc giúp giảm bớt sự dư thừa này nhưng vẫn duy trì khối lượng thực thi mô hình đáng kể, trong khi các phương pháp sửa lỗi delta hiện có hoặc chỉ hỗ trợ các mối quan hệ ngữ cảnh lặp lại, hoặc duy trì các trạng thái sửa lỗi trực tuyến tốn nhiều bộ nhớ đối với ngữ cảnh thay đổi linh hoạt. Đối với ngữ cảnh chia sẻ lần đầu xuất hiện, các phương pháp này cũng xây dựng một bộ nhớ đệm tham chiếu bên ngoài quy trình làm việc của tác nhân, và việc sửa lỗi xấp xỉ tại tác nhân đầu tiên sẽ ảnh hưởng đến các đầu ra được chuyển cho các tác nhân tiếp theo. Chúng tôi giới thiệu KVCMAS, một khung sửa lỗi KV cache trực tuyến đại diện cho các sai lệch bộ nhớ đệm giữa các tác nhân bằng cách sử dụng các trạng thái hạng thấp (low-rank) nhỏ gọn và liên kết các sửa lỗi một cách liền mạch dọc theo quy trình làm việc của tác nhân mà không cần thêm bước prefill tham chiếu. Thiết kế này hỗ trợ ngữ cảnh chia sẻ thay đổi linh hoạt trong khi vẫn bảo toàn chính xác bộ nhớ đệm của tác nhân đầu tiên. Trên nhiều khối lượng công việc ngôn ngữ và ngôn ngữ-hình ảnh, KVCMAS đạt được hoặc cải thiện độ chính xác so với các phương pháp chia sẻ KV cache trước đây, đồng thời đạt được TTFT thấp nhất trong môi trường phục vụ có tính đồng thời cao. Dưới các dấu vết phục vụ được kiểm soát, nó mang lại tốc độ TTFT nhanh gấp 2,0 lần so với suy luận không chia sẻ KV cache và giảm bộ nhớ GPU đỉnh lên tới 3,7 lần so với một phương pháp sửa lỗi KV cache trước đó. Những kết quả này khẳng định KVCMAS là một phương pháp chia sẻ KV cache chính xác và có khả năng mở rộng cho việc phục vụ đa tác nhân chuyên biệt hóa theo prompt.

Bình luận:29 trang, 13 hình, 15 bảng
Chủ đề:Học máy (cs.LG)
Trích dẫn là:arXiv:2609.34060 [cs.LG]
(hoặc arXiv:2609.34060v1 [cs.LG] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.34060 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Hyesung Jeon [xem email] [v1] Thứ Hai, 28 tháng 9 năm 2026 00:39:50 UTC (3.240 KB)

KV cacheMulti-AgentTối ưu hóa AILLMHiệu suất

Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

KVCMAS: Khung tối ưu hóa KV cache hiệu quả cho hệ thống đa tác nhân (Multi-Agent) | AIHOT.vn