# PReCache: Khung chia sẻ KV Cache không cần huấn luyện cho Multi-LoRA Agent

- Nguồn: HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
- Thời gian phát hành: 2026-09-28 07:00 (giờ Việt Nam)
- Điểm AI: 44/100
- Link AIHOT.vn: https://aihot.vn/items/4bfe84b33428a3ea
- Nguồn dữ liệu AI HOT: https://aihot.news/items/suux8shrkz3wnloxh0ww0xk50
- Link gốc: https://arxiv.org/abs/2609.34054

## Tóm tắt AI

PReCache là khung chia sẻ KV cache đột phá, sử dụng PreLRShared và ReBaseShared để tái sử dụng cache cơ sở và tiền tính toán các cache bậc thấp (LR) riêng biệt cho từng agent, giúp tối ưu hóa hiệu suất Multi-LoRA.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.34054) [HTML (thử nghiệm)](https://arxiv.org/html/2609.34054v1)

> Tóm tắt: Các hệ thống tác nhân Multi-LoRA cho phép chuyên môn hóa vai trò hiệu quả bằng cách chia sẻ một mô hình nền tảng chung. Tuy nhiên, mỗi tác nhân liên tục xử lý quỹ đạo chia sẻ ngày càng tăng và tự xây dựng bộ nhớ đệm KV (KV cache) riêng, dẫn đến sự dư thừa đáng kể về bộ nhớ và tính toán trong các tác vụ dài hạn. Các phương pháp chia sẻ KV cache hiện có giúp giảm bớt quá trình tiền nạp (prefill) lặp lại này, nhưng chúng hoặc yêu cầu đào tạo bổ sung, hoặc bị hạn chế về kiến trúc, hoặc vẫn giữ lại khối lượng tính toán mô hình đáng kể. Hơn nữa, việc tái sử dụng cache trực tiếp khiến tác nhân hiện tại phụ thuộc vào các trạng thái cache được tạo bởi adapter của tác nhân trước đó, làm suy yếu hành vi đặc thù vai trò được mã hóa bởi chính LoRA của nó. Chúng tôi giới thiệu PReCache, một khung chia sẻ KV cache không cần đào tạo với hai thiết kế là PreLRShared và ReBaseShared, giúp chia sẻ cache cơ sở được tính toán bằng trọng số tiền huấn luyện và tính toán trước một cache hạng thấp (low-rank - LR) nhỏ gọn dành riêng cho từng tác nhân. Để loại bỏ tiền nạp lặp lại, PreLRShared tính toán trước cache LR của mỗi tác nhân khi ngữ cảnh chia sẻ được xử lý lần đầu, cho phép tác nhân hiện tại sử dụng cache LR của riêng mình mà không cần xử lý lại ngữ cảnh đã được các tác nhân trước đó xử lý. Để cải thiện độ chính xác khi chia sẻ, ReBaseShared tái tạo cache cơ sở chia sẻ từ các trạng thái ẩn không chứa adapter, giảm sai số còn lại do biểu diễn đã thích nghi của tác nhân trước đó gây ra. Để giảm thiểu chi phí tái tạo, chúng tôi đề xuất hai lược đồ suy luận được thiết kế riêng cho suy luận luồng đơn và phục vụ đồng thời, thực hiện tái tạo tương ứng sau mỗi lượt của tác nhân hoặc song song với quá trình thực thi của nó. Trên nhiều mô hình và điểm chuẩn tác nhân, PreLRShared đạt tốc độ TTFT nhanh hơn tới 3,1 lần và cải thiện 2,3 lần thông lượng trên mỗi yêu cầu so với suy luận không chia sẻ KV cache. ReBaseShared bảo toàn độ chính xác tổng thể tốt nhất trong số các phương pháp chia sẻ cache được đánh giá, với mức giảm trung bình chỉ 1,1 điểm so với suy luận không chia sẻ cache.

| Bình luận: | 24 trang, 8 hình, 13 bảng |
| --- | --- |
| Chủ đề: | Học máy (cs.LG) |
| Trích dẫn là: | arXiv:2609.34054 [cs.LG] |
|  | (hoặc arXiv:2609.34054v1 [cs.LG] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.34054 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Hyesung Jeon [xem email](https://arxiv.org/show-email/576810f6/2609.34054)] [v1] Thứ Hai, 28 tháng 9 năm 2026 00:24:14 UTC (5.031 KB)
