Hugging Face Daily Papers
85

Nghiên cứu

Grouped Value Attention: Tối ưu hóa bộ nhớ KV Cache bằng kỹ thuật tái tạo khóa theo yêu cầu

(giờ Việt Nam)

Tóm tắt AI

GVA là phương pháp mới giúp giảm 45-47% dung lượng bộ nhớ KV cache bằng cách tái tạo khóa nội dung thông qua ánh xạ tuyến tính, thay vì lưu trữ toàn bộ, giúp tăng hiệu suất giải mã cho các mô hình Transformer.

Bản dịch AI

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite

Lịch sử gửi bài

Từ: Vishesh Tripathi [xem email] [v1] Thứ Ba, ngày 8 tháng 9 năm 2026 17:58:44 UTC (10.184 KB)

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.