Nghiên cứu
Grouped Value Attention: Tối ưu hóa bộ nhớ KV Cache bằng kỹ thuật tái tạo khóa theo yêu cầu
(giờ Việt Nam)
Tóm tắt AI
GVA là phương pháp mới giúp giảm 45-47% dung lượng bộ nhớ KV cache bằng cách tái tạo khóa nội dung thông qua ánh xạ tuyến tính, thay vì lưu trữ toàn bộ, giúp tăng hiệu suất giải mã cho các mô hình Transformer.
Bản dịch AI
Xem PDF HTML (thử nghiệm)
DOI do arXiv cấp thông qua DataCite
Lịch sử gửi bài
Từ: Vishesh Tripathi [xem email] [v1] Thứ Ba, ngày 8 tháng 9 năm 2026 17:58:44 UTC (10.184 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.