NLP@dongxi_nlp
85

Tin ngành

Tại sao KV Cache trong LLM lại lưu trữ K và V mà bỏ qua Q?

(giờ Việt Nam)

Tóm tắt AI

Bài viết giải thích cơ chế KV Cache trong suy luận LLM: K và V của các token trước được lưu lại để tái sử dụng, trong khi Q chỉ dùng cho vị trí hiện tại nên không cần lưu trữ.

LLMKV CacheTối ưu hóaSuy luận AIKiến trúc Transformer
Xem nguyên văn trên X

Bài viết được AI dịch và tổng hợp tự động từ X: NLP (@dongxi_nlp). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.