Random Attention: Tối ưu hóa KV Cache bằng cơ chế loại bỏ ngẫu nhiên giúp tăng tốc suy luận LLM
Salesforce giới thiệu Random Attention, phương pháp thay thế việc đánh giá token bằng cách loại bỏ ngẫu nhiên trong KV cache. Kỹ thuật này giúp tăng 32-43% lưu lượng xử lý trên vLLM mà vẫn duy trì độ chính xác tương đương các phương pháp tiên tiến nhất.




















