Nghiên cứu
Flash-dLLM: Tối ưu hóa bộ nhớ và giải mã song song cho các mô hình ngôn ngữ khuếch tán (dLLM)
(giờ Việt Nam)
Tóm tắt AI
Flash-dLLM là khung tăng tốc suy luận không cần huấn luyện, giúp giải quyết nút thắt I/O bộ nhớ GPU thông qua kỹ thuật KV-cache hợp nhất, từ đó cải thiện đáng kể tốc độ và hiệu quả bộ nhớ cho các mô hình dLLM.
Bản dịch AI
Xem PDF HTML (thử nghiệm)
DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)
Lịch sử gửi bài
Từ: Quan Nguyen-Tri [xem email] [v1] Thứ Ba, 22 tháng 9 năm 2026 17:59:57 UTC (445 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.