Hugging Face Daily Papers
85

Nghiên cứu

Flash-dLLM: Tối ưu hóa bộ nhớ và giải mã song song cho các mô hình ngôn ngữ khuếch tán (dLLM)

(giờ Việt Nam)

Tóm tắt AI

Flash-dLLM là khung tăng tốc suy luận không cần huấn luyện, giúp giải quyết nút thắt I/O bộ nhớ GPU thông qua kỹ thuật KV-cache hợp nhất, từ đó cải thiện đáng kể tốc độ và hiệu quả bộ nhớ cho các mô hình dLLM.

Bản dịch AI

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Quan Nguyen-Tri [xem email] [v1] Thứ Ba, 22 tháng 9 năm 2026 17:59:57 UTC (445 KB)

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Flash-dLLM: Tối ưu hóa bộ nhớ và giải mã song song cho các mô hình ngôn ngữ khuếch tán (dLLM) | AIHOT.vn