Nghiên cứu
Tối ưu hóa suy luận cho mô hình ngôn ngữ dạng vòng lặp với kỹ thuật Continuous Depth Batching
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu giới thiệu phương pháp Continuous Depth Batching (CDB) giúp giải quyết vấn đề hiệu suất khi xử lý các token có độ khó khác nhau trong mô hình ngôn ngữ dạng vòng lặp, cho phép tối ưu hóa tài nguyên tính toán một cách linh hoạt.
Chính văn · Bản dịch AI
Tóm tắt: Một lời hứa hẹn chính của các mô hình ngôn ngữ dạng vòng lặp (looped language models) là suy luận thích ứng theo độ sâu (depth-adaptive inference). Bằng cách lặp lại một khối các lớp chia sẻ với số lần thay đổi, mô hình có thể sử dụng ít tài nguyên tính toán hơn cho các token "dễ" và nhiều hơn cho các token "khó". Tuy nhiên, các token với số vòng lặp khác nhau không thể chia sẻ một lượt truyền xuôi (forward pass) đồng nhất và do đó không thể được xử lý bởi các hệ thống batching tiêu chuẩn như vLLM. Giá trị thực tiễn của suy luận thích ứng theo độ sâu vì thế phụ thuộc vào việc liệu batching có thể được thực hiện hiệu quả hay không. Chúng tôi giới thiệu phương pháp hiệu quả đầu tiên cho các LM dạng vòng lặp thích ứng theo độ sâu thông qua continuous depth batching (CDB), giúp hình thành các batch mới giữa các bước lặp. Phương pháp của chúng tôi lập lịch động các phần có vòng lặp và không có vòng lặp của kiến trúc, quản lý KV-caching dạng vòng lặp, và dự đoán trước token nào sẽ thoát khỏi vòng lặp để chuẩn bị batch một cách bất đồng bộ. Các thử nghiệm trên Ouro 1.4B và Huginn 3.5B cho thấy các kiến trúc hoàn toàn dạng vòng lặp phù hợp nhất với suy luận thích ứng theo độ sâu, vì các lớp lớn không có vòng lặp nằm ngoài lõi tái phát (ví dụ: token embedding, LM head, và các khối transformer không chia sẻ) làm chậm và phức tạp hóa việc lập lịch. Nhìn chung, CDB đạt tới 99% mức tăng tốc tối đa ước tính, các cải thiện tiếp theo chủ yếu phụ thuộc vào kiến trúc mô hình và hành vi thoát vòng lặp.
| Bình luận: | v2: thêm các thử nghiệm và chi tiết |
| Chủ đề: | Học máy (cs.LG); Tính toán và Ngôn ngữ (cs.CL); Tính toán Phân tán, Song song và Cụm (cs.DC) |
| Trích dẫn là: | arXiv:2608.09444 [cs.LG] |
| (hoặc arXiv:2608.09444v2 [cs.LG] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2608.09444 DOI do arXiv cấp thông qua DataCite |
Lịch sử gửi bài
Từ: Kristian Schwethelm [xem email] v1 Thứ Hai, 10 tháng 8 năm 2026 11:20:14 UTC (1,766 KB) [v2] Thứ Sáu, 25 tháng 9 năm 2026 14:52:02 UTC (765 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.