# WaveFront Decoding: Tăng tốc suy luận cho các mô hình ngôn ngữ dạng vòng lặp

- Nguồn: Hugging Face Daily Papers
- Thời gian phát hành: 2026-09-29 07:00 (giờ Việt Nam)
- Điểm AI: 85/100
- Link AIHOT.vn: https://aihot.vn/items/051308571b5f6cdf
- Link gốc: https://arxiv.org/abs/2609.23033

## Tóm tắt AI

WaveFront Decoding (WFD) là phương pháp suy luận tự dự đoán giúp tối ưu hóa độ trễ cho các mô hình ngôn ngữ sử dụng trọng số chia sẻ (looped language models) bằng cách xử lý song song các trạng thái ở nhiều độ sâu khác nhau.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.23033) [HTML (thử nghiệm)](https://arxiv.org/html/2609.23033v2)

> Tóm tắt: Các mô hình ngôn ngữ dạng vòng lặp (looped language models) áp dụng lặp đi lặp lại một khối chia sẻ trọng số để tăng độ sâu hiệu dụng mà không làm tăng số lượng tham số, nhưng việc thực hiện T lệnh gọi khối tái quy (recurrent-block) tuần tự cho mỗi token được tạo ra sẽ làm tăng đáng kể độ trễ giải mã. Để giải quyết vấn đề này, chúng tôi giới thiệu Wavefront Decoding (WFD), một khung giải mã tự suy đoán (self-speculative decoding) không cần huấn luyện, được thiết kế cho các mô hình ngôn ngữ dạng vòng lặp. WFD khai thác hai đặc tính của các kiến trúc này: các đầu ra tái quy trung gian cung cấp các dự đoán nháp hiệu quả, và việc chia sẻ trọng số cho phép các trạng thái token ở các vị trí và độ sâu tái quy khác nhau được xử lý trong một lệnh gọi khối tái quy theo lô. WFD tổ chức các trạng thái có độ sâu hỗn hợp này thành một dạng sóng chéo (diagonal wavefront), liên tục tạo nháp các vị trí mới ở độ sâu nông trong khi thúc đẩy các vị trí trước đó tiến tới xác thực ở độ sâu đầy đủ. Không giống như lịch trình tách biệt giai đoạn "tạo nháp rồi xác thực", WFD thực hiện đồng thời việc tạo nháp và xác thực theo lô trong cùng các lệnh gọi tái quy, trong khi các bản nháp bị từ chối sẽ được sửa lỗi bằng các dự đoán ở độ sâu đầy đủ. Trên sáu danh mục tác vụ của Spec-Bench, WFD đạt tốc độ nhanh gấp 2,42 lần trên Ouro-2.6B và 3,54 lần trên Huginn-3.5B so với giải mã tự hồi quy, liên tục vượt trội hơn phương pháp tạo nháp rồi xác thực. Việc chia sẻ KV giữa các lần tái quy giúp giảm lưu lượng KV của dạng sóng và tăng tốc độ của WFD lên gấp 4,81 lần trên Huginn-3.5B. Mã nguồn có sẵn tại [đường dẫn https này](https://github.com/summerbro-hhj/wavefront-decoding).

| Bình luận: | 18 trang, 7 hình, 8 bảng |
| --- | --- |
| Chủ đề: | Học máy (cs.LG) |
| Trích dẫn là: | arXiv:2609.23033 [cs.LG] |
|  | (hoặc arXiv:2609.23033v2 [cs.LG] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.23033 DOI do arXiv cấp thông qua DataCite |

### Lịch sử gửi bài

Từ: Hyeongju Ha [xem email](https://arxiv.org/show-email/700c0286/2609.23033)] [v1](https://arxiv.org/abs/2609.23033v1) Thứ Bảy, 19 tháng 9 năm 2026 14:08:07 UTC (475 KB) [v2] Thứ Bảy, 26 tháng 9 năm 2026 09:59:28 UTC (499 KB)
