# Disaggregated Quantization: Tối ưu hóa riêng biệt cho giai đoạn Prefill và Decode của LLM

- Nguồn: Hugging Face Daily Papers
- Thời gian phát hành: 2026-09-28 07:00 (giờ Việt Nam)
- Điểm AI: 88/100
- Nhãn AIHOT: Tinh chọn
- Link AIHOT.vn: https://aihot.vn/items/9133c01e3d3315ab
- Link gốc: https://arxiv.org/abs/2609.26333

## Lý do tinh chọn

Đây là một nghiên cứu kỹ thuật chuyên sâu, giải quyết trực tiếp bài toán tối ưu hóa hiệu năng LLM đang được cộng đồng AI quan tâm, có số liệu thực nghiệm rõ ràng.

## Tóm tắt AI

Nghiên cứu đề xuất phương pháp Disaggregated Quantization (DQ) giúp tối ưu hóa định dạng tính toán và trọng số riêng biệt cho giai đoạn xử lý prompt (prefill) và tạo văn bản (decode), giúp cải thiện độ chính xác và tốc độ trên các mô hình như Qwen 3 và Gemma 3.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.26333) [HTML (thử nghiệm)](https://arxiv.org/html/2609.26333v1)

> Tóm tắt: Prefill và decode đòi hỏi các phương pháp lượng tử hóa khác nhau: số học độ chính xác thấp giúp tăng tốc xử lý prompt, trong khi trọng số nhỏ gọn giúp giảm lưu lượng bộ nhớ trong quá trình tạo văn bản. Chúng tôi đề xuất "lượng tử hóa phân tách" (disaggregated quantization - DQ), chuyên biệt hóa các định dạng tính toán, trọng số và vị trí lưu trữ cho cả hai giai đoạn này. Trên Qwen 3 và Gemma 3, việc loại bỏ lượng tử hóa kích hoạt (activation quantization) cụ thể trong giai đoạn decode giúp cải thiện độ chính xác cho các tác vụ nặng về decode mà không làm tăng chi phí suy luận. Việc huấn luyện các trọng số prefill gốc (compute-native) riêng biệt giúp tăng tốc xử lý prompt so với suy luận chỉ dùng trọng số (weight-only), đồng thời đạt hoặc vượt độ chính xác của nó ở mức 2-3 bit decode trên cả các tác vụ nặng về decode và prefill. Với các bộ giải mã Qwen3.8-27B GGUF đã phát hành, việc huấn luyện một bộ prefiller NVFP4 giúp cải thiện độ chính xác 1-bit thêm 32,5 điểm trên MMLU-Pro và 35,3 điểm trên MMMU-Pro mà không cần sửa đổi checkpoint decode. Để chứa thêm checkpoint bổ sung trên một thiết bị duy nhất, kỹ thuật offloaded disaggregated prefill (ODP) sẽ truyền tải trọng số từ SSD, phân bổ thời gian tải theo độ dài prompt. Trên cùng mô hình 27B, ODP mang lại tốc độ time-to-first-token nhanh gấp 1,78 lần so với baseline weight-only ở độ dài prompt 8K trong [đường dẫn http này](http://llama.cpp/). Chúng tôi đánh giá độ chính xác dưới cơ chế phục vụ phân tách trong vLLM và xác thực thêm việc phân tách định dạng trọng số chia sẻ thông qua lượng tử hóa hậu huấn luyện trên các mô hình lên tới 2,8 nghìn tỷ tham số.

| Chủ đề: | Học máy (cs.LG) |
| --- | --- |
| Trích dẫn là: | arXiv:2609.26333 [cs.LG] |
|  | (hoặc arXiv:2609.26333v1 [cs.LG] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.26333 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Andrei Panferov [xem email](https://arxiv.org/show-email/d3e0cdf5/2609.26333)] [v1] Thứ Ba, 22 tháng 9 năm 2026 12:44:16 UTC (746 KB)
