# LastOPD: Giải quyết hiện tượng sụp đổ mô hình trong chưng cất Latent On-Policy

- Nguồn: Hugging Face Daily Papers
- Thời gian phát hành: 2026-09-28 07:00 (giờ Việt Nam)
- Điểm AI: 85/100
- Link AIHOT.vn: https://aihot.vn/items/b9658c681d1b99df
- Link gốc: https://arxiv.org/abs/2609.28845

## Tóm tắt AI

Nghiên cứu chỉ ra hiện tượng sụp đổ hiệu suất khi chưng cất mô hình Qwen3, nơi việc căn chỉnh trạng thái ẩn (latent) quá mức dẫn đến kết quả tệ hơn. LastOPD đề xuất giải pháp khắc phục sự mất cân bằng này để duy trì độ chính xác khi huấn luyện.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.28845) [HTML (thử nghiệm)](https://arxiv.org/html/2609.28845v1)

> Tóm tắt: On-policy distillation (OPD) điều chỉnh mô hình học viên dựa trên các phản hồi mà nó tạo ra, nhưng tín hiệu của phương pháp này lại là phân phối token tiếp theo của mô hình giáo viên: nó cho học viên biết giáo viên nói gì nhưng lại bỏ lỡ cách giáo viên tư duy. Latent supervision hứa hẹn bù đắp phần thiếu hụt này bằng cách căn chỉnh các trạng thái ẩn (latent states) của học viên với giáo viên. Các phương pháp gần đây như OPRD đã đưa tín hiệu này vào on-policy distillation. Tuy nhiên, chúng tôi quan sát thấy hai thất bại của công thức này khi chưng cất (distilling) Qwen3-4B và Qwen3-8B vào Qwen3-1.7B-Base. Tăng trưởng sớm, sụp đổ muộn: chỉ riêng latent supervision giúp tăng độ chính xác trên MATH-500 từ 25 lên 46 trong 10 bước, nhưng quá trình huấn luyện sau đó làm hiệu suất giảm xuống 11 mà không thể phục hồi. Căn chỉnh tốt hơn, hành vi tệ hơn: mặc dù chỉ số căn chỉnh liên tục cải thiện trong suốt quá trình sụp đổ này, mô hình có độ căn chỉnh cao nhất lại cho hiệu suất kém nhất. Phân tích sâu hơn cho thấy sự không khớp trong cách áp dụng tín hiệu ẩn: các lớp được ghép cặp theo độ sâu đóng vai trò khác nhau trong hai mô hình, vì vậy việc tiếp tục căn chỉnh có thể kéo học viên về phía các trạng thái của giáo viên mà nó không thể hiểu được. Để giải quyết vấn đề này, chúng tôi đề xuất LastOPD, phương pháp chỉ áp dụng tín hiệu ẩn tại trạng thái lớp cuối cùng – giao diện chung mà cả hai LM head đều đọc – và chỉ trong quá trình chuyển đổi 10 bước sang OPD cấp độ token. Điều này giữ lại phần hữu ích của tín hiệu ẩn và chuyển giao học viên sang sự giám sát cấp độ token trước khi sự sụp đổ xảy ra. Các thử nghiệm mở rộng cho thấy LastOPD cải thiện MATH-500 so với OPD chỉ dùng token thêm 5.55 và 4.02 điểm với giáo viên 4B và 8B, dẫn đầu trên hầu hết các tập dữ liệu kiểm chứng (held-out datasets) và đạt được điểm số cuối cùng của OPD chỉ dùng token trong khoảng một nửa số bước. Mã nguồn có sẵn tại [đường dẫn này](https://github.com/Muyiiiii/LastOPD).

| Chủ đề: | Học máy (cs.LG); Tính toán và Ngôn ngữ (cs.CL) |
| --- | --- |
| Trích dẫn là: | arXiv:2609.28845 [cs.LG] |
|  | (hoặc arXiv:2609.28845v1 [cs.LG] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.28845 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Jie Yang [xem email](https://arxiv.org/show-email/70246c37/2609.28845)] [v1] Thứ Tư, 23 tháng 9 năm 2026 23:22:21 UTC (864 KB)
