# MOPD-Router: Tối ưu hóa điều phối giáo viên trong chưng cất mô hình On-Policy

- Nguồn: Hugging Face Daily Papers
- Thời gian phát hành: 2026-09-28 07:00 (giờ Việt Nam)
- Điểm AI: 85/100
- Link AIHOT.vn: https://aihot.vn/items/e0a766b8e0e275f3
- Link gốc: https://arxiv.org/abs/2609.30837

## Tóm tắt AI

MOPD-Router là khung làm việc mới giúp điều phối tín hiệu từ nhiều mô hình giáo viên tại từng token mà không cần nhãn miền, kết hợp với phương pháp ExpertAlign để chọn lọc tri thức chuyên sâu hiệu quả hơn cho mô hình học sinh.

## Thân bài

Tác giả: [Tianze Xu](https://arxiv.org/search/cs?searchtype=author&query=Xu,+T), [Yanzhao Zheng](https://arxiv.org/search/cs?searchtype=author&query=Zheng,+Y), [Zhentao Zhang](https://arxiv.org/search/cs?searchtype=author&query=Zhang,+Z), [Yuanqiang Yu](https://arxiv.org/search/cs?searchtype=author&query=Yu,+Y), [Chao Ma](https://arxiv.org/search/cs?searchtype=author&query=Ma,+C), [Jihuai Zhu](https://arxiv.org/search/cs?searchtype=author&query=Zhu,+J), [Lelun Wu](https://arxiv.org/search/cs?searchtype=author&query=Wu,+L), [Lyumanshan Ye](https://arxiv.org/search/cs?searchtype=author&query=Ye,+L), [Pengfei Liu](https://arxiv.org/search/cs?searchtype=author&query=Liu,+P), [Baohua Dong](https://arxiv.org/search/cs?searchtype=author&query=Dong,+B), [Hangcheng Zhu](https://arxiv.org/search/cs?searchtype=author&query=Zhu,+H), [Ruohui Huang](https://arxiv.org/search/cs?searchtype=author&query=Huang,+R), [Gang Yu](https://arxiv.org/search/cs?searchtype=author&query=Yu,+G)

[Xem PDF](https://arxiv.org/pdf/2609.30837) [HTML (thử nghiệm)](https://arxiv.org/html/2609.30837v1)

> Tóm tắt: Chưng cất on-policy đa giáo viên (MOPD) tích hợp các khả năng chuyên biệt vào một mô hình học sinh duy nhất, nhưng thực tế hiện nay thường định tuyến cứng mỗi prompt đến một giáo viên phù hợp với lĩnh vực cho toàn bộ quá trình rollout. Sự phụ thuộc vào nhãn lĩnh vực ở cấp độ prompt này hạn chế việc sử dụng các tập dữ liệu huấn luyện không nhãn và bỏ lỡ các tín hiệu bổ trợ từ những giáo viên khác. Chúng tôi giới thiệu MOPD-Router, một khung làm việc định tuyến sự giám sát trên toàn bộ nhóm giáo viên tại mỗi token mà không cần nhãn lĩnh vực hay việc huấn luyện một mô hình định tuyến riêng biệt. Giao diện plug-in của nó hỗ trợ các số liệu khác nhau để lựa chọn và gán trọng số cho các tín hiệu OPD từ giáo viên. Trong giao diện này, chúng tôi đề xuất ExpertAlign, phương pháp chấm điểm từng giáo viên dựa trên việc liệu sự điều chỉnh của họ đối với học sinh tại token hiện tại có thể hiện chuyên môn mà giáo viên đó đã đạt được trong quá trình hậu huấn luyện hay không, đồng thời so sánh nó với hai số liệu tham chiếu dựa trên độ tin cậy của giáo viên (Entropy) và sự khác biệt giữa giáo viên-học sinh (Novelty). Các thử nghiệm trên các tập dữ liệu huấn luyện có nhãn và không nhãn lĩnh vực trong các kịch bản chưng cất từ mạnh đến yếu và cùng kích thước cho thấy ExpertAlign đạt hiệu suất tổng thể tốt nhất trong cả bốn thiết lập. Trên dữ liệu không nhãn, nó cải thiện điểm số tổng thể thêm 5,88 (+12,3%) điểm so với phương pháp tổng hợp Mean; trên dữ liệu có nhãn lĩnh vực, nó vượt trội hơn MOPD tiêu chuẩn 3,95 (+7,8%) điểm mà không cần sử dụng các nhãn lĩnh vực có sẵn. Những kết quả này chứng minh rằng việc định tuyến ở cấp độ token có thể khai thác sự giám sát bổ trợ liên lĩnh vực và giảm bớt sự phụ thuộc độc quyền vào việc gán lĩnh vực ở cấp độ prompt. Mã nguồn có sẵn tại: [đường dẫn https này](https://github.com/TURLEing/MOPD-Router).

| Bình luận: | 19 trang, 5 hình ảnh |
| --- | --- |
| Chủ đề: | Học máy (cs.LG); Trí tuệ nhân tạo (cs.AI) |
| Trích dẫn là: | arXiv:2609.30837 [cs.LG] |
|  | (hoặc arXiv:2609.30837v1 [cs.LG] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.30837 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Tianze Xu [xem email](https://arxiv.org/show-email/355523ef/2609.30837)] [v1] Thứ Sáu, 25 tháng 9 năm 2026 05:32:03 UTC (1.284 KB)
