Nghiên cứu
MOPD-Router: Tối ưu hóa điều phối giáo viên trong chưng cất mô hình On-Policy
(giờ Việt Nam)
Tóm tắt AI
MOPD-Router là khung làm việc mới giúp điều phối tín hiệu từ nhiều mô hình giáo viên tại từng token mà không cần nhãn miền, kết hợp với phương pháp ExpertAlign để chọn lọc tri thức chuyên sâu hiệu quả hơn cho mô hình học sinh.
Chính văn · Bản dịch AI
Tác giả: Tianze Xu, Yanzhao Zheng, Zhentao Zhang, Yuanqiang Yu, Chao Ma, Jihuai Zhu, Lelun Wu, Lyumanshan Ye, Pengfei Liu, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu
Tóm tắt: Chưng cất on-policy đa giáo viên (MOPD) tích hợp các khả năng chuyên biệt vào một mô hình học sinh duy nhất, nhưng thực tế hiện nay thường định tuyến cứng mỗi prompt đến một giáo viên phù hợp với lĩnh vực cho toàn bộ quá trình rollout. Sự phụ thuộc vào nhãn lĩnh vực ở cấp độ prompt này hạn chế việc sử dụng các tập dữ liệu huấn luyện không nhãn và bỏ lỡ các tín hiệu bổ trợ từ những giáo viên khác. Chúng tôi giới thiệu MOPD-Router, một khung làm việc định tuyến sự giám sát trên toàn bộ nhóm giáo viên tại mỗi token mà không cần nhãn lĩnh vực hay việc huấn luyện một mô hình định tuyến riêng biệt. Giao diện plug-in của nó hỗ trợ các số liệu khác nhau để lựa chọn và gán trọng số cho các tín hiệu OPD từ giáo viên. Trong giao diện này, chúng tôi đề xuất ExpertAlign, phương pháp chấm điểm từng giáo viên dựa trên việc liệu sự điều chỉnh của họ đối với học sinh tại token hiện tại có thể hiện chuyên môn mà giáo viên đó đã đạt được trong quá trình hậu huấn luyện hay không, đồng thời so sánh nó với hai số liệu tham chiếu dựa trên độ tin cậy của giáo viên (Entropy) và sự khác biệt giữa giáo viên-học sinh (Novelty). Các thử nghiệm trên các tập dữ liệu huấn luyện có nhãn và không nhãn lĩnh vực trong các kịch bản chưng cất từ mạnh đến yếu và cùng kích thước cho thấy ExpertAlign đạt hiệu suất tổng thể tốt nhất trong cả bốn thiết lập. Trên dữ liệu không nhãn, nó cải thiện điểm số tổng thể thêm 5,88 (+12,3%) điểm so với phương pháp tổng hợp Mean; trên dữ liệu có nhãn lĩnh vực, nó vượt trội hơn MOPD tiêu chuẩn 3,95 (+7,8%) điểm mà không cần sử dụng các nhãn lĩnh vực có sẵn. Những kết quả này chứng minh rằng việc định tuyến ở cấp độ token có thể khai thác sự giám sát bổ trợ liên lĩnh vực và giảm bớt sự phụ thuộc độc quyền vào việc gán lĩnh vực ở cấp độ prompt. Mã nguồn có sẵn tại: đường dẫn https này.
| Bình luận: | 19 trang, 5 hình ảnh |
| Chủ đề: | Học máy (cs.LG); Trí tuệ nhân tạo (cs.AI) |
| Trích dẫn là: | arXiv:2609.30837 [cs.LG] |
| (hoặc arXiv:2609.30837v1 [cs.LG] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.30837 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Tianze Xu [xem email] [v1] Thứ Sáu, 25 tháng 9 năm 2026 05:32:03 UTC (1.284 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.