Hugging Face Daily Papers
Điểm AI 85/100

Nghiên cứu

Vượt xa phân bổ giáo viên: Kỹ thuật chưng cất đa mô hình theo miền (Domain-Normalized MOPD)

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu giới thiệu phương pháp Domain-Normalized MOPD nhằm khắc phục sự mất cân bằng phản hồi khi hợp nhất các mô hình chuyên gia vào một mô hình Qwen3.5 duy nhất, giúp tối ưu hóa khả năng học đa kỹ năng.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

Tóm tắt: Học tăng cường (reinforcement learning) có thể biến một mô hình ngôn ngữ thành nhiều chuyên gia, mỗi chuyên gia xuất sắc trong một kỹ năng đơn lẻ như toán học, lập trình hoặc tuân thủ chỉ dẫn, nhưng người dùng lại cần một mô hình sở hữu tất cả các kỹ năng này. Phương pháp chưng cất on-policy đa giáo viên (Multi-teacher on-policy distillation - MOPD) hợp nhất chúng bằng cách để các chuyên gia dạy cho một học viên: học viên trả lời từng câu lệnh (prompt), và chuyên gia thuộc lĩnh vực của câu lệnh đó sẽ đưa ra phản hồi cho từng token. Cơ chế định tuyến này quyết định chuyên gia nào sẽ giảng dạy, nhưng không quyết định mức độ ảnh hưởng của phản hồi đó đến học viên chung. Trên các mô hình Qwen3.5 với ba kích thước khác nhau, chúng tôi nhận thấy học viên của MOPD không vượt qua được học viên được dạy bởi chuyên gia đơn lẻ tốt nhất và thu được rất ít lợi thế từ chuyên gia toán học. Phản hồi bị mất cân bằng: phản hồi về tuân thủ chỉ dẫn có độ phân tán lớn hơn gấp nhiều lần so với phản hồi toán học và chiếm ưu thế trong việc cập nhật học viên. Chúng tôi đề xuất Domain-Normalized MOPD (DN-MOPD), phương pháp giữ nguyên cơ chế định tuyến và chuẩn hóa lại phản hồi của từng lĩnh vực dựa trên độ phân tán đo được. Trên sáu bộ tiêu chuẩn đánh giá công khai, DN-MOPD cải thiện điểm số trung bình so với MOPD ở mọi kích thước, trên ba hạt giống ngẫu nhiên (random seeds) và dưới hai giới hạn độ dài câu trả lời, đồng thời khôi phục phần lớn lợi thế toán học đã mất. Các kiểm soát với trọng số lĩnh vực cố định cho thấy lợi ích chủ yếu đến từ việc giảm bớt phản hồi tuân thủ chỉ dẫn thay vì chỉ tăng cường phản hồi toán học, và các trọng số cố định gần với giá trị mà DN-MOPD đo được cũng mang lại hiệu suất tương đương. Do đó, việc kết hợp các chuyên gia đòi hỏi không chỉ quyết định ai là người dạy, mà còn phải quyết định mức độ ảnh hưởng của phản hồi đó.

Bình luận:Trang dự án: this https URL. Mã nguồn: this https URL
Chủ đề:Học máy (cs.LG)
Trích dẫn là:arXiv:2609.35347 [cs.LG]
(hoặc arXiv:2609.35347v1 [cs.LG] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.35347 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Xin Li [xem email] [v1] Thứ Hai, 28 tháng 9 năm 2026 15:01:25 UTC (638 KB)

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Vượt xa phân bổ giáo viên: Kỹ thuật chưng cất đa mô hình theo miền (Domain-Normalized MOPD) | AIHOT.vn