Nghiên cứu
Sự lệch hướng định tuyến không phải là bằng chứng cho lỗi trong các mô hình MoE hợp nhất
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu chỉ ra rằng việc thay đổi định tuyến chuyên gia sau khi hợp nhất các mô hình MoE thường do sự thay đổi đầu vào thay vì lỗi tham số, thách thức quan điểm cho rằng đây là dấu hiệu của sự cố mô hình.
Chính văn · Bản dịch AI
Tóm tắt: Hợp nhất mô hình (model merging) kết hợp hiệu quả các mô hình ngôn ngữ lớn (LLM) chuyên biệt mà không cần huấn luyện lại đồng thời, nhưng có thể làm thay đổi đáng kể việc định tuyến chuyên gia (expert routing) trong các mô hình Mixture-of-Experts (MoE). Hiện tượng \emph{trôi định tuyến (routing drift)} này thường bị coi là lỗi định tuyến, đặt ra một câu hỏi cơ bản vẫn chưa có lời giải: \emph{liệu trôi định tuyến sau khi hợp nhất MoE có thực sự cho thấy lỗi định tuyến hay không, và bằng chứng nào nên được dùng để biện minh cho việc sửa chữa?} Chúng tôi nghiên cứu các câu hỏi này trên DeepSeekMoE, OLMoE và Qwen3-MoE, đồng thời đề xuất một bộ công cụ phân tích định tuyến cho các can thiệp phản thực tế (counterfactual interventions) có kiểm soát và phân tích ở cấp độ token. Bằng cách đối chiếu đầu vào và tham số của bộ định tuyến nguồn và bộ định tuyến đã hợp nhất, chúng tôi quy phần lớn việc tái phân bổ chuyên gia là do sự thay đổi đầu vào thay vì thay đổi tham số tại cùng một lớp. Tuy nhiên, sự khác biệt về định tuyến so với nguồn dự đoán kém hiệu quả về mức tăng khả năng dự đoán token tiếp theo từ việc khôi phục định tuyến nguồn, và các lựa chọn chuyên gia khác nhau có thể tạo ra các kết quả hỗn hợp tương tự nhau về hướng. Do đó, chúng tôi định nghĩa lỗi định tuyến là \textit{mất mát tác vụ có thể phục hồi dưới một can thiệp định tuyến cụ thể, với các tham số không định tuyến được giữ cố định.} Các thử nghiệm này phát hiện mức mất mát có thể phục hồi khi bộ định tuyến bị làm hỏng có chủ đích, trong khi việc khôi phục định tuyến nguồn không mang lại lợi ích tác vụ đáng tin cậy trong các mô hình hợp nhất được đánh giá. Từ đó, chúng tôi đề xuất \emph{Selective Router Repair (SRR)} như một nghiên cứu điển hình và nhận thấy rằng các lợi thế về khả năng dự đoán token của chuyên gia nguồn không xác định được một cách đáng tin cậy các hiệu chỉnh cục bộ có lợi. Tổng hợp lại, những phát hiện này cho thấy \textbf{chỉ riêng trôi định tuyến là không đủ bằng chứng cho lỗi định tuyến}: các hiệu chỉnh dựa trên nguồn phải được đánh giá bằng hiệu quả can thiệp ở cấp độ tác vụ của chúng. Bộ công cụ phân tích và mã nguồn SRR đã được công bố.
| Chủ đề: | Trí tuệ nhân tạo (cs.AI); Học máy (cs.LG) |
| Trích dẫn là: | arXiv:2609.32821 [cs.AI] |
| (hoặc arXiv:2609.32821v1 [cs.AI] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.32821 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Yuanyi Wang [xem email] [v1] Thứ Bảy, 26 tháng 9 năm 2026 17:47:55 UTC (1.406 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.