Nghiên cứu
LLaDA MoE v2: Khám phá quy luật mở rộng mô hình ngôn ngữ khuếch tán dạng chuyên gia (MoE)
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu chỉ ra sự khác biệt trong quy luật mở rộng của mô hình MoE khuếch tán so với mô hình tự hồi quy. LLaDA MoE v2 đạt hiệu suất vượt trội, tiệm cận Qwen3 với ít dữ liệu hơn và đánh bại SDAR Chat trong nhiều bài kiểm tra lập trình, suy luận.
Bản dịch AI
Tác giả: Fengqi Zhu, Shaoxuan Xu, Jingyang Ou, Zebin You, Yipeng Xing, Huabin Liu, Xiaolu Zhang, Jun Zhou, Zhenzhong Lan, Yankai Lin, Wayne Xin Zhao, Jianguo Li, Chongxuan Li, Ji-Rong Wen
Xem PDF HTML (thử nghiệm)
DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)
Lịch sử gửi bài
Từ: Fengqi Zhu [xem email] [v1] Thứ Ba, 4 tháng 8 năm 2026 10:53:02 UTC (532 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (Nổi bậtBài nghiên cứu). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.