Nghiên cứu
Giải mã kiến trúc Qwen3.8-Next: Đột phá về hiệu suất và độ ổn định huấn luyện
(giờ Việt Nam)
Tóm tắt AI
Bài báo giới thiệu Qwen3.8-Flash-Next, mô hình MoE thưa thớt với 125B tham số (kích hoạt 6B mỗi token) cùng bảng nhúng n-gram 51B đặt ngoài bộ tăng tốc giúp tối ưu hóa hiệu năng.
Bản dịch AI
Tác giả: Zihan Qiu, Zekun Wang, Xiao Li, Yanpeng Li, Yang Xu, Yixuan Wang, Huaqing Zhang, Rui Men, Bochao Mao, Chengruidong Zhang, Fan Zhou, Hao Luo, Haofeng Huang, Haoran Lian, Haoyan Huang, Hongqing Chen, Jianwei Zhang, Jing Xu, Junjie Wang, Langshi Chen, Liangyu Wang, Linlang Jiang, Man Yuan, Minmin Sun, Peng Jin, Siqi Zhang, Siyu Wang, Xingzhang Ren, Yakai Wang, Yi Zhang, Yiming Dong, Yizhong Cao, Yubo Ma, Yunfei Mao, Bo Zheng, Dayiheng Liu
Xem PDF HTML (thử nghiệm)
DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)
Lịch sử gửi bài
Từ: Zihan Qiu [xem email] [v1] Thứ Hai, 31 tháng 8 năm 2026 06:35:07 UTC (1.739 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (Nổi bậtBài nghiên cứu). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.