Nghiên cứu
Công bố báo cáo kỹ thuật Hunyuan-A13B: Mô hình MoE mã nguồn mở với 80B tham số và 13B tham số kích hoạt
(giờ Việt Nam)
Tóm tắt AI
Tencent giới thiệu Hunyuan-A13B, mô hình MoE tối ưu hiệu suất với 80B tham số tổng nhưng chỉ kích hoạt 13B khi suy luận. Điểm nhấn là khung tư duy kép (Chain-of-Thought) giúp cân bằng tốc độ xử lý cho các câu hỏi đơn giản và độ chính xác cho các bài toán phức tạp.
Chính văn · Bản dịch AI
Tác giả: Nhóm Tencent Hunyuan, Ao Liu, Botong Zhou, Can Xu, Chayse Zhou, ChenChen Zhang, Chengcheng Xu, Chenhao Wang, Decheng Wu, Dengpeng Wu, Dian Jiao, Dong Du, Dong Wang, Feng Zhang, Fengzong Lian, Guanghui Xu, Guanwei Zhang, Hai Wang, Haipeng Luo, Han Hu, Huilin Xu, Jiajia Wu, Jianchen Zhu, Jianfeng Yan, Jiaqi Zhu, Jihong Zhang, Jinbao Xue, Jun Xia, Junqiang Zheng, Kai Liu, Kai Zhang, Kai Zheng, Kejiao Li, Keyao Wang, Lan Jiang, Lixin Liu, Lulu Wu, Mengyuan Huang, Peijie Yu, Peiqi Wang, Qian Wang, Qianbiao Xiang, Qibin Liu, Qingfeng Sun, Richard Guo, Ruobing Xie, Saiyong Yang, Shaohua Chen, Shihui Hu, Shuai Li, Shuaipeng Li, Shuang Chen, Suncong Zheng, Tao Yang, Tian Zhang, Tinghao Yu, Weidong Han, Weijie Liu, Weijin Zhou, Weikang Wang, Wesleye Chen, Xiao Feng, Xiaoqin Ren, Xingwu Sun, Xiong Kuang, Xuemeng Huang, Xun Cao, Yanfeng Chen, Yang Du, Zhen Yang, Yangyu Tao, Yaping Deng, Yi Shen, Yigeng Hong, Yiqi Chen
Tóm tắt: Chúng tôi giới thiệu Hunyuan-A13B, một mô hình ngôn ngữ lớn mã nguồn mở dựa trên kiến trúc Mixture-of-Experts. Mô hình chứa tổng cộng 80 tỷ tham số nhưng chỉ kích hoạt 13 tỷ tham số trong quá trình suy luận, giúp cân bằng giữa khả năng của mô hình, hiệu quả tính toán và chi phí triển khai. Mô hình được huấn luyện trước trên tập dữ liệu 20T-token đã qua sàng lọc nghiêm ngặt với việc tăng cường quản lý dữ liệu STEM, giúp cải thiện độ tin cậy về thông tin thực tế và khả năng suy luận. Quá trình tinh chỉnh có giám sát chất lượng cao và học tăng cường quy mô lớn giúp nâng cao hơn nữa hiệu suất tổng thể. Hunyuan-A13B cũng giới thiệu khung Chain-of-Thought chế độ kép giúp điều chỉnh độ sâu suy luận theo độ phức tạp của tác vụ: tư duy nhanh cho các truy vấn thông thường và tư duy chậm cho các vấn đề phức tạp, đa bước. Các đánh giá cho thấy hiệu suất cạnh tranh trong các lĩnh vực toán học, khoa học, lập trình, hiểu ngôn ngữ chung và các tác vụ đại lý, thường tiệm cận với các mô hình lớn hơn nhiều. Thông lượng suy luận cao giúp mô hình phù hợp với các ứng dụng nhạy cảm về độ trễ. Chúng tôi phát hành Hunyuan-A13B nhằm hỗ trợ nghiên cứu mở và triển khai LLM thực tế.
| Chủ đề: | Trí tuệ nhân tạo (cs.AI) |
| Trích dẫn là: | arXiv:2609.27284 [cs.AI] |
| (hoặc arXiv:2609.27284v1 [cs.AI] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.27284 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Peijie Yu [xem email] [v1] Thứ Tư, 23 tháng 9 năm 2026 03:21:24 UTC (176 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.