IT Home
Điểm AI 75/100

Mô hình

Alibaba ra mắt Qwen3.8-Flash: Mô hình MoE 125B với chi phí huấn luyện giảm 9 lần

(giờ Việt Nam)

Tóm tắt AI

Alibaba vừa trình làng Qwen3.8-Flash, mô hình MoE 125B với 6B tham số kích hoạt mỗi token, hỗ trợ cửa sổ ngữ cảnh lên tới 262K và mở rộng tối đa 1M token.

Chính văn · Bản dịch AI

Theo tin từ IT ngày 26 tháng 8, đội ngũ Alibaba Qwen tối nay đã chính thức ra mắt Qwen3.8-Flash. Đồng thời, đội ngũ Qwen cũng công bố mã nguồn mở trọng số (weights) của Qwen3.8-Flash-Next, kiến trúc mới của phiên bản Next này sẽ là hình mẫu sơ khai cho dòng mô hình Qwen4 thế hệ mới.

Đây là một mô hình MoE đa phương thức, với tham số mô hình chính là 125B, được trang bị thêm 51B N-gram Embedding, kích hoạt 6B tham số trên mỗi token. Mô hình hỗ trợ gốc ngữ cảnh 262.144 tokens và có thể mở rộng lên 1M tokens thông qua YaRN.

Theo giới thiệu, Qwen3.8-Flash đã được nâng cấp hệ thống xoay quanh bốn phương diện:

Về Attention, mô hình áp dụng kiến trúc hỗn hợp GDN (Gated DeltaNet) + QSA (Qwen Sparse Attention). GDN chịu trách nhiệm nén thông tin lịch sử hiệu quả, trong khi QSA thông qua Indexer hạng nhẹ để sàng lọc ngữ cảnh quan trọng ở mức độ micro-block, giúp giảm đáng kể chi phí Attention cho các chuỗi dài. Đối với ngữ cảnh siêu dài 1M token, Attention Kernel của QSA đạt mức tăng tốc tối đa lần lượt là 7,6 lần ở giai đoạn Prefill và 4,9 lần ở giai đoạn Decode.

Về Residual, mô hình giới thiệu cơ chế Gated Residual (GR), mở rộng luồng dư (residual stream) thành 4 nhánh song song, kiểm soát việc đọc/ghi thông tin thông qua Gate động. Trạng thái dư hỗ trợ lưu trữ FP8, giúp giảm đáng kể chi phí truy cập bộ nhớ.

Về Embedding, mô hình giới thiệu 51B tham số N-gram Embedding, tận dụng tra cứu ngữ cảnh cục bộ để mở rộng dung lượng mô hình. Các tham số này có thể được giải phóng vào Host Memory, thông qua cơ chế Prefetch bất đồng bộ để chồng lấp với quá trình tính toán của mô hình, không chiếm dụng lâu dài VRAM của GPU.

Về Optimization, mô hình sử dụng Muon Optimizer, đồng thời tối ưu hóa các chiến lược như độ chính xác trực giao hóa, phân công tham số và phân tách ma trận hợp nhất. Scaling Law cũng đã được điều chỉnh lại cho kiến trúc mới này.

Hiệu suất và chi phí

So với Qwen3.7-Plus, chi phí huấn luyện của Qwen3.8-Flash chỉ bằng khoảng 1/9, nhưng lại sở hữu năng lực mạnh mẽ hơn trong các tác vụ lập trình và văn phòng.

Với 6B tham số kích hoạt, Qwen3.8-Flash-Next-Base đã đạt kết quả tốt nhất trên 8 trong số 14 benchmark, bao gồm MMLU-Pro, SuperGPQA, BBH, SWEBench-Pretrain, MGSM và MMMU.

Hiệu năng mô hình

Văn bản thuần túy:

Đa phương thức:

Cấu trúc mô hình:

Hiệu năng mô hình Base:

Khả năng khả dụng và định giá

IT được biết từ phía chính thức, Qwen3.8-Flash sắp được đưa lên nền tảng Qwen AI, cung cấp dịch vụ API ra bên ngoài với mức giá 1 Nhân dân tệ cho mỗi triệu Tokens đầu vào và 3 Nhân dân tệ cho đầu ra.

Trọng số mô hình đã được mở nguồn trên các nền tảng Hugging Face và ModelScope vào lúc 23:00 ngày 26 tháng 8 (giờ Bắc Kinh), đồng thời phát hành phiên bản lượng tử hóa FP8. Qwen3.8-Flash-Next hỗ trợ mặc định ngữ cảnh 1M và tích hợp sẵn các công cụ chính thức.

Tài liệu tham khảo:

Báo cáo kỹ thuật: https://github.com/ QwenLM / Qwen3.8-Flash-Next / blob / main / tech_report.pdf

Blog kỹ thuật: https://qwen.ai/ blog?id=qwen3.8-flash-next

Hugging Face: https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next

ModelScope: https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921XAP2dV&file=Qwen3.8-Flash-Next

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Xem toàn bộ
Alibaba Qwen ra mắt Qwen3.8-Flash
Alibaba ra mắt Qwen3.8-Flash: Mô hình MoE 125B với chi phí huấn luyện giảm 9 lần | AIHOT.vn