MarkTechPost
Điểm AI 70/100

Mô hình

Alibaba ra mắt Qwen3.8-Flash-Next: Mô hình MoE đa phương thức 125B với hiệu suất cực cao

(giờ Việt Nam)

Tóm tắt AI

Đội ngũ Qwen của Alibaba vừa giới thiệu Qwen3.8-Flash-Next, mô hình MoE đa phương thức 125B chỉ kích hoạt 6B tham số mỗi token, đóng vai trò là bản xem trước cho kiến trúc Qwen4 thế hệ mới.

Chính văn · Bản dịch AI

Alibaba’s Qwen Team Releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture

Đội ngũ Qwen của Alibaba vừa phát hành Qwen3.8-Flash-Next, một mô hình đa phương thức Mixture-of-Experts (MoE) với trọng số mở, được tối ưu hóa cho chi phí trên mỗi token. Checkpoint này kết hợp một backbone 125B với bảng nhúng N-gram 51B và mô-đun dự đoán đa token 4B. Chỉ có 6B tham số được kích hoạt trên mỗi token. Đội ngũ phát triển định vị đây là bản xem trước sớm của kiến trúc sẽ làm nền tảng cho Qwen4, tương tự vai trò của Qwen3-Next đối với Qwen3.5. Bản phát hành này mang đến bốn thay đổi: Gated DeltaNet kết hợp với Qwen Sparse Attention, Gated Residual, N-gram Embedding và trình tối ưu hóa Muon. Đội ngũ Qwen báo cáo chi phí huấn luyện chỉ bằng khoảng 1/9 so với Qwen3.7-Plus.

Liệu mô hình có thể triển khai được không?

Có, nhưng không phải trên máy trạm thông thường. Checkpoint FP8 có dung lượng 172,78 GiB và checkpoint BF16 là 335,28 GiB. Theo các công thức của vLLM, TP2 là cấu hình FP8 tối thiểu được xác thực trên GB300 và khuyến nghị sử dụng TP4. Trên node 8×H200, hãy sử dụng TEP8; TP8 thông thường không tương thích với các khối lượng tử hóa 128-wide của checkpoint này. Kích hoạt thưa (sparse activation) giúp giảm tính toán, không giảm dung lượng lưu trữ.

Những điểm mới thực sự

Qwen3.8-Flash-Next kết hợp mô hình chính 125B với 51B tham số nhúng N-gram và mô-đun dự đoán đa token 4B, tổng cộng là 180B trên ổ cứng. Chỉ 6B tham số được kích hoạt trên mỗi token. Bốn thay đổi thúc đẩy điều này bao gồm:

Lớp MoE chứa 512 chuyên gia (experts), kích hoạt 10 chuyên gia định tuyến cộng với 1 chuyên gia dùng chung, với chiều trung gian của chuyên gia là 640.

Điểm chuẩn (Benchmarks)

Qwen báo cáo đạt 58,7 điểm trên DeepSWE 1.1, 62,5 trên SWE-bench Pro, 81,0 trên SWE-bench Multilingual và 91,9 trên LiveCodeBench v6. Đối với các tác vụ đại lý (agentic tasks), mô hình đạt 73,9 trên CoWorkBench, 55,7 trên JobBench và 73,5 trên Toolathlon Verified. Kết quả đa phương thức bao gồm 84,5 trên AndroidWorld, 76,6 trên LVBench, 88,5 trên RealWorldQA và 95,7 trên MathVision với trình thông dịch mã (code interpreter).

Mô hình không dẫn đầu ở mọi mặt. Claude Opus 4.6 (Max) đạt 40,0 điểm HLE so với 35,9 của Qwen, và DeepSeek-V4-Flash-0731 dẫn đầu NL2Repo-Bench với 54,2 so với 48,1. Khả năng suy luận tiên phong vẫn là khoảng cách cần thu hẹp.

Hiệu suất

Qwen tuyên bố chi phí huấn luyện bằng khoảng 1/9 so với Qwen3.7-Plus. Về khả năng phục vụ, thông báo trích dẫn tốc độ kernel QSA tăng tới 7,6 lần cho prefill và 4,9 lần cho decode ở mức 1 triệu token, trong khi tài liệu SGLang và vLLM trích dẫn con số lần lượt là 10,2 lần và 6,6 lần. Hãy coi các phạm vi này là số liệu do nhà cung cấp báo cáo cho đến khi có đo lường độc lập. Qwen cũng báo cáo thông lượng prefill gấp 8,6 lần so với Qwen3.7-Plus ở tỷ lệ hit prefix-cache 90%.

Ngữ cảnh mặc định là 262.144 token, có thể mở rộng lên 1.000.000 token với YaRN.

Cách vận hành

Mô hình phục vụ thông qua vLLM, SGLang, TokenSpeed, transformers serve và llama.cpp cho các bản lượng tử hóa GGUF. Việc tinh chỉnh (fine-tuning) được hỗ trợ thông qua Unsloth, Swift và LLaMA-Factory. Nó đã cung cấp năng lượng cho chế độ “Standard” trên QwenWork và hoạt động với Qwen Code.

Chế độ suy nghĩ (Thinking mode) được bật theo mặc định, với reasoning_effort ở mức xhigh, medium hoặc low. Qwen khuyến nghị temperature 1.0 và top_p 0.95 cho chế độ suy nghĩ, và temperature 0.7 với top_p 0.80 cho chế độ instruct.

Những điểm chính cần lưu ý

Hãy xem qua trang GitHub, HF Model Card và Technical Details. Ngoài ra, hãy theo dõi chúng tôi trên Twitter, đừng quên tham gia SubReddit ML 150k+ của chúng tôi và đăng ký nhận bản tin (Newsletter). Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo độc giả. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với công chúng.

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Xem toàn bộ
Alibaba Qwen ra mắt Qwen3.8-Flash-Next
Alibaba ra mắt Qwen3.8-Flash-Next: Mô hình MoE đa phương thức 125B với hiệu suất cực cao | AIHOT.vn