The Decoder: AI News
88

Mô hình

Alibaba ra mắt Qwen3.8-Flash-Next: Đột phá hiệu suất với chi phí tối ưu

(giờ Việt Nam)

Tóm tắt AI

Alibaba giới thiệu mô hình đa phương thức MoE Qwen3.8-Flash-Next với 125 tỷ tham số nhưng chỉ kích hoạt 6 tỷ mỗi token, tích hợp lớp N-gram 51 tỷ tham số giúp tối ưu hóa khả năng chạy trên bộ nhớ hệ thống.

Bản dịch AI

Đội ngũ Qwen của Alibaba vừa giới thiệu Qwen3.8-Flash-Next, một mô hình đa phương thức hỗn hợp chuyên gia (multimodal mixture-of-experts), đóng vai trò là bản xem trước kiến trúc cho Qwen4. Mô hình này hướng tới mục tiêu đạt hiệu suất ngang ngửa các mô hình lớn hơn nhiều với chi phí huấn luyện chỉ bằng một phần nhỏ.

Mô hình có tổng cộng 125 tỷ tham số nhưng chỉ kích hoạt 6 tỷ tham số trên mỗi token. Nó cũng bao gồm 51 tỷ tham số trong một lớp nhúng N-gram mới, một trong những cải tiến kiến trúc dự kiến sẽ có trên Qwen4. Lớp này lưu trữ các nhóm từ phổ biến dưới dạng các mục riêng biệt trong một loại "từ điển cụm từ" và có thể nằm trong RAM hệ thống thông thường thay vì trên GPU với "chi phí bổ sung tương đối thấp."

Mô hình hỗ trợ cửa sổ ngữ cảnh 262.144 token và có thể mở rộng lên một triệu token bằng cách sử dụng YaRN. Báo cáo kỹ thuật hiện đã có trên GitHub, và trọng số (weights) có sẵn trên Hugging Face và ModelScope. Phiên bản thương mại được phát hành dưới tên Qwen3.8-Flash thông qua QwenCloud, với giá 0,16 USD cho mỗi triệu token đầu vào và 0,47 USD cho mỗi triệu token đầu ra. Theo Qwen, API sẽ sớm được ra mắt.

Chi phí huấn luyện bằng một phần chín, kết quả tốt hơn

Theo đội ngũ Qwen, Qwen3.8-Flash-Next mang lại kết quả tốt hơn Qwen3.7-Plus với chi phí huấn luyện chỉ bằng khoảng một phần chín, trong đó những cải thiện lớn nhất nằm ở các tác vụ lập trình và văn phòng. Qwen3.7-Plus có 397 tỷ tham số với 17 tỷ tham số được kích hoạt trên mỗi token, gần gấp ba lần số lượng tham số kích hoạt của Flash-Next.

Các bài kiểm tra chuẩn (benchmarks) do Alibaba công bố đã đặt mô hình này lên bàn cân so sánh với DeepSeek-V4-Flash (284 tỷ tham số, 13 tỷ kích hoạt) và Claude Opus 4.6 (Max) của Anthropic. Mặc dù cả hai đối thủ đều lớn hơn hoặc đắt đỏ hơn nhiều, Flash-Next vẫn dẫn trước trong phần lớn các tác vụ được thử nghiệm.

Mô hình dường như được tối ưu hóa cho các bài kiểm tra lập trình tác nhân (agentic coding benchmarks), đòi hỏi AI phải tự tìm và sửa lỗi trong các dự án phần mềm thực tế. Flash-Next đạt 58,7 điểm trên DeepSWE và 62,5 điểm trên SWE-bench Pro, vượt qua cả DeepSeek-V4-Flash và Claude Opus 4.6.

Khoảng cách về hiệu suất trong các tác vụ văn phòng và năng suất thậm chí còn lớn hơn. Flash-Next đạt 73,9 điểm trên CoWorkBench trong khi DeepSeek-V4-Flash chỉ đạt 45,1. Trên JobBench, một bài kiểm tra cho các quy trình công việc chuyên nghiệp, Flash-Next đạt 55,7 điểm, gần gấp đôi so với mức 27,6 của Qwen3.7-Plus. Về suy luận khoa học (GPQA Diamond: 91,7) và lập trình thi đấu (LiveCodeBench v6: 91,9), các mô hình có kết quả khá tương đồng.

Claude Opus 4.6 chỉ vượt lên dẫn trước ở Humanity's Last Exam, một bài kiểm tra xoay quanh các vấn đề đa ngành cực kỳ khó, nhưng đây cũng là một mô hình "cũ" của Anthropic từ tháng 2 năm 2026. Như thường lệ, điểm số benchmark và hiệu suất thực tế có thể khác biệt.

Giá cả tiếp tục gây áp lực lên các đối thủ

Alibaba mới chỉ giới thiệu Qwen3.8-Max làm mô hình chủ lực vào đầu tháng 8, cạnh tranh với các tên tuổi như Claude Opus 4.8, Gemini 3.1 Pro và GPT5.6 Sol. Flash-Next hoạt động ngay dưới mức mô hình chủ lực nhưng có chi phí chỉ bằng khoảng một phần mười hai, với chênh lệch giá khoảng 12 lần cho cả token đầu vào và đầu ra.

Mức giá đó tiếp tục gia tăng áp lực lên OpenAI và Anthropic. Qwen3.8-27B gần đây cũng trở nên phổ biến vì có thể chạy cục bộ và mang lại hiệu suất mạnh mẽ với chi phí gần như bằng không, nếu bạn có phần cứng phù hợp. OpenAI gần đây đã phản ứng bằng cách giảm giá mạnh cho dòng mô hình GPT-5.6 mới của mình. Điều này tốt cho người dùng nhưng lại bất lợi cho sự tăng trưởng doanh thu nhanh chóng mà các nhà cung cấp AI cần để duy trì câu chuyện đầu tư.

Tin tức AI không cường điệu – Được tuyển chọn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền về công nghệ tiên phong "AI Radar" sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.

Đăng ký ngay

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.