The Decoder
92

Mô hình

Alibaba ra mắt Qwen3.8-Max: Mô hình mã nguồn mở 2,4 nghìn tỷ tham số cho các tác vụ dài hạn

(giờ Việt Nam)

Tóm tắt AI

Qwen3.8-Max là mô hình flagship mới của Alibaba, được thiết kế để tự động xử lý các tác vụ phức tạp kéo dài nhiều ngày như nghiên cứu khoa học hay thiết kế chip. Alibaba dự kiến sẽ công bố trọng số mô hình vào tuần tới.

Bản dịch AI

Mô hình chủ lực mới của Alibaba là Qwen3.8-Max được xây dựng để tự mình xử lý các tác vụ phức tạp trong nhiều ngày liên tục, từ việc tái hiện các bài báo nghiên cứu đến thiết kế chip một cách tự chủ. Nhóm phát triển dự kiến sẽ công bố trọng số (weights) của mô hình vào tuần tới.

Đội ngũ Qwen của Alibaba đã ra mắt Qwen3.8-Max, mô hình ngôn ngữ mạnh mẽ nhất của họ cho đến nay. Mô hình này có quy mô lên tới 2,4 nghìn tỷ tham số tổng cộng, với 95 tỷ tham số hoạt động cho mỗi truy vấn. Qwen3.8-Max được phát triển dựa trên kiến trúc Qwen3.5, và nhóm phát triển cho biết trọng tâm của mô hình là hoàn thành các tác vụ phức tạp một cách độc lập trong thời gian dài thay vì chỉ trả lời các câu lệnh đơn lẻ.

Alibaba lần đầu công bố mô hình này vào giữa tháng 7 dưới dạng phiên bản xem trước thông qua Token Plan, Qoder và QoderWork của Alibaba với mức giá bằng mười phần trăm giá tiêu chuẩn. Ngay từ lúc đó, nhóm đã đề cập đến con số 2,4 nghìn tỷ tham số và xếp hạng mô hình ngay sau Fable 5, nhưng không chia sẻ các kết quả đánh giá (benchmarks). Qwen3.8-Max là mô hình đầu tiên trong dòng Qwen-Max có trọng số được công khai rộng rãi.

Ba đợt chạy mã hóa tự chủ đã thử thách khả năng của mô hình

Để phô diễn khả năng lập trình của Qwen3.8-Max, nhóm phát triển đã trình bày ba nghiên cứu tình huống mà trong đó mô hình hoạt động mà không cần bất kỳ sự trợ giúp nào từ con người.

Trong trường hợp đầu tiên, Qwen3.8-Max đã dành 16 ngày để xây dựng công cụ dòng lệnh oh-my-cli. Mô hình tiếp nhận các yêu cầu từ người dùng, chuyển chúng thành các GitHub issues, tự gán nhiệm vụ cho chính mình, viết mã, chạy thử nghiệm và cải thiện kết quả một cách lặp đi lặp lại. Đến ngày 30 tháng 7 năm 2026, nó đã thực hiện 265 commits, 127 pull requests và 151 issues, tất cả đều không có sự can thiệp của con người.

Trong trường hợp thứ hai, mô hình nhận được bài báo nghiên cứu "Unified Data Selection for LLM Reasoning" nhưng không có mã nguồn khởi đầu. Nhiệm vụ của nó là tái hiện các kết quả của bài báo và sau đó cải thiện chúng. Theo nhóm phát triển, trong khoảng năm ngày và khoảng 125 giờ tính toán, Qwen3.8-Max đã viết 7.600 dòng mã và chạy 33 tác vụ huấn luyện GPU. Đầu tiên, nó tái hiện thành công tất cả sáu kết quả chính của bài báo. Sau đó, nó thử nghiệm 18 ý tưởng của riêng mình qua bốn vòng và vượt qua phương pháp của bài báo trên bài kiểm tra toán AIME24 với cách biệt 2,7 điểm.

Trường hợp thứ ba liên quan đến Thử thách Nhận dạng Ý định Đối thoại Đa phương thức WWW2025 trên nền tảng Tianchi của Alibaba, nơi có 526 đội thi là con người tham gia. Trong vòng 24 giờ, mô hình đã tinh chỉnh (fine-tune) một số mô hình ngôn ngữ tiếng Trung cùng với Qwen2.5-VL-7B để xử lý ảnh chụp màn hình sản phẩm và kết hợp chúng thành một hệ thống bỏ phiếu. Qua 45 lần gửi bài, độ chính xác đã tăng từ 0,60 lên 0,853. Điều đó giúp Qwen3.8-Max vượt lên trên 458 trong tổng số 526 đội thi là con người.

Thiết kế chip và mô phỏng năm tài chính thử thách khả năng lập kế hoạch dài hạn

Hai nghiên cứu tình huống khác nhắm vào các tác vụ kéo dài qua hàng trăm vòng tương tác. Trong trường hợp đầu tiên, Qwen3.8-Max phải thiết kế một khối xây dựng mật mã cho các lược đồ mã hóa. Chỉ số hiệu quả chính cho một mạch như vậy là số lượng cổng logic cần thiết, vốn là các phần tử cơ bản trên một con chip. Ít cổng hơn đồng nghĩa với một con chip nhỏ hơn và hiệu quả hơn. Mô hình bắt đầu với một thiết kế hoạt động được nhưng cồng kềnh với 8.298 cổng và đã tinh giản nó xuống còn 678 cổng sau khoảng 500 lần lặp.

Sau một lượt bố trí tự động bằng công cụ mã nguồn mở OpenROAD, diện tích chip vật lý đã giảm từ 106x106 xuống còn 46x46 micromet, tương đương mức giảm 81%. Nhóm Qwen cho biết mô hình vẫn tiếp tục thực hiện các thay đổi cấu trúc sâu sắc ngay cả sau hàng trăm lần lặp thay vì chỉ dừng lại ở những điều chỉnh bề mặt.

Nghiên cứu tình huống thứ hai là E-Commerce-Bench, một mô phỏng toàn bộ năm tài chính trong lĩnh vực bán lẻ trực tuyến dựa trên dữ liệu ẩn danh từ Taobao và Tmall. Mô hình bắt đầu với số vốn 100.000 nhân dân tệ và phải điều hành nhiều cửa hàng trực tuyến song song trong suốt một năm. Điều đó bao gồm việc mua sản phẩm, đàm phán với nhà cung cấp bằng ngôn ngữ tự nhiên, điều chỉnh giá cả, quản lý hàng trả lại và xử lý các cuộc khủng hoảng như bão lũ hoặc gián đoạn chuỗi cung ứng.

Ẩn trong nhóm nhà cung cấp là 152 kẻ lừa đảo mà mô hình phải phát hiện ra. Qwen3.8-Max kết thúc với số dư 416.252 nhân dân tệ, gấp bốn lần số vốn ban đầu. Con số này cao hơn 38% so với đối thủ xếp thứ hai là GLM 5.2 và gấp hơn 2,5 lần so với những gì người tiền nhiệm Qwen3.7-Max đạt được. Mô hình đã đầu tư mạnh mẽ vào đầu năm và thu về lợi nhuận ròng hơn 100.000 nhân dân tệ trong mùa lễ hội.

Kỹ năng đa phương thức và tái tạo ứng dụng không cần mã nguồn

Đối với các tác vụ đa phương thức, nhóm phát triển cho biết Qwen3.8-Max có thể xử lý các tài liệu dài hơn 200 trang và video dài hơn 100 giờ. Họ cũng giới thiệu RecreationBench, một bài kiểm tra mới yêu cầu mô hình xây dựng lại các ứng dụng đang chạy mà không cần quyền truy cập vào mã nguồn.

Mô hình chỉ có thể quan sát ứng dụng mục tiêu thông qua tương tác, nghĩa là thông qua các cú nhấp chuột và nhập liệu từ bàn phím. Việc thử nghiệm bao gồm Ubuntu, macOS, Windows, Android và web. Bên cạnh đó, nhóm cũng phát hành Qwen-MM-Plugins, một thư viện mở rộng bổ sung khả năng xử lý hình ảnh và video, sử dụng công cụ trực quan và bộ nhớ đa phương thức cho các hệ thống tác nhân (agent) hiện có.

Benchmark-Übersicht zu Qwen3.8-Max mit Balkengruppen für Coding, Agentic Work, Reasoning und Multimodalität im Vergleich zu weiteren Frontier-Modellen.

Trong các bảng đánh giá mà nhóm Qwen công bố, mô hình đạt kết quả gần bằng hoặc vượt qua Claude Opus 4.8, Claude Fable 5 và GPT-5.6 Sol ở nhiều danh mục. Trên PaperBench, Qwen3.8-Max đạt 93 điểm, số điểm cao nhất trong bảng so sánh. Trên TerminalBench 2.1, nó đạt 86,6 điểm, xếp sau mức 88,8 của GPT-5.6 Sol. Như thường lệ với các con số tự báo cáo từ các nhà sản xuất mô hình, những kết quả này đến từ các đợt chạy nội bộ. Việc xác minh độc lập vẫn đang chờ thực hiện.

Nhóm Qwen cho rằng khả năng duy trì các tác vụ dài hạn của mô hình là nhờ vào việc mở rộng đáng kể các môi trường huấn luyện trong quá trình học tăng cường (reinforcement learning). Việc huấn luyện không còn chỉ tập trung vào các tác vụ đơn lẻ mà còn bao gồm các quy trình làm việc kéo dài nhiều ngày, cấu trúc thư mục lồng nhau thay vì các tệp riêng lẻ và nhiều loại khung tác nhân khác nhau.

Chỉ số điểm nội bộ của nhóm trên hơn mười bài kiểm tra đã tăng từ 0,474 lên 0,725. Mô hình đạt hiệu suất tốt nhất ở mức khoảng 4.000 môi trường, sau đó điểm số giảm nhẹ.

Liniendiagramm zeigt den Score von Qwen3.8-Max über den Verlauf des RL-Trainings, aufgetragen gegen die Zahl der Trainingsumgebungen und den Rechenaufwand; die Kurve steigt kontinuierlich an.

Cuộc đua mô hình mở tại Trung Quốc nóng lên

Đối thủ trực tiếp nhất của Qwen3.8-Max cũng đến từ Trung Quốc. Moonshot AI đã phát hành Kimi K3 với trọng số mở trên Hugging Face vào ngày 27 tháng 7, một mô hình hỗn hợp chuyên gia (mixture-of-experts) đa phương thức với 2,4 nghìn tỷ tham số và cửa sổ ngữ cảnh một triệu token. Cùng với trọng số, Moonshot cũng công bố một phần cơ sở hạ tầng của riêng mình, bao gồm các nhân chú ý (attention kernels), thư viện giao tiếp MoE và các công cụ để chạy tác nhân ở quy mô lớn. Tuy nhiên, các thử nghiệm độc lập đã làm giảm bớt những tuyên bố của công ty. K3 vẫn còn kém xa các mô hình hàng đầu của phương Tây về cả khả năng an ninh mạng lẫn toán học phức tạp.

Qwen3.8-Max hiện đã có sẵn thông qua QwenCloud. Các trọng số dự kiến sẽ được công bố trên Hugging Face và ModelScope vào tuần tới. Mô hình hỗ trợ cả định dạng Chat Completions của OpenAI và giao thức API của Anthropic, vì vậy nó có thể tích hợp trực tiếp vào Claude Code, Codex, Qoder CLI, Qwen Code và OpenClaw. Một tham số có tên reasoning_effort cho phép người dùng chọn giữa ba cấp độ để cân bằng giữa tốc độ và độ kỹ lưỡng.

Balkendiagramm vergleicht die Ergebnisse von Qwen3.8-Max in den Agenten-Harnesses QwenWork, Claude Code, Codex, OpenClaw und Hermes; die Werte liegen dicht beieinander.

Qwen3.8-Max không phải là mảnh ghép duy nhất mà Alibaba bổ sung gần đây. Vài tuần trước, nhóm đã giới thiệu Qwen-Image-3.0, một trình tạo hình ảnh cho các bố cục chứa nhiều thông tin, có khả năng xử lý đầu vào lên đến 4.500 token và hiển thị văn bản dễ đọc với kích thước nhỏ chỉ mười pixel. Ở quy mô khác, Alibaba tiếp tục thúc đẩy các mô hình mở nhỏ như Qwen3.6-35B-A3B, có tổng cộng 35 tỷ tham số nhưng chỉ kích hoạt ba tỷ tham số tại một thời điểm.

AlibabaQwenMô hình ngôn ngữ lớnMã nguồn mởAI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.