Tin ngành
Bảng xếp hạng AI tuần: Qwen3.8-max của Alibaba lọt Top 6, các mô hình nội địa gây ấn tượng mạnh
(giờ Việt Nam)
Tóm tắt AI
Trong bảng xếp hạng mù Arena tuần 32 năm 2026, Qwen3.8-max của Alibaba đã vươn lên vị trí thứ 6 với 1497 điểm ELO, trong khi mô hình mới muse-spark-1.2 của Meta xuất sắc giành vị trí thứ 4.
Bản dịch AI
Theo tin từ IT ngày 10 tháng 8, nền tảng Arena (arena.ai) đã công bố bảng xếp hạng mù các mô hình AI lớn tuần thứ 32 năm 2026 (từ ngày 3 tháng 8 đến ngày 9 tháng 8). Tuần này có nhiều mô hình mới góp mặt, trong đó mô hình nội địa Trung Quốc là Alibaba qwen3.8-max có màn thể hiện nổi bật khi lọt vào top 6 bảng xếp hạng tổng hợp với điểm ELO đạt 1497, chính thức gia nhập nhóm dẫn đầu. Mô hình mới ra mắt của Meta là muse-spark-1.2 (xHigh) cũng xếp thứ 4 trên bảng tổng hợp, trở thành một tân binh sáng giá từ phía quốc tế. Nhiều bảng xếp hạng chuyên biệt trong tuần này cũng ghi nhận sự xuất hiện của các mô hình mới, với các mô hình nội địa đạt được những bước đột phá trong các lĩnh vực như phát triển frontend, lập trình và tạo ảnh.
Lưu ý từ IT: Bảng xếp hạng này dựa trên các cuộc bỏ phiếu mù ẩn danh trên nền tảng Arena (arena.ai), tính toán thứ hạng thông qua ELO (đối với bảng xếp hạng tác tử - agent là tín hiệu phần trăm). Kết quả phản ánh sở thích chủ quan của người dùng thay vì kiểm tra năng lực tuyệt đối; các bảng xếp hạng khác nhau là độc lập và không nên so sánh chéo. Khoảng cách điểm nằm trong phạm vi sai số được coi là đồng hạng, và các mô hình mới cần tích lũy đủ lượng bình chọn mới được chính thức đưa vào bảng xếp hạng.
Bảng xếp hạng tổng hợp
Cục diện dẫn đầu bảng tổng hợp tuần này tương đối ổn định. Claude-fable-5 của Anthropic vẫn giữ vững vị trí đầu bảng với 1507 điểm ELO, theo sau là claude-opus-4-6-thinking và claude-opus-4-7-thinking ở vị trí thứ hai và thứ ba. Khoảng cách điểm giữa ba mô hình này đều dưới 10 điểm, được coi là sát sao trong phạm vi sai số. Điểm nhấn lớn nhất tuần này là sự bứt phá mạnh mẽ của hai mô hình mới: muse-spark-1.2 (xHigh) của Meta ra mắt ở vị trí thứ 4 với 1498 điểm ELO; qwen3.8-max hoàn toàn mới của Alibaba giành vị trí thứ 6 với 1497 điểm ELO, bằng điểm với claude-opus-4-6 ở vị trí thứ 5 nhưng xếp sau do khác biệt về khoảng tin cậy, cũng được coi là đồng hạng trong phạm vi sai số thống kê. Điểm số nhóm dẫn đầu rất sít sao, top 10 đều đạt trên 1488 điểm, cho thấy sự cạnh tranh cực kỳ khốc liệt.
Các mô hình nội địa đã có nhiều đại diện lọt vào nhóm trung và thượng tầng của bảng xếp hạng tổng hợp, thứ hạng cụ thể như sau:
Alibaba qwen3.8-max xếp thứ 6, 1497 điểm ELO;
Moonshot AI kimi-k3-max xếp thứ 14, 1485 điểm ELO, giữ nguyên thứ hạng;
Alibaba qwen3.7-max-preview xếp thứ 23, 1475 điểm ELO, giảm 2 bậc.
Bảng xếp hạng lập trình (Code)
Nhóm dẫn đầu bảng lập trình vẫn bị các mô hình của Anthropic thống trị, claude-fable-5 tiếp tục giữ vị trí số 1 với 1553 điểm ELO, claude-opus-4-7-thinking và claude-opus-4-6-thinking lần lượt chiếm vị trí thứ hai và thứ ba. Moonshot AI kimi-k3-max tuần này tăng từ vị trí thứ 8 lên thứ 6, điểm ELO tăng 11 điểm lên 1542, lọt vào Top 6 và trở thành mô hình nội địa có thứ hạng cao nhất trong bảng lập trình. Alibaba qwen3.8-max xếp thứ 8 với 1532 điểm ELO, cũng lọt vào top 10. Meta muse-spark-1.2 (xHigh) lần đầu góp mặt ở vị trí thứ 15 với 1526 điểm ELO.
Các mô hình nội địa đã có nhiều đại diện lọt vào top 30 bảng lập trình, cụ thể như sau:
Moonshot AI kimi-k3-max xếp thứ 6, 1542 điểm ELO, tăng 2 bậc so với tuần trước;
Alibaba qwen3.8-max xếp thứ 8, 1532 điểm ELO;
Alibaba qwen3.7-max-preview xếp thứ 17, 1526 điểm ELO, giảm 1 bậc;
Xiaomi mimo-v2.5-pro xếp thứ 28, 1519 điểm ELO, giữ nguyên thứ hạng;
Zhipu AI glm-5.1 xếp thứ 30, 1517 điểm ELO, giảm 3 bậc so với tuần trước.
Bảng xếp hạng phát triển Frontend
Dẫn đầu bảng phát triển frontend tuần này vẫn là claude-opus-5-max với 1686 điểm ELO. Moonshot AI kimi-k3-max giữ vững vị trí thứ hai với 1675 điểm ELO, chỉ giảm 1 điểm, vẫn bám sát mô hình quốc tế dẫn đầu. Alibaba qwen3.8-max giành vị trí thứ 4 với 1667 điểm ELO, trực tiếp lọt vào top 5 với màn thể hiện rất ấn tượng. DeepSeek deepseek-v4-flash-high cũng lần đầu góp mặt ở vị trí thứ 8 với 1581 điểm ELO. Các mô hình nội địa đã chiếm nhiều vị trí trong top 10 bảng frontend, năng lực cạnh tranh tổng thể không ngừng được nâng cao.
Thứ hạng cụ thể của các mô hình nội địa như sau:
Moonshot AI kimi-k3-max xếp thứ 2, 1675 điểm ELO, giữ nguyên thứ hạng;
Alibaba qwen3.8-max xếp thứ 4, 1667 điểm ELO;
Zhipu AI glm-5.2-max xếp thứ 7, 1588 điểm ELO, tăng 1 bậc;
DeepSeek deepseek-v4-flash-high xếp thứ 8, 1581 điểm ELO, lần đầu góp mặt.
Bảng xếp hạng tác tử (Agent)
Nhóm dẫn đầu bảng tác tử tuần này có sự thay đổi. Anthropic Claude Opus 5 (High) vươn lên từ vị trí thứ ba lên thứ nhất với mức tăng trưởng ròng đạt 11,99%. Cựu quán quân Claude Fable 5 (High) tụt xuống vị trí thứ hai với mức tăng trưởng ròng 11,66%. Khoảng cách giữa hai mô hình này nhỏ hơn tổng khoảng tin cậy của cả hai, nên được coi là đồng hạng trong phạm vi sai số. Mô hình nội địa Moonshot AI Kimi K3 (Max) giữ vững vị trí thứ 5 với mức tăng trưởng ròng 10,08%, tỷ lệ xác nhận nhiệm vụ thành công đạt 14,97%, đã lọt vào nhóm dẫn đầu bảng tác tử. DeepSeek V4 Flash (High) (20260731) lần đầu góp mặt ở vị trí thứ 21 với mức tăng trưởng ròng 2,84%, tỷ lệ xác nhận nhiệm vụ thành công đạt 8,53%, màn ra mắt đáp ứng kỳ vọng.
Các mô hình nội địa đã có nhiều đại diện lọt vào top 30 bảng tác tử, cụ thể như sau:
Moonshot AI Kimi K3 (Max) xếp thứ 5, mức tăng trưởng ròng 10,08%, tỷ lệ xác nhận nhiệm vụ thành công 14,97%, giữ nguyên thứ hạng;
Zhipu AI GLM 5.2 (Max) xếp thứ 12, mức tăng trưởng ròng 6,75%, giữ nguyên thứ hạng;
DeepSeek V4 Flash (High) (20260731) xếp thứ 21, mức tăng trưởng ròng 2,84%, lần đầu góp mặt;
Zhipu AI GLM 5.1 xếp thứ 24, mức tăng trưởng ròng 0,35%, giảm 2 bậc.
Bảng xếp hạng AI tạo ảnh
Tuần này, OpenAI gpt-image-2 (medium) vẫn chiếm vị trí số 1 bảng AI tạo ảnh với 1380 điểm ELO. Mô hình mới ra mắt của SpaceXAI là grok-imagine-image-2.0 (low) lần đầu góp mặt đã giành vị trí thứ hai với 1320 điểm ELO, thể hiện xuất sắc. Về phía mô hình nội địa, Alibaba qwen-image-3.0-pro lần đầu góp mặt ở vị trí thứ 7 với 1258 điểm ELO, ByteDance seedream-5.0-pro xếp thứ 8 với 1257 điểm ELO. Cả hai mô hình nội địa đều lọt vào top 10, nằm trong nhóm dẫn đầu. Tencent hunyuan-image-3.0 xếp thứ 29 với 1151 điểm ELO, thể hiện ổn định.
Bảng xếp hạng AI video
Cục diện dẫn đầu bảng AI video ổn định, Google gemini-omni-flash vẫn giữ vị trí đầu bảng với 1513 điểm ELO, ByteDance dreamina-seedance-2.0-720p giữ vị trí thứ hai với 1479 điểm ELO, khoảng cách chỉ là 34 điểm, tiệm cận mức dẫn đầu. MiniMax minimax-h3 hoàn toàn mới lần đầu góp mặt ở vị trí thứ 4 với 1455 điểm ELO, trực tiếp lọt vào top 5, trở thành điểm sáng mới nhất của mô hình AI video nội địa. Alibaba happyhorse-1.0 xếp thứ 5 với 1428 điểm ELO, cũng duy trì sự ổn định. Các mô hình nội địa đã chiếm 3 trong 5 vị trí dẫn đầu bảng xếp hạng, cho thấy ưu thế rõ rệt.
Bảng xếp hạng tuần của Arena đã đón nhận nhiều mô hình mới quan trọng. Các mô hình lớn nội địa đã đạt được những bước đột phá trên nhiều phương diện như tổng hợp, lập trình, phát triển frontend, tạo ảnh và video. Màn ra mắt của Alibaba qwen3.8-max đã lọt ngay vào nhóm dẫn đầu, chứng minh năng lực tổng hợp của các mô hình lớn nội địa đã tiệm cận mức dẫn đầu quốc tế, đồng thời chiếm lĩnh vị trí dẫn đầu ở nhiều lĩnh vực chuyên biệt. Dự kiến tuần tới sẽ có thêm nhiều mô hình mới hoàn thành kiểm tra và gia nhập bảng xếp hạng, chúng tôi sẽ tiếp tục theo dõi những thay đổi về thứ hạng.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.