Thủ thuật
Bảng xếp hạng AI tuần: Anthropic thống trị top đầu, Kimi vươn lên mạnh mẽ
(giờ Việt Nam)
Tóm tắt AI
Bảng xếp hạng Arena tuần 33 chứng kiến sự áp đảo của các mô hình Claude mới từ Anthropic. Trong khi đó, đại diện Việt Nam Kimi-k3-max tiếp tục thăng hạng, khẳng định vị thế trong top đầu các mô hình AI toàn cầu.
Bản dịch AI
Theo tin từ IT ngày 17 tháng 8, nền tảng Arena (arena.ai) đã công bố bảng xếp hạng mù (blind test) các mô hình ngôn ngữ lớn (LLM) tuần thứ 33 năm 2026 (từ 10/8 đến 16/8). Điểm nhấn lớn nhất trong kỳ này là việc hàng loạt mô hình mới thuộc dòng claude-opus-4 của Anthropic đồng loạt lọt vào bảng xếp hạng và chiếm trọn top 5 bảng tổng hợp. Mô hình nội địa kimi-k3-max tăng 2 bậc lên vị trí thứ 12 trên bảng tổng hợp và giữ vững vị trí thứ 2 trên bảng xếp hạng phát triển frontend, trong khi qwen3.8-max lần đầu tiên lọt vào Top 10 bảng xếp hạng tác nhân AI (AI Agent). Nhìn chung, các mô hình nội địa vẫn duy trì ở phân khúc trung và cao cấp, đồng thời đang tạo ra thế bám đuổi quyết liệt với các mô hình hàng đầu quốc tế trong các lĩnh vực chuyên biệt như phát triển frontend.
Lưu ý từ IT: Bảng xếp hạng này dựa trên các lượt bình chọn mù ẩn danh từ nền tảng Arena (arena.ai), tính toán thứ hạng thông qua ELO (đối với bảng xếp hạng tác nhân AI là tỷ lệ phần trăm tín hiệu). Kết quả phản ánh sở thích chủ quan của người dùng thay vì các bài kiểm tra năng lực tuyệt đối. Các bảng xếp hạng phụ độc lập với nhau và không nên so sánh chéo; khoảng cách điểm số nằm trong phạm vi sai số được coi là đồng hạng. Các mô hình mới cũng cần tích lũy một lượng bình chọn nhất định mới được chính thức đưa vào bảng xếp hạng.
Bảng xếp hạng tổng hợp
Bảng xếp hạng tổng hợp kỳ này gần như bị các mô hình mới của Anthropic thâu tóm. claude-fable-5 tiếp tục giữ vững ngôi đầu với 1506 điểm, theo sát phía sau là mô hình mới claude-opus-4-6-high ở vị trí thứ hai với 1505 điểm, và claude-opus-4-7-high cũng là một tân binh xếp thứ ba với 1502 điểm. Khoảng cách điểm số giữa top 3 đều nằm trong phạm vi 5 điểm, được coi là đồng hạng trong phạm vi sai số.
Mô hình mới gemini-3.7-flash-high của Google gây ấn tượng mạnh khi lần đầu lọt vào bảng xếp hạng đã giành ngay vị trí thứ 9. Về phía các mô hình nội địa, kimi-k3-max tăng 2 bậc lên vị trí thứ 12, trở thành mô hình nội địa có thứ hạng cao nhất.
Các mô hình nội địa nhìn chung đều nằm ở phân khúc trung và cao cấp của bảng xếp hạng, thứ hạng cụ thể như sau:
Moonshot AI kimi-k3-max xếp thứ 12, đạt 1489 điểm ELO, tăng 2 bậc so với tuần trước;
Alibaba qwen3.8-max xếp thứ 8, đạt 1491 điểm ELO, giảm 2 bậc so với tuần trước;
Alibaba qwen3.7-max-preview xếp thứ 26, đạt 1474 điểm ELO, giảm 3 bậc so với tuần trước.
Bảng xếp hạng lập trình (Code)
Cục diện bảng xếp hạng lập trình cũng bị thống trị bởi các mô hình mới của Anthropic. claude-fable-5 giữ vững vị trí dẫn đầu với 1554 điểm. Các tân binh claude-opus-4-7-high và claude-opus-4-6-high lần lượt chiếm vị trí thứ hai và thứ ba với 1552 và 1551 điểm; khoảng cách điểm số cực nhỏ nên được coi là đồng hạng trong phạm vi sai số. kimi-k3-max ổn định ở vị trí thứ sáu với điểm ELO tăng 2 điểm, tiếp tục là mô hình lập trình nội địa có thứ hạng cao nhất. Meta muse-spark-1.2 (xHigh) tăng 7 bậc lên vị trí thứ tám, là mô hình hàng đầu có mức tăng trưởng mạnh nhất tuần này.
Các mô hình nội địa chiếm nhiều vị trí trong phân khúc trung và cao cấp của bảng xếp hạng lập trình, thứ hạng cụ thể như sau:
Moonshot AI kimi-k3-max có thứ hạng cao nhất, đứng thứ 6 với 1544 điểm ELO, giữ nguyên thứ hạng;
Alibaba qwen3.8-max xếp thứ 13, đạt 1529 điểm ELO, giảm 5 bậc so với tuần trước;
Alibaba qwen3.7-max-preview xếp thứ 17, đạt 1525 điểm ELO, giữ nguyên thứ hạng;
Xiaomi mimo-v2.5-pro xếp thứ 25, đạt 1520 điểm ELO, tăng 3 bậc so với tuần trước.
Bảng xếp hạng phát triển Frontend
Cục diện top đầu bảng xếp hạng phát triển frontend khá ổn định. claude-opus-5-max tiếp tục giữ ngôi vương với 1692 điểm. Mô hình nội địa kimi-k3-max duy trì vị trí thứ hai với 1674 điểm, chỉ kém 18 điểm và vẫn tạo áp lực lớn lên vị trí dẫn đầu. Alibaba qwen3.8-max tăng 1 bậc lên vị trí thứ ba với 1667 điểm ELO. DeepSeek với mô hình mới deepseek-v4-pro-high-20260813 lần đầu lọt vào bảng xếp hạng đã giành vị trí thứ 10 với 1584 điểm ELO, thể hiện phong độ ấn tượng.
Các mô hình nội địa chiếm nhiều vị trí trong top đầu và phân khúc trung cao cấp của bảng xếp hạng phát triển frontend, cụ thể như sau:
Moonshot AI kimi-k3-max xếp thứ 2, đạt 1674 điểm ELO, giữ nguyên thứ hạng;
Alibaba qwen3.8-max xếp thứ 3, đạt 1667 điểm ELO, tăng 1 bậc so với tuần trước;
Zhipu AI glm-5.2-max xếp thứ 9, đạt 1585 điểm ELO, giảm 2 bậc so với tuần trước;
DeepSeek deepseek-v4-pro-high-20260813 mới lọt vào bảng xếp hạng ở vị trí thứ 10, đạt 1584 điểm ELO;
DeepSeek deepseek-v4-flash-high xếp thứ 11, đạt 1581 điểm ELO, giảm 3 bậc.
Bảng xếp hạng tạo ảnh AI
Trong bảng xếp hạng tạo ảnh AI, gpt-image-2 (medium) tiếp tục giữ vững ngôi đầu với 1381 điểm. Mô hình mới mai-image-2.6-preview của Microsoft lần đầu lọt vào bảng xếp hạng đã giành vị trí thứ hai với 1336 điểm ELO, trực tiếp tiến vào nhóm dẫn đầu. Mô hình nội địa seedream-5.0-pro giữ vững vị trí thứ tám với 1258 điểm ELO, qwen-image-3.0-pro xếp thứ chín, khoảng cách giữa hai mô hình chỉ là 1 điểm, được coi là đồng hạng trong phạm vi sai số.
Bảng xếp hạng video AI
Bảng xếp hạng video AI chứng kiến sự thay đổi ở top đầu. Mô hình mới flux-3-video của Black Forest Labs lần đầu lọt vào bảng xếp hạng đã giành vị trí thứ hai với 1496 điểm ELO, chỉ kém 16 điểm so với mô hình dẫn đầu gemini-omni-flash. Mô hình nội địa dreamina-seedance-2.0-720p duy trì vị trí thứ ba với 1478 điểm ELO, minimax-h3 xếp thứ năm, cục diện top đầu nhìn chung tương đối ổn định.
Bảng xếp hạng tác nhân AI (AI Agent)
Trong bảng xếp hạng tác nhân AI, các mô hình của Anthropic tiếp tục độc chiếm top 3, với Claude Opus 5 (High) giữ vững ngôi đầu nhờ mức tăng trưởng ròng 12,19%. Bảng xếp hạng lần này có hai mô hình mới lọt vào top 10, trong đó mô hình nội địa Qwen3.8 Max lần đầu lọt vào bảng xếp hạng đã đứng thứ 11 với mức tăng trưởng ròng 7,61%, tỷ lệ xác nhận tác vụ thành công đạt 12,54% và tỷ lệ ảo giác công cụ chỉ 0,11%, thể hiện rất xuất sắc. Một tân binh khác là Claude Opus 4.8 (High) xếp thứ sáu với mức tăng trưởng ròng 9,78%. Kimi K3 (Max) của nội địa ổn định ở vị trí thứ năm với mức tăng trưởng ròng 10,6%, tỷ lệ xác nhận tác vụ thành công 15,55%, đã chính thức lọt vào nhóm dẫn đầu toàn cầu về tác nhân AI.
Các mô hình nội địa đã có nhiều đại diện lọt vào phân khúc trung và cao cấp của bảng xếp hạng tác nhân AI, cụ thể như sau:
Moonshot AI Kimi K3 (Max) xếp thứ 5, mức tăng trưởng ròng 10,60%, tỷ lệ xác nhận tác vụ thành công 15,55%, giữ nguyên thứ hạng;
Alibaba Qwen3.8 Max mới lọt vào bảng xếp hạng ở vị trí thứ 11, mức tăng trưởng ròng 7,61%, tỷ lệ xác nhận tác vụ thành công 12,54%;
Zhipu AI GLM 5.2 (Max) xếp thứ 14, mức tăng trưởng ròng 6,74%, giảm 2 bậc so với tuần trước;
DeepSeek Deepseek V4 Flash (High) (20260731) xếp thứ 19, mức tăng trưởng ròng 4,04%, tăng 2 bậc so với tuần trước.
Đặc điểm nổi bật nhất của bảng xếp hạng Arena tuần này là việc nhà sản xuất Anthropic từ nước ngoài tập trung ra mắt hàng loạt mô hình mới và nhanh chóng chiếm lĩnh các vị trí đầu bảng, khẳng định sự tích lũy kỹ thuật trong quá trình lặp lại mô hình của họ. Về phía các mô hình nội địa, kimi-k3-max duy trì ổn định trong top 15 ở cả ba bảng xếp hạng cốt lõi là tổng hợp, lập trình và phát triển frontend, đặc biệt giữ vững vị trí thứ hai ở bảng phát triển frontend. qwen3.8-max ngay lần đầu ra mắt đã lọt vào Top 11 bảng xếp hạng tác nhân AI. Nhìn chung, các mô hình lớn nội địa đang tiếp tục tiến bộ cả về năng lực tổng quát lẫn lĩnh vực tác nhân AI, khoảng cách với các mô hình hàng đầu quốc tế đang dần được thu hẹp. Dự kiến tuần tới thị trường sẽ có thêm nhiều mô hình nội địa mới hoàn tất cập nhật phiên bản, rất đáng để tiếp tục theo dõi hiệu suất xếp hạng của chúng.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.