Thủ thuật
Bảng xếp hạng AI tuần 34: GLM-5.3-max và Kimi-k3-max bứt phá ngoạn mục
(giờ Việt Nam)
Tóm tắt AI
Trong bảng xếp hạng mù Arena tuần 34, mô hình mới GLM-5.3-max của Zhipu đã xuất sắc lọt top 13 toàn cầu, trong khi Kimi-k3-max của Moonshot AI lần đầu tiên tiến vào top 10.
Bản dịch AI
Theo tin từ IT ngày 24 tháng 8, nền tảng Arena (arena.ai) đã công bố bảng xếp hạng mù (blind test) các mô hình ngôn ngữ lớn (LLM) tuần thứ 34 năm 2026 (từ 17/8 đến 23/8). Trong kỳ này, mô hình glm-5.3-max mới ra mắt của Zhipu đã lần đầu tiên lọt vào Top 15 bảng xếp hạng tổng hợp, đứng ở vị trí thứ 13 với 1487 điểm ELO; mô hình kimi-k3-max của Moonshot AI đã vươn từ vị trí thứ 12 lên thứ 10, lần đầu tiên tiến vào top 10 bảng xếp hạng tổng hợp. Ngoài ra, tuần này còn có nhiều mô hình nội địa khác đạt thành tích ấn tượng ở các bảng xếp hạng chuyên biệt, với số lượng mô hình mới gia nhập bảng xếp hạng khá lớn, làm thay đổi đáng kể cục diện cạnh tranh chung.
Lưu ý của IT: Bảng xếp hạng này dựa trên các cuộc bỏ phiếu mù ẩn danh trên nền tảng Arena (arena.ai), tính toán thứ hạng thông qua ELO (đối với bảng xếp hạng tác tử - agent, sử dụng tín hiệu phần trăm). Kết quả phản ánh sở kiến chủ quan của người dùng thay vì các bài kiểm tra năng lực tuyệt đối. Các bảng xếp hạng phụ khác nhau là độc lập và không nên so sánh chéo; sự chênh lệch điểm số nằm trong phạm vi sai số được coi là ngang hàng. Các mô hình mới cũng cần tích lũy một lượng phiếu bầu nhất định mới được chính thức đưa vào bảng xếp hạng.
Bảng xếp hạng tổng hợp
Cục diện dẫn đầu bảng xếp hạng tổng hợp vẫn giữ được sự ổn định. claude-fable-5 tiếp tục giữ vững vị trí số 1 với 1508 điểm, claude-opus-4-6-high và claude-opus-4-7-high lần lượt đứng thứ hai và thứ ba với số điểm tương ứng là 1504 và 1502. Khoảng cách điểm số giữa ba mô hình này đều dưới 30 điểm, được coi là tiệm cận trong phạm vi sai số.
Thay đổi lớn nhất trong tuần này là mô hình mới glm-5.3-max đã vươn thẳng lên vị trí thứ 13 với hiệu suất nổi bật; kimi-k3-max tăng 2 bậc lên vị trí thứ 10, lần đầu tiên lọt vào top 10; muse-spark-1.1 tăng 3 bậc lên vị trí thứ 8. Đồng thời, tuần này có hai mô hình mới là gpt-5.5-instant và claude-opus-4-8 gia nhập bảng xếp hạng, lần lượt đứng ở vị trí thứ 28 và 29. Thứ hạng của qwen3.8-max có sự sụt giảm, từ vị trí thứ 8 xuống thứ 19.
Các mô hình nội địa chiếm nhiều vị trí ở phân khúc trên và trung bình, với hiệu suất tổng thể ổn định:
Moonshot AI kimi-k3-max đứng thứ 10, đạt 1489 điểm ELO, tăng 2 bậc so với tuần trước;
Zhipu glm-5.3-max đứng thứ 13, đạt 1487 điểm ELO, lần đầu tiên lọt vào bảng xếp hạng;
Alibaba qwen3.8-max đứng thứ 19, đạt 1481 điểm ELO, giảm 11 bậc so với tuần trước;
Alibaba qwen3.7-max-preview đứng thứ 27, đạt 1474 điểm ELO, thứ hạng cơ bản không đổi.
Bảng xếp hạng lập trình
Nhóm dẫn đầu bảng xếp hạng lập trình có sự điều chỉnh nhẹ. claude-opus-4-7-high vươn lên dẫn đầu với 1552 điểm ELO, claude-opus-4-6-high đứng thứ hai, trong khi quán quân trước đó là claude-fable-5 tụt xuống vị trí thứ ba. Khoảng cách ELO giữa ba mô hình này chỉ là 1 điểm, được coi là ngang hàng trong phạm vi sai số. glm-5.3-max của Zhipu ngay lần đầu gia nhập đã lọt vào top 10, đứng ở vị trí thứ 10 với 1531 điểm ELO, một màn ra mắt ấn tượng. grok-4.20-beta1 mới gia nhập đứng ở vị trí thứ 20; hai mô hình mới là claude-sonnet-4-5-20250929-high-32k và gpt-5.5-high cũng đã hoàn tất xếp hạng lần đầu. Thứ hạng của qwen3.8-max giảm đáng kể, từ vị trí thứ 13 xuống thứ 25.
Các mô hình nội địa đã có nhiều đại diện lọt vào top 30 của bảng xếp hạng lập trình, thứ hạng cụ thể như sau:
Moonshot AI kimi-k3-max đứng thứ 6, đạt 1542 điểm ELO, thứ hạng cơ bản không đổi;
Zhipu glm-5.3-max đứng thứ 10, đạt 1531 điểm ELO, lần đầu tiên lọt vào bảng xếp hạng;
Alibaba qwen3.7-max-preview đứng thứ 17, đạt 1524 điểm ELO, thứ hạng cơ bản không đổi;
Alibaba qwen3.8-max đứng thứ 25, đạt 1520 điểm ELO, giảm 12 bậc so với tuần trước;
Xiaomi mimo-v2.5-pro đứng thứ 27, đạt 1519 điểm ELO, thứ hạng cơ bản không đổi.
Bảng xếp hạng phát triển Frontend
Nhóm dẫn đầu bảng xếp hạng phát triển Frontend vẫn ổn định, claude-opus-5-max tiếp tục giữ vững vị trí số 1 với 1691 điểm. Các mô hình nội địa kimi-k3-max và qwen3.8-max giữ vững vị trí thứ hai và thứ ba với số điểm ELO lần lượt là 1674 và 1669, khoảng cách với vị trí dẫn đầu dưới 30 điểm, được coi là tiệm cận trong phạm vi sai số. Mô hình mới glm-5.3-max vươn thẳng lên vị trí thứ 8, qwen3.8-27b lần đầu lọt vào bảng xếp hạng ở vị trí thứ 9. Cả hai mô hình nội địa mới này đều lọt vào top 10 với hiệu suất nổi bật. Hiện đã có nhiều mô hình nội địa lọt vào top 15, cho thấy năng lực cạnh tranh đáng kể trong lĩnh vực phát triển Frontend.
Bảng xếp hạng tạo ảnh AI
Cục diện dẫn đầu bảng xếp hạng tạo ảnh AI ổn định, gpt-image-2 (medium) tiếp tục dẫn đầu với 1381 điểm. Mô hình nội địa seedream-5.0-pro giữ vững vị trí thứ 8, qwen-image-3.0-pro đứng thứ 9. Cả hai mô hình nội địa đều lọt vào top 10 và không có biến động lớn về thứ hạng tổng thể. hunyuan-image-3.0 tuần này tăng lên vị trí thứ 29, duy trì trong top 30.
Bảng xếp hạng video AI
Trong bảng xếp hạng video AI, mô hình mới dreamina-seedance-2.5-720p của ByteDance ngay lần đầu gia nhập đã vươn lên vị trí thứ 4 với 1477 điểm ELO, theo sát ngay sau sản phẩm tiền nhiệm là dreamina-seedance-2.0-720p. Cả hai mô hình nội địa đều lọt vào top 5 với hiệu suất ấn tượng. gemini-omni-flash tiếp tục giữ vị trí số 1 với 1512 điểm, flux-3-video đứng thứ hai và dreamina-seedance-2.0-720p giữ vị trí thứ ba.
Bảng xếp hạng tác tử (Agent)
Nhóm dẫn đầu bảng xếp hạng tác tử vẫn do các mô hình của Anthropic chiếm lĩnh. Claude Opus 5 (High) giữ vững vị trí số 1 với mức tăng trưởng ròng 12,47%, Claude Opus 5 (Max) tăng một bậc lên thứ hai, Claude Fable 5 (High) tụt xuống thứ ba. Khoảng cách tăng trưởng ròng giữa ba mô hình này nhỏ hơn khoảng tin cậy, được coi là tiệm cận trong phạm vi sai số. Kimi K3 (Max) của Moonshot AI tăng một bậc lên thứ tư với mức tăng trưởng ròng 10,41% và tỷ lệ xác nhận tác vụ thành công đạt 17,97%, hiệu suất tổng thể đã tiến vào nhóm dẫn đầu. Tuần này, hai mô hình nội địa là DeepSeek V4 Pro (High) (0813) và Qwen3.8 Max mới gia nhập bảng xếp hạng, lần lượt đứng ở vị trí thứ 14 và 15 với kết quả không tồi.
Các mô hình nội địa đã có nhiều đại diện lọt vào top 30 của bảng xếp hạng tác tử, với nhóm dẫn đầu đã chạm ngưỡng nhóm thứ nhất:
Moonshot AI Kimi K3 (Max) xếp thứ 4, tăng trưởng ròng 10,41%, tỷ lệ xác nhận tác vụ thành công 17,97%, tăng 1 bậc so với tuần trước;
DeepSeek V4 Pro (High) (0813) xếp thứ 14, tăng trưởng ròng 6,26%, tỷ lệ xác nhận tác vụ thành công 13,06%, lần đầu lọt vào bảng xếp hạng;
Alibaba Qwen3.8 Max xếp thứ 15, tăng trưởng ròng 6,20%, tỷ lệ ảo giác công cụ chỉ 0,18%, lần đầu lọt vào bảng xếp hạng;
Zhipu GLM 5.2 (Max) xếp thứ 17, tăng trưởng ròng 5,82%, giảm 3 bậc so với tuần trước;
Deepseek V4 Flash (High) (20260731) xếp thứ 20, tăng trưởng ròng 3,99%.
Tuần này, bảng xếp hạng Arena chứng kiến sự xuất hiện của nhiều mô hình nội địa mới. Zhipu glm-5.3-max đạt thứ hạng xuất sắc ở cả bảng tổng hợp, bảng lập trình và bảng phát triển Frontend; Moonshot AI kimi-k3-max lần đầu lọt vào top 10 bảng tổng hợp và tiến vào top 4 bảng tác tử; mô hình mới dreamina-seedance-2.5-720p của ByteDance lọt thẳng vào top 5 bảng xếp hạng video AI. Các mô hình nội địa tiếp tục đạt được những bước đột phá trên nhiều phương diện. Sắp tới, với việc nhiều phiên bản mô hình lớn nội địa mới được ra mắt, dự kiến cuộc cạnh tranh thứ hạng sẽ càng trở nên gay gắt hơn, rất đáng để theo dõi trong thời gian tới.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.