Tin ngành
Bảng xếp hạng Arena tuần 30: Kimi K3 giữ vững ngôi vương lập trình, bứt phá mạnh mẽ ở mảng Agent
(giờ Việt Nam)
Tóm tắt AI
Kimi K3 tiếp tục thống trị bảng xếp hạng lập trình front-end của Arena tuần 30 và ghi dấu ấn mạnh mẽ ở mảng Agent với tỷ lệ hoàn thành nhiệm vụ cao nhất. Trong khi đó, Claude-fable-5 vẫn duy trì vị thế dẫn đầu trên bảng xếp hạng tổng hợp.
Bản dịch AI
Theo tin từ IT ngày 27 tháng 7, nền tảng Arena (arena.ai) hôm nay đã công bố dữ liệu xếp hạng các mô hình ngôn ngữ lớn (AI) tuần thứ 30 năm 2026, với chu kỳ thống kê từ ngày 20-07-2026 đến 26-07-2026.
Tuần này, các mô hình nội địa có màn thể hiện ấn tượng, trong đó kimi-k3 của Moonshot AI tiếp tục giữ vững vị trí số 1 thế giới trên bảng xếp hạng phát triển front-end, đồng thời lọt vào Top 10 bảng xếp hạng lập trình, trở thành điểm sáng lớn nhất trong kỳ này.
Trong bảng xếp hạng tổng thể, nhiều mô hình Claude mới của Anthropic đã tập trung góp mặt, với nhóm dẫn đầu nằm trong khoảng 1500 điểm. Các mô hình nội địa tiếp tục đạt được những bước đột phá ở nhiều phân khúc, không ít mô hình đã tiến vào nhóm dẫn đầu của các bảng xếp hạng tương ứng, cho thấy năng lực cạnh tranh tổng thể đang tăng lên ổn định.
Bảng xếp hạng tổng hợp
Cục diện nhóm dẫn đầu bảng xếp hạng tổng hợp vẫn duy trì ổn định, claude-fable-5 tiếp tục giữ ngôi đầu với 1508 điểm. Nhiều mô hình thuộc dòng Claude của Anthropic chiếm giữ 6 vị trí đầu bảng, trong đó có sự góp mặt của nhiều mô hình mới như claude-opus-4-6-thinking, claude-opus-4-7-thinking.
Chênh lệch điểm ELO của 7 mô hình dẫn đầu đều nằm trong khoảng 30 điểm, được coi là trạng thái cạnh tranh ngang hàng trong phạm vi sai số. Muse-spark-1.1 và muse-spark của Meta lần lượt xếp thứ 7 và thứ 8, gemini-3.1-pro-preview của Google tăng 2 bậc lên vị trí thứ 9, cuộc cạnh tranh trong Top 10 đang diễn ra vô cùng gay gắt.
Các mô hình nội địa nhìn chung đang ở vị trí trung bình khá trong bảng xếp hạng tổng hợp, với đội hình tương đối đầy đủ:
kimi-k3 của Moonshot AI xếp thứ 11 với 1485 điểm ELO, giảm 2 bậc so với tuần trước, là mô hình nội địa có thứ hạng cao nhất hiện tại;
qwen3.7-max-preview của Alibaba xếp thứ 20 với 1475 điểm ELO, giảm 2 bậc so với tuần trước;
glm-5.1 của Zhipu AI trước đó xếp thứ 27, tuần này đứng ở vị trí thứ 31;
glm-5.2 (max) của Zhipu AI trước đó xếp thứ 30, tuần này giữ nguyên thứ hạng.
Bảng xếp hạng lập trình
Nhóm dẫn đầu bảng xếp hạng lập trình vẫn do các mô hình của Anthropic thống trị, claude-opus-4-7-thinking giữ vững vị trí đầu bảng với 1553 điểm. Top 5 đều là các mô hình thuộc dòng Anthropic Claude, với chênh lệch điểm số dưới 5 điểm, cho thấy sự cạnh tranh rất sát sao.
Điểm sáng lớn nhất kỳ này là mô hình nội địa kimi-k3 đã tăng 2 bậc lên vị trí thứ 8, lọt vào Top 10 bảng xếp hạng lập trình với 1530 điểm. Khoảng cách với các mô hình dẫn đầu xung quanh cũng nằm trong phạm vi sai số thống kê 30 điểm, hoàn toàn đủ năng lực cạnh tranh ở nhóm đầu.
Các mô hình nội địa được phân bổ rộng rãi trong bảng xếp hạng lập trình, nhiều mô hình đã tiến vào nhóm trung bình khá với hiệu suất ổn định:
kimi-k3 của Moonshot AI xếp thứ 8 với 1530 điểm ELO, tăng 2 bậc so với tuần trước, là mô hình lập trình nội địa có thứ hạng cao nhất;
qwen3.7-max-preview của Alibaba xếp thứ 15 với 1525 điểm ELO, giảm 3 bậc so với tuần trước;
glm-5.1 của Zhipu AI xếp thứ 21 với 1520 điểm ELO, giảm 4 bậc so với tuần trước;
mimo-v2.5-pro của Xiaomi xếp thứ 24 với 1519 điểm ELO, giữ nguyên thứ hạng so với tuần trước;
kimi-k2.6 của Moonshot AI xếp thứ 28 với 1515 điểm ELO, giảm 2 bậc so với tuần trước;
ernie-5.1 của Baidu trước đó xếp thứ 27, tuần này xuống vị trí thứ 31.
Bảng xếp hạng phát triển front-end
Bảng xếp hạng phát triển front-end đã chứng kiến một bước đột phá lịch sử khi mô hình nội địa kimi-k3 bảo vệ thành công ngôi đầu với 1682 điểm (tuần trước là 1679 điểm), vượt qua claude-opus-5-high để trở thành mô hình lớn có năng lực phát triển front-end mạnh nhất thế giới hiện nay.
claude-opus-5-high của Anthropic theo sát ở vị trí thứ 2 với 1673 điểm, claude-fable-5 tụt xuống vị trí thứ 3, và gpt-5.6-sol-xhigh của OpenAI xếp ở vị trí thứ 4.
Ngoài Top 4, khoảng cách điểm số giữa các mô hình bắt đầu nới rộng, glm-5.2 (max) của Zhipu AI cũng đã tiến vào vị trí thứ 5, tiếp tục mở rộng lợi thế của các mô hình nội địa trong phân khúc phát triển front-end.
Các mô hình nội địa đã hình thành một đội hình hùng hậu trong bảng xếp hạng phát triển front-end, chiếm gần một nửa số ghế, thể hiện hiệu suất vô cùng ấn tượng:
kimi-k3 của Moonshot AI đứng đầu bảng với 1682 điểm ELO, giữ nguyên thứ hạng so với tuần trước, là điểm sáng lớn nhất của bảng xếp hạng kỳ này;
glm-5.2 (max) của Zhipu AI xếp thứ 5 với 1587 điểm ELO, giảm 1 bậc so với tuần trước;
seed-2.1-pro-preview của ByteDance xếp thứ 15 với 1529 điểm ELO, giảm 1 bậc so với tuần trước;
glm-5.1 của Zhipu AI xếp thứ 18 với 1518 điểm ELO, giảm 3 bậc so với tuần trước;
hy3 của Tencent xếp thứ 19 với 1518 điểm ELO;
qwen3.7-max-20260517 của Alibaba xếp thứ 20 với 1517 điểm ELO;
kimi-k2.6 của Moonshot AI xếp thứ 21 với 1510 điểm ELO, giảm 3 bậc so với tuần trước;
minimax-m3 của Minimax xếp thứ 24 với 1493 điểm ELO;
qwen3.6-max-preview của Alibaba xếp thứ 28 với 1478 điểm ELO;
mimo-v2.5-pro của Xiaomi xếp thứ 29 với 1474 điểm ELO;
kimi-k2.7-code của Moonshot AI xếp thứ 30 với 1473 điểm ELO.
Bảng xếp hạng tác nhân thông minh (Agent)
Dẫn đầu bảng xếp hạng tác nhân thông minh là Claude Fable 5 (High) với mức cải thiện ròng 12,72%. Khả năng kiểm soát của mô hình này cũng đạt 14,62%, đứng đầu toàn bảng.
GPT 5.6 Sol (xHigh) của OpenAI theo sát ở vị trí thứ 2 với mức cải thiện ròng 10,12%, và Claude Opus 4.8 (Thinking) của Anthropic xếp ở vị trí thứ 3.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.