IT Home ITHome
85

Tin ngành

Bảng xếp hạng AI tuần: Kimi K3 lần đầu lọt Top 10 thế giới, dẫn đầu mảng lập trình frontend

(giờ Việt Nam)

Tóm tắt AI

Mô hình Kimi K3 của Trung Quốc gây ấn tượng mạnh khi lần đầu tiên lọt vào Top 10 bảng xếp hạng tổng quát của Arena và chiếm lĩnh vị trí số 1 trong lĩnh vực phát triển frontend, khẳng định năng lực cạnh tranh vượt trội so với các đối thủ quốc tế.

Bản dịch AI

Theo tin từ IT ngày 20 tháng 7, nền tảng Arena (arena.ai) đã công bố bảng xếp hạng mô hình ngôn ngữ lớn (LLM) kỳ 2026-29, với chu kỳ thống kê từ ngày 13 tháng 7 năm 2026 đến ngày 19 tháng 7 năm 2026.

Bảng xếp hạng tuần này chứng kiến sự đổ bộ của hàng loạt mô hình mới, trong đó đáng chú ý nhất là màn thể hiện xuất sắc của mô hình nội địa kimi-k3: không chỉ lần đầu tiên lọt vào Top 10 bảng xếp hạng tổng hợp, mà còn trực tiếp vươn lên dẫn đầu bảng xếp hạng phát triển Frontend, vượt qua hầu hết các mô hình hàng đầu quốc tế ở các năng lực chuyên biệt.

Nhìn chung, nhiều mô hình nội địa đã đứng vững ở các vị trí cao trên nhiều bảng xếp hạng, cho thấy sự hoàn thiện hơn nữa về mặt đội ngũ.

Bảng xếp hạng tổng hợp

Các vị trí dẫn đầu bảng xếp hạng tổng hợp vẫn do các mô hình mới từ các nhà sản xuất như Claude, Meta, Google, OpenAI thống trị. Vị trí số 1 vẫn thuộc về claude-fable-5 với 1507 điểm ELO. Nhiều phiên bản mô hình "tư duy" (thinking) của Anthropic đã đồng loạt lọt vào Top 5, với khoảng cách điểm số giữa các mô hình đều dưới 15 điểm, nằm trong phạm vi sai số và được coi là cùng thuộc nhóm dẫn đầu.

Điểm nhấn lớn nhất tuần này là mô hình nội địa kimi-k3 đã vươn lên vị trí thứ 9 với 1486 điểm ELO, lần đầu tiên lọt vào Top 10 bảng xếp hạng tổng hợp. Điểm số này hoàn toàn ngang bằng với gemini-3-pro ở vị trí thứ 8 và gpt-5.6-sol-xhigh ở vị trí thứ 10, nằm ở ngưỡng biên của nhóm dẫn đầu.

Các mô hình nội địa phân bổ ở phân khúc từ trung bình đến cao trên bảng xếp hạng tổng hợp với phong độ ổn định:

Moonshot AI kimi-k3 xếp hạng 9, 1486 điểm ELO, tăng 1 bậc so với tuần trước, lần đầu tiên lọt vào Top 10;

Alibaba qwen3.7-max-preview xếp hạng 18, 1475 điểm ELO, giữ nguyên thứ hạng;

Zhipu AI glm-5.1 xếp hạng 27, 1471 điểm ELO, giảm 2 bậc so với tuần trước;

Zhipu AI glm-5.2 (max) xếp hạng 30, 1468 điểm ELO, giữ nguyên thứ hạng.

Bảng xếp hạng mã nguồn (Code)

Vị trí dẫn đầu bảng xếp hạng mã nguồn đã có sự thay đổi, claude-opus-4-7-thinking vươn từ vị trí thứ 2 lên thứ 1 với 1553 điểm ELO, đẩy claude-fable-5 xuống vị trí thứ 2 với 1551 điểm. Khoảng cách giữa hai mô hình chỉ là 2 điểm, hoàn toàn nằm trong khoảng tin cậy, cùng thuộc nhóm dẫn đầu. Các mô hình "tư duy" của Anthropic gần như chiếm trọn 7 vị trí đầu bảng, cho thấy sức thống trị mạnh mẽ.

Trong khi đó, mô hình nội địa kimi-k3 lần đầu tiên lọt vào Top 10 bảng xếp hạng mã nguồn ở vị trí thứ 10 với 1529 điểm ELO, chỉ kém mô hình đứng thứ 9 đúng 1 điểm, cho thấy hiệu suất tiệm cận nhóm dẫn đầu.

Các mô hình nội địa trên bảng xếp hạng mã nguồn phân bổ ở nhiều phân khúc, thể hiện sự cân bằng:

Moonshot AI kimi-k3 xếp hạng 10, 1529 điểm ELO, lần đầu tiên lọt vào Top 10 bảng xếp hạng mã nguồn;

Alibaba qwen3.7-max-preview xếp hạng 12, 1527 điểm ELO;

Zhipu AI glm-5.1 xếp hạng 17, 1521 điểm ELO, tăng 1 bậc so với tuần trước;

Xiaomi mimo-v2.5-pro xếp hạng 24, 1518 điểm ELO, giảm 1 bậc so với tuần trước;

Moonshot AI kimi-k2.6 xếp hạng 26, 1515 điểm ELO, giảm 1 bậc so với tuần trước;

Baidu ernie-5.1 xếp hạng 27, 1514 điểm ELO, giảm 1 bậc so với tuần trước;

Bảng xếp hạng phát triển Frontend

Bảng xếp hạng phát triển Frontend chứng kiến một cục diện chưa từng có khi mô hình nội địa kimi-k3 vươn lên vị trí số 1 với số điểm ELO ấn tượng là 1679, bỏ xa vị trí thứ 2 là claude-fable-5 với 1631 điểm (khoảng cách 48 điểm), tạo ra ưu thế rất rõ rệt.

Vị trí thứ 4 cũng thuộc về một mô hình nội địa là glm-5.2 (max) với 1587 điểm ELO, vượt qua nhiều mô hình flagship của Claude và OpenAI. Điều này cho thấy năng lực của các mô hình lớn nội địa trong lĩnh vực chuyên biệt như phát triển Frontend đã vươn lên hàng đầu thế giới.

Các mô hình nội địa chiếm lĩnh nhiều vị trí từ dẫn đầu đến trung bình trên bảng xếp hạng phát triển Frontend, bao phủ toàn bộ các phân khúc:

Moonshot AI kimi-k3 xếp hạng 1, 1679 điểm ELO, giữ vững vị trí dẫn đầu;

Zhipu AI glm-5.2 (max) xếp hạng 4, 1587 điểm ELO, duy trì vị trí trong Top 5;

ByteDance seed-2.1-pro-preview xếp hạng 14, 1534 điểm ELO, lần đầu tiên lọt vào nửa đầu bảng xếp hạng;

Zhipu AI glm-5.1 xếp hạng 15, 1526 điểm ELO, phong độ ổn định;

Alibaba qwen3.7-max-20260517 xếp hạng 17, 1516 điểm ELO;

Moonshot AI kimi-k2.6 xếp hạng 18, 1515 điểm ELO;

Bảng xếp hạng tác nhân (Agent)

Bảng xếp hạng tác nhân tuần này hoàn toàn là các mô hình mới. Đứng đầu là Claude Fable 5 (High) với mức cải thiện ròng 13,94%, đồng thời sở hữu tỷ lệ đánh giá tích cực/tiêu cực cao nhất là 30,65%, tỷ lệ ảo tưởng công cụ (tool hallucination) chỉ ở mức thấp 1,33%. Mô hình đứng thứ hai là GPT 5.6 Sol (xHigh) có chỉ số khả năng kiểm soát cao nhất, đạt 17,26%. Khoảng cách về mức cải thiện ròng giữa ba mô hình dẫn đầu lớn hơn đáng kể so với khoảng tin cậy của chúng, tạo nên một cục diện phân tầng rõ rệt.

Mô hình nội địa GLM 5.2 (Max) đã lọt vào Top 10 ở vị trí thứ 9 với mức cải thiện ròng 6,24%. Tốc độ phục hồi Bash của nó chỉ là 4,45, tốt hơn nhiều so với mức trung bình của nhóm dẫn đầu, cho phép phục hồi nhanh chóng sau khi lệnh gặp lỗi, thể hiện hiệu suất vượt trội.

Các mô hình nội địa bao phủ nhiều vị trí từ cao đến trung bình trên bảng xếp hạng tác nhân, với năng lực liên quan đến công cụ rất ấn tượng:

Zhipu AI glm-5.2 (max) xếp hạng 9, mức cải thiện ròng 6,24%, tỷ lệ xác nhận tác vụ thành công 8,72%;

Zhipu AI glm-5.1 xếp hạng 16, mức cải thiện ròng 1,19%;

Alibaba qwen3.7 Plus xếp hạng 18, mức cải thiện ròng 0,61%, tỷ lệ ảo tưởng công cụ chỉ 0,19%;

Moonshot AI kimi-k2.7-code xếp hạng 20, mức cải thiện ròng 0,76%;

Alibaba qwen3.7 Max xếp hạng 21, mức cải thiện ròng 0,81%;

Kimi K3AIBảng xếp hạng AILLMCông nghệ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home ITHome. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.