Thủ thuật
Bảng xếp hạng AI tuần 35: GLM-5.3-Flash lọt top 10 code, Qwen3.8-Max-0902 thống trị mảng Frontend
(giờ Việt Nam)
Tóm tắt AI
Bảng xếp hạng Arena tuần 35 ghi nhận sự bứt phá của GLM-5.3-Flash trong lĩnh vực lập trình và Qwen3.8-Max-0902 vượt mặt Claude-Opus-5-Max để dẫn đầu bảng xếp hạng phát triển Frontend.
Bản dịch AI
Theo tin từ IT ngày 2 tháng 9, nền tảng Arena (arena.ai) đã công bố bảng xếp hạng mù các mô hình ngôn ngữ lớn (LLM) tuần thứ 35 năm 2026 (từ 24/8 đến 30/8). Tuần này, nhiều mô hình mới "nội địa" đã ra mắt và đạt được thứ hạng ấn tượng.
Mô hình nội địa GLM-5.3-Flash lần đầu tiên lọt vào Top 10 bảng xếp hạng lập trình, Qwen3.8-Max-0902 ngay khi vừa ra mắt đã chiếm lĩnh vị trí dẫn đầu bảng xếp hạng phát triển Frontend, Kimi-K3-Max duy trì ổn định vị trí trong Top 10 bảng xếp hạng tổng hợp. Nhìn chung, các mô hình nội địa tiếp tục duy trì sức cạnh tranh trong các lĩnh vực chuyên biệt.
Lưu ý từ IT: Bảng xếp hạng này dựa trên các lượt bình chọn mù ẩn danh từ nền tảng Arena (arena.ai), tính toán thứ hạng thông qua ELO (đối với bảng xếp hạng tác nhân/agent là tỷ lệ phần trăm tín hiệu). Kết quả phản ánh sở kiến chủ quan của người dùng thay vì là bài kiểm tra năng lực tuyệt đối; các bảng xếp hạng phụ độc lập với nhau, không nên so sánh chéo, các mức chênh lệch điểm nằm trong phạm vi sai số được coi là ngang hàng, và các mô hình mới cần tích lũy đủ số lượng bình chọn mới được chính thức đưa vào bảng xếp hạng.
Bảng xếp hạng tổng hợp
Tuần này, cục diện dẫn đầu bảng xếp hạng tổng hợp khá ổn định. Claude-Fable-5 tiếp tục giữ vững vị trí số 1 với 1508 điểm. Nhiều mô hình của Anthropic chiếm giữ 7 vị trí đầu bảng, sự thay đổi thứ hạng đều nằm trong phạm vi 1 bậc, chênh lệch điểm ELO đều dưới 30 điểm, cho thấy sự bám đuổi sát sao trong phạm vi sai số thống kê.
Ngoài ra, tuần này có hai mô hình mới gia nhập bảng xếp hạng là Google Gemini-3-Flash và Zhipu GLM-5.3-Flash, lần lượt ra mắt ở vị trí thứ 27 và 30 với số điểm ELO tương ứng là 1474 và 1473.
Các mô hình nội địa nhìn chung đang ở vị trí trung bình khá:
Moonshot AI kimi-k3-max có thứ hạng cao nhất, đứng thứ 10 với 1489 điểm ELO, giữ nguyên thứ hạng;
Zhipu glm-5.3-max đứng thứ 17 với 1482 điểm ELO, giảm 4 bậc so với tuần trước;
Alibaba qwen3.8-max đứng thứ 20 với 1479 điểm ELO, giảm 1 bậc so với tuần trước;
Alibaba qwen3.7-max-preview đứng thứ 28 với 1474 điểm ELO, giảm 1 bậc;
Zhipu glm-5.3-flash đứng thứ 30 với 1473 điểm ELO, là mô hình mới gia nhập bảng xếp hạng tuần này.
Bảng xếp hạng lập trình
Tuần này, vị trí dẫn đầu bảng xếp hạng lập trình vẫn bị Anthropic thống trị. Claude-Opus-4-7-high vững vàng ở vị trí thứ nhất với 1552 điểm, chênh lệch điểm ELO giữa top 3 chỉ là 1 điểm, được coi là ngang hàng trong phạm vi sai số.
Đáng chú ý nhất là mô hình nội địa mới GLM-5.3-Flash lần đầu tiên lọt vào Top 10, đứng ở vị trí thứ 7 với 1535 điểm ELO, vượt qua đại đa số các mô hình nước ngoài hàng đầu. Ngoài ra, mô hình mới GPT-5.6-Terra-Xhigh của OpenAI cũng lần đầu tiên góp mặt, đứng thứ 30 với 1519 điểm ELO.
Nhiều mô hình nội địa đã lọt vào nhóm dẫn đầu bảng xếp hạng lập trình:
Moonshot AI kimi-k3-max đứng thứ 6 với 1542 điểm ELO, giữ nguyên thứ hạng;
Zhipu glm-5.3-flash đứng thứ 7 với 1535 điểm ELO, là mô hình mới gia nhập tuần này;
Zhipu glm-5.3-max đứng thứ 16 với 1528 điểm ELO, giảm 6 bậc so với tuần trước;
Alibaba qwen3.7-max-preview đứng thứ 18 với 1525 điểm ELO, giảm 1 bậc;
Xiaomi mimo-v2.5-pro đứng thứ 24 với 1521 điểm ELO, tăng 3 bậc;
Alibaba qwen3.8-max đứng thứ 29 với 1519 điểm ELO, giảm 4 bậc.
Bảng xếp hạng phát triển Frontend
Tuần này, bảng xếp hạng phát triển Frontend chứng kiến sự thay đổi lớn. Mô hình mới Qwen3.8-max-0902 của Alibaba ngay khi vừa ra mắt đã chiếm lĩnh vị trí dẫn đầu với 1691 điểm, đẩy Claude-Opus-5-Max xuống vị trí thứ hai.
Mô hình mới Hy4-Preview của Tencent ra mắt ở vị trí thứ 8 với 1627 điểm ELO; Qwen3.8-flash-next của Alibaba ra mắt ở vị trí thứ 9 (1622 điểm), GLM-5.3-Flash của Zhipu ra mắt ở vị trí thứ 12 (1604 điểm). Bốn mô hình nội địa mới đồng loạt lọt vào Top 12 với màn thể hiện cực kỳ ấn tượng.
Các mô hình nội địa chiếm ưu thế lớn trong bảng xếp hạng phát triển Frontend với vị trí dẫn đầu ổn định:
Alibaba qwen3.8-max-0902 đứng thứ 1 với 1691 điểm ELO, là mô hình mới gia nhập tuần này;
Moonshot AI kimi-k3-max đứng thứ 3 với 1674 điểm ELO, giảm 1 bậc;
Alibaba qwen3.8-max đứng thứ 4 với 1669 điểm ELO, giảm 1 bậc;
Tencent hy4-preview đứng thứ 8 với 1627 điểm ELO, là mô hình mới gia nhập tuần này;
Alibaba qwen3.8-flash-next đứng thứ 9 với 1622 điểm ELO, là mô hình mới gia nhập tuần này;
Zhipu glm-5.3-flash đứng thứ 12 với 1604 điểm ELO, là mô hình mới gia nhập tuần này.
Bảng xếp hạng tác nhân (Agent)
Tuần này, cục diện dẫn đầu bảng xếp hạng tác nhân cơ bản ổn định. Các mô hình của Anthropic vẫn chiếm giữ Top 3, Claude Opus 5 (High) tiếp tục giữ vị trí số 1 với tỷ lệ cải thiện ròng 13,74%, tỷ lệ ảo tưởng công cụ (tool hallucination) chỉ 0,8%, thấp nhất trong các mô hình hàng đầu. Đáng chú ý là GLM 5.2 (Max) của Zhipu đã tăng mạnh 7 bậc lên vị trí thứ 10, với tỷ lệ cải thiện ròng 6,23% và tỷ lệ xác nhận nhiệm vụ thành công đạt 8,65%, thể hiện rất xuất sắc.
Tuần này có 4 mô hình mới gia nhập bảng xếp hạng, bao gồm SpaceXAI Grok-4.6 (xHigh), Zhipu GLM 5.3 Flash, Zhipu GLM 5.3 (Max), Alibaba Qwen3.8 Flash Next và Alibaba Qwen 3.8 27B. Trong đó, Grok-4.6 (xHigh) ra mắt ở vị trí thứ 15 với tỷ lệ cải thiện ròng 5,33%.
Nhiều mô hình nội địa đã lọt vào Top 20 bảng xếp hạng tác nhân, thứ hạng cụ thể:
Moonshot AI Kimi K3 (Max) đứng thứ 6, tỷ lệ cải thiện ròng 8,71%, tỷ lệ xác nhận nhiệm vụ thành công 16,90%, giảm 2 bậc so với tuần trước;
DeepSeek V4 Pro (High) (0813) đứng thứ 14, tỷ lệ cải thiện ròng 5,91%, tỷ lệ xác nhận nhiệm vụ thành công 13,14%;
Alibaba Qwen3.8 Max đứng thứ 16, tỷ lệ cải thiện ròng 5,24%, tỷ lệ ảo tưởng công cụ chỉ 0,11%;
Zhipu GLM 5.2 (Max) đứng thứ 10, tỷ lệ cải thiện ròng 6,23%, tăng 7 bậc so với tuần trước.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.