The Decoder: AI News
85

Thủ thuật

Qwen3.8 Max bắt kịp Claude Opus 4.8, nhưng Kimi K3 mới là 'vua' hiệu năng với chi phí rẻ hơn 25%

(giờ Việt Nam)

Tóm tắt AI

Qwen3.8 Max đạt 56 điểm trên bảng xếp hạng Artificial Analysis, ngang bằng Claude Opus 4.8. Tuy nhiên, Kimi K3 dẫn trước với 57 điểm trong khi tiết kiệm chi phí vận hành tới 25%.

Bản dịch AI

Qwen3.8 Max của Alibaba đạt 56 điểm trên Artificial Analysis Intelligence Index, tăng 10 điểm so với Qwen3.7 Max (46). Theo Artificial Analysis, mức điểm này đưa mô hình ngang hàng với Claude Opus 4.8 và vượt trên GLM-5.2 (51), nhưng vẫn đứng sau Kimi K3 (57) – mô hình vốn cũng có chi phí vận hành rẻ hơn 25%.

Trên GDPval-AA, một bộ tiêu chuẩn đánh giá các tác vụ liên quan đến công việc, Qwen đã tăng 468 điểm Elo lên mức 1.739, vượt qua Kimi K3 (1.685). Chỉ có Claude Opus 5 (1.852) là đạt điểm cao hơn. Vấn đề nằm ở cách thức đạt được kết quả này: Qwen3.8 Max cần tới 64 bước cho mỗi tác vụ thay vì 14, và số lượng token đầu vào tăng gấp 15 lần do bài kiểm tra gửi lại toàn bộ lịch sử hội thoại cho mô hình ở mỗi bước.

Mô hình hoạt động kỹ lưỡng hơn nhưng lại chạy chậm hơn và tốn kém hơn. Tỷ lệ hiệu năng trên giá thành của Alibaba bị ảnh hưởng bất chấp giá token đã giảm (đầu vào giảm từ 2,50 USD xuống 2,00 USD mỗi triệu token, đầu ra từ 7,50 USD xuống 6,00 USD, và cache hits từ 0,50 USD xuống 0,25 USD). Một tác vụ đơn lẻ trên Intelligence Index hiện có giá 1,14 USD, cao hơn gấp đôi so với Qwen3.7 Max (0,53 USD). Kimi K3 đạt điểm cao hơn một điểm với chi phí chỉ 0,86 USD mỗi tác vụ, và GLM-5.2 có mức giá 0,57 USD.

Ngoài ra còn có những sự sụt giảm hiệu năng so với phiên bản trước. Chỉ số AA-LCR giảm 2 điểm, đây là bài kiểm tra khả năng tổng hợp thông tin chính xác từ các văn bản rất dài của mô hình. AA-Omniscience giảm 10 điểm, vốn dùng để đo lường việc mô hình trả lời các câu hỏi kiến thức một cách chính xác hay trung thực thừa nhận không biết. Tỷ lệ chính xác vẫn duy trì ở mức khoảng 31%, nhưng tỷ lệ ảo tưởng (hallucination) đã tăng từ 23% lên 40%. Qwen3.8 Max đoán mò thường xuyên hơn nhiều thay vì thừa nhận không biết.

Tin tức AI không thổi phồng – Được biên soạn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo chuyên sâu "AI Radar" độc quyền sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.

Đăng ký ngay

QwenKimiClaudeĐánh giá AIMô hình ngôn ngữ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.