IT Home ITHome
92

Mô hình

Kimi K3 của Moonshot AI vượt mặt GPT-5.6 Sol, đứng thứ 2 thế giới về năng lực xử lý công việc

(giờ Việt Nam)

Tóm tắt AI

Mô hình Kimi K3 đạt 1543 điểm trên bảng xếp hạng AA-Briefcase, chỉ xếp sau Claude Fable 5. Đây là bước tiến lớn của Moonshot AI trong việc xử lý các tác vụ doanh nghiệp phức tạp và dữ liệu quy mô lớn.

Bản dịch AI

Theo tin từ IT ngày 24 tháng 7, Artificial Analysis đã cập nhật bộ tiêu chuẩn đánh giá tác vụ tri thức dành cho AI Agent là AA-Briefcase vào ngày 22 tháng 7. Kết quả cho thấy mô hình Kimi K3 đạt 1543 điểm, vượt qua GPT-5.6 Sol (1501 điểm) và chỉ đứng sau mô hình Claude Fable 5 (1574 điểm).

Lưu ý từ IT: AA-Briefcase là bộ tiêu chuẩn đánh giá tác vụ tri thức dành cho AI Agent tiên tiến, được tổ chức đánh giá AI độc lập Artificial Analysis ra mắt vào tháng 6 năm 2026.

Bộ tiêu chuẩn này được thiết kế để đánh giá hiệu suất của AI trong việc xử lý các nghiệp vụ thực tế có chu kỳ dài và độ phức tạp cao. Nó mô phỏng môi trường làm việc thực tế và hỗn loạn tại các doanh nghiệp, kiểm tra các kịch bản như khoa học dữ liệu, quản lý sản phẩm, chiến lược doanh nghiệp, đồng thời xử lý lượng lớn ngữ cảnh rời rạc (bao gồm hơn 25.000 tin nhắn Slack, hơn 3.500 email, biên bản cuộc họp và báo cáo tài chính, v.v.) và yêu cầu tạo ra các sản phẩm bàn giao thực tế như mô hình tài chính Excel, slide thuyết trình hội đồng quản trị.

Theo kết quả điểm số mới nhất, mô hình Kimi K3 đạt 1543 điểm trên AA-Briefcase, chỉ xếp sau Claude Fable 5 (1574 điểm), vượt qua GPT-5.6 Sol (tối đa 1501), Claude Sonnet 5 (tối đa 1388) và Claude Opus 4.8 (tối đa 1347). Để so sánh, mô hình Kimi K2.6 trước đó đạt 816 điểm trên bảng xếp hạng này.

Đọc thêm

Mô hình Kimi K3 được Moonshot AI chính thức ra mắt vào ngày 16 tháng 7 năm 2026. Đây là mô hình flagship mạnh mẽ nhất của hãng tính đến thời điểm hiện tại, sở hữu 2,8 nghìn tỷ tham số và cửa sổ ngữ cảnh 1 triệu Tokens, đặc biệt xuất sắc trong các tác vụ lập trình, game/3D và các tác vụ liên quan đến tri thức.

Về khả năng lập trình, Kimi K3 từng đứng đầu bảng xếp hạng Frontend Code Arena với 1679 điểm, vượt qua Claude Fable 5 và giành vị trí dẫn đầu trong 6 trên 7 lĩnh vực frontend như tiếp thị thương hiệu và phân tích dữ liệu.

Mô hình Kimi K3 áp dụng hình thức tính phí theo lưu lượng, với chi phí cho mỗi 1 triệu Tokens đầu vào là 2 nhân dân tệ khi có cache hit và 20 nhân dân tệ khi không có cache hit, chi phí đầu ra là 100 nhân dân tệ.

Gần đây có thông tin cho rằng Microsoft đang thử nghiệm nội bộ mô hình Kimi K3 và đánh giá tính khả thi của việc tích hợp một phần mô hình này vào trợ lý AI Copilot nhằm giảm chi phí suy luận.

Tuyên bố quảng cáo: Các liên kết chuyển hướng bên ngoài trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, giúp tiết kiệm thời gian chọn lọc, kết quả chỉ mang tính chất tham khảo. Tất cả các bài viết trên IT đều bao gồm tuyên bố này.

Kimi K3Moonshot AIAI AgentGPT-5.6Claude Fable
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home ITHome. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.