Thủ thuật
Grok 4.6 của SpaceXAI đạt 61 điểm trên bảng xếp hạng Artificial Analysis
(giờ Việt Nam)
Tóm tắt AI
Grok 4.6 đạt 61 điểm trên Artificial Analysis, ngang bằng GPT-5.6 Sol nhưng có chi phí rẻ hơn 60%. Với cửa sổ ngữ cảnh 500k token và hiệu suất ấn tượng, đây là lựa chọn tối ưu về kinh tế cho người dùng.
Bản dịch AI

Grok 4.6 của SpaceXAI đạt 61 điểm trên Artificial Analysis Intelligence Index, gia nhập nhóm dẫn đầu cùng với GPT-5.6 Sol, với hiệu suất tác vụ (agentic performance) vượt trội ở mức chi phí thấp hơn.
Grok 4.6 tăng 5 điểm so với Grok 4.5 trên Intelligence Index chỉ hơn một tháng sau khi ra mắt, tương đương mức tăng +23 điểm so với Grok 4.3. Điều này đưa SpaceXAI trở lại nhóm dẫn đầu về trí tuệ cùng với OpenAI, chỉ đứng sau Anthropic.
Những điểm chính: ➤ Grok 4.6 gia nhập nhóm dẫn đầu của Artificial Analysis Intelligence Index: Đạt 61 điểm, ngang bằng với GPT-5.6 Sol (max), đứng sau Claude Opus 5 (max, 63) và Claude Fable 5 (max with fallback, 62), và chỉ nhỉnh hơn Kimi K3.
➤ Hiệu suất tác vụ mạnh mẽ: Grok 4.6 đạt Elo 1753 trên GDPval-AA v2, chỉ đứng sau Claude Opus 5 và có khoảng tin cậy chồng lấn với Claude Fable 5 và Qwen3.8 Max. Mô hình đạt 50,7% trên 𝜏³-Banking, nằm trong top hai điểm số cao nhất cùng với Qwen3.8 Max (51,3%), và 88,4% trên Terminal-Bench v2.1, ngang bằng với các mô hình hàng đầu.
➤ Trí tuệ cấp độ dẫn đầu với chi phí thấp hơn: Giá niêm yết không đổi so với Grok 4.5 ở mức $2/$6 cho mỗi 1 triệu token đầu vào/đầu ra, thấp hơn 60%+ so với Claude Opus 5 ($5/$25) và GPT-5.6 Sol ($5/$30). Chi phí thực hiện là $0,84 mỗi tác vụ, tương đương với Kimi K3 nhưng có trí tuệ cao hơn một chút, đưa mô hình này lên đường biên Pareto về Trí tuệ so với Chi phí mỗi tác vụ.
➤ Grok 4.6 nằm ở phân khúc Fable 5 trên AA-Briefcase, bộ tiêu chuẩn đánh giá riêng của chúng tôi về các tác vụ tri thức tác vụ dài hạn, với Elo 1577 - đứng sau dòng Claude Opus 5. Mô hình này đặc biệt hiệu quả về số lượt tương tác, hoàn thành các tác vụ trung bình trong khoảng 53 lượt và ~0,5 tỷ token đầu vào so với ~103 lượt và ~2,0 tỷ token đầu vào của Claude Opus 5 (max).
Thông tin chi tiết khác về mô hình: ➤ Cửa sổ ngữ cảnh 500k token (không đổi so với Grok 4.5).
➤ Giá $2/$6 cho mỗi 1 triệu token đầu vào/đầu ra; cache hits được giảm giá còn $0,5 cho mỗi 1 triệu token, tăng so với mức $0,3 cho mỗi 1 triệu token của Grok 4.5 đối với cache hits.

Hiệu suất tác vụ (Agentic performance)
Kết quả mạnh mẽ nhất của Grok 4.6 nằm ở các tác vụ thực thi thay vì suy luận tĩnh. Trên GDPval-AA v2, thước đo hàng đầu của chúng tôi về công việc tri thức tác vụ trong thế giới thực, mô hình đạt Elo 1753 - chỉ đứng sau Claude Opus 5, và không có sự khác biệt đáng kể về mặt thống kê so với Claude Fable 5 và Qwen3.8 Max do khoảng tin cậy chồng lấn.
Mô hình này duy trì phong độ trên các loại tác vụ. 𝜏³-Banking (50,7%) kiểm tra khả năng dịch vụ khách hàng đa lượt với việc sử dụng công cụ và đưa Grok 4.6 vào top hai, trong khi Terminal-Bench v2.1 (88,4%) đưa mô hình ngang hàng với các đối thủ dẫn đầu về các tác vụ phần mềm trên terminal. Ít mô hình nào có khả năng cạnh tranh đồng thời trên các mảng công việc tri thức, dịch vụ khách hàng và sử dụng terminal; kết hợp với mức giá, điều này đưa Grok 4.6 lên đường biên Pareto về chi phí so với hiệu suất cho mọi đánh giá tác vụ trong Intelligence Index.

Chi phí
Việc giữ nguyên giá niêm yết qua một thế hệ là điều bất thường ở nhóm dẫn đầu, nơi các bước tiến về trí tuệ thường đi kèm với việc tăng giá. Grok 4.6 mang lại mức tăng 5 điểm trên Intelligence Index với mức giá $2/$6 không đổi, và chi phí đo lường được là $0,84 mỗi tác vụ phản ánh cả mức giá đó lẫn hiệu quả sử dụng token hợp lý.
Sự so sánh quan trọng đối với người mua là với các mô hình có điểm số chênh lệch trong vòng hai điểm: Claude Opus 5 ở mức $5/$25 và GPT-5.6 Sol ở mức $5/$30. Grok 4.6 cung cấp điểm số Intelligence Index gần như tương đương với GPT-5.6 Sol với mức giá token đầu ra chỉ bằng một phần nhỏ, đây là yếu tố chi phối chi phí trong các khối lượng công việc đòi hỏi suy luận cao.

Công việc tri thức dài hạn
Grok 4.6 ra mắt trên AA-Briefcase, bộ tiêu chuẩn đánh giá riêng của chúng tôi về các tác vụ tri thức tác vụ dài hạn, với Elo 1577. Điều này đưa mô hình vào phân khúc Fable 5, đứng sau dòng Claude Opus 5, với hiệu suất mạnh mẽ nhất quán trên các tiêu chí chấm điểm, chất lượng trình bày và chất lượng phân tích thay vì chỉ mạnh ở một khía cạnh để bù đắp cho điểm yếu ở khía cạnh khác.
Hồ sơ hiệu quả cũng đáng chú ý như điểm số. Grok 4.6 giải quyết các tác vụ trung bình trong ~53 lượt và ~0,5 tỷ token đầu vào, so với ~103 lượt và ~2,0 tỷ token đầu vào của Claude Opus 5 (max). Công việc tri thức tác vụ dài hạn tích lũy ngữ cảnh rất nhanh, vì vậy một mô hình đạt được câu trả lời tương đương với số lượt bằng một nửa và số token đầu vào bằng một phần tư sẽ có lợi thế về chi phí vượt xa mức giá trên mỗi token.

Kết quả đầy đủ
Phân tích chi tiết các đánh giá riêng lẻ trong Artificial Analysis Intelligence Index:

Xem Artificial Analysis để biết thêm chi tiết và các tiêu chuẩn đánh giá của Grok 4.6: https://artificialanalysis.ai/models/grok-4-6
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.