Mô hình
SpaceXAI ra mắt Grok 4.6: Mô hình 500K token tối ưu cho lập trình và tác vụ thông minh
(giờ Việt Nam)
Tóm tắt AI
Grok 4.6 là bản nâng cấp hậu huấn luyện từ Grok 4.5, hỗ trợ cửa sổ ngữ cảnh 500K token, xử lý đa phương thức và bổ sung chế độ suy luận chuyên sâu xhigh.
Bản dịch AI

SpaceXAI vừa phát hành Grok 4.6. Đây là bản nâng cấp sau huấn luyện (post-training) của Grok 4.5 thay vì là một mô hình nền tảng lớn hơn. SpaceXAI giữ nguyên nền tảng và tập trung cải tiến vào quá trình huấn luyện bổ sung kéo dài hơn, tái tạo các quỹ đạo tinh chỉnh có giám sát (supervised fine-tuning trajectories) và học tăng cường trong các môi trường tác nhân (agentic environments). Các tác nhân này có khả năng duy trì nhiệm vụ qua nhiều bước mà không bị chệch hướng. Grok 4.6 đạt 61 điểm trên Artificial Analysis Intelligence Index, tăng 5 điểm so với Grok 4.5 và ngang bằng với GPT-5.6 Sol Max. Mô hình hỗ trợ 500.000 token ngữ cảnh, hiện đã có mặt trên Cursor và Grok Build, đồng thời bổ sung mức độ nỗ lực suy luận xhigh mới, cao hơn so với các mức mà Grok 4.5 cung cấp trước đó.
Liệu mô hình này có thể triển khai được không?
Có, trong môi trường sản xuất với một tập hợp khối lượng công việc giới hạn. Mô hình hiện đã khả dụng rộng rãi thông qua xAI API dưới tên grok-4.6, là mô hình mặc định trong Grok Build, được tích hợp sẵn trong Cursor trên tất cả các gói dịch vụ và có thể định tuyến qua OpenRouter, Vercel và Cloudflare. Hiện không có bản phát hành mã nguồn mở (open-weights) hay tùy chọn tự lưu trữ (self-hosting), vì vậy các triển khai trong môi trường cách ly (air-gapped) là không khả thi.
Những thay đổi thực tế
Grok 4.6 không phải là một mô hình nền tảng lớn hơn. SpaceXAI mô tả đây là một quá trình huấn luyện bổ sung kéo dài hơn so với Grok 4.5, sử dụng dữ liệu được tuyển chọn do mô hình tạo ra cho các khái niệm kỹ thuật nâng cao và suy luận, dữ liệu kỹ thuật chất lượng cao, cùng với bộ tối ưu hóa và công thức huấn luyện cải tiến.
Grok 4.5 sau đó được sử dụng để tái tạo các quỹ đạo tinh chỉnh có giám sát trên nhiều cấp độ nỗ lực suy luận, các bộ công cụ tác nhân và các lĩnh vực bao gồm STEM, kỹ thuật phần mềm và công việc tri thức, với các dấu vết lỗi được lọc bởi các kiểm tra dựa trên mô hình. Học tăng cường được thực hiện sau đó trong các môi trường tác nhân bao gồm công việc tri thức, lập trình tổng quát, phát triển web, thiết kế hỗ trợ bằng máy tính và tối ưu hóa nhân (kernel).
Thông tin chi tiết về hành vi là một điểm quan trọng: trên các quỹ đạo dài hơn, SpaceXAI báo cáo rằng mô hình thực hiện việc tự kiểm tra và xác minh nhiều hơn, tự kiểm tra công việc của chính mình trước khi tiếp tục. Đây là quan sát từ phía nhà cung cấp thông qua thử nghiệm nội bộ, không phải là kết quả đo lường độc lập.
Mô hình hỗ trợ 500.000 token ngữ cảnh, chấp nhận đầu vào là văn bản và hình ảnh với đầu ra chỉ là văn bản, không có giới hạn đầu ra văn bản được công bố và có mốc cắt dữ liệu kiến thức là ngày 1 tháng 2 năm 2026. Tham số reasoning_effort hiện hỗ trợ các mức low, medium, high (mặc định) và mức xhigh mới. SpaceXAI không công bố số lượng tham số cho Grok 4.6.
Các điểm chuẩn (Benchmarks): hãy đọc các chỉ số mất mát (losses) trước
Trên bảng ra mắt của xAI, Grok 4.6 (High) đạt 61 điểm trên Artificial Analysis Intelligence Index, tăng từ 56 điểm của Grok 4.5 và ngang bằng với GPT-5.6 Sol Max. Mô hình này dẫn đầu bảng xếp hạng trên GDPval-AA v2 (1753 Elo, so với 1526 của Grok 4.5), AA-Briefcase (1577, so với 1313) và Harvey LAB.
Mô hình này tụt hậu ở các hạng mục lập trình quan trọng nhất đối với các đội ngũ kỹ thuật. DeepSWE v1.1 đạt 65,9%, tăng 11,9 điểm so với thế hệ trước nhưng vẫn đứng sau GPT-5.6 Sol Max với 73%. Terminal-Bench v3.0 đạt 26%, gần gấp đôi mức 15,7% của Grok 4.5 nhưng vẫn đứng cuối trong bốn mô hình được liệt kê. CursorBench v3.2 đạt 69,9%, FrontierCode v1.1 Extended đạt 61,3% và APEX-Agents đạt 57,5%.
Hai điều cần lưu ý khi đánh giá. Thứ nhất, các chiến thắng được in đậm trên bảng xếp hạng GDPval-AA v2 và AA-Briefcase nằm trong khoảng tin cậy do Artificial Analysis công bố — đó là các kết quả hòa về mặt thống kê, không phải là dẫn đầu. Thứ hai, tập hợp so sánh không bao gồm Claude Opus 5 của Anthropic, mô hình hiện đang đứng đầu chỉ số đó. Các chỉ số mất mát được tiết lộ là tín hiệu đáng tin cậy hơn.
Giá cả và quyền truy cập
Theo ghi chú phát hành, Grok 4.6 có giá 2 USD / 0,50 USD / 6 USD cho mỗi 1 triệu token (đầu vào / đầu vào được lưu trữ / đầu ra) dưới 200 nghìn token prompt, và 4 USD / 1 USD / 12 USD trên ngưỡng đó. Trang ra mắt cũng đề cập đến một biến thể nhanh hơn với giá gấp đôi, nhưng không có ID mô hình riêng biệt nào được công bố. Grok Build và Cursor đang cung cấp mức sử dụng bao gồm gấp đôi trong tuần đầu tiên.
Các nhóm nên thiết lập một prompt_cache_key (hoặc tiêu đề x-grok-conv-id trên Chat Completions). Nếu không có nó, các yêu cầu sẽ bị phân tán trên các máy chủ và việc truy cập bộ nhớ đệm trở nên không đáng tin cậy, do đó mức giá đầu vào đầy đủ sẽ được áp dụng.
Trình giải thích tương tác
Những điểm chính cần lưu ý
Xem CHI TIẾT KỸ THUẬT ĐẦY ĐỦ tại đây. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML của chúng tôi và đăng ký nhận Bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Cần hợp tác với chúng tôi để quảng bá GitHub Repo, Hugging Face Page, Sản phẩm mới hoặc Hội thảo trực tuyến của bạn? Hãy kết nối với chúng tôi.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có thể hành động được.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.