Latent Space
85

Sản phẩm

Tin AI: SpaceXAI ra mắt Grok 4.6 và tính năng Grok @Bot

(giờ Việt Nam)

Tóm tắt AI

Phân khúc trợ lý AI đồng hành vừa đón nhận một bước tiến quan trọng với sự xuất hiện của Grok 4.6 và tính năng @Bot mới từ SpaceXAI.

Bản dịch AI

[AINews] SpaceXAI Grok 4.6 and Grok @Bot

Một trong những chủ đề nổi bật nhất của năm nay là việc các coding agent (tác nhân lập trình) đang dần phá vỡ rào cản để tiến vào lĩnh vực tri thức, và rõ ràng không gian AI teammate/multiplayer/multiagent (cộng sự AI/đa người dùng/đa tác nhân) chính là chiến trường AI lớn tiếp theo. Với việc Claude Tag ra mắt và nhận về những đánh giá trái chiều, cùng với Buzz của Block đòi hỏi người dùng phải có kỹ thuật cao hơn, thị trường vẫn đang chờ đợi một đơn vị dẫn đầu danh mục mới. Và giờ đây, đội ngũ Cursor→SpaceX đã khéo léo tung ra sản phẩm đáp ứng điều đó với những phản hồi rất tích cực:

X avatar for @bot

Grok Bot@bot

Giới thiệu Grok Bot, hiện đang trong giai đoạn beta sớm. Bot là những cộng sự AI thực hiện công việc thực tế thay cho bạn. Chúng đăng nhập vào các công cụ của bạn, sử dụng chúng giống hệt cách bạn làm và quay lại với kết quả công việc đã hoàn thành.

5:09 CH · 11 thg 8, 2026 · 22,9 triệu lượt xem

2,33 nghìn lượt trả lời · 3,22 nghìn lượt đăng lại · 28,9 nghìn lượt thích

Sản phẩm này được vận hành bởi mô hình mới nhất của họ, Grok 4.6, ra mắt hôm nay và được coi là mô hình làm việc tri thức tốt thứ hai trên thế giới (như cả đối thủ Cognition và Elon đều thừa nhận)… mặc dù xét về hiệu suất thì chắc chắn nó đứng đầu:

X avatar for @ArtificialAnlys

Artificial Analysis@ArtificialAnlys

Grok 4.6 đã đạt được những bước tiến lớn trên AA-Briefcase, chuẩn đánh giá công việc tri thức dạng tác nhân của chúng tôi, và có chi phí thấp hơn đáng kể so với các mô hình hàng đầu khác mà AA-Briefcase kiểm tra trên các tác vụ công việc tri thức dạng tác nhân dài hạn. Bộ kiểm tra này được giữ kín để tránh rò rỉ dữ liệu. Grok 4.6 đang bám đuổi sát nút và

5:55 CH · 12 thg 8, 2026 · 29,6 nghìn lượt xem

28 lượt trả lời · 35 lượt đăng lại · 479 lượt thích

Grok 4.6 được xác nhận là mô hình 1.5T, “được xây dựng dựa trên Grok 4.5 với trọng tâm đặc biệt vào các tác nhân hoạt động lâu dài và các công việc tương tác, hình ảnh tham vọng hơn”. Tiết lộ duy nhất về quá trình huấn luyện có thể được trích dẫn đầy đủ như sau (chúng tôi nhấn mạnh):

Grok 4.6 đã trải qua quá trình huấn luyện bổ sung dài hơn so với Grok 4.5, sử dụng dữ liệu được tuyển chọn do mô hình tạo ra để phục vụ suy luận và các khái niệm kỹ thuật nâng cao, dữ liệu kỹ thuật chất lượng cao, cùng bộ tối ưu hóa và công thức huấn luyện cải tiến. Điều này tạo ra nền tảng vững chắc hơn cho các giai đoạn SFT và RL theo sau.

Sau đó, chúng tôi đã sử dụng Grok 4.5 để tái tạo các quỹ đạo SFT trên các nỗ lực suy luận, các bộ khung tác nhân (agent harnesses) và các lĩnh vực như STEM, kỹ thuật phần mềm và công việc tri thức, đồng thời lọc bỏ các dấu vết có vấn đề bằng các kiểm tra dựa trên mô hình. Điểm kiểm tra SFT thu được cho thấy hiệu suất mạnh mẽ và hành vi cải thiện.

Grok 4.6 được huấn luyện trên phạm vi rộng các tác vụ RL dạng tác nhân, bao gồm công việc tri thức, lập trình tổng quát và các môi trường chuyên biệt cho tối ưu hóa nhân (kernel), phát triển web, thiết kế hỗ trợ bằng máy tính (CAD), và nhiều hơn nữa.

Hiện vẫn chưa rõ việc không có sự cố thoát khỏi sandbox khi huấn luyện Grok 4.6 là minh chứng cho năng lực của các kỹ sư hạ tầng hay là lời chỉ trích dành cho các nhà nghiên cứu của họ.

(đó là một câu đùa về các sự kiện hiện tại, đừng giận nhé)

Tin tức AI từ 11/8/2026 đến 12/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm Discord nào. Trang web của AINews cho phép bạn tìm kiếm tất cả các số đã phát hành. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể chọn nhận hoặc hủy nhận email theo tần suất!

Ngày của các mô hình tiên phong (Frontier Model Day): Grok 4.6, Qwen3.8-Max, DeepSeek V4 Pro và MAI-Thinking-1 của Microsoft

Grok 4.6 đạt đến ngưỡng tiên phong về giá thành/hiệu suất: xAI đã phát hành Grok 4.6, được mô tả là bước tiến lớn so với bản 4.5 ở cùng mức giá. Các đánh giá độc lập từ Artificial Analysis xếp nó ở vị trí 61 trên Chỉ số Thông minh (Intelligence Index), ngang ngửa với GPT-5.6 Sol Max, đứng sau Claude Opus/Fable, với kết quả tác nhân mạnh mẽ bao gồm 88,4% trên Terminal-Bench v2.1, 1753 GDPval-AA v2 Elo, và hiệu suất cạnh tranh trên AA-Briefcase với chi phí thấp hơn nhiều (ghi chú AA-Briefcase). Dữ liệu arena sớm từ Code Arena cũng xếp nó gần với GPT-5.6 Sol và Claude Fable trong các tác vụ phát triển web. Giá cả là một chủ đề trọng tâm: AA nhấn mạnh mức $2/$6 cho mỗi 1 triệu token đầu vào/đầu ra, thấp hơn đáng kể so với các đối thủ tiên phong, trong khi những người thực hành ngay lập tức coi đây là lựa chọn mặc định mới cho các khối lượng công việc lập trình và tìm lỗi (Pawel Huryn, khả năng cung cấp của Cognition trong Devin). xAI cho biết các cải tiến đến từ quá trình huấn luyện bổ sung dài hơn, các dấu vết SFT được tái tạo và RL dạng tác nhân trên các lĩnh vực lập trình, web, CAD và tối ưu hóa nhân; họ cũng báo cáo hành vi tự kiểm tra nhiều hơn trong các tác vụ dài (@kimmonismus tóm tắt). Elon cũng cho biết Grok 4.7 đã sẵn sàng, với quá trình huấn luyện ban đầu đã hoàn tất và dự kiến sẽ huấn luyện bổ sung trên dữ liệu nội bộ của SpaceX.

Qwen3.8-Max mã nguồn mở đã ra mắt: Qwen3.8-Max của Alibaba đã được phát hành dưới dạng mô hình MoE mã nguồn mở với tổng 2,4T tham số / 95B tham số hoạt động. Cộng đồng nhấn mạnh vào quy mô, khả năng phục vụ ngay ngày đầu (day-0) và định hướng tác nhân/ngữ cảnh dài: Yuchen Jin gọi đây là một trong những bản phát hành mã nguồn mở lớn nhất từ trước đến nay; vLLM đã hỗ trợ ngay từ ngày đầu cùng với các checkpoint 4-bit dành riêng cho nhà cung cấp cho NVIDIA B300 và AMD MI355X; Together AI và Baseten cũng thông báo hỗ trợ ngay lập tức. Một lưu ý quan trọng từ người dùng: biến thể mã nguồn mở được phát hành dường như chỉ dành cho văn bản, không có đầu vào hình ảnh trong đợt phát hành ban đầu (skalskip92).

DeepSeek V4 Pro GA ra mắt với giá cạnh tranh: Việc triển khai DeepSeek V4 Pro GA ngay lập tức thu hút sự chú ý, không phải vì "điểm chuẩn tốt nhất trong mọi cột" mà vì yếu tố kinh tế. Nhiều nhà quan sát nhấn mạnh mức giá khoảng $0,435/triệu token đầu vào và $0,87/triệu token đầu ra (kimmonismus), với Cline gọi nó rẻ hơn khoảng 57 lần so với Fable 5 trong khi báo cáo những cải tiến đáng kể so với bản xem trước, bao gồm mức tăng 15,8% trên Terminal Bench. Phản ứng về khả năng của nó khá trái chiều: một số người dùng sớm thấy nó ổn nhưng không rõ ràng vượt trội hơn Kimi/Flash trong mọi tác vụ (tổng hợp của Yuchen Jin, scaling01, teortaxesTex), cho thấy những bước tiến tiếp theo của DeepSeek có thể phụ thuộc nhiều vào môi trường RL và công việc tác nhân hơn là quy mô thuần túy.

Microsoft tham gia với mô hình suy luận riêng: Mustafa Suleyman đã công bố MAI-Thinking-1, mô hình suy luận đầu tiên của Microsoft "được xây dựng từ đầu", hiện đã có sẵn trong Foundry. Yêu cầu ban đầu từ đội ngũ mang tính thực tiễn đáng chú ý—Finbarr Timbers đặc biệt yêu cầu phản hồi về việc sử dụng công cụ—điều này cho thấy Microsoft đang định vị nó như một mô hình suy luận ứng dụng thay vì chỉ là một mô hình tham gia đánh giá điểm chuẩn.

Solar Pro 4 cũng đã thăng hạng: Artificial Analysis báo cáo rằng Solar Pro 4 của Upstage đã nhảy từ vị trí 14 lên 42 trên Chỉ số Thông minh, với những cải tiến đặc biệt lớn trong các tác vụ tác nhân và ngữ cảnh dài, mặc dù vẫn đứng sau các mô hình tiên phong và dẫn đầu mã nguồn mở hiện tại cả về điểm số thô lẫn giá cả.

Mô hình đa phương thức mã nguồn mở và mô hình biên (Edge Models): Video, Hình ảnh, Giọng nói và Suy luận cục bộ

LTX-2.5 và hệ sinh thái video mã nguồn mở tiếp tục cải thiện: @RisingSayak nhấn mạnh rằng LTX-2.5 của Lightricks đã có mặt trong Diffusers với một số tính năng thực tế quan trọng cho các quy trình làm việc cục bộ: tạo video kết hợp âm thanh 48 kHz, kiểm soát độ dài clip bằng prompt, chế độ chất lượng 2 lượt, kết xuất theo ô (tile rendering) để giảm mức sử dụng bộ nhớ và tiền xử lý giúp nén lại hình ảnh đầu vào để khớp hơn với dữ liệu huấn luyện. Ostris AI Toolkit đã thêm hỗ trợ ngay trong cùng ngày. Nhìn rộng hơn, nhiều tài khoản đánh giá tuần này là một đợt phát hành đa phương tiện mã nguồn mở mạnh mẽ bất thường, bao gồm MiniMax H3, LTX-2.5, LFM2.5-VL-3B và North Micro Vision (victormustar, multimodalart).

Các VLM nhỏ và đa phương thức cục bộ đang trở nên nghiêm túc: Cohere đã ra mắt North Micro Vision, một VLM nhỏ mã nguồn mở theo giấy phép Apache-2.0 nhắm vào việc hiểu tài liệu, với tuyên bố vượt trội hơn Gemma 4 E2B và Ministral 3 3B trên một loạt các chuẩn đánh giá hình ảnh hỗn hợp (chuỗi kết quả). LFM2.5-VL-3B của Liquid AI cũng liên tục được nhắc đến như một mô hình thị giác nhỏ gọn mạnh mẽ, và người dùng đã trình diễn các hệ thống tác nhân lai cục bộ/từ xa—ví dụ, Hermes Agent sử dụng DeepSeek V4 Flash để lập kế hoạch cộng với LFM2.5-VL-3B cho thị giác cục bộ.

Các bản phát hành về giọng nói và ngôn ngữ ký hiệu có nội dung đặc biệt đáng chú ý: Google DeepMind đã công bố SL2T, một hệ thống chuyển đổi ngôn ngữ ký hiệu sang văn bản hỗ trợ đầu vào ASL trên Android/Pixel 11. Các ghi chú tiếp theo về mặt kỹ thuật rất thú vị: theo dõi tư thế cơ thể diễn ra trên thiết bị, dịch thuật chạy trên máy chủ và hệ thống được tối ưu hóa cho các ràng buộc thực tế như ký hiệu bằng một tay (chi tiết). Ngoài ra, Deepgram đã ra mắt Flux TTS, một mô hình TTS đàm thoại có độ trễ thấp, tuyên bố thời gian phản hồi khoảng 80 ms và khả năng thích ứng giữa cuộc gọi cho các tác nhân giọng nói.

Suy luận, Nén và Hệ thống: vLLM, Lượng tử hóa, Lập lịch CUDA và Hạ tầng xếp hạng

vLLM đã thêm hạ tầng quan trọng cho các mô hình khổng lồ và prompt dài: vLLM hiện hỗ trợ các đường dẫn Azure Blob cho cả việc tải mô hình và các kết nối KV. Công thức của Microsoft/NVIDIA quan trọng về mặt vận hành: tải trọng nhanh hơn thông qua Dynamo ModelExpress (nhanh hơn tới 7,3 lần trên H100/A100) và bộ nhớ đệm KV hỗ trợ bởi blob thông qua LMCache + NIXL, đánh đổi việc tính toán lại bằng cách tìm nạp trên các khối lượng công việc có prompt dài (theo dõi).

Công việc nén đang kéo dài tuổi thọ hữu ích của các mô hình rất lớn: LLM Compressor v0.13.0 đã thêm tính năng tỉa chuyên gia (expert pruning) REAP cho các mô hình MoE—loại bỏ toàn bộ các chuyên gia dựa trên độ nổi bật hiệu chuẩn trước khi lượng tử hóa—cũng như lượng tử hóa tùy ý 3/5/6/7-bit. Ở mức độ cực đoan hơn, Unsloth tuyên bố đã thu nhỏ Qwen3.8-2.4T-A95B từ 4,9 TB xuống 397 GB thông qua lượng tử hóa 1-bit động, giúp việc thực thi cục bộ trở nên khả thi trên các hệ thống có RAM/VRAM từ 410 GB trở lên. Họ cũng trình diễn thiết lập Nemotron 3.5 Lightning 2-bit duy trì các phiên sử dụng công cụ dài trong 22 GB VRAM.

Việc viết kernel GPU đang trở nên an toàn và mang tính khai báo hơn: maharshii nhấn mạnh các kernel Lập lịch tác vụ CuTeDSL 4.7.0, cho phép các nhà phát triển khai báo rõ ràng vai trò warp, tài nguyên, sự phụ thuộc và lịch trình, cho phép kiểm tra tĩnh các tình trạng bế tắc (deadlock), tranh chấp (race) và khởi tạo rào cản trước khi hạ cấp xuống mã GPU. Tác giả tương tự cũng đã đăng một bài giải thích ngắn gọn về các điều kiện tiên quyết đằng sau việc sao chép không đồng bộ TMA—ngữ nghĩa acquire/release, mbarriers và các bộ giá trị số học CuTe—cho những người đang cố gắng suy luận về các nguyên hàm di chuyển bộ nhớ NVIDIA hiện đại (chuỗi).

Các hệ thống gợi ý/xếp hạng cổ điển vẫn âm thầm mang lại hiệu quả: François Chollet chỉ ra việc Expedia chuyển sang thiết lập Keras 3 hiện đại, báo cáo quá trình huấn luyện nhanh hơn 30% và độ trễ suy luận thấp hơn 70% cho các mô hình xếp hạng (tweet). Bài viết tiếp theo của ông nhấn mạnh một điểm chiến lược hơn: các API không phụ thuộc vào backend của Keras giúp giảm sự phụ thuộc vào nhà cung cấp nếu các đội ngũ sau này cần các kernel PyTorch hoặc JAX (ghi chú).

Tác nhân, Bộ khung và Công cụ dành cho nhà phát triển: Độ tin cậy, Bộ nhớ, Plugin và Bảo mật

Hệ thống phía trên mô hình đang trở thành bề mặt sản phẩm chính: Nhiều tweet hội tụ về cùng một chủ đề: nhiều cải tiến thực tế đến từ kỹ thuật bộ khung (harness engineering), bộ nhớ, phê duyệt, đánh giá và công cụ nhiều hơn là việc huấn luyện mô hình tùy chỉnh. Scott Stevenson nhắc lại lập luận rằng RAG và kỹ thuật bộ khung đánh bại việc huấn luyện trong hầu hết các trường hợp vì chúng cá nhân hóa cho từng khách hàng, tránh rủi ro quyền riêng tư, cải thiện theo thời gian thực và kế thừa sự tiến bộ của mô hình cơ sở (chuỗi, theo dõi). Random Walker đã thêm một sự phân biệt sản phẩm hữu ích giữa tác nhân ủy quyền và tác nhân cộng tác, với các mục tiêu tối ưu hóa rất khác nhau về khả năng xác minh, độ trễ và sự kiểm soát của con người (tweet).

Các bản phát hành công cụ phản ánh sự thay đổi đó: @code của GitHub đã giới thiệu Agent Plugins 1.0, đóng gói các kỹ năng, máy chủ MCP và các tiện ích mở rộng AI lại với nhau, đồng thời phát hành các cải tiến UX như cuộn dính (sticky scroll) và xử lý phiên tốt hơn (chuỗi phát hành). Động lực từ phía OpenAI/Codex cũng xuất hiện, bao gồm Codex cho Linux. LangChain đã xây dựng lại bảng điều khiển LangSmith để phân tích và báo cáo dấu vết hữu ích hơn.

Bộ nhớ và trạng thái tác nhân di động đang trở thành kỳ vọng cơ bản: Hermes Agent đã nhận được nhiều cập nhật hệ sinh thái, từ triển khai trên Raspberry Pi đến xuất/nhập hồ sơ dễ dàng và các kỹ năng mới như tạo API có thể tái sử dụng từ lưu lượng truy cập web được quan sát (Teknium). Các ví dụ về Deep Agents được quản lý từ LangChain tập trung rõ ràng vào bộ nhớ bền vững và các quy trình làm việc định kỳ như các tác nhân mạng xã hội (hwchase17).

GrokSpaceXAIAI đồng hànhTrợ lý ảoCông nghệ AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.