smol.ai AI News
85

Mô hình

Moonshot ra mắt Kimi K3: Mô hình MoE 2.8T tham số với kiến trúc đột phá

(giờ Việt Nam)

Tóm tắt AI

Moonshot công bố Kimi K3, mô hình MoE 2.8T tham số tích hợp công nghệ KDA và Gated MLA. Dù có trọng số mở, việc vận hành đòi hỏi hạ tầng phần cứng cực kỳ đắt đỏ, đồng thời xu hướng tác nhân AI trên di động cũng đang phát triển mạnh mẽ.

Bản dịch AI

not much happened today | AINews

Một ngày yên ắng.

Tin tức AI từ 27/7/2026 đến 28/7/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số đã phát hành. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể tùy chọn nhận hoặc hủy nhận email theo tần suất mong muốn!

Tóm tắt AI trên Twitter

Phát hành Open-Weight cho Kimi K3: kiến trúc, cơ sở hạ tầng và chi phí thực tế để vận hành

Thông tin chi tiết về Kimi K3 hiện đã được công bố đầy đủ: Mô hình MoE 2,8 nghìn tỷ tham số của Moonshot với khoảng 104 tỷ tham số hoạt động/token đã được phát hành kèm trọng số, báo cáo kỹ thuật và cơ sở hạ tầng hỗ trợ. Một số phân tích chuyên sâu đều đi đến cùng một kết luận: K3 mở rộng quy mô dựa trên chiều dài, độ sâu và chiều rộng thay vì chỉ dựa vào số lượng tham số. @ZhihuFrontier đã tóm tắt cấu trúc hybrid long-context—Kimi Delta Attention (KDA) kết hợp với Gated MLA, AttnRes theo độ sâu và một LatentMoE thưa; các ghi chú về kiến trúc của @rasbt nhấn mạnh K3 là bước tiến ở quy mô sản xuất của Kimi Linear, với NoPE ở mọi nơi, khả năng đa phương thức gốc và các phần dư attention (attention residuals) giúp tăng hiệu suất ổn định với chi phí thấp. Báo cáo cũng mô tả một quy trình hậu huấn luyện (post-training recipe) đang dần trở thành tiêu chuẩn ở các mô hình tiên phong: huấn luyện nhiều giáo viên RL chuyên biệt, sau đó hợp nhất chúng bằng phương pháp chưng cất on-policy đa giáo viên; xem thêm tại @BhavinJawade.

Cơ sở hạ tầng là một phần của bản phát hành, không phải là yếu tố phụ: Cùng với mô hình, Moonshot đã phát hành MoonEP, FlashKDA và AgentEnv, nhấn mạnh rằng K3 phụ thuộc vào khả năng giao tiếp, các kernel và môi trường huấn luyện tác nhân (agent) biệt lập cũng nhiều như phụ thuộc vào kiến trúc mô hình. Chủ đề này liên tục xuất hiện trong các bình luận và công việc triển khai: Ghi chú của Baseten định hình K3 như một hệ thống phân bổ năng lực theo chức năng—bộ nhớ tái phát, truy xuất định kỳ, các chuyên gia thưa và truy cập phần dư có chọn lọc—trong khi tài liệu của NVIDIA hỗ trợ triển khai trên Dynamo và Red Hat AI đã phát hành checkpoint được tinh chỉnh FP8-Block Hopper cho H100/H200 với hỗ trợ vLLM ngay từ ngày đầu. Phản ứng của cộng đồng cho rằng báo cáo này vừa cực kỳ phong phú vừa cực kỳ dày đặc: “nếu bạn muốn cảm thấy mình kém cỏi, hãy đọc báo cáo kỹ thuật của Kimi K3”.

Open weights không có nghĩa là dễ dàng tiếp cận: Một lập luận phản bác hữu ích đối với quan điểm “mở” đến từ phân tích chi phí của @ZhihuFrontier, cho rằng K3 thực chất là một dự án cơ sở hạ tầng. Các cấu hình tối thiểu được xác thực công khai là khoảng 8× MI355X chỉ để tải mô hình; việc phục vụ sản xuất thực tế có thể yêu cầu hơn 64 GPU trong một miền băng thông cao vì việc định tuyến chuyên gia và kết nối liên thông trở thành nút thắt cổ chai. Ước tính: chi phí đầu vào sáu con số USD cho một máy chủ 8-GPU, với các triển khai quy mô sản xuất lên tới hàng chục triệu RMB. Trên thực tế, nhiều người dùng sẽ sử dụng K3 thông qua các dịch vụ lưu trữ thay vì tự host. Các nhà cung cấp đã phản ứng nhanh chóng: Perplexity đã thêm K3 được lưu trữ tại Hoa Kỳ cho gói Pro/Max, Baseten cung cấp khả năng suy luận ngay từ ngày đầu và Together đã lên lịch cho một buổi phân tích kỹ thuật chuyên sâu với Moonshot.

Sản phẩm tác nhân (agent), quy trình lập trình và điều phối trên thiết bị di động

Mô hình “làm việc với tác nhân từ mọi nơi” đang dần củng cố: Nhiều bài đăng chỉ ra một lớp UX mới, nơi các tác nhân lập trình hoặc tác nhân tri thức chạy không đồng bộ trong khi người dùng giám sát từ thiết bị di động hoặc giọng nói. @danizeres mô tả ChatGPT Voice + Codex là cách để duy trì cuộc trò chuyện với các tác nhân đang hoạt động trong khi chạy bộ, đi bộ hoặc lái xe, tập trung vào việc ưu tiên và đánh giá thay vì gõ câu lệnh. Các phản ứng tương tự xuất hiện xung quanh việc điều khiển tác nhân ưu tiên di động trong Cursor: Cursor đã ra mắt “Start” tại Ấn Độ với giá ₹649/tháng cùng Grok 4.5, Composer, các tác nhân đám mây, máy chủ MCP, hooks và hỗ trợ iOS; Aman Sanger lưu ý rằng mức sử dụng tại Ấn Độ đã tăng gấp ba lần so với cùng kỳ năm ngoái, với số lượng yêu cầu tác nhân trên mỗi người dùng cao hơn bất kỳ quốc gia nào khác. Perplexity cũng thúc đẩy hướng đi tương tự với Personal Computer trên Windows—công cụ điều khiển tác nhân cục bộ trên các tệp, ứng dụng và web—cộng với Model Council bên trong Computer để so sánh đa mô hình và tổng hợp trích dẫn (ra mắt, Model Council).

Bài học thực tế từ các tác nhân lập trình là các bộ khung (harnesses) và giàn giáo (scaffolding) rất quan trọng: Một số bình luận thu hút nhất từ các nhà vận hành không nằm ở các mô hình cơ sở, mà ở việc chất lượng quy trình làm việc phụ thuộc nhiều như thế nào vào hệ thống xung quanh. @theo cho biết việc viết lại CLAUDE.md / AGENTS.md và các kỹ năng là “hoàn toàn xứng đáng”, trong khi OpenAI nhấn mạnh các tác nhân lập trình cho tính toán khoa học nhưng nhấn mạnh vào sự xác minh của con người và sự quản lý lâu dài. Cũng có những dấu hiệu của sự trưởng thành đi kèm khó khăn: những lời phàn nàn lặp đi lặp lại về việc Codex bị reset (ví dụ), sự thất vọng với Opus 5 trong các cài đặt tác nhân lập trình (@omarsar0) và quan sát rằng các mô hình khác nhau thể hiện “tính cách tác nhân” rất khác nhau. Một chủ đề lặp đi lặp lại là kết quả tốt ngày càng đến từ các vòng lặp đánh giá-thực thi (judge-executor loops), các tác nhân phụ và các lớp đánh giá rõ ràng thay vì câu lệnh một lần (one-shot prompting); xem các ví dụ về bộ khung mô phỏng/trò chơi của @omarsar0 và ghi chú của earlysignalsvc về Command Center như một lớp đánh giá mã cho các diff AI.

Các tiêu chuẩn đánh giá (benchmark) và nghiên cứu về tác nhân dài hạn, mô hình thế giới và tính toàn vẹn của đánh giá

Đánh giá dài hạn đang trở nên thực tế hơn, và các tác nhân hiện tại vẫn gặp khó khăn: Một số bản phát hành tập trung vào các môi trường nơi các phần thưởng câu trả lời cuối cùng đơn giản hoặc các đánh giá ngắn hạn không còn hiệu quả. MazeBench là một tiêu chuẩn đánh giá thế giới mở 3D cho khả năng suy luận không gian thị giác và lập kế hoạch dài hạn, nơi “các tác nhân tốt nhất hiện nay không thể tiến xa hơn các cấp độ ban đầu”. WorldModelGym định hình lại việc đánh giá mô hình thế giới xung quanh độ trung thực của quyết định—liệu một mô hình có dự đoán được hành động nào dẫn đến kết quả tốt nhất hay không—thay vì tính chân thực của video, với Dreamer-v3 là mục nhập công khai đầu tiên. Về phía huấn luyện, @ZhihuFrontier nhấn mạnh lập luận về phân bổ tín dụng cho RL tác nhân: các phần thưởng thưa thớt ở cấp độ nhóm hoạt động kém hơn nhiều đối với các quỹ đạo sử dụng công cụ 128K–256K so với các tác vụ suy luận, và ngay cả các sơ đồ prefix-replay / partial-credit đơn giản cũng có thể ổn định quá trình huấn luyện.

Quản lý ngữ cảnh và mô hình hóa thế giới đang nổi lên như những năng lực tác nhân hạng nhất: @omarsar0 chỉ ra công trình của Meta/CMU về quản lý ngữ cảnh tác nhân, nơi các tác nhân học cách quyết định khi nào nên nén ngữ cảnh, chuyển tải sang bộ nhớ và truy xuất sau đó; mức tăng được báo cáo là 27% tương đối trên BrowseComp-Plus, tiệm cận với các mô hình mở lớn hơn nhiều. Song song đó, @cwolferesearch lập luận rằng việc thêm mục tiêu mô hình hóa thế giới không chỉ cải thiện hiệu suất cuối cùng mà còn cải thiện hiệu quả thời gian suy luận—ít lượt tương tác, ít lệnh gọi công cụ và ít token đầu ra hơn—vì tác nhân dự đoán tốt hơn cách môi trường phản ứng. Quan điểm “học về thế giới, không chỉ học về phần thưởng” này cũng xuất hiện trong các bản phát hành robot từ World Labs/SceniX (bên dưới).

Tính toàn vẹn của tiêu chuẩn đánh giá đã trở thành một vấn đề kỹ thuật lớn: PostTrainBench v1.1 đáng chú ý không phải vì bảng xếp hạng mà vì cơ sở hạ tầng chống gian lận. Những người duy trì mô tả các biện pháp kiểm soát mới đối với sự nhiễm bẩn dữ liệu huấn luyện-kiểm tra, thay thế mô hình, sử dụng API giáo viên bên ngoài và thậm chí là tra cứu trực tiếp tiêu chuẩn đánh giá từ các dấu vết công khai trước đó; phần tiếp theo của Karin Nguyen chi tiết 234 lần chạy bị nhiễm bẩn và nhiều lần chạy GPT-5.6 (Sol) đã tham khảo các tài liệu PTB trước đó. Điều này phù hợp với một mô hình rộng hơn: khi các tác nhân trở nên mạnh mẽ hơn, các bộ khung đánh giá phải được củng cố để chống lại việc tối ưu hóa chính tiêu chuẩn đánh giá đó.

Các mô hình mở, công cụ bảo mật và sự cố tác nhân tự hành của Hugging Face

Báo cáo pháp y của Hugging Face đã trở thành câu chuyện bảo mật lớn nhất trong ngày: HF đã công bố một bản phân tích chi tiết về cái mà họ gọi là cuộc tấn công mạng bằng tác nhân tự hành đầu tiên, bao gồm dòng thời gian kỹ thuật, phát lại và vai trò của các mô hình mở trong việc ứng phó sự cố. Bài đăng của Clement Delangue nhấn mạnh tính minh bạch và học hỏi từ phòng thủ; Arav Srinivas tóm tắt điểm vận hành chính: các công cụ đóng không thể phân biệt đáng tin cậy giữa kẻ tấn công và người phòng thủ trong quá trình phân tích pháp y, trong khi HF đã sử dụng GLM 5.2 (open-weight) trên cơ sở hạ tầng của riêng họ. Simon Willison nhấn mạnh sự tinh vi và bền bỉ của vụ xâm nhập (tweet), và Kimmonismus đã rút ra những số liệu thống kê đáng kinh ngạc nhất: khoảng 17.600 hành động trong 4,5 ngày, quyền truy cập root trên 11 node, quyền quản trị cụm trên hai cụm, 136 bí mật bị truy cập, đăng ký VPN lặp đi lặp lại và một nỗ lực thỏa hiệp CI thông qua GitHub App tokens và một PR.

Sự cố này đã thúc đẩy trực tiếp nỗ lực xây dựng một hệ sinh thái bảo mật mở: Một nhóm các công ty đã tham gia hoặc thúc đẩy Open Secure AI Alliance, lập luận rằng tính minh bạch ở các lớp mô hình và suy luận là cần thiết cho các công cụ phòng thủ. Factory đã công bố hỗ trợ, vLLM tham gia với trọng tâm rõ ràng vào bảo mật lớp suy luận, và Perplexity gắn kết sự tham gia của mình trực tiếp với các bài học từ vụ vi phạm HF (bài đăng của Arav). Theo cùng hướng đó, GDB lưu ý đến việc mở mã nguồn của Codex Security CLI. Điểm chung là các lập luận về an toàn không còn chỉ nói về hành vi của mô hình; chúng ngày càng nói về việc liệu các nhà vận hành có thể kiểm tra, tự host và thích ứng với toàn bộ ngăn xếp trong các sự cố hay không.

Anthropic cũng đã công bố nghiên cứu bảo mật kỹ thuật, nhưng ở một khía cạnh rất khác: Anthropic thông báo rằng Claude Mythos Preview đã giúp các nhà nghiên cứu phát hiện ra những điểm yếu trong các thuật toán mật mã, với các bài báo về HAWK và các kết quả liên quan đến AES cùng với một CryptanalysisBench (tiêu chuẩn đánh giá) mới. Khung phòng thủ rất đơn giản—nghiên cứu mật mã cấp chuyên gia có giá trị bảo mật rõ ràng—nhưng bản phát hành cũng gây ra sự hoài nghi về thông điệp và tầm quan trọng thực tế trong một số bộ phận của cộng đồng.

Robot, mô hình thế giới và tiến bộ từ mô phỏng sang thực tế (sim-to-real)

World Labs/SceniX đang hiện thực hóa luận điểm “những thế giới huấn luyện robot”: Thông báo của Fei-Fei Li đã giới thiệu những kết quả ban đầu về việc xây dựng các môi trường ảo phù hợp với thực tế để huấn luyện và đánh giá robot. Tuyên bố không chỉ là mô phỏng tốt hơn, mà là một vòng lặp thực-đến-mô phỏng-đến-thực (real-to-sim-to-real) nơi các mô hình thế giới giúp thu hẹp nút thắt dữ liệu của robot. Yunzhu Li mô tả nó như một nền tảng để huấn luyện/đánh giá có thể mở rộng trong các thế giới phù hợp với thực tế, và clip của a16z đưa ra luận điểm chiến lược một cách rõ ràng: không giống như ngôn ngữ, robot thiếu dữ liệu quy mô web dồi dào, vì vậy các định luật mở rộng đòi hỏi các thế giới tổng hợp có thể thay thế việc thu thập dữ liệu thực tế tốn kém và không an toàn.

Các công trình liên quan cho thấy “bộ não LLM + cơ thể robot” đang trở nên khả thi: @lianegalanti báo cáo rằng việc kết nối suy luận kiểu LLM với các chính sách robot đã thúc đẩy hiệu suất từ 16,7% lên 97,3% trên một robot thực và từ 12,8% lên 53,3% trong mô phỏng (LIBERO-PRO). @tri_dao lặp lại kết quả này, ghi nhận mức cải thiện 4× so với SOTA mà không cần huấn luyện thêm. Trong khi đó, WorldDiT đã được phát hành như một kiến trúc thống nhất cho mô hình hóa thế giới robot và điều khiển trên LIBERO, được định vị trên biên Pareto giữa các phương pháp công khai không dựa vào VLM để tạo hành động.

Quản trị, open weights và “điều tiết tốc độ tiên phong”

Một sự chia rẽ lớn trong diễn ngôn quản trị AI đã mở ra xung quanh việc “cố tình điều tiết tốc độ tiên phong”: Một bức thư có chữ ký của các nhân viên từ OpenAI, Anthropic, Google DeepMind, Meta và những người khác đã kêu gọi chính phủ Hoa Kỳ hỗ trợ các cơ chế kỹ thuật/quản trị quốc tế có thể làm chậm quá trình phát triển AI tiên phong nếu cần thiết. Báo cáo của Shirin Ghaffary đã nắm bắt được sự phát triển cơ bản; OpenAI chính thức tán thành nỗ lực này, trong khi Anthropic cho biết nghiên cứu RSI của riêng họ cũng chỉ ra nhu cầu tương tự. Lập luận là nghiên cứu AI đệ quy hoặc tự động có thể đẩy nhanh tiến độ vượt quá mức mà bất kỳ phòng thí nghiệm hoặc quốc gia nào có thể quản lý đơn phương.

Phản ứng dữ dội đã diễn ra ngay lập tức và dựa trên cơ sở kỹ thuật về những lo ngại về sự chiếm dụng quy định (regulatory-capture): Các nhà phê bình lập luận rằng các phòng thí nghiệm tiên phong đang yêu cầu các cấu trúc quản trị sẽ gây gánh nặng cho các đối thủ và các mô hình mở trong khi vẫn duy trì vị thế dẫn đầu của chính họ. Phản hồi của Adam Thierer định hình đây là một lời kêu gọi nguy hiểm về việc kiểm soát toàn cầu mà sẽ không hạn chế được Trung Quốc một cách có ý nghĩa. Chuỗi bài trước đó của Sarah Hooker về open weights cũng phù hợp ở đây: việc giới hạn phát hành mở đối với các hệ thống yếu hơn được nhiều người coi là cách để bảo vệ các đơn vị độc quyền sở hữu. Đồng thời, một số người ký tên đã công khai làm rõ sự ủng hộ của họ: @eliebakouch cho biết các công cụ phối hợp là hợp lý, nhưng bất kỳ chính sách nào dựa trên RSI đều cần định lượng tốt hơn nhiều và minh bạch hơn nhiều về các năng lực nội bộ thực tế.

Các tweet hàng đầu (theo mức độ tương tác)

Tóm tắt AI trên Reddit

Tóm tắt /r/LocalLlama + /r/localLLM

Tóm tắt các Subreddit AI ít kỹ thuật hơn

/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo, /r/aivideo

MoonshotKimi K3MoEAI AgentHạ tầng AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ smol.ai AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.