Tin ngành
Kimi K3 và cuộc đua mô hình mã nguồn mở: Tác động toàn cầu
(giờ Việt Nam)
Tóm tắt AI
Phân tích sâu sắc về cách Kimi K3 làm thay đổi cục diện hệ sinh thái AI toàn cầu và áp lực cạnh tranh từ các mô hình mã nguồn mở.
Bản dịch AI

Vào thứ Năm, ngày 16 tháng 7, Moonshot AI đã phát hành mô hình chủ lực mới nhất của họ là Kimi K3. K3 là một mô hình MoE với 2,8 nghìn tỷ tham số, dự kiến sẽ được công bố trọng số (weights) vào ngày 27 tháng 7. Phần lớn bài viết này là những suy ngẫm về trạng thái của hệ sinh thái, dựa trên giả định rằng Moonshot sẽ giữ đúng lời hứa về ngày phát hành trọng số. Đây là một cái nhìn cực đoan hơn về trạng thái cân bằng, và nhiều kết quả cuối cùng sẽ nằm ở mức trung bình nếu tình hình thực tế là Trung Quốc sở hữu các mô hình mạnh tương đương nhưng lại đóng (tức là K3 không bao giờ được phát hành).
Thực tế quan trọng là khoảng cách về hiệu suất giữa mô hình mở và đóng, hoặc giữa mô hình Mỹ và Trung Quốc, đã bị thu hẹp từ mức 6-9 tháng như tranh luận trước đây xuống còn khoảng thời gian ngắn hơn, giả sử là 3-5 tháng.
Từ các tài liệu phát hành, rõ ràng K3 là một mô hình tiên phong thực thụ. Đây sẽ là mô hình mở tiệm cận nhất với ngưỡng tiên phong kể từ sau DeepSeek R1. DeepSeek R1 là một câu chuyện khác. Đó là trường hợp một phòng thí nghiệm Trung Quốc cực kỳ nhanh nhạy trong việc chuyển hướng sang các mô hình suy luận và phát hành sản phẩm nhanh hơn nhiều công ty Mỹ. Kimi K3 là ví dụ về một phòng thí nghiệm Trung Quốc thực thi việc mở rộng quy mô trên các lĩnh vực đã biết: dữ liệu, thuật toán, kiến trúc, công cụ, môi trường, v.v.
Kimi K3 đứng thứ 2 chung cuộc trên bảng xếp hạng Vals AI, thứ 3 chung cuộc trên Intelligence Index của Artificial Analysis (chỉ xếp sau Claude Fable và GPT-5.6 Sol Max trong khi có chi phí rẻ hơn), đứng thứ 1 chung cuộc trong Frontend Code Arena, cùng nhiều kết quả ấn tượng khác. Moonshot AI đang cạnh tranh trực tiếp với Anthropic và OpenAI với nguồn lực ít hơn rất nhiều.
Đây rõ ràng là mô hình mở mạnh nhất từng được phát hành. Nhìn vào mô hình này, có thể thấy rõ rằng nếu việc chưng cất đối nghịch (adversarial distillation) từ các mô hình tiên phong đóng ở Mỹ có đóng góp, thì nó cũng chỉ ở mức độ tương đối nhỏ. Những người quan sát AI từng theo dõi sự hoảng loạn về chưng cất mô hình và đi đến kết luận sai lầm rằng các phòng thí nghiệm AI Trung Quốc chỉ tạo ra mô hình tốt nhờ đánh cắp sở hữu trí tuệ sẽ phải thức tỉnh – rằng các công ty Trung Quốc cực kỳ giỏi trong việc xây dựng mô hình theo cách tương tự như các công ty hàng đầu của Mỹ. Moonshot AI đang giải quyết nhiều vấn đề giống như những gì các chuyên gia tại OpenAI hay Anthropic đang thực hiện. Tôi tin rằng sẽ còn nhiều cuộc thảo luận và áp lực hơn nữa về vấn đề chưng cất, nhưng bằng chứng hiện đã rõ ràng rằng các công ty Trung Quốc có thể làm được nhiều điều hơn là chỉ "bắt chước nhanh".
Khi gặp gỡ một số thành viên nòng cốt của đội ngũ Kimi trong chuyến đi đến Trung Quốc, tôi thấy rõ họ có một văn hóa đáng kinh ngạc, một số người có thể gọi là "aura" (hào quang), và sự tự do để thể hiện điều đó – trong những giới hạn của môi trường bị hạn chế về GPU. Khi việc xây dựng mô hình chủ yếu là cuộc chơi về quy mô, phần lớn khả năng tạo ra một mô hình tốt vẫn phụ thuộc vào sự thực thi, động lực và khả năng thể hiện của cá nhân. Sau khi đến thăm họ, kết quả này bớt gây ngạc nhiên hơn. Tôi đã đến thăm nhiều công ty AI, nhưng rất ít nơi có được văn hóa mà bạn có thể cảm nhận ngay lập tức như thế này.
Đồng thời, xu hướng áp dụng AI của Trung Quốc bắt đầu muộn hơn so với Mỹ. Vì vậy, mặc dù tất cả các phòng thí nghiệm Trung Quốc đều có ít tài nguyên tính toán hơn nhiều so với các đối tác ở Mỹ, nhưng phần lớn tài nguyên đó chắc chắn có thể được dành cho việc huấn luyện. Khi tôi nói đùa về việc một nhà nghiên cứu trung bình tại OpenAI có thể có bao nhiêu tài nguyên tính toán – giả sử là vài nghìn máy tương đương H100 – các nhà nghiên cứu tại Kimi đã rất sốc. Sơ đồ tổ chức và cách tiếp cận để xây dựng các mô hình Kimi chắc chắn phản ánh điều này, nhưng rất khó để phân tích chi tiết nếu không có thông tin độc quyền đáng kể.
Tình hình về hiệu suất mô hình đỉnh cao hiện nay đại khái như sau:
Anthropic – Claude Fable 5
OpenAI – GPT 5.6 Sol
Moonshot AI – Kimi K3 (trọng số mở*)
SpaceXAI – Grok 4.5
Zhipu (Z.ai) – GLM 5.2 (trọng số mở)
Meta – Muse Spark 1.1
DeepMind – Gemini Flash 3.5
Alibaba – Qwen 3.7 Max (đã công bố bản 3.8, cũng sẽ là trọng số mở tại thời điểm viết bài)
Thật đáng kinh ngạc khi thấy DeepMind và một số gã khổng lồ Mỹ khác lại ở vị trí thấp như vậy. Theo nhiều cách, đội ngũ X AI xứng đáng nhận được nhiều sự ghi nhận hơn. Tóm tắt trực quan từ Artificial Analysis được trình bày dưới đây:

Sự kiện phát hành này và các sự kiện gần đây khác đã gây ra sự thay đổi lớn về hướng đi đối với các kết quả có khả năng xảy ra nhất trong sự cân bằng giữa mô hình mở và đóng. Tôi sẽ phân tích từng yếu tố một.
Theo nhiều cách, cảm giác như chúng ta đang ở buổi bình minh của một kỷ nguyên mới. Một kỷ nguyên với sự cạnh tranh gay gắt hơn nhiều, nhưng cũng đòi hỏi sự phối hợp cao hơn khi chúng ta triển khai các công nghệ cực kỳ mạnh mẽ trên toàn thế giới.
Chia sẻ
Nhiều người bắt đầu theo dõi bối cảnh AI của Trung Quốc tương đối gần đây, vì vậy họ có thể đi đến kết luận rằng phát hành mô hình mở là chiến lược cốt lõi của họ. Thực tế, tôi nghĩ hầu hết các phòng thí nghiệm đều có chiến lược cốt lõi gần giống với Anthropic hoặc OpenAI hơn – đó là xây dựng trí tuệ tốt nhất có thể. Sau nhiều năm theo dõi và tương tác với các phòng thí nghiệm Trung Quốc, lời giải thích tốt nhất cho việc họ chuyển sang phát hành mô hình mở là tính thực dụng. Họ cần phát hành mô hình mở để có được sự chấp nhận, sự chú ý và phản hồi (đặc biệt là tại thị trường giá trị cao như Bay Area).
Trong một thời gian dài, Trung Quốc có rất ít chính sách giải thích vai trò của AI nguồn mở và đâu là "chiến lược cấp quốc gia". Theo hiểu biết của tôi, chưa có nhà lãnh đạo cấp cao nào bình luận công khai về AI nguồn mở. Điều này cũng đã thay đổi trong tuần này, khi Tập Cận Bình có bài phát biểu quan trọng tại Hội nghị AI Thế giới (WAIC) và cam kết trực tiếp tương lai hệ sinh thái AI của Trung Quốc với nguồn mở và sự lan tỏa toàn cầu. Cam kết duy trì hiện trạng này, ngay trong tuần công bố mô hình trọng số mở mạnh nhất từ trước đến nay, là một dấu mốc rõ ràng trong lịch sử hiện đại của AI.
Điều này diễn ra trong khoảng thời gian mà nhiều con đường tiềm năng đã được thảo luận cho ngành công nghiệp AI Trung Quốc – Liệu họ có giữ mô hình mở không? Họ có thể theo kịp các phòng thí nghiệm Mỹ trong việc mở rộng quy mô không? Thị trường doanh thu ở Trung Quốc có đang tăng trưởng không? Với những câu hỏi này, trọng tâm đã chuyển sang khả năng chấp nhận rủi ro của Trung Quốc, khả năng kiếm tiền của các công ty và bất kỳ lý do liên quan nào khiến một công ty ngừng phát hành các mô hình tốt nhất của họ dưới dạng mở.
Bằng cách gắn cam kết của ông Tập với một mô hình rất mạnh, Trung Quốc đã ngầm bình luận về khả năng chấp nhận rủi ro của mình đối với việc phát hành các mô hình trọng số mở. Hiện tại, đây là một cách hiểu về những rủi ro được nhận thức đối với các chủ đề như năng lực an ninh mạng mạnh (hoặc các mối nguy sinh học) trong hệ thống Trung Quốc.
Lời giải thích đơn giản nhất là chính phủ Trung Quốc chắc chắn đang theo dõi chặt chẽ các rủi ro tiềm ẩn từ các mô hình – có khả năng với phạm vi kỹ thuật rộng hơn so với kiểu quản lý dựa trên cảm tính của chính phủ Mỹ – và sẽ hành động nếu họ đo lường được rủi ro. Lời giải thích đơn giản là họ không thấy các mô hình tiên phong hiện tại có rủi ro đáng kể.
Đồng thời, các nhà hoạch định kinh tế của Trung Quốc cho rằng việc áp dụng AI là tốt, để họ có thể kiếm lợi nhuận từ ngành này sau này – sau khi đã mở rộng phân phối (như Trung Quốc đã làm với ô tô, năng lượng mặt trời, sản xuất tiên tiến và nhiều lĩnh vực khác trong lịch sử gần đây).
Những điều này có vẻ gây sốc trong bối cảnh truyền thông AI tại Mỹ, nơi đã trải qua nhiều tháng cường điệu và gieo rắc nỗi sợ hãi về mô hình Claude Mythos. Sự ngạc nhiên này nên là một nền tảng vững chắc – thế giới không có sự đồng thuận tuyệt đối với các câu chuyện về AI mà chúng ta thường nghe ở Mỹ.
Nhiều người dẫn dắt các cuộc thảo luận về AI có động cơ rõ ràng để hạ thấp năng lực được nhận thức của các mô hình AI mở tốt nhất. Dean Ball – người cá nhân ủng hộ các mô hình mở nhưng hiện đang làm việc tại OpenAI – đã có một bài đăng được bình luận rộng rãi với những suy ngẫm về Kimi, nơi ông nói về các mô hình mở. Điều quan trọng là phải hiểu tuyên bố này, vì nó tập trung vào vai trò của các mô hình mở trong khía cạnh kinh tế của việc xây dựng AI. Dean nói:
Các mô hình trọng số mở vốn dĩ là sự giảm tốc, và tôi liên tục ngạc nhiên khi thấy những người được gọi là "những người theo chủ nghĩa tăng tốc" lại hào hứng với các mô hình trọng số mở đến vậy.
Giải thích lý do tại sao các mô hình trọng số mở là một hình thức giảm tốc là điều quan trọng để hiểu trật tự thế giới sắp tới. Ông ấy nói đúng.
Các mô hình mở mang tính giảm tốc về mặt kinh tế đối với các phòng thí nghiệm tiên phong, điều này sẽ làm chậm khoản đầu tư ròng và triển khai chi phí vốn (capex) cho AI. Điều này là do các mô hình AI trọng số mở mạnh mẽ làm giảm đáng kể biên lợi nhuận tiềm năng cho các phòng thí nghiệm đóng. Điều này có hai tác động. Thứ nhất, các phòng thí nghiệm AI có ít lợi nhuận hơn để tái đầu tư vào các mô hình tương lai. Thứ hai, thị trường coi giá trị cuối cùng của các công ty này là thấp hơn, vì vậy họ sẽ kìm hãm các vòng gọi vốn trong tương lai. Những điều này cùng nhau sẽ làm chậm tiến độ đến với các mô hình AI mang tính biến đổi nhất, nhưng tôi không thấy chúng đủ mạnh để ngăn cản OpenAI và Anthropic trở thành một trong những công ty có giá trị cao nhất thế giới.
Đối với tôi, đây là lợi ích ròng cho xã hội. Vì các mô hình trọng số mở mang tính tăng tốc cho sự lan tỏa AI trên toàn nền kinh tế bằng cách làm cho giá đầu vào cho trí tuệ ở một mức hiệu suất nhất định trở nên thấp hơn. Các mô hình mở cũng khuyến khích tùy chỉnh. Vấn đề là loại lan tỏa này về bản chất chậm hơn nhiều so với các sản phẩm của các phòng thí nghiệm AI tiên phong, những bên bán công cụ được các nhà phát triển sử dụng trực tiếp. Tiềm năng của các mô hình mở là gần như mọi doanh nghiệp đều có thể sử dụng chúng để tạo ra các tác nhân (agents) chuyên biệt theo lĩnh vực. Sự lan tỏa kinh tế này mất rất nhiều thời gian! Tôi đã mô tả các mô hình trọng số mở giống như đang ở trên một đường cong tăng trưởng bắt đầu chậm hơn nhiều, nhưng có tiềm năng lớn hơn theo cấp số nhân. Vấn đề là, nếu các mô hình đóng vượt quá xa về năng lực thô, khả năng tùy chỉnh này có thể trở nên vô nghĩa.
Sự kết hợp giữa việc tăng cường lan tỏa và giảm tập trung quyền lực vào các phòng thí nghiệm AI mà tôi thấy là rất tích cực cho quá trình chuyển đổi AI. Nó cho chúng ta nhiều thời gian hơn để tìm ra các vấn đề khó của các năng lực mới và cho phép nhiều bên liên quan tác động đến câu chuyện – bất kỳ công ty nào cũng rất có khả năng gặp vấn đề trong việc kiểm soát công nghệ quan trọng nhất thế giới một cách an toàn.
Tất nhiên, đối với tôi trong thế giới này, điều quan trọng là các mô hình tốt nhất vẫn phải được tạo ra bởi các công ty Mỹ, điều này sẽ cho phép Mỹ kiểm soát quỹ đạo của công nghệ và các giá trị của nó. Tôi cũng kỳ vọng điều này sẽ xảy ra, vì Mỹ có thị trường vốn lớn hơn sẵn sàng đầu tư vào AI (và tỷ trọng lợi nhuận ngày càng tăng), nhưng đó không phải là điều hiển nhiên.
Blog ra mắt của Kimi có một số chi tiết kỹ thuật xác nhận loại cải tiến đang cung cấp những cải tiến mô hình nhất quán mà chúng ta cảm nhận được. Để chọn một ví dụ:
Kimi K3 được xây dựng trên Kimi Delta Attention (KDA) và Attention Residuals (AttnRes), hai bản cập nhật kiến trúc được thiết kế để cải thiện cách thông tin luân chuyển qua độ dài chuỗi và độ sâu mô hình. Chúng tôi cũng đã mở rộng quy mô độ thưa (sparsity) của Mixture of Experts (MoE), kích hoạt hiệu quả 16 trong số 896 chuyên gia khi kết hợp với khung Stable LatentMoE. Cùng với các công thức huấn luyện và dữ liệu được tinh chỉnh, những thay đổi cấu trúc này mang lại hiệu suất mở rộng quy mô tổng thể cải thiện khoảng 2,5 lần so với Kimi K2, cho phép mô hình chuyển đổi tài nguyên tính toán thành trí tuệ hiệu quả hơn.
Hiệu quả huấn luyện thực sự cộng dồn. Chúng sẽ dẫn đến những bước tiến liên tục, đáng kinh ngạc cho các mô hình.
Ngoài lề, việc truy vết con đường của sự đổi mới cụ thể này thông qua hệ sinh thái là một ví dụ thú vị. Kimi Delta Attention (KDA) được giới thiệu trong bài báo Kimi Linear, tương tự như Gated DeltaNet được sử dụng cho Olmo Hybrid (mô hình Olmo cuối cùng của tôi khi còn ở Ai2). Các mô hình mới nhất của Qwen đã chuyển sang một kiến trúc liên quan và các mô hình Nemotron gần đây cũng là mô hình lai (nhưng vẫn gần với Mamba hơn là Gated DeltaNet). Thật tuyệt vời khi thấy các ý tưởng kiến trúc mới như thế này, vốn được giới học thuật thúc đẩy mạnh mẽ, lại được chuyển đổi nhanh chóng thành các mô hình ở quy mô tiên phong. Gated Delta Networks được giới thiệu vào cuối năm 2024, dựa trên các ý tưởng từ Mamba. Đến giữa năm 2026, chúng đã nằm trong các mô hình tiên phong.
Bài viết được AI dịch và tổng hợp tự động từ Interconnects (Nathan Lambert). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.