Mô hình
Kimi K3: Mô hình AI lớn nhất Trung Quốc đặt cược vào bộ nhớ thay vì sức mạnh tính toán
(giờ Việt Nam)
Tóm tắt AI
Với 2,8 nghìn tỷ tham số, Kimi K3 của Moonshot AI trở thành mô hình mã nguồn mở lớn nhất hiện nay, tập trung tối ưu hóa khả năng ghi nhớ thay vì chỉ dựa vào sức mạnh tính toán thuần túy.
Bản dịch AI

Mô hình open-weight Kimi K3 của Moonshot AI đã được phân tích gần như toàn diện thông qua số lượng tham số kể từ khi ra mắt vào ngày 16 tháng 7. Với 2,8 nghìn tỷ tham số, đây là mô hình open-weight lớn nhất được phát hành cho đến nay. Quy mô mô hình thường được chia thành các nhóm thô, và 2,8 nghìn tỷ tham số rơi vào phân khúc mà ngành công nghiệp gọi là lớp 3T. Một cấp độ mà chưa có mô hình công khai nào đạt tới trước đây.

Kết luận tự nhiên là Moonshot đã tìm ra cách vượt qua các hạn chế về năng lực tính toán của Mỹ. Blog kỹ thuật của chính công ty gợi ý một điều cụ thể hơn: K3 không hẳn là né tránh các hạn chế mà là dịch chuyển chúng, đánh đổi năng lực tính toán lấy bộ nhớ ở hầu hết mọi lớp của thiết kế.
Sự đánh đổi đó rất đáng để tìm hiểu, bởi vì năng lực tính toán và bộ nhớ không phải là những hạn chế có thể thay thế cho nhau, và chúng cũng không sẵn có như nhau đối với một phòng thí nghiệm tại Trung Quốc.
Giới thiệu Kimi K3: Trí tuệ biên mở (Open Frontier Intelligence)
🔹 2,8 nghìn tỷ tham số, 1 triệu context, đa phương thức gốc 🔹 Kimi Delta Attention cho phép giải mã nhanh hơn tới 6,3 lần trong các context triệu token 🔹 Attention Residuals mang lại hiệu suất huấn luyện cao hơn ~25% với mức bổ sung <2%… pic.twitter.com/eFHEbdxn3P
Tại sao mô hình open-weight Kimi K3 lại là một bài toán về bộ nhớ
Hai yếu tố khác nhau quyết định chi phí vận hành một mô hình lớn. Một là máy tính thực hiện bao nhiêu phép tính để tạo ra mỗi từ. Hai là bao nhiêu phần của mô hình phải được giữ sẵn sàng và có thể truy cập ngay lập tức trong suốt quá trình hoạt động. Yếu tố đầu tiên là năng lực tính toán (compute). Yếu tố thứ hai là bộ nhớ (memory). Các biện pháp kiểm soát xuất khẩu chip đã gây áp lực mạnh lên Trung Quốc ngay từ đầu, và thiết kế của Moonshot cho thấy một nỗ lực bền bỉ nhằm tiêu tốn ít năng lực tính toán hơn.
Bước đi chính là một kỹ thuật gọi là mixture-of-experts (hỗn hợp chuyên gia). Thay vì chạy toàn bộ mô hình cho mỗi từ, K3 tự chia thành 896 phần chuyên biệt và chỉ gọi 16 phần trong số đó tại một thời điểm, chiếm khoảng 1,8% tổng số. Phép tính trên mỗi từ giảm mạnh. Hóa đơn bộ nhớ không hề thay đổi, vì tất cả 2,8 nghìn tỷ tham số vẫn phải được tải sẵn và chờ đợi trong trường hợp chúng là những phần được gọi tiếp theo.
Vì vậy, Moonshot đã nhắm trực tiếp vào hóa đơn đó. Họ đã huấn luyện K3 hoạt động ở độ chính xác 4-bit trên mỗi tham số thay vì 16-bit như thông thường, một phương pháp được gọi là quantisation-aware training (huấn luyện nhận thức lượng tử hóa). Công ty đã áp dụng phương pháp này từ giai đoạn tinh chỉnh trở đi và cho biết họ chọn nó "để tương thích rộng rãi với phần cứng", một cụm từ đáng lưu tâm vì nó giống như một biện pháp phòng ngừa khi chạy trên các dòng chip không phải của Nvidia. Mức tiết kiệm là rất đáng kể. Phân tích độc lập về bản phát hành cho thấy mô hình này có dung lượng khoảng 1,4TB ở định dạng đó, so với 5,6TB nếu ở độ chính xác đầy đủ.
Thay đổi thứ hai, Kimi Delta Attention, nhắm vào một chi phí bộ nhớ khác. Khi một mô hình xử lý một tài liệu rất dài, nó tích lũy một kho lưu trữ chạy liên tục mọi thứ mà nó đã đọc. Ở giới hạn 1 triệu token mà K3 quảng cáo, tương đương vài nghìn trang, kho lưu trữ đó – chứ không phải bản thân mô hình – trở thành thứ chiếm dụng bộ nhớ lớn nhất.
Moonshot tỏ ra đặc biệt thẳng thắn về lợi ích thương mại ở đây. Họ đã đóng góp mã caching cho dự án phục vụ mã nguồn mở vLLM và cho biết sự kết hợp này là yếu tố giúp họ định giá K3 một cách cạnh tranh bất chấp quy mô của mô hình. Moonshot khuyến nghị chạy K3 trên 64 bộ tăng tốc (accelerator) trở lên được kết nối đủ chặt chẽ để hoạt động như một nhóm thống nhất.
Đó cũng là cách tiếp cận đằng sau các hệ thống CloudMatrix của Huawei, và nó chỉ ra đâu là giải pháp thay thế thực sự. Bộ nhớ có thể được tập hợp từ một số lượng lớn các chip riêng lẻ không quá nổi bật. Năng lực tính toán cấp độ huấn luyện thì không thể lắp ghép theo cách tương tự.
Việc tập hợp đó có diễn ra trên chip của Trung Quốc hay không là câu hỏi mà blog không trả lời. Các thử nghiệm cấp chip của Moonshot được thực hiện trên Nvidia H200S và trên thứ mà họ chỉ mô tả là "GPGPU từ một nhà cung cấp thay thế" mà họ từ chối nêu tên. Các kết quả khác được benchmark trên Nvidia L20, dòng card rút gọn được bán vào Trung Quốc theo các quy định xuất khẩu.
Blog không nói rõ phần cứng H200 nằm ở đâu, và Hạ viện Mỹ đã thông qua một dự luật vào tháng 1 nhằm đóng lỗ hổng cho thuê đám mây ở nước ngoài vốn đã cho phép các công ty Trung Quốc tiếp cận các bộ tăng tốc bị hạn chế từ xa. Lý do khiến tất cả những điều này quan trọng là vì bộ nhớ, chứ không phải sức mạnh xử lý, mới là nơi ngành công nghiệp chip của Trung Quốc tụt hậu xa nhất.
Trong các cuộc đàm phán thương mại vào tháng 8 năm 2025, Bắc Kinh đã yêu cầu nới lỏng các hạn chế về bộ nhớ băng thông cao (HBM) thay vì các công cụ quang khắc hay quyền truy cập TSMC, một tín hiệu rõ ràng về những gì các quan chức cho là thực sự mang tính ràng buộc. Sản lượng nội địa của loại bộ nhớ đó dự kiến đạt khoảng hai triệu stack trong năm nay, đủ cho khoảng 250.000 đến 300.000 chip Huawei Ascend 910C, trong khi SMIC có công suất wafer cho hơn một triệu chip.
Những gì các doanh nghiệp thực sự có thể triển khai
Đối với các doanh nghiệp trong khu vực này, câu hỏi thực tế không phải là liệu K3 có đứng đầu bảng xếp hạng hay không. Mà là liệu một mô hình open-weight ở quy mô này có thể triển khai được hay không. Các doanh nghiệp châu Á tìm đến open-weight vì ba lý do – giá cả, chủ quyền dữ liệu và khả năng hỗ trợ ngôn ngữ khu vực – và các ngân hàng, công ty bảo hiểm trên khắp Đông Nam Á đã và đang thử nghiệm các mô hình mở tự lưu trữ (self-hosted) để đảm bảo hồ sơ không bao giờ rời khỏi hệ thống của họ.
Các trọng số (weights) sẽ được công bố vào ngày 27 tháng 7, và bất kỳ tổ chức nào đủ khả năng chi trả cho phần cứng sẽ được tự do tải xuống, sửa đổi và chạy K3 trong nội bộ. Câu hỏi là có bao nhiêu tổ chức làm được điều đó. Moonshot khuyến nghị phục vụ mô hình trên 64 bộ tăng tốc trở lên được kết nối thành một nhóm, và chỉ riêng các trọng số đã lên tới khoảng 1,4TB ở định dạng phát hành, dựa trên phân tích độc lập, chưa kể bộ nhớ cần thiết để xử lý một tài liệu dài.
Đó là cam kết ở cấp độ trung tâm dữ liệu, không phải phòng máy chủ thông thường. Đối với hầu hết các doanh nghiệp, kết quả thực tế là thuê năng lực chuyên dụng thay vì sở hữu nó. Điều đó vẫn giữ dữ liệu trong nước và theo hợp đồng, đúng như những gì hầu hết các cơ quan quản lý khu vực yêu cầu. Điều mà nó không mang lại là sự độc lập khỏi các nhà cung cấp cơ sở hạ tầng – thứ vốn đã thu hút nhiều người mua đến với open-weight ngay từ đầu.
Phần mềm cũng chưa sẵn sàng. Hai thay đổi kiến trúc chính của K3 còn khá mới đến mức các công cụ mã nguồn mở tiêu chuẩn để chạy mô hình vẫn chưa hỗ trợ chúng, và Moonshot cho biết họ đang làm việc với các đối tác suy luận và những người duy trì mã nguồn mở để thống nhất các chi tiết kỹ thuật trước khi phát hành. Các đội ngũ đang lên kế hoạch triển khai tự lưu trữ nên coi ngày ra mắt và ngày có thể sử dụng là hai thời điểm khác nhau.
Giá cả cũng đã thay đổi. K3 có giá 3 USD cho mỗi triệu token đầu vào, giảm xuống 0,30 USD khi mô hình đã thấy đầu vào đó gần đây, và 15 USD cho mỗi triệu token đầu ra. Mức giá này thấp hơn nhiều so với 50 USD cho đầu ra của Fable 5, nhưng cao hơn nhiều so với GLM-5.2 của z.ai ở mức 4,40 USD và DeepSeek V4 ở mức 0,87 USD. K3 không còn nằm trong phân khúc ngân sách mà những người tiền nhiệm của nó từng chiếm giữ.
Nó cũng ra mắt với chế độ "nỗ lực suy luận tối đa" là cài đặt duy nhất, các chế độ thấp hơn sẽ được cập nhật sau, vì vậy các chuỗi suy luận dài và các bước thử lại sẽ nhanh chóng làm tăng chi phí. Các công ty nên lập ngân sách dựa trên chi phí của một tác vụ hoàn chỉnh, không phải giá niêm yết.
Những gì được tuyên bố và những gì được xác minh
Arena đã xếp K3 ở vị trí đầu tiên trong bài đánh giá Frontend Code với 1.679 điểm, vượt qua Fable 5 trong các bài kiểm tra mù của nhà phát triển, theo báo cáo của Tom’s Hardware. Kết quả đó là có thật. Tuy nhiên, đó cũng chỉ là một benchmark trong một lĩnh vực cụ thể.
Bản thân Moonshot còn thận trọng hơn các tiêu đề báo chí. Công ty tuyên bố rằng hiệu suất tổng thể của K3 vẫn còn kém hơn Claude Fable 5 và GPT 5.6 Sol, đồng thời liệt kê ba hạn chế: chất lượng tạo văn bản có thể trở nên rất không ổn định nếu một harness không truyền lại được nội dung tư duy lịch sử, mô hình có thể đưa ra các quyết định bất ngờ thay cho người dùng khi ý định không rõ ràng, và nó cho thấy khoảng cách trải nghiệm người dùng đáng kể so với Fable 5 và GPT 5.6 Sol.
Các chú thích của chính họ cũng tiết lộ rằng Fable 5 đã gặp lỗi dự phòng trên 35% các tác vụ trong bài đánh giá SWE Marathon của Moonshot, điều này có thể đã ảnh hưởng đến điểm số đo được của mô hình đó. Mọi thứ khác vẫn chỉ là tuyên bố từ một phía. Không có con số nào về K3 được công bố có thể được xác minh độc lập cho đến khi các trọng số được công khai.
Các nhà phân tích của Bank of America do Alex Liu dẫn đầu cho biết trong một ghi chú rằng K3 cho thấy việc huấn luyện trước quy mô lớn kết hợp với công việc kiến trúc vẫn có thể mang lại những bước tiến đột phá cho các mô hình hàng đầu của Trung Quốc bất chấp các hạn chế về năng lực tính toán. Đây là phiên bản tỉnh táo hơn của lập luận và gần với những gì blog hỗ trợ.
Hướng đi là điều không cần bàn cãi. Các mô hình open-weight đã xử lý 29% tổng số token được định tuyến qua cổng sản xuất của Vercel trong tháng 6, tăng từ khoảng 1/9 khối lượng vào tháng 4, trong khi chỉ chiếm dưới 4% chi phí. Ngày 27 tháng 7 là lúc chúng ta biết được bao nhiêu phần của K3 thuộc về cột đó.

Bạn muốn tìm hiểu thêm về AI và dữ liệu lớn từ các nhà lãnh đạo ngành? Hãy xem AI & Big Data Expo diễn ra tại Amsterdam, California và London. Sự kiện toàn diện này là một phần của TechEx và được tổ chức cùng với các sự kiện công nghệ hàng đầu khác bao gồm Cyber Security & Cloud Expo. Nhấp vào đây để biết thêm thông tin.
AI News được vận hành bởi TechForge Media. Khám phá các sự kiện và hội thảo trực tuyến về công nghệ doanh nghiệp sắp tới tại đây.
Bài viết được AI dịch và tổng hợp tự động từ Artificial Intelligence News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.