# Xiaomi lập kỷ lục 'livestream luyện AI': Đốt 20 triệu trong 6 ngày để thống trị bảng xếp hạng mã nguồn mở

- Nguồn: QbitAI
- Thời gian phát hành: 2026-09-22 18:50 (giờ Việt Nam)
- Điểm AI: 92/100
- Nhãn AIHOT: Tinh chọn
- Link AIHOT.vn: https://aihot.vn/items/ccca7a8b913a36f0
- Link gốc: https://www.qbitai.com/2026/09/494179.html

## Lý do tinh chọn

Sự kiện livestream luyện mô hình AI công khai của Xiaomi là một bước đi táo bạo, minh bạch và thu hút sự quan tâm lớn từ giới chuyên môn lẫn cộng đồng mã nguồn mở.

## Tóm tắt AI

Xiaomi vừa kết thúc buổi livestream 'luyện' mô hình AI đầy ấn tượng, thu hút sự chú ý lớn từ cộng đồng công nghệ và nhận được lời khen ngợi từ CEO Hugging Face.

## Thân bài

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

22/09/2026 19:50:28 Nguồn: QbitAI

CEO Hugging Face: "Quá tuyệt vời"

Sau 6 ngày và hơn 20 triệu nhân dân tệ, "buổi livestream luyện đan" (huấn luyện mô hình) chưa từng có tiền lệ của Xiaomi cuối cùng đã hạ màn.

Trong sáu ngày qua, Xiaomi đã đưa quá trình huấn luyện học tăng cường (reinforcement learning) cho mô hình lớn vào ngay trong buổi livestream, khiến người xem chứng kiến đồng hồ đếm tiền USD nhảy số liên tục.

Hiện tại, cả hai phiên bản Pro và Flash của MiMo-V2.6 đã hoàn thành 30 bước (Step) huấn luyện, với hóa đơn cuối cùng dừng lại ở mức 3,5 triệu USD (khoảng 23,44 triệu nhân dân tệ).

![](https://i.qbitai.com/wp-content/uploads/2026/09/120037029a914d31b2f16f87b61901a7.webp)

Tiền đã đốt xong, và mô hình cũng đã đạt được bước tiến lớn.

MiMo-V2.6-Pro, với 1,02 nghìn tỷ tham số và 420 tỷ tham số kích hoạt, đã đạt 46 điểm trên Artificial Analysis Intelligence Index, đứng đầu bảng xếp hạng mã nguồn mở.

CEO của Hugging Face cũng dành lời khen ngợi: "Quá tuyệt vời".

![](https://i.qbitai.com/wp-content/uploads/2026/09/101ad49a33680bdf63b3e350cc492817.webp)

Hơn nữa, trong hầu hết các bài đánh giá về Agent, kết quả của bản Pro đã tiệm cận với Claude Opus 5 và GPT-5.6 Sol.

![](https://i.qbitai.com/wp-content/uploads/2026/09/56ac17c216bce2f9b5a89c74ccb83da3.webp)

Luo Fuli gọi đây là "một trong những đợt huấn luyện học tăng cường quy mô lớn nhất từng được thực hiện bởi bất kỳ đội ngũ mô hình mã nguồn mở nào cho đến nay".

Chưa hết, những điều ấn tượng hơn vẫn còn ở phía sau. Vị lãnh đạo dự án MiMo của Xiaomi, người từng tham gia phát triển DeepSeek-R1, thẳng thắn chia sẻ:

Theo tôi, những đổi mới nghiên cứu và thách thức kỹ thuật đằng sau nó còn vượt xa cả DeepSeek-R1 mà tôi từng tham gia.

Nhận định này có sức nặng đến mức nào? Hãy xem qua các chi tiết huấn luyện của MiMo-V2.6 thì sẽ rõ.

Đốt hơn 20 triệu, mô hình mã nguồn mở tiến vào hàng ngũ tiên phong của mô hình đóng

Trước khi bàn về kỹ thuật, hãy cùng điểm qua "báo cáo kết quả" của buổi livestream này.

MiMo-V2.6-Pro hoàn thành 30 Step trong 5 ngày 3 giờ, tiêu tốn khoảng 2,6 triệu USD;

Bản Flash cũng hoàn thành 30 Step trong 3 ngày 10 giờ, tiêu tốn khoảng 900.000 USD.

Mỗi Step bao gồm 1.568 Prompt, mỗi câu hỏi yêu cầu mô hình thử nghiệm 16 lộ trình khác nhau, tạo ra hơn 25.000 Rollout trong một vòng.

Theo báo cáo kỹ thuật, với mỗi bước xử lý từ 2,7 tỷ đến 3,7 tỷ training tokens, tổng cộng Pro đã xử lý khoảng 81 tỷ đến 111 tỷ Tokens, tương đương với việc lấp đầy hơn 80.000 cửa sổ ngữ cảnh (context window) triệu Token.

![](https://i.qbitai.com/wp-content/uploads/2026/09/a662916e320c76ffea4dca6b956739a5.webp)

Với lượng Token khổng lồ và số tiền thực tế được đổ vào, hiệu quả mang lại cũng rất trực diện.

Sau khi kết thúc 30 Step, tỷ lệ vượt qua trung bình của Flash tăng tương đối 25%, và của Pro tăng 12%.

Ngoài sự tăng trưởng tổng thể, những thay đổi thuyết phục hơn xuất hiện trong bài kiểm tra ngoài tập dữ liệu (out-of-sample) mang tên DeepSWE v1.1.

Pro tăng từ 58,4 điểm lên 72,57 điểm, cải thiện khoảng 14 điểm;

Flash tăng từ 48,7 điểm lên 65,68 điểm, cải thiện khoảng 17 điểm.

DeepSWE v1.1 chuyên kiểm tra khả năng làm việc liên tục của Coding Agent trong các kho lưu trữ mã nguồn mở thực tế; OpenAI và Anthropic cũng đã liệt kê đây là hạng mục đánh giá trọng tâm khi công bố các mô hình tiên phong.

Hiệu suất của MiMo-V2.6 cho thấy đợt RL này không chỉ là việc "cày điểm" trên tập huấn luyện. Chỉ sau 30 Step, mô hình không những mạnh lên mà còn chuyển giao được khả năng sang các tác vụ kỹ thuật phần mềm chưa từng gặp, chứng minh được hiệu quả mẫu và khả năng tổng quát hóa ngoài tập dữ liệu.

Đặc biệt là bản Flash, chi phí chỉ bằng khoảng 1/3 so với Pro nhưng mức tăng tương đối lại lớn hơn, xứng đáng là "ứng viên hiệu năng trên giá thành" của đợt huấn luyện này.

![](https://i.qbitai.com/wp-content/uploads/2026/09/2c3e664eaeb693648f272e148510cf87.jpeg)

Còn về phần Pro, nhiệm vụ của nó là thúc đẩy giới hạn năng lực lên mức cao nhất.

Trên Artificial Analysis Intelligence Index, MiMo-V2.6-Pro đạt 46 điểm, chính thức lên ngôi vương trong thế giới mã nguồn mở.

![](https://i.qbitai.com/wp-content/uploads/2026/09/d5f011d97f4547a2e55f1ea0ad57357b.webp)

Trong một số bài đánh giá Agent, nó đã có thể cạnh tranh sòng phẳng với các mô hình đóng hàng đầu.

Ví dụ, trên AutomationBench, Pro đạt 53,1 điểm, vượt qua mức 50,3 điểm của Claude Opus 5 và 45,8 điểm của GPT-5.6 Sol.

Kết hợp với các bài đánh giá khác, vị thế của MiMo-V2.6-Pro trên thị trường mô hình toàn cầu đã khá rõ ràng:

Đã tiến vào nhóm dẫn đầu các mô hình mã nguồn mở và chạm đến ngưỡng tiên phong của các mô hình đóng trong một số tác vụ Agent.
