Mô hình
Luo Fuli tái xuất sau nửa năm, hé lộ dự án học tăng cường tại Xiaomi: Đốt 30.000 USD mỗi giờ để huấn luyện mô hình
(giờ Việt Nam)
Tóm tắt AI
Luo Fuli công khai quá trình huấn luyện mô hình mới tại Xiaomi, minh bạch hóa từ biểu đồ phần thưởng đến các sự cố kỹ thuật phần cứng với chi phí vận hành cực lớn.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
17-09-2026 09:09:25 Nguồn: QbitAI
Công khai toàn bộ đường cong phần thưởng và lỗi card đồ họa
Meng Chen đưa tin từ trụ sở QbitAI | Kênh chính thức QbitAI
Chuyện gì đang xảy ra vậy? Quá trình huấn luyện học tăng cường (Reinforcement Learning) cho mô hình mới của Xiaomi đang được phát trực tiếp (livestream).
Nhấp vào xem mới thấy, đây đâu phải là hiện trường huấn luyện, đây chính là hiện trường "đốt tiền". Chớp mắt một cái đã mất 10 USD, mỗi phút trôi qua là hơn 4.000 Nhân dân tệ bay đi.

Tất nhiên, tốc độ đốt tiền có thể không đồng đều. Tính từ khi bắt đầu huấn luyện mô hình Pro được 36 giờ, hai mẫu mô hình này đã tiêu tốn hơn 1,08 triệu USD, trung bình mỗi giờ là 30.000 USD.
Nếu là người khác làm việc này, người ta sẽ thốt lên là "lạc vào nhà trời", nhưng với Xiaomi thì chỉ có thể nói là "lạc vào nhà Mi".
Trên trang này, chi phí huấn luyện là bao nhiêu, đã chạy bao nhiêu bước, đường cong phần thưởng có tăng hay không, card đồ họa ở nút nào gặp sự cố, tất cả đều được công khai để tra cứu.

Từng thấy các bên mở mã nguồn trọng số (open weights), mở mã huấn luyện và mở dữ liệu huấn luyện, nhưng mở cả quá trình huấn luyện thì quả thực chưa từng thấy. Khán giả theo dõi đều không khỏi trầm trồ thích thú.


Vậy hiện tại, quá trình huấn luyện hai mô hình Flash và Pro của MiMo-V2.6 đang diễn ra như thế nào?
Thực ra vẫn đang ở giai đoạn đầu, dù sao thì cũng mới bắt đầu huấn luyện được hơn 1 ngày.
Tuy nhiên, đã có thể thấy cả hai đều có sự cải thiện năng lực khá rõ rệt trong quá trình RL:
Chỉ số dynsam/avg@n của Pro đã tăng từ khoảng 0,565 ở bước 1 lên 0,614, trong khi Flash tăng từ khoảng 0,514 lên 0,603; trong bài đánh giá ngoại tuyến DeepSWE v1.1 mới nhất được công bố, Pro và Flash lần lượt đạt 62,24 và 60,77. (Để so sánh, DeepSeek-Flash v1.1 là 74,2%).
Flash đang bám đuổi nhanh chóng từ điểm xuất phát thấp hơn, còn Pro hiện chỉ duy trì khoảng cách dẫn trước nhỏ. Tuy nhiên, vì Pro mất nhiều thời gian hơn để hoàn thành một Step (bước) huấn luyện, nên điểm số mới nhất vẫn chưa được cập nhật.

Kể từ khi mã nguồn mở MiMo-v2.5 vào tháng 4, Xiaomi đã im hơi lặng tiếng gần nửa năm.
Giờ đây, người phụ trách Luo Fuli đã lên tiếng giải thích, trong khoảng thời gian này họ chỉ nghiên cứu một việc: Học tăng cường (Reinforcement Learning) có thể mở rộng đến mức nào.

Xiaomi công khai cách Scaling (mở rộng) học tăng cường
Việc scaling trong tiền huấn luyện (pre-training) truyền thống rất dễ hiểu: Nhiều dữ liệu hơn × Nhiều tham số hơn × Nhiều sức mạnh tính toán hơn → Mô hình mạnh hơn.
Hiện nay, các mô hình tiên phong ngày càng quan tâm đến việc liệu RL có thể scaling theo cách tương tự hay không?
Nghĩa là nếu liên tục tăng:
Số lượng quỹ đạo (trajectory) được tạo ra mỗi vòng;
Số lượng môi trường tác vụ thực tế mà mô hình phải đối mặt;
Lượng tính toán đầu tư để đánh giá các quỹ đạo đó tốt hay xấu;
Liệu năng lực của mô hình có thể tiếp tục cải thiện hay không?
Câu trả lời mà Xiaomi đưa ra là mở rộng theo ba chiều: Tính toán huấn luyện, Môi trường/Khung thực thi, và Tính toán đánh giá.
#### Scaling tính toán huấn luyện
Chiều thứ nhất là trực quan nhất, đó là tăng quy mô tính toán của chính RL.
Mỗi Step huấn luyện của dòng MiMo-V2.6 xử lý khoảng 2 tỷ Token, với cấu hình 1568 Prompt × 16 Rollout cho mỗi Prompt.
Nghĩa là, cùng một câu hỏi không chỉ để mô hình trả lời một lần, mà là để nó thử nghiệm nhiều quỹ đạo giải quyết vấn đề và hành động khác nhau, sau đó thu thập tín hiệu học tăng cường từ những thử nghiệm này.
1568 × 16 có nghĩa là một vòng có thể tạo ra hơn 25.000 Rollout. Đối với các tác vụ Agent, một Rollout không chỉ đơn thuần là "một hỏi một đáp": mô hình có thể phải trải qua hàng chục vòng suy nghĩ, gọi công cụ, phản hồi môi trường và hành động lại, do đó số lượng Token cuối cùng của một Step có thể đạt tới cấp độ hàng tỷ.
Quan trọng hơn, toàn bộ hệ thống áp dụng Fully Async, tức là phương thức thực thi hoàn toàn bất đồng bộ.
Theo nghĩa truyền thống, có thể hình dung một lần huấn luyện RL như một dây chuyền sản xuất ngăn nắp: tạo xong tất cả mẫu, đánh giá thống nhất, sau đó huấn luyện mô hình, cuối cùng mới bắt đầu vòng tiếp theo.
Nhưng RL cho Agent quy mô lớn rất khó để chờ đợi như vậy.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.