Mô hình
Xiaomi ra mắt và mở mã nguồn dòng MiMo-V2.6: Hai phiên bản Pro và Flash với giá API không đổi
(giờ Việt Nam)
Tóm tắt AI
Xiaomi chính thức phát hành dòng mô hình đa phương thức MiMo-V2.6 gồm bản Pro và Flash. Trong đó, bản Pro đạt 46 điểm trên bảng xếp hạng AA Intelligence Index v4.3.2.
Bản dịch AI
Theo tin từ IT ngày 22 tháng 9, Xiaomi sáng nay đã chính thức phát hành và mã nguồn mở dòng Xiaomi MiMo-V2.6 hoàn toàn mới, bao gồm hai mô hình đa phương thức gốc (native full-modal) là Pro và Flash.
Xiaomi cho biết đây là bước đi then chốt trong lộ trình khám phá RSI (Recursive Self-Improvement - Tự cải thiện đệ quy), thông qua việc mở rộng quy mô sức mạnh tính toán học tăng cường (RL), cho phép mô hình mở rộng biên giới trí tuệ trong quá trình khám phá và phản hồi liên tục.

Nhờ vào việc mở rộng sức mạnh tính toán RL, MiMo-V2.6-Pro đã đạt 46 điểm trong Artificial Analysis Intelligence Index (AA) v4.3.2, vượt qua Kimi K3 (44 điểm) và GLM-5.3 (45 điểm), trở thành mô hình có trọng số mã nguồn mở xếp hạng cao nhất trên chỉ số AA hiện nay, cao hơn 20 điểm so với thế hệ tiền nhiệm MiMo-V2.5-Pro (26 điểm).

Phía Xiaomi cũng làm rõ rằng, mô hình này vẫn còn khoảng cách so với các mô hình đóng hàng đầu như Claude Fable 5.1 và GPT-6 Astra (đều đạt 53 điểm).

Trong giai đoạn huấn luyện RL, MiMo-V2.6 có thể là một trong những mô hình mã nguồn mở nội địa đầu tư nhiều sức mạnh tính toán RL nhất hiện nay. Quá trình huấn luyện Pro và Flash kéo dài chưa đầy 6 ngày, với chi phí lần lượt khoảng 2,62 triệu USD và 850 nghìn USD, mỗi mô hình hoàn thành 30 bước với tổng cộng khoảng 750 nghìn quỹ đạo (trajectories).
Tỷ lệ vượt qua các tác vụ huấn luyện trung bình lần lượt tăng 25% và 12%, điểm chuẩn kỹ thuật phần mềm dài hạn ngoài mẫu (out-of-sample) DeepSWE v1.1 tăng lần lượt khoảng 17 điểm (từ 48,8 lên 65,7) và khoảng 14 điểm (từ 58,4 lên 72,6).
Lần huấn luyện này mở rộng sức mạnh tính toán RL từ ba chiều: Batch lớn hơn và thông lượng cao hơn, mỗi lần cập nhật sử dụng 1568 mẫu, hỗ trợ huấn luyện độ dài ngữ cảnh 1 triệu, số lượng Token huấn luyện mỗi bước đạt từ 3,5 đến 3,7 tỷ; nhiều tác vụ và môi trường phức tạp hơn, xây dựng hệ thống huấn luyện đa tác vụ bao phủ các lĩnh vực Code, General, Visual, Cyber; sức mạnh tính toán Grader lớn hơn, cung cấp tín hiệu phần thưởng chính xác hơn cho các tác vụ RL dài hạn thông qua so sánh tương đối trong nhóm (Group).

Về mở rộng năng lực, MiMo-V2.6 tích hợp khả năng suy luận không gian 3D, nhận thức đa phương thức và thao tác máy tính. Trong phát triển trò chơi, sau khi người dùng nhập hình ảnh, video hoặc văn bản, mô hình có thể phân tách nhu cầu thành nhiều tác vụ, để các đa tác nhân (multi-agent) phối hợp hoàn thành việc dựng cảnh 3D, viết logic tương tác và kiểm chứng hình ảnh. Trong môi trường mô phỏng hiện thân (embodied simulation), MiMo-V2.6 có thể trực tiếp lấy hình ảnh từ camera đa góc làm đầu vào, thông qua vòng lặp phản hồi thị giác để điều khiển cánh tay robot Franka Panda, hoàn thành việc gắp vật thể, khớp màu sắc và đặt chính xác. Ghi chú của IT: Mô hình đa phương thức (full-modal) là mô hình có khả năng xử lý đồng thời nhiều hình thức đầu vào như văn bản, hình ảnh, video và âm thanh.

Về nghiên cứu khoa học, MiMo-V2.6-Pro đã hỗ trợ các nhà nghiên cứu hoàn thành phương án thiết kế vật liệu khung hữu cơ kim loại (MOF) dùng để hấp phụ các chất per- và polyfluoroalkyl (PFAS), đồng thời hoàn thành việc hình thức hóa đầy đủ định lý chính gốc trong bài báo kinh điển "Chu kỳ ba hàm ý hỗn loạn" (Period Three Implies Chaos) của Li-Yorke trong Lean 4, tạo ra hơn 6000 dòng mã nguồn Lean, với chứng minh hoàn chỉnh đã được xác thực bởi nhân (kernel) của Lean. Mô hình chưa từng được huấn luyện chuyên biệt cho Lean.

Dòng MiMo-V2.6 tiếp tục áp dụng định giá API của dòng V2.5: Flash có giá 1 nhân dân tệ cho mỗi triệu token đầu vào và 2 nhân dân tệ cho mỗi triệu token đầu ra; Pro có giá 3 nhân dân tệ và 6 nhân dân tệ, đồng thời cung cấp chiết khấu bộ nhớ đệm (cache) 99%. Ở cùng mức độ thông minh, giá chỉ bằng 1/20 đến 1/60 so với các mô hình nước ngoài.
Cùng với việc ra mắt mô hình mới, ứng dụng máy tính để bàn MiMo Desktop (hỗ trợ Windows và Mac) và gói đăng ký thành viên cũng được ra mắt đồng thời. Đăng ký thành viên có thể sử dụng mô hình MiMo-V2.6-Pro và Flash, cũng có thể cấu hình API Key của riêng mình để sử dụng ứng dụng.
MiMo Desktop đồng thời ra mắt chế độ siêu tốc UltraSpeed cho MiMo-V2.6-Pro, cung cấp tốc độ suy luận nhanh gấp 20 lần.
Dòng MiMo-V2.6 đã có mặt trên nền tảng mở Xiaomi MiMo. Hoạt động mời dùng thử ban đầu sẽ kết thúc sau 1 tuần, người dùng đã có tư cách mời dùng thử cần chuyển đổi tên mô hình mới có thể tiếp tục sử dụng.
Đồng thời, Xiaomi chính thức mở nguồn toàn bộ trọng số mô hình và báo cáo kỹ thuật của MiMo-V2.6-Pro và Flash, đồng thời mở tài nguyên nghiên cứu RL đi kèm cho MiMo-V2.6-Distill-Qwen-9B, chia sẻ các thực tiễn huấn luyện đã được kiểm chứng. Dưới đây là nội dung mã nguồn mở chi tiết:
Hơn 7 nghìn môi trường tác vụ RL chất lượng cao: Bao phủ bốn loại tác vụ tác nhân (agent) bao gồm kỹ thuật phần mềm, tái hiện lỗ hổng bảo mật, công việc tri thức, thiết kế và phát triển web. Lấy MiMo-V2.6-Distill-Qwen-9B làm điểm khởi đầu để triển khai huấn luyện RL, đạt được sự cải thiện trong cả 11 bài đánh giá so với đường cơ sở SFT: SWE-bench Verified tăng từ 61,1 lên 66,2, MiMo Cyber Bench tăng từ 31,3 lên 47,0, Terminal Bench 2.1 tăng từ 37,1 lên 52,8, MiMo Visual Coding tăng từ 64,0 lên 72,4;
Khung huấn luyện RL đầu cuối (end-to-end): Dựa trên verl, uni-agent và mini-swe-agent, bao phủ quy trình huấn luyện hoàn chỉnh từ tương tác môi trường, thu thập quỹ đạo, đánh giá phần thưởng đến tối ưu hóa chiến lược. Kết hợp với mô hình và môi trường tác vụ mở, hỗ trợ cộng đồng nghiên cứu và lặp lại xung quanh thuật toán huấn luyện, cơ chế phần thưởng và agent harness;
Harness nhẹ và có thể kết hợp: Mã nguồn mở các mini-harnesses tối giản, tách biệt các gợi ý hệ thống (system prompts), công cụ và quản lý ngữ cảnh, xây dựng cấu hình huấn luyện đa dạng và có thể kiểm soát. Thông qua Multi-Harness Training, có thể đưa tính đa dạng và sự tinh gọn vào huấn luyện RL, nâng cao khả năng tổng quát hóa của mô hình trên các khung khác nhau, bao gồm cả các khung chưa từng thấy, hỗ trợ cộng đồng tự do kết hợp các thành phần khung, mở rộng cấu hình huấn luyện và liên tục khám phá các hướng nghiên cứu mới.
Tuyên bố quảng cáo: Các liên kết ngoài có trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian sàng lọc, kết quả chỉ mang tính chất tham khảo. Các bài viết của IT có chứa liên kết ngoài đều bao gồm tuyên bố này.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.