Mô hình
Xiaomi ra mắt MiMo-V2.6: Đỉnh cao mô hình mã nguồn mở, vướng nghi vấn dùng dữ liệu từ Claude
(giờ Việt Nam)
Tóm tắt AI
Xiaomi vừa trình làng dòng MiMo-V2.6, trong đó bản Pro dẫn đầu bảng xếp hạng Artificial Analysis với chi phí cực kỳ cạnh tranh, dù Anthropic cáo buộc mô hình này được huấn luyện bằng dữ liệu chưng cất từ Claude.
Chính văn · Bản dịch AI

Xiaomi vừa ra mắt dòng sản phẩm MiMo-V2.6, trong đó mẫu flagship đang đứng đầu bảng xếp hạng các mô hình mã nguồn mở với chi phí trên mỗi tác vụ chỉ bằng một phần nhỏ so với các đối thủ cạnh tranh. Những cải tiến này đến từ quá trình học tăng cường (reinforcement learning) được mở rộng quy mô lớn, mặc dù công ty cũng đang đối mặt với cáo buộc sao chép từ Claude của Anthropic.
Theo Xiaomi, mẫu lớn hơn trong hai mô hình mới, MiMo-V2.6-Pro, đạt 46 điểm trên Intelligence Index từ công ty phân tích Artificial Analysis. Điều này biến nó trở thành mô hình AI mã nguồn mở mạnh nhất hiện nay, vượt qua các đối thủ như Kimi K3 và Qwen. Điểm đáng chú ý nhất chính là giá thành: 0,435 USD cho mỗi triệu token đầu vào và 0,87 USD cho mỗi triệu token đầu ra.
Theo tính toán của Artificial Analysis, một tác vụ kiểm thử đơn lẻ chỉ tốn khoảng 0,13 USD, thấp hơn nhiều so với mức phí của các mô hình có năng lực tương đương. Điều này đưa mô hình vào vị trí được gọi là đường biên Pareto (Pareto frontier) về trí tuệ và chi phí.

Pro là một mô hình mixture-of-experts với 1,02 nghìn tỷ tham số, trong đó chỉ có 42 tỷ tham số hoạt động cho mỗi yêu cầu. Song hành cùng nó là phiên bản MiMo-V2.6-Flash nhỏ gọn và hiệu quả hơn.
Những cải tiến đến từ học tăng cường
Xiaomi cho rằng bước nhảy vọt về hiệu suất là nhờ việc mở rộng đáng kể học tăng cường (RL), tức là huấn luyện thông qua thử nghiệm, phản hồi và phần thưởng. Công ty đã mở rộng giai đoạn này trên ba trục: nhiều dữ liệu hơn cho mỗi bước huấn luyện, môi trường tác vụ đa dạng hơn và nhiều tài nguyên tính toán hơn để đánh giá các giải pháp.
Xiaomi cho biết quá trình chạy huấn luyện mất chưa đầy sáu ngày, với chi phí khoảng 2,62 triệu USD cho bản Pro và 0,85 triệu USD cho bản Flash. Trong bài kiểm tra lập trình DeepSWE, điểm số của Pro đã tăng từ 58,4 lên 72,6, trong khi Flash tăng từ 48,8 lên 65,7.
Để giữ cho quá trình huấn luyện ổn định ở quy mô này, Xiaomi đã đóng băng cơ chế phân phối nội bộ của mô hình và bổ sung nhiều lớp bảo vệ chống lại "reward hacking" (hack phần thưởng) – những thủ thuật mà mô hình sử dụng để thao túng phần thưởng mà không thực sự giải quyết được tác vụ.
Khoảng 7.000 tác vụ với hệ thống chấm điểm tự động
Cùng với các mô hình này, Xiaomi còn cung cấp một biến thể đặc biệt nhanh có tên là Pro-UltraSpeed, với tốc độ đầu ra nhanh gấp 20 lần. Điều nổi bật nhất là công ty đang mở bộ công cụ RL của mình, bao gồm báo cáo kỹ thuật, khung huấn luyện đầy đủ, một mô hình nhỏ hơn để huấn luyện thêm và khoảng 7.000 tác vụ huấn luyện sẵn có với hệ thống chấm điểm tự động cho các lĩnh vực phát triển phần mềm, an ninh mạng, công việc văn phòng, thiết kế web, cùng khoảng 1.000 tác vụ sáng tác nhạc.
Các tác vụ này đến từ nhiều nguồn khác nhau. Một phần mã nguồn lấy từ các pull request thực tế trên GitHub của nhân viên và truy vấn người dùng, trong khi các mô tả tác vụ khác được tạo bởi mô hình ngôn ngữ. Các tác vụ an ninh mạng dựa trên OSS-Fuzz, một bộ sưu tập hàng chục nghìn lỗ hổng phần mềm thực tế, và các môi trường văn phòng được xây dựng tổng hợp.
Sự cởi mở đầy chủ đích và tầm ngắm của Anthropic
Sự cởi mở này hoàn toàn trái ngược với những cáo buộc mà Anthropic đưa ra chỉ hai tuần trước đó. Trong báo cáo tình báo về mối đe dọa, Anthropic đã kiểm tra các trường hợp lạm dụng Claude được phát hiện từ tháng 12 năm 2025 đến tháng 8 năm 2026, và nêu tên bảy phòng thí nghiệm Trung Quốc liên quan đến các chiến dịch chống lại mô hình này: Alibaba, Moonshot AI, DeepSeek, Zhipu, Xiaomi, MiniMax và SenseTime.
Tổng cộng, các phòng thí nghiệm này được cho là đã tạo ra khoảng 190 triệu lượt trao đổi để "hút" khả năng của Claude nhằm huấn luyện các mô hình riêng của họ, một kỹ thuật mà Anthropic gọi là chưng cất bất hợp pháp (illegal distillation).
Xiaomi bị nêu tên trực tiếp. Trong trường hợp có mã GTG-16008, Anthropic đã theo dõi hơn 400.000 lượt trao đổi trong 20 ngày vào tháng 3 và tháng 4 năm 2026, trong đó Xiaomi đã chuyển các cuộc hội thoại của người dùng và các phiên lập trình từ mô hình MiMo của chính họ thông qua OpenClaw và OpenCode sang Claude, nhằm làm phong phú dữ liệu huấn luyện cho các mô hình tương lai. Báo cáo hầu như không cung cấp tài liệu nào về nguồn gốc dữ liệu huấn luyện và dữ liệu giáo viên ban đầu cho việc chưng cất nội bộ các mô hình giáo viên.
Nói cách khác, báo cáo khẳng định Xiaomi đã ghi lại các cuộc hội thoại của người dùng với mô hình MiMo của mình, sau đó đưa chúng vào Claude để trích xuất dữ liệu huấn luyện – chính là dữ liệu đã đưa họ lên vị trí dẫn đầu các bảng xếp hạng mô hình mở hiện nay.
Tin tức AI không cường điệu – Được tuyển chọn bởi con người
Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo chuyên sâu "AI Radar" độc quyền sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.
Đăng ký ngay
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.