Mô hình
OpenBMB ra mắt MiniCPM5-2B: Mô hình 2.52 tỷ tham số tối ưu cho thiết bị di động
(giờ Việt Nam)
Tóm tắt AI
OpenBMB giới thiệu MiniCPM5-2B, mô hình ngôn ngữ nhỏ gọn với 2.52 tỷ tham số, hỗ trợ cửa sổ ngữ cảnh 131k token và tương thích hoàn hảo với các công cụ chạy AI trên thiết bị như Ollama hay llama.cpp.
Bản dịch AI

OpenBMB vừa phát hành MiniCPM5-2B, checkpoint thứ hai trong dòng MiniCPM5 và là phiên bản kế nhiệm của MiniCPM5-1B. Đây là một mô hình ngôn ngữ nhân quả (causal language model) dày đặc với 2.516.756.480 tham số, trong đó 1.981.982.720 tham số nằm ngoài các lớp embedding. Mô hình sử dụng 42 lớp, cơ chế chú ý truy vấn nhóm (grouped-query attention) với 16 đầu truy vấn và 2 đầu khóa/giá trị, cùng cửa sổ ngữ cảnh gốc lên tới 131.072 token. Kiến trúc này tuân theo chuẩn LlamaForCausalLM, vì vậy các engine phổ biến có thể tải mô hình mà không cần kernel tùy chỉnh hay fork mã nguồn mô hình.
Có thể triển khai được không? Có. Các trọng số được cấp phép theo Apache 2.0 và có thể chạy thông qua vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX và FlagOS.
Bảng điểm chuẩn thực sự cho thấy điều gì
OpenBMB so sánh MiniCPM5-2B với LFM2.5-2.6B, Qwen3.5-2B và Gemma-4-E2B-it trong cùng phân khúc kích thước, đồng thời liệt kê Qwen3.5-4B, granite-4.2-3B, Nemotron-3-Nano-4B, Gemma-4-E4B-it và LFM2.5-8B-A1B để tham chiếu. Trên 34 hàng điểm chuẩn, mô hình đạt mức trung bình 53,9. Baseline tốt nhất trong tập hợp đó là Qwen3.5-4B với 51,1, tiếp theo là granite-4.2-3B với 42,7 và LFM2.5-2.6B với 33,2.
Về khả năng suy luận mã nguồn, MiniCPM5-2B đạt 69,1 trên LiveCodeBench v6 so với 56,4, và 46,4 trên SWE-bench Verified so với 33,6. Khả năng sử dụng công cụ là điểm khác biệt lớn nhất: 97,1 trên τ²-Bench Telecom, 66,6 trên BFCL v4, và 20,8 trên τ³-Bench Banking so với 6,8. Đối với ngữ cảnh dài, kết quả khá phân hóa: 68,1 trên NoLiMa so với 43,5, nhưng đạt 59,0 trên AA-LCR so với 61,0 và 43,7 trên LongBench v2 so với 47,3. Kiến thức tổng quát là nơi khoảng cách về kích thước thể hiện rõ: 70,8 trên MMLU-Pro so với 78,0, và 8,9 trên Humanity’s Last Exam so với 9,9. OpenBMB đánh dấu riêng các hàng dữ liệu lấy từ Artificial Analysis so với các hàng được tái tạo nội bộ.
Công thức huấn luyện: SFT, sau đó là RL, cuối cùng là chưng cất on-policy (on-policy distillation).
Quá trình huấn luyện tuân theo phương pháp quản lý dữ liệu phân tầng UltraData được mô tả trong nghiên cứu gốc. Quá trình huấn luyện cơ sở chạy qua các giai đoạn ổn định và suy giảm, sau đó giai đoạn huấn luyện trung gian điều chỉnh mô hình theo phân phối dữ liệu mục tiêu. Giai đoạn hậu huấn luyện bắt đầu với 400 tỷ token SFT tư duy sâu (deep-thinking SFT), sau đó huấn luyện các giáo viên RL chuyên biệt cho toán học, mã nguồn, tác vụ đại lý (agentic tasks) và viết lách bằng thuật toán JustRL II dựa trên phê bình (critic-based).
Bước cuối cùng là chưng cất on-policy (OPD). OPD hợp nhất 16 chuyên gia RL, trong đó có 5 chuyên gia về tác vụ đại lý, thành một mô hình duy nhất để phát hành. Tại mỗi vị trí phản hồi, nó tính toán sự phân kỳ KL ngược trên toàn bộ từ vựng giữa logit của học viên và giáo viên để làm ước tính lợi thế, thay thế cho lợi thế dựa trên xác minh. Nó tái sử dụng các prompt RL làm dữ liệu chưng cất, vì vậy không cần xây dựng kho ngữ liệu mới. OpenBMB đo lường giai đoạn RL cộng với OPD đạt trung bình 10,96 điểm trên các bài kiểm tra suy luận và tổng quát, và 6,96 điểm trên các bài kiểm tra về tác vụ đại lý.
Dữ liệu cũng được mở
Cùng với các trọng số, OpenBMB đã phát hành Ultra-FineWeb, Ultra-FineWeb-L3, UltraX, UltraData-Code, UltraData-Math, UltraData-SFT-2605, UltraData-SFT-Agent-2609 với 500 nghìn mẫu đại lý, và UltraData-RL-2609 với hơn 80 nghìn mẫu RL. Các checkpoint trung gian cũng được công bố, bao gồm Base, Midtrain và SFT-only, giúp có thể đo lường trực tiếp đóng góp của từng giai đoạn.
Tóm tắt
MiniCPM5-2B là một lựa chọn đáng tin cậy để chạy trên thiết bị cho các tác vụ đại lý và gọi công cụ, không phải là một mô hình kiến thức tổng quát. Ưu điểm của nó thể hiện rõ nhất ở khả năng sử dụng công cụ, các đại lý lập trình và truy xuất ngữ cảnh dài theo phong cách NoLiMa, trong khi vẫn thua kém các mô hình lớn hơn trên MMLU-Pro, GPQA-Diamond và MATH-500. Dữ liệu mở và các checkpoint trung gian giúp việc kiểm chứng tuyên bố về RL cộng với OPD trở nên khả thi, điều này quan trọng hơn con số trung bình tiêu đề.
Những điểm chính cần lưu ý
Hãy xem qua HF, kho lưu trữ GitHub và trang web. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia cộng đồng 150k+ ML SubReddit của chúng tôi cũng như đăng ký nhận bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá kho lưu trữ GitHub, trang Hugging Face, bản phát hành sản phẩm hoặc hội thảo trực tuyến của bạn? Hãy kết nối với chúng tôi.
Sana Hassan, một thực tập sinh tư vấn tại Marktechpost và là sinh viên văn bằng kép tại IIT Madras, rất tâm huyết với việc ứng dụng công nghệ và AI để giải quyết các thách thức trong thế giới thực. Với sự quan tâm sâu sắc đến việc giải quyết các vấn đề thực tiễn, anh mang đến một góc nhìn mới mẻ cho sự giao thoa giữa AI và các giải pháp đời sống.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.