Mô hình
Ra mắt mô hình tư duy cục bộ 657MB: Tinh chỉnh MiniCPM5-1B từ dữ liệu Claude Fable 5
(giờ Việt Nam)
Tóm tắt AI
Một nhà phát triển cộng đồng đã tinh chỉnh MiniCPM5-1B thành mô hình 1B siêu nhẹ, hỗ trợ ngữ cảnh 128K và khả năng suy luận trực quan, có thể chạy hoàn toàn ngoại tuyến.
Bản dịch AI

Một nhà phát triển cộng đồng có tên GnLOLot vừa công bố một mô hình 1B có khả năng chạy hoàn toàn trên phần cứng cục bộ. Mô hình này có tên là MiniCPM5-1B-Claude-Opus-Fable5-Thinking, với các bản dựng GGUF tương thích với các runtime hỗ trợ llama.cpp. Mô hình không cần khóa API và không thực hiện bất kỳ lệnh gọi nào lên đám mây.
Mô hình được đề xuất
Mô hình được xây dựng dựa trên openbmb/MiniCPM5-1B. Đây là một bản phát hành thực tế, có tài liệu đầy đủ từ OpenBMB. Đây là mô hình dense 1,08 tỷ tham số sử dụng kiến trúc LlamaForCausalLM tiêu chuẩn. Mô hình có 24 lớp, cơ chế grouped-query attention và độ dài ngữ cảnh 131.072 token. OpenBMB báo cáo rằng đây là mô hình mã nguồn mở SOTA trong phân khúc 1B dựa trên tập so sánh của riêng họ.
Bản gốc đã tích hợp sẵn template tư duy (thinking template). Khả năng suy luận được bật/tắt thông qua enable_thinking, cung cấp cả chế độ Think (Tư duy) và No Think (Không tư duy). Mô hình phái sinh này vẫn giữ nguyên template đó và định dạng gọi công cụ (tool-call) của MiniCPM5.
Trên nền tảng đó, nhà phát triển đã thực hiện tinh chỉnh (fine-tune). Thẻ thông tin cho biết mô hình được "tinh chỉnh thêm trên dữ liệu Fable 5" để cải thiện khả năng lập trình và tuân thủ chỉ dẫn. Thẻ GGUF cũng nhắc lại điều này là "được huấn luyện hậu kỳ trên dữ liệu Fable 5".
Cách thức xây dựng thực tế
Phương pháp được mô tả không phải là chưng cất (distillation) cổ điển. Bạn không thu nhỏ mô hình gốc. Thay vào đó, bạn tạo ra nhiều cuộc hội thoại với một mô hình giáo viên (teacher model). Bạn thu thập các phản hồi và dấu vết suy luận của nó dưới dạng văn bản. Sau đó, bạn thực hiện tinh chỉnh có giám sát (supervised-fine-tune) một mô hình cơ sở nhỏ hơn dựa trên các dấu vết đó.
Sự khác biệt này rất quan trọng đối với độ chính xác. Chưng cất cổ điển chuyển giao tín hiệu từ logit hoặc trọng số của giáo viên. Không ai có quyền truy cập vào trọng số hoặc logit của Claude. Vì vậy, đây là quá trình tinh chỉnh có giám sát trên các đầu ra được tạo ra, không phải chưng cất ở cấp độ trọng số. Ngược lại, mô hình cơ sở của chính OpenBMB sử dụng giai đoạn On-Policy Distillation (Chưng cất theo chính sách) có tài liệu giữa các checkpoint giáo viên và học sinh của họ.
Hiệu quả thực tế là mô hình 1B học cách bắt chước định dạng và phong cách phản hồi. Nó không hấp thụ được khả năng cốt lõi của giáo viên. Ngân sách 1 tỷ tham số không thể chứa đựng khả năng suy luận ở quy mô tiên phong (frontier-scale).
Các thông số kỹ thuật đã được kiểm chứng
Cửa sổ ngữ cảnh là 128K token, được kế thừa từ file config.json gốc (131.072). Kho lưu trữ GGUF cung cấp bốn mức lượng tử hóa (quantization). Q4_K_M nặng khoảng 657MB và được gắn nhãn là mức chiếm dụng bộ nhớ nhỏ nhất. Q5_K_M nặng khoảng 751MB. Q8_0 nặng khoảng 1,1GB và là mặc định được người duy trì khuyến nghị. F16 nặng khoảng 2,1GB.
"Mức chiếm dụng 657MB" là mức lượng tử hóa nhỏ nhất, không phải bản dựng mặc định. Mô hình tải trực tiếp trong llama.cpp, Ollama, LM Studio, jan và KoboldCpp.
Tương tác: cách thức hoạt động của bản dựng
Phần giải thích bên dưới sẽ đi qua quy trình xây dựng, các đánh đổi về dung lượng và sự phân tách trung thực về những gì một bản tinh chỉnh có thể và không thể kế thừa.
Cách chạy mô hình
Thẻ GGUF cung cấp một dòng lệnh để chạy qua Ollama:
Cùng kho lưu trữ đó cũng cung cấp tài liệu cho llama.cpp, LM Studio, jan và KoboldCpp. Thông số lấy mẫu (sampling) được khuyến nghị cho chế độ Think là temperature=0.9, top_p=0.95. Mô hình có thể xuất ra các khối suy luận trước câu trả lời cuối cùng, các ứng dụng hạ nguồn có thể lọc bỏ phần này.
Những điểm chính cần lưu ý

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có giá trị thực tiễn.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.