Sản phẩm
Unsloth ra mắt định dạng Dynamic 3.0 GGUF: Tối ưu hóa hiệu suất suy luận cục bộ
(giờ Việt Nam)
Tóm tắt AI
Unsloth vừa giới thiệu định dạng Dynamic 3.0 GGUF, tập trung vào việc cải thiện hiệu suất và khả năng tương thích cho các mô hình ngôn ngữ lớn khi chạy trên thiết bị cá nhân.
Bản dịch AI

🦥 Unsloth Dynamic 3.0 GGUF
Unsloth Dynamic v3.0 là phiên bản kế tiếp của phương pháp lượng tử hóa Dynamic (Dynamic quantization) của chúng tôi và là một cải tiến lớn so với Dynamic v2.0.
Hôm nay, chúng tôi ra mắt các bản lượng tử hóa Qwen3.8-27B Dynamic v3.0, mang lại độ chính xác top-1% cao hơn >10% ở cùng kích thước so với mọi nhà cung cấp khác. Đây là bản cập nhật cho phiên bản xem trước sớm (early preview) đầu tiên mà chúng tôi đã chia sẻ về Dynamic v3.0. Các tệp GGUF 3.0 mới hoạt động với hầu hết các công cụ suy luận (inference engines), bao gồm llama.cpp và Unsloth Desktop.
Nhìn chung, Dynamic v3.0 bảo toàn chất lượng mô hình tốt hơn trong khi vẫn giữ nguyên kích thước, với kết quả mạnh mẽ hơn trên các chỉ số như Divergence-300 @32 và KL Divergence.
Xin gửi lời cảm ơn sâu sắc đến tất cả sự ủng hộ của các bạn! Chúng tôi đã ghi nhận hơn 5,1 triệu lượt tải xuống Unsloth Qwen3.8 chỉ trong vòng 5 ngày!

Phương pháp mới của chúng tôi bao gồm nhiều tính năng và cải tiến mới. Hiện tại, chúng tôi sử dụng tập dữ liệu hiệu chuẩn imatrix chất lượng cao hơn nhiều từ các nguồn đa dạng. Tập dữ liệu này được tinh chỉnh cho các tác vụ lập trình đại lý (agentic coding), trò chuyện và hiệu suất đa ngôn ngữ. Chúng tôi cũng cải thiện việc lựa chọn lớp (layer selection) và giới thiệu thêm nhiều kỹ thuật lượng tử hóa để bảo toàn chất lượng mô hình ở mức tối đa.
Chúng tôi không huấn luyện trên tập dữ liệu hiệu chuẩn imatrix và KHÔNG sử dụng QAT hay QAD. Mọi thứ đều được thực hiện thông qua lượng tử hóa hậu huấn luyện (post-training quantization). Tệp imatrix của chúng tôi được cung cấp công khai để cộng đồng có thể kiểm tra, đánh giá và sử dụng. Chúng tôi khuyến khích các nhà nghiên cứu và lập trình viên tạo ra các biến thể và bản tinh chỉnh (fine-tune) của Qwen3.8 bằng cách sử dụng các bản lượng tử hóa/imatrix của Unsloth. Bạn cũng có thể đọc phân tích về tình trạng quá khớp (overfitting) của chúng tôi.
Chúng tôi cũng đã loại bỏ mô-đun MTP khỏi các bản lượng tử hóa nhỏ hơn mức UD-Q2_K_XL (8,37GB trở xuống) để tiết kiệm khoảng 500MB dung lượng đĩa - bạn có thể sử dụng mô-đun MTP Q4_0 riêng biệt nếu cần.
Chúng tôi cũng đã tạo ra một số bản lượng tử hóa UD-1bit nhỏ hơn, với UD-IQ1_S chỉ nặng 6,2GB (không bao gồm MTP) nhưng vẫn giữ được khoảng 72% độ chính xác top-1% trong khi kích thước nhỏ hơn tới 89%.
UD-Q2_K_XL có độ chính xác top-1% cao hơn khoảng +8% so với đối thủ tốt nhất tiếp theo, với dung lượng 9,83GB và đã tạo thành công một chương trình HTML hoạt động được với chỉ 1 lỗi JS nhỏ - trước đây chương trình này thường bị lỗi.

🔀 Divergence-300 @32
Chúng tôi thường báo cáo độ chính xác top-1% giống như cách Kimi-K3 thực hiện: "Dynamic 1-bit đạt độ chính xác top-1 khoảng 78,9% trong khi kích thước nhỏ hơn 62%". Tuy nhiên, top-1% là giá trị argmax trên 1 dự đoán, vì vậy nó không thực sự hiệu quả để đánh giá quá trình suy luận thực tế.
Chúng tôi đã tạo ra một tập dữ liệu gồm 300 ví dụ độc lập (KHÔNG nằm trong tập dữ liệu hiệu chuẩn) từ Terminal-Bench 2.1 + DeepSWE + Harbor + MathArena 2025-26 + các câu lệnh (prompt) không phải tiếng Latin/tài liệu dài, và chúng tôi đã thực hiện giải mã greedy argmax cho 32 token để so sánh BF16 với tất cả các bản lượng tử hóa và nhà cung cấp khác. Xem phân tích quá khớp để biết thêm chi tiết.
Điều này cho phép chúng tôi đánh giá liệu có xảy ra tình trạng quá khớp hay không và liệu đầu ra của bản lượng tử hóa có tương đồng với quỹ đạo của BF16 qua nhiều token hay không. Đây là chỉ số tốt hơn so với độ chính xác top-1% vì chúng tôi mở rộng KLD top-1% thành dạng KLD top-1% tại 32 token.

🔀 Điểm chuẩn KL Divergence
Chúng tôi cũng đã chạy các điểm chuẩn KLD cho tất cả các nhà cung cấp và báo cáo chỉ số Top-1% cùng giá trị trung bình KLD. Ở mọi cấp độ, đặc biệt là trên các kích thước lượng tử hóa nhỏ hơn, các bản lượng tử hóa Unsloth UD-3 đạt được độ chính xác top-1% cao hơn tới +10% ở cùng dung lượng đĩa!
Tất cả các biểu đồ đều loại bỏ phần đầu MTP khỏi trục x khi tính toán dung lượng đĩa để đảm bảo sự so sánh công bằng cho tất cả mọi người.


🕊️ Không quá khớp (Not Overfitting)
Khi so sánh với phiên bản UD-2 cũ hơn của chúng tôi trên dữ liệu Wikitext và Code chưa từng thấy, chúng tôi cho thấy sự cải thiện lớn về KLD - các mô hình lớn hơn không cải thiện nhiều, vì vậy chúng tôi vẫn sử dụng UD-2 cũ cho các bản lượng tử hóa lớn hơn - chúng tôi cũng dự định sẽ thử nghiệm và cải thiện chúng!
Chúng tôi cũng kiểm soát tình trạng quá khớp bằng cách sử dụng các tập dữ liệu hoàn toàn khác biệt cho việc hiệu chuẩn và loại bỏ tối đa mọi sự rò rỉ dữ liệu. Chúng tôi kiểm tra KLD trên các tập dữ liệu chưa từng thấy này, và chúng tôi KHÔNG thực hiện QAD/QAT, chỉ sử dụng PTQ thuần túy nên quá khớp ít đáng lo ngại hơn so với các phương pháp QAD/QAT khác.
Tương tự, 🔀 Divergence-300 @32 sử dụng tập dữ liệu gồm 300 câu lệnh chưa từng thấy từ DeepSWE, Terminal Bench và các nguồn khác, đóng vai trò như một tập dữ liệu khác để đánh giá quá khớp - và cho thấy các phương pháp UD-3 mới của chúng tôi không bị quá khớp.
Dynamic v2.0 (Cũ)
Chúng tôi giới thiệu phương pháp lượng tử hóa Unsloth Dynamic v2.0 - một bản nâng cấp lớn so với các bản lượng tử hóa trước đây. Phương pháp mới này vượt trội hơn các phương pháp lượng tử hóa hàng đầu và thiết lập các tiêu chuẩn mới cho Aider Polyglot, 5-shot MMLU và KL Divergence.
Điều này có nghĩa là bạn hiện có thể chạy và tinh chỉnh các LLM đã được lượng tử hóa trong khi vẫn bảo toàn độ chính xác ở mức cao nhất có thể! Bạn có thể chạy các tệp GGUF 2.0 trên hầu hết các công cụ suy luận như llama.cpp, Unsloth Studio, v.v.
Cập nhật ngày 10 tháng 9 năm 2025: Bạn đã yêu cầu các bài kiểm tra khó hơn, vì vậy đây là kết quả Aider Polyglot! Bản GGUF Dynamic 3-bit DeepSeek V3.1 của chúng tôi đạt 75,6%, vượt qua nhiều LLM SOTA (State-of-the-art) ở độ chính xác đầy đủ. Đọc thêm.
Bạn cũng có thể xem các điểm chuẩn về trường hợp sử dụng thực tế do Benjamin Marie thực hiện cho LiveCodeBench v6, MMLU Pro, v.v.:
Bạn có thể thấy các tệp GGUF của Unsloth hoạt động tốt hơn các bản lượng tử hóa không phải của Unsloth mặc dù kích thước nhỏ hơn khoảng 8GB.
Phân tích chi tiết về các điểm chuẩn và đánh giá của chúng tôi ở bên dưới.
💡 Có gì mới trong Dynamic v2.0?
Cải tiến Lựa chọn lớp cho GGUF + safetensors: Unsloth Dynamic 2.0 hiện lượng tử hóa các lớp một cách thông minh và sâu rộng hơn nhiều. Thay vì chỉ sửa đổi các lớp được chọn, giờ đây chúng tôi điều chỉnh linh hoạt loại lượng tử hóa của mọi lớp có thể, và các kết hợp sẽ khác nhau đối với từng lớp và từng mô hình.
Các tệp GGUF đã chọn hiện tại và tất cả các tệp tải lên trong tương lai sẽ sử dụng Dynamic 2.0 và tập dữ liệu hiệu chuẩn mới của chúng tôi. Tập dữ liệu chứa hơn 1,5 triệu token (tùy thuộc vào mô hình) và bao gồm dữ liệu chất lượng cao, được tuyển chọn và làm sạch thủ công - để nâng cao đáng kể hiệu suất trò chuyện.
Trước đây, phương pháp lượng tử hóa Dynamic của chúng tôi (DeepSeek-R1 1.58-bit GGUF) chỉ hiệu quả với các kiến trúc MoE. Lượng tử hóa Dynamic 2.0 hiện hoạt động trên tất cả các mô hình (bao gồm cả MOE và không phải MOE).
Lượng tử hóa theo mô hình: Mỗi mô hình hiện sử dụng một lược đồ lượng tử hóa được tùy chỉnh riêng. Ví dụ: các lớp được lượng tử hóa trong Gemma 3 khác biệt đáng kể so với những lớp trong Llama 4.
Để tối đa hóa hiệu quả, đặc biệt là trên các thiết bị Apple Silicon và ARM, chúng tôi hiện cũng bổ sung các định dạng Q4_NL, Q5.1, Q5.0, Q4.1 và Q4.0.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.