Hugging Face: Blog
85

Mô hình

Liquid AI ra mắt dòng LFM 2.5 với kỹ thuật QAD: Khôi phục 97% độ chính xác sau khi lượng tử hóa

(giờ Việt Nam)

Tóm tắt AI

Liquid AI giới thiệu các checkpoint Q4_0 cho dòng mô hình LFM 2.5, sử dụng kỹ thuật chưng cất nhận thức lượng tử (QAD) để duy trì tốc độ cao trong khi khôi phục tới 97% độ chính xác so với chuẩn BF16.

Bản dịch AI

LFM2.5 Q4\_0 Checkpoints from Quantization-Aware Distillation

Quay lại danh sách bài viết

Hôm nay, chúng tôi phát hành các tệp QAD Q4_0 GGUF. Đây là các checkpoint 4-bit đã được cập nhật cho LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct và LFM2.5-2.6B. Chúng cho phép các nhà phát triển chạy các mô hình LFM2.5 ở mức bộ nhớ và tốc độ Q4_0 mà không bị suy giảm chất lượng như thông thường:

Kết quả đánh giá (Benchmark)

Đối với cả bốn mô hình, chúng tôi so sánh các tệp GGUF được phát hành bằng phương pháp lượng tử hóa sau huấn luyện (PTQ) với các checkpoint QAD Q4_0 đã qua huấn luyện trên một bộ tiêu chuẩn đánh giá bao gồm khả năng suy luận, tuân thủ chỉ dẫn, sử dụng công cụ và khả năng tác nhân: GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF và BFCLv4. Định dạng BF16 GGUF đóng vai trò là ngưỡng hiệu năng tối đa. Chúng tôi cũng bổ sung một bài kiểm tra toán học phù hợp với quy mô: GSM8K cho LFM2.5-230M và LFM2.5-350M, và AIME25 cho LFM2.5-1.2B-Instruct và LFM2.5-2.6B. Chúng tôi báo cáo giá trị trung bình qua năm lần lặp lại.

lfm25_gguf_eval_scores_2x2_liquid

Trên cả bốn mô hình, QAD cải thiện đáng kể checkpoint Q4_0. Các checkpoint QAD duy trì được 97,1%, 96,5%, 97,4% và 96,6% hiệu năng so với mức cơ sở BF16 tương ứng.

Tốc độ và kích thước trên phần cứng biên (edge hardware) thực tế

Chúng tôi đo lường thông lượng giải mã (decode throughput) cho bốn mô hình LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct và LFM2.5-2.6B trên bốn thiết bị mục tiêu: MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra và Raspberry Pi 5. MacBook Pro và NucBox sử dụng suy luận GPU, trong khi Samsung và Raspberry Pi sử dụng suy luận CPU Arm. BF16 và F16 được hiển thị dưới dạng tham chiếu độ chính xác đầy đủ (full-precision) ở những nơi được đo đạc.

lfm25_230m_decode_throughput_4panel_liquidlfm25_350m_decode_throughput_4panel_liquidlfm25_1p2b_decode_throughput_4panel_liquidlfm25_2p6b_decode_throughput_3panel_liquid

Các checkpoint QAD Q4_0 230M và 350M đạt chất lượng tương đương Q5_K_M trong phạm vi sai số đánh giá với thông lượng giải mã cao hơn từ 4-33%. Các checkpoint QAD Q4_0 1.2B và 2.6B đạt chất lượng tương đương Q4_K_M với thông lượng cao hơn từ 3-14%. Các checkpoint QAD Q4_0 cũng tương đương với UD-Q4_K_XL của Unsloth (nếu áp dụng, cho các bản 230M và 1.2B), một checkpoint lượng tử hóa sau huấn luyện mạnh mẽ từ bên thứ ba.

Cách sử dụng QAD GGUF

Sử dụng các tệp này với llama.cpp hoặc bất kỳ runtime nào hỗ trợ các tệp GGUF Q4_0.

Bắt đầu với QAD GGUF

Các tệp QAD GGUF hiện đã có sẵn trên Hugging Face: LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct và LFM2.5-2.6B.

Chúng tôi rất nóng lòng được thấy những gì bạn sẽ xây dựng.

Trích dẫn

Để trích dẫn, vui lòng sử dụng tài liệu tham khảo hoặc BibTeX sau đây:

Hoặc sử dụng trích dẫn BibTeX

Liquid AILượng tử hóaMô hình ngôn ngữTối ưu hóa AILFM 2.5
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.