Mô hình
Liquid AI ra mắt mô hình DSpark: Tăng tốc độ giải mã lên gấp 3,18 lần cho dòng LFM2.5
(giờ Việt Nam)
Tóm tắt AI
Liquid AI vừa giới thiệu các mô hình dự thảo DSpark cho dòng LFM2.5, giúp tăng tốc độ giải mã lên tới 3,18 lần trên GPU H100 và 2,87 lần trên chip M4 Max mà vẫn giữ nguyên chất lượng đầu ra.
Bản dịch AI

Liquid AI đã phát hành các checkpoint mô hình dự thảo DSpark cho ba mô hình thuộc dòng LFM2.5: LFM2.5-1.2B-Instruct, LFM2.5-2.6B và LFM2.5-8B-A1B. Mỗi mô hình dự thảo (drafter) bổ sung một đường dẫn giải mã suy đoán (speculative decoding) vào một mô hình mục tiêu hiện có. Một mô hình dự thảo với khoảng 300 triệu tham số sẽ đề xuất một khối gồm chín token ứng viên, và mô hình mục tiêu sẽ xác thực toàn bộ khối đó trong một lần truyền xuôi (forward pass) duy nhất. Sự đánh đổi ở đây là mức tăng bộ nhớ nhỏ để đổi lấy tốc độ giải mã nhanh hơn đáng kể: lên tới 3,18 lần trên H100 và lên tới 2,87 lần trên MacBook Pro chip M4 Max. Đầu ra không thay đổi. Với phương pháp giải mã tham lam (greedy decoding), trình tự được tạo ra giống hệt như khi chạy mô hình mục tiêu đơn lẻ, vì vậy độ chính xác trên các bài kiểm tra (benchmark) vẫn được giữ nguyên. Cả llama.cpp và SGLang đều hỗ trợ ngay từ ngày đầu tiên.
Có thể triển khai được không?
Có, nếu bạn tự lưu trữ (self-host). Các trọng số được cung cấp dưới định dạng Safetensors và GGUF, và hiện tại chưa có nhà cung cấp dịch vụ suy luận (inference provider) nào trên Hugging Face hỗ trợ các checkpoint dự thảo này. Để chạy chúng, bạn cần bản build SGLang hoặc llama.cpp có hỗ trợ DSpark cho các mục tiêu LFM2.
Drafter là gì?
Giải mã suy đoán sử dụng một mô hình nhỏ để đề xuất các token mà một mô hình lớn hơn sẽ xác thực. Mỗi drafter LFM2.5 có khoảng 300 triệu tham số: 295,7 triệu cho mục tiêu 1.2B-Instruct và 327,7 triệu cho các mục tiêu 2.6B và 8B-A1B. Cấu trúc cốt lõi bao gồm 5 lớp full-attention với hidden_size=2048, intermediate_size=6144, GQA với 32 đầu (heads) trên 8 đầu KV, và kích thước khối là 9. Drafter không đi kèm trọng số từ vựng; embedding và LM head được liên kết từ mô hình mục tiêu tại thời điểm tải. Kho lưu trữ của drafter 2.6B có dung lượng 655 MB ở định dạng BF16, đây chính là chi phí bộ nhớ thực tế mà bạn phải thêm vào.
DSpark kết hợp ba phần. Một cấu trúc cốt lõi song song kiểu DFlash, được điều kiện hóa dựa trên các đặc trưng ngữ cảnh của mô hình mục tiêu, tạo ra các trạng thái ẩn cho tất cả các token dự thảo trong một lần truyền xuôi. Một head tuần tự nhẹ, được mô hình hóa như một chuỗi Markov giữa các token lân cận ở hạng 256, giúp khôi phục sự phụ thuộc giữa các token và nâng cao tỷ lệ chấp nhận ở các vị trí sau trong khối. Một bộ xác thực dựa trên độ tin cậy (confidence-scheduled verifier) dự đoán xác suất tồn tại của mỗi token và loại bỏ các hậu tố có độ tin cậy thấp khi việc xác thực tiêu tốn nhiều tài nguyên hơn là tiết kiệm được.
Các kết quả đo lường
Liquid AI báo cáo thông lượng trên 1xH100 ở định dạng BF16 thông qua SGLang, và trên MacBook Pro M4 Max thông qua llama.cpp với Metal và trọng số GGUF FP16. Cả hai đều sử dụng kích thước khối 9, kích thước batch 1 và nhiệt độ (temperature) 0, trên các tập dữ liệu MATH500, HumanEval, MBPP, GSM8K và MT-Bench.
Tốc độ tăng phụ thuộc vào tỷ lệ chấp nhận, vốn phụ thuộc vào khả năng dự đoán của đầu ra. LFM2.5-8B-A1B chấp nhận 8,27 trên 10 token mỗi bước trên MATH500 và chỉ 4,02 trên GSM8K, vì vậy cùng một mô hình có thể dao động từ 3,18 lần xuống 1,29 lần trên cùng một GPU. Trên mô hình 1.2B, tỷ lệ chấp nhận trên MT-Bench giảm xuống 3,90 và mức tăng trên H100 giảm xuống 1,66 lần.
Kết quả MoE trên Apple silicon là lưu ý rõ ràng nhất: LFM2.5-8B-A1B chỉ đạt mức tăng trung bình 1,18 lần trên M4 Max. Liquid AI cho rằng điều này là do cách triển khai MoE hiện tại trong backend Metal của llama.cpp, và thực tế là việc xác thực k token sẽ kích hoạt nhiều chuyên gia (experts) hơn, do đó lưu lượng trọng số lớn hơn so với một bước giải mã đơn lẻ.
Trường hợp sử dụng cho Agent
Mức tăng tập trung vào những nơi người dùng phải chờ đợi quá trình suy luận trước mỗi lần gọi công cụ. Trong các kịch bản gọi hàm đa công cụ (multi-tool function-calling), Liquid AI báo cáo rằng DSpark giảm độ trễ trung bình 57% cho LFM2.5-2.6B. Hãy kiểm tra với các dấu vết (traces) của riêng bạn: một agent thực hiện lập kế hoạch, gọi hàm và lập kế hoạch lại sẽ phải trả chi phí giải mã nhiều lần cho mỗi lượt tương tác của người dùng.
Trên SGLang, hãy khởi chạy mô hình mục tiêu với drafter được đính kèm:
Kích thước khối được đọc từ tệp config.json của drafter, và đường cơ sở (baseline) là cùng một lệnh đó nhưng không có ba cờ --speculative-*.
Những điểm chính cần lưu ý
Hãy xem thẻ mô hình (model card) trên 8B-A1B và bài viết kỹ thuật đầy đủ. Mọi công lao cho nghiên cứu này thuộc về các nhà nghiên cứu của dự án.
Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia cộng đồng 150k+ ML SubReddit của chúng tôi và đăng ký nhận bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, bản phát hành sản phẩm hoặc hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.