MarkTechPost
Điểm AI 55/100

Mô hình

Liquid AI ra mắt LFM2.5-VL-3B-DSpark: Mô hình hỗ trợ tăng tốc giải mã lên tới 3,13 lần

(giờ Việt Nam)

Tóm tắt AI

Liquid AI giới thiệu LFM2.5-VL-3B-DSpark, mô hình dự đoán (draft model) giúp tăng tốc giải mã cho LFM2.5-VL-3B lên 3,13 lần trên Apple silicon và 2,66 lần trên NVIDIA H100.

Chính văn · Bản dịch AI

Liquid AI Releases LFM2.5-VL-3B-DSpark: Speculative Decoding for Vision-Language Models With Up to 3.13x Faster Decoding

Liquid AI đã công bố LFM2.5-VL-3B-DSpark, một mô hình dự thảo suy luận suy đoán (speculative-decoding) thử nghiệm cho mô hình ngôn ngữ-hình ảnh LFM2.5-VL-3B của họ. Mô hình dự thảo này bổ sung khoảng 280 triệu tham số và tăng tốc độ giải mã mà không làm thay đổi đầu ra của mô hình gốc. Nhóm Liquid AI báo cáo tốc độ giải mã nhanh hơn tới 3,13 lần trên Apple silicon và tới 2,66 lần trên NVIDIA H100.

Có thể triển khai được không? Có, các trọng số đã có sẵn trên Hugging Face ở định dạng Safetensors và GGUF, với sự hỗ trợ ngay từ ngày đầu trên SGLang, MLX-VLM và llama.cpp. Nhóm Liquid AI gắn nhãn bản phát hành này là thử nghiệm và nó được phát hành theo LFM Open License v1.0, cho phép sử dụng thương mại miễn phí chỉ dành cho các công ty có doanh thu hàng năm dưới 10 triệu USD.

Suy luận suy đoán thay đổi điều gì đối với VLM

Một mô hình tiêu chuẩn tạo ra một token cho mỗi lần truyền tiến (forward pass). Suy luận suy đoán bổ sung một mô hình dự thảo nhỏ để đề xuất trước một vài token. Sau đó, mô hình mục tiêu lớn sẽ kiểm tra toàn bộ khối trong một lần truyền và giữ lại các token mà nó đồng ý.

DSpark tuân theo công thức từ các mô hình dự thảo DSpark cho văn bản của Liquid AI, được mô tả trong bài báo về DSpark. Mô hình dự thảo đọc các trạng thái ẩn của mô hình mục tiêu từ một vài lớp và dự đoán k token tiếp theo.

Điểm thiết kế chính: phương thức (modality) không quan trọng đối với mô hình dự thảo. Khi các token đến được các lớp ẩn, cả văn bản và các mảng hình ảnh đều chỉ là các tensor. Vì vậy, nhóm Liquid AI sử dụng lại chính xác thuật toán suy luận đó cho mô hình ngôn ngữ-hình ảnh của mình.

Kiến trúc và huấn luyện mô hình dự thảo

Mô hình dự thảo là một mô hình chỉ sử dụng cơ chế chú ý (attention-only) được đơn giản hóa. Các thử nghiệm cắt tỉa (ablations) đã chọn 4 lớp và kích thước khối là 9. Liquid AI khuyến nghị kích thước khối là 8 hoặc 9 khi suy luận, tùy thuộc vào phần cứng. Các thiết bị chạy Apple silicon sử dụng kích thước 8.

Thành phầnTham số
Ngăn xếp giải mã (4 lớp)193,0 triệu
Chiếu trạng thái ẩn21,0 triệu
Markov head65,5 triệu
Chuẩn hóa + confidence head6,4 nghìn
Tổng cộng279,5 triệu

Embedding và LM head được liên kết với mô hình mục tiêu, vì vậy mô hình dự thảo không chứa chúng. Liquid AI cho biết điều này làm tăng số lượng tham số triển khai thêm 8,9%. Quá trình huấn luyện sử dụng dữ liệu tinh chỉnh có giám sát bao gồm các tác vụ ngôn ngữ-hình ảnh phổ biến trong 10 epoch. Tất cả các thử nghiệm cắt tỉa và huấn luyện đều chạy độc quyền trên phần cứng AMD.

Kết quả điểm chuẩn

Đánh giá tuân theo điểm chuẩn MMSpec trên 6 loại tác vụ: VQA tổng quát, VQA văn bản, Chú thích hình ảnh, VQA biểu đồ, Suy luận phức tạp và Hội thoại đa lượt. Tất cả các lần chạy đều sử dụng kích thước batch là 1, nhiệt độ (temperature) là 0 và trọng số 16-bit cho bộ mã hóa hình ảnh và backbone. Dữ liệu được thu thập trên Pipette, cơ sở hạ tầng đo điểm chuẩn thiết bị công khai của Liquid AI.

Ngăn xếpTốc độ giải mã tăngTốc độ toàn trình tăngToken được chấp nhận mỗi lần truyền
MLX-VLM, M5 Max MacBook Pro (khối 8)2,30x đến 3,13x1,56x đến 2,62x3,24 đến 4,34
llama.cpp, M3 Ultra (khối 8)1,57x đến 2,14x1,30x đến 1,77x3,31 đến 4,50
SGLang, 1x H100 80GB (khối 9)2,04x đến 2,66x1,64x đến 2,27x3,46 đến 4,57

Các con số "tới" về tốc độ giải mã và toàn trình thường đến từ các tác vụ khác nhau. Trên M5 Max, tốc độ giải mã 3,13x đến từ tác vụ chú thích COCO, trong khi tốc độ toàn trình 2,62x đến từ MMMU-Pro.

Tỷ lệ chấp nhận nằm trong phạm vi tương tự trên cả hai ngăn xếp Apple. Liquid AI cho rằng sự chấp nhận phụ thuộc vào mô hình dự thảo và khối lượng công việc, không phải thời gian chạy.

Ở mức đồng thời cao hơn, DSpark duy trì lợi thế về thông lượng ở mọi cấp độ được đo lường trên một H100 trong SGLang. Khoảng cách thu hẹp khi mức độ đồng thời tăng lên.

Chất lượng đầu ra và nhiệt độ

Với giải mã tham lam (greedy decoding), mô hình mục tiêu xác minh mọi token được đề xuất, vì vậy đầu ra giống hệt với mô hình cơ sở. Ở nhiệt độ khác 0 với lấy mẫu khớp, suy luận suy đoán bảo toàn phân phối đầu ra của mô hình mục tiêu, như đã được chứng minh bởi Leviathan và cộng sự.

Nhiệt độ ảnh hưởng đến tốc độ. Nhiệt độ cao hơn làm phân tán xác suất trên nhiều token ứng viên hơn, vì vậy mô hình dự thảo và mô hình mục tiêu thường xuyên không đồng nhất hơn. Trong các thử nghiệm của Liquid AI, điều này làm giảm tỷ lệ chấp nhận và thông lượng.

Tại sao mức tăng toàn trình lại nhỏ hơn trên thiết bị biên (edge)

Suy luận suy đoán chỉ tăng tốc quá trình giải mã. Việc mã hóa hình ảnh và tiền điền (prefill) chạy ở cùng tốc độ. Một VLM phải mã hóa hình ảnh, sau đó xử lý hàng trăm token hình ảnh cùng với prompt.

Trên các thiết bị biên có ít tài nguyên tính toán hơn GPU trung tâm dữ liệu, tiền điền chiếm tỷ trọng lớn hơn trong độ trễ. Liquid AI coi đây là định luật Amdahl: tốc độ tăng tổng thể bị giới hạn bởi phần không được tăng tốc. Điều này giải thích các trường hợp như TextVQA trên M5 Max, nơi giải mã nhanh hơn 2,69 lần mang lại mức tăng toàn trình 1,56 lần.

Cách chạy mô hình

SGLang yêu cầu v0.5.19 hoặc mới hơn. Khởi chạy LiquidAI/LFM2.5-VL-3B với --speculative-algorithm DSPARK và trỏ --speculative-draft-model-path đến mô hình dự thảo. Trên Apple silicon, MLX-VLM v0.7.2 hoặc mới hơn chấp nhận mô hình dự thảo thông qua --draft-model. DSpark trong MLX-VLM hiện chỉ hỗ trợ lấy mẫu tham lam, vì vậy hãy đặt nhiệt độ là 0. Đối với llama.cpp, hãy ghép nối mô hình dự thảo GGUF với mô hình mục tiêu LFM2.5-VL-3B-GGUF.

Công việc tích hợp được công khai trong các yêu cầu pull request của llama.cpp, SGLang và MLX-VLM. Việc tăng tốc các mô hình đã lượng tử hóa nằm ngoài phạm vi của bản phát hành này.

Những điểm chính cần lưu ý

  • Mô hình dự thảo 279,5 triệu tham số bổ sung 8,9% tham số cho LFM2.5-VL-3B.
  • Giải mã chạy nhanh hơn tới 3,13 lần trên M5 Max, 2,66 lần trên H100.
  • Đầu ra giống hệt nhau khi giải mã tham lam; phân phối được bảo toàn khi lấy mẫu.
  • Tiền điền và mã hóa hình ảnh giới hạn mức tăng toàn trình, đặc biệt là trên thiết bị biên.
  • Chỉ thử nghiệm ở định dạng 16-bit; tăng tốc lượng tử hóa chưa được đề cập.

Xem Chi tiết kỹ thuật. Mọi công lao thuộc về các nhà nghiên cứu của dự án này. Ngoài ra, hãy theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML và đăng ký Bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Cần hợp tác với chúng tôi để quảng bá GitHub Repo, Trang Hugging Face, Bản phát hành sản phẩm hoặc Hội thảo trực tuyến của bạn, v.v.? Kết nối với chúng tôi

Asif Razzaq

Asif Razzaq là CEO của Marktechpost AI Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy (machine learning) và học sâu (deep learning), vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo độc giả. Nền tảng này tự hào đạt hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với công chúng.

Liquid AILFM2.5-VL-3BTăng tốc AIThị giác máy tínhGiải mã dự đoán

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Liquid AI ra mắt LFM2.5-VL-3B-DSpark: Mô hình hỗ trợ tăng tốc giải mã lên tới 3,13 lần | AIHOT.vn