# Liquid AI ra mắt LFM2.5-VL-DSpark: Tăng tốc suy luận cho mô hình đa phương thức

- Nguồn: Hugging Face: Blog
- Thời gian phát hành: 2026-09-24 21:08 (giờ Việt Nam)
- Điểm AI: 57/100
- Link AIHOT.vn: https://aihot.vn/items/bb9fc8a7ee838412
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmufm3m5m04rsro8wjiqanu58
- Link gốc: https://huggingface.co/blog/LiquidAI/lfm2-5-vl-dspark

## Tóm tắt AI

Liquid AI giới thiệu mô hình nháp DSpark cho LFM2.5-VL-3B trên Hugging Face, ứng dụng kỹ thuật giải mã suy đoán để tăng tốc độ phản hồi mà vẫn giữ nguyên chất lượng đầu ra.

## Thân bài

![Accelerating vision-language models with LFM2.5-VL-DSpark](https://cdn-uploads.huggingface.co/production/uploads/644249b08443bce4c9890a0f/WgfT8N8Xyb6lBxSif7XLO.gif)

Hôm nay, chúng tôi phát hành mô hình dự thảo [DSpark](https://huggingface.co/papers/2607.05147) thử nghiệm cho mô hình ngôn ngữ-thị giác (VLM) [LFM2.5-VL-3B](https://huggingface.co/LiquidAI/LFM2.5-VL-3B) của mình. Tương tự như các [mô hình dự thảo LFM2.5-DSpark vừa ra mắt gần đây](https://huggingface.co/blog/LiquidAI/lfm25-dspark), nó bổ sung một đường dẫn giải mã suy đoán (speculative decoding), giúp tăng tốc độ đáng kể với mức tiêu thụ bộ nhớ tăng thêm tối thiểu mà không làm thay đổi chất lượng đầu ra.

- Suy luận nhanh hơn: tốc độ giải mã tăng tới 3,13 lần trên thiết bị và 2,66 lần trên H100, với mức cải thiện toàn trình (end-to-end) đạt tới 2,62 lần và 2,27 lần.
- Chi phí bộ nhớ nhỏ: mô hình dự thảo bổ sung 280 triệu tham số, tương đương 8,9% so với mô hình mục tiêu 3B.
- Hỗ trợ ngay từ ngày đầu: tích hợp DSpark tương thích với LFM cho llama.cpp, MLX-VLM và SGLang.

### Giải mã suy đoán hoạt động như thế nào đối với VLM

Mô hình dự thảo thị giác sử dụng cùng kiến trúc với các mô hình dự thảo văn bản LFM2.5-DSpark của chúng tôi: nó nắm bắt các trạng thái ẩn của mô hình mục tiêu tại một tập hợp các lớp cố định và dựa vào đó để dự thảo một khối gồm k token ứng viên. Các mảng hình ảnh (image patches) và token văn bản được chiếu vào một không gian biểu diễn chung trước các lớp đó, vì vậy mô hình dự thảo hoạt động trên các vectơ trạng thái ẩn có cùng số chiều bất kể phương thức đầu vào. Do đó, thuật toán suy luận không thay đổi so với các mô hình văn bản.

![DSpark-Vision](https://cdn-uploads.huggingface.co/production/uploads/644249b08443bce4c9890a0f/P7UX63U74cbjMWDapPjFm.png)

### Đào tạo và Kiến trúc

Chúng tôi tuân theo công thức DSpark với hỗn hợp dữ liệu SFT ngôn ngữ-thị giác, được phân bổ trọng số cho các khối lượng công việc mà chúng tôi dự kiến mô hình sẽ phục vụ. Dựa trên các thử nghiệm cắt bỏ (ablations) qua 3, 4 và 5 lớp, mô hình dự thảo là một mô hình chỉ dùng attention đơn giản với 4 lớp và kích thước khối là 9. Chúng tôi đã chạy 10 epoch trên hỗn hợp cuối cùng và đo lường tỷ lệ chấp nhận sau mỗi epoch, kết quả cải thiện khi thêm token đào tạo trước khi đạt đến ngưỡng lợi nhuận giảm dần. Tại thời điểm suy luận, chúng tôi khuyến nghị kích thước khối là 8 hoặc 9 tùy thuộc vào phần cứng.

Mô hình dự thảo thu được có khoảng 280 triệu tham số và chỉ làm tăng 8,9% số lượng tham số của mô hình được triển khai.

| Thành phần | LFM2.5-VL-3B |
| --- | --- |
| Ngăn xếp giải mã (4 lớp) | 193,0 triệu |
| Chiếu trạng thái ẩn | 21,0 triệu |
| Đầu Markov | 65,5 triệu |
| Chuẩn hóa + đầu tin cậy | 6,4 nghìn |
| Tổng cộng | 279,5 triệu |

### Tăng tốc suy luận trên CPU và GPU

Mô hình dự thảo DSpark cho LFM2.5-VL-3B đi kèm với hỗ trợ ngay từ ngày đầu cho [llama.cpp](https://github.com/ggml-org/llama.cpp), [MLX-VLM](https://github.com/Blaizzy/mlx-vlm) và [SGLang](https://github.com/sgl-project/sglang).

Chúng tôi đo lường cả suy luận trên thiết bị và suy luận trên GPU. Cả hai cấu hình đều sử dụng kích thước khối DSpark là 8 và được đánh giá trên sáu tác vụ thị giác đa dạng, bao gồm VQA tổng quát, VQA văn bản, chú thích hình ảnh, VQA biểu đồ, suy luận phức tạp và hội thoại đa lượt, theo [điểm chuẩn MMSpec](https://huggingface.co/papers/2603.14989).

Suy luận trên thiết bị. Với MLX trên M5 Max, tốc độ giải mã nhanh hơn từ 2,30 đến 3,13 lần tùy theo tác vụ. Độ trễ toàn trình cải thiện từ 1,56 đến 2,62 lần. Với llama.cpp trên M3 Ultra, tốc độ giải mã cải thiện từ 1,57 đến 2,14 lần và toàn trình từ 1,30 đến 1,77 lần.

![Screenshot 2026-09-24 at 15.49.03](https://cdn-uploads.huggingface.co/production/uploads/644249b08443bce4c9890a0f/n638hOT2C6Yoflniz2ffs.png)

Suy luận trên GPU. Trên H100, cùng mô hình dự thảo này mang lại tốc độ giải mã nhanh hơn từ 2,04 đến 2,66 lần, với mức cải thiện toàn trình từ 1,64 đến 2,27 lần.

![Screenshot 2026-09-24 at 15.49.27](https://cdn-uploads.huggingface.co/production/uploads/644249b08443bce4c9890a0f/QUPP6CX21dma5OiIYcEIL.png)

### Hạn chế của suy đoán đối với khối lượng công việc thị giác

Trong các LLM, giai đoạn tiền điền (prefill) chủ yếu bị giới hạn bởi tính toán và chi phí của nó tăng (gần như) theo bình phương độ dài prompt. VLM làm tăng thêm gánh nặng này vì hình ảnh trước tiên phải đi qua bộ mã hóa thị giác, sau đó phần lõi ngôn ngữ xử lý hàng trăm token thị giác cùng với prompt văn bản. Các thiết bị biên có ít năng lực tính toán hơn nhiều so với GPU trung tâm dữ liệu, vì vậy giai đoạn tiền điền chiếm nhiều độ trễ toàn trình hơn, như các phép đo thời gian đến token đầu tiên và giải mã trên Apple silicon và H100 cho thấy. (Các bộ tăng tốc thần kinh GPU trên mỗi nhân của M5 giúp thu hẹp khoảng cách này).

Giải mã suy đoán chỉ tăng tốc giai đoạn giải mã, không phải mã hóa thị giác hay tiền điền. Khi các giai đoạn đó đã chiếm phần lớn thời gian thực, ngay cả khi tốc độ giải mã tăng lớn cũng chỉ mang lại mức cải thiện toàn trình khiêm tốn. Đây là định luật Amdahl, trong đó tốc độ tổng thể bị giới hạn bởi phần khối lượng công việc không được tăng tốc.

### Cách sử dụng LFM2.5-VL-DSpark

Chạy các mô hình dự thảo DSpark với SGLang yêu cầu bản dựng SGLang có hỗ trợ DSpark cho các mục tiêu LFM2 ([PR #40651](https://github.com/sgl-project/sglang/pull/40651)). Khởi chạy mục tiêu với mô hình dự thảo được đính kèm:

```
python -m sglang.launch_server \
  --model-path LiquidAI/LFM2.5-VL-3B \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark \
  --speculative-draft-attention-backend flashinfer \
  --speculative-dspark-block-size 9 \
  --disable-radix-cache
```

Sau đó truy vấn endpoint tương thích với OpenAI tại http://localhost:30000/v1. Kích thước khối được đọc từ tệp config.json của mô hình dự thảo; đường cơ sở (baseline) là cùng một lệnh nhưng không có ba cờ --speculative-*.

Chạy chúng với llama.cpp yêu cầu bản dựng llama.cpp tương ứng ([PR#29339](https://github.com/ggml-org/llama.cpp/pull/29339)).

```
llama-server -m models/LFM2.5-VL-3B-F16.gguf \
  --mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \
  -md LFM2.5-2.6B-DSpark-F16.gguf \
  --spec-type draft-dspark --spec-draft-n-max 8 --spec-draft-n-min 0 \
  -fa on -ngl 99 -c 8192
```

Chạy chúng với MLX-VLM yêu cầu bản dựng tương ứng ([PR#2280](https://github.com/Blaizzy/mlx-vlm/pull/2280)).

```
mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark
```

Kích thước khối được đọc từ siêu dữ liệu sidecar (n-max được giới hạn theo đó). Giải mã suy đoán là chính xác: mục tiêu xác minh mọi token được đề xuất, vì vậy đầu ra tham lam (greedy) bằng với việc chỉ chạy mô hình mục tiêu; thời gian mỗi phản hồi báo cáo draft_n / draft_n_accepted.

### Bắt đầu

Mô hình dự thảo DSpark thị giác của chúng tôi có sẵn trên Hugging Face ở [định dạng Safetensors](https://huggingface.co/LiquidAI/LFM2.5-VL-3B-DSpark) và [định dạng GGUF](https://huggingface.co/LiquidAI/LFM2.5-VL-3B-DSpark-GGUF).

Với LFM2.5, chúng tôi đang hiện thực hóa tầm nhìn về AI có thể chạy ở bất cứ đâu. Các mô hình này là:

- Mở trọng số — Tải xuống, tinh chỉnh và triển khai mà không có hạn chế.
- Nhanh ngay từ ngày đầu — Hỗ trợ ngay từ ngày đầu cho llama.cpp, MLX và SGLang.
- Một gia đình hoàn chỉnh — Từ các mô hình cơ sở để tùy chỉnh đến các biến thể chuyên biệt về âm thanh và thị giác, một kiến trúc bao quát các trường hợp sử dụng đa dạng.

Chúng tôi rất nóng lòng chờ xem bạn sẽ xây dựng những gì.

### Trích dẫn

Để trích dẫn, vui lòng sử dụng tài liệu tham khảo hoặc BibTeX sau: Liquid AI, "LFM2.5-VL-DSpark: Tăng tốc các mô hình ngôn ngữ-thị giác trên thiết bị biên và hơn thế nữa", Blog Liquid AI, tháng 9 năm 2026.

```
@article{liquidAI2026vldspark,
  author = {Liquid AI},
  title = {LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond},
  journal = {Liquid AI Blog},
  year = {2026},
  note = {www.liquid.ai/blog/lfm2-5-vl-dspark},
}
```
