Tin ngành
LFM2.5-VL-3B: Bước tiến mới cho khả năng thị giác máy tính nhanh và hiệu quả trên thiết bị biên
(giờ Việt Nam)
Tóm tắt AI
Liquid AI ra mắt mô hình LFM2.5-VL-3B, tối ưu hóa khả năng xử lý thị giác cho các thiết bị biên với tốc độ vượt trội và hiệu suất cao, mở ra tiềm năng ứng dụng thực tế rộng rãi.
Bản dịch AI

Quay lại các bài viết
LFM2.5-VL-3B là mô hình ngôn ngữ thị giác mạnh mẽ nhất của chúng tôi mà bạn có thể chạy trên phần cứng của riêng mình. Nó có khả năng hiểu cả tài liệu lẫn màn hình, định vị đối tượng và có thể gọi các công cụ. Mô hình trả lời trực tiếp thay vì suy luận, giúp phản hồi luôn nhanh chóng trong các ứng dụng thời gian thực và trên thiết bị.
LFM2.5-VL-3B mở rộng các khả năng ngôn ngữ thị giác từ các phiên bản trước của chúng tôi với bốn cải tiến lớn:

Cách chúng tôi huấn luyện mô hình ngôn ngữ thị giác mạnh mẽ nhất của mình
LFM2.5-VL-3B kết hợp bộ mã hóa thị giác SigLIP2 400M NaFlex với cùng một cấu trúc nền tảng (backbone) đã được huấn luyện trước như mô hình văn bản LFM2.5-2.6B của chúng tôi. Mô hình được huấn luyện trước trên khoảng 34 nghìn tỷ token, với lượng dữ liệu thị giác nhiều gấp 4 lần so với trước đây, được lấy từ các tập dữ liệu chú thích ảnh, OCR, định vị và tuân thủ chỉ dẫn đã qua chọn lọc và tổng hợp. Để hỗ trợ các hệ thống chữ viết không phải Latinh, chúng tôi đã tăng gấp đôi từ vựng lên 128K bằng cách mở rộng tokenizer tại chỗ thay vì huấn luyện lại từ đầu.
Quá trình hậu huấn luyện diễn ra trong hai giai đoạn: Đầu tiên là tinh chỉnh có giám sát (SFT), với việc chưng cất kiến thức từ một mô hình giáo viên lớn hơn và huấn luyện Antidoom. Thứ hai là học tăng cường đa phần thưởng (multi-reward reinforcement learning - RL).
Kết quả đánh giá (Benchmark)
Chúng tôi đã đánh giá LFM2.5-VL-3B trên cả các tiêu chuẩn đánh giá thị giác và văn bản.
Các tiêu chuẩn đánh giá thị giác bao gồm khả năng hiểu hình ảnh đa ngôn ngữ, tuân thủ chỉ dẫn, suy luận toán học và khoa học bằng hình ảnh, hiểu tài liệu, phát hiện đối tượng, hiểu đa hình ảnh và hiểu màn hình. LFM2.5-VL-3B dẫn đầu trong phân khúc kích thước của nó về các tác vụ hình ảnh trong thế giới thực, đồng thời đọc tốt nội dung kỹ thuật số, từ tài liệu và biểu đồ đến các thành phần giao diện người dùng (UI) trên màn hình.
*Tất cả các giá trị trong bảng được chuẩn hóa về thang 0–100. Việc đánh giá được thực hiện bằng vLLM 0.26.0 và các tham số tạo văn bản được khuyến nghị của từng mô hình (nếu có). Chế độ không suy luận được sử dụng ở mọi nơi và các mô hình được yêu cầu trả lời trực tiếp mà không cần suy luận.
Chúng tôi cũng đã đánh giá LFM2.5-VL-3B trên các tiêu chuẩn đánh giá chỉ dành cho văn bản về khả năng tuân thủ chỉ dẫn và sử dụng công cụ. Khả năng tuân thủ chỉ dẫn tăng lên trên diện rộng và khả năng sử dụng công cụ cải thiện rõ rệt. Về khả năng sử dụng công cụ, LFM2.5-VL-3B ngang hàng với Gemma-4-E2B và Qwen3.5-2B.
*Các mô hình InternVL 3.5 không hỗ trợ gọi hàm (function-calling).
Những kết quả này chứng minh rằng LFM2.5-VL-3B là một mô hình ngôn ngữ thị giác đa năng, mạnh mẽ. Nó bao quát các tác vụ hàng ngày (tạo chú thích, trả lời câu hỏi bằng hình ảnh, hiểu tài liệu) và đặc biệt giỏi trong việc định vị đối tượng, đọc màn hình và tài liệu, cũng như gọi các công cụ.
Tốc độ suy luận trên CPU và GPU
LFM2.5-VL-3B được hỗ trợ ngay từ ngày đầu ra mắt trên toàn bộ hệ sinh thái suy luận, bao gồm llama.cpp, MLX, vLLM, SGLang và ONNX.
Suy luận trên thiết bị. LFM2.5-VL-3B giải mã 228 token/giây trên chip M5 Max và 116 token/giây trên Ryzen AI Max+ 395, với dung lượng bộ nhớ khoảng 3 GB. Nó thậm chí đạt tốc độ 20 token/giây trên Galaxy S26 Ultra, vì vậy bạn có thể chạy hoàn toàn trên thiết bị.

Suy luận trên GPU. LFM2.5-VL-3B duy trì độ trễ thấp ổn định và là mô hình nhanh nhất đối với các đầu vào đa khung hình (multi-frame).

LFM2.5-VL-3B cũng là mô hình nhanh nhất về thông lượng đầu ra trong số tất cả các mô hình chúng tôi đã thử nghiệm, đạt khoảng 11 nghìn token mỗi giây ở mức độ đồng thời cao. Con số này gấp khoảng 2 lần các mô hình lớp 4B lớn hơn và vượt xa cả các mô hình lớp 2B nhỏ hơn, tương đương với gần 1 tỷ token đầu ra mỗi ngày trên một card H100 duy nhất.

Cách sử dụng LFM2.5-VL-3B
Hãy chọn LFM2.5-VL-3B khi bạn cần trí tuệ nhân tạo trên thiết bị cho các khối lượng công việc lớn.
Cài đặt phiên bản mới nhất của transformers (tương thích với transformers>=5.0.0):
Sau đó tải và chạy mô hình:

Bạn có thể tìm thêm các ví dụ thực tế về cách sử dụng LFM2.5-VL3B cho đầu vào đa hình ảnh, định vị, OCR, gọi công cụ và nhiều tính năng khác trong tài liệu của chúng tôi. Hãy xem blog phát hành của chúng tôi để biết các ví dụ bằng video.
Bản demo LFM2.5-VL-3B
Hãy xem bản demo trên trình duyệt này của LFM2.5-VL-3B, hỗ trợ giao diện trò chuyện có khả năng thị giác. Nó cho phép bạn chụp hoặc tải lên nhiều hình ảnh và để mô hình tương tác với chúng, bao gồm định vị, OCR và sử dụng công cụ.
Bắt đầu
LFM2.5-VL-3B hiện đã có sẵn trên Hugging Face.
Với LFM2.5, chúng tôi đang hiện thực hóa tầm nhìn về AI có thể chạy ở bất cứ đâu. Các mô hình này là:
Chúng tôi rất nóng lòng muốn thấy những gì bạn sẽ xây dựng.
Trích dẫn
Vui lòng trích dẫn bài viết này như sau:
Hoặc sử dụng trích dẫn BibTeX:
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.