MarkTechPost
85

Mô hình

Liquid AI ra mắt LFM2.5-VL-3B: Mô hình thị giác ngôn ngữ 3B tối ưu cho thiết bị di động

(giờ Việt Nam)

Tóm tắt AI

Liquid AI giới thiệu LFM2.5-VL-3B, mô hình 3.1 tỷ tham số có khả năng đọc màn hình, định vị đối tượng, phân tích biểu đồ và tự động gọi công cụ ngay trên thiết bị.

Bản dịch AI

Liquid AI Releases LFM2.5-VL-3B: A 3B Vision-Language Model That Reads Screens, Grounds Objects, and Calls Tools On-Device

Hôm qua, Liquid AI đã phát hành LFM2.5-VL-3B. Đây là mô hình ngôn ngữ thị giác (vision-language model) với 3,1 tỷ tham số được xây dựng để triển khai trực tiếp trên thiết bị (on-device). Mô hình có khả năng đọc màn hình kỹ thuật số trên thiết bị di động, web và máy tính để bàn. Nó xác định tọa độ các đối tượng, phân tích tài liệu và biểu đồ, đồng thời gọi các công cụ từ đầu vào là văn bản hoặc hình ảnh. Liquid AI báo cáo mức điểm trung bình là 69,4 trên 28 bài kiểm tra đánh giá thị giác (vision benchmarks). Kết quả này ngang bằng với InternVL-3.5-4B và chỉ kém 0,7 điểm so với Qwen3.5-4B, trong khi cả hai mô hình so sánh đều có 4,7 tỷ tham số. Mô hình này không có khả năng suy luận (non-reasoning), vì vậy nó phản hồi trực tiếp và duy trì độ trễ thấp. Nó chiếm khoảng 3 GB bộ nhớ và giải mã 228 token/giây trên chip Apple M5 Max.

Liệu mô hình có thể triển khai được không?

Có, checkpoint được cung cấp dưới bốn định dạng: native, GGUF, ONNX và MLX. Các runtime hỗ trợ ngay từ ngày đầu bao gồm llama.cpp, MLX, vLLM, SGLang và ONNX. Mô hình chiếm khoảng 3 GB bộ nhớ.

Vậy, có gì mới?

LFM2.5-VL-3B mở rộng từ LFM2-VL-3B trên bốn khía cạnh.

Kiến trúc và đào tạo

Phần cốt lõi ngôn ngữ là LFM2.5-2.6B. Tháp thị giác (vision tower) là bộ mã hóa SigLIP2 NaFlex 400M được tối ưu hóa hình dạng. NaFlex xử lý độ phân giải gốc bằng cách chia các hình ảnh lớn thành các phân đoạn (patch) 512×512 không chồng lấp, cộng với một hình thu nhỏ của toàn bộ ảnh đã được thay đổi kích thước. Độ dài ngữ cảnh là 32.768 token và hỗ trợ 16 ngôn ngữ.

Quá trình tiền huấn luyện sử dụng khoảng 34 nghìn tỷ token. Từ vựng đã được tăng gấp đôi lên 128K bằng cách mở rộng bộ mã hóa (tokenizer) hiện có tại chỗ, giúp cải thiện khả năng bao phủ các hệ thống chữ viết không phải Latinh. Quá trình tiền huấn luyện thị giác đã được mở rộng gấp 4 lần về số lượng token với dữ liệu được tuyển chọn và tổng hợp bao gồm chú thích, OCR, xác định tọa độ (grounding) và tuân thủ chỉ dẫn.

Quá trình hậu huấn luyện (post-training) là SFT (tinh chỉnh có giám sát) với kỹ thuật chưng cất tri thức (knowledge distillation) từ một mô hình giáo viên lớn hơn và đào tạo Antidoom, theo sau là học tăng cường từ nhiều phần thưởng (multi-reward reinforcement learning).

Mô hình này không có khả năng suy luận. Nó phản hồi trực tiếp, đây là lựa chọn thiết kế đằng sau cấu hình độ trễ của nó.

Các bài kiểm tra đánh giá (Benchmarks)

Liquid AI đã đánh giá trên 28 bài kiểm tra thị giác sử dụng vLLM 0.26.0 ở chế độ không suy luận. LFM2.5-VL-3B đạt trung bình 69,4 điểm, ngang bằng với InternVL-3.5-4B (69,4) và kém 0,7 điểm so với Qwen3.5-4B (70,1). Cả hai mô hình so sánh đều có 4,7 tỷ tham số.

Các kết quả cá biệt đáng chú ý: RealWorldQA đạt 73,1 so với 67,7 của InternVL-3.5-4B, TextVQA đạt 84,3 so với 81,2 của Qwen3.5-4B, MMStar đạt 63,3, MathVista-mini đạt 68,5, ChartQA đạt 81,3, DocVQA đạt 91,1 và OCRBench v1 đạt 84,2. CountBenchQA giảm xuống 87,3 từ mức 92,2 ở phiên bản trước.

Về đánh giá chỉ có văn bản, IFEval đạt 82,3, tăng từ 72,9. Gemma-4-E4B vẫn dẫn đầu ở mức 87,9.

Những điểm chính cần lưu ý

Hãy xem Chi tiết kỹ thuật và Trọng số mô hình. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia cộng đồng ML SubReddit với hơn 150 nghìn thành viên của chúng tôi và đăng ký nhận bản tin (Newsletter). Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, bản phát hành sản phẩm hoặc hội thảo trực tuyến (Webinar), v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt nền tảng truyền thông về Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về các tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo độc giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với công chúng.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.