# inclusionAI ra mắt mô hình thị giác ngôn ngữ Ling-3.0-flash-VL-int4

- Nguồn: Ant Group inclusionAI: HuggingFace mô hình mới
- Thời gian phát hành: 2026-09-08 17:22 (giờ Việt Nam)
- Điểm AI: 23/100
- Link AIHOT.vn: https://aihot.vn/items/cecd626746c99770
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmtu70igi11t5rofpfxfijkio
- Link gốc: https://huggingface.co/inclusionAI/Ling-3.0-flash-VL-int4

## Tóm tắt AI

inclusionAI vừa phát hành phiên bản lượng tử hóa int4 của mô hình thị giác ngôn ngữ Ling-3.0-flash-VL trên HuggingFace. Người dùng cần đăng nhập và xác thực tài khoản để truy cập thông tin chi tiết do các hạn chế truy cập hiện tại.

## Thân bài

![inclusionAI/Ling-3.0-flash-VL-int4 · Hugging Face](https://cdn-thumbnails.huggingface.co/social-thumbnails/models/inclusionAI/Ling-3.0-flash-VL-int4.png)

![](https://mdn.alipayobjects.com/huamei_qa8qxu/afts/img/A*4QxcQrBlTiAAAAAAQXAAAAgAemJ7AQ/original)

🤗 Hugging Face | 🤖 ModelScope

### Giới thiệu

Chúng tôi xin giới thiệu Ling-3.0-flash-VL, mô hình đa phương thức (multimodal) thế hệ mới của chúng tôi. Được xây dựng dựa trên Ling-3.0-flash, mô hình này đưa thông tin hình ảnh vào toàn bộ quy trình hiểu, suy luận, hành động và xác minh—vượt xa khả năng nhận diện hình ảnh và video thông thường để giải quyết các tác vụ thực tế thông qua thị giác. Với tổng cộng 124B tham số, chỉ 5,5B tham số được kích hoạt trên mỗi token, hỗ trợ đầu vào là hình ảnh và video, cùng cửa sổ ngữ cảnh lên tới 1M token, Ling-3.0-flash-VL mang lại khả năng suy luận đa phương thức và năng lực tác tử (agentic) mạnh mẽ với hiệu suất vượt trội.

### Tổng quan về mô hình

Ling-3.0-flash-VL kế thừa các khả năng về ngôn ngữ, suy luận và ngữ cảnh dài của Ling-3.0-flash, đồng thời mở rộng chúng với khả năng hiểu hình ảnh và video gốc (native). Mô hình có tổng cộng 124B tham số, với chỉ 5,5B tham số được kích hoạt trên mỗi token và hỗ trợ cửa sổ ngữ cảnh lên tới 1M token.

Kiến trúc của Ling-3.0-flash-VL được thiết kế để tích hợp thông tin thị giác vào các quy trình suy luận và tác tử trong thế giới thực.

Nhìn chung, những thiết kế này biến thị giác trở thành một phần không thể thiếu thay vì chỉ là một đầu vào đơn thuần, tích hợp nó vào toàn bộ quá trình hiểu, suy luận, lập kế hoạch, hành động và xác minh.

![ling-3.0-flash-vl-0906](https://cdn-uploads.huggingface.co/production/uploads/6666ca359f5a0b3229238a1a/WhsE3cM7QMelBCjdeyex2.png)

### Đánh giá

Ling-3.0-flash-VL đạt số điểm 42 trên Artificial Analysis Intelligence Index v4.1.1, cải thiện 4 điểm so với số điểm 38 của Ling-3.0-flash. Kết quả cho thấy việc mở rộng mô hình với các khả năng thị giác giúp cải thiện hơn nữa hiệu suất trí tuệ tổng thể của nó.

![ling-3.0-flash-vl-aa](https://cdn-uploads.huggingface.co/production/uploads/6666ca359f5a0b3229238a1a/5gqrYjboQ8j7sTWjd1A_q.png)

Trên các tiêu chuẩn đánh giá đa phương thức (multimodal benchmarks), Ling-3.0-flash-VL thể hiện ba khía cạnh năng lực riêng biệt:

![ling-3.0-flash-vl-benchmark](https://cdn-uploads.huggingface.co/production/uploads/6666ca359f5a0b3229238a1a/w-V0gtCa3qy0un6vuz-sj.png)

### SGLang

Ma trận khởi chạy dành riêng cho phần cứng và công thức cụ thể (BF16/FP8 × Độ trễ thấp / Thông lượng cao), cùng với trình tạo lệnh trực tiếp và các cấu hình đã được xác minh, có sẵn trong SGLang cookbook:

Cookbook: https://docs.sglang.io/cookbook/autoregressive/InclusionAI/Ling-3.0-flash-VL

### Chạy suy luận (Inference)

Công thức khuyến nghị với ngữ cảnh 256K (YaRN), trên 2 GPU loại 141GB (H20-3e / H200) hoặc các node Blackwell 2-GPU (B300 / GB300):

Trên các card 80GB (H100 / H800), hãy mở rộng quy mô lên --tp 2. Các trình phân tích cú pháp suy luận và gọi công cụ (tool-call) sẽ tự động phân giải thành ling3 từ chat template; bạn cũng có thể thiết lập chúng một cách rõ ràng với --reasoning-parser ling3 --tool-call-parser ling3.

Client

Tính năng "Thinking" (Suy nghĩ) được bật theo mặc định bởi chat template; bạn có thể tắt nó cho từng yêu cầu với "chat_template_kwargs": {"enable_thinking": false}. Lấy mẫu khuyến nghị: temperature=1.0, top_p=0.95, top_k=20 (theo generation_config.json).

Đầu vào video sử dụng {"type": "video_url", "video_url": {"url": "..."}} trong cùng định dạng tin nhắn. Để biết các lệnh tái tạo MMMU-Pro / bench_serving và các công thức cho từng loại phần cứng, hãy xem trang cookbook được liên kết ở trên.

### Chạy suy luận (Inference)

Server

Client

Tính năng "Thinking" (Suy nghĩ) được bật theo mặc định bởi chat template; bạn có thể tắt nó cho từng yêu cầu với "chat_template_kwargs": {"enable_thinking": false}. Lấy mẫu khuyến nghị: temperature=1.0, top_p=0.95, top_k=20 (theo generation_config.json).

Đầu vào video sử dụng {"type": "video_url", "video_url": {"url": "..."}} trong cùng định dạng tin nhắn. Để biết các lệnh tái tạo MMMU-Pro / bench_serving và các công thức cho từng loại phần cứng, hãy xem trang cookbook được liên kết ở trên.

_Bài gốc còn tiếp._ Xem tiếp tại: <https://huggingface.co/inclusionAI/Ling-3.0-flash-VL-int4>
