Mô hình
Ant Group ra mắt Ling-3.0-flash-VL: Mô hình đa phương thức mã nguồn mở với cơ chế tự sửa lỗi qua phản hồi thị giác
(giờ Việt Nam)
Tóm tắt AI
Ant Group vừa phát hành Ling-3.0-flash-VL, mô hình đa phương thức 124B tham số với kiến trúc MoE, nổi bật nhờ cơ chế 'quan sát - hành động - xác thực' giúp tự sửa lỗi trong các tác vụ phức tạp như lập trình GUI và phân tích y tế.
Bản dịch AI
Theo tin từ IT ngày 9 tháng 9, Ant Group hôm nay đã công bố ra mắt và mã nguồn mở Ling-3.0-flash-VL, mô hình đa phương thức gốc đầu tiên thuộc dòng Bailing.
Mô hình này được phát triển dựa trên kiến trúc MoE (Mixture of Experts) của Ling-3.0-flash, với tổng số tham số là 124B và 5,5B tham số được kích hoạt cho mỗi lần suy luận. Mô hình hỗ trợ gốc các đầu vào là hình ảnh, văn bản và video, với cửa sổ ngữ cảnh lên tới 256K Token.


Tập trung vào mục tiêu "hoàn thành các tác vụ thực tế một cách đáng tin cậy và hiệu quả hơn", mô hình đã giới thiệu cơ chế vòng lặp phản hồi thị giác. Khác với kiểu "nhìn ảnh tạo văn bản" một lần, cơ chế này thúc đẩy tác vụ thành một vòng lặp liên tục bao gồm "quan sát → hành động → xác minh → sửa lỗi", giúp mô hình có thể liên tục điều chỉnh kết quả thực thi dựa trên phản hồi thị giác trong các tình huống như đọc báo cáo y tế, tạo mã front-end và tự động hóa GUI.

Về khía cạnh đào tạo, Ant Group cho biết thông qua việc đào tạo kết hợp đa phương thức gốc, việc đưa thông tin thị giác vào đã mang lại sự cải thiện tích cực cho khả năng xử lý văn bản của mô hình. Trong đánh giá Artificial Analysis Intelligence Index v4.1.1, Ling-3.0-flash-VL đã tăng 4 điểm so với phiên bản thuần văn bản (Ling-3.0-Flash).

Trong các thử nghiệm ứng dụng thực tế, mô hình có khả năng hiểu bố cục và mối quan hệ giữa các thành phần trong tác vụ chuyển đổi hình ảnh sang trang web để tạo mã, đồng thời có thể tự sửa lỗi thông qua việc so sánh kết quả hiển thị. Trong bài đánh giá chính thức của Image-to-WebDev Arena, mô hình (tên mã linthium) đạt điểm số cao hơn GPT-5.4. Khi đóng vai trò là GUI Agent, mô hình có thể nhận diện cấu trúc giao diện và thực hiện các thao tác liên công cụ; trong kịch bản đọc báo cáo y tế, mô hình hỗ trợ tích hợp dữ liệu đa tài liệu và xác định rủi ro.
Ling-3.0-flash-VL tích hợp bộ mã hóa thị giác độ phân giải tùy ý và VideoRoPE, phần lõi ngôn ngữ vẫn sử dụng kiến trúc hỗn hợp 42 lớp (Ghi chú của IT: sắp xếp xen kẽ KDA và Gated MLA với tỷ lệ 5:1), giúp chỉ kích hoạt 5,5B tham số trong mỗi lần suy luận trên tổng số 124B tham số. Mô hình duy trì phản hồi độ trễ thấp trong các cuộc hội thoại video thời gian thực, tương tác thị giác đa vòng và các tác vụ dài, đồng thời cửa sổ ngữ cảnh 256K hỗ trợ phân tích tài liệu dài và video dài.
Hiện tại, Ling-3.0-flash-VL đã có mặt trên Ling Studio và cung cấp trải nghiệm miễn phí. Các phiên bản BF16 và FP8 của mô hình đã được mã nguồn mở trên các nền tảng Hugging Face và ModelScope, các phiên bản FP4 và INT4 dự kiến sẽ được phát hành trong thời gian tới.
Tài liệu tham khảo:
Hugging Face BF16https://huggingface.co/inclusionAI/Ling-3.0-flash-VL
Hugging Face FP8https://huggingface.co/inclusionAI/Ling-3.0-flash-VL-fp8
ModelScope BF16https://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-VL
ModelScope FP8https://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-VL-fp8
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.