Mô hình
Ant Group ra mắt mã nguồn mở Ling-3.0-flash: Mô hình MoE hiệu năng cao với 124 tỷ tham số
(giờ Việt Nam)
Tóm tắt AI
Ant Group chính thức công bố mã nguồn mở Ling-3.0-flash, mô hình suy luận hỗn hợp (MoE) với 124 tỷ tham số tổng và 5,1 tỷ tham số kích hoạt, hỗ trợ đa dạng định dạng nén từ FP8 đến INT4.
Bản dịch AI
Theo tin từ IT ngày 8 tháng 8, đội ngũ phát triển mô hình Bailing thuộc Ant Group thông báo chính thức mở mã nguồn (open source) cho thế hệ mô hình suy luận hỗn hợp thuần túy mới nhất: Ling-3.0-flash.
Ling-3.0-flash sử dụng kiến trúc MoE với tổng tham số 124B và 5.1B tham số kích hoạt. Đội ngũ phát triển cung cấp đồng thời phiên bản cơ sở cùng các phiên bản FP8, FP4, INT4, mang đến ba lựa chọn triển khai khác nhau:
Gọi API: Dành cho các nhà phát triển muốn tích hợp nhanh chóng mà không cần tự xây dựng dịch vụ suy luận, Ling-3.0-flash có thể được gọi trực tiếp thông qua API đám mây.
Triển khai riêng tư trên máy đơn lẻ: Dành cho các doanh nghiệp và đội ngũ có yêu cầu bảo mật dữ liệu không được rời khỏi hệ thống nội bộ, các phiên bản MXFP4 và INT4 có thể thực hiện suy luận đầu cuối (end-to-end) trên một máy NVIDIA DGX Spark duy nhất.
Triển khai hiệu năng cao: Dành cho các dịch vụ hiệu năng cao nhạy cảm với độ trễ trên mỗi yêu cầu, trong cấu hình thử nghiệm GPU cụ thể, tốc độ đầu ra trung bình đạt hơn 1100 tokens/s.
Đối với các nhà phát triển và đội ngũ sản phẩm muốn xác thực sản phẩm nhanh chóng và đưa các ứng dụng Agent lên môi trường thực tế, API là phương thức tiếp cận có ngưỡng gia nhập thấp nhất. Trên bảng xếp hạng Artificial Analysis, tốc độ đầu ra của Ling-3.0-flash đạt 353 tokens/s.

Trong bảng xếp hạng AA Intelligence Index, chi phí gọi trung bình có trọng số cho mỗi tác vụ của Ling-3.0-flash là khoảng 0,04 USD (tương đương khoảng 0,27 Nhân dân tệ theo tỷ giá hiện tại), thời gian giải mã trung bình có trọng số là khoảng 1,4 phút, đồng thời lọt vào vùng ưu thế của cả hai tiêu chí "Mức độ thông minh — Chi phí tác vụ" và "Mức độ thông minh — Thời gian tác vụ".


Phía chính thức cho biết, từ 00:00 ngày 7 tháng 8 năm 2026 đến 24:00 ngày 31 tháng 8, Ling-3.0-flash được hưởng ưu đãi giảm giá 75% (còn 25% giá gốc) trên Ling Studio; từ 00:00 ngày 1 tháng 9 sẽ khôi phục về giá gốc.

IT đính kèm đường dẫn mã nguồn:
Hugging Facehttps://huggingface.co/inclusionAI/Ling-3.0-flash
ModelScopehttps://modelscope.cn/models/inclusionAI/Ling-3.0-flash
Bài đọc liên quan:
Ant Group ra mắt mô hình suy luận hỗn hợp thuần túy Bailing Ling-3.0-flash: Tổng tham số 124B, năng lực tương đương thế hệ flagship tiền nhiệm Ring-2.6-1T
Tuyên bố quảng cáo: Các liên kết chuyển hướng bên ngoài có trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian lựa chọn, kết quả chỉ mang tính chất tham khảo. Các bài viết của IT có chứa liên kết ngoài đều bao gồm tuyên bố này.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.