Tin ngành
Ant Group ra mắt mô hình Ling-3.0-flash-fp8 trên Hugging Face
(giờ Việt Nam)
Tóm tắt AI
Ant Group vừa phát hành phiên bản tối ưu hóa Ling-3.0-flash-fp8 trên nền tảng Hugging Face, hứa hẹn cải thiện hiệu suất suy luận cho các ứng dụng AI.
Bản dịch AI
🤗 Hugging Face | 🤖 ModelScope | 🐙 OpenRouter
Giới thiệu
Chúng tôi xin giới thiệu Ling-3.0-flash, mô hình suy luận lai (hybrid reasoning) thế hệ mới. Với tổng cộng 124B tham số và 5.1B tham số hoạt động (tương đương khoảng 12.4% và 8.1% so với mô hình flagship Ring-2.6-1T 1T-class trước đây của chúng tôi), Ling-3.0-flash đạt hiệu suất tương đương hoặc vượt trội hơn so với phiên bản tiền nhiệm trên các tiêu chuẩn đánh giá chính.
Các điểm nổi bật của mô hình được tóm tắt dưới đây:

Tổng quan về mô hình
Thông tin tóm tắt và sơ đồ kiến trúc của mô hình như sau:

Đánh giá
Chúng tôi đã thực hiện đánh giá toàn diện Ling-3.0-flash trên nhiều bộ tiêu chuẩn uy tín. Ling-3.0-flash thể hiện sức mạnh vượt trội trên các tiêu chuẩn đại diện cho code/agent như SWE-Bench Pro, SWE-Bench Multilingual, Tau3-banking-AA, MCP-Atlas và SkillsBench, v.v. Trong thực tế, Ling-3.0-flash mang lại trải nghiệm người dùng mạnh mẽ trên các framework bao gồm Claude Code, Kilo Code, Qwen Code, Hermes Agent và OpenClaw, v.v. Ngoài các tác vụ agent, Ling-3.0-flash còn mang lại hiệu suất ấn tượng trong các lĩnh vực kiến thức tổng quát, suy luận toán học, tuân thủ chỉ dẫn và hiểu ngữ cảnh dài.

Các mô hình đã lượng tử hóa (Quantized Models) Chúng tôi đánh giá các mô hình đã lượng tử hóa bằng cách sử dụng một số bộ dữ liệu. Mô hình lượng tử hóa FP8 được áp dụng thông qua lượng tử hóa theo khối (blockwise quantization), còn các mô hình INT4 và FP4 được áp dụng thông qua lượng tử hóa theo nhóm (groupwise quantization) với trọng số chuyên gia được định tuyến (routed experts weights).
Các mô hình đã lượng tử hóa
Chúng tôi đánh giá các mô hình đã lượng tử hóa bằng cách sử dụng một số bộ dữ liệu. Mô hình lượng tử hóa FP8 được áp dụng thông qua lượng tử hóa theo khối, còn các mô hình INT4 và FP4 được áp dụng thông qua lượng tử hóa theo nhóm với trọng số chuyên gia được định tuyến.
Hướng dẫn nhanh
SGlang
Cài đặt SGLang của chúng tôi
Chạy suy luận
Dưới đây là ví dụ để chạy Ling-3.0-flash với 4 GPU, trong đó IP của nút chính là ${MASTER_IP} và cổng máy chủ là ${PORT}:
Máy chủ (Server)
Vì mô hình được huấn luyện với MTP, chúng tôi khuyến nghị kích hoạt MTP trong quá trình suy luận (ví dụ: --speculative-algorithm NEXTN) để giảm độ trễ.
Máy khách (Client)
Chúng tôi khuyến nghị sử dụng các tham số lấy mẫu temperature=0.6, top_p=0.95 và top_k=20, đồng thời kích hoạt enable_thinking để đạt hiệu suất tốt hơn.
vLLM
Cài đặt vLLM của chúng tôi
Chạy suy luận
Dưới đây là ví dụ để chạy Ling-3.0-flash với 4 GPU, trong đó cổng máy chủ là ${PORT}:
Máy chủ (Server)
Vì mô hình được huấn luyện với MTP, chúng tôi khuyến nghị kích hoạt MTP trong quá trình suy luận (ví dụ: --speculative-config) để giảm độ trễ.
Máy khách (Client)
Chúng tôi khuyến nghị sử dụng các tham số lấy mẫu temperature=0.6, top_p=0.95 và top_k=20, đồng thời kích hoạt enable_thinking để đạt hiệu suất tốt hơn.
Safetensors
Bài viết được AI dịch và tổng hợp tự động từ Ant Group inclusionAI: HuggingFace mô hình mới. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.