Tin ngành
Ant Group ra mắt Ling-3.0-flash-int4: Mô hình AI tối ưu hóa hiệu suất trên Hugging Face
(giờ Việt Nam)
Tóm tắt AI
Ant Group vừa phát hành phiên bản Ling-3.0-flash-int4 trên Hugging Face, một mô hình được tối ưu hóa bằng kỹ thuật lượng tử hóa int4 nhằm tăng tốc độ xử lý và giảm tài nguyên tính toán.
Bản dịch AI
🤗 Hugging Face | 🤖 ModelScope | 🐙 OpenRouter
Giới thiệu
Chúng tôi xin giới thiệu Ling-3.0-flash, mô hình suy luận lai (hybrid reasoning) thế hệ mới. Với tổng cộng 124 tỷ tham số và 5,1 tỷ tham số hoạt động (tương đương khoảng 12,4% và 8,1% so với mô hình chủ lực Ring-2.6-1T 1 nghìn tỷ tham số trước đây của chúng tôi), Ling-3.0-flash đạt hiệu suất tương đương hoặc vượt trội hơn so với phiên bản tiền nhiệm trên các tiêu chuẩn đánh giá chính.
Các điểm nổi bật của mô hình được tóm tắt dưới đây:

Tổng quan về mô hình
Thông tin tóm tắt và sơ đồ kiến trúc của mô hình như sau:

Đánh giá
Chúng tôi đã thực hiện đánh giá toàn diện Ling-3.0-flash trên nhiều tiêu chuẩn uy tín. Ling-3.0-flash thể hiện sức mạnh vượt trội trên các tiêu chuẩn đánh giá về mã nguồn/tác nhân (agent) tiêu biểu như SWE-Bench Pro, SWE-Bench Multilingual, Tau3-banking-AA, MCP-Atlas và SkillsBench, v.v. Trong thực tế, Ling-3.0-flash mang lại trải nghiệm người dùng mạnh mẽ trên các framework bao gồm Claude Code, Kilo Code, Qwen Code, Hermes Agent và OpenClaw, v.v. Ngoài các tác vụ tác nhân, Ling-3.0-flash còn đạt hiệu suất cao trong các lĩnh vực kiến thức tổng quát, suy luận toán học, tuân thủ chỉ dẫn và hiểu ngữ cảnh dài.

Các mô hình đã lượng tử hóa (Quantized Models)
Chúng tôi đánh giá các mô hình đã lượng tử hóa bằng cách sử dụng một số bộ dữ liệu. Mô hình lượng tử hóa FP8 được áp dụng thông qua phương pháp lượng tử hóa theo khối (blockwise quantization), còn các mô hình INT4 và FP4 được áp dụng thông qua phương pháp lượng tử hóa theo nhóm (groupwise quantization) với trọng số chuyên gia được định tuyến (routed experts weights).
Bắt đầu nhanh
Cài đặt SGLang của chúng tôi
Chạy suy luận (Inference)
Dưới đây là ví dụ để chạy mô hình Ling-3.0-flash int4 đã lượng tử hóa với 2 GPU, trong đó IP của nút chính (master node) là ${MASTER_IP} và cổng máy chủ là ${PORT}:
Máy chủ (Server)
Vì mô hình được huấn luyện với MTP, chúng tôi khuyến nghị kích hoạt MTP trong quá trình suy luận (tức là --speculative-algorithm NEXTN) để có độ trễ thấp hơn.
Máy khách (Client)
Chúng tôi khuyến nghị sử dụng các tham số lấy mẫu (sampling parameters) là temperature=0.6, top_p=0.95, và top_k=20, đồng thời kích hoạt enable_thinking để đạt hiệu suất tốt hơn.
Bài viết được AI dịch và tổng hợp tự động từ Ant Group inclusionAI: HuggingFace mô hình mới. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.