Tin ngành
Ant Group ra mắt Ling-3.0-tiny-int4: Mô hình ngôn ngữ siêu nhỏ tối ưu cho thiết bị
(giờ Việt Nam)
Tóm tắt AI
Ant Group vừa phát hành Ling-3.0-tiny-int4 trên HuggingFace, một phiên bản mô hình ngôn ngữ được nén tối ưu, hứa hẹn hiệu suất cao cho các ứng dụng chạy trực tiếp trên thiết bị.
Bản dịch AI
🤗 Hugging Face | 🤖 ModelScope | 🐙 OpenRouter
Giới thiệu
Chúng tôi xin giới thiệu Ling-3.0-tiny, một mô hình suy luận lai (hybrid reasoning) thuần túy với tổng cộng 7,9 tỷ tham số và chỉ 1,3 tỷ tham số được kích hoạt trong quá trình suy luận. Bản phát hành này cung cấp các biến thể BF16, FP8 và INT4, cho phép các nhà phát triển lựa chọn linh hoạt dựa trên môi trường phần cứng, yêu cầu về năng lực và chi phí triển khai.
Các điểm nổi bật chính của mô hình được tóm tắt dưới đây:
Tổng quan về mô hình
Ling-3.0-tiny áp dụng kiến trúc chú ý tuyến tính lai (hybrid linear attention) thuần túy của dòng Ling-3.0 và được tối ưu hóa hơn nữa cho các kịch bản triển khai nhẹ và dễ tiếp cận. Mô hình có tổng cộng 7,9 tỷ tham số, với chỉ 1,3 tỷ tham số được kích hoạt cho mỗi token.
Kiến trúc của Ling-3.0-tiny không được thiết kế để tối ưu hóa một chỉ số kỹ thuật đơn lẻ; thay vào đó, nó hướng tới việc chuyển đổi hiệu suất thành kết quả thực tế trong các tác vụ đời thực.
Tổng hợp lại, các thiết kế này nhắm đến ba mục tiêu:

Đánh giá
Chúng tôi đã đánh giá Ling-3.0-tiny trên các tác vụ đại lý (agent) tổng quát, đại lý lập trình, tạo mã, hiểu ngữ cảnh dài, độ tin cậy của kiến thức, suy luận toán học và khoa học, cùng khả năng tuân thủ chỉ dẫn.
Ling-3.0-tiny đạt 25 điểm trên Artificial Analysis Intelligence Index v4.1.1 và 16 điểm trên Artificial Analysis Agentic Index. Trong các bài kiểm tra của Artificial Analysis, mô hình đạt tốc độ đầu ra hơn 160 token/giây và độ trễ đầu cuối khoảng 18 giây để tạo 500 token (bao gồm cả thời gian suy nghĩ của mô hình), phản ánh sự cân bằng giữa năng lực tổng thể, quy mô tham số kích hoạt và hiệu quả phản hồi.
Bảng sau đây trình bày các điểm chuẩn tiêu biểu cho Ling-3.0-tiny:

Tất cả kết quả đánh giá của Ling-3.0-tiny đều sử dụng chế độ Thinking (suy nghĩ); các tham số lấy mẫu được khuyến nghị là temperature=1.0, top_p=0.95 và top_k=20.
Bắt đầu nhanh
SGLang
Ma trận khởi chạy dành riêng cho phần cứng và công thức cụ thể (BF16/FP8 × Độ trễ thấp / Thông lượng cao / HiCache + Mooncake) bao gồm trình tạo lệnh trực tiếp và các cấu hình đã được xác thực:
Cài đặt SGLang
Sử dụng image được xây dựng sẵn theo dõi runtime của Ling-3.0:
Chạy suy luận
Chúng tôi khuyến nghị sử dụng công thức độ trễ thấp (tích hợp MTP / NEXTN, ngữ cảnh 256K YaRN) trên 1 GPU loại 141GB (H20-3e) hoặc một node Blackwell 1-GPU:
Máy chủ (Server)
Máy khách (Client)
Mẫu trò chuyện (chat template) và trình phân tích suy luận ling3 cho phép bật chế độ thinking theo mặc định. Để tắt chế độ này cho một yêu cầu riêng lẻ, hãy đặt "chat_template_kwargs": {"enable_thinking": false}. Chúng tôi khuyến nghị các tham số lấy mẫu là temperature=1.0, top_p=0.95 và top_k=20.
vLLM
Cài đặt vLLM của chúng tôi
Chạy suy luận
Ví dụ sau đây chạy Ling-3.0-tiny trên 1 GPU, với máy chủ lắng nghe tại cổng ${PORT}:
Máy chủ (Server)
Máy khách (Client)
Chúng tôi khuyến nghị sử dụng các tham số lấy mẫu temperature=1.0, top_p=0.95, top_k=20 và bật enable_thinking để đạt hiệu suất tốt hơn.
Bài viết được AI dịch và tổng hợp tự động từ Ant Group inclusionAI: HuggingFace mô hình mới. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.