Mô hình
Ant Group ra mắt Ling-3.0-Flash: Mô hình suy luận hỗn hợp thế hệ mới
(giờ Việt Nam)
Tóm tắt AI
Ant Group vừa giới thiệu Ling-3.0-Flash, mô hình AI suy luận hỗn hợp (hybrid) thế hệ mới, được tối ưu hóa để cân bằng giữa hiệu suất xử lý và tốc độ phản hồi.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
27-07-2026 09:57:26 Nguồn: QbitAI
Ngày 24 tháng 7, Ant Bailing đã chính thức ra mắt thế hệ mô hình suy luận hỗn hợp thuần túy mới mang tên Ling-3.0-Flash. Mô hình này có tổng số tham số là 124B, với 5,1B tham số được kích hoạt trong mỗi lần tính toán. Trong khi tinh giản đáng kể dung lượng và giảm chi phí tính toán, Ling-3.0-Flash vẫn đạt được hoặc thậm chí vượt qua các mô hình hàng đầu trong ngành có quy mô tham số lớn gấp 2 đến 3 lần ở các chỉ số cốt lõi như suy luận cơ bản, tuân thủ chỉ dẫn và xử lý văn bản dài, qua đó thể hiện "tỷ lệ hiệu năng trí tuệ" và hiệu quả chi phí thực tế cao hơn. Được biết, mô hình này đã có mặt trên OpenRouter, miễn phí trong một tuần và sẽ chính thức mã nguồn mở sau đó.

Là trọng tâm của phiên bản này, Ling-3.0-Flash đã được tinh chỉnh chuyên sâu cho các kịch bản ứng dụng thực tế của Agent. Mô hình đã mở rộng hơn 10.000 môi trường huấn luyện tương tác thực tế, đồng thời tối ưu hóa cơ chế tự sửa lỗi và lập kế hoạch dài hạn cho các tác vụ phức tạp. Dù là trong các tác vụ viết mã, phân tách nhiệm vụ phức tạp hay nghiên cứu chuyên sâu từ nhiều nguồn thông tin, Ling-3.0-Flash đều thể hiện khả năng tự hoàn thiện quy trình tốt hơn, giải quyết được vấn đề các mô hình truyền thống dễ bị "lệch hướng" hoặc gián đoạn khi xử lý các tác vụ lớn.
Theo giới thiệu, chìa khóa để đạt được "dung lượng nhỏ, trí tuệ cao" nằm ở việc tái thiết kế kiến trúc tính toán nền tảng của mô hình. Ling-3.0-Flash từ bỏ tư duy chỉ tập trung vào việc tăng số lượng tham số, thay vào đó áp dụng kiến trúc chú ý hỗn hợp ngay từ giai đoạn tiền huấn luyện, với tỷ lệ 5:1 xen kẽ giữa các lớp chú ý tuyến tính KDA và lớp MLA, giúp mô hình đạt được sự cân bằng tối ưu giữa hiệu suất ngữ cảnh dài và năng lực mô hình.
Ngoài ra, Ling-3.0-Flash đã nâng cấp Lightning Attention của thế hệ trước thành KDA (Kimi Delta Attention), đưa cơ chế cổng chéo (diagonal gating) tinh vi vào quá trình cập nhật trạng thái của Delta Rule, giúp mô hình ghi nhớ thông tin quan trọng chính xác hơn khi xử lý các tài liệu dài và kho mã nguồn. Đồng thời, Ling-3.0-Flash tiếp tục nén tỷ lệ kích hoạt chuyên gia trong mỗi lần tính toán, với tỷ lệ kích hoạt chuyên gia trên mỗi Token giảm từ 1/32 của thế hệ trước xuống còn 1/64, từ đó tạo ra "đòn bẩy hiệu suất" cao hơn.

Để giúp AI Agent vận hành nhanh và ổn định hơn, Bailing cũng trang bị các kiến trúc kỹ thuật và cộng tác đi kèm. Về tốc độ phản hồi, thông qua việc giới thiệu bộ nhớ đệm phân cấp cấp độ cụm (cluster-level tiered caching), mô hình tránh được việc tính toán lặp lại trong các cuộc hội thoại dài và tương tác nhiều vòng, giúp giảm độ trễ phản hồi ký tự đầu tiên khi nhập liệu dài từ 60% đến hơn 80%. Về độ ổn định của tác vụ, kiến trúc cộng tác đa tác nhân (multi-agent) được nâng cấp cho phép các Agent khác nhau phân công phối hợp và kiểm chứng lẫn nhau, giảm thiểu hiệu quả rủi ro sai sót của mô hình đơn lẻ, từ đó hỗ trợ các dịch vụ trực tuyến tần suất cao và triển khai nghiệp vụ thực tế.
Bài viết này do Ant Bailing cung cấp, QbitAI được ủy quyền đăng tải lại, quan điểm thuộc về tác giả gốc.
Bản quyền đã được bảo hộ, không được phép sao chép hoặc sử dụng dưới mọi hình thức khi chưa có sự cho phép, mọi hành vi vi phạm sẽ bị xử lý theo pháp luật.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.