Ant Ling: Developer Blog (Web)
88

Mô hình

Ant Ling ra mắt Ling-3.0-flash: Mô hình 124B tham số với hiệu suất vượt xa các flagship 1T

(giờ Việt Nam)

Tóm tắt AI

Ant Ling vừa trình làng Ling-3.0-flash, mô hình suy luận hỗn hợp với 124 tỷ tham số tổng nhưng chỉ kích hoạt 5,1 tỷ, đạt mật độ thông minh vượt trội so với thế hệ tiền nhiệm 1T.

Bản dịch AI

Hôm nay, chúng tôi chính thức ra mắt Ling-3.0-flash, thế hệ mô hình suy luận hỗn hợp thuần túy (native hybrid reasoning model) mới của Bailing.

So với thế hệ trước là mô hình tư duy flagship cấp 1T Ring-2.6-1T, Ling-3.0-flash có tổng số tham số là 124B (chỉ bằng khoảng 12,4% của Ring-2.6-1T), tham số kích hoạt chỉ là 5,1B (khoảng 8,1% của Ring-2.6-1T), nhưng đã đạt được sự đối trọng toàn diện về năng lực, thậm chí là vượt trội. Đây không chỉ là một cuộc tái cấu trúc về quy mô tham số, mà còn là một "paradigm shift" (chuyển dịch mô hình) — cách thức mô hình đạt được trí tuệ không còn theo đuổi việc chồng chất quy mô đơn thuần, mà tập trung hơn vào việc khai thác hiệu quả từng chút sức mạnh tính toán và trạng thái, theo đuổi sự nâng cấp tối thượng về "mật độ trí tuệ".

Sự nhảy vọt về năng lực của Ling-3.0-flash không đến từ việc mở rộng quy mô tham số, mà bắt nguồn từ sự dẫn dắt kép của việc nâng cấp kiến trúc nền tảng và tối ưu hóa định hướng cho Agent: Một mặt, cơ chế chú ý tuyến tính hỗn hợp thuần túy (native hybrid linear attention), bộ nhớ trạng thái KDA hạt mịn và MoE thưa 1/64 phối hợp nâng cao hiệu suất chuyển đổi tham số thành năng lực thực tế; mặt khác, việc tinh chỉnh định hướng cho các kịch bản năng suất đã củng cố sức mạnh cốt lõi của mô hình trong lập kế hoạch phức tạp, gọi công cụ đa vòng và thực hiện nhiệm vụ dài hạn. Dưới tác động chung của cả hai, mô hình thể hiện khả năng đối trọng hoặc thậm chí thách thức vượt cấp các mô hình có quy mô lớn hơn dù sở hữu kích thước cực nhỏ, giúp đạt được cả hiệu năng cao và hiệu quả chi phí tối ưu.

Cụ thể, những cải tiến cốt lõi của Ling-3.0-flash được thể hiện qua các khía cạnh sau:

Ling-3.0 核心能力对比

Dòng mô hình Ling-3.0 đã đạt được sự nâng cấp hệ thống về thiết kế kiến trúc, tích hợp sâu tính toán ngữ cảnh dài, bộ nhớ trạng thái và tối ưu hóa định tuyến chuyên gia, nhằm mang vác và chuyển hóa dung lượng kiến thức cùng năng lực lớn hơn với quy mô kích hoạt trên mỗi Token thấp hơn.

Hybrid-linear: Kiến trúc chú ý tuyến tính hỗn hợp thuần túy.

Khác với Ling-2.6 dựa vào việc chuyển đổi kiến trúc để cải tạo tiền huấn luyện, Ling-3.0 áp dụng kiến trúc chú ý tuyến tính hỗn hợp thuần túy ngay từ khi bắt đầu tiền huấn luyện, xếp chồng xen kẽ các lớp chú ý tuyến tính KDA và lớp MLA theo tỷ lệ 5:1 (cứ mỗi 6 lớp bao gồm 5 lớp KDA và 1 lớp MLA). Thiết kế này giúp các thành phần của mô hình toàn chuỗi phối hợp tối ưu sâu sắc trong suốt chu kỳ huấn luyện, đạt được sự cân bằng tối ưu giữa hiệu suất ngữ cảnh dài và năng lực mô hình.

Ling-3.0 nâng cấp Lightning Attention của thế hệ trước thành KDA (Kimi Delta Attention). KDA đưa vào cơ chế cổng chéo (diagonal gating) hạt mịn trong quá trình cập nhật trạng thái của Delta Rule, trao cho các kênh đặc trưng khác nhau khả năng kiểm soát độc lập về lưu giữ, suy giảm và ghi dữ liệu. Cơ chế này nâng cao đáng kể độ chính xác kiểm soát bộ nhớ trạng thái hữu hạn, giúp mô hình khi xử lý các tài liệu dài, kho mã nguồn lớn và gói dữ liệu phức tạp có thể duy trì chính xác thông tin quan trọng xuyên suốt các đoạn văn và các bước, đặt nền tảng kiến trúc vững chắc cho việc truy xuất ngữ cảnh dài, tích hợp thông tin và suy luận liên tục.

Dựa trên Ling Scaling Law, tỷ lệ kích hoạt chuyên gia thấp hơn có thể mang lại "đòn bẩy hiệu quả" cao hơn, tức là đạt được năng lực mô hình tương đương cao hơn với ít tính toán thực tế hơn. Do đó, Ling-3.0 giảm tỷ lệ kích hoạt chuyên gia trên mỗi Token từ 1/32 của thế hệ trước xuống còn 1/64, thúc đẩy sự nhảy vọt về năng lực mô hình với mức tiêu thụ tính toán cực thấp.

Tóm lại, sự phối hợp sâu sắc giữa chú ý tuyến tính hỗn hợp thuần túy, KDA và MoE thưa đã nâng cao đáng kể hiệu suất chuyển đổi giữa quy mô tham số, chi phí tính toán và năng lực mô hình, cung cấp sự hỗ trợ kiến trúc vững chắc cho sự phát triển vượt bậc của Ling-3.0-flash ở quy mô 124B (kích hoạt 5,1B).

原生混合线性注意力架构示意

Với mật độ trí tuệ tối thượng, khám phá ranh giới năng lực và giới hạn ứng dụng.

Trên cơ sở khám phá tối thượng về mật độ trí tuệ và tỷ lệ hiệu quả trí tuệ của thế hệ mô hình flash trước, Ling-3.0-flash tiếp tục tiến hóa toàn diện. Chúng tôi không theo đuổi sự "lớn và toàn diện" đơn thuần, mà tập trung vào việc đạt đến mức tối thượng về "nhanh, tiết kiệm, khả thi" trên tiền đề "đủ mạnh", liên tục phá vỡ giới hạn trên của năng lực mô hình và ranh giới tuyệt đối của mật độ trí tuệ. Đối mặt với các mô hình SOTA kích thước lớn hơn và thế hệ flagship trước là Ring-2.6-1T, Ling-3.0-flash thể hiện hiệu suất vượt cấp không hề kém cạnh, thậm chí ưu việt hơn ở nhiều chỉ số then chốt:

Đối trọng toàn diện năng lực cốt lõi, đạt hiệu suất vượt cấp. Ling-3.0-flash thể hiện sự tự tin khi so sánh với các mô hình quy mô lớn hơn trong suy luận truyền thống, tuân thủ chỉ dẫn và tương tác văn bản dài, không chỉ bao phủ toàn diện các kịch bản phức tạp cốt lõi như toán học, logic truyền thống và mã nguồn, điều khiển chính xác các chỉ dẫn khắt khe trong môi trường đa ràng buộc và môi trường tác nhân thông minh, mà còn hỗ trợ xử lý ngữ cảnh khổng lồ một cách thong dong, đảm bảo sự thúc đẩy liên tục của logic nghiệp vụ phức tạp trong các tương tác sâu đa vòng, chu kỳ dài.

Thích ứng sâu đa kịch bản, Agent triển khai vững chắc. Xoay quanh kịch bản Agent đang được quan tâm nhất hiện nay, Ling-3.0-flash thể hiện độ khớp kịch bản cực cao, đạt được "năng lực mạnh, phản hồi nhanh, phối hợp ổn định". Dù là Coding Agent bao phủ sâu việc tạo mã, tái cấu trúc đa tệp và xác thực kết quả; General Agent có khả năng lập kế hoạch nhiệm vụ, kết hợp công cụ và điều chỉnh động xuất sắc; hay Deep Research Agent tập trung vào truy xuất đa vòng, tích hợp đa nguồn và khép kín bằng chứng, mô hình đều có thể triển khai vững chắc, điều khiển các kịch bản năng suất phức tạp bằng năng lực thực thi khép kín vượt trội.

Mật độ trí tuệ tối thượng, cân bằng hiệu năng cao và hiệu quả chi phí. Trong khi theo đuổi hiệu năng cao, Ling-3.0-flash theo đuổi sự tối thượng ở khía cạnh mật độ trí tuệ và tỷ lệ hiệu quả trí tuệ. Nhờ tổng số tham số và tham số kích hoạt cực ít, mô hình đạt hoặc vượt các SOTA kích thước lớn và flagship thế hệ trước Ring-2.6-1T trong nhiều chỉ số đánh giá, đồng thời ép chi phí suy luận xuống mức cực thấp. Mật độ trí tuệ tối thượng này chuyển hóa thành giá trị ứng dụng thực tế, nghĩa là độ trễ tạo văn bản ngắn hơn, phản hồi chữ đầu tiên (TTFT) nhanh hơn và chi phí gọi API thấp hơn, trao quyền toàn diện cho các dịch vụ trực tuyến tần suất cao và việc triển khai Agent thực tế.

Đánh giá mặc định bật chế độ tư duy, các tính toán điểm trung bình sử dụng phần mà tất cả các mô hình đều có điểm đánh giá.

Tham số kích hoạt quyết định lượng tính toán suy luận đơn lẻ và thông lượng dịch vụ: Ling-3.0-flash chỉ cần 5,1B tham số kích hoạt để cung cấp điểm số trí tuệ có tính cạnh tranh.

智能密度与评测对比

Đáng chú ý, Ling-3.0-flash còn nâng cấp hệ thống xung quanh các kịch bản năng suất thực tế về năng lực Agent, hiệu suất vận hành và kiến trúc phối hợp. Đối mặt với các ràng buộc phức tạp và nhiệm vụ dài hạn, Ling-3.0-flash có thể lập kế hoạch liên tục, gọi công cụ, phản hồi phản hồi môi trường và điều chỉnh lộ trình thực thi dựa trên kết quả trung gian, cuối cùng hoàn thành việc bàn giao nhiệm vụ có thể xác thực. Đồng thời, thông qua bộ nhớ đệm phân cấp và kiến trúc phối hợp Multi-Agent, chúng tôi đã nâng cao hơn nữa hiệu suất tương tác hội thoại dài, cũng như giới hạn trên và tính ổn định của năng lực thực thi nhiệm vụ phức tạp.

Năng lực mạnh: Nhiệm vụ phức tạp, tối ưu hóa liên tục.

Về huấn luyện, chúng tôi đã mở rộng môi trường huấn luyện tương tác của Coding Agent, General Agent và Deep Research Agent lên hơn 10.000 môi trường, đồng thời liên tục nâng cao chất lượng, sự đa dạng và độ khó của nhiệm vụ. Đối với các nhiệm vụ Agent dài hạn, chúng tôi đưa vào cơ chế xem xét lại quỹ đạo thực thi hoàn chỉnh và đánh giá đóng góp từng bước trong giai đoạn RL, tạo ra tín hiệu huấn luyện cấp bước hạt mịn hơn cho quá trình thực thi nhiệm vụ, giúp mô hình học tập hiệu quả hơn từ tương tác môi trường, phản hồi thất bại và tự sửa lỗi.

Nhờ đó, so với flagship thế hệ trước Ring-2.6-1T, năng lực Agent của Ling-3.0-flash đã đạt được sự nâng cấp toàn diện, đối chuẩn hoặc vượt qua các mô hình SOTA mã nguồn mở và mô hình đóng hàng đầu ngành có quy mô lớn gấp 2-3 lần ở nhiều chỉ số, thể hiện năng lực thực thi và bàn giao nhiệm vụ hướng tới các kịch bản năng suất thực tế. Năng lực này cũng đã vượt qua bài kiểm tra của các kịch bản nhu cầu tạo APP thực tế, tỷ lệ thông qua của Ling-3.0-flash trên MiniAppBench đạt 25,3%, ngang bằng với các mô hình SOTA mã nguồn mở có tổng quy mô tham số lớn gấp đôi nó. MiniAppBench yêu cầu mô hình tạo ra một APP hoàn chỉnh có thể sử dụng chỉ dựa trên một câu nhu cầu của người dùng, tỷ lệ thông qua trung bình của 16 mô hình chính thống tham gia đánh giá chỉ là 17%.

Agent 能力评测对比

Phản hồi nhanh: Tương tác dài hạn, không cần tính toán lại.

Nhiệm vụ Agent càng phức tạp, số vòng hội thoại càng nhiều, ngữ cảnh càng dài. Trong dịch vụ suy luận truyền thống, một khi bộ nhớ đệm cục bộ bị đẩy ra bởi yêu cầu mới hoặc cùng một phiên hội thoại được điều phối đến các nút tính toán khác, hệ thống thường cần xử lý lại ngữ cảnh hàng chục nghìn Token trước đó, dẫn đến độ trễ Token đầu tiên (TTFT) tăng nhanh. Vì vậy, Ling-3.0-flash xây dựng hệ thống bộ nhớ đệm phân cấp cấp cụm dựa trên SGLang HiCache và Mooncake, cho phép ngữ cảnh hiện có được lưu trữ xuyên cấp, chia sẻ xuyên nút và khôi phục theo yêu cầu, nâng cấp bộ nhớ đệm từ "riêng tư của thực thể" thành "chia sẻ cấp cụm", giảm thiểu tối đa việc tính toán lặp lại ngữ cảnh dài. Kiểm tra thực tế cho thấy, trong kịch bản đầu vào dài, việc trúng L3 Cache có thể giảm TTFT từ 60% đến hơn 80% so với việc tính toán lại trực tiếp.

Từ bộ nhớ đệm cục bộ đến chia sẻ cấp cụm, từ tính toán lặp lại đến tái sử dụng phân cấp, Ling-3.0-flash nâng cao đáng kể Token Efficiency của các hội thoại dài. Đối với các kịch bản như Coding Agent, hỏi đáp tài liệu dài cần mang theo lịch sử đầy đủ liên tục, điều này đồng nghĩa với việc tiếp nối nhiệm vụ nhanh hơn, chi phí tính toán thấp hơn và trải nghiệm tương tác mượt mà, ổn định hơn.

Phối hợp Multi-Agent ổn định: Trí tuệ đa nguyên, kiểm chứng lẫn nhau.

Đối mặt với các nhiệm vụ Agent phức tạp, chuỗi suy luận Single-Agent truyền thống dễ bị ảnh hưởng bởi các vấn đề như trôi quyết định, phán đoán sai cục bộ và khả năng chịu lỗi không đủ. Vì vậy, Ling-3.0-flash đã nâng cấp kiến trúc phối hợp đa tác nhân "Ling Multi-Agent". Trên cơ sở mô hình "Delegation Intelligence" (Trí tuệ ủy quyền) của SearchSwam, chúng tôi đã nghiên cứu sâu hơn cơ chế Scaling của kiến trúc Multi-Agent. Các Agent khác nhau có thể phân công đa cấp xoay quanh nhiệm vụ, và thông qua kiểm chứng chéo, bổ sung thông tin, sửa lỗi phối hợp và cạnh tranh, giảm thiểu sai lệch do lộ trình suy luận đơn lẻ mang lại.

Như hình dưới, trên BrowseComp và BrowseComp_zh, thông qua kiến trúc "Ling Multi-Agent" có thể đạt được sự nâng cấp hiệu suất log-linear. Trong tương lai, chúng tôi sẽ mở rộng mô hình này sang các kịch bản nhiệm vụ rộng hơn, tiếp tục khám phá ranh giới năng lực của sự phối hợp tác nhân quy mô lớn hơn.

Ling Multi-Agent 在 BrowseComp 上的性能提升

Ling-3.0-flash hỗ trợ thuần túy ngữ cảnh 256K và có thể mở rộng lên 1M; đồng thời tối ưu hóa chuyên biệt cho kịch bản Agent, giúp năng lực mô hình không chỉ thể hiện ở các chỉ số đánh giá mà còn có thể chuyển hóa tốt hơn thành năng lực thực thi nhiệm vụ trong hệ thống thực tế.

Mô hình hóa tự động Blender.

Ling-3.0-flash đã phá vỡ giới hạn của mã nguồn phẳng, có thể can thiệp trực tiếp vào thế giới thiết kế 3D, trở thành trợ lý mô hình hóa ba chiều ảo mà bạn có thể gọi bất cứ lúc nào.

Trong kịch bản sử dụng Blender, Ling-3.0-flash điều khiển phần mềm 3D thông qua giao diện Blender MCP, tự động viết kịch bản Python để dựng cảnh thành phố bao gồm mạng lưới đường cao tốc, tòa nhà chọc trời và vật liệu chỉ với một câu lệnh, cuối cùng thiết lập lộ trình camera và xuất video quay từ trên không.

Trong quá trình tạo, Ling-3.0-flash thể hiện các năng lực như suy luận không gian hình học 3D phức tạp, điều khiển Blender Python API và gọi công cụ MCP dài hạn.

Bảng điều khiển nghiên cứu khoa học đa tác nhân tự chủ.

Nhận một đề tài mà không biết bắt đầu từ đâu? Ling-3.0-flash có thể đóng nhiều vai trò để nhanh chóng thực hiện truy xuất tài liệu, chất vấn dữ liệu, tạo bài báo và tổng hợp PPT bạn cần.

Bảng điều khiển nghiên cứu khoa học đa tác nhân tự chủ do Ling-3.0-flash xây dựng hỗ trợ các vai trò (Scientist, Data Analyst, CrossValidator, Archivist, Writer) tự chủ thực hiện suy diễn giả thuyết, truy xuất tài liệu, chất vấn dữ liệu, thảo luận tại chỗ và tự động tổng hợp bài báo kết quả cùng báo cáo Slide.

Ant LingMô hình ngôn ngữAI hiệu năng caoLing-3.0-flashCông nghệ AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Ant Ling: Developer Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.