Ant Group inclusionAI: HuggingFace mô hình mới
85

Mô hình

Ant Group ra mắt LLaDA2.2-mini: Mô hình ngôn ngữ khuếch tán tối ưu cho tác vụ thông minh

(giờ Việt Nam)

Tóm tắt AI

Ant inclusionAI vừa phát hành LLaDA2.2-mini trên Hugging Face, một mô hình ngôn ngữ khuếch tán nhẹ với 16 tỷ tham số nhưng chỉ kích hoạt 1,4 tỷ tham số khi suy luận, giúp tối ưu hiệu suất cho các tác vụ thông minh.

Bản dịch AI

inclusionAI/LLaDA2.2-mini · Hugging Face

LLaDA2.2-mini là biến thể gọn nhẹ của mô hình ngôn ngữ khuếch tán (diffusion language model) hướng tác tử trong dòng LLaDA2. Được xây dựng dựa trên kiến trúc LLaDA2.0-mini, mô hình kế thừa những cải tiến cốt lõi của dòng LLaDA2.2 — Levenshtein Editing (giới thiệu các token điều khiển DELETE và INSERT) — cho phép gọi công cụ với ngữ cảnh dài, tương tác đa vòng và sửa lỗi mạnh mẽ, đồng thời duy trì số lượng tham số nhỏ hơn và chi phí suy luận thấp hơn. Để biết thêm chi tiết, vui lòng tham khảo báo cáo kỹ thuật của chúng tôi.

📊 Điểm chuẩn (Benchmarks)

Bảng dưới đây so sánh LLaDA2.0-mini, LLaDA2.1-mini và LLaDA2.2-mini trên các khả năng Tổng quát và Tác tử.

🚀 Các tính năng chính

Hạ tầng khuếch tán 128K hiệu quả: LLaDA2.2-mini mở rộng cửa sổ ngữ cảnh lên 128K và giới thiệu cơ chế Block Routing, giúp hạn chế kích hoạt chuyên gia MoE ở cấp độ khối khuếch tán, từ đó cho phép thực hiện các tác vụ tác tử với ngữ cảnh dài một cách hiệu quả.

Levenshtein Editing: Giới thiệu các token điều khiển DELETE và INSERT, cho phép giải mã khuếch tán để chỉnh sửa cấu trúc chuỗi, loại bỏ nội dung dư thừa và tạo các điểm chèn trong quá trình tạo song song.

Học tăng cường tác tử (Agentic Reinforcement Learning): Đề xuất phương pháp tối ưu hóa chính sách cấp khối dựa trên ELBO của Levenshtein Editing (L-EBPO), tận dụng phần thưởng từ môi trường tác tử để huấn luyện khả năng chỉnh sửa Levenshtein và sửa lỗi trong các kịch bản sử dụng công cụ đa vòng.

Gọn nhẹ & Hiệu quả: Với tổng cộng 16B tham số và chỉ 1.4B tham số được kích hoạt trong quá trình suy luận, mô hình giúp giảm đáng kể chi phí tính toán trong khi vẫn duy trì khả năng mạnh mẽ.

📦 Các biến thể mô hình

🔍 Tổng quan mô hình

Các thông số kỹ thuật chính của LLaDA2.2-mini:

🤗 Cách sử dụng với Hugging Face Transformers

Vui lòng đảm bảo đã cài đặt transformers>=5.2.0 và các phụ thuộc liên quan.

Các phương pháp tối ưu (Best Practices)

Để đạt hiệu suất tối ưu, chúng tôi khuyến nghị các cấu hình sau:

Tham số lấy mẫu (Sampling Parameters): Sử dụng block_length=32, temperature=0.0, top_p=None, top_k=None làm các giá trị mặc định ổn định.

Ngưỡng khử nhiễu (Denoising Threshold): Điều chỉnh threshold, editing_threshold và max_post_steps dựa trên sự cân bằng giữa tốc độ và chất lượng cho trường hợp sử dụng của bạn. Các ngưỡng thấp hơn có thể cải thiện tốc độ suy luận nhưng có thể dẫn đến đầu ra lặp lại hoặc không ổn định.

Độ dài đầu ra: Đối với hầu hết các truy vấn, độ dài đầu ra 32768 token là mức được khuyến nghị.

Tác vụ tác tử ngữ cảnh dài: Đối với các ứng dụng tác tử đa vòng và gọi công cụ với ngữ cảnh dài, chúng tôi khuyến nghị sử dụng SGLang làm backend phục vụ. Đảm bảo cấu hình máy chủ hỗ trợ cửa sổ ngữ cảnh 128K và các yêu cầu suy luận khuếch tán MoE của mô hình.

🤖 ModelScope

Nếu bạn đang ở Trung Quốc đại lục, chúng tôi đặc biệt khuyến nghị truy cập các mô hình của chúng tôi thông qua 🤖 ModelScope.

🌐 Giấy phép

Dự án này được cấp phép theo Giấy phép Apache 2.0.

🤝 Liên hệ & Hợp tác

Nếu có bất kỳ câu hỏi, cơ hội hợp tác hoặc phản hồi nào, vui lòng liên hệ với chúng tôi qua Hugging Face hoặc gửi issue trên kho lưu trữ GitHub của chúng tôi.

Hãy tham gia cùng chúng tôi để thúc đẩy các mô hình ngôn ngữ khuếch tán mở, hiệu quả và thông minh cho các ứng dụng tác tử!

Ant GroupLLaDAMô hình ngôn ngữAI nhẹDiffusion Model
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Ant Group inclusionAI: HuggingFace mô hình mới. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.