Tin ngành
Meituan ra mắt LongCat: Mô hình AI tối ưu hóa hiệu suất mới trên HuggingFace
(giờ Việt Nam)
Tóm tắt AI
Meituan vừa giới thiệu LongCat-Flash-Lite-Sparse, một mô hình AI mới được tối ưu hóa cho các tác vụ xử lý dữ liệu quy mô lớn với cấu trúc thưa (sparse) giúp tăng tốc độ phản hồi.
Bản dịch AI
Báo cáo kỹ thuật 📄
Giới thiệu mô hình
LongCat-Flash-Lite-Sparse là mô hình Mixture-of-Experts (MoE) không tư duy (non-thinking) với tổng cộng 69 tỷ tham số và khoảng 3 tỷ tham số được kích hoạt trên mỗi token. Được xây dựng dựa trên LongCat-Flash-Lite, mô hình này thay thế dense MLA bằng LongCat Sparse Attention (LSA) và hỗ trợ nguyên bản độ dài ngữ cảnh lên tới 1 triệu token. So với phiên bản dense tiền nhiệm, LongCat-Flash-Lite-Sparse cải thiện hiệu suất suy luận trên ngữ cảnh dài và khả năng tác vụ (agentic capabilities) trong khi vẫn duy trì hiệu năng suy luận và kiến thức tổng quát mạnh mẽ.
Các tính năng chính
🌟 LongCat Sparse Attention (LSA)
LSA là một khung sparse-attention hiệu quả về phần cứng, mở rộng từ DeepSeek Sparse Attention (DSA) với ba cơ chế lập chỉ mục bổ trợ:
Tổng hợp lại, các cơ chế này cho phép LongCat-Flash-Lite-Sparse xử lý các ngữ cảnh dài hiệu quả hơn đáng kể mà không làm giảm chất lượng mô hình.
🌟 Hỗ trợ nguyên bản ngữ cảnh 1 triệu token
Để tăng cường khả năng xử lý ngữ cảnh dài, chúng tôi đã cập nhật giai đoạn mở rộng ngữ cảnh của LongCat-Flash-Lite với kho dữ liệu phong phú hơn và lộ trình tăng dần lên tới 1.024K, cho phép hỗ trợ nguyên bản độ dài ngữ cảnh lên tới 1 triệu token.
🌟 Hiệu suất tác vụ (Agentic) mạnh mẽ
LongCat-Flash-Lite-Sparse mang lại hiệu suất mạnh mẽ hơn so với phiên bản dense tiền nhiệm trong các tác vụ lập trình, tìm kiếm và sử dụng công cụ theo hướng tác vụ (agentic).
Vui lòng tham khảo báo cáo kỹ thuật của chúng tôi để biết thêm chi tiết!
Kết quả đánh giá
Các tiêu chuẩn đánh giá (Benchmarks)
Lưu ý: Lite-Dense biểu thị cho LongCat-Flash-Lite, với các chỉ số được lấy từ báo cáo kỹ thuật của mô hình này. Lite-Sparse (w/o HI) và Lite-Sparse (w/ HI) lần lượt biểu thị cho các biến thể sparse được đánh giá khi không có và có sử dụng Hierarchical Indexing.
Các tiêu chuẩn đánh giá ngữ cảnh dài
Triển khai
Chúng tôi đã thực hiện các điều chỉnh cơ bản trong SGLang (PR) để hỗ trợ việc triển khai LongCat-Flash-Lite-Sparse.
LongCat-Flash-Lite có thể được phục vụ trên một node đơn lẻ (ví dụ: 1xH20-141G).
Máy chủ có thể được khởi chạy như sau:
Thỏa thuận cấp phép
Kho lưu trữ này, bao gồm cả trọng số mô hình và mã nguồn, được phát hành theo Giấy phép MIT.
Mọi đóng góp cho kho lưu trữ này đều được cấp phép theo Giấy phép MIT, trừ khi có quy định khác. Giấy phép này không cấp bất kỳ quyền nào để sử dụng nhãn hiệu hoặc bằng sáng chế của Meituan.
Để biết chi tiết, vui lòng xem tệp LICENSE.
Lưu ý khi sử dụng
Mô hình này chưa được thiết kế đặc biệt hoặc đánh giá toàn diện cho mọi ứng dụng hạ nguồn có thể xảy ra.
Các nhà phát triển nên cân nhắc những hạn chế đã biết của các mô hình ngôn ngữ lớn, bao gồm sự khác biệt về hiệu suất giữa các ngôn ngữ, đồng thời đánh giá cẩn thận về độ chính xác, tính an toàn và tính công bằng trước khi triển khai mô hình trong các tình huống nhạy cảm hoặc có rủi ro cao. Các nhà phát triển và người dùng hạ nguồn có trách nhiệm tìm hiểu và tuân thủ mọi luật lệ và quy định hiện hành liên quan đến trường hợp sử dụng của họ, bao gồm nhưng không giới hạn ở các yêu cầu về bảo vệ dữ liệu, quyền riêng tư và an toàn nội dung.
Không có nội dung nào trong Thẻ mô hình (Model Card) này được hiểu là thay đổi hoặc hạn chế các điều khoản của Giấy phép MIT mà theo đó mô hình được phát hành.
Liên hệ
Vui lòng liên hệ với chúng tôi tại [email protected] hoặc mở một issue nếu bạn có bất kỳ câu hỏi nào.
Bài viết được AI dịch và tổng hợp tự động từ Meituan LongCat: HuggingFace mô hình mới. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.