Mô hình
Meta ra mắt Muse Glimmer: Mô hình mã hóa 30B tham số với trọng số mở
(giờ Việt Nam)
Tóm tắt AI
Meta vừa công bố Muse Glimmer, mô hình mã hóa 30B tham số hỗ trợ triển khai cục bộ, giúp tối ưu hóa hiệu suất cho các tác vụ lập trình và xử lý dữ liệu ngay trên thiết bị.
Bản dịch AI
Hôm nay, chúng tôi giới thiệu Muse Glimmer, mô hình tiếp theo từ Meta Superintelligence Labs, đồng thời phát hành trọng số mô hình dưới giấy phép Apache 2.0 cởi mở.
Muse Glimmer là mô hình 30 tỷ tham số được tối ưu hóa cho các quy trình làm việc của tác nhân (agent) cục bộ luôn hoạt động. Nó đủ nhỏ để chạy trên máy Mac hoặc PC với một GPU phổ thông, cho phép triển khai các trường hợp sử dụng từ tác nhân cục bộ và gọi hàm (function calling), đến lập trình cục bộ và đánh giá LLM-as-a-judge. Muse Glimmer mang lại hiệu suất mạnh mẽ trên các trường hợp sử dụng tác nhân và các bộ tiêu chuẩn đánh giá chính so với các mô hình hàng đầu trong cùng phân khúc kích thước.
Các mô hình nền tảng đã đạt được những khả năng đáng kinh ngạc trong việc suy luận, tạo mã và sử dụng công cụ — tuy nhiên, hầu hết các triển khai vẫn phụ thuộc vào cơ sở hạ tầng đám mây và kết nối mạng. Việc chạy mô hình cục bộ cho phép bạn sử dụng AI mọi lúc, mọi nơi, dù có hay không có kết nối internet. Điều này ngày càng trở nên khả thi: cộng đồng mã nguồn mở đã chứng minh rằng các mô hình nhỏ hơn, khi được đào tạo hiệu quả, có thể đạt tới hiệu suất tiệm cận cấp độ tiên phong trong các tác vụ mục tiêu. Muse Glimmer được tối ưu hóa cho các trường hợp sử dụng cục bộ này.
Tiếp nối truyền thống lâu đời trong việc chia sẻ nghiên cứu AI cơ bản, hôm nay chúng tôi phát hành trọng số mở của Muse Glimmer trên Hugging Face, cùng với tài liệu dành cho nhà phát triển để giúp bạn bắt đầu xây dựng và vận hành các tác nhân của riêng mình. Muse Glimmer được thiết kế để hoạt động với các công cụ mà nhà phát triển đang sử dụng. Các tích hợp tối ưu hóa trên llama.cpp, MLX và ExecuTorch sẽ sớm ra mắt trong những ngày tới, giúp bạn có thể chuyển từ bước tải xuống sang vận hành tác nhân chỉ trong vài phút.
Cách chúng tôi đào tạo Muse Glimmer
Một tác nhân quản lý lịch trình, soạn thảo tin nhắn, sắp xếp tệp tin và học cách bạn làm việc cần có quyền truy cập sâu vào ngữ cảnh cá nhân. Nó cũng cần nhiều khả năng phối hợp nhịp nhàng: thực thi dài hạn, gọi công cụ chính xác, hiểu đa phương thức, bộ nhớ ngữ cảnh dài và tuân thủ hướng dẫn.
Chúng tôi thiết kế Muse Glimmer để cân bằng giữa khả năng xử lý với các hạn chế về bộ nhớ và tính toán của phần cứng cục bộ. Điều này đòi hỏi một kiến trúc nhỏ gọn, một công thức chưng cất (distillation) mới giúp chuyển giao khả năng suy luận tác nhân từ một mô hình giáo viên lớn hơn nhiều, và các tối ưu hóa suy luận — bao gồm lượng tử hóa (quantization) — để đáp ứng kỳ vọng về độ trễ. Chúng tôi đã đạt được điều này qua các giai đoạn sau:
Muse Glimmer đã được đánh giá theo các tiêu chuẩn đặt ra trong Khung mở rộng AI tiên tiến (Advanced AI Scaling Framework) của Meta và được thẩm định để phát hành trọng số mở trên tất cả các danh mục liên quan.
Được xây dựng cho các tác nhân: Những gì Muse Glimmer có thể làm
Việc xây dựng các tác nhân hiệu quả đòi hỏi các khả năng then chốt phải phối hợp với nhau để đạt được mục tiêu của người dùng. Muse Glimmer được đào tạo và đánh giá trên từng khía cạnh sau:
Hiệu suất
Chúng tôi đã đánh giá Muse Glimmer trên một loạt các bộ tiêu chuẩn để kiểm tra các khả năng đa dạng cần thiết cho hành vi tác nhân tự hành hiệu quả. So với Gemma4-31B và Qwen3.6-27B, Muse Glimmer thể hiện hiệu suất mạnh mẽ trong phân khúc kích thước của nó trên một số bộ tiêu chuẩn LLM được sử dụng rộng rãi.
Để biết thêm chi tiết về các đánh giá của chúng tôi, hãy xem báo cáo của chúng tôi.
Tối ưu hóa cho triển khai cục bộ
Một tác nhân cục bộ chỉ thực sự hữu ích nếu nó đủ nhanh để tạo cảm giác phản hồi tức thì. Một tác nhân mất vài phút để trả lời hoặc lập kế hoạch cho bước tiếp theo sẽ làm gián đoạn luồng công việc thực tế. Chúng tôi đã áp dụng hai tối ưu hóa để Muse Glimmer chạy ở tốc độ thực tế trên phần cứng phổ thông mà không làm giảm chất lượng.
Đưa mô hình vào thiết bị của bạn.
Ở độ chính xác đầy đủ, một mô hình 30 tỷ tham số sẽ yêu cầu hơn 55 GB bộ nhớ — lớn hơn nhiều so với bất kỳ GPU phổ thông nào cung cấp. Chúng tôi sử dụng các kỹ thuật lượng tử hóa để nén trọng số của mô hình xuống độ chính xác khoảng 4-bit, thu nhỏ mô hình ngôn ngữ xuống dưới 20 GB. Điều này để lại đủ khoảng trống cho bộ nhớ làm việc của mô hình ("KV cache"), bộ mã hóa nhận thức để hiểu hình ảnh, và trình dự đoán suy luận suy đoán (speculative decoding drafter) cùng chạy đồng thời trong phạm vi 24 GB hoặc 32 GB. Chúng tôi đã xác nhận rằng việc nén này gây ra sự suy giảm tối thiểu hoặc không đáng kể đối với các tác vụ tác nhân.
Tạo văn bản nhanh hơn thông qua suy luận suy đoán (Speculative Decoding).
Các mô hình ngôn ngữ thường tạo văn bản từng token một, điều này có thể gây chậm trong các chuỗi suy luận dài hoặc các lệnh gọi công cụ nhiều bước. Muse Glimmer đi kèm với một mô hình "drafter" nhẹ dựa trên DFlash — một mạng lưới đồng hành nhỏ đề xuất toàn bộ các khối token cùng một lúc. Sau đó, mô hình chính sẽ xác minh các đề xuất này song song, chấp nhận các token đúng và sửa các token sai. Kỹ thuật này cho phép Muse Glimmer tạo văn bản nhanh hơn đáng kể so với việc tạo từng token tiêu chuẩn mà vẫn giữ nguyên chất lượng đầu ra. Chúng tôi cung cấp các phiên bản drafter đã lượng tử hóa để giảm thiểu mức tiêu thụ bộ nhớ trong bản phát hành.
Kết quả:
Chúng tôi đo lường tốc độ của mô hình K-Quant-17GB cùng với drafter DFlash đã lượng tử hóa trên MacBook M4-Max, M5-Max và trên RTX-5090. Mô hình đủ nhanh cho các cuộc hội thoại trôi chảy và tương tác tác nhân thời gian thực, tất cả đều chạy hoàn toàn trên thiết bị của bạn.
Bắt đầu với Muse Glimmer ngay hôm nay
Muse Glimmer hiện đã có sẵn và bạn có thể tải xuống trọng số trên Hugging Face. Trong những ngày tới, hãy chạy nó cục bộ thông qua các đối tác như Ollama, LM Studio và Unsloth, triển khai nó với các khung làm việc biên bao gồm llama.cpp, ExecuTorch và MLX, phục vụ ở quy mô lớn với vLLM và SGLang, hoặc bắt đầu nhanh chóng thông qua các đối tác như Together AI, Fireworks AI và OpenRouter. Bạn thậm chí có thể tùy chỉnh nó cho trường hợp sử dụng của mình bằng cách tận dụng tính năng đào tạo TorchTitan của PyTorch để tùy chỉnh mô hình sâu hơn nữa.
Chúng tôi cũng đang làm việc với các đối tác bao gồm AMD, Arm, Dell, Intel và NVIDIA để tối ưu hóa hiệu suất trên các thiết bị. Ngoài ra, chúng tôi đang phát hành tài liệu để các nhà phát triển có đủ tài nguyên cần thiết để bắt đầu và xây dựng một cách có trách nhiệm với Muse Glimmer. Điều này bao gồm hướng dẫn thiết lập các khung tùy chỉnh, giúp việc bắt đầu xây dựng và triển khai các tác nhân cá nhân ngay từ ngày đầu tiên trở nên dễ dàng hơn. Bạn có thể tìm hiểu thêm và tìm tài nguyên để xây dựng tại Trung tâm Nhà phát triển AI của Meta.
Công trình này được xây dựng dựa trên bề dày thành tích nghiên cứu AI mở của Meta, mở rộng nó sang lĩnh vực AI tác nhân và cung cấp cho các nhà phát triển quyền truy cập vào các khả năng tác nhân cục bộ. Như thường lệ, chúng tôi hoan nghênh phản hồi từ cộng đồng và rất nóng lòng được thấy những gì các nhà phát triển tạo ra với mô hình trọng số mở này.
Tải xuống mô hình trên HuggingFace Tài liệu dành cho nhà phát triển
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.