Artificial Intelligence News
85

Mô hình

Meta ra mắt Muse Glimmer: Đưa AI Agent mạnh mẽ lên GPU cá nhân

(giờ Việt Nam)

Tóm tắt AI

Meta vừa phát hành Muse Glimmer, mô hình 30 tỷ tham số cho phép chạy AI Agent cục bộ trên GPU phổ thông. Công cụ này hỗ trợ đắc lực cho việc lập trình, gọi hàm và đánh giá mô hình ngay trên thiết bị cá nhân.

Bản dịch AI

Meta Muse Glimmer brings local AI agents to consumer GPUs

Meta đang phát hành Muse Glimmer theo giấy phép Apache 2.0 dành cho các tác nhân AI cục bộ (local AI agents) có thể chạy trên GPU của người dùng phổ thông.

Superintelligence Labs của công ty đã phát hành trọng số của mô hình 30 tỷ tham số này trên Hugging Face. Meta cho biết các nhà phát triển có thể sử dụng nó cho việc lập trình cục bộ, gọi hàm (function calling), các tác nhân cục bộ và đánh giá LLM-as-a-judge.

Bản phát hành này nhắm đến một hạn chế vận hành mà các đội ngũ AI đang đối mặt: các mô hình lưu trữ trên đám mây cần truy cập mạng và cơ sở hạ tầng tập trung. Thay vào đó, Meta giới thiệu Muse Glimmer cho các khối lượng công việc đòi hỏi mô hình chạy trên thiết bị, bao gồm các tác nhân cá nhân có quyền truy cập vào lịch trình, tin nhắn, tệp tin và các ngữ cảnh riêng tư khác.

Meta Muse Glimmer dẫn đầu một số tiêu chuẩn đánh giá tác nhân (agent task benchmarks)

Các bài kiểm tra tiêu chuẩn của Meta cho thấy Muse Glimmer vượt trội hơn Gemma4-31B và Qwen3.6-27B trong 5 trên 8 tiêu chuẩn đánh giá tác nhân tổng quát. Mô hình đạt 75,5 điểm trên MCP Atlas. Gemma4-31B đạt 54,2 điểm và Qwen3.6-27B ghi nhận 62,5 điểm.

DeepSearch QA cũng cho kết quả tương tự. Meta báo cáo điểm số 74,6 cho Muse Glimmer, so với 61,7 của Gemma4-31B và 71,1 của Qwen3.6-27B. Thông báo được cung cấp xác định cả hai tiêu chuẩn này là các bài kiểm tra khả năng của một tác nhân trong việc làm việc với các khung (scaffolds) và hoàn thành các yêu cầu đa lượt.

Mô hình đạt 23,5 điểm trên τ²-Banking. Gemma4-31B ghi nhận 15,1 điểm. Qwen3.6-27B đạt 16,7 điểm.

Muse Glimmer cũng đạt 47,6 điểm trên WildClawBench, vượt qua mức 37,6 của Gemma4-31B và 43,2 của Qwen3.6-27B. Kết quả GAIA2 của nó đạt 43,3, so với lần lượt là 36,4 và 40,0.

Các điểm số tác nhân khác nghiêng về phía Qwen3.6-27B. Bảng của Meta cho thấy mô hình đó đạt 1.141 điểm trên GDPval-AA, so với 953 của Muse Glimmer và 811 của Gemma4-31B. Qwen3.6-27B cũng dẫn đầu SkillsBench với 46,6 điểm, trong khi Muse Glimmer ghi nhận 44,3.

OSWorld-Verified tạo ra khoảng cách lớn nhất trong nhóm này. Meta báo cáo 75,6 cho Qwen3.6-27B. Muse Glimmer đạt 65,9 và Gemma4-31B đạt 58,5.

Những bài kiểm tra này đo lường các tác vụ bị giới hạn. Chúng không chứng minh được cách một tác nhân cục bộ sẽ hoạt động sau khi một tổ chức kết nối nó với các tệp tin, lịch, hệ thống nhắn tin hoặc công cụ nội bộ của riêng họ.

Kết quả lập trình chia đều giữa Muse Glimmer và Qwen

Kết quả lập trình của Muse Glimmer cho thấy sự so sánh sít sao hơn. Mô hình dẫn đầu SWE-Bench Pro với số điểm 51,2. Meta báo cáo 36,9 cho Gemma4-31B và 50,2 cho Qwen3.6-27B.

SciCode tạo ra kết quả sát nút. Muse Glimmer đạt 43,6 điểm, nhỉnh hơn một chút so với 43,4 của Gemma4-31B. Qwen3.6-27B ghi nhận 39,8 điểm.

Qwen3.6-27B dẫn đầu hai đánh giá lập trình khác. Nó đạt 77,2 điểm trên SWE-Bench Verified, so với 76,0 của Muse Glimmer. TerminalBench 2.1 cho Qwen3.6-27B số điểm 60,7; Muse Glimmer đạt 51,7 và Gemma4-31B đạt 43,4.

Một tác nhân lập trình cục bộ làm được nhiều việc hơn là chỉ tạo mã. Nó cần một khung (scaffold) để quyết định các kho lưu trữ, terminal, môi trường thử nghiệm và lệnh nào mà mô hình có thể truy cập. Meta cho biết Muse Glimmer hỗ trợ OpenClaw và các mô hình điều phối tác nhân khác, với các khung tùy chỉnh được đề cập trong tài liệu dành cho nhà phát triển.

Một tổ chức đánh giá mô hình cho công việc phần mềm nên xác định các lệnh và kho lưu trữ khả dụng cho tác nhân trước khi đo lường mức độ thành công của tác vụ. Tài liệu được cung cấp mô tả việc huấn luyện thử lại (retry training) cho các lệnh gọi công cụ thất bại. Hành vi đó đòi hỏi sự kiểm soát đối với các lần thử lại, đặc biệt là khi một công cụ có thể thay đổi mã nguồn hoặc gọi một hệ thống bên ngoài.

Điểm số đa phương thức nghiêng về Qwen trong hầu hết các bài kiểm tra

Muse Glimmer chấp nhận văn bản và hình ảnh xen kẽ thông qua một bộ mã hóa nhận thức (perception encoder) chuyên dụng. Meta cho biết thiết kế này cho phép các tác nhân diễn giải ảnh chụp màn hình, biểu đồ và tài liệu như một phần của cuộc trò chuyện.

Biểu đồ tiêu chuẩn đặt Muse Glimmer dẫn đầu về Charxiv Reasoning. Điểm số của nó đạt 78,8, so với 77,7 của Gemma4-31B và 78,4 của Qwen3.6-27B.

Qwen3.6-27B dẫn đầu ScreenSpot Pro với 76,1 điểm. Muse Glimmer ghi nhận 75,4 và Gemma4-31B đạt 75,9. Cùng mô hình đó dẫn đầu OmniDocBench v1.5 với 77,8 điểm, so với 75,8 của Muse Glimmer và 72,5 của Gemma4-31B.

MMMU Pro tạo ra sự khác biệt nhỏ hơn. Meta liệt kê Muse Glimmer ở mức 74. Qwen3.6-27B đạt 75 và Gemma4-31B đạt 73.

Những kết quả này quan trọng đối với các đội ngũ đang cân nhắc các tác nhân hoạt động trên giao diện hình ảnh. Một mô hình đọc ảnh chụp màn hình có thể diễn giải những gì nó nhìn thấy, tuy nhiên việc kiểm thử cục bộ vẫn phải bao gồm quyền truy cập, bố cục hiển thị, định dạng tài liệu và các lỗi được trả về bởi các công cụ được kết nối.

Các số liệu an toàn cho thấy tỷ lệ tấn công thành công thấp hơn so với Qwen

Meta cũng báo cáo hai đánh giá liên quan đến an toàn: CI Memories và Siren AgentDojo. Biểu đồ sử dụng các thước đo khác nhau cho mỗi bài kiểm tra.

Trên CI Memories, Meta liệt kê tỷ lệ vi phạm là 26,4 cho Muse Glimmer và điểm bao phủ (coverage score) là 64,8. Gemma4-31B ghi nhận tỷ lệ vi phạm là 12,1 với độ bao phủ 53,0. Qwen3.6-27B ghi nhận tỷ lệ vi phạm là 53,4 và độ bao phủ 66,9.

Kết quả Siren AgentDojo sử dụng tỷ lệ tấn công thành công và tiện ích (utility). Meta cho Muse Glimmer tỷ lệ tấn công thành công là 28,4 và điểm tiện ích là 94,2. Gemma4-31B đạt 25,6 về tỷ lệ tấn công thành công, với tiện ích là 90,8. Qwen3.6-27B ghi nhận 40,3 và 92,7.

Kết quả suy luận tổng quát bổ sung ngữ cảnh cho các tuyên bố về tác nhân

Muse Glimmer dẫn đầu 4 trong số 6 bài kiểm tra về khả năng và suy luận tổng quát trong bảng so sánh của Meta. Nó đạt 77,0 điểm trên IFBench. Gemma4-31B ghi nhận 76,0 và Qwen3.6-27B đạt 70,8.

Điểm AIME 2026 là 94,7 cho Muse Glimmer. Meta báo cáo 89,2 cho Gemma4-31B và 94,1 cho Qwen3.6-27B. Trên AA-LCR, Muse Glimmer đạt 80,0, dẫn trước mức 68,3 và 73,3.

Mô hình cũng dẫn đầu Beam 128K với 65,1 điểm. Qwen3.6-27B đạt 63,0. Gemma4-31B ghi nhận 58,2.

Gemma4-31B dẫn đầu GPQA Diamond với 85,7 điểm. Muse Glimmer đạt 83,5, theo sau là Qwen3.6-27B với 84,2. Gemma4-31B cũng giành điểm cao nhất trong Humanity’s Last Exam, Text No Tools, với 23,6; Muse Glimmer đạt 22,0.

Không có mô hình nào dẫn đầu mọi bài kiểm tra. Thay vào đó, kết quả của Meta cho thấy Muse Glimmer cạnh tranh sít sao với hai mô hình có kích thước tương đương trên một tập hợp hỗn hợp các đánh giá về tác nhân, lập trình, hình ảnh, an toàn và suy luận.

Giới hạn bộ nhớ định hình thiết kế triển khai cục bộ

Meta cho biết một mô hình 30 tỷ tham số với độ chính xác đầy đủ sẽ yêu cầu hơn 55 GB bộ nhớ. Thay vào đó, Muse Glimmer sử dụng lượng tử hóa trọng số khoảng 4-bit, giảm mô hình ngôn ngữ xuống dưới 20 GB.

Việc phân bổ đó để lại bộ nhớ cho KV cache. Mô hình cũng cần không gian cho bộ mã hóa nhận thức và bộ soạn thảo suy luận suy đoán (speculative-decoding drafter). Meta nhắm đến mức bộ nhớ 24 GB hoặc 32 GB cho các thành phần này.

Công ty cho biết bộ soạn thảo dựa trên DFlash đề xuất các khối token để mô hình chính xác minh song song. Meta cho biết điều này giúp tăng tốc độ tạo văn bản so với đầu ra từng token tiêu chuẩn và giữ nguyên chất lượng đầu ra. Bài đăng được cung cấp không bao gồm các số liệu về token mỗi giây, kích thước prompt, dữ liệu năng lượng hoặc kết quả đồng thời.

Meta đã thử nghiệm phiên bản K-Quant-17GB của mình với bộ soạn thảo DFlash đã được lượng tử hóa trên phần cứng MacBook M4-Max, MacBook M5-Max và RTX-5090. Họ mô tả trải nghiệm thu được là phù hợp cho cuộc trò chuyện trôi chảy và tương tác tác nhân theo thời gian thực.

Các trọng số công khai có sẵn thông qua Hugging Face. Meta cho biết các tích hợp với llama.cpp, MLX và ExecuTorch sẽ ra mắt trong những ngày tới.

Abstract stars as Meta is releasing Muse Glimmer under an Apache 2.0 licence for local AI agents that can run on a consumer GPU.Company logo of the social media platform as every post you see, every Reel that autoplays, and every ‘Explore’ page suggestion on Instagram is now decided by its AI system.
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Artificial Intelligence News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.