MarkTechPost
92

Mô hình

Meta ra mắt Muse Glimmer: Mô hình 30 tỷ tham số chạy mượt trên GPU cá nhân

(giờ Việt Nam)

Tóm tắt AI

Meta vừa phát hành Muse Glimmer, mô hình đa phương thức 30 tỷ tham số mã nguồn mở, cho phép chạy cục bộ trên GPU 24GB nhờ kỹ thuật nén 4-bit và giải mã suy đoán DFlash, giúp tăng tốc độ xử lý lên gấp 3,1 lần.

Bản dịch AI

Meta AI Releases Muse Glimmer: A 30B Open-Weights Agentic Model That Runs on One Consumer GPU

Meta vừa ra mắt Muse Glimmer, một mô hình đa phương thức với 30 tỷ tham số được chưng cất từ Muse Spark. Mô hình này được tinh chỉnh cho các quy trình làm việc của tác nhân cục bộ (local agent) luôn hoạt động và được phát hành theo giấy phép Apache 2.0. Một mô hình 30B thông thường cần hơn 55 GB bộ nhớ ở độ chính xác đầy đủ. Meta đã nén nó xuống khoảng 4-bit, sau đó thêm cơ chế giải mã suy đoán cấp khối (block-level speculative decoding) để mô hình phản hồi đủ nhanh, phù hợp để chạy bên trong vòng lặp của một tác nhân thực tế. Kết quả là mô hình có thể chạy trên một GPU phổ thông hoặc máy Mac mà không cần gọi mạng.

Liệu nó có thể triển khai được không?

Có, các trọng số được mở theo giấy phép Apache 2.0. Bộ sưu tập trên Hugging Face bao gồm các trọng số BF16, GGUF k-quants, các bản dựng ExecuTorch và trình soạn thảo DFlash. Tự lưu trữ (self-hosting) là phương án khả thi ngay từ ngày đầu.

Mô hình và đào tạo

Muse Glimmer là một mô hình transformer nhân quả dày đặc (dense causal transformer) với bộ mã hóa nhận thức chuyên dụng. Tổng số tham số là khoảng 30B, bao gồm cả tháp thị giác (vision tower). Cơ chế chú ý truy vấn nhóm (Grouped-query attention) sử dụng 32 đầu truy vấn và 2 đầu KV. Cơ chế chú ý lặp lại theo mô hình [Cục bộ, Cục bộ, Cục bộ, Toàn cục] với cửa sổ trượt 2.048. RoPE chỉ được áp dụng cho các lớp cục bộ với theta là 500.000. Phía thị giác là một bộ mã hóa nhận thức ViT-G/14 khoảng 1,8B, chấp nhận tối đa 4.096 token hình ảnh mỗi ảnh. Độ dài ngữ cảnh là 131.072+, từ vựng gồm 202.048 token và thời điểm cắt dữ liệu tri thức là ngày 4 tháng 1 năm 2026. Đầu vào là văn bản và hình ảnh; đầu ra là văn bản. Âm thanh không được hỗ trợ và video được xử lý dưới dạng các khung hình riêng lẻ.

Quá trình đào tạo diễn ra trong ba giai đoạn:

Đưa mô hình 30B lên phần cứng phổ thông

Ở độ chính xác đầy đủ, mô hình cần hơn 55 GB bộ nhớ. Meta nén các trọng số xuống độ chính xác khoảng 4-bit, giúp mô hình ngôn ngữ giảm xuống dưới 20 GB. Điều này tạo ra khoảng trống bên trong giới hạn 24 GB hoặc 32 GB. Bộ nhớ đệm KV, bộ mã hóa nhận thức và trình soạn thảo sẽ chia sẻ phần dung lượng này. Hai bản dựng lượng tử hóa được phát hành. K-Quant-Dynamic nhắm đến VRAM 32 GB với mức suy giảm trung bình 0,2%. K-Quant-17GB nhắm đến VRAM 24 GB với mức suy giảm 1,0%. Mức suy giảm được tính trung bình trên các chỉ số độ chính xác qua 15 tiêu chuẩn đánh giá phổ biến.

Tốc độ tạo văn bản đến từ DFlash, một trình soạn thảo khuếch tán khối (block-diffusion drafter) dự đoán 16 token trong một lần truyền xuôi (forward pass). Mô hình chính xác minh khối đó song song. Trình soạn thảo sử dụng 5 lớp, cơ chế chú ý cửa sổ trượt tại 2.048 và 32 đầu truy vấn / 8 đầu KV. Meta đã đo lường K-Quant-17GB ở kích thước batch là 1 với giải mã tham lam (greedy decoding). Trên RTX 5090, thông lượng tăng từ 74,9 lên 233,4 tok/s, nhanh gấp 3,1 lần. Apple M5 Max tăng từ 26,6 lên 50,2 tok/s và M4 Max từ 23,7 lên 37,8 tok/s.

Các tiêu chuẩn đánh giá

Meta so sánh Muse Glimmer với Gemma4-31B và Qwen3.6-27B ở chế độ tư duy. Nó dẫn đầu trên MCP Atlas với 75,5 điểm, so với 54,2 và 62,5. Nó cũng dẫn đầu trên DeepSearch QA với 74,6, Gaia2 với 43,3 và SWE-Bench Pro với 51,2. Điểm số suy luận như sau: AIME 2026 đạt 94,7, IFBench đạt 77,0, AA-LCR đạt 80,0. Qwen3.6-27B vẫn dẫn trước trên OSWorld-Verified với 75,6 so với 65,9. Nó cũng dẫn đầu TerminalBench 2.1 với 60,7 và SWE-Bench Verified với 77,2. Mô hình này nhất quán: Muse Glimmer thắng về khả năng điều phối tác nhân và suy luận, nhưng tụt lại phía sau trong các tác vụ sử dụng máy tính và dòng lệnh.

Về độ an toàn, tỷ lệ tấn công thành công của Siren AgentDojo là 28,4 với mức độ hữu ích 94,2. Meta tuyên bố mô hình không đáp ứng định nghĩa Frontier AI trong Khung mở rộng AI nâng cao (Advanced AI Scaling Framework) của họ. Nó xếp hạng rủi ro về hóa/sinh, mạng và mất kiểm soát ở mức trung bình hoặc thấp hơn.

Những điểm chính cần lưu ý

Hãy xem trọng số mô hình trên HF, các chi tiết và Blog của Meta. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML với hơn 150 nghìn thành viên của chúng tôi cũng như đăng ký nhận Bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, Trang Hugging Face, Phát hành sản phẩm hoặc Hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về các tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với độc giả.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.