Tin ngành
Meta ra mắt Muse Glimmer: Mô hình đa phương thức mã nguồn mở chạy cục bộ
(giờ Việt Nam)
Tóm tắt AI
Meta vừa giới thiệu Muse Glimmer, mô hình AI đa phương thức thế hệ mới hỗ trợ tác vụ tự hành (agentic) và có thể chạy trực tiếp trên thiết bị cá nhân, tiếp tục cam kết thúc đẩy hệ sinh thái mã nguồn mở.
Bản dịch AI
Quay lại các bài viết
Tin tuyệt vời từ những "cây đa cây đề" trong lĩnh vực LLM mã nguồn mở! Muse Glimmer, được ra mắt hôm nay, là mô hình đa phương thức mới của Meta, được thiết kế đặc biệt cho các trường hợp sử dụng tác nhân (agentic) cục bộ. Được chưng cất (distilled) từ Muse xuống còn 30 tỷ tham số và phát hành theo giấy phép Apache 2.0, mô hình này rất lý tưởng để triển khai cục bộ nhằm đảm bảo quyền riêng tư, giảm chi phí hoặc đơn giản là để vọc vạch. Nó hướng tới các ứng dụng chú trọng quyền riêng tư như lập trình, phân tích tài liệu, trợ lý cá nhân, hoặc các thiết lập tương tự như Claw hay Hermes.
Để ăn mừng, chúng tôi đã hỗ trợ ngay từ ngày đầu (day-0) cho Muse Glimmer trong các thư viện transformers, llama.cpp, vLLM, Inference Endpoints và các thư viện khác. Chúng tôi đã xây dựng một vài thứ thú vị và giải thích các phát hiện của mình trong bài blog này. Hãy xem các bản demo bên dưới để lấy cảm hứng. Bạn có thể tìm thấy tất cả các mô hình Muse Glimmer trong bộ sưu tập này.
Kiến trúc
Muse Glimmer là một mô hình dày (dense) với 30 tỷ tham số bao gồm:
Ngoài VLM chính, còn có một trình dự thảo (drafter) giải mã suy đoán (speculative decoding) được triển khai trên DFlash. Việc sử dụng mô-đun này là tùy chọn và nó có thể cung cấp tốc độ tạo văn bản nhanh hơn nhiều để đổi lấy một chút chi phí bộ nhớ. Chúng tôi nhận thấy trình dự thảo này đặc biệt phù hợp với việc tạo nội dung có cấu trúc như lập trình.
Bộ giải mã văn bản (Text Decoder)
Mô hình ngôn ngữ sử dụng các thành phần kiến trúc sau:
Bộ mã hóa nhận thức (Perception Encoder)
Muse Glimmer sử dụng một bộ mã hóa hình ảnh để xử lý cả hình ảnh và video. Không giống như các bộ mã hóa thị giác tương đối nhỏ được sử dụng trong các VLM khác, đây là một mô hình lớn với 2 tỷ tham số kiểu ViT được thiết kế dựa trên kiến trúc Perception Encoder. Perception Encoder trước đây đã được Meta giới thiệu như một nền tảng (backbone) cho nhiều tác vụ không gian và đa phương thức hạ nguồn. Bộ mã hóa chia hình ảnh thành các bản vá (patch) với hình dạng 2 khung hình x 3 kênh x 14 x 14, và truyền chúng qua một lớp tuyến tính để chiếu (projection). Một nhúng vị trí tuyệt đối nội suy từ bảng vị trí đã học sau đó được thêm vào các nhúng này. Các dữ liệu này sau đó được gửi đến tháp thị giác (vision tower) bao gồm 50 lớp và các MLP GELU. Tương tự như mô hình ngôn ngữ, mô hình chú ý bao gồm ba lớp chú ý cửa sổ theo sau bởi một lớp chú ý đầy đủ. Bên trong các lớp chú ý, 2D RoPE được áp dụng cho các truy vấn (queries) và khóa (keys).
Sau transformer, pixel shuffle kết hợp các nhóm 2x2 của các token không gian lân cận, giúp giảm số lượng token hình ảnh đi 4 lần mà không làm mất đi các kênh của chúng. Các đặc trưng đã hợp nhất sau đó được chiếu vào không gian nhúng chung của bộ giải mã văn bản.
Video được xử lý qua cùng một bộ mã hóa theo từng khung hình, trong đó mỗi khung hình được chuyển đổi thành các bản vá (có hình dạng [batch, temporal groups, grid height, grid width, 2 frames, 3 channels, 14, 14]). Bộ xử lý nhắm mục tiêu 2 khung hình mỗi giây và giới hạn clip ở mức 96 khung hình được lấy mẫu đều khắp video. Bộ xử lý tạo ra các trình giữ chỗ video có gắn dấu thời gian, xen kẽ văn bản với khung hình, ví dụ: “Time: 0.0s <|video|> x N”, trong đó các nhúng video cuối cùng được thay thế trước lớp chiếu cuối cùng.
Transformers
Hãy nâng cấp transformers lên phiên bản mới nhất để có thể sử dụng Muse Glimmer.
Muse Glimmer đi kèm với hỗ trợ day-0 trong transformers, cho cả mô hình chính và trình dự thảo giải mã suy đoán. Bạn có thể sử dụng các lớp AutoModelForMultimodalLM và AutoProcessor để tải mô hình và bộ xử lý.
Cùng một đoạn mã chạy không thay đổi trên các GPU NVIDIA (CUDA), AMD (ROCm) và Intel (XPU), device_map="auto" sẽ đặt mô hình trên bất kỳ bộ tăng tốc nào khả dụng.
Suy luận chỉ văn bản (Text-only Inference)
Sau khi tải mô hình, bạn có thể thực hiện suy luận chỉ văn bản với nó như sau.
Nhắc mô hình (Prompting) với hình ảnh và văn bản
Chúng ta sẽ cần torchvision để có thể sử dụng hình ảnh và văn bản.
Muse Glimmer chấp nhận hình ảnh làm đầu vào, như được minh họa tại đây:
Gọi công cụ đa phương thức (Multimodal tool calling)
Muse Glimmer có thể thực hiện gọi công cụ đa phương thức, đây là cách bạn có thể thực hiện. Trong ví dụ dưới đây, chúng tôi yêu cầu mô hình gọi công cụ thời tiết dựa trên thành phố trong hình ảnh.
Phát hiện đối tượng (Object Detection)
Bạn có thể sử dụng Muse Glimmer để thực hiện phát hiện đối tượng mở trong hình ảnh như sau.
Suy luận video (Video Inference)
Để làm việc với video, chúng tôi khuyên bạn nên cài đặt torchcodec vào môi trường.
Muse Glimmer có thể trả lời các câu hỏi phức tạp về video không có âm thanh. Bạn có thể thực hiện suy luận video như sau, đây là một ví dụ từ VideoMME2, tiêu chuẩn đánh giá trả lời câu hỏi video phổ biến nhất.
Llama.cpp
Muse Glimmer đi kèm với hỗ trợ day-0 cho llama.cpp. Meta đã phân phối các bản lượng tử hóa (quants) đã hiệu chuẩn trong repo này, và Unsloth cũng đang phát hành các bản lượng tử hóa được tối ưu hóa. Giải mã suy đoán DFlash cũng được hỗ trợ. Bạn có thể sử dụng tệp nhị phân llama được xây dựng sẵn để khởi động máy chủ llama hoặc CLI. Để cài đặt llama.cpp, hãy chạy
Sau đó, bạn có thể khởi động máy chủ như sau.
Sau khi máy chủ đã khởi động, bạn có thể truy cập localhost:8080 để trò chuyện với WebUI tích hợp sẵn.
TODO: Chèn video webui với mô hình này
Bạn cũng có thể truy vấn máy chủ như sau.
Bạn cũng có thể sử dụng máy chủ llama với các tác nhân lập trình như Pi.
Giải mã suy đoán (Speculative Decoding)
DFlash sử dụng mô hình dự thảo block-diffusion nhẹ để cung cấp cùng kết quả đầu ra với tốc độ tăng thêm trong giai đoạn giải mã. Transformers và llama.cpp hỗ trợ trình dự thảo DFlash của Muse Glimmer ngay từ ngày đầu.
Dưới đây, bạn có thể thấy cách giải mã suy đoán có thể tăng tốc độ tạo văn bản trong các thiết lập thực tế. Video cho thấy llama.cpp webui với DFlash ở bên trái và quá trình tạo thông thường ở bên phải.
### Giải mã suy đoán với transformers
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.