Mô hình
SGLang hỗ trợ Muse Glimmer: Tối ưu hóa suy luận cho tác vụ AI cục bộ
(giờ Việt Nam)
Tóm tắt AI
SGLang hợp tác cùng Meta Superintelligence Labs mang đến hỗ trợ Day-0 cho mô hình đa phương thức Muse Glimmer 30B, với khả năng xử lý ngữ cảnh lên tới 128k token.
Bản dịch AI
Chúng tôi rất vui mừng được hợp tác với Meta Superintelligence Labs để mang đến khả năng hỗ trợ Day-0 cho Muse Glimmer trên SGLang, với các tối ưu hóa chuyên biệt được thiết kế riêng cho suy luận hiệu năng cao của các quy trình làm việc tác nhân (agentic workflows) trên phần cứng cục bộ.
Các điểm nổi bật
Kiến trúc mô hình Muse Glimmer
Muse Glimmer là mô hình 30B, bao gồm một bộ giải mã văn bản dày đặc 27,9B, một ViT 1,9B và một bộ chiếu đa phương thức dựa trên GELU. Bộ giải mã văn bản có 52 lớp transformer. Mỗi lớp chứa cơ chế chú ý truy vấn nhóm (grouped-query attention) với 32 đầu truy vấn và hai đầu khóa-giá trị, theo sau là mạng truyền thẳng SwiGLU.
Cơ chế chú ý cửa sổ trượt (Sliding Window Attention)
Bộ giải mã sử dụng mô hình chú ý lai, xen kẽ ba lớp cửa sổ trượt 2.048 token với một lớp toàn trình tự (full-sequence) ở mỗi bước thứ tư để đạt hiệu quả. Việc kết hợp RoPE trên các cửa sổ cục bộ với NoPE trên các lớp chú ý toàn phần cho phép mô hình mở rộng độ dài ngữ cảnh vượt quá giới hạn huấn luyện ban đầu.
Hỗ trợ tính năng
Hỗ trợ Backend mở rộng cho phần cứng AI cục bộ
Muse Glimmer có thể được triển khai với SGLang trên nhiều loại phần cứng thường được các nhà phát triển sử dụng để xây dựng và chạy các tác nhân AI cục bộ, bao gồm các thiết bị Apple Silicon (Mac mini và MacBook Pro dòng M), GPU NVIDIA GeForce RTX 5090 và NVIDIA DGX Spark. Trên các nền tảng NVIDIA SM120, SGLang tận dụng các backend GEMM và FlashInfer đã được tối ưu hóa để đạt thông lượng suy luận cao, trong khi các thiết bị Apple Silicon sử dụng backend MLX gốc để cung cấp khả năng phục vụ cục bộ hiệu năng cao.
Suy luận suy đoán (Speculative Decoding) với DFlash
Để đạt được suy luận có độ trễ thấp, hãy sử dụng triển khai DFlash của SGLang:
Các tối ưu hóa gốc của SGLang
Muse Glimmer tương thích với nhiều tối ưu hóa gốc của SGLang, bao gồm bộ lập lịch có chi phí thấp (low-overhead scheduler), bộ nhớ đệm tiền tố RadixAttention và các biểu đồ CUDA có thể ngắt (breakable CUDA graphs). Chúng tôi cũng đã mang một số tối ưu hóa này, bao gồm bộ nhớ đệm tiền tố, sang backend SGLang MLX, cho phép đạt hiệu năng cạnh tranh trên Apple Silicon cho các khối lượng công việc tác nhân.
Các checkpoint BF16, NVFP4, GGUF và MLX 4-bit
Chúng tôi cung cấp các checkpoint Muse Glimmer ở nhiều định dạng khác nhau để đáp ứng nhu cầu của người dùng với các yêu cầu khác nhau về phần cứng, độ trung thực và hiệu năng hệ thống.
Các nhà phát triển cần độ trung thực tối đa của mô hình có thể chạy checkpoint BF16 gốc trên một GPU H100 duy nhất. Đường dẫn SM120 bao gồm công thức lượng tử hóa hỗn hợp NVFP4+MXFP8 khoảng 19,5 GB. Một checkpoint NVFP4 18 GB kết hợp với bộ suy đoán DFlash BF16 5 GB có thể chạy thoải mái trên một chiếc RTX 5090 duy nhất, cho phép triển khai hiệu năng cao trên các bộ tăng tốc NVIDIA GeForce RTX 5090 và DGX Spark.
Chúng tôi cũng cung cấp hai checkpoint GGUF. Định dạng nhỏ hơn là Q4KM với kích thước nhóm là 128. Checkpoint này cho phép tốc độ suy luận nhanh hơn và triển khai trên phần cứng có giới hạn bộ nhớ chặt chẽ hơn. Q4K-Dynamic mang lại chất lượng mô hình tốt hơn. Đối với các nhà phát triển làm việc trên thiết bị Apple Silicon, chúng tôi cung cấp các checkpoint GGUF đã đề cập ở trên dưới định dạng MLX.
Kết quả hiệu năng
Chúng tôi đã đo lường Muse Glimmer với SGLang trên bảy nền tảng, quét qua các kích thước batch từ 1 đến 8. Dưới đây là báo cáo về tính tương tác ở batch-1 (tok/s/người dùng) và tổng thông lượng đầu ra ở batch-8 (tok/s).
DFlash giúp tăng tính tương tác ở batch-1 từ 1,9–4,3 lần tùy thuộc vào nền tảng và độ chính xác: đạt 3,0 lần trở lên trên mọi cấu hình ngoại trừ đường dẫn GGUF trên RTX 5090 (đạt 1,9 lần). Mức tăng ở batch-8 nhỏ hơn và biến động nhiều hơn, dao động từ 1,4 đến 4,2 lần. Suy luận suy đoán hiện không khả dụng trên backend MLX.
Lời cảm ơn
Chúng tôi xin cảm ơn các đội ngũ tại Meta Superintelligence Labs và cộng đồng SGLang vì sự hợp tác trong việc mang đến khả năng hỗ trợ Day-0 cho Muse Glimmer trên SGLang.
Bài viết được AI dịch và tổng hợp tự động từ LMSYS: Blog (Chatbot Arena ). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.