MarkTechPost
92

Mô hình

MiniMax ra mắt MiniMax-Music3: Mô hình AI tạo nhạc mã nguồn mở, sáng tác bài hát 5 phút từ văn bản

(giờ Việt Nam)

Tóm tắt AI

MiniMax giới thiệu MiniMax-Music3, mô hình AI tạo nhạc mã nguồn mở cho phép tạo các bản nhạc stereo 32kHz dài tới 5 phút dựa trên lời bài hát và mô tả cấu trúc chi tiết.

Bản dịch AI

MiniMax Releases MiniMax-Music3: An Open-Weights Music Model Generating Complete Five-Minute Songs From Lyrics and a Structured Caption

MiniMax đã phát hành MiniMax-Music3, một mô hình chuyển đổi văn bản thành âm nhạc (text-to-music) với trọng số mở. Mô hình này tiếp nhận hai đầu vào riêng biệt: lời bài hát có gắn thẻ phân đoạn và mô tả chi tiết về âm nhạc. Nó trả về một bài hát hoàn chỉnh dài tối đa năm phút trong một lần tạo duy nhất, dưới định dạng WAV stereo 32 kHz, 16-bit. Kiến trúc của mô hình kết hợp Hybrid-LM, bao gồm một Global LLM 8B và một Local LLM 0.6B, cùng với một ngăn xếp tổng hợp liên tục được xây dựng dựa trên flow matching và Flow-VAE. Trọng số, mã suy luận và ba lộ trình phục vụ (serving paths) có tài liệu hướng dẫn đã được phát hành ngay trong ngày.

Liệu mô hình này có thể triển khai được không?

Có, MiniMax đã công bố trọng số có thể sử dụng, mã suy luận và ba lộ trình phục vụ có tài liệu hướng dẫn ngay từ ngày đầu tiên, vì vậy đây là sản phẩm có thể triển khai ngay lập tức thay vì chỉ là bản xem trước nghiên cứu.

Kiến trúc

MiniMax-Music3 kết hợp một ngăn xếp tự hồi quy phân cấp (hierarchical autoregressive stack) với một lộ trình tổng hợp liên tục.

Bộ mã hóa (tokenizer) huấn luyện sử dụng tám lớp lượng tử hóa vector dư (residual vector quantization - RVQ). Lớp đầu tiên, semantic codebook, có 16.384 mục và chứa các ngữ nghĩa cũng như cấu trúc âm nhạc cốt lõi. Bảy codebook âm thanh còn lại mỗi lớp có 1.024 mục và mã hóa các chi tiết dư. Quá trình huấn luyện tối ưu hóa lớp ngữ nghĩa trước, sau đó mới tối ưu hóa cả tám lớp cùng nhau.

Hybrid-LM phân chia bài toán mô hình hóa. Một Global LLM 8B dự đoán khung codebook RVQ đầu tiên theo từng khung hình và duy trì cấu trúc dài hạn; một Local LLM 0.6B dự đoán các codebook còn lại trong mỗi khung hình. Thẻ mô hình (model card) và giấy phép nêu rằng Global LLM được khởi tạo từ Qwen3-8B; tuy nhiên bài đăng của MiniMax Research lại ghi là Qwen3.5-8B, vì vậy hãy coi checkpoint cơ sở chính xác vẫn chưa được xác định rõ ràng.

Giai đoạn tổng hợp là lựa chọn thiết kế thú vị hơn. Thay vì giải mã từ các token RVQ rời rạc, MiniMax hợp nhất các trạng thái ẩn cuối cùng của cả hai LLM và sử dụng chúng để điều phối một mô-đun flow-matching 2.4B, mô-đun này ánh xạ vào một không gian tiềm ẩn được giải mã bởi một Flow-VAE 123M kế thừa từ MiniMax Speech. Khi suy luận, bộ giải mã tokenizer rời rạc sẽ không được tải.

Kiểm soát hai đầu vào

Lời bài hát chứa các từ và thẻ phân đoạn trên các dòng riêng biệt: [Intro], [Verse], [Pre-Chorus], [Chorus], [Post-Chorus], [Bridge], [Instrumental], [Solo], [Outro]. Một Structured Caption riêng biệt chứa Siêu dữ liệu toàn cục (Global Metadata), Chi tiết giọng hát (Vocal Details) và Hòa âm (Arrangement). MiniMax cũng cung cấp một kỹ năng tác nhân (agent skill) viết lại mô tả âm nhạc giúp mở rộng mô tả ngắn thành định dạng ba phần đó ở chế độ ngoại tuyến.

Công cụ giải thích tương tác

Cách vận hành

Ba lộ trình đã được ghi chép tài liệu. SGLang-Omni là máy chủ tham chiếu; trang GitHub chỉ định sử dụng hai GPU CUDA, trong đó GPU 0 chạy Qwen3 và tạo tự hồi quy RVQ, còn GPU 1 chạy flow matching và giải mã DAV. Đường ống mô-đun (modular pipeline) của diffusers chiếm dưới 24 GB VRAM ở độ chính xác đầy đủ, khoảng 22 GB với tính năng tự động offload CPU, và giảm xuống còn 8 GB với tính năng offload nhóm cấp lá (leaf-level group offloading). ComfyUI có một mẫu Text to Music gốc sử dụng trọng số FP16/INT8 đã được đóng gói lại từ Comfy-Org.

Những điểm chính cần lưu ý

Hãy xem mô hình trên HF và GitHub Repo. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia ML SubReddit với hơn 150 nghìn thành viên của chúng tôi cũng như đăng ký nhận Bản tin (Newsletter). Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, Hugging Face Page, Sản phẩm mới, Hội thảo trực tuyến (Webinar), v.v. của bạn? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về các tin tức học máy (machine learning) và học sâu (deep learning) vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo công chúng. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với độc giả.

MiniMaxAI tạo nhạcMã nguồn mởGenerative AISáng tạo nội dung
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.