Mô hình
MiniMax ra mắt Music 3.0: Mô hình AI tạo nhạc toàn năng, hỗ trợ mã nguồn mở
(giờ Việt Nam)
Tóm tắt AI
MiniMax giới thiệu Music 3.0, mô hình AI thế hệ mới có khả năng sáng tác, phối khí và sản xuất trọn vẹn một bài hát dài tới 5 phút chỉ từ ý tưởng và lời bài hát.
Bản dịch AI

Hôm nay, chúng tôi giới thiệu MiniMax Music 3.0, mô hình tạo nhạc thế hệ tiếp theo của chúng tôi. Với một ý tưởng sáng tạo và phần lời bài hát tùy chọn, mô hình có thể sáng tác, phối khí, biểu diễn và sản xuất một bài hát hoàn chỉnh chỉ trong một lần tạo.
Music 3.0 tập trung vào các khía cạnh sáng tạo âm nhạc khó nắm bắt nhất bằng một câu lệnh (prompt) đơn giản: thấu hiểu ý đồ biểu đạt của người sáng tạo; duy trì ý đồ đó xuyên suốt một bài hát hoàn chỉnh dài tới năm phút; tái tạo nhạc cụ với độ rõ nét và chân thực vật lý; đồng thời tạo ra giọng hát nghe như được biểu diễn thực thụ thay vì tổng hợp.
Để đạt được điều này, chúng tôi đã thiết kế lại toàn bộ quy trình tạo nhạc—từ mô tả âm nhạc và mô hình ngôn ngữ đến kết xuất âm thanh. Các mô tả chi tiết theo thời gian giúp nắm bắt sự phát triển của cảm xúc, nhạc cụ và cách thể hiện giọng hát. Mô hình Hybrid-LM kết hợp toàn cục–cục bộ (global–local) giúp mô hình hóa đồng thời cấu trúc dài hạn và chi tiết âm thanh. Kỹ thuật lượng tử hóa vector dư đa lớp (Multi-layer residual vector quantization - RVQ), hợp nhất trạng thái ẩn (hidden-state fusion), flow matching và Flow-VAE giúp cải thiện hơn nữa độ trung thực của đầu ra. Tổng hợp lại, những tiến bộ này mang đến ba nâng cấp chính: diễn giải ý đồ sáng tạo chính xác hơn, các bản phối hoàn chỉnh và đa dạng hơn, cùng âm thanh rõ ràng, tự nhiên hơn.
Music 3.0: Kiến trúc kỹ thuật
Music 3.0 bao gồm ba thành phần cốt lõi liên kết với nhau: tokenizer, Hybrid-LM và synthesis stack. Chúng giải quyết lần lượt các vấn đề: cách biểu diễn thông tin âm nhạc, cách mô hình hóa cấu trúc dài hạn và chi tiết cục bộ, và cách tái tạo âm thanh với độ trung thực cao. Quy trình làm việc hoàn chỉnh được hiển thị bên dưới.

Multi-Layer RVQ: Tách biệt cấu trúc cốt lõi khỏi chi tiết âm thanh
RVQ tám lớp biểu diễn thông tin âm nhạc theo phân cấp. Lớp đầu tiên nắm bắt ngữ nghĩa và cấu trúc cốt lõi, trong khi bảy lớp còn lại dần dần mã hóa các phần dư âm thanh. Trong quá trình huấn luyện theo giai đoạn, lớp đầu tiên trước tiên học một khung thông tin ổn định; sau đó tất cả các codebook được huấn luyện cùng nhau để mô hình hóa âm thanh chi tiết. Thiết kế này cung cấp một biểu diễn rời rạc ổn định hơn cho việc dự đoán chuỗi dài và tránh quá tải cho một lớp token duy nhất với cả thông tin cấu trúc lẫn thông tin về độ trung thực.
Hybrid-LM: Mô hình hóa kết hợp cấu trúc toàn cục và âm thanh cục bộ
Global LLM 8B được khởi tạo từ Qwen3.5-8B và thực hiện dự đoán từng khung hình (frame-by-frame) các token ngữ nghĩa trong khi vẫn mô hình hóa ngữ cảnh toàn cục. Local LLM 0.6B được khởi tạo ngẫu nhiên sẽ dự đoán các token âm thanh trong khung hình dọc theo trục chiều sâu. Quá trình huấn luyện diễn ra theo hai giai đoạn: căn chỉnh toàn cục trước tiên thiết lập khả năng dự đoán ngữ nghĩa âm nhạc của Global LLM, theo sau là huấn luyện kết hợp toàn tham số của cả mô hình toàn cục và cục bộ. Sự hợp tác phân cấp này cho phép mô hình duy trì tính ổn định cấu trúc ở cấp độ bài hát trong khi vẫn giải quyết được chi tiết âm thanh trong từng khung hình.
Hidden-State Fusion: Từ dự đoán rời rạc đến kết xuất âm thanh liên tục
Các hệ thống thông thường thường đưa trực tiếp các token âm thanh rời rạc vào bộ giải mã (decoder). Thay vào đó, Music 3.0 hợp nhất các trạng thái ẩn liên tục từ Global LLM và Local LLM, sau đó sử dụng chúng để điều hướng mô-đun flow-matching 2.4B. Một Flow-VAE 123M sau đó sẽ giải mã âm thanh. Đường dẫn hoàn chỉnh là:
Các đặc trưng LLM đã hợp nhất → Flow matching → Trạng thái ẩn VAE → Bộ giải mã Flow-VAE → Âm thanh cuối cùng
Thiết kế này kết nối trực tiếp sự hiểu biết về cấu trúc của mô hình ngôn ngữ với khả năng tái tạo âm thanh của mô hình âm thanh thông qua các biểu diễn liên tục. Nó duy trì tính nhất quán dài hạn đồng thời cải thiện độ chính xác của phát âm, sự mạch lạc của nhạc cụ và độ trung thực của các chi tiết tinh vi.
Prompt người dùng
Lời bài hát
Bản demo
Jazz / soul Thượng Hải cổ điển với sự ấm áp nhẹ nhàng của lo-fi. Những đoạn thơ dịu dàng, hoài cổ mở ra một điệp khúc rạng rỡ, nhẹ nhàng, dẫn dắt bởi giọng nữ đầy cảm xúc với cách nhả chữ tiết chế, được hỗ trợ bởi tiếng piano êm dịu, đàn upright bass, tiếng trống chổi, các điểm nhấn kèn đồng ấm áp và bản phối mang không gian phòng thu cổ điển.
EDM giai điệu tương lai / progressive house. Những đoạn thơ suy tư về ký ức và danh tính kỹ thuật số xây dựng nên một điệp khúc đầy cảm hứng, bắt tai, với giọng hát chính giàu cảm xúc, các lớp synth tươi sáng, bass dồn dập, tiếng trống four-on-the-floor sắc nét, các kết cấu glitch tinh tế và bản phối festival rộng mở, bóng bẩy.
Progressive house / EDM, 126 BPM, giọng Si giáng trưởng. Những đoạn thơ hoài niệm và suy tư trỗi dậy thành một điệp khúc đầy thăng hoa, giải tỏa, với giọng nam tenor mượt mà, hơi thở, các lớp synth side-chained dồn dập, bass club mạnh mẽ, trống sắc nét và hiệu ứng vang hội trường rộng lớn.
Bright power pop / pop rock, 112 BPM, giọng Mi giáng trưởng. Những đoạn thơ hoài niệm, đắng cay ngọt bùi bùng nổ thành các điệp khúc đầy cảm xúc, dẫn dắt bởi giọng nữ mezzo-soprano trong trẻo với những quãng tám cao vút, trống mạnh mẽ, các lớp guitar dày, synth tinh tế và bản phối hiện đại, bóng bẩy.
Thấu hiểu ý đồ sáng tạo
Nhạc do AI tạo ra có thể nghe như một bài hát hoàn chỉnh nhưng vẫn chệch khỏi yêu cầu ban đầu. Các nhạc cụ được chỉ định có thể dần biến mất khỏi bản phối, đặc tính cảm xúc dự định có thể suy yếu khi bài hát phát triển, và phong cách giọng hát được yêu cầu có thể chỉ xuất hiện ở một đoạn thay vì duy trì nhất quán trong toàn bộ tác phẩm.
Music 3.0 giới thiệu một khung mô tả âm nhạc biểu cảm hơn. Thay vì tóm tắt toàn bộ tác phẩm bằng một nhãn toàn cục duy nhất, nó sử dụng Structured Captions (Chú thích có cấu trúc) để mô tả âm nhạc ở độ chi tiết thời gian tinh vi. Các chú thích này chỉ định thể loại, nhịp độ, số chỉ nhịp, giọng, mục đích sử dụng và đặc tính sản xuất, đồng thời theo dõi đường nét cảm xúc; sự xuất hiện và kết thúc của các nhạc cụ chính và phụ; sự phát triển của groove và năng lượng dải trầm; cũng như những thay đổi ở cấp độ đoạn về cách thể hiện giọng hát, hòa âm và hiệu ứng giọng hát.
Những mô tả này chuyển đổi các ấn tượng nghe chủ quan thành một khung phối khí chuyên nghiệp mà mô hình có thể học và thực hiện. Kết quả là, mô hình có thể chuyển đổi ngôn ngữ sáng tạo thành biểu đạt âm nhạc cụ thể chính xác hơn, duy trì bản sắc âm nhạc nhất quán khi bài hát phát triển, đồng thời vẫn đưa vào các biến đổi động cần thiết.
Để giúp việc sáng tạo âm nhạc chuyên nghiệp trở nên dễ tiếp cận hơn, chúng tôi cũng đã phát triển Hệ thống tăng cường Prompt dựa trên mẫu (Template-based Prompt Enhancement System). Hệ thống này chọn lọc ngôn ngữ phù hợp từ thư viện các mẫu Structured Caption và áp dụng thuật ngữ âm nhạc cũng như nguyên tắc phối khí đã được thiết lập để mở rộng mô tả đơn giản của người dùng thành một hướng dẫn chi tiết, mạch lạc về mặt âm nhạc. Do đó, người sáng tạo có thể kiểm soát chính xác mà không cần nắm vững từ vựng chuyên ngành—cho dù họ muốn một màn trình diễn unplugged thân mật, tiết chế; một bản nhạc R&B đêm khuya với tiếng hi-hat dồn dập và tiếng bass 808 sâu lắng; hay một bản nhạc không lời đậm chất điện ảnh phát triển từ sự tự sự đến cường độ lớn.
Prompt người dùng
Lời bài hát
Bản demo
Nhạc pop tiếng Trung ấm áp / bản ballad truyền thống Trung Hoa, 74 BPM, giọng La giáng trưởng. Sự hoài niệm dịu dàng mở ra một điệp khúc ăn mừng, với giọng nam baritone-tenor trưởng thành, tiếng đàn tranh (guzheng) tinh tế, bộ dây mềm mại, kết cấu acoustic nhẹ nhàng, rung âm (vibrato) biểu cảm và âm thanh phòng thu tự nhiên.
Pop rock hào hùng, 132 BPM, giọng Mi trưởng. Những đoạn thơ bay bổng, nhẹ nhàng xây dựng nên một điệp khúc tràn đầy adrenaline, với giọng nữ mezzo-soprano mạnh mẽ, những quãng tám cao vút, trống dồn dập, guitar dày, không gian lung linh và một đoạn bridge ngắn đầy bay bổng.
Baroque pop / emo rock, 162 BPM, giọng Mi giáng thứ. Một đoạn mở đầu trang nghiêm, u buồn dẫn đến đoạn kết bùng nổ âm thanh đầy uy nghi, với giọng nam baritenor kịch tính, gai góc, bộ dây dàn nhạc, đàn harpsichord, guitar méo tiếng, trống mạnh mẽ và một đoạn breakdown đầy thách thức.
Các bản phối hoàn chỉnh và đa dạng hơn
Thách thức của việc tạo bài hát dài không chỉ là tạo ra thời lượng dài hơn; mà là tạo ra sự tiến triển đáng tin cậy giữa các đoạn. Cảm xúc phải được xây dựng và giải tỏa, nhạc cụ phải xuất hiện, xếp lớp và rút lui đúng lúc, và các đoạn verse, chorus, bridge, và đoạn nhạc cụ phải phục vụ một định hướng thống nhất.
Music 3.0 giải quyết thách thức này ở hai cấp độ. Thứ nhất, các thẻ đoạn trong lời bài hát—như [intro], [verse], [pre-chorus], [chorus], [bridge], [instrumental], [solo] và [outro]—xác định cấu trúc vĩ mô của bài hát. Thứ hai, Structured Caption chỉ định sự phát triển cảm xúc, thay đổi nhạc cụ, cách thể hiện giọng hát, nền tảng nhịp điệu, âm sắc trang trí và hiệu ứng không gian ở từng giai đoạn, biến những gì thay đổi và thay đổi ở đâu thành một điều kiện tạo nhạc rõ ràng.
Ở cấp độ mô hình, Music 3.0 sử dụng Hybrid-LM hợp tác toàn cục–cục bộ. Global LLM 8B dự đoán các token ngữ nghĩa và cấu trúc cốt lõi theo từng khung hình và duy trì ngữ cảnh toàn bộ bài hát. Local LLM 0.6B dự đoán các token âm thanh dọc theo trục chiều sâu trong mỗi khung hình, cung cấp chi tiết âm thanh cục bộ. Sự phân chia trách nhiệm này duy trì tính ổn định theo thời gian cho các bài hát dài tới năm phút trong khi vẫn bảo toàn sự biến đổi phong phú trong từng đoạn riêng lẻ.
Prompt người dùng
Lời bài hát
Bản demo
Bài viết được AI dịch và tổng hợp tự động từ MiniMax: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.