Nghiên cứu
YuE2: Đột phá trong việc hợp nhất tạo nhạc biểu tượng và âm thanh chất lượng cao
(giờ Việt Nam)
Tóm tắt AI
YuE2 là mô hình Mixture-of-Transformers tiên phong kết hợp lập kế hoạch biểu tượng với tạo âm thanh, giúp kiểm soát tốt hơn giai điệu, hòa âm và cấu trúc bài hát, vượt qua các tiêu chuẩn hiện có trên WildSongBench.
Chính văn · Bản dịch AI
Tác giả: Ruibin Yuan, Jiahao Pan, Junyan Jiang, Zhiyue Wu, Ziya Zhou, Jiankai Sun, Yizhi Li, Ge Zhang, Yicheng Gu, Zeyue Tian, Junyu Dai, Hanfeng Lin, Kai Li, Shangda Wu, Xuanjie Liu, Jiaming Wang, Zihan Liu, Yue Wang, Yinghao Ma, Hanzhi Yin, Kangrui Chen, Xinyue Zhang, Ziyang Ma, Mengqi Liao, Hejia Zhao, Guowei Huang, Chao Yan, Lei Ke, Jianwei Yu, Bei Liu, Joe Guo, Liumeng Xue, Gus Xia, Wei Xue, Yike Guo
Tóm tắt: Các mô hình ký hiệu (symbolic models) làm rõ nét giai điệu, hòa âm, nhịp điệu và cấu trúc nhưng thường dừng lại trước khi tạo ra bản ghi âm hoàn chỉnh; các mô hình âm thanh tạo ra bài hát hoàn chỉnh nhưng lại để phần sáng tác ở dạng ẩn. Chúng tôi giới thiệu YuE2, mô hình hợp nhất việc tạo nhạc bằng ký hiệu và âm thanh với chất lượng tiên phong thông qua lập kế hoạch ký hiệu. Một mô hình Mixture-of-Transformers (MoT) dạng AR-NAR duy nhất trước tiên sẽ viết một bản phổ có thể đọc được để xác định giai điệu và hòa âm, mở rộng nó thành các token âm nhạc ngữ nghĩa, và hiện thực hóa thành âm thanh bài hát hoàn chỉnh. Trong các so sánh sử dụng cùng một checkpoint, các chuyên gia ưu tiên lập kế hoạch ký hiệu về chất lượng tổng thể và tính nhạc, với 49,3% lượt ưu tiên so với 34,6% khi không có lập kế hoạch. Các chuyên gia cũng ưu tiên mô hình hợp nhất này hơn so với việc sử dụng riêng biệt mô hình ngôn ngữ và diffusion Transformer. Trên WildSongBench, YuE2 đạt 6,73 điểm về SongBench Global Avg, vượt qua tất cả các mô hình cơ sở công khai được đánh giá. Khi chọn từ tám ứng viên (best-of-8), YuE2 đạt 6,96 điểm, mức trung bình cao nhất được ghi nhận trong tất cả các hệ thống được đánh giá. Việc nghe thẩm định bởi chuyên gia cũng xác lập tính cạnh tranh của nó với các trình tạo bài hát độc quyền, ưu tiên best-of-8 hơn Suno v4.5 và đạt được sự ưu tiên gần như cân bằng so với Suno v5. Để học quy trình tạo nhạc này từ các bản ghi âm mà không cần bản phổ căn chỉnh, chúng tôi giới thiệu MERT2 và SheetSage2 để cung cấp sự giám sát về ngữ nghĩa và ký hiệu. MERT2 thiết lập một trạng thái nghệ thuật mới trong học biểu diễn âm nhạc, vượt qua các kết quả tốt nhất trước đó trên 14 trong số 15 chỉ số MARBLE; SheetSage2 dẫn đầu 12 trong số 15 cặp chỉ số chuẩn trong so sánh phiên âm bản nhạc (lead-sheet) của chúng tôi. Cùng một checkpoint đó có khả năng tuân theo các chỉnh sửa bản phổ trong khi vẫn bảo toàn phần lớn nội dung âm nhạc không bị chỉnh sửa và tạo ra các bản cover zero-shot mà không cần huấn luyện chuyên biệt cho việc cover. Bản phổ có thể đọc được của nó cũng cho phép chỉnh sửa âm nhạc bằng tác nhân (agentic music editing), với các mô hình ngôn ngữ bên ngoài chuyển đổi phản hồi của người dùng thành các bản sửa đổi cho tác phẩm.
| Bình luận: | 56 trang. Báo cáo kỹ thuật. Dự án: liên kết https này |
| Chủ đề: | Xử lý Âm thanh và Giọng nói (eess.AS); Học máy (cs.LG); Âm thanh (cs.SD) |
| Trích dẫn là: | arXiv:2609.33757 [eess.AS] |
| (hoặc arXiv:2609.33757v1 [eess.AS] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.33757 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử nộp bài
Từ: Ruibin Yuan [xem email] [v1] Chủ nhật, 27 tháng 9 năm 2026 16:55:13 UTC (2.132 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.