IT Home
85

Mô hình

ByteDance ra mắt Seed Audio 1.0: Mô hình tạo âm thanh đa năng với khả năng kiểm soát thời gian chính xác

(giờ Việt Nam)

Tóm tắt AI

ByteDance vừa giới thiệu Seed Audio 1.0, mô hình tạo âm thanh hỗ trợ hơn 20 ngôn ngữ, cho phép kiểm soát chính xác tiến trình âm thanh và đạt tỷ lệ sử dụng thực tế trên 90%.

Bản dịch AI

Theo tin từ IT ngày 20 tháng 7, bộ phận Seed của ByteDance hôm nay đã chính thức ra mắt mô hình sáng tạo âm thanh Seed Audio 1.0. Hướng tới các kịch bản âm thanh toàn diện, mô hình này kết hợp nhiều yếu tố âm thanh như giọng nói, hiệu ứng âm thanh và âm thanh môi trường trong một khung thống nhất, cho phép thực hiện sáng tạo âm thanh cấp độ điện ảnh theo quy trình end-to-end.

Phía chính thức tuyên bố rằng, âm thanh không còn chỉ là phần bổ trợ cho hình ảnh mà có thể trực tiếp tham gia vào việc dẫn dắt câu chuyện, tạo ra cảm giác hình ảnh ngay trong tâm trí người nghe, đạt được trạng thái "nghe" tức là "thấy". Các khả năng cốt lõi của mô hình được thể hiện qua những khía cạnh sau:

Biên tập thống nhất nhiều yếu tố, hỗ trợ kiểm soát thời gian tinh vi: Chỉ với một câu lệnh (prompt), người dùng có thể biên tập đồng bộ các đoạn đối thoại mang cảm xúc cụ thể, hiệu ứng âm thanh quan trọng và âm thanh môi trường, đồng thời kiểm soát chính xác thời điểm xuất hiện của âm thanh trên dòng thời gian.

Kiểm soát phong cách âm sắc, ổn định trong thời gian dài: Hỗ trợ đầu vào bằng văn bản và âm thanh tham chiếu, duy trì tính nhất quán của nhân vật trong các đoạn âm thanh dài và các kịch bản kéo dài nhiều lần, đồng thời cùng một âm sắc cũng có thể thể hiện tự nhiên các giọng điệu và cảm xúc khác nhau.

Tạo âm thanh đa ngôn ngữ tự nhiên: Hỗ trợ tạo âm thanh cho hơn 20 ngôn ngữ, giọng nói của cùng một nhân vật có thể thể hiện cách phát âm, nhịp điệu và cách diễn đạt tự nhiên hơn tùy theo đặc điểm của từng ngôn ngữ.

Theo giới thiệu, về khả năng tạo âm sắc từ văn bản, Seed Audio 1.0 đã thể hiện ưu thế vượt trội trong các bài đánh giá chủ quan AB, với tỷ lệ sử dụng được và tỷ lệ xuất sắc tăng lên đáng kể.

Về khả năng tạo âm thanh đa kịch bản, phía chính thức đã thử nghiệm trên các lĩnh vực như điện ảnh, chương trình truyền hình, phim ngắn, hoạt hình, hội thoại podcast, livestream bán hàng, sáng tạo nội dung mạng, kịch nói và tổng hợp giọng nói. Kết quả cho thấy, tỷ lệ sử dụng được của âm thanh trong hầu hết các kịch bản đã đạt trên 90%.

Đối với khả năng tạo âm thanh đa ngôn ngữ, về độ tự nhiên của âm thanh, MOS (Mean Opinion Score) của hầu hết các ngôn ngữ đều vượt quá 4 điểm, chất lượng âm thanh đã đạt mức xuất sắc; về khả năng tuân thủ chỉ dẫn trong tạo âm thanh phức tạp, ngoại trừ tiếng Việt, MOS của các ngôn ngữ còn lại đều cao hơn 3,5 điểm, cho thấy Seed Audio 1.0 đã sở hữu khả năng tuân thủ chỉ dẫn đa ngôn ngữ khá mạnh mẽ.

Hiện tại, Seed Audio 1.0 đã có mặt trên trung tâm trải nghiệm Volcano Ark, IT đính kèm liên kết liên quan:

https://seed.bytedance.com/seedaudio1_0

Tuyên bố quảng cáo: Các liên kết chuyển hướng bên ngoài có trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian sàng lọc, kết quả chỉ mang tính chất tham khảo, tất cả các bài viết của IT đều bao gồm tuyên bố này.

ByteDanceSeed AudioAI tạo âm thanhCông nghệ AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.