IT Home ITHome
92

Mô hình

Alibaba ra mắt Qwen-Audio-3.0-TTS: Mô hình tổng hợp giọng nói đạt đỉnh bảng xếp hạng Artificial Analysis

(giờ Việt Nam)

Tóm tắt AI

Alibaba vừa trình làng Qwen-Audio-3.0-TTS với hai phiên bản Flash và Plus, hỗ trợ 16 ngôn ngữ và 20 phương ngữ cùng khả năng kiểm soát cảm xúc tinh vi, đạt chất lượng âm thanh 48KHz chuẩn phòng thu.

Bản dịch AI

Theo tin từ IT ngày 20 tháng 7, Alibaba Qwen hôm nay đã ra mắt mô hình lớn tổng hợp giọng nói Qwen-Audio-3.0-TTS, bao gồm phiên bản Flash hướng tới tương tác thời gian thực (độ trễ gói tin đầu tiên ở mức 300ms) và phiên bản Plus hướng tới khả năng tạo nội dung chất lượng cao.

Phía nhà sản xuất cho biết, mô hình mới đã đạt được những cải tiến mang tính hệ thống về khả năng kiểm soát nhãn chi tiết, tuân thủ chỉ dẫn freestyle, độ phủ đa ngôn ngữ và phương ngữ, cũng như tính ổn định trong các môi trường âm thanh phức tạp, giúp giọng nói tổng hợp chuyển mình từ "biết nói" sang "biết biểu cảm". Trên bảng xếp hạng uy tín toàn cầu Artificial Analysis, Qwen-Audio-3.0-TTS-Plus đã xuất sắc giành vị trí quán quân.

Theo giới thiệu, Qwen-Audio-3.0-TTS hỗ trợ nhúng các thẻ cấu trúc vào văn bản. Người dùng có thể trực tiếp chèn các thẻ như [gasp] (hít hơi), [giggles] (cười khúc khích), [angry] (giận dữ) vào văn bản để điều chỉnh chính xác tông giọng, cảm xúc và các chi tiết hơi thở.

Ngoài ra, mô hình này còn đi kèm thư viện giọng nói chất lượng cao, sẵn sàng sử dụng ngay (out-of-the-box), tích hợp các khả năng về đa ngôn ngữ, đa phương ngữ, kiểm soát chỉ dẫn và biểu cảm chi tiết thành các tài nguyên giọng nói có thể gọi trực tiếp. Các loại giọng nói theo phong cách chỉ dẫn, 20 loại phương ngữ, giọng nói kiểm soát chi tiết và hơn 14 ngôn ngữ ít phổ biến sẽ lần lượt được ra mắt. Đồng thời, chất lượng đầu ra âm thanh được nâng cấp từ 24KHz lên 48KHz, tương đương với việc nâng cấp từ chất lượng điện thoại và trợ lý ảo thông thường lên tiêu chuẩn phòng thu và lồng tiếng phim ảnh, với thời lượng tổng hợp giọng nói mỗi lần lên tới 3 phút.

Đối với các kịch bản đa ngôn ngữ toàn cầu, Qwen-Audio-3.0-TTS-Plus đã được tối ưu hóa chuyên biệt, bao phủ 16 ngôn ngữ bao gồm tiếng Trung, Anh, Nhật, Hàn, Đức... và bổ sung thêm tiếng Ả Rập, tiếng Việt, tiếng Mã Lai, tiếng Philippines; đồng thời hỗ trợ 20 loại phương ngữ như tiếng Quảng Đông, Trùng Khánh, Đông Bắc, Thiểm Tây, Thượng Hải, Tứ Xuyên, Vân Nam...

Qwen-Audio-3.0-TTS hiện đã được mở hoàn toàn, IT đính kèm đường dẫn:

Phiên bản Plus: https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-plus

Phiên bản Flash: https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-flash

Thông báo quảng cáo: Các liên kết chuyển hướng bên ngoài trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, giúp tiết kiệm thời gian chọn lọc, kết quả chỉ mang tính chất tham khảo. Tất cả các bài viết của IT đều bao gồm thông báo này.

AlibabaQwenTTSTổng hợp giọng nóiAI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home ITHome. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.