Sản phẩm
Alibaba ra mắt Qwen-Audio-3.0-TTS: Mô hình chuyển văn bản thành giọng nói đa ngôn ngữ trên đám mây
(giờ Việt Nam)
Tóm tắt AI
Phòng thí nghiệm Tongyi của Alibaba vừa giới thiệu Qwen-Audio-3.0-TTS với hai phiên bản Flash (tốc độ cao) và Plus (chất lượng cao), hỗ trợ 16 ngôn ngữ thông qua nền tảng Alibaba Cloud Model Studio.
Bản dịch AI

Tongyi Lab của Alibaba vừa ra mắt Qwen-Audio-3.0-TTS, một hệ thống chuyển văn bản thành giọng nói (TTS) hướng tới mục tiêu sản xuất. Mô hình này được phát hành dưới hai phiên bản cùng dòng: Flash dành cho tương tác thời gian thực và Plus dành cho tạo nội dung chất lượng cao. Cả hai đều được cung cấp dưới dạng mô hình lưu trữ (hosted models) thông qua Alibaba Cloud Model Studio, thay vì dưới dạng trọng số có thể tải xuống.
Bản phát hành này tập trung vào bốn vấn đề mà các nhà phát triển thường gặp trong quá trình sản xuất: mở rộng phạm vi ngôn ngữ, kiểm soát phong cách ngôn ngữ tự nhiên, kiểm soát thẻ (tag) chi tiết và độ ổn định khi âm thanh tham chiếu không sạch. Qwen-Audio-3.0-TTS-Plus cũng xếp hạng nhất trên bảng xếp hạng Text-to-Speech độc lập của Artificial Analysis.
Hai phiên bản, một dòng sản phẩm
Hai cấp độ này phục vụ các công việc khác nhau. Flash được tinh chỉnh cho tương tác thời gian thực, với độ trễ gói tin đầu tiên ở mức 300 ms. Plus được tinh chỉnh cho việc tạo nội dung chất lượng cao, nơi sự tự nhiên và độ trung thực của âm sắc quan trọng hơn tốc độ.
Các ID mô hình là qwen-audio-3.0-tts-flash và qwen-audio-3.0-tts-plus. Cả hai đều được gọi thông qua giao thức truyền phát WebSocket hai chiều. API hỗ trợ các định dạng PCM, WAV, MP3 và Opus, với tốc độ lấy mẫu đầu ra lên tới 48 kHz. Hệ thống hỗ trợ truyền phát đầu vào và đầu ra, nhân bản giọng nói (voice cloning), Voice Design và kiểm soát bằng chỉ dẫn (instruction control). Alibaba cung cấp DashScope SDK cùng các ví dụ WebSocket thô bằng Python, Java, Go, C#, PHP và Node.js tại các khu vực Singapore và Bắc Kinh.
Cách thức xây dựng mô hình
Hệ thống dựa trên hai lựa chọn thiết kế chính.
Mô hình cũng xử lý việc tổng hợp văn bản dài trong một lần truyền (one-pass) lên đến 3 phút, các trường hợp chuẩn hóa văn bản khó và siêu phân giải vocoder cho đầu ra 48 kHz.
Hỗ trợ đa ngôn ngữ với 16 ngôn ngữ
Qwen-Audio-3.0-TTS hỗ trợ 16 ngôn ngữ: Ả Rập, Trung Quốc, Anh, Pháp, Đức, Indonesia, Ý, Nhật Bản, Hàn Quốc, Mã Lai, Bồ Đào Nha, Nga, Tây Ban Nha, Tagalog, Thái Lan và Việt Nam. Bảy trong số này là những ngôn ngữ mới được bổ sung so với dòng sản phẩm trước đó. Hệ thống cũng bao phủ 20 vùng phương ngữ tiếng Trung.
Về khả năng hiểu đa ngôn ngữ, dòng mô hình này đạt tỷ lệ lỗi từ/ký tự (WER/CER) tốt nhất ở 10 trong số 16 ngôn ngữ. Flash đạt WER/CER trung bình thấp nhất ở mức 3,87; Plus theo sát ở mức 3,96. Chỉ số này càng thấp càng tốt.
Về độ tương đồng giọng nói, Plus xếp hạng nhất trên tất cả 16 ngôn ngữ với điểm trung bình 82,75, theo sau là Flash với 80,44. Bản phát hành này cũng bổ sung một thư viện giọng nói cài sẵn được tuyển chọn trải dài trên 16 ngôn ngữ được hỗ trợ, giúp các đội ngũ có thể triển khai giọng nói ngay mà không cần phải thực hiện nhân bản trước.
Để kiểm soát chính xác, nhóm nghiên cứu đã nhúng các thẻ nội dòng (inline tags) trực tiếp vào văn bản mục tiêu. Bản phát hành bổ sung 86 thẻ nội dòng chi tiết để kiểm soát cục bộ ở cấp độ cụm từ và từ ngữ. Các thẻ này bao gồm các chuyển đổi biểu cảm và các sự kiện phi ngôn ngữ như cười, thở, ho và thở dài.
Tài liệu của Model Studio chia các thẻ này thành hai nhóm. Các thẻ kiểm soát như [excited], [sad], [whispers] và [asmr] thiết lập cảm xúc hoặc phong cách cho đến khi gặp thẻ tiếp theo. Các thẻ ngôn ngữ phong phú như [laughing], [gasp] và [clears throat] chèn một hiệu ứng giọng nói đơn lẻ mà không làm thay đổi tông giọng xung quanh. Ví dụ: [excited]What a beautiful day today![laughing]Let's go out and have fun together! Một hạn chế cần lưu ý: các thẻ cảm xúc và ngôn ngữ phong phú này chỉ được hỗ trợ ở chế độ truyền phát một chiều.
Vị thế trên bảng xếp hạng
Qwen-Audio-3.0-TTS-Plus đã giành vị trí chất lượng hàng đầu trên Artificial Analysis Speech Arena cho hạng mục Provider Voices. Mô hình đạt điểm Elo gần 1.236, vượt nhẹ so với Simba 3.2 (1.234) và bỏ xa Gemini 3.1 Flash TTS (1.214) cùng Sonic 3.5 (1.207). Khoảng cách dẫn trước Simba 3.2 nằm trong khoảng tin cậy chồng lấp, vì vậy đây là một sự ngang bằng về mặt thống kê ở vị trí dẫn đầu.
Có hai sự đánh đổi cần được nêu rõ. Thông lượng ở mức khiêm tốn: Plus tạo ra khoảng 16 ký tự mỗi giây, thấp hơn Simba 3.2 (30,2), Gemini 3.1 Flash TTS (27) và Sonic 3.5 (120). Giá cả mang tính cạnh tranh: mức giá niêm yết là 27,59 USD cho mỗi 1 triệu ký tự, chỉ bằng khoảng một phần ba so với mức phí của ElevenLabs và MiniMax cho các cấp độ tương đương. Thứ hạng và giá cả thay đổi thường xuyên, vì vậy hãy xác nhận cả hai trước khi lập kế hoạch sử dụng.
Phản ứng của các nhà phát triển và cộng đồng
Phản ứng ban đầu khá hào hứng nhưng thận trọng. Câu chuyện được chia sẻ nhiều nhất là một mô hình TTS không đến từ phương Tây đã đứng đầu bảng xếp hạng với mức giá chỉ bằng một phần nhỏ so với các đối thủ đương nhiệm. Những lo ngại phổ biến nhất là mô hình chỉ được cung cấp dưới dạng lưu trữ, thông lượng chậm hơn các đối thủ và tên gọi bị trùng lặp với dòng Qwen3-TTS mã nguồn mở. Bảng điều khiển dưới đây tổng hợp các tín hiệu ban đầu đó trên X, Reddit và Hacker News.
Những điểm chính cần lưu ý
Nguồn: Blog phát hành Qwen-Audio-3.0-TTS · Thông báo của Tongyi Lab · Tài liệu TTS thời gian thực của Alibaba Cloud Model Studio · Bảng xếp hạng Artificial Analysis · Tongyi Lab trên X

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, đảm bảo cả về mặt kỹ thuật lẫn sự dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với người dùng.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.