QbitAI
85

Mô hình

AI giọng nói bước vào 'kỷ nguyên biểu diễn': Qwen-Audio-3.0-TTS của Alibaba dẫn đầu bảng xếp hạng toàn cầu

(giờ Việt Nam)

Tóm tắt AI

Mô hình Qwen-Audio-3.0-TTS của Alibaba vừa thiết lập chuẩn mực mới với khả năng xử lý nhãn chi tiết và hỗ trợ tới 20 loại phương ngữ khác nhau.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

20/07/2026 17:05:06 Nguồn: QbitAI

Nhãn chi tiết (fine-grained) + 20 loại phương ngữ

Ngày 20 tháng 7, Alibaba đã ra mắt mô hình lớn về tổng hợp giọng nói Qwen-Audio-3.0-TTS. Mô hình này mang đến những cải tiến hệ thống về khả năng kiểm soát nhãn chi tiết, tuân thủ chỉ dẫn freestyle, độ phủ đa ngôn ngữ và phương ngữ, cũng như tính ổn định trong các môi trường âm thanh phức tạp. Sản phẩm bao gồm phiên bản Flash dành cho tương tác thời gian thực (độ trễ gói tin đầu tiên ở mức 300ms) và phiên bản Plus dành cho tạo nội dung chất lượng cao, giúp giọng nói tổng hợp chuyển mình từ "biết nói" sang "biết biểu cảm". Hiện tại, trên bảng xếp hạng uy tín của bên thứ ba toàn cầu là Artificial Analysis, Qwen-Audio-3.0-TTS-Plus đã giành vị trí quán quân, trong khi phiên bản xem trước Fun-Realtime-TTS của nó cũng từng đứng đầu bảng xếp hạng này cách đây một tháng.

Phiên bản tiền nhiệm của Qwen-Audio-3.0-TTS đã hỗ trợ freestyle (chế độ phong cách tự do), cho phép người dùng thêm các thiết lập vai trò như "nhân viên chăm sóc khách hàng chuyên nghiệp", "bình luận viên bóng đá" vào câu lệnh (prompt) để kiểm soát cảm xúc, bối cảnh và tốc độ nói. Mô hình mới tiếp tục tạo ra bước nhảy vọt về độ chi tiết: thông qua các nhãn có cấu trúc, người dùng có thể trực tiếp chèn các ký hiệu như [gasp] (hít hơi), [giggles] (cười khúc khích), [angry] (giận dữ) vào văn bản. Điều này giúp tinh chỉnh độ chính xác từ cảm xúc của cả đoạn văn xuống mức "sau chữ nào thì nên hít hơi", phù hợp cho các kịch bản cần kiểm soát chi tiết chính xác như kể chuyện, trò chơi và lồng tiếng.

Hướng tới các kịch bản đa ngôn ngữ toàn cầu, Qwen-Audio-3.0-TTS đã được tối ưu hóa chuyên biệt, bao phủ 16 ngôn ngữ bao gồm tiếng Trung, Anh, Nhật, Hàn, Đức và bổ sung thêm tiếng Ả Rập, tiếng Việt, tiếng Mã Lai cùng tiếng Philippines. Theo kết quả kiểm chuẩn đa ngôn ngữ của CV3-Eval, trong bài đánh giá "tỷ lệ lỗi từ/chữ" trên 16 ngôn ngữ, dòng Qwen-Audio-3.0-TTS đã đạt kết quả SOTA (State-of-the-Art) ở 10 ngôn ngữ, với biên độ dẫn đầu lớn nhất ở tiếng Hàn và tiếng Mã Lai. Trong bài đánh giá "độ tương đồng người nói" trên 16 ngôn ngữ, Qwen-Audio-3.0-TTS-Plus đã giành chiến thắng tuyệt đối, chiếm trọn các vị trí dẫn đầu, trong khi phiên bản Flash chiếm 15 vị trí thứ hai, với biên độ dẫn đầu rõ rệt nhất ở tiếng Mã Lai, tiếng Tây Ban Nha và tiếng Ả Rập.

Quy mô mô hình càng lớn và dữ liệu huấn luyện càng phức tạp, phát âm phương ngữ thường vô tình bị lái sang giọng phổ thông. Để giải quyết điểm đau này, đội ngũ nghiên cứu đã thiết kế chương trình huấn luyện tăng cường phương ngữ, giúp mô hình đạt được nhịp điệu, ngữ điệu và cách diễn đạt khẩu ngữ gần giống với người bản xứ, bao phủ 20 loại phương ngữ như Quảng Đông, Trùng Khánh, Đông Bắc, Thiểm Tây, Thượng Hải, Tứ Xuyên, Vân Nam, v.v.

Các sản phẩm sao chép giọng nói thường yêu cầu âm thanh tham chiếu gốc phải được ghi âm trong môi trường yên tĩnh. Qwen-Audio-3.0-TTS thông qua huấn luyện mô phỏng âm học thực tế đã tích hợp khả năng tăng cường giọng nói vào quy trình sao chép, cho phép mô hình lọc bỏ nhiễu và chỉ giữ lại âm sắc ngay cả trong điều kiện độ ồn và độ vang cao. Đối với các kịch bản sáng tạo chuyên nghiệp, mô hình sở hữu thư viện âm sắc chất lượng cao có thể sử dụng ngay lập tức, đồng thời nâng cấp đầu ra âm thanh từ 24kHz lên 48kHz, tương đương với việc nâng chất lượng lồng tiếng video và sách nói lên tiêu chuẩn phòng thu và lồng tiếng phim ảnh, với thời lượng tổng hợp giọng nói mỗi lần lên tới 3 phút.

Kể từ hôm nay, hai phiên bản mô hình này đã được mở quyền truy cập trên nền tảng Alibaba Cloud PAI (Bailian).

Bản quyền thuộc về đơn vị sở hữu, nghiêm cấm sao chép và sử dụng dưới mọi hình thức khi chưa được cho phép, mọi hành vi vi phạm sẽ bị xử lý theo pháp luật.

AIQwenAlibabaTTSCông nghệ giọng nói
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.