IT Home
Điểm AI 68/100

Mô hình

Alibaba ra mắt dòng mô hình âm thanh Qwen-Audio-3.1 và giảm giá toàn bộ sản phẩm

(giờ Việt Nam)

Tóm tắt AI

Alibaba vừa giới thiệu 5 mô hình thuộc dòng Qwen-Audio-3.1 bao gồm ASR, ASR-Next, TTS, TTS-Next và Realtime, hỗ trợ toàn diện từ nhận diện, tổng hợp giọng nói đến tương tác thời gian thực.

Chính văn · Bản dịch AI

Theo tin từ IT ngày 23 tháng 9, hôm nay, Qwen đã chính thức ra mắt dòng mô hình ngôn ngữ lớn về giọng nói Qwen-Audio-3.1. Bản nâng cấp lần này không chỉ cải tiến toàn diện ba mô hình cốt lõi gồm nhận dạng giọng nói, tổng hợp giọng nói và tương tác giọng nói thời gian thực, mà còn đặc biệt giới thiệu mô hình sáng tạo âm thanh mới Qwen-Audio-3.1-TTS-Next và mô hình hiểu âm thanh Qwen-Audio-3.1-ASR-Next.

Theo thông tin chính thức, năm mô hình giọng nói hoàn toàn mới được ra mắt đồng thời, tạo thành một hệ sinh thái năng lực âm thanh hoàn chỉnh bao phủ các khía cạnh "hiểu - tạo - tương tác - sáng tạo". Để tiếp tục giảm chi phí sử dụng cho người dùng, giá của toàn bộ dòng mô hình giọng nói Qwen-Audio đều được điều chỉnh giảm, trong đó TTS giảm khoảng 70%, Realtime giảm khoảng 85% và ASR giảm tới 95%.

IT đính kèm giới thiệu chi tiết từ phía chính thức như sau:

Qwen-Audio-3.1-ASR: Khả năng hiểu ngữ cảnh và tinh chỉnh văn bản mạnh mẽ hơn

Qwen-Audio-3.1-ASR là mô hình ngôn ngữ lớn về nhận dạng giọng nói thế hệ mới, giúp tăng cường hơn nữa khả năng nhận dạng đa ngôn ngữ, phương ngữ và hiểu ngữ cảnh. Đồng thời, mô hình bổ sung khả năng tinh chỉnh bản ghi gốc, có thể tự động loại bỏ các từ đệm và biểu đạt lặp lại, tái cấu trúc ngữ nghĩa để văn bản được chuyển đổi trở nên trôi chảy và logic hơn.

Ngoài ra, giải pháp phân vai chuyển đổi (diarization) hoàn toàn mới giúp trình bày đầy đủ "ai đã nói gì vào lúc nào", cung cấp các bản ghi có cấu trúc, có thể truy xuất cho các cuộc họp, phỏng vấn và phân tích đối thoại.

Các điểm nổi bật về năng lực cốt lõi:

Có cấu trúc:

Giải pháp end-to-end, kết hợp xuất nhãn người nói, dấu thời gian và văn bản. Mô hình có thể xử lý các lượt phát biểu luân phiên, đồng thời giữ lại các đoạn chèn ngang ngắn và giọng nói chồng lấn, giúp chuyển đổi rõ ràng lời nói của từng người.

Nghe rộng:

Một bộ mô hình hỗ trợ 30 ngôn ngữ và 16 phương ngữ tiếng Trung, bao phủ các kịch bản giọng nói phức tạp như giao tiếp đa ngôn ngữ, đối thoại bằng phương ngữ.

Nghe chuẩn:

Hỗ trợ nhận dạng từ vựng ngành, thực thể chuyên môn và từ khóa nóng phân cấp, đồng thời có thể tham chiếu ngữ cảnh lịch sử của âm thanh dài, giúp tên người, từ viết tắt và thuật ngữ chuyên môn luôn nhất quán.

Nghe nhanh:

Hỗ trợ nhận dạng luồng (streaming) độ trễ thấp, vừa nói vừa chuyển đổi, xuất văn bản chính xác theo thời gian thực, phản hồi ký tự đầu tiên khoảng 160 mili giây.

Nghe rõ:

Tự động hoàn thiện việc loại bỏ từ đệm, loại bỏ lặp lại, tự sửa lỗi và tái cấu trúc ngữ nghĩa; tự động phân biệt các người nói khác nhau, đạt được sự nhất quán về vai trò, căn chỉnh thời gian và xuất dữ liệu có cấu trúc đối với âm thanh dài.

Hiệu suất hoạt động

ASR / AST phương ngữ mã nguồn mở:

图片

Thông qua 11 tập con của KeSpeech và WSYue, đánh giá khả năng chuyển đổi và dịch thuật phương ngữ của mô hình trên dữ liệu công khai. Qwen-Audio-3.1-ASR đạt CER (tỷ lệ lỗi ký tự) trung bình là 4,55% và giành kết quả tốt nhất trên 6 tập con.

ASR trên tập kiểm thử phương ngữ tiếng Trung tự xây dựng:

图片

Đánh giá khả năng chuyển đổi văn bản gốc của 16 phương ngữ tiếng Trung, đo lường bằng tỷ lệ lỗi ký tự (CER). Qwen-Audio-3.1-ASR đạt kết quả tốt nhất trên 11 tập con phương ngữ, với CER trung bình là 10,38%, trong đó sự cải thiện đối với các phương ngữ khó như tiếng Ôn Châu đặc biệt rõ rệt.

AST trên tập kiểm thử phương ngữ tiếng Trung tự xây dựng:

图片

Đánh giá khả năng dịch giọng nói phương ngữ sang tiếng phổ thông và giữ nguyên ý nghĩa gốc, đo lường bằng tỷ lệ chính xác câu ngữ nghĩa.

Qwen-Audio-3.1-ASR đạt hiệu suất tốt nhất trên 10 trong số 11 tập con phương ngữ, với tỷ lệ chính xác câu ngữ nghĩa trung bình đạt 82,10%.

Qwen-Audio-3.1-ASR-Next: Hiểu rõ hơn về cảm xúc nhân vật và bối cảnh

Mô hình hiểu âm thanh Qwen-Audio-3.1-ASR-Next dựa trên kiến trúc thế hệ mới chính thức ra mắt, có khả năng hiểu cảm xúc nhân vật, âm thanh môi trường và âm thanh cơ khí, từ đó thực hiện mô tả âm thanh, định vị sự kiện, hỏi đáp và suy luận dựa trên âm thanh.

Ví dụ, đối với một đoạn âm thanh chứa cả đối thoại, nhạc nền và tiếng ồn môi trường, mô hình không chỉ xuất văn bản đối thoại mà còn có thể mô tả thêm các âm thanh có trong đoạn đó, thời điểm xảy ra các sự kiện liên quan và trả lời các câu hỏi về toàn bộ nội dung.

Nhờ đó, đối tượng xử lý của ASR bắt đầu mở rộng từ "văn bản trong giọng nói" thành "thông tin âm thanh hoàn chỉnh".

Hiệu suất hoạt động

ASR phân vai:

图片

Đánh giá khả năng nhận dạng "ai nói gì vào lúc nào" trong giọng nói nhiều người, đồng thời kiểm tra độ chính xác của việc phân biệt người nói và chuyển đổi văn bản. Trong tám chỉ số của bốn tập kiểm thử, các phiên bản Qwen-Audio-3.1-ASR-Flash-Next và Qwen-Audio-3.1-ASR-Flash lần lượt đạt năm và ba kết quả tốt nhất, đều vượt trội hoàn toàn so với hệ thống phân tầng Fun-ASR trước đây.

Qwen-Audio-3.1-TTS: Tổng hợp âm sắc đa ngôn ngữ tự nhiên hơn

Qwen-Audio-3.1-TTS là mô hình ngôn ngữ lớn về tổng hợp giọng nói thế hệ mới, hỗ trợ tổng hợp đa ngôn ngữ và phương ngữ, hỗ trợ chuyển đổi tự nhiên khi mô hình thực hiện tổng hợp xuyên ngôn ngữ với cùng một âm sắc, giúp bạn nói được nhiều ngôn ngữ chỉ trong tích tắc.

So với phương pháp truyền thống chỉ tập trung vào độ chính xác của âm tiết, mô hình này chú trọng hơn vào biểu đạt chân thực: thông qua các lệnh điều khiển cảm xúc, tốc độ nói và cách biểu đạt, giúp giọng nói trở nên gần gũi với nội dung cụ thể và kịch bản sử dụng.

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Alibaba ra mắt dòng mô hình âm thanh Qwen-Audio-3.1 và giảm giá toàn bộ sản phẩm | AIHOT.vn