Sản phẩm
Alibaba ra mắt Qwen-Audio-3.1 với 5 mô hình mới, giảm giá dịch vụ AI âm thanh tới 95%
(giờ Việt Nam)
Tóm tắt AI
Alibaba giới thiệu bộ 5 mô hình Qwen-Audio-3.1 chuyên về nhận diện (ASR) và tổng hợp giọng nói (TTS) với khả năng xử lý đa ngôn ngữ, cảm xúc và âm thanh môi trường vượt trội, đồng thời cắt giảm mạnh chi phí API lên đến 95%.
Chính văn · Bản dịch AI
Đội ngũ AI Qwen của Alibaba vừa ra mắt Qwen-Audio-3.1, một dòng sản phẩm gồm năm mô hình dành cho nhận dạng giọng nói (ASR), chuyển văn bản thành giọng nói (TTS) và tương tác thời gian thực. Mô hình ASR cải thiện khả năng nhận dạng đa ngôn ngữ và phương ngữ, đồng thời tự động loại bỏ các từ đệm và từ lặp. ASR-Next bổ sung tính năng nhận diện nhiều người nói kèm dấu thời gian, đồng thời phát hiện cảm xúc, âm thanh môi trường và tiếng ồn máy móc. TTS xử lý việc tổng hợp đa ngôn ngữ với khả năng chuyển đổi giọng nói xuyên ngôn ngữ một cách tự nhiên. Người dùng có thể điều khiển cảm xúc, tốc độ và phong cách thông qua các câu lệnh văn bản đơn giản như "Hãy đọc đoạn này với tông giọng sắc bén, uy quyền và đầy sự tôn trọng."
TTS-Next kết hợp mô hình ngôn ngữ với phương pháp khuếch tán để tạo ra giọng nói, hiệu ứng âm thanh và âm thanh nền trong một lần xử lý duy nhất. Mô hình thời gian thực hỗ trợ việc vừa nói vừa nghe đồng thời với khả năng ngắt lời tức thì. Theo Qwen, khi phát hiện tâm trạng người dùng không tốt, mô hình sẽ phản hồi chậm rãi và đồng cảm hơn. Alibaba cũng đang cắt giảm mạnh giá thành. Giá dịch vụ TTS giảm khoảng 70%, Realtime giảm khoảng 85% và ASR giảm tới 95%. Xem thêm chi tiết trên blog và tại Qwen Cloud.
Tin tức AI không thổi phồng – Được biên tập bởi con người
Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo chuyên sâu "AI Radar" độc quyền sáu lần mỗi năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận.
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.