IT Home
85

Mô hình

Alibaba ra mắt Qwen-Audio-3.0-ASR-Flash: Mô hình nhận diện giọng nói siêu việt cho thuật ngữ chuyên ngành

(giờ Việt Nam)

Tóm tắt AI

Alibaba giới thiệu mô hình Qwen-Audio-3.0-ASR-Flash với khả năng nhận diện từ ngữ chuyên ngành, tùy chỉnh từ khóa linh hoạt và hỗ trợ xuất văn bản có cấu trúc, giúp tối ưu hóa độ chính xác trong xử lý giọng nói.

Bản dịch AI

Theo tin từ IT ngày 31 tháng 7, Alibaba hôm nay đã ra mắt mô hình ngôn ngữ lớn nhận diện giọng nói Qwen-Audio-3.0-ASR-Flash. Nói một cách đơn giản, mô hình này giúp AI hiểu rõ hơn các thuật ngữ chuyên ngành.

Qwen-Audio-3.0-ASR-Flash đã được tối ưu hóa một cách hệ thống trên ba khía cạnh: tính nhất quán của ngữ cảnh, khả năng nhận diện từ vựng ngành và tùy chỉnh từ khóa nóng. Đồng thời, mô hình còn được trang bị khả năng tinh chỉnh giọng nói, cho phép xuất trực tiếp văn bản có cấu trúc.

Nhóm nghiên cứu đã liên tục khai thác các thuật ngữ chuyên môn từ nhiều lĩnh vực như y tế, lập trình IT, chứng khoán, người nổi tiếng... để xây dựng kho từ vựng chất lượng cao bao phủ đa ngành, từ đó tăng cường khả năng nhận diện các thuật ngữ chuyên môn và từ ngữ ít phổ biến của mô hình. Trong các bài kiểm tra nội bộ về từ vựng ngành mới nhất, "tỷ lệ nghe chính xác" các thuật ngữ chuyên môn của mô hình mới đã cải thiện rõ rệt, trong đó lĩnh vực y tế đã vượt mốc 95,36%.

图片

Hiện tại, dòng Qwen-Audio-ASR-Flash đã được kiểm chứng trong các tình huống như tóm tắt biên bản cuộc họp, phụ đề thời gian thực, ghi hình giáo dục, chăm sóc khách hàng thông minh, và từng giành vị trí số 1 thế giới trên nền tảng đánh giá AI Artificial Analysis với tỷ lệ lỗi ký tự chỉ 1,7%.

Qwen-Audio-3.0-ASR hiện đã mở quyền truy cập thông qua nền tảng Alibaba Cloud Bailian với ba phiên bản:

Qwen-Audio-3.0-ASR-Flash: Nhận diện giọng nói, tối đa 5 phút.

Qwen-Audio-3.0-ASR-Filetrans: Chuyển đổi tệp tin ngoại tuyến.

Qwen-Audio-3.0-ASR-Streaming: Nhận diện giọng nói thời gian thực.

IT đính kèm địa chỉ trải nghiệm Qwen-Audio-3.0-ASR-Flash như sau:

Qwen-Audio-3.0-ASR-Flash:

https://help.aliyun.com/zh/model-studio/non-real-time-speech-recognition-for-fun-asr-flash

Qwen-Audio-3.0-ASR-Flash-Filetrans:

https://help.aliyun.com/zh/model-studio/fun-asr-recorded-speech-recognition-http-api

Qwen-Audio-3.0-ASR-Flash-Streaming:

https://help.aliyun.com/zh/model-studio/fun-asr-realtime-websocket-api

Tuyên bố quảng cáo: Các liên kết chuyển hướng bên ngoài trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin và tiết kiệm thời gian chọn lọc, kết quả chỉ mang tính chất tham khảo. Tất cả các bài viết của IT đều bao gồm tuyên bố này.

AlibabaQwenNhận diện giọng nóiASRAI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.