Sản phẩm
Alibaba ra mắt CosyVoice Studio: Nền tảng AI giọng nói toàn diện đầu tiên tại Trung Quốc
(giờ Việt Nam)
Tóm tắt AI
CosyVoice Studio cung cấp giải pháp tất cả trong một cho phép AI 'nghe, nói và sáng tạo', tích hợp sâu khả năng hiểu ngữ nghĩa vào công nghệ giọng nói.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
2026-08-07 15:43:06 Nguồn: QbitAI
Đáp ứng trọn gói nhu cầu "nghe, nói, sáng tạo" bằng AI giọng nói
Yun Zhong đưa tin từ QbitAI | Tài khoản chính thức QbitAI
Ngày 7 tháng 8, Alibaba chính thức ra mắt CosyVoice Studio, nền tảng năng suất AI giọng nói "tất cả trong một" đầu tiên tại Trung Quốc. Nền tảng này được xây dựng dựa trên mô hình giọng nói tự phát triển Qwen-Audio của Alibaba. Trên nền tảng đánh giá AI uy tín toàn cầu Artificial Analysis, mô hình này đã giành vị trí số 1 thế giới ở ba hạng mục: Nhận dạng giọng nói (ASR), Tương tác thời gian thực (RealTime) và Tổng hợp giọng nói (TTS). CosyVoice Studio bao gồm ba tính năng chính: Bàn phím giọng nói có khả năng chuyển đổi lời nói thành văn bản có cấu trúc, loại bỏ các từ đệm và logic rõ ràng hơn; Công cụ sáng tạo nội dung âm thanh giúp biến nội dung người dùng muốn truyền tải thành podcast và sách nói; và Tác nhân giọng nói (Voice Agent) cho phép doanh nghiệp tạo ra các tác nhân giọng nói tương tác thời gian thực theo nhu cầu. Nền tảng này đáp ứng toàn diện nhu cầu về AI giọng nói cho doanh nghiệp, nhà phát triển và người dùng cá nhân.
Giọng nói đang trở thành giao diện cốt lõi cho tương tác người-máy trong kỷ nguyên AI. Với sự trưởng thành của các mô hình lớn, người dùng ngày càng có xu hướng chọn đối thoại bằng giọng nói thay vì nhập văn bản khi sử dụng các sản phẩm AI. Kiến trúc kỹ thuật của ngành cũng đang chuyển dịch theo hướng này, từ các công cụ chuyển đổi giọng nói và tổng hợp giọng nói rời rạc trước đây sang các Voice Agent đầu cuối (end-to-end). CosyVoice Studio lần đầu tiên mở ra khả năng của mô hình giọng nói Alibaba dưới dạng một sản phẩm tổng hợp: người dùng doanh nghiệp có thể trải nghiệm trực tiếp trên nền tảng rồi gọi API theo nhu cầu, người dùng cá nhân cũng có thể sử dụng trực tiếp thông qua sản phẩm này.

Bàn phím giọng nói CosyVoice không chỉ có khả năng chuyển đổi giọng nói thành văn bản thông thường mà còn tích hợp khả năng hiểu ngữ nghĩa và tạo văn bản. Trong các tình huống giao tiếp hàng ngày, CosyVoice sẽ tự động lọc bỏ các từ đệm như "cái đó", "ừm", đồng thời sắp xếp các ý tưởng rời rạc thành cách diễn đạt logic và rõ ràng. Những đoạn tự sửa lỗi của người dùng khi nói, ví dụ như "không phải, ý tôi là", sẽ không để lại dấu vết sửa đổi mà chỉ giữ lại ý định cuối cùng. Trong các tình huống công việc chính thức, chỉ cần đọc một đoạn văn là có thể tạo ngay định dạng và văn phong cho email, báo cáo công việc hoặc biên bản cuộc họp.

Đối với các tình huống chuyên môn, CosyVoice hỗ trợ chuyển đổi thông minh các văn bản đặc biệt như số liệu, công thức; ví dụ "ba trăm năm mươi tám triệu", "mười hai phẩy sáu phần trăm" có thể được xuất trực tiếp thành 358 triệu, 12,6%. Các chuyên gia phân tích tài chính đọc báo cáo thị trường, nhà nghiên cứu mô tả dữ liệu thí nghiệm, hay phóng viên tổng hợp các điểm chính của bài phỏng vấn đều có thể nhận được nội dung có cấu trúc sẵn sàng để sử dụng.
Ngoài nhập liệu giọng nói 1-1, CosyVoice còn tích hợp chế độ "Ghi chú nhanh" (Memo), dành riêng cho các tình huống cần ghi chép liên tục trong thời gian dài như cuộc họp, phỏng vấn, lớp học. Sau khi bật chế độ này, hệ thống sẽ chuyển giọng nói thành văn bản theo thời gian thực; nhận diện thông minh các diễn giả khác nhau dựa trên đặc điểm giọng nói (voiceprint), giúp phân biệt rõ ai đã nói gì; sau khi kết thúc ghi âm, hệ thống tự động tạo các chương có cấu trúc. Sau cuộc họp, biên bản và các đầu việc cần làm đã sẵn sàng. Chế độ này cũng hỗ trợ dịch thuật đa ngôn ngữ chỉ với một cú nhấp chuột, giúp các cuộc họp quốc tế và phỏng vấn khách hàng nước ngoài không còn cần phải xử lý thủ công sau đó. Các tệp ghi âm có sẵn cũng có thể được tải lên để chuyển đổi, hỗ trợ ghi âm liên tục tối đa 6 giờ mỗi lần.
Tác nhân giọng nói CosyAgent là một công cụ xây dựng AI Agent. Người dùng có thể nhanh chóng tạo ra các tác nhân có khả năng hiểu kiến thức doanh nghiệp, gọi công cụ và tương tác giọng nói thời gian thực thông qua ngôn ngữ tự nhiên, hỗ trợ cấu hình chuyên sâu về prompt và workflow, hướng tới các tình huống như chăm sóc khách hàng thông minh, tiếp thị qua điện thoại.
Công cụ sáng tạo nội dung âm thanh CosyCreative tích hợp hàng nghìn loại âm sắc và hỗ trợ sao chép giọng nói, tạo ra âm sắc rất gần với người thật. Người dùng chỉ cần tải lên tài liệu, liên kết web hoặc nhập một câu văn là có thể nhanh chóng tạo ra một podcast đối thoại hoặc sách nói đa nhân vật, bao phủ toàn bộ chuỗi quy trình sáng tạo nội dung âm thanh.
Kể từ hôm nay, người dùng có thể tìm kiếm "CosyVoice" trên các kho ứng dụng iOS, Android, Mac và Windows để tải về trải nghiệm, sử dụng miễn phí không giới hạn. CosyAgent và CosyCreative hiện đang được thử nghiệm cho người dùng doanh nghiệp theo hình thức danh sách trắng (white-list) và sẽ sớm mở rộng hoàn toàn trong thời gian tới. Chi tiết xem tại trang web chính thức của CosyVoice Studio (cosyvoice.net).
Bản quyền thuộc về QbitAI, không được phép sao chép hoặc sử dụng dưới mọi hình thức khi chưa được ủy quyền, mọi vi phạm sẽ bị xử lý theo pháp luật.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.