Sản phẩm
Gradium AI ra mắt mô hình TTS mặc định mới: Tỷ lệ xử lý khó đạt 81%, độ trễ chỉ 216ms
(giờ Việt Nam)
Tóm tắt AI
Gradium AI vừa cập nhật mô hình chuyển đổi văn bản thành giọng nói (TTS) mặc định cho nền tảng, giúp cải thiện đáng kể tốc độ phản hồi và độ chính xác mà không làm gián đoạn các giọng nói tùy chỉnh hiện có của người dùng.
Bản dịch AI

Các trợ lý giọng nói thường thất bại ở chính những phần quan trọng nhất của cuộc gọi: số đơn hàng, các chữ số cần gọi lại, địa chỉ email mà người gọi phải ghi chép lại. Gradium AI vừa ra mắt một mô hình chuyển văn bản thành giọng nói (text-to-speech) mới và thiết lập nó làm mặc định trên toàn bộ API và Studio của hãng. Công ty báo cáo tỷ lệ vượt qua đánh giá của con người đạt 81,0% trên bộ dữ liệu gồm 500 câu hỏi khó bằng năm ngôn ngữ, vượt qua Cartesia Sonic 3.6 với 75,1% và ElevenLabs v3 Conversational với 65,4%. Thời gian phản hồi âm thanh đầu tiên (time to first audio) đạt 216 ms ở mức P50 trên Coval, nhanh hơn 170 ms so với mô hình tiền nhiệm.
Liệu mô hình này có thể triển khai được không?
Có, ngay hôm nay và không cần di chuyển dữ liệu. Gradium đã kích hoạt mô hình này làm mặc định trên API và Studio của mình vào ngày 31 tháng 8 năm 2026. Các giọng nói hiện có, bao gồm cả các bản sao tùy chỉnh, vẫn hoạt động bình thường mà không cần thay đổi.
Chỉ số độ chính xác
Gradium đã xây dựng một bộ đánh giá gồm 500 câu và mã nguồn mở trên Hugging Face theo giấy phép CC BY 4.0: bao gồm 100 mục cho mỗi tiêu chí trong số 10 tiêu chí thuộc năm ngôn ngữ (EN, DE, FR, ES, PT). Bảy tiêu chí cơ bản bao gồm đánh vần, từ viết tắt, mã chữ-số, ngày tháng, số thông thường, số lớn và số thập phân, cùng địa chỉ email. Ba tiêu chí tổng hợp (Đơn hàng, Phiếu hỗ trợ IT, Khiếu nại) kết hợp nhiều yếu tố trên vào một lượt hội thoại thực tế của trợ lý.
Việc chấm điểm được thực hiện bởi con người và rất nghiêm ngặt. Một câu chỉ được coi là đạt nếu một người đánh giá bản ngữ độc lập nghe thấy mọi thành phần được phát âm chính xác và đầy đủ; chỉ cần sai một chữ số là câu đó bị coi là thất bại. Âm thanh đã được chuẩn hóa độ lớn, thứ tự được xáo trộn ngẫu nhiên và người đánh giá bị giới hạn tối đa 40 lượt so sánh kèm theo thời gian nghỉ bắt buộc.
Tổng hợp trên mười tiêu chí và tính trung bình trên năm ngôn ngữ với trọng số bằng nhau: Gradium TTS đạt 81,0%, Cartesia Sonic 3.6 đạt 75,1%, ElevenLabs v3 Conversational đạt 65,4%, Fish Audio S2.1 Pro đạt 49,5%, Inworld TTS 1.5 Max đạt 46,5%. Tất cả đều được tạo vào tháng 8 năm 2026 với cài đặt mặc định.
Chỉ số độ trễ
Trên tiêu chuẩn đánh giá TTS của Coval, Gradium báo cáo thời gian phản hồi âm thanh đầu tiên ở mức P50 là 216 ms, nhanh hơn 170 ms so với mô hình mà nó thay thế. Chỉ số hữu ích hơn là độ phân tán: khoảng tứ phân vị p75-p25 là 30 ms trên 480 lần chạy, mức ổn định nhất trong năm mô hình được thử nghiệm. Cartesia Sonic 3.6 có mức trung vị là 454 ms với độ phân tán 165 ms, chiếm 36% so với mức trung vị của chính nó, và người gọi thường phải trải nghiệm những phản hồi chậm trễ thay vì mức trung bình.
Gradium không phải là mô hình nhanh nhất trên biểu đồ đó. Inworld TTS 2 đạt mức trung vị 166 ms; Fish Audio S2.1 Pro (291 ms) và ElevenLabs v3 Conversational (329 ms) xếp sau Gradium. Tuyên bố ở đây là về vị trí kết hợp: tỷ lệ thất bại thấp nhất trong các trường hợp khó với thời gian phản hồi âm thanh đầu tiên dưới 250 ms, cùng với độ biến thiên rất thấp.
Bắt đầu sử dụng
Người dùng hiện tại không cần làm gì cả. Các nhóm mới chỉ cần cài đặt Python SDK, trỏ đến điểm cuối WebSocket TTS và sử dụng lại các ID giọng nói hiện có. Gradium đang tặng 1 triệu tín dụng cho các báo cáo lỗi chính xác về các trường hợp khó trên Discord của hãng.
Những điểm chính cần lưu ý
Hãy xem bài đăng phát hành và bộ dữ liệu. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML với hơn 150 nghìn thành viên của chúng tôi cũng như đăng ký nhận Bản tin (Newsletter). Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, Trang Hugging Face, Sản phẩm mới hoặc Hội thảo trực tuyến (Webinar), v.v.? Hãy kết nối với chúng tôi.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có giá trị thực tiễn.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.