MarkTechPost
88

Mô hình

Cartesia ra mắt Sonic-3.6: Mô hình chuyển văn bản thành giọng nói thời gian thực dẫn đầu bảng xếp hạng

(giờ Việt Nam)

Tóm tắt AI

Cartesia vừa trình làng Sonic-3.6, mô hình TTS đạt độ trễ dưới 90ms và vượt qua ElevenLabs để chiếm lĩnh vị trí số 1 trên bảng xếp hạng Artificial Analysis.

Bản dịch AI

Cartesia Ships Sonic-3.6: A Streaming TTS Model That Now Leads Both Artificial Analysis Speech Arenas

Cartesia vừa ra mắt Sonic-3.6, phiên bản mới nhất của mô hình chuyển đổi văn bản thành giọng nói (text-to-speech) thời gian thực. Bản cập nhật này xuất hiện chỉ khoảng ba tháng sau Sonic-3.5. Thay đổi mới nằm ở độ tự nhiên, và điều này có thể được kiểm chứng độc lập. Sonic 3.6 hiện đang giữ vị trí số 1 trên cả hai bảng xếp hạng giọng nói của Artificial Analysis — đạt 1.283 Elo trên bảng Provider Voice và 1.123 trên bảng Controlled Voice. Kết quả thứ hai quan trọng hơn, vì bảng xếp hạng này áp dụng mọi mô hình lên cùng tám giọng nói tham chiếu, giúp tách biệt công cụ tổng hợp khỏi danh mục giọng nói có sẵn. Sonic-3.6 dẫn đầu, theo sau là Sonic-3.5 ở vị trí thứ hai và ElevenLabs Eleven v3 ở vị trí thứ ba. Mô hình này vận hành dựa trên các mô hình không gian trạng thái (state space models) thay vì kiến trúc transformer, và Cartesia cho biết thời gian phản hồi âm thanh đầu tiên (time-to-first-audio) dưới 90ms. Hiện mô hình đang ở giai đoạn beta.

Liệu nó có thể triển khai được không?

CÓ, nó hiện đã có sẵn dưới dạng bản beta và API lưu trữ (hosted API). Không phải dưới dạng trọng số tự lưu trữ (self-hosted weights).

Sonic là một mô hình thương mại đóng. Không có trọng số mở và không có kho lưu trữ trên Hugging Face. Bạn phải thuê dịch vụ này.

Kiến trúc

Sonic vận hành trên các mô hình không gian trạng thái thay vì transformer. Trang giới thiệu của Cartesia đặt ra các đánh đổi thông thường — tốc độ so với độ tự nhiên, độ chính xác so với chi phí — như là những vấn đề về kiến trúc, chứ không phải là điều tất yếu.

Kết quả thực tế là thời gian phản hồi âm thanh đầu tiên. Cartesia công bố độ trễ TTS dưới 90ms và độ trễ bản ghi 100ms cho mô hình chuyển đổi giọng nói thành văn bản (speech-to-text) Ink-2. Cả hai đều là độ trễ mô hình do nhà cung cấp công bố, không phải là thời gian phản hồi toàn trình (end-to-end round trips) được đo lường thực tế.

Trình giải thích tương tác

Các tính năng quan trọng trong sản xuất

Sonic cung cấp các quyền kiểm soát được xây dựng cho các bản ghi của tác nhân (agent transcripts) thay vì cho mục đích tường thuật:

Các bản demo ra mắt của Cartesia cho thấy tiếng Anh với các quãng nghỉ tự nhiên và từ đệm, cộng với khả năng chuyển đổi mã (code-switching) giữa tiếng Hindi và tiếng Anh (Hinglish).

Thực tế về giá cả

Artificial Analysis chuẩn hóa mức giá của Sonic 3.6 ở mức 49,00 USD cho mỗi 1 triệu ký tự. Mức giá này bằng một nửa so với ElevenLabs Eleven v3 (100,00 USD) và cao hơn đáng kể so với Speechify Simba 3.2 (10,00 USD cho 1.240 Elo).

Cartesia bán tín dụng (credits), không bán theo ký tự. Gói Scale với giá 299 USD mỗi tháng bao gồm khoảng 10.667 phút TTS và 15 yêu cầu đồng thời. Các tác nhân giọng nói qua đường dây (line voice agents) được tính phí riêng ở mức 0,06 USD mỗi phút.

Những điểm chính cần lưu ý

Hãy xem qua Trang dự án Cartesia Sonic, trang giới thiệu Cartesia, bảng giá Cartesia, tài liệu Cartesia, Artificial Analysis Speech Arena và @cartesia trên X. Tất cả các số liệu đã được xác minh vào ngày 18 tháng 8 năm 2026. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter, tham gia SubReddit ML 150k+ thành viên và đăng ký nhận Bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, sản phẩm mới hoặc hội thảo trực tuyến (webinar), v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc. Với tư cách là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt nền tảng truyền thông về Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy (machine learning) và học sâu (deep learning), đảm bảo cả tính kỹ thuật lẫn sự dễ hiểu đối với đông đảo độc giả. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với công chúng.

AITTSCartesiaSonic-3.6Công nghệ giọng nói
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.