Google vừa giới thiệu hai mô hình TTS mới thuộc dòng Gemini 3.8, cung cấp hơn 2.000 giọng đọc có sẵn và khả năng tạo giọng nói tùy chỉnh chỉ với 30 giây mẫu âm thanh.
Announcing Multilingual Text to Speech Arena Leaderboards, comparing leading TTS models across 9 lan…
DịchArtificial Analysis vừa mở rộng nền tảng Controlled Voice Arena, bổ sung bảng xếp hạng cho 9 ngôn ngữ bao gồm tiếng Việt, giúp đánh giá chất lượng các mô hình chuyển đổi văn bản thành giọng nói (TTS) một cách khách quan.
Announcing the Artificial Analysis Pronunciation Robustness benchmark, measuring how reliably Text t…
DịchArtificial Analysis vừa ra mắt bộ tiêu chuẩn đánh giá khả năng phát âm của các mô hình TTS. Google Gemini 3.1 Flash dẫn đầu với tỷ lệ chính xác 88,1%, theo sau là SpaceXAI và ElevenLabs.
Alibaba giới thiệu Qwen3.8-LiveTranslate, mô hình thông dịch thời gian thực sử dụng kiến trúc Hybrid MoE Thinker-Talker, giúp giảm độ trễ trung bình xuống còn 2,3 giây.
SPACEXAI 🔥: Grok Bot is getting a voice mode on desktop and mobile apps. > The feature will be ro…
DịchGrok Bot chuẩn bị cập nhật chế độ giọng nói trên cả nền tảng máy tính và di động trong vài ngày tới, hứa hẹn mở ra nhiều trải nghiệm tương tác mới cho người dùng.
GPT-Live in the API, for empowering builders to create new kinds of applications:
DịchGPT-Live-1 đã có mặt trên OpenAI API, cho phép các nhà phát triển tích hợp khả năng đàm thoại tự nhiên, nghe-nói thời gian thực vào ứng dụng của mình.
DịchOpenAI vừa tích hợp mô hình GPT-Live-1 vào API, cho phép các nhà phát triển xây dựng ứng dụng với trải nghiệm hội thoại giọng nói tự nhiên, hỗ trợ tương tác hai chiều thời gian thực.
There is a subtle architecture shift happening in voice AI. The voice stack is becoming part of the…
DịchCartesia vừa ra mắt Sonic-3.6 (Text-to-Speech) và Ink-2 (Speech-to-Text) với độ trễ cực thấp lần lượt là 90ms và 100ms, trở thành đơn vị duy nhất dẫn đầu cả hai mảng xử lý âm thanh, tối ưu hóa mạnh mẽ cho các tác nhân AI đàm thoại.
New Gemini voice capabilities are rolling out so you can search your Gmail inbox, organize thoughts …
DịchSundar Pichai vừa giới thiệu tính năng giọng nói mới trên Gemini, cho phép người dùng tìm kiếm email, quản lý ghi chú và soạn thảo văn bản bằng hội thoại tự nhiên. Tính năng này hiện đã khả dụng cho người dùng đăng ký Google AI.
Inworld's newly released Realtime TTS-2 is the new #1 on the Artificial Analysis Controlled Voice Ar…
DịchMô hình Realtime TTS-2 mới của Inworld vừa đạt 1.123 điểm Elo, vượt qua Cartesia Sonic 3.6 để dẫn đầu bảng xếp hạng Controlled Voice Arena và giữ vị trí thứ hai trong Provider Voice Arena.
Inworld has released Realtime TTS-2, focused on clarity, and TTS-2 Flash, built for low latency and …
DịchInworld vừa giới thiệu bộ đôi TTS-2 và TTS-2 Flash với khả năng sao chép giọng nói siêu tốc chỉ trong 5-15 giây, hỗ trợ đọc chính xác các mã số phức tạp và tối ưu độ trễ thấp.
META 🔥: A new Muse Voice Transcribe model from MSL is now available on Meta models API. > SOTA …
DịchMeta vừa phát hành Muse Voice Transcribe trên API, hỗ trợ hơn 70 ngôn ngữ với khả năng chuyển đổi giọng nói thời gian thực đạt chuẩn SOTA. Mô hình này hiện đã được tích hợp vào các ứng dụng của Meta và cung cấp tùy chọn bảo mật không lưu trữ dữ liệu cho người dùng doanh nghiệp.
Gradium AI vừa cập nhật mô hình chuyển đổi văn bản thành giọng nói (TTS) mặc định cho nền tảng, giúp cải thiện đáng kể tốc độ phản hồi và độ chính xác mà không làm gián đoạn các giọng nói tùy chỉnh hiện có của người dùng.
Google vừa giới thiệu Gemini 3.5 Transcribe, mô hình AI đạt tỷ lệ lỗi từ (WER) chỉ 2,6% trên hơn 85 ngôn ngữ, hỗ trợ xử lý cả tệp ghi âm lẫn luồng dữ liệu trực tiếp.
New productivity upgrades to Gemini Live bring in agentic capabilities, so you can do more with your…
DịchGemini Live vừa được bổ sung khả năng của AI Agent, cho phép người dùng xử lý email, nghe tóm tắt tin tức hàng ngày và tương tác với các ứng dụng như Spark chỉ bằng giọng nói.
Meta is planning to bring back its voice mode on Meta AI soon. > A new voice election UI now appear…
DịchMeta đang rục rịch tái khởi động tính năng giọng nói trên Meta AI, với giao diện tùy chọn mới đã xuất hiện ẩn trong phần cài đặt. Nhiều khả năng tính năng này sẽ đi kèm với các mô hình ngôn ngữ nâng cấp mới.
SPACEXAI 🔥: Grok Bot may soon get voice call support! Users will be able to chat with Grok bots v…
DịchxAI đang phát triển tính năng gọi thoại cho Grok, cho phép người dùng trò chuyện trực tiếp với AI như một trợ lý cá nhân, hứa hẹn khả năng tự động hóa các tác vụ như lên lịch họp trong tương lai.
Cartesia vừa trình làng Sonic-3.6, mô hình TTS đạt độ trễ dưới 90ms và vượt qua ElevenLabs để chiếm lĩnh vị trí số 1 trên bảng xếp hạng Artificial Analysis.
Startup Wispr vừa huy động 280 triệu USD để nâng định giá lên 2 tỷ USD, đồng thời ra mắt mô hình Canto giúp giảm tỷ lệ lỗi chính tả khi đọc chính tả và giới thiệu công cụ ghi chú cuộc họp cạnh tranh trực tiếp với các đối thủ như Fireflies.
Trong chương trình Equity của TechCrunch, CEO Mina Fahmi khẳng định giọng nói là chìa khóa cho thế hệ thiết bị đeo AI tiếp theo, đồng thời chỉ ra những sai lầm chiến lược mà nhiều công ty phần cứng AI đang mắc phải.