Startup AI giọng nói Ringg của Ấn Độ vừa huy động thêm 10 triệu USD, nâng tổng vòng Series A lên 15,5 triệu USD. Công ty hiện xử lý 20 triệu cuộc gọi mỗi tháng và đang mở rộng công nghệ AI vượt ra ngoài phạm vi điện thoại truyền thống.
What can you build with AI audio models beyond voice generation? 🎙️ Developer @maxar2032 has creat…
DịchPlugin ComfyUI_VoxCPM_SM mới cho phép người dùng chạy mô hình VoxCPM2 trên máy tính cá nhân với yêu cầu VRAM thấp, hỗ trợ định dạng GGUF và tinh chỉnh LoRA bằng dữ liệu giọng nói tùy chỉnh.
Grok Voice Think Fast 2.0 is now #1 on Artificial Analysis' updated Speech-to-Speech Index, beating …
DịchGrok Voice Think Fast 2.0 vừa vươn lên dẫn đầu bảng xếp hạng giọng nói của Artificial Analysis, vượt qua các đối thủ từ OpenAI và Google với tỷ lệ thành công nhiệm vụ ấn tượng 94,7%.
DịchGrok Voice 2 vừa vươn lên vị trí dẫn đầu trên bảng xếp hạng Artificial Analysis về khả năng xử lý giọng nói, nhờ năng lực suy luận và giải quyết vấn đề thực tế vượt trội.
Grok Voice Think Fast 2.0 is now #1 on the Artificial Analysis Speech-to-Speech Index. This index m…
DịchGrok Voice Think Fast 2.0 vừa vươn lên vị trí số 1 trên bảng xếp hạng Artificial Analysis nhờ khả năng suy luận, giải quyết vấn đề thực tế và sử dụng công cụ thông minh vượt trội.
Google tích hợp khả năng đánh giá thời gian thực vào ADK, cho phép mô phỏng người dùng bằng âm thanh để kiểm thử và chấm điểm các tác nhân AI giọng nói trong quy trình làm việc tự động.
Announcing our new Speech Agent Arena, evaluating Speech to Speech models on real-world scenarios to…
DịchSpeech Agent Arena đánh giá các mô hình giọng nói dựa trên trải nghiệm thực tế của người dùng. Gemini 3.1 Flash dẫn đầu về độ ưa chuộng, trong khi Grok Voice Think Fast 2.0 đạt tỷ lệ hoàn thành nhiệm vụ cao nhất.
Speko cung cấp dịch vụ định tuyến thông minh cho hơn 60 mô hình giọng nói, tối ưu hóa hiệu suất cho các ngôn ngữ ngoài tiếng Anh vốn thường bị bỏ qua trong các bài kiểm tra tiêu chuẩn.
Mô hình Sonic 3.6 từ Cartesia vừa chính thức vươn lên vị trí dẫn đầu trong cả hai hạng mục giọng nói điều khiển và giọng nói nhà cung cấp theo đánh giá từ Artificial Analysis.
Alibaba chính thức đưa Qwen-Audio-3.0 lên nền tảng Qwen và Bailian. Dòng mô hình này bao gồm ASR, TTS và tương tác thời gian thực, hiện đang giữ vị trí số 1 thế giới trên bảng xếp hạng Artificial Analysis.
Startup VUI Labs vừa đưa mô hình Luna-TTS lên vị trí dẫn đầu bảng xếp hạng TTS Arena của Hugging Face, vượt qua các tên tuổi lớn như ElevenLabs nhờ kiến trúc khuếch tán từ Qwen3 và độ trễ cực thấp chỉ 41,6ms.
Vì sao đáng đọc: Tin tức quan trọng về sự trỗi dậy của AI Trung Quốc trong lĩnh vực giọng nói, với các số liệu kiểm chứng từ bảng xếp hạng uy tín, rất đáng chú ý cho cộng đồng công nghệ.
Soniox TTS v2 is one of those models you need to actually hear. They just launched TTS v2, a text-t…
DịchSoniox vừa trình làng mô hình TTS v2 với khả năng hỗ trợ đa ngôn ngữ, tích hợp tính năng cảm xúc và sao chép giọng nói, tối ưu cho các tác nhân AI thời gian thực với mức giá chỉ 0,7 USD/giờ.
Jason Liu thông báo đã tối ưu hóa thành công, giúp giảm 50% độ trễ khung hình trên Codex Voice, hứa hẹn mang lại trải nghiệm tương tác mượt mà hơn đáng kể.
I wasn't expecting Soniox TTS v2 (a text-to-speech model) to sound this natural. They just released…
DịchSoniox giới thiệu mô hình TTS v2 hỗ trợ hơn 60 ngôn ngữ với chi phí chỉ 0,7 USD/giờ. Công nghệ này tối ưu cho AI agent nhờ khả năng phản hồi thời gian thực, độ trễ thấp và tính năng sao chép giọng nói trung thực.