24/09

Thứ Năm · 1 tin
Simon Willison Blog
Sản phẩmĐiểm AI 66/100

Cùng sự kiệnGoogle ra mắt bộ đôi mô hình chuyển văn bản thành giọng nói Gemini 3.8-flash-tts và flash-lite-tts

Google vừa giới thiệu hai mô hình TTS mới thuộc dòng Gemini 3.8, cung cấp hơn 2.000 giọng đọc có sẵn và khả năng tạo giọng nói tùy chỉnh chỉ với 30 giây mẫu âm thanh.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS: Đột phá công nghệ chuyển văn bản thành giọng nói»

23/09

Thứ Tư · 1 tin
Artificial Analysis@ArtificialAnlys
Sản phẩmĐiểm AI 51/100

Artificial Analysis ra mắt bảng xếp hạng Text-to-Speech đa ngôn ngữ, hỗ trợ tiếng Việt

Announcing Multilingual Text to Speech Arena Leaderboards, comparing leading TTS models across 9 lan…

DịchArtificial Analysis vừa mở rộng nền tảng Controlled Voice Arena, bổ sung bảng xếp hạng cho 9 ngôn ngữ bao gồm tiếng Việt, giúp đánh giá chất lượng các mô hình chuyển đổi văn bản thành giọng nói (TTS) một cách khách quan.

22/09

Thứ Ba · 1 tin
Artificial Analysis@ArtificialAnlys
Mô hìnhĐiểm AI 45/100

Artificial Analysis công bố chuẩn đánh giá độ chuẩn xác của công nghệ chuyển văn bản thành giọng nói (TTS)

Announcing the Artificial Analysis Pronunciation Robustness benchmark, measuring how reliably Text t…

DịchArtificial Analysis vừa ra mắt bộ tiêu chuẩn đánh giá khả năng phát âm của các mô hình TTS. Google Gemini 3.1 Flash dẫn đầu với tỷ lệ chính xác 88,1%, theo sau là SpaceXAI và ElevenLabs.

19/09

Thứ Bảy · 1 tin
IT Home
Mô hìnhĐiểm AI 63/100

Cùng sự kiệnAlibaba ra mắt Qwen3.8-LiveTranslate: Mô hình thông dịch trực tiếp với độ trễ cực thấp

Alibaba giới thiệu Qwen3.8-LiveTranslate, mô hình thông dịch thời gian thực sử dụng kiến trúc Hybrid MoE Thinker-Talker, giúp giảm độ trễ trung bình xuống còn 2,3 giây.

Cùng sự kiện, bài đại diện «Qwen ra mắt mô hình dịch thuật trực tiếp Qwen3.8-LiveTranslate»

18/09

Thứ Sáu · 1 tin
Testing Catalog@testingcatalog
Sản phẩmĐiểm AI 39/100

Grok Bot sắp ra mắt tính năng trò chuyện bằng giọng nói

SPACEXAI 🔥: Grok Bot is getting a voice mode on desktop and mobile apps. > The feature will be ro…

DịchGrok Bot chuẩn bị cập nhật chế độ giọng nói trên cả nền tảng máy tính và di động trong vài ngày tới, hứa hẹn mở ra nhiều trải nghiệm tương tác mới cho người dùng.

11/09

Thứ Sáu · 2 tin
Greg Brockman@gdb
Sản phẩmĐiểm AI 67/100

Cùng sự kiệnOpenAI chính thức ra mắt mô hình giọng nói GPT-Live-1 trên API

GPT-Live in the API, for empowering builders to create new kinds of applications:

DịchGPT-Live-1 đã có mặt trên OpenAI API, cho phép các nhà phát triển tích hợp khả năng đàm thoại tự nhiên, nghe-nói thời gian thực vào ứng dụng của mình.

Cùng sự kiện, tinh chọn hiển thị «OpenAI ra mắt mô hình giọng nói song công GPT-Live-1 qua API»
Thomas Wolf (Hugging Face đồng sáng lập/CSO)@Thom_Wolf
Sản phẩmĐiểm AI 71/100

Cùng sự kiệnOpenAI chính thức đưa mô hình giọng nói GPT-Live-1 vào API

cute robot spotted

DịchOpenAI vừa tích hợp mô hình GPT-Live-1 vào API, cho phép các nhà phát triển xây dựng ứng dụng với trải nghiệm hội thoại giọng nói tự nhiên, hỗ trợ tương tác hai chiều thời gian thực.

Cùng sự kiện, tinh chọn hiển thị «OpenAI ra mắt mô hình giọng nói song công GPT-Live-1 qua API»

08/09

Thứ Ba · 1 tin
Rohan Paul@rohanpaul_ai
NgànhĐiểm AI 50/100

Cartesia thống trị bảng xếp hạng Voice AI với bộ đôi Sonic-3.6 và Ink-2

There is a subtle architecture shift happening in voice AI. The voice stack is becoming part of the…

DịchCartesia vừa ra mắt Sonic-3.6 (Text-to-Speech) và Ink-2 (Speech-to-Text) với độ trễ cực thấp lần lượt là 90ms và 100ms, trở thành đơn vị duy nhất dẫn đầu cả hai mảng xử lý âm thanh, tối ưu hóa mạnh mẽ cho các tác nhân AI đàm thoại.

03/09

Thứ Năm · 3 tin
Sundar Pichai@sundarpichai
Sản phẩmĐiểm AI 49/100

Google tích hợp tính năng điều khiển bằng giọng nói cho Gemini trên Gmail, Docs và Keep

New Gemini voice capabilities are rolling out so you can search your Gmail inbox, organize thoughts …

DịchSundar Pichai vừa giới thiệu tính năng giọng nói mới trên Gemini, cho phép người dùng tìm kiếm email, quản lý ghi chú và soạn thảo văn bản bằng hội thoại tự nhiên. Tính năng này hiện đã khả dụng cho người dùng đăng ký Google AI.

Thêm 2 nguồn khác đưa tinX: Testing Catalog (@testingcatalog)The Verge: AI
Artificial Analysis@ArtificialAnlys
Hướng dẫnĐiểm AI 58/100

Inworld Realtime TTS-2 soán ngôi đầu bảng xếp hạng giọng nói AI của Artificial Analysis

Inworld's newly released Realtime TTS-2 is the new #1 on the Artificial Analysis Controlled Voice Ar…

DịchMô hình Realtime TTS-2 mới của Inworld vừa đạt 1.123 điểm Elo, vượt qua Cartesia Sonic 3.6 để dẫn đầu bảng xếp hạng Controlled Voice Arena và giữ vị trí thứ hai trong Provider Voice Arena.

Testing Catalog@testingcatalog
Sản phẩmĐiểm AI 51/100

Inworld ra mắt Realtime TTS-2: Sao chép giọng nói chỉ với 5-15 giây

Inworld has released Realtime TTS-2, focused on clarity, and TTS-2 Flash, built for low latency and …

DịchInworld vừa giới thiệu bộ đôi TTS-2 và TTS-2 Flash với khả năng sao chép giọng nói siêu tốc chỉ trong 5-15 giây, hỗ trợ đọc chính xác các mã số phức tạp và tối ưu độ trễ thấp.

02/09

Thứ Tư · 1 tin
Testing Catalog@testingcatalog
Mô hìnhĐiểm AI 56/100

Cùng sự kiệnMeta ra mắt Muse Voice Transcribe: Mô hình chuyển đổi giọng nói thành văn bản đa ngôn ngữ

META 🔥: A new Muse Voice Transcribe model from MSL is now available on Meta models API. > SOTA …

DịchMeta vừa phát hành Muse Voice Transcribe trên API, hỗ trợ hơn 70 ngôn ngữ với khả năng chuyển đổi giọng nói thời gian thực đạt chuẩn SOTA. Mô hình này hiện đã được tích hợp vào các ứng dụng của Meta và cung cấp tùy chọn bảo mật không lưu trữ dữ liệu cho người dùng doanh nghiệp.

Cùng sự kiện, bài đại diện «Meta ra mắt Muse Voice Transcribe: Mô hình nhận diện âm thanh thời gian thực đột phá»

01/09

Thứ Ba · 1 tin

28/08

Thứ Sáu · 2 tin
MarkTechPost
Mô hìnhĐiểm AI 60/100

Cùng sự kiệnGoogle ra mắt Gemini 3.5 Transcribe: Mô hình chuyển đổi giọng nói thành văn bản với độ chính xác vượt trội

Google vừa giới thiệu Gemini 3.5 Transcribe, mô hình AI đạt tỷ lệ lỗi từ (WER) chỉ 2,6% trên hơn 85 ngôn ngữ, hỗ trợ xử lý cả tệp ghi âm lẫn luồng dữ liệu trực tiếp.

Cùng sự kiện, tinh chọn hiển thị «Hướng dẫn toàn tập về Gemini 3.5 Transcribe: Giải pháp chuyển đổi giọng nói thành văn bản tối ưu»
Gemini@GeminiApp
Sản phẩmĐiểm AI 53/100

Gemini Live nâng cấp tính năng Agent: Điều khiển mọi tác vụ bằng giọng nói

New productivity upgrades to Gemini Live bring in agentic capabilities, so you can do more with your…

DịchGemini Live vừa được bổ sung khả năng của AI Agent, cho phép người dùng xử lý email, nghe tóm tắt tin tức hàng ngày và tương tác với các ứng dụng như Spark chỉ bằng giọng nói.

27/08

Thứ Năm · 2 tin
Testing Catalog@testingcatalog
Sản phẩmĐiểm AI 34/100

Meta AI chuẩn bị mang chế độ giọng nói trở lại

Meta is planning to bring back its voice mode on Meta AI soon. > A new voice election UI now appear…

DịchMeta đang rục rịch tái khởi động tính năng giọng nói trên Meta AI, với giao diện tùy chọn mới đã xuất hiện ẩn trong phần cài đặt. Nhiều khả năng tính năng này sẽ đi kèm với các mô hình ngôn ngữ nâng cấp mới.

Testing Catalog@testingcatalog
Sản phẩmĐiểm AI 17/100

Grok sắp hỗ trợ tính năng gọi thoại thời gian thực

SPACEXAI 🔥: Grok Bot may soon get voice call support! Users will be able to chat with Grok bots v…

DịchxAI đang phát triển tính năng gọi thoại cho Grok, cho phép người dùng trò chuyện trực tiếp với AI như một trợ lý cá nhân, hứa hẹn khả năng tự động hóa các tác vụ như lên lịch họp trong tương lai.

18/08

Thứ Ba · 1 tin

17/08

Thứ Hai · 1 tin
TechCrunch: AI
Mô hìnhĐiểm AI 50/100

Wispr gọi vốn thành công 280 triệu USD, đạt định giá 2 tỷ USD và lấn sân sang mảng ghi chú cuộc họp

Startup Wispr vừa huy động 280 triệu USD để nâng định giá lên 2 tỷ USD, đồng thời ra mắt mô hình Canto giúp giảm tỷ lệ lỗi chính tả khi đọc chính tả và giới thiệu công cụ ghi chú cuộc họp cạnh tranh trực tiếp với các đối thủ như Fireflies.

13/08

Thứ Năm · 1 tin
Tổng 20 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (31 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “công nghệ giọng nói” | AIHOT.vn