Giọng nói & Âm thanh
Tiến triển âm thanh AI: Tổng hợp giọng nói, trò chuyện thời gian thực, tạo nhạc và mô hình hiểu âm thanh.
725 bài thu thập36 tinh chọncập nhật đến 28/09 01:03
- Hugging Face: BlogT7 · 29/08 · 04:26
Bảng xếp hạng Open ASR bổ sung ngôn ngữ Nam bán cầu đầu tiên: Tiếng Hindi và tiếng Anh Ấn Độ
Voice Arena và Hugging Face vừa tích hợp bộ dữ liệu Monsoon cho tiếng Hindi và tiếng Anh Ấn Độ vào bảng xếp hạng Open ASR, đánh dấu cột mốc ngôn ngữ phi châu Âu đầu tiên được đưa vào hệ thống đánh giá này.
- Google AI: DEV tác giảT6 · 28/08 · 20:39
Hướng dẫn toàn tập về Gemini 3.5 Transcribe: Giải pháp chuyển đổi giọng nói thành văn bản tối ưu
Google ra mắt Gemini 3.5 Transcribe, mô hình chuyên biệt cho chuyển đổi giọng nói với độ chính xác cao, hỗ trợ hơn 85 ngôn ngữ, tách lời người nói và tùy chỉnh từ vựng chuyên ngành.
- JiQiZhiXinT6 · 28/08 · 13:45
ECCV 2026 Oral: MAVIN - Bước tiến mới giúp AI 'đạo diễn' video đa góc quay theo kịch bản
MAVIN là mô hình tiên phong cho phép AI tạo video đa góc quay với khả năng kiểm soát chặt chẽ về thời gian, đồng bộ âm thanh và nhất quán nhân vật, giải quyết bài toán khó trong việc kể chuyện bằng video dài.
- Hugging Face Daily PapersT5 · 27/08 · 12:45
JoyAI-Echo-1.5: Bước tiến mới trong tạo video dài và thế giới ảo tương tác
JoyAI-Echo-1.5 là hệ thống tạo video và âm thanh đột phá, giúp duy trì tính nhất quán của nhân vật trong các video dài và cho phép tương tác thời gian thực trong môi trường 3D.
- Google DeepMind: BlogT5 · 27/08 · 00:12
Google ra mắt Gemini 3.5 Transcribe: Mô hình chuyển đổi giọng nói siêu chính xác cho tương tác thời gian thực
Google DeepMind vừa trình làng Gemini 3.5 Transcribe, mô hình chuyển đổi giọng nói thành văn bản với độ chính xác vượt trội, hỗ trợ hơn 85 ngôn ngữ, nhận diện đa người nói và tùy chỉnh từ vựng linh hoạt.
- Hugging Face Daily PapersT3 · 25/08 · 09:30
TLive-Omni: Mô hình đa phương thức chuyên biệt cho livestream thương mại điện tử
TLive-Omni là mô hình AI đột phá giúp phân tích livestream bán hàng bằng cách hợp nhất dữ liệu từ video, âm thanh, hình ảnh và văn bản. Với cơ chế Per-vGrid và kỹ thuật tinh chỉnh Faithful-RFT, mô hình giúp AI hiểu ngữ cảnh và phản hồi chính xác các thông tin sản phẩm trong thời gian thực.
- Hugging Face: BlogT6 · 21/08 · 21:06
Hugging Face vạch trần hiện tượng 'gian lận' điểm số trong các mô hình nhận dạng giọng nói (ASR)
Nghiên cứu mới từ Hugging Face chỉ ra nhiều mô hình ASR đạt điểm cao nhờ học thuộc lòng dữ liệu kiểm thử thay vì cải thiện khả năng nhận dạng thực tế, dẫn đến kết quả đánh giá bị thổi phồng.
- JiQiZhiXinT6 · 21/08 · 15:15
FireRedTTS3 từ Xiaohongshu: Mô hình AI 'đa năng' biết nói 24 ngôn ngữ, tự thiết kế giọng nói và chỉnh sửa âm thanh cực chuẩn
FireRedTTS3 tích hợp khả năng sao chép giọng nói zero-shot, thiết kế âm thanh qua mô tả văn bản và chỉnh sửa giọng nói chính xác trong một mô hình duy nhất, đạt hiệu suất dẫn đầu ngành trên nhiều bảng xếp hạng.
- IT HomeT2 · 17/08 · 21:15
Đột phá công nghệ: Chế tạo robot siêu nhỏ vận hành hoàn toàn bằng sóng âm
Các nhà khoa học tại EPFL đã phát triển robot siêu nhỏ (tàu và thiết bị bay) sử dụng buồng cộng hưởng 3D để chuyển đổi sóng âm thành lực đẩy, loại bỏ hoàn toàn nhu cầu về động cơ hay linh kiện cơ khí phức tạp.
- QbitAIT2 · 17/08 · 16:15
Bước ngoặt cho mô hình thế giới: Tạo video 24FPS kèm âm thanh nổi 48kHz theo thời gian thực
Công nghệ mô hình thế giới vừa đạt cột mốc mới khi hỗ trợ tạo video đồng bộ âm thanh chất lượng cao theo thời gian thực và sắp sửa được công bố mã nguồn mở hoàn toàn.
- WeChat: Xiaohongshu Tech (dots.llm)T6 · 14/08 · 18:31
Tiểu Hồng Thư ra mắt dots3-note Preview: Mô hình 280B tối ưu cho tác vụ Agent và đa phương thức
Tiểu Hồng Thư vừa công bố mã nguồn mở dots3-note Preview, mô hình nhẹ nhất trong dòng dots3 với 280B tham số (16B kích hoạt). Sản phẩm hỗ trợ cửa sổ ngữ cảnh 512K, xử lý đa phương thức (văn bản, hình ảnh, âm thanh) và tối ưu hóa cho suy luận phức tạp.
- PandailyT6 · 14/08 · 15:15
Luna-TTS của VUI Labs: 'Ngôi sao' AI Trung Quốc vượt mặt ElevenLabs trên bảng xếp hạng toàn cầu
Startup VUI Labs vừa đưa mô hình Luna-TTS lên vị trí dẫn đầu bảng xếp hạng TTS Arena của Hugging Face, vượt qua các tên tuổi lớn như ElevenLabs nhờ kiến trúc khuếch tán từ Qwen3 và độ trễ cực thấp chỉ 41,6ms.
- MiniMax: Blog (Web)T5 · 13/08 · 23:52
MiniMax ra mắt Music 3.0: Mô hình AI tạo nhạc toàn năng, hỗ trợ mã nguồn mở
MiniMax giới thiệu Music 3.0, mô hình AI thế hệ mới có khả năng sáng tác, phối khí và sản xuất trọn vẹn một bài hát dài tới 5 phút chỉ từ ý tưởng và lời bài hát.
- WeChat: Xiaohongshu Tech (dots.llm)T5 · 13/08 · 17:01
Xiaohongshu ra mắt dots.tts: Mô hình tổng hợp giọng nói tự hồi quy mã nguồn mở mới
Đội ngũ dots của Xiaohongshu vừa công bố mô hình tổng hợp giọng nói (TTS) end-to-end với 2 tỷ tham số, đạt hiệu suất vượt trội về độ chính xác nội dung và khả năng mô phỏng giọng nói trên bộ đánh giá Seed-TTS-Eval.
- JiQiZhiXinT5 · 13/08 · 14:45
Dots.tts: Mô hình tổng hợp giọng nói mã nguồn mở đột phá từ Xiaohongshu
Dots.tts là mô hình TTS 2 tỷ tham số sử dụng cơ chế tự hồi quy trong không gian ẩn liên tục, loại bỏ hoàn toàn token rời rạc để đạt độ chính xác và tính tự nhiên vượt trội, đồng thời hỗ trợ mạnh mẽ cho các tác vụ chỉnh sửa giọng nói.
- IT HomeT4 · 12/08 · 14:13
Ra mắt mô hình LTX-2.5: Tạo video 10 giây 720p chỉ trong 6,8 giây, tích hợp sẵn ComfyUI
LTX-2.5 mang đến khả năng tạo video 720p kèm âm thanh với tốc độ ấn tượng và chi phí tối ưu, đồng thời hỗ trợ tích hợp sâu vào ComfyUI. Các tổ chức có doanh thu dưới 10 triệu USD/năm có thể sử dụng miễn phí.