Recommended benchmark. I expect voice to become one of the main ways people interact with robots a…
DịchBRIDGE ASR 2.0 đánh giá 23 mô hình nhận diện giọng nói qua các cuộc hội thoại thực tế, hỗ trợ 18 ngôn ngữ Ấn Độ cùng tiếng Tây Ban Nha, Bồ Đào Nha và Việt Nam, tập trung vào khả năng xử lý từ ngữ pha trộn (code-switch).
Apple giới thiệu phương pháp mới giúp giảm sai số trong học máy liên kết ASR bán giám sát, cải thiện hiệu suất nhận diện giọng nói đáng kể bằng cách ổn định nhãn giả và cập nhật máy chủ liên tục.
Nghiên cứu giới thiệu phương pháp loại bỏ 6 lớp ít quan trọng nhất trong bộ mã hóa Whisper, giúp giảm 18,5% kích thước mô hình mà không cần thay đổi cấu trúc suy luận. Hiệu suất được khôi phục ấn tượng thông qua kỹ thuật chưng cất từ dữ liệu âm thanh không nhãn.
⚡ Meet Qwen-Audio-3.1! ASR, TTS & Realtime are fully upgraded, joined by two new models: TTS-Next fo…
DịchQwen giới thiệu Qwen-Audio-3.1 với 5 mô hình mới, bổ sung TTS-Next và ASR-Next cùng khả năng tương tác thời gian thực thông minh. Đặc biệt, chi phí sử dụng được cắt giảm mạnh tới 95%, hỗ trợ nhận diện cảm xúc và phản hồi tự nhiên hơn.
Vì sao đáng đọc: Nhà phát hành công bố chi tiết năng lực của năm mô hình âm thanh cùng ba mức giảm giá, giúp độc giả đối chiếu với nhu cầu thực tế để đánh giá chi phí thay thế.
Tại sự kiện Apsara 2026, Alibaba giới thiệu Qwen3.8-LiveTranslate với độ trễ giảm xuống còn 2.3 giây, đồng thời công bố dòng Qwen-Audio-3.1 hỗ trợ ASR, TTS và âm thanh điện ảnh thời gian thực.
Alibaba vừa giới thiệu 5 mô hình thuộc dòng Qwen-Audio-3.1 bao gồm ASR, ASR-Next, TTS, TTS-Next và Realtime, hỗ trợ toàn diện từ nhận diện, tổng hợp giọng nói đến tương tác thời gian thực.
StepFun has released StepAudio 3 ASR, ranking #1 on the AA-WER Index for non-streaming Speech to Tex…
DịchStepFun vừa ra mắt StepAudio 3 ASR, đạt tỷ lệ lỗi từ (WER) chỉ 1,7% trên bảng xếp hạng của Artificial Analysis, vượt xa thành tích 4,7% của phiên bản tiền nhiệm.
Voice agents should consume speech incrementally but only act on committed text, because a fast tran…
DịchNetEase Youdao giới thiệu mô hình nhận diện giọng nói thời gian thực Confucius4-R2T2, sử dụng kỹ thuật Longest Stable Prefix để đảm bảo văn bản đã xuất ra sẽ không bị thay đổi. Mô hình dựa trên Qwen3-ASR, cho phép tùy chỉnh thuật ngữ chuyên ngành linh hoạt mà không cần huấn luyện lại.
Nghiên cứu mô tả quá trình phát triển Sophea, hệ thống nhận diện giọng nói song ngữ Hy Lạp - Anh, tập trung vào việc tối ưu hóa dữ liệu và vượt qua các tiêu chuẩn khắt khe về độ chính xác trong môi trường thực tế.
My criteria for buying tech have changed a lot over the years. The biggest limitation of the smartp…
DịchHojo-ASR-Multi-V1 vừa gia nhập Open ASR Leaderboard với vị trí thứ 7 toàn cầu và đứng đầu trong nhóm mô hình mã nguồn mở, đạt tỷ lệ lỗi từ (WER) trung bình ấn tượng 3.54% trên 5 ngôn ngữ.
VibeVoice là mô hình ASR đầu cuối dựa trên LLM, cho phép xác định người nói ngay khi âm thanh được truyền đến mà không cần bước phân tách giọng nói (diarization) riêng biệt.
Meta Superintelligence Labs giới thiệu Muse Voice Transcribe, mô hình tự hồi quy đầu tiên xử lý đồng thời nhận diện giọng nói, phân tách hơn 20 người nói và phát hiện điểm cuối mà không cần hậu xử lý.
Introducing Muse Voice Transcribe, the first real-time audio perception model from Meta Superintelli…
DịchMeta giới thiệu Muse Voice Transcribe, mô hình nhận diện giọng nói thời gian thực hỗ trợ đa ngôn ngữ, phân tách người nói và chuyển đổi ngôn ngữ linh hoạt. Công nghệ này hiện dẫn đầu các bảng xếp hạng về khả năng chuyển đổi giọng nói thành văn bản.
Thêm 7 nguồn khác đưa tinIT HomeX: Rohan Paul (@rohanpaul_ai)MarkTechPostX: Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI) (@alexandr_wang)X: Artificial Analysis (@ArtificialAnlys)X: Testing Catalog (@testingcatalog)X: Mark Zuckerberg (@finkd)
Speech recognition for the world's languages needs benchmarks models cannot easily overfit. @huggin…
DịchHugging Face hợp tác cùng Voice Arena bổ sung bộ dữ liệu Monsoon (tiếng Hindi và tiếng Anh Ấn Độ) vào bảng xếp hạng Open ASR, giúp đánh giá chính xác khả năng nhận diện giọng nói và hạn chế tình trạng mô hình học vẹt.
Voice Arena và Hugging Face vừa tích hợp bộ dữ liệu Monsoon cho tiếng Hindi và tiếng Anh Ấn Độ vào bảng xếp hạng Open ASR, đánh dấu cột mốc ngôn ngữ phi châu Âu đầu tiên được đưa vào hệ thống đánh giá này.
Vì sao đáng đọc: Tin tức quan trọng về tính đa dạng ngôn ngữ trong AI, giúp cải thiện độ chính xác cho các khu vực ít được đại diện, phù hợp với xu hướng phát triển AI toàn cầu.
Google ra mắt Gemini 3.5 Transcribe, mô hình chuyên biệt cho chuyển đổi giọng nói với độ chính xác cao, hỗ trợ hơn 85 ngôn ngữ, tách lời người nói và tùy chỉnh từ vựng chuyên ngành.
Diễn biến sự kiện · 6 bài →Thêm 4 nguồn khác đưa tinMarkTechPostHacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)The Decoder: AI NewsIT Home
Vì sao đáng đọc: Đây là công cụ cực kỳ hữu ích cho người làm nội dung và lập trình viên, giải quyết trực tiếp các vấn đề về độ chính xác và chi phí trong xử lý âm thanh.
25/08
Thứ Ba · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứu chỉ ra rằng việc sử dụng đồ thị thực thể và tái viết truy vấn trong RAG đa chặng làm khuếch đại sai sót từ ASR, khiến độ chính xác giảm mạnh hơn so với tìm kiếm thuần túy khi dữ liệu đầu vào bị nhiễu.
Nghiên cứu mới từ Hugging Face chỉ ra nhiều mô hình ASR đạt điểm cao nhờ học thuộc lòng dữ liệu kiểm thử thay vì cải thiện khả năng nhận dạng thực tế, dẫn đến kết quả đánh giá bị thổi phồng.
Vì sao đáng đọc: Bài viết cung cấp góc nhìn chuyên sâu về lỗ hổng trong đánh giá AI, giúp cộng đồng nhận diện thực trạng 'học vẹt' của các mô hình hiện nay.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứu mới chỉ ra rằng các mô hình ASR hàng đầu có xu hướng 'học vẹt' văn bản tham chiếu thay vì thực sự hiểu âm thanh, dẫn đến điểm số ảo dù dữ liệu đầu vào bị nhiễu hoặc thiếu hụt.
Alibaba chính thức đưa Qwen-Audio-3.0 lên nền tảng Qwen và Bailian. Dòng mô hình này bao gồm ASR, TTS và tương tác thời gian thực, hiện đang giữ vị trí số 1 thế giới trên bảng xếp hạng Artificial Analysis.