Nvidia vừa phát hành mô hình Nemotron 3 Diarization với 100 triệu tham số, cho phép nhận diện và phân tách giọng nói của tối đa 8 người cùng lúc trong thời gian thực, hỗ trợ cả ghi âm và luồng âm thanh trực tiếp.
Sarvam AI vừa giới thiệu Saaras V4, mô hình nhận diện giọng nói đạt độ chính xác SOTA trên toàn bộ 22 ngôn ngữ chính thức của Ấn Độ, đồng thời bổ sung khả năng xử lý đa dạng các giọng tiếng Anh quốc tế.
Recommended benchmark. I expect voice to become one of the main ways people interact with robots a…
DịchBRIDGE ASR 2.0 đánh giá 23 mô hình nhận diện giọng nói qua các cuộc hội thoại thực tế, hỗ trợ 18 ngôn ngữ Ấn Độ cùng tiếng Tây Ban Nha, Bồ Đào Nha và Việt Nam, tập trung vào khả năng xử lý từ ngữ pha trộn (code-switch).
Apple giới thiệu phương pháp mới giúp giảm sai số trong học máy liên kết ASR bán giám sát, cải thiện hiệu suất nhận diện giọng nói đáng kể bằng cách ổn định nhãn giả và cập nhật máy chủ liên tục.
iFLYTEK vừa phát hành Spark-ASR-2.0, tối ưu hóa khả năng nhận diện giọng nói trong môi trường ồn, phương ngữ và chuyển đổi linh hoạt giữa tiếng Trung - Anh với chi phí suy luận chỉ tăng 10% so với bản tiền nhiệm.
NVIDIA vừa phát hành Nemotron 3 Diarization trên Hugging Face, mô hình mã nguồn mở 100M tham số có khả năng theo dõi thời gian thực tới 8 người nói và xử lý chồng lấn âm thanh, cho phép sử dụng thương mại.
Alibaba giới thiệu bộ 5 mô hình Qwen-Audio-3.1 chuyên về nhận diện (ASR) và tổng hợp giọng nói (TTS) với khả năng xử lý đa ngôn ngữ, cảm xúc và âm thanh môi trường vượt trội, đồng thời cắt giảm mạnh chi phí API lên đến 95%.
iFlytek giới thiệu Spark-ASR-2.0 với khả năng nhận diện vượt trội trong môi trường ồn ào và đa ngôn ngữ, đồng thời tối ưu chi phí vận hành. Mô hình sẽ sớm có mặt trên bộ gõ iFlytek và các thiết bị phần cứng của hãng.
StepFun has released StepAudio 3 ASR, ranking #1 on the AA-WER Index for non-streaming Speech to Tex…
DịchStepFun vừa ra mắt StepAudio 3 ASR, đạt tỷ lệ lỗi từ (WER) chỉ 1,7% trên bảng xếp hạng của Artificial Analysis, vượt xa thành tích 4,7% của phiên bản tiền nhiệm.
TeleAntiFraud 2.0 cung cấp quy trình tạo dữ liệu linh hoạt, giúp phân biệt chính xác giữa cuộc gọi lừa đảo và cuộc gọi dịch vụ thông thường dựa trên ngữ cảnh thực tế, hỗ trợ cập nhật các kịch bản lừa đảo mới nhất.
our dictation is really good! I never type if I'm alone!
DịchTính năng nghe đọc (dictation) trên Muse đang gây ấn tượng mạnh với người dùng nhờ độ chính xác cao, khiến nhiều người quyết định thay thế các công cụ cũ như WhisperFlow.
SpaceXAI has released Grok Voice Transcribe 2.0, taking the #1 spot for Final Transcript accuracy an…
DịchMô hình Grok Voice Transcribe 2.0 của xAI vừa xác lập kỷ lục mới trên bảng xếp hạng AA-WER, đạt tỷ lệ lỗi từ (WER) chỉ 2,7% với độ trễ cực thấp ngay sau khi kết thúc câu lệnh.
Introducing Grok Voice Transcribe 2.0. It's the world's most accurate speech transcription model.
DịchxAI vừa giới thiệu Grok Voice Transcribe 2.0, được khẳng định là mô hình chuyển đổi giọng nói thành văn bản có độ chính xác cao nhất hiện nay trên toàn cầu.
Diễn biến sự kiện · 9 bài →Thêm 6 nguồn khác đưa tinX: Andrew Milich (@milichab)X: Kim (@kimmonismus)IT HomeMarkTechPostX: Artificial Analysis (@ArtificialAnlys)X: Testing Catalog (@testingcatalog)
xAI vừa giới thiệu Grok Voice Transcribe 2.0, cải thiện độ chính xác gấp đôi so với bản tiền nhiệm trong khi giữ nguyên giá. Mô hình này hiện dẫn đầu bảng xếp hạng của Artificial Analysis về khả năng nhận diện đa ngôn ngữ và giảm đáng kể tỷ lệ lỗi từ ngữ.
Diễn biến sự kiện · 9 bài →Thêm 3 nguồn khác đưa tinIT HomeX: Elon Musk (@elonmusk, xAI)X: Eric Zakariasson (@ericzakariasson)
Vì sao đáng đọc: Đây là bước tiến quan trọng của xAI trong lĩnh vực xử lý âm thanh, có tính ứng dụng thực tế cao và hiệu suất vượt trội so với các đối thủ cạnh tranh.
Qwen3.8-Omni-Flash cải thiện 25% hiệu suất, giảm tỷ lệ lỗi nhận diện giọng nói trong hội họp từ 88% xuống 3% và hỗ trợ xử lý âm thanh/video liên tục 1 giờ. Đặc biệt, giá thành giảm mạnh và ra mắt phiên bản Realtime với độ trễ cực thấp.
Voice agents should consume speech incrementally but only act on committed text, because a fast tran…
DịchNetEase Youdao giới thiệu mô hình nhận diện giọng nói thời gian thực Confucius4-R2T2, sử dụng kỹ thuật Longest Stable Prefix để đảm bảo văn bản đã xuất ra sẽ không bị thay đổi. Mô hình dựa trên Qwen3-ASR, cho phép tùy chỉnh thuật ngữ chuyên ngành linh hoạt mà không cần huấn luyện lại.
Introducing StepAudio 3, our new family of 5 audio models for real-time voice, speech recognition, s…
DịchStepFun vừa trình làng bộ 5 mô hình StepAudio 3, dẫn đầu bảng xếp hạng Artificial Analysis về khả năng hội thoại và suy luận giọng nói, đồng thời đạt tỷ lệ lỗi nhận diện (ASR) cực thấp chỉ 1,7%.
Nghiên cứu mô tả quá trình phát triển Sophea, hệ thống nhận diện giọng nói song ngữ Hy Lạp - Anh, tập trung vào việc tối ưu hóa dữ liệu và vượt qua các tiêu chuẩn khắt khe về độ chính xác trong môi trường thực tế.
Loa thông minh chủ yếu nhận diện phần vần (nguyên âm) trong từ khóa kích hoạt, cho phép bạn thay đổi phụ âm mà vẫn có thể điều khiển thiết bị. Hãy thử thay đổi phụ âm của từ khóa gốc để kiểm chứng mẹo thú vị này.
Xiaomi vừa công bố mô hình CocktailASR-1, giải quyết hiệu quả bài toán 'tiệc cocktail' khi nhận diện giọng nói trong môi trường nhiều người. Mô hình đạt hiệu suất SOTA, hỗ trợ suy luận theo chuỗi tư duy và đã được mở mã nguồn trên GitHub.
My criteria for buying tech have changed a lot over the years. The biggest limitation of the smartp…
DịchHojo-ASR-Multi-V1 vừa gia nhập Open ASR Leaderboard với vị trí thứ 7 toàn cầu và đứng đầu trong nhóm mô hình mã nguồn mở, đạt tỷ lệ lỗi từ (WER) trung bình ấn tượng 3.54% trên 5 ngôn ngữ.
Microsoft vừa công bố MAI-Transcribe-2, mô hình nhận diện giọng nói được khẳng định là có tốc độ nhanh nhất, độ chính xác cao nhất và chi phí vận hành thấp nhất hiện nay.
VibeVoice là mô hình ASR đầu cuối dựa trên LLM, cho phép xác định người nói ngay khi âm thanh được truyền đến mà không cần bước phân tách giọng nói (diarization) riêng biệt.
Meta giới thiệu Muse Voice Transcribe, mô hình AI tích hợp nhận diện giọng nói, tách lời và phát hiện điểm dừng theo thời gian thực với chi phí 3 USD/1000 phút.
Mark Zuckerberg vừa giới thiệu Muse Voice Transcribe, mô hình AI đầu tiên của MSL có khả năng chuyển đổi giọng nói thành văn bản thời gian thực với độ chính xác cao, tích hợp sẵn tính năng phân tách người nói và phát hiện điểm dừng.
Love this, another huge release from Meta. Lunched Muse Voice Transcribe for real-time voice dicta…
DịchMeta vừa giới thiệu Muse Voice Transcribe, mô hình nhận diện âm thanh thời gian thực với độ chính xác cao (tỷ lệ lỗi từ chỉ 3,1%). Công nghệ này tích hợp khả năng phân tách người nói và phát hiện điểm dừng tự động, mang lại trải nghiệm xử lý luồng âm thanh mượt mà.
Introducing Muse Voice Transcribe, the first real-time audio perception model from Meta Superintelli…
DịchMeta giới thiệu Muse Voice Transcribe, mô hình nhận diện giọng nói thời gian thực hỗ trợ đa ngôn ngữ, phân tách người nói và chuyển đổi ngôn ngữ linh hoạt. Công nghệ này hiện dẫn đầu các bảng xếp hạng về khả năng chuyển đổi giọng nói thành văn bản.
Thêm 7 nguồn khác đưa tinIT HomeX: Rohan Paul (@rohanpaul_ai)MarkTechPostX: Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI) (@alexandr_wang)X: Artificial Analysis (@ArtificialAnlys)X: Testing Catalog (@testingcatalog)X: Mark Zuckerberg (@finkd)
Speech recognition for the world's languages needs benchmarks models cannot easily overfit. @huggin…
DịchHugging Face hợp tác cùng Voice Arena bổ sung bộ dữ liệu Monsoon (tiếng Hindi và tiếng Anh Ấn Độ) vào bảng xếp hạng Open ASR, giúp đánh giá chính xác khả năng nhận diện giọng nói và hạn chế tình trạng mô hình học vẹt.
Voice Arena và Hugging Face vừa tích hợp bộ dữ liệu Monsoon cho tiếng Hindi và tiếng Anh Ấn Độ vào bảng xếp hạng Open ASR, đánh dấu cột mốc ngôn ngữ phi châu Âu đầu tiên được đưa vào hệ thống đánh giá này.
Vì sao đáng đọc: Tin tức quan trọng về tính đa dạng ngôn ngữ trong AI, giúp cải thiện độ chính xác cho các khu vực ít được đại diện, phù hợp với xu hướng phát triển AI toàn cầu.
Đội ngũ WeChat đã làm sạch cơ sở dữ liệu sau khi thuật toán tạo ra các câu từ không phù hợp trong mini-app hỗ trợ nhận diện giọng nói phương ngữ. Hãng khẳng định dữ liệu người dùng được bảo mật và chỉ dùng cho mục đích tối ưu hóa dịch vụ.
Apple giới thiệu phương pháp huấn luyện bán giám sát mới, sử dụng dữ liệu chưa gán nhãn để tối ưu hóa khả năng nhận diện giọng nói pha trộn Trung - Anh thông qua quy trình tinh chỉnh lặp lại.