Hôm qua · 27/09

Chủ Nhật · 2 tin
The Decoder: AI News
Sản phẩmĐiểm AI 56/100

Nvidia ra mắt mô hình mã nguồn mở Nemotron 3 Diarization: Phân tách giọng nói thời gian thực cho 8 người

Nvidia vừa phát hành mô hình Nemotron 3 Diarization với 100 triệu tham số, cho phép nhận diện và phân tách giọng nói của tối đa 8 người cùng lúc trong thời gian thực, hỗ trợ cả ghi âm và luồng âm thanh trực tiếp.

MarkTechPost
Mô hìnhĐiểm AI 47/100

Sarvam AI ra mắt Saaras V4: Mô hình chuyển đổi giọng nói thành văn bản hỗ trợ 22 ngôn ngữ Ấn Độ và tiếng Anh toàn cầu

Sarvam AI vừa giới thiệu Saaras V4, mô hình nhận diện giọng nói đạt độ chính xác SOTA trên toàn bộ 22 ngôn ngữ chính thức của Ấn Độ, đồng thời bổ sung khả năng xử lý đa dạng các giọng tiếng Anh quốc tế.

25/09

Thứ Sáu · 2 tin
Elvis Saravia@omarsar0
Mô hìnhĐiểm AI 39/100

Humyn Labs ra mắt BRIDGE ASR 2.0: Chuẩn đánh giá nhận diện giọng nói đa ngôn ngữ

Recommended benchmark. I expect voice to become one of the main ways people interact with robots a…

DịchBRIDGE ASR 2.0 đánh giá 23 mô hình nhận diện giọng nói qua các cuộc hội thoại thực tế, hỗ trợ 18 ngôn ngữ Ấn Độ cùng tiếng Tây Ban Nha, Bồ Đào Nha và Việt Nam, tập trung vào khả năng xử lý từ ngữ pha trộn (code-switch).

Apple Machine Learning Research
Nghiên cứuĐiểm AI 38/100

Apple công bố giải pháp ASR liên kết bán giám sát: Tối ưu hóa nhãn giả và ổn định cập nhật máy chủ

Apple giới thiệu phương pháp mới giúp giảm sai số trong học máy liên kết ASR bán giám sát, cải thiện hiệu suất nhận diện giọng nói đáng kể bằng cách ổn định nhãn giả và cập nhật máy chủ liên tục.

24/09

Thứ Năm · 2 tin
MarkTechPost
Mô hìnhĐiểm AI 58/100

Cùng sự kiệnNVIDIA ra mắt mô hình tách giọng nói Nemotron 3 Diarization: Hỗ trợ theo dõi 8 người cùng lúc

NVIDIA vừa phát hành Nemotron 3 Diarization trên Hugging Face, mô hình mã nguồn mở 100M tham số có khả năng theo dõi thời gian thực tới 8 người nói và xử lý chồng lấn âm thanh, cho phép sử dụng thương mại.

Cùng sự kiện, bài đại diện «NVIDIA ra mắt mô hình tách giọng nói Nemotron 3 Diarization: Đỉnh cao mới trên VoiceArena»

23/09

Thứ Tư · 3 tin
The Decoder: AI News
Sản phẩmĐiểm AI 67/100

Alibaba ra mắt Qwen-Audio-3.1 với 5 mô hình mới, giảm giá dịch vụ AI âm thanh tới 95%

Alibaba giới thiệu bộ 5 mô hình Qwen-Audio-3.1 chuyên về nhận diện (ASR) và tổng hợp giọng nói (TTS) với khả năng xử lý đa ngôn ngữ, cảm xúc và âm thanh môi trường vượt trội, đồng thời cắt giảm mạnh chi phí API lên đến 95%.

Thêm 2 nguồn khác đưa tinPandailyIT Home
Artificial Analysis@ArtificialAnlys
Sản phẩmĐiểm AI 52/100

StepAudio 3 ASR của StepFun dẫn đầu bảng xếp hạng chuyển đổi giọng nói của Artificial Analysis

StepFun has released StepAudio 3 ASR, ranking #1 on the AA-WER Index for non-streaming Speech to Tex…

DịchStepFun vừa ra mắt StepAudio 3 ASR, đạt tỷ lệ lỗi từ (WER) chỉ 1,7% trên bảng xếp hạng của Artificial Analysis, vượt xa thành tích 4,7% của phiên bản tiền nhiệm.

21/09

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

TeleAntiFraud 2.0: Bộ tiêu chuẩn mới giúp phát hiện lừa đảo viễn thông qua giọng nói

TeleAntiFraud 2.0 cung cấp quy trình tạo dữ liệu linh hoạt, giúp phân biệt chính xác giữa cuộc gọi lừa đảo và cuộc gọi dịch vụ thông thường dựa trên ngữ cảnh thực tế, hỗ trợ cập nhật các kịch bản lừa đảo mới nhất.

19/09

Thứ Bảy · 4 tin
Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI)@alexandr_wang
Sản phẩmĐiểm AI 24/100

Tính năng nhận diện giọng nói của Muse nhận được nhiều lời khen ngợi

our dictation is really good! I never type if I'm alone!

DịchTính năng nghe đọc (dictation) trên Muse đang gây ấn tượng mạnh với người dùng nhờ độ chính xác cao, khiến nhiều người quyết định thay thế các công cụ cũ như WhisperFlow.

Artificial Analysis@ArtificialAnlys
Mô hìnhĐiểm AI 55/100

Cùng sự kiệnGrok Voice Transcribe 2.0 ra mắt: Thiết lập kỷ lục mới về độ chính xác chuyển đổi giọng nói

SpaceXAI has released Grok Voice Transcribe 2.0, taking the #1 spot for Final Transcript accuracy an…

DịchMô hình Grok Voice Transcribe 2.0 của xAI vừa xác lập kỷ lục mới trên bảng xếp hạng AA-WER, đạt tỷ lệ lỗi từ (WER) chỉ 2,7% với độ trễ cực thấp ngay sau khi kết thúc câu lệnh.

Cùng sự kiện, bài đại diện «xAI ra mắt Grok Voice Transcribe 2.0: Độ chính xác gấp đôi, giá không đổi»
SpaceXAI@SpaceXAI
Mô hìnhĐiểm AI 36/100

xAI ra mắt Grok Voice Transcribe 2.0: Mô hình chuyển đổi giọng nói chính xác nhất thế giới

Introducing Grok Voice Transcribe 2.0. It's the world's most accurate speech transcription model.

DịchxAI vừa giới thiệu Grok Voice Transcribe 2.0, được khẳng định là mô hình chuyển đổi giọng nói thành văn bản có độ chính xác cao nhất hiện nay trên toàn cầu.

Diễn biến sự kiện · 9 bài →Thêm 6 nguồn khác đưa tinX: Andrew Milich (@milichab)X: Kim (@kimmonismus)IT HomeMarkTechPostX: Artificial Analysis (@ArtificialAnlys)X: Testing Catalog (@testingcatalog)
xAI: News (Web)
Mô hìnhĐiểm AI 63/100

Tinh chọnxAI ra mắt mô hình chuyển đổi giọng nói Grok Voice Transcribe 2.0 với độ chính xác vượt trội

xAI vừa giới thiệu Grok Voice Transcribe 2.0, cải thiện độ chính xác gấp đôi so với bản tiền nhiệm trong khi giữ nguyên giá. Mô hình này hiện dẫn đầu bảng xếp hạng của Artificial Analysis về khả năng nhận diện đa ngôn ngữ và giảm đáng kể tỷ lệ lỗi từ ngữ.

Diễn biến sự kiện · 9 bài →Thêm 3 nguồn khác đưa tinIT HomeX: Elon Musk (@elonmusk, xAI)X: Eric Zakariasson (@ericzakariasson)

Vì sao đáng đọc: Đây là bước tiến quan trọng của xAI trong lĩnh vực xử lý âm thanh, có tính ứng dụng thực tế cao và hiệu suất vượt trội so với các đối thủ cạnh tranh.

18/09

Thứ Sáu · 1 tin
karminski@karminski3
Mô hìnhĐiểm AI 71/100

Cùng sự kiệnQwen ra mắt Qwen3.8-Omni-Flash: Hiệu suất vượt trội, chi phí giảm sâu

Qwen3.8-Omni-Flash cải thiện 25% hiệu suất, giảm tỷ lệ lỗi nhận diện giọng nói trong hội họp từ 88% xuống 3% và hỗ trợ xử lý âm thanh/video liên tục 1 giờ. Đặc biệt, giá thành giảm mạnh và ra mắt phiên bản Realtime với độ trễ cực thấp.

Cùng sự kiện, bài đại diện «Thông Nghĩa Thiên Vấn ra mắt Qwen3.8-Omni-Flash: Mô hình toàn năng tập trung vào tác tử AI»

17/09

Thứ Năm · 1 tin
Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 55/100

NetEase Youdao ra mắt mô hình nhận diện giọng nói Confucius4-R2T2: Không bao giờ sửa lại văn bản đã xuất

Voice agents should consume speech incrementally but only act on committed text, because a fast tran…

DịchNetEase Youdao giới thiệu mô hình nhận diện giọng nói thời gian thực Confucius4-R2T2, sử dụng kỹ thuật Longest Stable Prefix để đảm bảo văn bản đã xuất ra sẽ không bị thay đổi. Mô hình dựa trên Qwen3-ASR, cho phép tùy chỉnh thuật ngữ chuyên ngành linh hoạt mà không cần huấn luyện lại.

16/09

Thứ Tư · 1 tin
StepFun@StepFun_ai
Mô hìnhĐiểm AI 64/100

Cùng sự kiệnStepFun ra mắt dòng StepAudio 3: Đột phá với 5 mô hình âm thanh toàn diện

Introducing StepAudio 3, our new family of 5 audio models for real-time voice, speech recognition, s…

DịchStepFun vừa trình làng bộ 5 mô hình StepAudio 3, dẫn đầu bảng xếp hạng Artificial Analysis về khả năng hội thoại và suy luận giọng nói, đồng thời đạt tỷ lệ lỗi nhận diện (ASR) cực thấp chỉ 1,7%.

Cùng sự kiện, tinh chọn hiển thị «StepAI ra mắt dòng mô hình âm thanh StepAudio 3: Thống trị bảng xếp hạng toàn cầu của Artificial Analysis»

15/09

Thứ Ba · 1 tin

13/09

Chủ Nhật · 1 tin
Xiaobei@frxiaobei
NgànhĐiểm AI 40/100

Mẹo nhỏ: Bạn có thể 'đánh lừa' loa thông minh bằng cách thay đổi phụ âm của từ khóa kích hoạt

Loa thông minh chủ yếu nhận diện phần vần (nguyên âm) trong từ khóa kích hoạt, cho phép bạn thay đổi phụ âm mà vẫn có thể điều khiển thiết bị. Hãy thử thay đổi phụ âm của từ khóa gốc để kiểm chứng mẹo thú vị này.

11/09

Thứ Sáu · 1 tin

04/09

Thứ Sáu · 1 tin
Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 34/100

Hojo-ASR-Multi-V1: Mô hình nhận diện giọng nói đa ngôn ngữ đạt WER 3.54%, dẫn đầu bảng xếp hạng mã nguồn mở

My criteria for buying tech have changed a lot over the years. The biggest limitation of the smartp…

DịchHojo-ASR-Multi-V1 vừa gia nhập Open ASR Leaderboard với vị trí thứ 7 toàn cầu và đứng đầu trong nhóm mô hình mã nguồn mở, đạt tỷ lệ lỗi từ (WER) trung bình ấn tượng 3.54% trên 5 ngôn ngữ.

03/09

Thứ Năm · 2 tin
Microsoft AI: Blog chính thức (Web)
Mô hìnhĐiểm AI 32/100

Cùng sự kiệnMicrosoft ra mắt MAI-Transcribe-2: Mô hình nhận diện giọng nói nhanh, chính xác và rẻ nhất thế giới

Microsoft vừa công bố MAI-Transcribe-2, mô hình nhận diện giọng nói được khẳng định là có tốc độ nhanh nhất, độ chính xác cao nhất và chi phí vận hành thấp nhất hiện nay.

Cùng sự kiện, bài đại diện «Microsoft ra mắt MAI-Transcribe-2: Mô hình chuyển đổi giọng nói nhanh và rẻ nhất thị trường»
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 51/100

Microsoft Research ra mắt VibeVoice: Công nghệ nhận diện giọng nói theo thời gian thực tích hợp định danh người nói

VibeVoice là mô hình ASR đầu cuối dựa trên LLM, cho phép xác định người nói ngay khi âm thanh được truyền đến mà không cần bước phân tách giọng nói (diarization) riêng biệt.

02/09

Thứ Tư · 4 tin
IT Home
Mô hìnhĐiểm AI 63/100

Cùng sự kiệnMeta ra mắt Muse Voice Transcribe: Mô hình AI nhận diện giọng nói thời gian thực, hỗ trợ tách lời hơn 20 người

Meta giới thiệu Muse Voice Transcribe, mô hình AI tích hợp nhận diện giọng nói, tách lời và phát hiện điểm dừng theo thời gian thực với chi phí 3 USD/1000 phút.

Cùng sự kiện, bài đại diện «Meta ra mắt Muse Voice Transcribe: Mô hình nhận diện âm thanh thời gian thực đột phá»
Mark Zuckerberg@finkd
Mô hìnhĐiểm AI 47/100

Cùng sự kiệnMeta ra mắt Muse Voice Transcribe: Mô hình AI nhận diện âm thanh thời gian thực đột phá

Mark Zuckerberg vừa giới thiệu Muse Voice Transcribe, mô hình AI đầu tiên của MSL có khả năng chuyển đổi giọng nói thành văn bản thời gian thực với độ chính xác cao, tích hợp sẵn tính năng phân tách người nói và phát hiện điểm dừng.

Cùng sự kiện, bài đại diện «Meta ra mắt Muse Voice Transcribe: Mô hình nhận diện âm thanh thời gian thực đột phá»
Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 59/100

Cùng sự kiệnMeta ra mắt Muse Voice Transcribe: Mô hình chuyển đổi giọng nói thành văn bản thời gian thực

Love this, another huge release from Meta. Lunched Muse Voice Transcribe for real-time voice dicta…

DịchMeta vừa giới thiệu Muse Voice Transcribe, mô hình nhận diện âm thanh thời gian thực với độ chính xác cao (tỷ lệ lỗi từ chỉ 3,1%). Công nghệ này tích hợp khả năng phân tách người nói và phát hiện điểm dừng tự động, mang lại trải nghiệm xử lý luồng âm thanh mượt mà.

Cùng sự kiện, bài đại diện «Meta ra mắt Muse Voice Transcribe: Mô hình nhận diện âm thanh thời gian thực đột phá»
AI at Meta@AIatMeta
Mô hìnhĐiểm AI 61/100

Meta ra mắt Muse Voice Transcribe: Mô hình nhận diện âm thanh thời gian thực đột phá

Introducing Muse Voice Transcribe, the first real-time audio perception model from Meta Superintelli…

DịchMeta giới thiệu Muse Voice Transcribe, mô hình nhận diện giọng nói thời gian thực hỗ trợ đa ngôn ngữ, phân tách người nói và chuyển đổi ngôn ngữ linh hoạt. Công nghệ này hiện dẫn đầu các bảng xếp hạng về khả năng chuyển đổi giọng nói thành văn bản.

Thêm 7 nguồn khác đưa tinIT HomeX: Rohan Paul (@rohanpaul_ai)MarkTechPostX: Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI) (@alexandr_wang)X: Artificial Analysis (@ArtificialAnlys)X: Testing Catalog (@testingcatalog)X: Mark Zuckerberg (@finkd)

29/08

Thứ Bảy · 2 tin
Rohan Paul@rohanpaul_ai
Sản phẩmĐiểm AI 38/100

Hugging Face và Voice Arena ra mắt bộ tiêu chuẩn đánh giá ASR tiếng Ấn Độ

Speech recognition for the world's languages needs benchmarks models cannot easily overfit. @huggin…

DịchHugging Face hợp tác cùng Voice Arena bổ sung bộ dữ liệu Monsoon (tiếng Hindi và tiếng Anh Ấn Độ) vào bảng xếp hạng Open ASR, giúp đánh giá chính xác khả năng nhận diện giọng nói và hạn chế tình trạng mô hình học vẹt.

Hugging Face: Blog
Sản phẩmĐiểm AI 66/100

Tinh chọnBảng xếp hạng Open ASR bổ sung ngôn ngữ Nam bán cầu đầu tiên: Tiếng Hindi và tiếng Anh Ấn Độ

Voice Arena và Hugging Face vừa tích hợp bộ dữ liệu Monsoon cho tiếng Hindi và tiếng Anh Ấn Độ vào bảng xếp hạng Open ASR, đánh dấu cột mốc ngôn ngữ phi châu Âu đầu tiên được đưa vào hệ thống đánh giá này.


Vì sao đáng đọc: Tin tức quan trọng về tính đa dạng ngôn ngữ trong AI, giúp cải thiện độ chính xác cho các khu vực ít được đại diện, phù hợp với xu hướng phát triển AI toàn cầu.

26/08

Thứ Tư · 1 tin
IT Home
Sản phẩmĐiểm AI 31/100

WeChat lên tiếng về sự cố nội dung phản cảm trong mini-app 'Phương ngữ'

Đội ngũ WeChat đã làm sạch cơ sở dữ liệu sau khi thuật toán tạo ra các câu từ không phù hợp trong mini-app hỗ trợ nhận diện giọng nói phương ngữ. Hãng khẳng định dữ liệu người dùng được bảo mật và chỉ dùng cho mục đích tối ưu hóa dịch vụ.

21/08

Thứ Sáu · 1 tin
Tổng 31 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (60 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Nhận diện giọng nói” | AIHOT.vn