Mô hình
Top mô hình nhận diện giọng nói (ASR) mã nguồn mở năm 2026: So sánh WER, ngôn ngữ và độ trễ
(giờ Việt Nam)
Tóm tắt AI
Năm 2026 đánh dấu sự bùng nổ của các mô hình ASR thay thế Whisper. Bài viết phân tích 16 mô hình hàng đầu dựa trên độ chính xác, khả năng đa ngôn ngữ và độ trễ thực tế để giúp bạn chọn giải pháp phù hợp nhất.
Bản dịch AI

Lĩnh vực nhận dạng giọng nói mã nguồn mở đã không còn là "độc quyền" của Whisper trong khoảng mười hai tháng qua. Vào tháng 3 năm 2026, Cohere đã phát hành Transcribe, một mô hình 2B theo giấy phép Apache 2.0, chiếm vị trí dẫn đầu trên bảng xếp hạng Hugging Face Open ASR với tỷ lệ lỗi từ (WER) trung bình là 5,42%. Năm tuần sau, IBM ra mắt Granite Speech 4.1 2B với tỷ lệ 5,33%. Kể từ đó, ARK-ASR-3B và MOSS-Transcribe-preview-2B đã ghi nhận những con số thấp hơn nữa.
Vị trí dẫn đầu trên bảng xếp hạng đó hiện nay có khoảng cách chưa đầy 1 điểm WER. Điều này dẫn đến một hệ quả cụ thể cho bất kỳ ai đang chọn mô hình: thứ hạng không còn là biến số quyết định. Thay vào đó, giấy phép, phạm vi ngôn ngữ, hỗ trợ phát trực tuyến (streaming) và chi phí cho mỗi giờ âm thanh mới là yếu tố quan trọng. Bài tổng hợp này so sánh các mô hình dựa trên cả bốn tiêu chí đó.
Trước hết, có một vấn đề với con số trên bảng xếp hạng mà mọi người thường trích dẫn.
Chỉ số trung bình của Open ASR Leaderboard không phải là một đại lượng cố định duy nhất, và các mô hình hiện được liệt kê cạnh nhau không phải tất cả đều được chấm điểm theo cùng một cách.
Con số 5,42% của Cohere là mức trung bình trên tám tập dữ liệu kiểm thử tiếng Anh, bao gồm cả TED-LIUM. Điều này hoàn toàn chính xác: AMI 8,13; Earnings-22 10,86; GigaSpeech 9,34; LibriSpeech clean 1,25; LibriSpeech other 2,37; SPGISpeech 3,08; TED-LIUM 2,49; VoxPopuli 5,87, tính trung bình ra đúng bằng 5,42.
Con số 5,04% của ARK-ASR-3B là mức trung bình trên bảy tập dữ liệu. TED-LIUM không có trong đó. Thẻ thông tin của MOSS-Transcribe-preview-2B nêu rõ điều này: TED-LIUM hiện không phải là một phần trong quá trình chạy bảng xếp hạng và do đó bị loại trừ.
TED-LIUM là một trong những tập dữ liệu dễ nhất trong bộ, vì vậy việc loại bỏ nó sẽ làm tăng mức trung bình. Nếu tính toán lại điểm số theo từng tập dữ liệu mà Cohere đã công bố dựa trên bảy tập dữ liệu giống như ARK, Cohere sẽ đạt 5,84 chứ không phải 5,42. Làm tương tự với Granite Speech 4.1 2B, con số sẽ chuyển từ 5,33 sang 5,65. Trên cơ sở so sánh tương đương, vị thế dẫn đầu của ARK lớn hơn so với những con số tiêu đề gợi ý, chứ không phải nhỏ hơn — nhưng vấn đề là bạn không thể lấy một con số đã công bố trừ đi con số khác để có được kết quả có ý nghĩa.
Hai lưu ý bổ sung cần được đề cập:
Một số điểm số được điều chỉnh công khai để phù hợp với bảng xếp hạng: Thẻ thông tin của MOSS-Transcribe-preview-2B nêu rõ mô hình đã được tinh chỉnh (fine-tuned) bằng học tăng cường (reinforcement learning) trên các tập dữ liệu huấn luyện của Open ASR Leaderboard. Điều này đã được công khai, tốt hơn hầu hết các trường hợp khác, nhưng nó có nghĩa là điểm số đo lường khả năng làm bài kiểm tra thay vì năng lực thực tế.
Dữ liệu theo dõi riêng (private-track) làm thay đổi thứ tự bảng xếp hạng: Appen đã đóng góp các tập đánh giá ẩn bao gồm giọng Úc, Canada, Ấn Độ và Mỹ trong các điều kiện kịch bản và hội thoại. Khi các tập dữ liệu riêng này được bật, zoom/scribe_v1 chuyển từ hạng 4 lên hạng 1 và mô hình dẫn đầu bảng xếp hạng công khai bị tụt một bậc. Các mô hình được tinh chỉnh cho giọng đọc sạch sẽ bị suy giảm hiệu suất đáng kể đối với âm thanh hội thoại tự phát.
Hãy sử dụng bảng xếp hạng để lập danh sách rút gọn. Đừng sử dụng nó để chọn người chiến thắng.
Nhóm độ chính xác
Cohere Transcribe (2B, Apache 2.0, 14 ngôn ngữ) là mô hình thực sự được đưa vào sản xuất. Nó đã được tải xuống hơn 620.000 lần trong tháng qua và hỗ trợ thời gian chạy (runtime) trên transformers, vLLM, mlx-audio cho Apple Silicon, một bản port Rust và bản dựng WebGPU. Đây là bộ mã hóa Conformer với bộ giải mã Transformer nhẹ, được huấn luyện từ đầu. Cohere cũng đã thực hiện đánh giá ưu tiên của con người, trong đó các chuyên gia chú giải đã chấm điểm các bản ghi về khả năng bảo toàn ý nghĩa, ảo giác (hallucination) và thực thể có tên: tỷ lệ thắng trung bình 61%, 78% so với IBM Granite 4.0 1B Speech và 64% so với Whisper large-v3.
Phần hạn chế trong thẻ mô hình của nó đặc biệt trung thực và nên được đọc trước khi quyết định sử dụng. Không có tính năng tự động phát hiện ngôn ngữ, không có dấu thời gian (timestamps) và không có phân đoạn người nói (diarization), và mô hình rất "hăng hái" trong việc phiên âm cả khoảng lặng, vì vậy Cohere khuyến nghị nên thêm VAD hoặc cổng nhiễu (noise gate) phía trước. Kho lưu trữ (repo) cũng bị chặn sau một thỏa thuận cung cấp thông tin liên hệ mặc dù giấy phép là Apache 2.0.
Granite Speech 4.1 2B (2B, Apache 2.0) là lựa chọn tốt hơn nếu bạn cần năng lực thực tế thay vì một con số thấp hơn. Hỗ trợ sáu ngôn ngữ cho ASR cộng với dịch thuật giọng nói hai chiều, tạo độ lệch (biasing) danh sách từ khóa cho tên riêng và thuật ngữ chuyên ngành, dấu câu và viết hoa đúng quy tắc bao gồm cả danh từ tiếng Đức. Được huấn luyện trên 174.000 giờ. RTFx 231,29. IBM cũng phát hành hai phiên bản anh em: -plus bổ sung ASR có gán nhãn người nói và dấu thời gian cấp độ từ, và -nar được thảo luận bên dưới.
Canary-Qwen-2.5B (2.5B, CC-BY-4.0, tiếng Anh) kết hợp bộ mã hóa FastConformer với bộ giải mã Qwen3-1.7B và chạy ở hai chế độ — phiên âm thuần túy, hoặc chế độ LLM nơi bộ giải mã tóm tắt và trả lời các câu hỏi về bản ghi. 5,63% WER tại RTFx 418. Lưu ý rằng AMI đã được lấy mẫu quá mức (oversampled) lên khoảng 15% dữ liệu huấn luyện, điều này làm lệch đầu ra theo hướng các bản ghi nguyên văn giữ nguyên các lỗi ngập ngừng. Đó là một tính năng cho công việc pháp lý nhưng lại là sự phiền toái cho biên bản cuộc họp.
Qwen3-ASR-1.7B (Apache 2.0) bao phủ 52 ngôn ngữ và phương ngữ — 30 ngôn ngữ cộng với 22 phương ngữ tiếng Trung — ở mức 5,76%. Nó đi kèm với bộ công cụ suy luận đầy đủ và một mô hình căn chỉnh cưỡng bức (forced-alignment) riêng biệt cho dấu thời gian bằng 11 ngôn ngữ. Đối với bất kỳ thứ gì liên quan đến tiếng Quan Thoại hoặc giọng địa phương Trung Quốc, đây là điểm khởi đầu rõ ràng.
Nhóm thông lượng (throughput)
Độ chính xác trên các mô hình hàng đầu hiện nay chênh lệch khoảng một điểm WER. Thông lượng chênh lệch hơn một bậc độ lớn, điều này có nghĩa là thông lượng thường quyết định hóa đơn.
Parakeet TDT 0.6B v3 (0.6B, CC-BY-4.0) là đơn vị dẫn đầu về thông lượng trong số các mô hình mở đa ngôn ngữ ở mức RTFx 3332,74 trên 25 ngôn ngữ châu Âu với tính năng ID ngôn ngữ tự động, xử lý tới 24 phút trong một lần chạy trên A100 80GB. Nó có chi phí 6,32% WER — cao hơn khoảng một điểm so với Granite 4.1 2B nhưng cho tốc độ xử lý âm thanh gấp khoảng mười bốn lần trên mỗi giây GPU.
Granite Speech 4.1 2B-NAR là kết quả kỹ thuật thú vị hơn. Nó không tự hồi quy (non-autoregressive): nó chỉnh sửa giả thuyết CTC trong một lần truyền xuôi (forward pass) bằng cách sử dụng LLM hai chiều, đạt RTFx ~1820 trên một H100 với kích thước batch 128. Nó từ bỏ tiếng Nhật, dịch thuật giọng nói và tạo độ lệch từ khóa để đạt được điều đó.
Qwen3-ASR-0.6B giữ lại tất cả 52 ngôn ngữ và đạt thông lượng gấp 2000 lần ở mức đồng thời 128.
Nhóm phát trực tuyến (streaming)
WER theo batch dường như là bài kiểm tra sai cho một mô hình streaming, dù bảng xếp hạng vẫn chấm điểm chúng. Voxtral Realtime đạt 7,68% và Kyutai STT 2.6B đạt 6,40% — cả hai đều thấp hơn Whisper — và không con số nào cho bạn biết bất cứ điều gì hữu ích về mục đích sử dụng dự kiến của chúng.
Voxtral Mini 4B Realtime 2602 (Apache 2.0, 13 ngôn ngữ) là một mô hình ngôn ngữ 3,4B cùng với bộ mã hóa âm thanh nhân quả (causal) 970M được huấn luyện từ đầu, với cơ chế chú ý cửa sổ trượt (sliding-window attention) trên cả hai nửa để phát trực tuyến hiệu quả không giới hạn. Độ trễ phiên âm có thể cấu hình theo các bước 80ms từ 80ms đến 1200ms, cộng với tùy chọn độc lập 2400ms; Mistral khuyến nghị 480ms là điểm tối ưu và báo cáo rằng ở cài đặt đó, nó ngang bằng với các mô hình mở ngoại tuyến hàng đầu. Nó chạy trên một GPU 16GB duy nhất và có hỗ trợ API vLLM Realtime ngay từ ngày đầu.
Kyutai STT (CC-BY-4.0) có hai dạng: mô hình ~1B tiếng Anh/Pháp với độ trễ 0,5 giây và bộ phát hiện hoạt động giọng nói ngữ nghĩa (semantic VAD) tích hợp, và mô hình 2,6B chỉ tiếng Anh với độ trễ 2,5 giây. Đối với các tác nhân giọng nói (voice agents), VAD ngữ nghĩa quan trọng hơn độ trễ phiên âm — nó dự đoán khi nào người nói thực sự kết thúc, điều này quyết định độ trễ lượt nói cảm nhận được. Một chiếc H100 phục vụ 400 luồng đồng thời trong thời gian thực.
Nhóm phạm vi bao phủ
Omnilingual ASR của Meta (Apache 2.0, tập dữ liệu CC-BY) không cạnh tranh về WER và không nên bị đánh giá như thể nó đang làm vậy. Nó hỗ trợ hơn 1.600 ngôn ngữ một cách tự nhiên và mở rộng lên hơn 5.400 thông qua học trong ngữ cảnh (in-context learning) zero-shot, được xây dựng trên bộ mã hóa wav2vec 2.0 mở rộng lên 7B và được huấn luyện trước trên khoảng 4,3 triệu giờ. Biến thể LLM-ASR 7B đạt tỷ lệ lỗi ký tự (CER) dưới 10% trên 78% ngôn ngữ được hỗ trợ, bao gồm hơn 500 ngôn ngữ chưa từng được phục vụ bởi bất kỳ hệ thống ASR nào trước đây. Kích thước bộ mã hóa chạy từ 300M đến 7B. Meta cũng đã phát hành Omnilingual ASR Corpus bao phủ hơn 350 ngôn ngữ ít được phục vụ.
Whisper large-v3 (1.55B, MIT, 99 ngôn ngữ) đã bị khoảng mười mô hình mở vượt qua về độ chính xác, nhưng nó vẫn là lựa chọn mặc định đúng đắn cho một lớp lớn các dự án. MIT là giấy phép ít bị ràng buộc nhất trong lĩnh vực này. Hệ sinh thái runtime — whisper.cpp, faster-whisper, WhisperX — không có đối thủ tương đương trong số các bản phát hành mới hơn. Nếu yêu cầu của bạn là "ngôn ngữ nào đó, phần cứng nào đó, không cần luật sư giấy phép", thì đây vẫn là câu trả lời.
Ranh giới nghiên cứu
diffusion-gemma-asr-small từ startup Interfaze của YC là bản phát hành sáng tạo nhất về mặt kiến trúc trong năm. Nó tạo ra các bản ghi bằng cách khử nhiễu khuếch tán song song trên canvas 256-token trong 8 đến 16 bước, vì vậy chi phí giải mã không tăng theo độ dài bản ghi. Chỉ khoảng 42 triệu tham số được huấn luyện — 0,16% trọng số — trên nền tảng của DiffusionGemma 26B đóng băng và bộ mã hóa whisper-small đóng băng. Nó đạt 6,6% WER trên LibriSpeech test-clean ở tốc độ nhanh gấp khoảng 11 đến 17 lần thời gian thực. Nó cũng đạt 15,7% trên FLEURS tiếng Anh và 29,6% CER trên FLEURS tiếng Quan Thoại, vì vậy hãy coi con số LibriSpeech là mức trần. Không ai nên triển khai cái này. Mọi người làm việc về ASR nên đọc nó.
MOSS-Transcribe-Diarize 0.9B (Apache 2.0, 50+ ngôn ngữ) giải quyết vấn đề mà hầu hết các bài tổng hợp đều bỏ qua: nó xuất ra nhãn người nói, dấu thời gian từ và bản ghi trong một lần tạo thay vì xâu chuỗi ASR với một ngăn xếp phân đoạn người nói riêng biệt. Ngữ cảnh 128k, khoảng 90 phút âm thanh trong một lần chạy, RTF ~0,017 trên RTX 4090, với tính năng tạo độ lệch từ khóa (hotword biasing).
Sự phân chia giấy phép mà không ai đọc cho đến khi triển khai
Đây là phần thực sự chặn việc phát hành sản phẩm, và lĩnh vực này được chia tách rõ ràng:
Apache 2.0: Cohere Transcribe, Granite Speech 4.1 (cả ba biến thể), Qwen3-ASR (cả hai kích thước), Voxtral Mini Realtime, Omnilingual ASR, ARK-ASR, MOSS-Transcribe. Không có nghĩa vụ ghi công, sử dụng thương mại không hạn chế. Lưu ý rằng kho lưu trữ của Cohere bị chặn sau một thỏa thuận cung cấp thông tin liên hệ mặc dù bản thân giấy phép là Apache 2.0.
MIT: Whisper large-v3. Lựa chọn dễ dãi nhất trong lĩnh vực này.
CC-BY-4.0: Canary-Qwen-2.5B, Parakeet TDT 0.6B v3, Kyutai STT. Có thể sử dụng thương mại, nhưng bắt buộc phải ghi công. Đối với một sản phẩm nhúng hoặc API white-labeled, đó là một nghĩa vụ tuân thủ thực sự, và đây là lý do phổ biến nhất khiến các nhóm cuối cùng triển khai một mô hình không phải là mô hình chính xác nhất mà họ đã thử nghiệm.
Omnilingual ASR của Meta chia tách hai loại: Apache 2.0 cho các mô hình, CC-BY cho tập dữ liệu.
Cách thực sự để lựa chọn
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.