# iFlytek ra mắt mô hình nhận diện giọng nói Spark-ASR-2.0, tích hợp vào bộ gõ iFlytek

- Nguồn: IT Home
- Thời gian phát hành: 2026-09-23 15:35 (giờ Việt Nam)
- Điểm AI: 49/100
- Link AIHOT.vn: https://aihot.vn/items/d0bc8fb7501d061a
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmudwe12i0aafroghfzr5furk
- Link gốc: https://www.ithome.com/1/006/345.htm

## Tóm tắt AI

iFlytek giới thiệu Spark-ASR-2.0 với khả năng nhận diện vượt trội trong môi trường ồn ào và đa ngôn ngữ, đồng thời tối ưu chi phí vận hành. Mô hình sẽ sớm có mặt trên bộ gõ iFlytek và các thiết bị phần cứng của hãng.

## Thân bài

[IT](https://www.ithome.com/) ngày 23 tháng 9, hôm nay, iFLYTEK chính thức ra mắt mô hình lớn nhận dạng giọng nói thế hệ mới nhất Spark-ASR-2.0.

Theo giới thiệu chính thức, Spark-ASR-2.0 đã cải thiện đáng kể hiệu quả nhận dạng giọng nói tổng thể nhờ các đổi mới công nghệ then chốt như phối hợp giữa phi tự hồi quy và tự hồi quy tăng cường LLM, kết hợp tăng cường văn bản và âm thanh hỗn hợp Trung-Anh, cùng khả năng chèn ngữ cảnh động. Đặc biệt, mô hình có những cải tiến rõ rệt trong nhận dạng phổ thông (hỗn hợp Trung-Anh, phương ngữ, thuật ngữ chuyên ngành), nhận dạng trong môi trường âm thanh phức tạp (nhiễu cao, âm lượng nhỏ, tốc độ nói nhanh, giọng trẻ em), nhận dạng ngữ cảnh và tính chuẩn xác, trôi chảy của văn bản. Trong khi hiệu suất được nâng cao, chi phí suy luận tổng thể của Spark-ASR-2.0 chỉ tăng 10% so với Spark-ASR-1.0.

Phía công ty cho biết: "Nếu như nhận dạng giọng nói trước đây theo đuổi việc khôi phục nội dung được nói một cách chính xác từng chữ, thì Spark-ASR-2.0 còn tiến xa hơn khi giúp kết quả nhận dạng trở nên 'trôi chảy thành văn' — đồng thời với việc nâng cao độ chính xác, mô hình còn kết hợp logic ngữ cảnh và hiểu biết ngữ nghĩa để tinh giản các biểu đạt dư thừa, tinh chỉnh các chi tiết, giúp văn bản mạch lạc và rõ nghĩa hơn."

So với Spark-ASR-1.0, Spark-ASR-2.0 có những tiến bộ rõ rệt trong các kịch bản cốt lõi của nhận dạng giọng nói, đặc biệt là sự cải thiện đáng kể về hiệu quả trong các khía cạnh như hỗn hợp Trung-Anh, phương ngữ, môi trường nhiễu cao, tính trôi chảy và chuẩn mực của văn bản, giúp WER (tỷ lệ lỗi từ) giảm đáng kể.

So với các tiêu chuẩn tốt nhất hiện nay trong ngành, Spark-ASR-2.0 sở hữu ưu thế vượt trội về phương ngữ, môi trường nhiễu cao và âm lượng nhỏ, một lần nữa khẳng định sức mạnh của nhận dạng giọng nói trong các kịch bản âm thanh phức tạp, với hiệu quả các tác vụ chính đều tốt hơn mức tối ưu của ngành.

![图片](https://img.ithome.com/newsuploadfiles/2026/9/803a7cd8-9a5f-44d1-a152-c37c201c37e6.jpg?x-bce-process=image/format,f_auto)

Các tác vụ ASR trong tập kiểm thử sử dụng WER / CER làm chỉ số đánh giá, giá trị càng thấp thì hiệu quả càng tốt.

* Tập kiểm thử được lấy từ dữ liệu yêu cầu tác vụ giọng nói thực tế, với nguồn phân bổ bao gồm các cập nhật luân phiên từ ứng dụng iFLYTEK Spark, ứng dụng iFLYTEK Hear, máy phiên dịch iFLYTEK, bộ gõ iFLYTEK, và các kịch bản thực tế của nhà phát triển trên nền tảng mở iFLYTEK API, v.v.

Theo tìm hiểu của IT, Spark-ASR-2.0 sẽ bắt đầu được triển khai dần trên bộ gõ iFLYTEK từ ngày mai và cung cấp dịch vụ API thông qua nền tảng mở iFLYTEK. Ngoài ra, Spark-ASR-2.0 cũng sẽ lần lượt được ứng dụng trên nhiều sản phẩm và dịch vụ khác như kính AI iFLYTEK, sổ tay văn phòng thông minh iFLYTEK, iFLYTEK Hear, v.v.
