Mô hình
Tencent ra mắt Hunyuan Hy ASR 3.0: Bước tiến mới trong nhận diện giọng nói theo ngữ cảnh
(giờ Việt Nam)
Tóm tắt AI
Tencent vừa giới thiệu bản xem trước của mô hình Hunyuan Hy ASR 3.0 với khả năng hiểu ngữ cảnh vượt trội, hiện đã được tích hợp trực tiếp vào trợ lý AI Yuanbao.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
04/08/2026 16:58:21 Nguồn: QbitAI
Đã tích hợp trên Yuanbao
Ngày 4 tháng 8, Tencent Hunyuan chính thức ra mắt thế hệ mô hình nhận diện giọng nói mới Hy ASR 3.0 preview. Dựa trên khả năng hiểu ngôn ngữ của mô hình ngôn ngữ lớn thế hệ mới nhất Hy3, Hy ASR 3.0 preview kết hợp khả năng nhận diện giọng nói độ chính xác cao với khả năng hiểu ngữ nghĩa chuyên sâu. Mô hình đã đạt được sự cải tiến toàn diện ở các khía cạnh cốt lõi như nhận diện tổng quát, nhận thức ngữ cảnh, độ bền bỉ trong nhiều tình huống và khả năng hỗ trợ phương ngữ. Hệ thống có thể đưa ra kết quả chuyển đổi văn bản chính xác, mạch lạc và sát với ý định của người dùng hơn trong các đầu vào thực tế phức tạp, chuyển mình từ "chuyển đổi từng chữ, tối ưu hóa đơn điểm" sang "hiểu ngữ cảnh, tương thích tình huống, xuất kết quả ngay lập tức".
Hy ASR 3.0 preview thể hiện hiệu suất vượt trội trên nhiều tập dữ liệu đánh giá mã nguồn mở và tập dữ liệu tự xây dựng. Trong các tập đánh giá mã nguồn mở, Hy ASR 3.0 preview kiểm soát WER (Word Error Rate - Tỷ lệ lỗi từ) ở mức khoảng 3% đối với nhiều ngôn ngữ, trong đó tiếng Trung phổ thông đạt WER 3.34%, tiếng Anh 2.62% và tiếng Quảng Đông 3.12%, dẫn đầu so với các sản phẩm cạnh tranh.

Hiệu suất trên tập đánh giá mã nguồn mở: Hy ASR 3.0 preview dẫn đầu về hiệu suất tổng thể trên các ngôn ngữ và phương ngữ.
Trên tập dữ liệu đánh giá tự xây dựng, Hy ASR 3.0 preview cũng duy trì mức WER thấp trong các bài kiểm tra theo tình huống như nhận diện tổng quát, nhận diện phương ngữ, hiểu ngữ cảnh (Context) và các môi trường âm thanh phức tạp (nhiễu cao, tiếng thì thầm), dẫn đầu toàn diện so với các sản phẩm cạnh tranh.

Hiệu suất trên tập đánh giá tự xây dựng: Đạt WER thấp nhất trên tập đánh giá tổng hợp, hiệu suất tổng thể dẫn đầu.
Từ góc độ trải nghiệm người dùng, Hy ASR 3.0 preview tập trung nâng cao bốn nhóm năng lực, bao gồm:
Kiến trúc, dữ liệu và hậu huấn luyện được tăng cường liên tục, nâng cao giới hạn năng lực nhận diện giọng nói.
Sự cải tiến năng lực của Hy ASR 3.0 preview không đến từ một mô-đun đơn lẻ, mà là kết quả của sự phối hợp giữa kiến trúc mô hình, Scaling dữ liệu và tối ưu hóa hậu huấn luyện.
Về kiến trúc, Hy ASR 3.0 preview sử dụng kiến trúc MoE cân bằng giữa hiệu suất và năng lực, đồng thời nâng cấp mô hình nền tảng lên Hy3, tăng cường khả năng hiểu ngôn ngữ, mô hình hóa ngữ cảnh và suy luận ngữ nghĩa. Về phía giọng nói, đội ngũ đã tự nghiên cứu bộ mã hóa (Encoder) giọng nói không giám sát, thông qua việc huấn luyện với hàng chục triệu giờ dữ liệu giọng nói không giám sát, giúp mô hình trích xuất các đặc trưng âm thanh chất lượng cao từ âm thanh phức tạp.
Để liên tục cải thiện khả năng mô hình hóa và hiểu giọng nói, đội ngũ Hunyuan đã thực hiện huấn luyện kết hợp giữa bộ mã hóa giọng nói và mô hình ngôn ngữ lớn, đưa vào hàng chục triệu giờ dữ liệu giọng nói từ nhiều nguồn, bao phủ nhiều phương ngữ, giọng địa phương và môi trường âm thanh khác nhau, đồng thời thực hiện gán nhãn tinh vi thông qua quy trình dữ liệu chất lượng cao. Trên nền tảng tiền huấn luyện kết hợp quy mô lớn, Hy ASR 3.0 preview dần đạt được các khả năng như nhận thức ngữ cảnh, thích ứng với tình huống phức tạp và nhận diện phương ngữ thông qua việc tiêm năng lực theo nhiều giai đoạn.
Xoay quanh nhận diện tổng quát, hiểu ngữ cảnh và độ bền bỉ trong tình huống phức tạp, đội ngũ đã xây dựng công thức SFT (Supervised Fine-Tuning) chất lượng cao, bao phủ ngữ cảnh (context), thuật ngữ chuyên ngành, các môi trường âm thanh khác nhau và giọng nói của nhiều nhóm người đa dạng. Đối với khả năng nhận diện phương ngữ, hệ thống dữ liệu SFT đã mở rộng bao phủ 10 vùng phương ngữ lớn và hơn 20 tiểu vùng cấp hai.
Trên cơ sở đó, đội ngũ tiếp tục đưa vào học tăng cường đa giai đoạn, tối ưu hóa riêng biệt cho độ chính xác chuyển đổi tổng quát, năng lực ngữ cảnh Any-context và các tình huống phức tạp, từ đó giảm thiểu các vấn đề nhận diện sai và bỏ sót trong môi trường âm thanh phức tạp.

Hiện tại, Hy ASR 3.0 preview đã lên sóng trên trang web chính thức của Tencent Cloud để cung cấp dịch vụ API, có thể ứng dụng rộng rãi trong các lĩnh vực như chăm sóc khách hàng thông minh, hiểu nội dung, tìm kiếm bằng giọng nói, v.v.
Yuanbao đã tham gia sâu vào quá trình nghiên cứu chung và hoàn tất việc ra mắt đầu tiên. Người dùng chỉ cần mở Yuanbao và nhấn giữ để nói là có thể trải nghiệm các cải tiến về khả năng nhận diện phương ngữ, sửa lỗi thông minh theo ngữ cảnh và chuyển đổi ổn định trong môi trường phức tạp. Nhập liệu bằng giọng nói trở nên chính xác, ổn định hơn và được cung cấp miễn phí; các sản phẩm như WorkBuddy cũng đang dần được tích hợp.
Địa chỉ trải nghiệm:
Tencent Hunyuan: https://aistudio.tencent.com/visual
Tencent Cloud: https://cloud.tencent.com/document/product/1093/135476
Bản quyền thuộc về đơn vị sở hữu, không được phép sao chép hoặc sử dụng dưới mọi hình thức khi chưa được cho phép, mọi hành vi vi phạm sẽ bị xử lý theo quy định.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.