Mô hình
Microsoft ra mắt MAI-Transcribe-2: Mô hình chuyển đổi giọng nói thành văn bản nhanh và chính xác nhất
(giờ Việt Nam)
Tóm tắt AI
Microsoft vừa trình làng MAI-Transcribe-2, mô hình AI chuyển đổi giọng nói với tỷ lệ lỗi từ chỉ 5,2%, vượt xa Whisper v3 và Gemini 3.1 Pro. Với tốc độ nhanh gấp 10 lần các đối thủ cùng mức giá cực rẻ, đây là bước tiến lớn trong công nghệ nhận diện giọng nói đa ngôn ngữ.
Bản dịch AI
Theo tin từ IT ngày 4 tháng 9, Microsoft đã đăng tải bài viết trên blog vào ngày hôm qua (3 tháng 9) để công bố ra mắt MAI-Transcribe-2, khẳng định đây là mô hình AI chuyển đổi giọng nói thành văn bản nhanh nhất, chính xác nhất và rẻ nhất của hãng.
Về giá cả, MAI-Transcribe-2 hiện đang có mức giá ưu đãi trong thời gian giới hạn là 0,10 USD/giờ (Lưu ý của IT: tỷ giá hối đoái hiện tại tương đương khoảng 0,67 Nhân dân tệ), chương trình ưu đãi kéo dài đến cuối năm 2026.
Về hiệu năng, MAI-Transcribe-2 là mô hình chuyển đổi mạnh mẽ nhất của Microsoft, sở hữu nhiều ưu thế về độ chính xác, tốc độ và giá thành so với các mô hình phổ biến khác trên thị trường.

Trong tập dữ liệu kiểm thử FLEURS, MAI-Transcribe-2 hỗ trợ hai chế độ là chỉ định ngôn ngữ bắt buộc và tự động suy luận ngôn ngữ, với tỷ lệ lỗi từ (WER) trung bình đều đạt 5,2%. Trong cùng bài kiểm tra này, hai kết quả tương ứng của Gemini 3.1 Pro lần lượt là 5,3% và 5,8%; GPT-Transcribe là 10,4% và 10,6%; Whisper v3-Large là 22,8% và 23,5%.


Về tốc độ, Microsoft dẫn nguồn từ đánh giá của Artificial Analysis cho biết MAI-Transcribe-2 nhanh hơn 10 lần so với GPT-Transcribe, nhanh hơn 7 lần so với Scribe v2 và nhanh hơn 5 lần so với Gemini 3.5 Transcribe.

Về tính năng, MAI-Transcribe-2 được bổ sung khả năng tách biệt người nói (speaker diarization), giúp phân biệt các diễn giả khác nhau trong một bản ghi âm và gán văn bản cho đúng người nói tương ứng. Dấu thời gian từng từ (word-level timestamps) cho phép đánh dấu vị trí chính xác của mỗi từ, hỗ trợ việc tìm kiếm, điều hướng, chỉnh sửa âm thanh và căn chỉnh phụ đề.
Về phong cách, mô hình cung cấp các tùy chọn chuyển đổi linh hoạt. Chế độ "verbatim" giữ lại các từ đệm và lỗi nói nhịu, phục vụ cho công việc tuân thủ và phân tích; chế độ "clean" loại bỏ các từ đệm để tạo ra phụ đề, ghi chú và văn bản xuất bản dễ đọc hơn. Mô hình cũng hỗ trợ ưu tiên từ khóa, tự động nhận diện ngôn ngữ, chuyển đổi ngôn ngữ và chuyển đổi trong môi trường nhiều tiếng ồn.
Mô hình hỗ trợ 60 ngôn ngữ và các cuộc hội thoại có sự pha trộn ngôn ngữ tự nhiên, người dùng không cần chỉ định trước ngôn ngữ mà mô hình có thể tự động phát hiện ngôn ngữ trong bản ghi. Hiện tại, các nhà phát triển có thể gọi hoặc dùng thử mô hình này trên Microsoft Foundry, MAI Playground và OpenRouter.

Bài viết được AI dịch và tổng hợp tự động từ IT Home ITHome. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.