Mô hình
xAI ra mắt mô hình chuyển đổi giọng nói thành văn bản Grok Voice Transcribe 2.0
(giờ Việt Nam)
Tóm tắt AI
xAI vừa giới thiệu Grok Voice Transcribe 2.0, khẳng định đây là một trong những mô hình chuyển đổi giọng nói chính xác nhất hiện nay với độ chuẩn xác gấp đôi phiên bản cũ mà giá thành không đổi.
Bản dịch AI

Hôm nay, chúng tôi ra mắt Grok Voice Transcribe 2.0, mô hình chuyển đổi giọng nói thành văn bản mới nhất của chúng tôi. Qua các đánh giá thực tế, Grok Voice Transcribe 2.0 là một trong những mô hình chuyển đổi chính xác nhất hiện nay và có độ chính xác cao gấp đôi so với Grok Voice Transcribe 1.0, với cùng mức giá.
Grok Voice Transcribe 2.0 được xây dựng dựa trên mô hình nền tảng âm thanh đứng sau Grok Voice. Grok Voice hiện đang hỗ trợ hàng chục nghìn cuộc gọi hỗ trợ khách hàng mỗi ngày, chuyển đổi hàng triệu giờ tường thuật video và vận hành các tác nhân giọng nói trong các sản phẩm vật lý, bao gồm cả trợ lý Grok trên các dòng xe Tesla. Mô hình này được huấn luyện trên một tập dữ liệu độc đáo gồm âm thanh trực tiếp, nhiều tạp âm, đa ngôn ngữ được ghi lại trong nhiều môi trường đa dạng và được tinh chỉnh thông qua quá trình hậu huấn luyện.
Kết quả là một trong những mô hình chuyển đổi chính xác nhất cho giọng nói trong các bối cảnh thực tế.
Độ chính xác
Hầu hết các mô hình chuyển đổi đều hoạt động tốt với âm thanh sạch, chỉ có một người nói. Âm thanh thực tế khó hơn nhiều: đường truyền điện thoại chập chờn, nhiều giọng nói đan xen, giọng địa phương, và các số điện thoại hoặc địa chỉ email được đọc thành tiếng. Chúng tôi đã xây dựng Grok Voice Transcribe 2.0 để xử lý những âm thanh khó nhất trong mọi điều kiện và môi trường.
Trên bảng xếp hạng công khai Artificial Analysis, Grok Voice Transcribe 2.0 đứng đầu về độ chính xác trong số 32 mô hình streaming.
Đánh giá nội bộ
Ngoài các tiêu chuẩn công khai, chúng tôi đo lường tỷ lệ lỗi từ (word error rate) trên bốn tập dữ liệu nội bộ được lấy từ lưu lượng thực tế: âm thanh điện thoại từ các cuộc gọi hỗ trợ khách hàng, các cuộc hội thoại với Grok, các thông tin xác thực được đọc thành tiếng như mã tài khoản và địa chỉ email, và các lệnh thoại đa ngôn ngữ ngắn. Grok Voice Transcribe 2.0 cải thiện hơn so với Grok Voice Transcribe 1.0 ở cả bốn hạng mục, và đối với âm thanh điện thoại, nó dẫn đầu mọi mô hình mà chúng tôi đã thử nghiệm.
Đa ngôn ngữ
Grok Voice Transcribe 2.0 chuyển đổi hàng chục ngôn ngữ, tự động phát hiện ngôn ngữ và nhận diện việc chuyển đổi ngôn ngữ ngay trong khi đang ghi âm chỉ trong một lần xử lý. Độ chính xác đa ngôn ngữ là cải tiến lớn nhất của nó so với Grok Voice Transcribe 1.0.
Các cụm từ ngắn như lệnh điều khiển trong xe hơi cung cấp rất ít ngữ cảnh để mô hình xác định ngôn ngữ. Trên tập dữ liệu cụm từ ngắn của chúng tôi, tỷ lệ lỗi từ đã giảm từ 20,6% xuống còn 6,8%.
Tính năng
Grok Voice Transcribe 2.0 hỗ trợ cấu hình và kiểm soát nâng cao. Các tích hợp Speech-to-Text API hiện có sẽ nhận được cải tiến về độ chính xác mà không cần thay đổi mã nguồn:
Grok Voice hỗ trợ Atlassian Loom
Atlassian Loom được sử dụng rộng rãi để ghi và chia sẻ màn hình. Atlassian nhận thấy Grok Voice Transcribe 2.0 chính xác hơn giải pháp hiện tại của họ và hiện đang sử dụng nó để chuyển đổi mọi video. Các bản ghi chính xác mở ra các quy trình làm việc AI mới: ghi lại kế hoạch hành động trong Loom, chuyển bản ghi vào Cursor, và nó sẽ thực hiện cập nhật mã nguồn trực tiếp.
Giá cả
Giá của Grok Voice Transcribe 2.0 giống hệt với Grok Voice Transcribe 1.0. Chuyển đổi theo lô (batch) vẫn giữ mức $0,10 mỗi giờ âm thanh và streaming là $0,20 mỗi giờ, đã bao gồm tính năng phân tách người nói (diarization), dấu thời gian (timestamps) và các thuật ngữ chính.
Grok Voice Transcribe 2.0 sẽ sớm trở thành mặc định trong Speech-to-Text API, và Grok Voice Transcribe 1.0 sẽ bị ngừng hỗ trợ trong vài tuần tới. Để tiếp tục sử dụng phiên bản cũ trong giai đoạn chuyển đổi, hãy ghim grok-voice-transcribe-1.0.
Bắt đầu xây dựng với Grok Voice Transcribe
Thử nghiệm trực tiếpXem tài liệu
Bài viết được AI dịch và tổng hợp tự động từ xAI: News (Web). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.