MarkTechPost
85

Sản phẩm

xAI ra mắt Grok Voice Transcribe 2.0: Độ chính xác gấp đôi, giá không đổi

(giờ Việt Nam)

Tóm tắt AI

xAI vừa phát hành mô hình chuyển đổi giọng nói thành văn bản Grok Voice Transcribe 2.0 với độ chính xác vượt trội gấp đôi phiên bản cũ, trong khi vẫn giữ nguyên mức giá cạnh tranh.

Bản dịch AI

SpaceXAI Releases Grok Voice Transcribe 2.0: A Speech-to-Text API Claiming 2x Accuracy Over 1.0 at $0.10 per Hour

SpaceXAI vừa phát hành Grok Voice Transcribe 2.0, mô hình chuyển đổi giọng nói thành văn bản (STT) mới nhất của họ. Đội ngũ phát triển khẳng định mô hình này có độ chính xác cao gấp đôi so với Grok Voice Transcribe 1.0 ở cùng mức giá. Mô hình nhắm đến các tệp âm thanh khó xử lý: đường truyền điện thoại nhiễu, nhiều giọng nói đan xen, giọng địa phương và các thông tin xác thực được đọc bằng lời. Nó hoạt động ở cả chế độ xử lý theo lô (batch) và truyền phát trực tiếp (real-time streaming) thông qua Speech to Text API.

Có thể triển khai được không? Có, dưới dạng một hosted API. Nó đã chính thức hoạt động từ hôm nay với model ID là grok-voice-transcribe-2.0. SpaceXAI chưa công bố trọng số mở (open weights), vì vậy việc tự lưu trữ (self-hosting) không phải là một lựa chọn.

Grok Voice Transcribe 2.0 được xây dựng trên mô hình nền tảng âm thanh đứng sau Grok Voice. Đội ngũ SpaceXAI cho biết Grok Voice hiện đã xử lý hàng chục nghìn cuộc gọi hỗ trợ khách hàng mỗi ngày. Nó cũng thực hiện chuyển đổi hàng triệu giờ thuyết minh video và vận hành trợ lý Grok trên các phương tiện của Tesla.

Dữ liệu huấn luyện là âm thanh thực tế, có nhiều tạp âm, đa ngôn ngữ được ghi lại từ nhiều môi trường khác nhau. Sau đó, SpaceXAI đã tinh chỉnh mô hình bằng phương pháp hậu huấn luyện (post-training).

Các điểm chuẩn (Benchmarks): Những gì SpaceXAI báo cáo

SpaceXAI báo cáo xếp hạng độ chính xác đứng đầu trong số 32 mô hình streaming trên bảng xếp hạng công khai Artificial Analysis. Điểm chuẩn đó, AA-WER Streaming, sử dụng khoảng 8 giờ âm thanh. Nó tính trọng số AA-AgentTalk ở mức 50%, VoxPopuli ở mức 25% và Earnings22 ở mức 25%. Xem phương pháp luận để biết chi tiết.

SpaceXAI cũng đo lường tỷ lệ lỗi từ (WER) trên 4 tập dữ liệu nội bộ được lấy từ lưu lượng truy cập thực tế:

Phiên bản 2.0 cải thiện so với 1.0 trên cả 4 tập dữ liệu. Đối với điện thoại, SpaceXAI cho biết họ dẫn đầu mọi mô hình mà công ty đã thử nghiệm. Những kết quả nội bộ này do nhà cung cấp báo cáo và chưa được kiểm chứng độc lập.

Chuyển đổi đa ngôn ngữ và chuyển đổi ngôn ngữ linh hoạt

Mô hình có khả năng chuyển đổi hàng chục ngôn ngữ và tự động phát hiện ngôn ngữ. Nó cũng theo kịp các thay đổi ngôn ngữ ngay trong lúc đang ghi âm chỉ trong một lần xử lý. Đội ngũ SpaceXAI gọi độ chính xác đa ngôn ngữ là cải tiến lớn nhất so với phiên bản 1.0.

Các cụm từ ngắn, chẳng hạn như lệnh điều khiển trong xe hơi, cung cấp rất ít ngữ cảnh để mô hình xác định ngôn ngữ. Trên tập dữ liệu đó, WER giảm từ 20,6% xuống còn 6,8%. Điều này tương đương với việc giảm khoảng 67% lỗi từ.

Tài liệu liệt kê 25 ngôn ngữ hỗ trợ định dạng văn bản cho số, tiền tệ và đơn vị đo lường.

Các tính năng chính dành cho nhà phát triển

Mọi tính năng dưới đây đều có sẵn trong cùng một API:

Điểm cuối (endpoint) batch chấp nhận các tệp lên đến 500 MB với 12 định dạng âm thanh. Chế độ streaming cũng chấp nhận định dạng Opus ở mức khoảng 4 KB/s, so với 48 KB/s đối với PCM thô ở tần số 24 kHz.

Giá cả

Giá cả giống hệt phiên bản 1.0. Chuyển đổi batch có giá 0,10 USD mỗi giờ âm thanh. Chế độ streaming có giá 0,20 USD mỗi giờ. Các tính năng phân đoạn người nói (diarization), dấu thời gian (timestamps) và các thuật ngữ chính (key terms) đã được bao gồm. Điều này tương đương với khoảng 1,67 USD và 3,33 USD cho mỗi 1.000 phút.

Cách gọi API

Atlassian Loom áp dụng Grok Voice Transcribe 2.0

Atlassian Loom hiện sử dụng Grok Voice Transcribe 2.0 để chuyển đổi mọi video. Atlassian nhận thấy nó chính xác hơn giải pháp hiện có của họ.

Quy trình làm việc mà SpaceXAI mô tả là: ghi âm, chuyển đổi, sau đó viết mã. Người dùng ghi lại một kế hoạch hành động trong Loom. Bản ghi được chuyển vào Cursor, công cụ này sẽ thực hiện các cập nhật mã. Sanchan Saxena, Phó chủ tịch cấp cao của Teamwork Collection tại Atlassian, mô tả đây là việc "khép kín vòng lặp từ ngữ cảnh đến mã nguồn."

Những điểm chính cần lưu ý

Hãy xem các chi tiết kỹ thuật và tài liệu API. Mọi công lao đều thuộc về các nhà nghiên cứu của dự án này. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter, đừng quên tham gia SubReddit 150k+ ML của chúng tôi và đăng ký nhận bản tin Newsletter. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, sản phẩm mới, hoặc hội thảo trực tuyến (webinar), v.v.? Hãy kết nối với chúng tôi.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có thể áp dụng được.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.