Mô hình
Google ra mắt Gemini 3.5 Transcribe: Mô hình chuyển đổi giọng nói thành văn bản với độ chính xác vượt trội
(giờ Việt Nam)
Tóm tắt AI
Google vừa giới thiệu Gemini 3.5 Transcribe, mô hình AI đạt tỷ lệ lỗi từ (WER) chỉ 2,6% trên hơn 85 ngôn ngữ, hỗ trợ xử lý cả tệp ghi âm lẫn luồng dữ liệu trực tiếp.
Bản dịch AI

Google vừa ra mắt Gemini 3.5 Transcribe, một mô hình chuyển đổi giọng nói thành văn bản dành cho các giao diện giọng nói thời gian thực và âm thanh đã ghi. Mô hình này được cung cấp dưới dạng hai endpoint thay vì một. gemini-3.5-transcribe xử lý các tệp đã ghi trước thông qua Interactions API. gemini-3.5-transcribe-live xử lý luồng dữ liệu hai chiều thông qua Live API. Theo báo cáo từ Artificial Analysis, Google đạt tỷ lệ lỗi từ trung bình là 4,0% đối với chế độ streaming và 2,6% đối với chế độ không streaming. Thời gian để hoàn tất bản ghi âm được cải thiện 70% so với Chirp 3, mô hình tiền nhiệm. Khả năng tự động phát hiện hỗ trợ hơn 85 ngôn ngữ, bao gồm cả việc chuyển đổi ngôn ngữ (code-switching) ngay trong câu. Việc phân tách thành hai endpoint là điểm cần lưu ý khi lập kế hoạch, vì chúng không chia sẻ cùng tập tính năng, giới hạn hay mức giá.
Có thể triển khai được không?
Có, nhưng chỉ thông qua API. Không có mã nguồn mở (open weights) và không có phương thức tự lưu trữ (self-hosted). Đây là quyết định về dịch vụ được quản lý (managed-service), không phải về hạ tầng.
Hai giao diện API, hai sản phẩm khác biệt
Live API cung cấp khả năng chuyển đổi văn bản liên tục với độ trễ dưới một giây. Nó phát ra interim_input_transcription cho các phần dự đoán tạm thời khi người dùng vẫn đang nói, sau đó là input_transcription khi lượt nói kết thúc. Âm thanh đầu vào là dạng raw 16-bit PCM ở tần số 16kHz mono, chia thành các đoạn 100ms. Nó hỗ trợ phát hiện hoạt động giọng nói (voice-activity detection) tự động, kết hợp và thủ công. Các token tạm thời (ephemeral tokens) cho phép các ứng dụng di động và web truyền phát mà không cần giữ khóa API.
Các hạn chế là có thật. Các phiên Live bị giới hạn tối đa 10 phút truyền phát liên tục. Tính năng phân tách người nói (speaker diarization) không được hỗ trợ. Dấu thời gian theo từng từ (word-level timestamps) cũng không được hỗ trợ.
Interactions API giải quyết những gì mà chế độ streaming không làm được. Nó cung cấp tính năng phân tách người nói, thời điểm bắt đầu và kết thúc theo từng từ, và tùy chỉnh từ vựng ưu tiên (vocabulary biasing). Danh sách từ vựng hỗ trợ tối đa 1.000 thuật ngữ, với kết quả tốt nhất là dưới 100 thuật ngữ. Các yêu cầu tiêu chuẩn chấp nhận tệp âm thanh dài tối đa một giờ. Giới hạn này giảm xuống còn 30 phút khi bật tính năng phân tách người nói hoặc dấu thời gian theo từ.
Verbatim và smart là quyết định thiết kế quan trọng
Cả hai endpoint đều cung cấp hai chế độ. verbatim là chế độ mặc định, trả về mọi thứ bao gồm cả từ đệm, từ lặp lại và các câu nói hụt. smart loại bỏ các lỗi diễn đạt, giải quyết các lỗi tự sửa lỗi trong lời nói và áp dụng định dạng có cấu trúc.
Ví dụ từ tài liệu của Google: “Um, so for the meeting, I think we should, uh, invite Alice and, wait no, Bob and Carol.” Chế độ Verbatim giữ nguyên tất cả. Chế độ Smart trả về: “For the meeting, I think we should invite Bob and Carol.”
Chế độ Smart không thể kết hợp với dấu thời gian theo từ hoặc phân tách người nói. Đây là sự đánh đổi cần cân nhắc. Một bản tóm tắt dễ đọc và một bản ghi chép có thể kiểm chứng hiện là hai lệnh gọi API khác nhau.
Hiệu suất
Theo đo lường từ Artificial Analysis, Google báo cáo tỷ lệ lỗi từ trung bình là 4,0% cho streaming và 2,6% cho không streaming. Trên bộ chuẩn đa ngôn ngữ FLEURS, qua một tập hợp các ngôn ngữ và khu vực phổ biến, mô hình đạt 5,50% cho streaming và 5,04% cho không streaming.
So với Chirp 3, mô hình chuyển đổi văn bản trước đây của Google, thời gian hoàn tất bản ghi được cải thiện 70%. Độ phủ ngôn ngữ trải rộng hơn 85 khu vực với khả năng tự động phát hiện và xử lý chuyển đổi ngôn ngữ mà không cần cấu hình.
Hệ sinh thái
Live API đã được tích hợp vào LiveKit, Pipecat, Agora, Fishjam, Vercel và Vision Agents. Về phía người dùng cuối, mô hình này cung cấp sức mạnh cho Rambler trên Android, ứng dụng Gemini trên macOS và Google Antigravity. Chrome được liệt kê là sẽ sớm hỗ trợ.
Những điểm chính cần lưu ý
Xem chi tiết kỹ thuật tại đây. Ngoài ra, hãy theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML với hơn 150 nghìn thành viên của chúng tôi cũng như đăng ký nhận bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, sản phẩm mới hoặc hội thảo trực tuyến của bạn? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt nền tảng truyền thông về Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với độc giả.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.