Mô hình
Google ra mắt Gemini 3.5 Transcribe: Chuyển đổi giọng nói sang văn bản đa ngôn ngữ với độ chính xác cao
(giờ Việt Nam)
Tóm tắt AI
Google giới thiệu mô hình Gemini 3.5 Transcribe hỗ trợ hơn 85 ngôn ngữ, có khả năng tự động lọc từ thừa, sửa lỗi nói và định dạng văn bản. Mô hình này giảm 70% độ trễ so với thế hệ trước, đạt tỷ lệ lỗi cực thấp.
Chính văn · Bản dịch AI

27 tháng 8, 2026
Google vừa ra mắt Gemini 3.5 Transcribe, một mô hình chuyển đổi giọng nói thành văn bản dành cho việc ghi chép thời gian thực. Mô hình này tự động nhận diện hơn 85 ngôn ngữ, loại bỏ các từ đệm như "ừm", sửa lỗi nói nhịu và tự động định dạng văn bản. Google báo cáo tỷ lệ lỗi từ (word error rate) là 4,0% đối với luồng trực tiếp và 2,6% đối với âm thanh đã ghi, với độ trễ thấp hơn 70% so với phiên bản tiền nhiệm là Chirp 3. Thông qua tính năng "function calling", mô hình có thể chuyển giao các tác vụ như tạo hình ảnh hoặc tìm kiếm web cho các mô hình Gemini khác.
Mô hình này đi kèm với hai giao diện. Live API xử lý luồng trực tiếp với độ trễ cực thấp (gemini-3.5-transcribe-live), trong khi Interactions API xử lý âm thanh đã ghi với khả năng phân biệt người nói và gắn dấu thời gian (gemini-3.5-transcribe). Mô hình hiện đã có mặt trên Google AI Studio và nền tảng Gemini Enterprise Agent Platform. Nó cũng đã được tích hợp sẵn vào Gboard cho Android (thông qua "Rambler") và ứng dụng Gemini trên macOS, với hỗ trợ cho Chrome sẽ sớm ra mắt.
Tin tức AI không thổi phồng – Được tuyển chọn bởi con người
Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo chuyên sâu "AI Radar" độc quyền sáu lần mỗi năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.
Đăng ký ngay
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.