Mô hình
Google ra mắt Gemini 3.5 Transcribe: AI chuyển giọng nói thành văn bản thông minh, tự động lọc từ thừa
(giờ Việt Nam)
Tóm tắt AI
Google giới thiệu Gemini 3.5 Transcribe, mô hình AI hỗ trợ hơn 85 ngôn ngữ, có khả năng tự động định dạng văn bản, loại bỏ các từ đệm (um, ah) và nhận diện thuật ngữ chuyên ngành với độ chính xác cao.
Chính văn · Bản dịch AI

Jess Weatherbed
là một cây bút tin tức chuyên về các ngành công nghiệp sáng tạo, điện toán và văn hóa internet. Jess bắt đầu sự nghiệp của mình tại TechRadar, chuyên đưa tin và đánh giá phần cứng.
Google đã cập nhật Gemini Audio với một số mô hình Gemini 3.5 mới, giới thiệu các khả năng chuyển đổi giọng nói thành văn bản (transcription) mới có thể tự động phát hiện thuật ngữ chuyên ngành và hơn 85 ngôn ngữ. Gemini 3.5 Live, 3.5 Live Experimental và 3.5 Transcribe được thiết kế để mang lại độ chính xác cao hơn cho các tính năng AI điều khiển bằng giọng nói của Google, mà không bị ảnh hưởng bởi tiếng ồn nền hoặc khi lời nói của bạn bị ngắt quãng.
Gemini 3.5 Transcribe là một sự bổ sung hoàn toàn mới cho gia đình Gemini, và sự ra mắt này diễn ra trong khi chúng ta vẫn đang chờ đợi Google phát hành mô hình Gemini 3.5 Pro mà hãng đã hứa sẽ triển khai vào tháng 6. Google cho biết 3.5 Transcribe “đại diện cho một bước tiến lớn so với mô hình chuyển đổi văn bản trước đây của chúng tôi là Chirp 3”, đặc biệt là về hiệu suất đa ngôn ngữ và tỷ lệ lỗi từ ngữ.
Theo Google, mô hình chuyển đổi văn bản này cho phép người dùng “chỉnh sửa một cách tự nhiên chỉ bằng giọng nói”, đồng thời có thể tự động định dạng văn bản và loại bỏ các từ đệm như “ờ”, “ừ”. Người dùng có thể cung cấp từ vựng tùy chỉnh cho mô hình, cho phép 3.5 Transcribe tự động điều chỉnh việc chuyển đổi văn bản theo các yêu cầu chính tả đặc thù và thuật ngữ chuyên ngành để tránh việc phải chỉnh sửa thủ công những từ đó. Nó cũng có thể phân biệt giọng nói cho tối đa ba người nói trong các đoạn âm thanh được ghi âm trước, đồng thời cung cấp dấu thời gian (timestamp) theo từng từ.
Transcribe được ra mắt cùng với 3.5 Live và 3.5 Live Experimental, vốn được xây dựng dựa trên công nghệ nhận dạng giọng nói hiện có đang vận hành chế độ trò chuyện bằng giọng nói của Gemini. Gemini 3.5 Live xử lý tốt hơn các tình huống bị ngắt lời giữa chừng, nhận dạng ngôn ngữ và xử lý hình ảnh trực tiếp, trong khi Gemini 3.5 Live Experimental còn tiến xa hơn bằng cách tường thuật tiến trình từng bước theo thời gian thực khi nó thực hiện suy luận cho các tác vụ phức tạp hơn.
Các bản cập nhật Gemini Audio này bắt đầu được triển khai từ hôm nay bằng tiếng Anh cho tất cả người dùng ứng dụng Gemini trên macOS, và tính năng đọc chính tả Rambler trên Android tại một số quốc gia và ngôn ngữ nhất định. Nó cũng khả dụng cho các nhà phát triển dưới dạng bản xem trước công khai (public preview) trong Gemini API thông qua AI Studio và Antigravity. Google cho biết hỗ trợ cho Chrome sẽ sớm ra mắt.
Hãy theo dõi các chủ đề và tác giả từ bài viết này để xem thêm các nội dung tương tự trên trang chủ cá nhân của bạn và nhận thông báo qua email.

Bài viết được AI dịch và tổng hợp tự động từ The Verge: AI. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.