Gemini 3.5 Transcribe API hiện đã có mặt trên Google AI Studio
Tổng quan sự kiện
Toàn cảnh do AI tổng thuật
Google ra mắt Gemini 3.5 Transcribe, mô hình chuyển đổi giọng nói thành văn bản mới thuộc dòng Gemini Audio. Mô hình này hỗ trợ tự động nhận diện hơn 85 ngôn ngữ, có khả năng nhận diện thuật ngữ chuyên ngành, từ vựng tùy chỉnh, đồng thời tự động định dạng văn bản và loại bỏ các từ đệm như "um", "uh". Mô hình hỗ trợ phân tách giọng nói cho tối đa ba người nói và cung cấp dấu thời gian theo từng từ. API hiện đã có sẵn trên Google AI Studio và Gemini Enterprise, các nhà phát triển có thể sử dụng thông qua bản xem trước công khai của Gemini API.
Kể từ hôm nay, phiên bản tiếng Anh đã được mở cho người dùng ứng dụng Gemini trên macOS, người dùng Android có thể trải nghiệm thông qua ứng dụng Rambler. Các báo cáo mới nhất cho biết, so với Chirp 3, tốc độ tổng thể dự kiến tăng khoảng 70%, tỷ lệ lỗi trong các tình huống hội thoại thời gian thực giảm xuống còn 5,5%, đồng thời đã hỗ trợ cho tính năng "Rambler" trên Gboard của Pixel 11.
The Decoder đưa tin tỷ lệ lỗi từ (WER) đối với chuyển đổi trực tuyến là 4,0%, đối với tệp ghi âm là 2,6%, độ trễ giảm 70% so với thế hệ Chirp 3 tiền nhiệm. MarkTechPost cho biết WER trung bình cho hơn 85 ngôn ngữ là 2,6%, đồng thời cung cấp khả năng xử lý tệp ghi âm trước và xử lý trực tuyến hai chiều thông qua Interactions API và Live API. Hướng dẫn chính thức nêu rõ mô hình hỗ trợ hai chế độ Smart Transcription và Verbatim, cho phép truyền tối đa 1.000 thuật ngữ chuyên ngành thông qua custom_vocabulary.
Tổng thuật do AI tổng hợp từ toàn bộ bài đưa tin, cập nhật theo diễn biến · làm mới T6 · 28/08 · 20:51.
Diễn biến mới nhất
Hướng dẫn chính thức bổ sung hỗ trợ cho chế độ Smart/Verbatim và tối đa 1.000 thuật ngữ tùy chỉnh.
Chính chủ · 1 bài
Nghe trực tiếp từ bên liên quan
- Google AI: DEV tác giảHướng dẫn đầy đủ về Gemini 3.5 Transcribe: Tạm biệt những khó khăn trong chuyển đổi ASR
Dòng thời gian đưa tin
Đang hiện 6 bài · tất cả · mới trước
T6 · 28/08
Hướng dẫn đầy đủ về Gemini 3.5 Transcribe: Tạm biệt những khó khăn trong chuyển đổi ASR
Google AI: DEV tác giảChính chủGoogle ra mắt mô hình Gemini 3.5 Transcribe chuyên dụng cho chuyển đổi giọng nói thành văn bản, tập trung vào tốc độ nhanh, độ chính xác cao và chi phí thấp, hỗ trợ phân tách người nói và dấu thời gian theo từng mili giây. Mô hình hỗ trợ tự động nhận diện hơn 85 ngôn ngữ và chuyển đổi mã, cho phép truyền tối đa 1.000 thuật ngữ chuyên ngành qua custom_vocabulary để tránh lỗi chính tả danh từ riêng, đồng thời cung cấp hai chế độ Smart Transcription và Verbatim.
Google ra mắt Gemini 3.5 Transcribe: Mô hình chuyển đổi giọng nói thành văn bản với WER trung bình 2,6% cho hơn 85 ngôn ngữ
MarkTechPostGoogle ra mắt mô hình chuyển đổi giọng nói thành văn bản Gemini 3.5 Transcribe, cung cấp khả năng xử lý tệp ghi âm trước và xử lý trực tuyến hai chiều thông qua Interactions API và Live API.
T5 · 27/08
Google ra mắt Gemini 3.5 Transcribe, hỗ trợ chuyển đổi giọng nói thành văn bản thời gian thực cho 85 ngôn ngữ
The Decoder: AI NewsGoogle giới thiệu mô hình chuyển đổi giọng nói thành văn bản Gemini 3.5 Transcribe, hỗ trợ hơn 85 ngôn ngữ, có khả năng tự động loại bỏ các từ đệm như "um", sửa lỗi nói nhịu và tự động định dạng văn bản. Tỷ lệ lỗi từ đối với chuyển đổi trực tuyến là 4,0%, đối với tệp ghi âm là 2,6%, độ trễ giảm 70% so với thế hệ Chirp 3 tiền nhiệm.
Google ra mắt mô hình chuyển đổi giọng nói thành văn bản Gemini 3.5 Transcribe, có khả năng tự động loại bỏ các từ đệm
IT HomeGoogle vừa công bố mô hình chuyển đổi giọng nói thành văn bản Gemini 3.5 Transcribe, với khả năng tự động loại bỏ các từ đệm như "ừm", "à" và tự sửa lỗi khi người nói nói nhầm, giúp văn bản đầu ra trôi chảy hơn. So với Chirp 3, tốc độ tổng thể của mô hình này dự kiến tăng khoảng 70%, tỷ lệ lỗi trong các tình huống hội thoại thời gian thực giảm xuống còn 5,5%. Gemini 3.5 Transcribe hỗ trợ 85 ngôn ngữ và xử lý được các tệp âm thanh ghi sẵn có tối đa 3 người nói. Hiện tại, mô hình này đã được tích hợp vào tính năng "Rambler" trên bàn phím Gboard của dòng Pixel 11 và sẽ sớm xuất hiện trên nhiều sản phẩm khác của Google.
Google ra mắt mô hình chuyển đổi Gemini 3.5 Transcribe, có khả năng tự động loại bỏ các từ đệm như "um", "ah"
The Verge: AIGoogle giới thiệu thành viên mới của dòng Gemini Audio là Gemini 3.5 Transcribe, có khả năng tự động nhận diện thuật ngữ chuyên ngành và hơn 85 ngôn ngữ, đồng thời tự động định dạng văn bản và loại bỏ các từ đệm như "um", "uh". Mô hình này hỗ trợ bảng từ vựng tùy chỉnh, phân biệt giọng nói của tối đa ba người và cung cấp dấu thời gian theo từng từ. Phiên bản tiếng Anh đã được mở cho người dùng ứng dụng Gemini trên macOS từ hôm nay, các nhà phát triển có thể sử dụng thông qua bản xem trước công khai của Gemini API.
Gemini 3.5 Transcribe ra mắt, hỗ trợ chuyển đổi đa ngôn ngữ
X: Sundar Pichai (@sundarpichai)Chào đón Gemini 3.5 Transcribe! - Xây dựng các ứng dụng có khả năng hiểu giọng nói/ý định của người dùng, ngay cả khi có nhiều người nói cùng lúc! - Sẵn sàng sử dụng ngay, tự động phát hiện hơn 85 ngôn ngữ - Tùy chỉnh từ vựng cho các thuật ngữ chuyên ngành... Quá tuyệt vời! API hiện đã có mặt trên @GoogleAIStudio và Gemini Enterprise, đồng thời có thể dùng thử trên ứng dụng Gemini cho macOS hoặc Rambler trên Android! Xem chi tiết tại: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/