← Về bảng nóng
SỰ KIỆNĐã lắng xuống

Google DeepMind ra mắt Gemini 3.5 Transcribe

Tổng quan sự kiện

Toàn cảnh do AI tổng thuật

Ngày 26/8/2026, Google DeepMind ra mắt Gemini 3.5 Transcribe, một mô hình chuyển đổi giọng nói thành văn bản độ chính xác cao dành cho tương tác thoại thời gian thực. Mô hình này hỗ trợ cả hai loại API là truyền phát trực tiếp và không truyền phát. Theo đánh giá từ Artificial Analysis, tỷ lệ lỗi từ trung bình của bản truyền phát là 4,0% và bản không truyền phát là 2,6%. Mô hình hỗ trợ tự động nhận diện hơn 85 ngôn ngữ, tùy chỉnh từ vựng cho các thuật ngữ chuyên ngành và nhận diện tối đa ba người nói. Ngoài ra, nó còn có khả năng chuyển ngữ thông minh, gọi hàm, tự động lọc từ đệm, định dạng dữ liệu thoại phi cấu trúc, đồng thời có thể kết hợp ngữ cảnh màn hình để thực hiện lệnh thoại, thậm chí tận dụng khả năng đa phương thức để chuyển đổi trực tiếp các đoạn thoại lộn xộn và tệp tin cục bộ thành bản nháp email.

API hiện đã có mặt trên Google AI Studio và Gemini Enterprise; người dùng cũng có thể trải nghiệm trực tiếp trên ứng dụng Gemini cho macOS hoặc Rambler trên Android. Kể từ hôm nay, phiên bản tiếng Anh đã được mở cho người dùng ứng dụng Gemini trên macOS và các nhà phát triển có thể truy cập thông qua bản xem trước công khai của Gemini API.

Các báo cáo mới nhất bổ sung chi tiết về hiệu năng và giá cả: So với thế hệ Chirp 3 tiền nhiệm, tốc độ chuyển đổi từ giọng nói sang văn bản cuối cùng tăng khoảng 70%, tỷ lệ lỗi giọng nói thời gian thực giảm xuống còn 5,5%. Artificial Analysis cho biết thêm, phiên bản âm thanh ghi âm trước đạt AA-WER 2,6%, xếp thứ năm với tốc độ xử lý nhanh gấp khoảng 84 lần thời gian thực; phiên bản truyền phát trực tiếp có độ trễ cho bản ghi cuối cùng đầu tiên là 0,40 giây với WER 4,0%. Cả hai đều hỗ trợ hơn 85 ngôn ngữ, phiên bản ghi âm trước hỗ trợ nhận diện tối đa ba người nói kèm dấu thời gian, với mức giá lần lượt khoảng 5 USD và 9 USD cho mỗi 1.000 phút.

Tổng thuật do AI tổng hợp từ toàn bộ bài đưa tin, cập nhật theo diễn biến · làm mới T5 · 27/08 · 05:06.

Diễn biến mới nhất

Artificial Analysis vừa công bố chi tiết về giá cả và hiệu năng của Gemini 3.5 Transcribe: phiên bản ghi âm trước có giá 5 USD/1.000 phút, phiên bản truyền phát trực tiếp (streaming) có giá 9 USD/1.000 phút.

Chính chủ · 2 bài

Nghe trực tiếp từ bên liên quan

Lọc toàn bộ bài chính chủ trong dòng thời gian →

Dòng thời gian đưa tin

Đang hiện 8 bài · tất cả · mới trước

T5 · 27/08

  1. Gemini 3.5 Transcribe ra mắt, API chuyển đổi giọng nói thông minh chính thức lên sóng

    X: Rohan Paul (@rohanpaul_ai)

    Google vừa phát hành Gemini 3.5 Transcribe, công cụ chuyển đổi giọng nói thông minh thành "văn bản theo ý định thực tế". Công nghệ này có khả năng loại bỏ các lỗi nói nhịu, lọc bỏ từ đệm, định dạng lại số liệu, ngày tháng và hỗ trợ tùy chỉnh từ vựng theo nhu cầu người dùng.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  2. Gemini 3.5 Transcribe ra mắt, đạt AA-WER 2,6% và xếp thứ năm

    X: Artificial Analysis (@ArtificialAnlys)

    Google phát hành hai API là Gemini 3.5 Transcribe và Transcribe Live: Phiên bản đầu dành cho âm thanh ghi âm trước đạt AA-WER 2,6%, xếp thứ năm với tốc độ xử lý nhanh gấp khoảng 84 lần thời gian thực; phiên bản sau dành cho truyền phát trực tiếp có độ trễ cho bản ghi cuối cùng đầu tiên là 0,40 giây với WER 4,0%. Cả hai đều hỗ trợ hơn 85 ngôn ngữ, phiên bản ghi âm trước hỗ trợ nhận diện tối đa ba người nói kèm dấu thời gian, với mức giá lần lượt khoảng 5 USD và 9 USD cho mỗi 1.000 phút.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  3. Google ra mắt mô hình AI chuyển đổi giọng nói thành văn bản Gemini 3.5 Transcribe

    Ars Technica: AI

    Google vừa phát hành Gemini 3.5 Transcribe, mô hình AI chuyên dụng cho đầu vào giọng nói, có khả năng loại bỏ các từ đệm như "ừm", "à" và tinh chỉnh văn bản. So với thế hệ tiền nhiệm Chirp 3, tốc độ chuyển đổi từ giọng nói sang văn bản hoàn chỉnh đã tăng khoảng 70%, đồng thời tỷ lệ lỗi khi xử lý giọng nói theo thời gian thực giảm xuống còn 5,5%.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  4. Google ra mắt mô hình chuyển đổi Gemini 3.5 Transcribe, có khả năng tự động loại bỏ các từ đệm như "um", "ah"

    The Verge: AI

    Google giới thiệu thành viên mới của dòng Gemini Audio là Gemini 3.5 Transcribe, có khả năng tự động nhận diện thuật ngữ chuyên ngành và hơn 85 ngôn ngữ, đồng thời tự động định dạng văn bản và loại bỏ các từ đệm như "um", "uh". Mô hình này hỗ trợ bảng từ vựng tùy chỉnh, phân biệt giọng nói của tối đa ba người và cung cấp dấu thời gian theo từng từ. Phiên bản tiếng Anh đã được mở cho người dùng ứng dụng Gemini trên macOS từ hôm nay, các nhà phát triển có thể sử dụng thông qua bản xem trước công khai của Gemini API.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  5. Gemini 3.5 Transcribe chính thức ra mắt với khả năng chuyển đổi giọng nói sang văn bản chính xác

    X: Google AI (@GoogleAI)Chính chủ

    Google giới thiệu mô hình chuyển đổi giọng nói sang văn bản Gemini 3.5 Transcribe, hỗ trợ hơn 85 ngôn ngữ. Mô hình có khả năng tự động lọc từ đệm, định dạng dữ liệu giọng nói phi cấu trúc và thực hiện các lệnh thoại dựa trên ngữ cảnh màn hình. Ngoài ra, nhờ khả năng đa phương thức, mô hình còn có thể chuyển đổi trực tiếp các đoạn ghi âm lộn xộn và tệp tin cục bộ thành bản nháp email.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  6. Gemini 3.5 Transcribe ra mắt, hỗ trợ chuyển đổi trực tiếp theo thời gian thực

    X: Logan Kilpatrick (@OfficialLoganK)

    Giới thiệu Gemini 3.5 Transcribe – mô hình chuyển đổi giọng nói sang văn bản mới nhất của chúng tôi. Sản phẩm sở hữu khả năng chuyển đổi thông minh, gọi hàm (function calling), độ chính xác cao hơn (tỷ lệ lỗi từ WER thấp hơn), hỗ trợ từ vựng tùy chỉnh, nhận diện nhiều người nói và hỗ trợ hơn 85 ngôn ngữ! Đồng thời hỗ trợ truyền phát dữ liệu theo thời gian thực!

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  7. Gemini 3.5 Transcribe ra mắt, hỗ trợ chuyển đổi đa ngôn ngữ

    X: Sundar Pichai (@sundarpichai)

    Chào đón Gemini 3.5 Transcribe! - Xây dựng các ứng dụng có khả năng hiểu giọng nói/ý định của người dùng, ngay cả khi có nhiều người nói cùng lúc! - Sẵn sàng sử dụng ngay, tự động phát hiện hơn 85 ngôn ngữ - Tùy chỉnh từ vựng cho các thuật ngữ chuyên ngành... Quá tuyệt vời! API hiện đã có mặt trên @GoogleAIStudio và Gemini Enterprise, đồng thời có thể dùng thử trên ứng dụng Gemini cho macOS hoặc Rambler trên Android! Xem chi tiết tại: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  8. Gemini 3.5 Transcribe ra mắt: Mô hình chuyển đổi giọng nói sang văn bản độ chính xác cao cho tương tác giọng nói thời gian thực

    Google DeepMind: BlogChính chủ

    Google DeepMind ra mắt mô hình chuyển đổi giọng nói sang văn bản Gemini 3.5 Transcribe, hỗ trợ cả API dạng luồng (streaming) và không theo luồng. Theo đánh giá từ Artificial Analysis, tỷ lệ lỗi từ (WER) trung bình của mô hình lần lượt là 4,0% và 2,6%. Sản phẩm hỗ trợ hơn 85 ngôn ngữ, cho phép tùy chỉnh từ vựng và nhận diện tối đa ba người nói.

    Đọc bản tiếng Việt →Đọc bài gốc ↗

Sự kiện liên quan

← Về bảng nóng

Hồ sơ sự kiện được gom từ nhiều nguồn đưa tin độc lập rồi dịch, tóm tắt sang tiếng Việt. Bản quyền từng bài viết thuộc về cơ quan báo chí gốc. Nguồn dữ liệu: hồ sơ gốc trên AI HOT

Google DeepMind ra mắt Gemini 3.5 Transcribe — Hồ sơ sự kiện | AIHOT.vn