Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Điểm AI 73/100

Hướng dẫn

Google ra mắt Gemini 3.5 Transcribe: Mô hình chuyển đổi giọng nói thành văn bản siêu chính xác

(giờ Việt Nam)

Tóm tắt AI

Google vừa giới thiệu Gemini 3.5 Transcribe, mô hình chuyển đổi giọng nói thành văn bản chính xác nhất hiện nay, hỗ trợ xử lý âm thanh trực tiếp và ghi âm sẵn thông qua Live API.

Chính văn · Bản dịch AI

Intelligent transcription with Gemini 3.5 Transcribe

26 tháng 8, 2026

Mô hình chuyển đổi giọng nói thành văn bản mới nhất của chúng tôi được thiết kế để phiên âm thời gian thực một cách chính xác và thông minh.

Diego Melendo Casado

Giám đốc cấp cao, Kỹ thuật, Gemini Audio

Luke Leonhard

Chánh văn phòng, Gemini Audio, đại diện cho Đội ngũ Gemini Audio

Text "Gemini 3.5 Transcribe" next to the Gemini spark, all on a blue background

Trình duyệt của bạn không hỗ trợ phần tử âm thanh.

Trình duyệt của bạn không hỗ trợ phần tử âm thanh.

Nghe bài viết

[[duration]] phút

Nội dung này được tạo bởi Google AI. AI tạo sinh là công nghệ thử nghiệm.

Nội dung này được tạo bởi Google AI. AI tạo sinh là công nghệ thử nghiệm.

Hôm nay, chúng tôi giới thiệu Gemini 3.5 Transcribe, mô hình chuyển đổi giọng nói thành văn bản chính xác nhất từ trước đến nay của chúng tôi, được thiết kế cho các tương tác giọng nói thông minh. Không giống như các mô hình nhận dạng giọng nói thông thường vốn gặp khó khăn với tiếng ồn nền, thuật ngữ chuyên môn phức tạp và việc xử lý các từ ngữ ngập ngừng, Gemini 3.5 Transcribe chuyển đổi âm thanh thô trực tiếp thành văn bản chính xác, chỉn chu và được định dạng rõ ràng.

Trên các sản phẩm như ứng dụng Gemini và trên Android, chúng tôi đã thấy người dùng được hưởng lợi từ mô hình phiên âm này với các tính năng giọng nói mới như Rambler trên Android và trong ứng dụng Gemini trên macOS. Giờ đây, các nhà phát triển có thể xây dựng những tính năng tương tự với Gemini 3.5 Transcribe thông qua Gemini API trong Google AI Studio và Gemini Enterprise Agent Platform.

Chúng tôi đã xây dựng 3.5 Transcribe để tích hợp liền mạch vào quy trình làm việc của nhà phát triển, cho dù bạn đang xây dựng các tác nhân giọng nói (voice agents), công cụ phụ đề thời gian thực hay các quy trình phân tích sau cuộc gọi. Mô hình này hiện khả dụng trên hai API riêng biệt:

Nhận bản phiên âm chính xác và thông minh hơn

Gemini 3.5 Transcribe được thiết kế để nắm bắt phong cách nói tự nhiên của bạn nhằm hiểu rõ hơn ý định và nhận diện từ vựng tùy chỉnh, giúp bạn thực hiện các tác vụ bằng giọng nói.

Hiệu suất của Gemini 3.5 Transcribe là một bước tiến lớn so với mô hình phiên âm trước đây của chúng tôi là Chirp 3, mang đến những khả năng mới, tỷ lệ lỗi từ (WER) được cải thiện và độ trễ thấp hơn đáng kể. Theo đo lường của Artificial Analysis, thời gian để hoàn tất phiên âm, chẳng hạn, đã cải thiện 70%. Trên tiêu chuẩn đánh giá FLEURS qua một loạt các ngôn ngữ và khu vực hàng đầu, mô hình mang lại hiệu suất đa ngôn ngữ chính xác, vượt trội hơn Chirp 3 và đạt tỷ lệ WER 5,50% ở chế độ phát trực tuyến (streaming) và 5,04% WER trong các trường hợp sử dụng không phát trực tuyến.

Graph of streaming speech recognition accuracyGraph of streaming speech recognition accuracy

Trải nghiệm phiên âm thông minh và đọc chính tả nâng cao

Ngoài Gemini API trong Google AI Studio và Gemini Enterprise Agent Platform, 3.5 Transcribe còn tiến xa hơn các công cụ chuyển đổi giọng nói thành văn bản tiêu chuẩn để giúp việc làm việc trên Google trở nên tự nhiên và trực quan hơn. Bằng cách đưa khả năng hiểu theo ngữ cảnh trực tiếp vào các bề mặt quen thuộc như Gboard, Antigravity, ứng dụng Gemini và Chrome, mô hình này nắm bắt các sắc thái, ý định và các chỉnh sửa nội tuyến một cách dễ dàng.

Đọc các đánh giá sớm

Bằng cách tận dụng Gemini Live API, các nền tảng dành cho nhà phát triển như Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel và Vision Agents cho phép các nhà phát triển xây dựng và triển khai các giao diện điều khiển bằng giọng nói hiệu năng cao một cách dễ dàng. Các nền tảng này quản lý cơ sở hạ tầng phát trực tuyến phương tiện thời gian thực phức tạp ở phía sau, cho phép các nhà phát triển tập trung hoàn toàn vào việc tạo ra trải nghiệm người dùng.

Các công ty như vivo, Intellitek Health và Lingopal cũng đã chia sẻ phản hồi tích cực về 3.5 Transcribe, nhấn mạnh vào độ trễ ấn tượng, độ chính xác và khả năng hỗ trợ ngôn ngữ mở rộng của mô hình.

vivo testimonialIntelliTek testimonial

Nhận tin tức mới nhất từ Google trong hộp thư đến của bạn

Đăng ký nhận bản tin của chúng tôi để cập nhật thông tin sản phẩm, sự kiện, ưu đãi đặc biệt và nhiều nội dung khác.

Thông tin của bạn sẽ được sử dụng theo chính sách quyền riêng tư của Google. Bạn có thể hủy đăng ký bất cứ lúc nào.

Bài gốc còn tiếp — xem tiếp tại bài gốc ↗

GoogleGeminiSpeech-to-TextAIAPI

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Google ra mắt Gemini 3.5 Transcribe: Mô hình chuyển đổi giọng nói thành văn bản siêu chính xác | AIHOT.vn