Mô hình
Google ra mắt Gemini 3.8 Live và 3.5 Transcribe: Đột phá mô hình giọng nói thời gian thực
(giờ Việt Nam)
Tóm tắt AI
Google giới thiệu bộ đôi mô hình Gemini 3.8 Live và 3.5 Transcribe với khả năng xử lý giọng nói đa ngôn ngữ, hỗ trợ tư duy mở rộng và tích hợp thị giác, trong đó bản Extended Thinking hiện dẫn đầu bảng xếp hạng Artificial Analysis.
Bản dịch AI

Hôm qua, chúng tôi đã phát hành các mô hình Gemini Live mới trong Gemini API và Google AI Studio, mở rộng bộ công cụ dành cho nhà phát triển để xây dựng các trải nghiệm sản phẩm ưu tiên giọng nói (voice-first) theo thời gian thực.
Gemini 3.8 Live và 3.8 Live Extended Thinking: Gemini 3.8 Live mang đến một bước tiến vượt bậc cho các mô hình chuyển đổi giọng nói sang giọng nói (speech-to-speech) nguyên bản, có khả năng thực hiện các tác vụ trong khi vẫn duy trì cuộc hội thoại. Đối với các yêu cầu phức tạp, 3.8 Live Extended Thinking cung cấp khả năng suy luận sâu hơn, xếp hạng #1 trên bảng xếp hạng Speech-to-Speech của Artificial Analysis.
Gemini 3.5 Transcribe: Mô hình chuyển đổi giọng nói sang văn bản chuyên dụng của chúng tôi mang lại khả năng phiên âm có độ chính xác cao trên hơn 85 ngôn ngữ. Được phát hành vào tháng trước, mô hình này đạt tỷ lệ lỗi từ (WER) trung bình là 4,0% (streaming) và 2,6% (non-streaming).
Gemini 3.8 Live & 3.8 Live Extended Thinking: Xây dựng các tác nhân hội thoại thông minh hơn.
Các mô hình mới của chúng tôi, Gemini 3.8 Live và 3.8 Live Extended Thinking, cho phép các nhà phát triển xây dựng các tác nhân giọng nói có khả năng suy luận và thực thi tác vụ trong khi vẫn duy trì luồng hội thoại. Các khả năng chính bao gồm:
3.8 Live Extended Thinking cũng hỗ trợ tư duy có thể cấu hình để giúp xử lý các suy luận phức tạp, nhiều bước ở chế độ nền, trong khi vẫn phản hồi hoặc tường thuật tiến trình của nó trong cuộc hội thoại chính. Những mô hình này đại diện cho một bước tiến so với các mô hình live trước đây của chúng tôi và cung cấp một giải pháp thay thế tinh gọn hơn cho các kiến trúc phân tầng (cascaded architectures).

Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking hiện đã có sẵn thông qua Live API. Với mức giá cạnh tranh là 0,005 USD/phút cho đầu vào âm thanh và 0,018 USD/phút* cho đầu ra âm thanh, chúng cho phép các nhà phát triển mở rộng quy mô các ứng dụng giọng nói với hiệu suất dẫn đầu ngành.

Các nhà phát triển cũng có thể truy cập các mô hình này thông qua Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel và Vision Agents, các đối tác tích hợp Live API của chúng tôi, những đơn vị xử lý cơ sở hạ tầng truyền phát phương tiện cho việc triển khai thực tế.

Gemini 3.5 Transcribe: Chuyển đổi giọng nói được truyền phát thành văn bản.
Khả năng hiểu giọng nói theo thời gian thực là rất quan trọng đối với các giao diện ưu tiên giọng nói. Tháng trước, chúng tôi đã phát hành Gemini 3.5 Transcribe để phiên âm có độ trễ thấp với độ chính xác cao, đạt WER 4,0% cùng các tính năng hữu ích:
3.5 Transcribe hỗ trợ hơn 85 ngôn ngữ và cung cấp một công cụ lắng nghe mạnh mẽ cho các trải nghiệm giọng nói và các tác vụ không trạng thái (stateless) như phụ đề dưới một giây, tác nhân tổng đài và phân tích âm thanh thời gian thực. Bạn cũng có thể truy cập mô hình này thông qua Interactions API để phiên âm các tệp âm thanh dài tới 1 giờ với dấu thời gian có cấu trúc và gắn nhãn người nói. Hãy đọc hướng dẫn dành cho nhà phát triển của chúng tôi để tìm hiểu thêm.
Bộ công cụ âm thanh hoàn chỉnh của chúng tôi dành cho nhà phát triển.
Để bắt đầu, hãy thử nghiệm các mô hình tại ai.studio/live, sao chép các ứng dụng mẫu từ GitHub hoặc trang bị cho tác nhân của bạn kỹ năng live api của chúng tôi.
Bạn cũng có thể tạo các trải nghiệm âm thanh với các mô hình tạo giọng nói và âm nhạc của chúng tôi, tất cả đều có sẵn trong Gemini API:
Micro là của bạn, và chúng tôi rất nóng lòng được thấy những gì bạn sẽ xây dựng!
Bài viết được AI dịch và tổng hợp tự động từ Google AI: DEV. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.