Mô hình
Google ra mắt Gemini 3.8 Live và bản Extended Thinking cho trợ lý giọng nói
(giờ Việt Nam)
Tóm tắt AI
Google vừa phát hành hai mô hình hội thoại giọng nói trực tiếp Gemini 3.8 Live và bản Extended Thinking, hiện đã có mặt trên Gemini Live API và Google AI Studio.
Bản dịch AI

Google vừa giới thiệu Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking, những mô hình đối thoại trực tiếp tiên tiến nhất của hãng tính đến thời điểm hiện tại. Cả hai đều là các mô hình chuyển đổi trực tiếp từ giọng nói sang giọng nói (speech-to-speech) được xây dựng cho các tác nhân giọng nói (voice agents) thời gian thực. Chúng mở rộng dòng Gemini Audio mà Google đã phát triển vào tháng trước với Gemini 3.5 Transcribe. Bản phát hành này nhắm đến một khoảng trống cụ thể: các tác nhân giọng nói có khả năng suy luận và thực thi công cụ mà không làm gián đoạn luồng hội thoại.
Có thể triển khai được không? Có, dành cho mục đích sử dụng trong môi trường sản xuất dựa trên API. Cả hai mô hình đều đã có mặt từ hôm nay trong Gemini Live API và Google AI Studio. Đây là các mô hình được lưu trữ (hosted models), không phải mã nguồn mở (open weights), vì vậy không có tùy chọn tự lưu trữ (self-hosted).
Những gì Google đã phát hành
Lần ra mắt này bao gồm 2 mô hình với các vai trò riêng biệt. Gemini 3.8 Live được xây dựng để tối ưu hóa quy mô và chi phí. Nó kết hợp trí tuệ hội thoại với khả năng đối thoại trôi chảy và nhận diện hình ảnh (visual grounding). Gemini 3.8 Live Extended Thinking được xây dựng cho các tác vụ có độ phức tạp cao. Nó bổ sung trí tuệ nâng cao và khả năng suy luận đa bước trong khi đang nói. Google định vị cả hai như một giải pháp thay thế tinh gọn cho các quy trình xử lý giọng nói phân tầng (cascaded speech pipelines) vốn phải kết nối chuỗi ASR, LLM và TTS.
Kết quả đánh giá (Benchmark)
Gemini 3.8 Live Extended Thinking chiếm vị trí số 1 chung cuộc trên bảng xếp hạng Speech to Speech Quality Index của Artificial Analysis với số điểm 82,6. Nó dẫn đầu về khả năng hoàn thành tác vụ của tác nhân với 68,6% trên τ-Voice và 35,1% trên tiêu chuẩn đánh giá τ-Voice-banking của Sierra. Nó cũng đạt 97,7% trên Big Bench Audio, một tiêu chuẩn đánh giá khả năng suy luận cho các mô hình âm thanh. Gemini 3.8 Live giành vị trí thứ hai trong Speech Agent Arena, một bài đánh giá dựa trên trải nghiệm của con người. Trên EVA-Bench của ServiceNow, Google báo cáo rằng các mô hình này đã đẩy giới hạn Pareto cho các quy trình công việc phức tạp. Chúng cân bằng giữa độ chính xác của tác vụ và chất lượng hội thoại, được đo lường trên Live API tại Gemini Enterprise Agent Platform.
Khả năng dành cho nhà phát triển
Live API cung cấp 5 khả năng cốt lõi trong các mô hình mới:
Extended Thinking bổ sung khả năng suy nghĩ có thể cấu hình để suy luận đa bước ở chế độ nền. Mô hình suy luận và nói đồng thời, sử dụng các tín hiệu ngôn ngữ sớm như “Để tôi kiểm tra xem” để xác nhận yêu cầu. Sau đó, nó tường thuật tiến độ từng bước trong khi các tác vụ dài hạn đang được thực thi. Các bản demo của Google cho thấy mô hình có thể chuyển đổi các bản phác thảo cùng phản hồi bằng giọng nói thành các thành phần React hoạt động được và điều phối các quy trình đặt chỗ đa bước.
Giá cả và Hệ sinh thái
Cả hai mô hình đều có giá 0,005 USD/phút cho đầu vào âm thanh và 0,018 USD/phút cho đầu ra âm thanh. Google cho biết ước tính này dựa trên mức 3 USD/1 triệu token đầu vào và 12 USD/1 triệu token đầu ra. Các nhà phát triển cũng có thể xây dựng thông qua các đối tác tích hợp Live API chuyên xử lý cơ sở hạ tầng truyền phát phương tiện thời gian thực. Các đối tác này bao gồm Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel và Vision Agents. Google cũng đang hợp tác với Salesforce, Genspark và Lumeris, những đơn vị đánh giá cao độ trễ, sự trôi chảy và khả năng gọi công cụ của các mô hình này. Các ứng dụng mẫu hiện đã có sẵn trên GitHub.
Những điểm chính cần lưu ý
Hãy xem các chi tiết kỹ thuật và bài viết dành cho nhà phát triển. Mọi công lao đều thuộc về nhóm nghiên cứu của dự án này. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia cộng đồng 150k+ ML SubReddit của chúng tôi cũng như đăng ký nhận Bản tin (Newsletter). Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, sản phẩm mới hay hội thảo trực tuyến (webinar), v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost AI Media Inc. Với tư cách là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về các tin tức học máy (machine learning) và học sâu (deep learning) vừa đảm bảo tính kỹ thuật, vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với người đọc.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.