Google ra mắt mô hình giọng nói thời gian thực Gemini 3.8 Live và 3.5 Transcribe
Tổng quan sự kiện
Toàn cảnh do AI tổng thuật
Google ra mắt hai mô hình hội thoại giọng nói thời gian thực là Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking. Theo blog của Google DeepMind, Gemini 3.8 Live tập trung vào quy mô và hiệu quả chi phí, kết hợp trí tuệ hội thoại, sự trôi chảy và khả năng hiểu hình ảnh; nó có thể xử lý đầu vào hình ảnh gần như thời gian thực, tự động phát hiện và chuyển đổi giữa 97 ngôn ngữ được hỗ trợ trong khi hội thoại, đồng thời thực thi các công cụ và lệnh gọi API ở chế độ nền mà không làm gián đoạn cuộc trò chuyện. Phiên bản Extended Thinking hướng tới các tác vụ có độ phức tạp cao, vừa suy luận vừa nói, phản hồi bằng các câu dẫn như "Để tôi xác nhận lại...", đồng thời giải thích tiến độ các tác vụ nền nhiều bước theo thời gian thực. Google cho biết Gemini 3.8 Live xếp thứ hai trên Speech Agent Arena, trong khi Extended Thinking đứng đầu chỉ số chất lượng giọng nói-sang-giọng nói của Artificial Analysis với 82,6 điểm, đạt 68,6% ở τ-Voice, 35,1% ở Sierra τ-Voice-banking và 97,7% ở Big Bench Audio. Cả hai mô hình hiện đã có mặt trên Gemini API và Google AI Studio; đối với khách hàng doanh nghiệp, chúng đang ở giai đoạn xem trước riêng tư trên Gemini Enterprise. Ngoài ra, Gemini 3.8 Live còn được tích hợp vào Search Live, còn Extended Thinking có mặt trên Gemini Live và các ứng dụng Docs, Gmail, Keep dành cho người đăng ký Google AI Pro/Ultra.
Các bên thứ ba và nhà phát triển đã đưa ra những đánh giá bổ sung với các góc nhìn khác nhau. Artificial Analysis cho biết họ đã đánh giá phiên bản tiêu chuẩn và phiên bản có cường độ suy luận cao (High), trong đó Extended Thinking (High) lần đầu tiên đứng đầu Speech to Speech Index với 82,6 điểm và dẫn đầu chuẩn đo lường Tau Voice với 68,6%. The Decoder báo cáo mức giá là 0,005 USD mỗi phút cho đầu vào âm thanh và 0,018 USD cho đầu ra, thấp hơn nhiều so với mức 0,05 USD mỗi phút của OpenAI GPT-Live-1. Họ cũng nhận định rằng GPT-Live-1 vẫn mang lại trải nghiệm hội thoại tự nhiên hơn nhờ tính năng song công toàn phần (full-duplex) và âm thanh demo nghe tốt hơn, cho rằng Google một lần nữa ưu tiên giá cả hơn chất lượng. Rohan Paul cho biết Gemini 3.8 Live đạt hiệu suất tác nhân giọng nói cấp độ tiên tiến với chi phí khoảng 0,84 USD/giờ, tổng điểm cao hơn GPT-Realtime-2 High với chi phí thấp hơn khoảng 80%, đồng thời chỉ số 68,6% của Extended Thinking trên τ-Voice cũng vượt qua mức 67,9% của GPT-Live-1 Astra medium. Testing Catalog cho biết Extended Thinking (High) đã vượt qua GPT Live 1 trong hầu hết các bài kiểm tra chuẩn và xếp hạng nhất. MarkTechPost lưu ý rằng cả hai đều là mô hình được quản lý (hosted models), không mở mã nguồn trọng số, không có tùy chọn tự lưu trữ và tất cả âm thanh tạo ra đều chứa hình mờ ẩn SynthID của Google DeepMind.
Về hệ sinh thái và tích hợp, Google cho biết các nhà phát triển có thể xây dựng giao diện giọng nói thông qua Gemini Live API và các đối tác tích hợp như Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents. Google cũng hợp tác với Salesforce, Genspark và Lumeris; các đối tác này đánh giá cao độ trễ, sự trôi chảy và khả năng gọi công cụ của mô hình. IT đưa tin rằng tất cả âm thanh do AI của Google tạo ra đều được nhúng hình mờ ẩn SynthID.
Về dòng thời gian, Testing Catalog trước đó đã phát hiện tên gọi Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking xuất hiện trên trang hạn mức của GCP Console và cho biết mô hình Gemini Live mới dựa trên Gemini 3.8 Flash dự kiến sẽ là một bước nhảy vọt lớn. Sau đó, Google AI, Google DeepMind và blog chính thức của Google đã công bố hai mô hình này. Simon Willison nhận xét rằng hình thái của hai mô hình này tương tự như các mô hình GPT-Live của OpenAI, đồng thời ông đã sử dụng GPT-6 Astra Extra High để xây dựng một giao diện web thử nghiệm dựa trên tài liệu, cho phép chọn mô hình và thiết lập giọng nói, nhập lời nhắc hệ thống để hội thoại, hỗ trợ ngắt lời khi mô hình đang nói và kết nối trực tiếp với điểm cuối WebSocket mà không cần dùng bất kỳ thư viện nào.
Tổng thuật do AI tổng hợp từ toàn bộ bài đưa tin, cập nhật theo diễn biến · làm mới T4 · 16/09 · 22:40.
Diễn biến mới nhất
Simon Willison cho biết ông đã sử dụng GPT-6 Astra Extra High để xây dựng một giao diện web thử nghiệm dựa trên tài liệu. Giao diện này cho phép người dùng chọn mô hình và thiết lập giọng nói, nhập lời nhắc hệ thống (system prompt) để thực hiện hội thoại bằng giọng nói, hỗ trợ ngắt lời khi mô hình đang nói và kết nối trực tiếp với điểm cuối WebSocket mà không cần sử dụng bất kỳ thư viện nào.
Chính chủ · 5 bài
Nghe trực tiếp từ bên liên quan
- Google AI: DEV tác giảGoogle ra mắt mô hình giọng nói thời gian thực Gemini 3.8 Live và 3.5 Transcribe
- X: Artificial Analysis (@ArtificialAnlys)Đánh giá mô hình giọng nói Gemini 3.8 Live: Phiên bản Extended Thinking dẫn đầu bảng xếp hạng Speech to Speech Index
Dòng thời gian đưa tin
Đang hiện 18 bài · tất cả · mới trước
T4 · 16/09
Google ra mắt mô hình giọng nói thời gian thực Gemini 3.8 Live và 3.5 Transcribe
Google AI: DEV tác giảChính chủGoogle đã phát hành các mô hình giọng nói Gemini 3.8 Live và 3.8 Live Extended Thinking trên Gemini API và Google AI Studio. Các mô hình này hỗ trợ gọi hàm bất đồng bộ, ngữ cảnh thị giác, hơn 97 ngôn ngữ và khả năng tùy chỉnh tư duy. Phiên bản Extended Thinking hiện đang đứng đầu bảng xếp hạng giọng nói-sang-giọng nói của Artificial Analysis.
Bản tin AI hàng ngày: Gemini 3.8 Live ra mắt, GPT-5.5 sắp ngừng hoạt động
X: Testing Catalog (@testingcatalog)Google công bố Gemini 3.8 Live và 3.8 Live Extended Thinking, hỗ trợ tự động phát hiện 97 ngôn ngữ, xử lý hình ảnh gần như thời gian thực và gọi công cụ chạy ngầm. Hiện tại, Live đã có mặt trên Search Live và bản xem trước công khai của Gemini API.
Google ra mắt Gemini 3.8 Live và phiên bản Extended Thinking
X: Rohan Paul (@rohanpaul_ai)Google phát hành Gemini 3.8 Live và 3.8 Live Extended Thinking, hướng tới các tác nhân trí tuệ nhân tạo (AI agent) cấp độ sản xuất. Microsoft AI công bố bộ quy tắc ứng xử cho các mô hình MAI trong tương lai, yêu cầu quyền kiểm soát của con người là yếu tố không thể thương lượng. Nvidia, Palantir và Booz Allen hạn chế sử dụng Claude Fable do chính sách lưu trữ dữ liệu 30 ngày của Anthropic.
Bản tin sáng BestBlogs: Gemini 3.8 Live và cuộc trò chuyện của Jensen Huang về an toàn AI
X: Hongming (@hongming731)Bản tin sáng ngày 16/09 của BestBlogs tổng hợp 10 tin tức AI, tiêu điểm là việc Google DeepMind ra mắt Gemini 3.8 Live. Công nghệ này tích hợp khả năng hiểu hình ảnh thời gian thực, đối thoại đa ngôn ngữ và gọi công cụ nền vào cùng một luồng thoại, đồng thời bổ sung phiên bản Extended Thinking để xử lý các tác vụ đa bước.
Google ra mắt mô hình hội thoại giọng nói Gemini 3.8 Live và 3.8 Live Extended Thinking, Simon Willison tự xây dựng giao diện web để thử nghiệm thực tế
Simon Willison BlogGoogle phát hành hai mô hình giọng nói-đối-giọng nói là Gemini 3.8 Live và 3.8 Live Extended Thinking, với hình thái tương tự dòng mô hình GPT-Live của OpenAI.
Google ra mắt các mô hình đối thoại thời gian thực Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking, hỗ trợ chuyển đổi giữa 97 ngôn ngữ
IT HomeVào ngày 15 tháng 9, Google đã giới thiệu hai mô hình đối thoại thời gian thực là Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking. Trong đó, phiên bản đầu tiên tập trung vào triển khai quy mô lớn và tối ưu hóa chi phí, còn phiên bản thứ hai hướng tới các tác vụ có độ phức tạp cao, tăng cường khả năng suy luận đa bước.
Đánh giá mô hình giọng nói Gemini 3.8 Live: Phiên bản Extended Thinking dẫn đầu bảng xếp hạng Speech to Speech Index
X: Artificial Analysis (@ArtificialAnlys)Chính chủArtificial Analysis đã đánh giá mô hình chuyển đổi giọng nói sang giọng nói Gemini 3.8 Live do Google phát hành. Trong đó, phiên bản Extended Thinking (High) đã vươn lên dẫn đầu Speech to Speech Index với 82,6 điểm, đồng thời đứng đầu bảng xếp hạng Tau Voice với tỷ lệ 68,6%.
Google ra mắt các mô hình tác nhân thông minh giọng nói Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking
MarkTechPostGoogle vừa phát hành hai mô hình đối thoại giọng nói-đến-giọng nói nguyên bản là Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking. Các mô hình này hiện đã có mặt trên Gemini Live API và Google AI Studio, tuy nhiên Google không cung cấp quyền truy cập trọng số (open weights) dưới hình thức lưu trữ.
Google ra mắt các mô hình hội thoại bằng giọng nói Gemini 3.8 Live và 3.8 Live Extended Thinking
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)Google vừa giới thiệu hai mô hình hội thoại bằng giọng nói gần như thời gian thực là Gemini 3.8 Live và 3.8 Live Extended Thinking, tập trung vào khả năng làm tác nhân giọng nói (voice agent) và thực thi các tác vụ phức tạp.
Google ra mắt mô hình hội thoại giọng nói Gemini 3.8 Live và 3.8 Live Extended Thinking
Hacker News: AI bài nổi bậtGoogle phát hành hai mô hình hội thoại giọng nói gần như thời gian thực là Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking, lần lượt hướng tới hiệu quả chi phí quy mô lớn và các tác vụ suy luận đa bước phức tạp.
Google ra mắt Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking, dẫn đầu bảng xếp hạng giọng nói-đến-giọng nói
X: Rohan Paul (@rohanpaul_ai)Google ra mắt Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking. Theo bảng xếp hạng của Artificial Analysis, các mô hình này đã giành vị trí số 1 về tổng thể giọng nói-đến-giọng nói, trong đó Extended Thinking đạt 82,6%, dẫn trước mức 81,5% của GPT-Live-1 Astra (Medium).
Google ra mắt mô hình giọng nói Gemini 3.8 Live, cạnh tranh trực tiếp với GPT-Live-1 của OpenAI bằng mức giá thấp
The Decoder: AI NewsGoogle DeepMind phát hành hai mô hình giọng nói dành cho nhà phát triển là Gemini 3.8 Live và 3.8 Live Extended Thinking, hiện đã có thể sử dụng thông qua Gemini API và Google AI Studio.
Google ra mắt các mô hình giọng nói thời gian thực Gemini 3.8 Live và 3.8 Live Extended Thinking
X: Logan Kilpatrick (@OfficialLoganK)Google công bố hai mô hình giọng nói thời gian thực Gemini 3.8 Live và 3.8 Live Extended Thinking, khẳng định đạt chuẩn SOTA với hiệu năng và mức giá dẫn đầu thị trường. Gemini 3.8 Live hỗ trợ 97 ngôn ngữ với khả năng chuyển đổi mượt mà, hỗ trợ gọi công cụ bất đồng bộ; hình ảnh đính kèm cho thấy Gemini 3.8 Live Extended Thinking đạt 82,6% trên chỉ số Artificial Analysis Speech to Speech Index.
Google ra mắt các mô hình âm thanh Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking
X: Testing Catalog (@testingcatalog)Google giới thiệu hai mô hình âm thanh Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking, hiện đã có mặt trên các ứng dụng như API, Google AI Studio và Gemini Live.
Google DeepMind phát hành Gemini 3.8 Live và 3.8 Live Extended Thinking
X: Google DeepMind (@GoogleDeepMind)Chính chủGoogle DeepMind ra mắt Gemini 3.8 Live và 3.8 Live Extended Thinking
Google DeepMind: BlogChính chủGoogle DeepMind ra mắt hai mô hình đối thoại giọng nói gần như thời gian thực là Gemini 3.8 Live và 3.8 Live Extended Thinking, tập trung vào các tác nhân giọng nói (voice agents) và thực thi tác vụ phức tạp.
Google ra mắt các mô hình âm thanh Gemini 3.8 Live và 3.8 Live Extended Thinking
X: Google AI (@GoogleAI)Chính chủGoogle AI công bố Gemini 3.8 Live và 3.8 Live Extended Thinking, những mô hình âm thanh Gemini tiên tiến nhất từ trước đến nay.
T3 · 15/09
Tên hai mô hình Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking vừa xuất hiện trên trang hạn mức của GCP Console
X: Testing Catalog (@testingcatalog)Hai tên gọi Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking đã chính thức xuất hiện trên trang hạn mức của GCP Console. Các mô hình mới này được xây dựng dựa trên nền tảng Gemini 3.8 Flash mới nhất, hứa hẹn là một bước tiến lớn của Gemini Live; hiện tại, mô hình Gemini Live mới nhất khả dụng qua API vẫn là Gemini 3.1 Live Preview.