IT Home
92

Mô hình

Google ra mắt Gemini 3.8 Live: Đột phá hội thoại thời gian thực với khả năng suy luận chuyên sâu

(giờ Việt Nam)

Tóm tắt AI

Google vừa giới thiệu Gemini 3.8 Live và phiên bản Extended Thinking, hỗ trợ 97 ngôn ngữ. Trong đó, bản tiêu chuẩn tối ưu chi phí, còn bản Extended tập trung vào các tác vụ suy luận đa bước phức tạp.

Bản dịch AI

Theo tin từ IT ngày 16 tháng 9, vào ngày 15 tháng 9 theo giờ địa phương, Google đã công bố ra mắt Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking. Google cho biết đây là các mô hình hội thoại thời gian thực tiên tiến nhất của hãng từ trước đến nay, với những nâng cấp đáng kể về trí tuệ và khả năng suy luận song song, giúp các cuộc hội thoại với AI trở nên trực quan và thông minh hơn.

Hai sản phẩm mới bao gồm Gemini 3.8 Live, hướng tới việc triển khai quy mô lớn và tối ưu hóa chi phí, và Gemini 3.8 Live Extended Thinking, hướng tới các tác vụ có độ phức tạp cao và tăng cường khả năng suy luận đa bước.

Gemini 3.8 Live 系列模型

Gemini 3.8 Live kết hợp giữa trí tuệ hội thoại, khả năng giao tiếp trôi chảy và hiểu biết về hình ảnh, tập trung vào tính quy mô và hiệu quả chi phí. Gemini 3.8 Live Extended Thinking tập trung vào các tác vụ phức tạp, sở hữu trí tuệ mạnh mẽ hơn và khả năng suy luận đa bước vượt trội.

Gemini 3.8 Live Extended Thinking đã đạt được những kết quả dẫn đầu trong nhiều bài kiểm tra chuẩn (benchmark), giành vị trí số 1 trên bảng xếp hạng chỉ số chất lượng giọng nói-đối-giọng nói (speech-to-speech) của Artificial Analysis (82,6%), đạt tỷ lệ hoàn thành tác vụ tác nhân τ-Voice là 68,6%, và đạt 35,1% trong bài kiểm tra chuẩn τ-Voice-banking của Sierra; về khả năng suy luận, mô hình đạt 97,7% điểm trong Big Bench Audio, đồng thời vẫn duy trì mức giá cạnh tranh.

Trong khi đó, Gemini 3.8 Live nhận được sự công nhận cao từ người dùng, xếp thứ hai trong Speech Agent Arena và sở hữu hiệu quả chi phí vượt trội, phù hợp cho việc triển khai quy mô lớn. Cả hai mô hình đều đã cân bằng thành công giữa độ chính xác và chất lượng hội thoại trong bài kiểm tra chuẩn tác nhân giọng nói ServiceNow EVA-Bench, đẩy cao đường biên Pareto cho các quy trình làm việc phức tạp.

Gemini 3.8 Live có khả năng xử lý đầu vào hình ảnh gần như thời gian thực, tự động phát hiện và chuyển đổi giữa 97 ngôn ngữ được hỗ trợ trong khi hội thoại, đồng thời có thể thực hiện các lệnh gọi công cụ và API ở chế độ nền mà vẫn duy trì sự trôi chảy của cuộc trò chuyện mà không bị gián đoạn.

Đối với các tác vụ đòi hỏi suy luận chuyên sâu, Gemini 3.8 Live Extended Thinking có thể thực hiện đồng thời việc suy luận và phát ngôn, nâng cao mức độ thông minh cho các quy trình làm việc phức tạp mà không làm gián đoạn sự trôi chảy của cuộc hội thoại. Mô hình phản hồi tự nhiên thông qua các gợi ý ngôn ngữ sớm như "Để tôi xác nhận lại...", đồng thời có thể giải thích tiến độ xử lý các tác vụ nền đa bước theo thời gian thực.

Các nhà phát triển có thể sử dụng Gemini Live API để dễ dàng xây dựng và triển khai các giao diện điều khiển bằng giọng nói hiệu năng cao trên các nền tảng như Agora, Fishjam, LiveKit, Pipecat, Vercel, Vision Agents; Google cũng đã hợp tác với các doanh nghiệp như Salesforce, Genspark, Lumeris để cùng thúc đẩy xây dựng hệ sinh thái.

Tất cả âm thanh do AI của Google tạo ra đều được gắn hình mờ ẩn SynthID, được nhúng trực tiếp vào đầu ra âm thanh, giúp phát hiện nội dung do AI tạo ra và hỗ trợ ngăn chặn sự lan truyền của thông tin sai lệch.

Hiện tại, Gemini 3.8 Live đã bắt đầu được triển khai: các nhà phát triển có thể sử dụng trên Gemini API và Google AI Studio; người dùng doanh nghiệp có thể trải nghiệm sớm trên Gemini Enterprise và sắp có mặt trên Gemini Enterprise for Customer Experience; người dùng phổ thông có thể trải nghiệm trên Search Live.

Gemini 3.8 Live Extended Thinking cũng đã bắt đầu được triển khai: các nhà phát triển có thể sử dụng trên Gemini API và Google AI Studio; người dùng doanh nghiệp có thể trải nghiệm sớm trên Gemini Enterprise, sắp có mặt trên Gemini Enterprise for Customer Experience và các khách hàng doanh nghiệp Google Workspace; người dùng phổ thông có thể trải nghiệm trên Gemini Live, người đăng ký Google AI Pro và Ultra có thể sử dụng trong Docs của Google Workspace, và tất cả người đăng ký Google AI có thể trải nghiệm trong Gmail và Keep.

GoogleGeminiAI hội thoạiLLMCông nghệ mới
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.