Hacker News: AI bài nổi bật
92

Mô hình

Google ra mắt Gemini 3.8 Live và bản Extended Thinking: Bước tiến mới cho AI đàm thoại

(giờ Việt Nam)

Tóm tắt AI

Google vừa giới thiệu bộ đôi mô hình Gemini 3.8 Live, tối ưu hóa cho khả năng phản hồi giọng nói thời gian thực, trong đó bản Extended Thinking tập trung vào suy luận đa bước phức tạp.

Bản dịch AI

Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking

15 tháng 9, 2026

Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking là những mô hình đối thoại trực tiếp tiên tiến nhất của chúng tôi từ trước đến nay. Những nâng cấp lớn về trí tuệ và khả năng suy luận song song giúp việc cộng tác và sử dụng giọng nói để thực hiện các tác vụ phức tạp trở nên trực quan hơn.

Tom Ouyang

Kỹ sư chính

Malini Jaganathan

Thành viên đội ngũ kỹ thuật, đại diện cho Nhóm Âm thanh Gemini

Text "Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking" with the Gemini Spark, all on a light blue background

Trình duyệt của bạn không hỗ trợ phần tử âm thanh.

Trình duyệt của bạn không hỗ trợ phần tử âm thanh.

Nghe bài viết

[[duration]] phút

Nội dung này được tạo bởi Google AI. AI tạo sinh là công nghệ đang trong giai đoạn thử nghiệm.

Nội dung này được tạo bởi Google AI. AI tạo sinh là công nghệ đang trong giai đoạn thử nghiệm.

Hôm nay, chúng tôi giới thiệu hai mô hình mới mang đến những tiến bộ trong khả năng suy luận gần như thời gian thực, giúp hỗ trợ hiệu quả hơn cho các tác nhân giọng nói (voice agents) và làm cho việc trò chuyện với AI trở nên trực quan và thông minh hơn.

Đối với các nhà phát triển và doanh nghiệp, những mô hình này cung cấp nền tảng để xây dựng các tác nhân giọng nói đáng tin cậy, sẵn sàng cho sản xuất. Chúng cũng giúp việc trò chuyện với Gemini trên ứng dụng Gemini, Google Workspace và Tìm kiếm trở nên trôi chảy và mang tính cộng tác cao hơn — giúp bạn giải quyết các tác vụ phức tạp chỉ bằng giọng nói.

Trải nghiệm những cuộc trò chuyện thông minh và trôi chảy hơn

Gemini 3.8 Live Extended Thinking cung cấp khả năng hoàn thành tác vụ và trí tuệ ở cấp độ doanh nghiệp, chiếm vị trí số 1 tổng thể trên Chỉ số Chất lượng Speech to Speech của Artificial Analysis (82.6), và dẫn đầu về khả năng hoàn thành tác vụ đại lý với 68.6% trên τ-Voice và 35.1% trên tiêu chuẩn τ-Voice-banking của Sierra. Mô hình này cũng cung cấp khả năng suy luận mạnh mẽ, đạt 97.7% trên Big Bench Audio, đồng thời duy trì mức giá cạnh tranh cao so với các mô hình tiên phong khác.

Gemini 3.8 Live đã cho thấy sự ưa chuộng cao từ người dùng, giành vị trí thứ hai trong Speech Agent Arena. Ngoài hiệu suất này, mô hình vẫn duy trì tính hiệu quả về chi phí — cung cấp cho các nhà phát triển và doanh nghiệp một mô hình mạnh mẽ và hiệu quả được xây dựng để mở rộng quy mô.

a chart showing Artificial Analysis Speech to Speech IndexA chart showing Artificial Analysis agentic performanceA chart showing SierraA chart showing Artificial Analysis cost per hour of input audio

Trên EVA-Bench của ServiceNow, một tiêu chuẩn để đánh giá các tác nhân giọng nói, các mô hình của chúng tôi đã đẩy giới hạn Pareto cho các quy trình công việc phức tạp bằng cách cân bằng thành công giữa độ chính xác và chất lượng hội thoại.

Lưu ý: Kết quả này được thực hiện trên Live API tại Nền tảng Tác nhân Doanh nghiệp Gemini (Gemini Enterprise Agent Platform).

Gemini 3.8 Live xử lý đầu vào hình ảnh gần như thời gian thực, làm phong phú các cuộc trò chuyện bằng ngữ cảnh để có những phản hồi hữu ích hơn. Nó tự động phát hiện và chuyển đổi giữa 97 ngôn ngữ được hỗ trợ ngay trong khi trò chuyện. Nó thực thi các công cụ và lệnh gọi API ở chế độ nền trong khi vẫn tiếp tục cuộc trò chuyện, vì vậy mô hình có thể xác nhận các yêu cầu và tiếp tục trò chuyện trong khi các tác vụ đang được hoàn thành ở chế độ nền.

Đối với các tác vụ đòi hỏi suy luận sâu hơn, 3.8 Live Extended Thinking vừa suy luận vừa nói cùng lúc. Nó mang lại trí tuệ tăng cường cho các quy trình công việc phức tạp trong khi vẫn duy trì luồng hội thoại không bị gián đoạn — sử dụng các tín hiệu bằng lời nói sớm như “Để tôi kiểm tra xem…” để xác nhận các yêu cầu một cách tự nhiên, và tường thuật tiến trình trực tiếp để hướng dẫn người dùng qua các tác vụ nền nhiều bước khi chúng đang được thực hiện.

Trên khắp Google Workspace và Tìm kiếm, các mô hình Live của chúng tôi mang đến những trải nghiệm trực quan và mang tính cộng tác hơn — đặc biệt là khi giải quyết các tác vụ phức tạp nhất của bạn.

Nhận trợ giúp khắc phục sự cố từng bước theo thời gian thực được hỗ trợ bởi Gemini 3.8 Live — ngay trong Tìm kiếm trực tiếp (Search Live).

Trao quyền cho hệ sinh thái giọng nói dành cho nhà phát triển và doanh nghiệp

Bằng cách sử dụng Gemini Live API, các nền tảng dành cho nhà phát triển như Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel và Vision Agents cho phép các nhà phát triển xây dựng và triển khai các giao diện điều khiển bằng giọng nói hiệu suất cao một cách dễ dàng. Các nền tảng này quản lý cơ sở hạ tầng truyền phát phương tiện thời gian thực phức tạp ở phía sau, cho phép các nhà phát triển tập trung hoàn toàn vào việc tạo ra trải nghiệm người dùng.

Chúng tôi cũng đang hợp tác với các công ty như Salesforce, Genspark và Lumeris, những đơn vị rất hào hứng với 3.8 Live và 3.8 Live Extended Thinking, nhấn mạnh vào độ trễ ấn tượng, sự trôi chảy và khả năng gọi công cụ của các mô hình này.

Đảm bảo tính minh bạch với hình mờ SynthID

Tất cả âm thanh được tạo bởi các sản phẩm AI của chúng tôi đều được gắn hình mờ SynthID. Hình mờ không thể nhận thấy này được lồng trực tiếp vào đầu ra âm thanh, đảm bảo nội dung do AI tạo ra vẫn có thể phát hiện được để giúp ngăn chặn thông tin sai lệch. Để biết chi tiết về cách tiếp cận của chúng tôi đối với sự an toàn và trách nhiệm, hãy xem thẻ mô hình (model card).

Bắt đầu sử dụng các mô hình Âm thanh Gemini mới nhất của chúng tôi:

3.8 Live bắt đầu được triển khai từ hôm nay:

3.8 Live Extended Thinking bắt đầu được triển khai từ hôm nay:

Nhận tin tức mới nhất từ Google trong hộp thư đến của bạn

Đăng ký nhận bản tin của chúng tôi để cập nhật thông tin sản phẩm, thông tin sự kiện, ưu đãi đặc biệt và nhiều nội dung khác.

Thông tin của bạn sẽ được sử dụng theo chính sách quyền riêng tư của Google. Bạn có thể hủy đăng ký bất cứ lúc nào.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News: AI bài nổi bật. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.