Simon Willison Blog
85

Mô hình

Google ra mắt Gemini 3.8 Live: Trải nghiệm hội thoại giọng nói thời gian thực

(giờ Việt Nam)

Tóm tắt AI

Google vừa giới thiệu bộ đôi mô hình Gemini 3.8 Live và Extended Thinking, mang đến khả năng tương tác giọng nói trực tiếp tương tự GPT-Live của OpenAI.

Bản dịch AI

Tool: Gemini Live audio

Google hôm nay đã ra mắt Gemini 3.8 Live và 3.8 Live Extended Thinking - hai mô hình chuyển đổi giọng nói sang giọng nói (speech-to-speech) mới có cấu trúc tương tự như dòng GPT-Live của OpenAI.

Tôi đã hướng GPT-6 Astra Extra High vào tài liệu hướng dẫn và yêu cầu nó xây dựng giao diện web này để trải nghiệm các mô hình mới. Bạn có thể chọn mô hình và cài đặt giọng nói trước, nhập system prompt tùy chọn, sau đó bắt đầu cuộc trò chuyện bằng giọng nói ngay trên trình duyệt, bao gồm cả khả năng ngắt lời mô hình khi nó đang nói.

Bản triển khai này không sử dụng bất kỳ thư viện nào. Nó kết nối tới endpoint WebSocket wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent?key=... và sử dụng Web Audio API AudioContext cho cả việc thu âm và phát lại.

Đây là hướng dẫn Gemini Live để bắt đầu làm quen với API WebSockets đó.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Simon Willison Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.