Sản phẩm
Google ra mắt bộ đôi mô hình chuyển văn bản thành giọng nói Gemini 3.8 Flash TTS và Flash-Lite TTS
(giờ Việt Nam)
Tóm tắt AI
Google vừa giới thiệu Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS, tối ưu hóa cho các tác vụ lồng tiếng sáng tạo và xử lý tự động hóa với tốc độ cao.
Chính văn · Bản dịch AI

Google vừa ra mắt hai mô hình TTS Gemini 3.8 Flash, giới thiệu các hệ thống tạo giọng nói chuyên dụng được thiết kế cho việc viết kịch bản hiệu suất trực tiếp và sản xuất âm thanh khối lượng lớn. Việc phát hành song song này phân chia các tác vụ tổng hợp giọng nói giữa định hướng sáng tạo và cơ sở hạ tầng quản lý chi phí.
Gemini 3.8 Flash TTS nhắm đến lĩnh vực giải trí tương tác, phát triển trò chơi và tường thuật dài tập, nơi các đội ngũ studio yêu cầu thiết kế giọng nói dựa trên câu lệnh. Gemini 3.8 Flash-Lite TTS tập trung vào lồng tiếng truyền thông tự động, các tác nhân hội thoại hướng tới khách hàng và các đường ống dịch thuật có lưu lượng cao.
Cả hai hệ thống đều mở rộng danh mục âm thanh hiện có của Google, vốn trước đó đã giới thiệu 3.5 Live Translate, 3.5 Transcribe, 3.8 Live và 3.8 Live Extended Thinking. Các đội ngũ kỹ thuật đã cấu trúc các mô hình mới để thay thế cho danh mục cố định gồm 30 giọng nói cũ.
Các nhà phát triển hiện có thể truy cập vào thư mục chứa hơn 2.000 hồ sơ giọng nói được xây dựng sẵn, bao phủ các biến thể ngôn ngữ khu vực như tiếng Pháp Quebec, tiếng Anh Scotland và tiếng Tây Ban Nha Mexico trên hơn 100 ngôn ngữ. Một mô-đun phối lại giọng nói sắp ra mắt sẽ cho phép các kỹ sư âm thanh điều chỉnh âm sắc, cao độ, tốc độ và các đường nét nhấn giọng thông qua các lệnh văn bản trực tiếp.
Các bài kiểm tra đánh giá hiệu suất tổng hợp của Hume AI
Các đánh giá độc lập xếp mô hình lớn hơn vào vị trí dẫn đầu trong các bảng xếp hạng âm thanh của bên thứ ba.
Trên bảng xếp hạng Hume AI Voice Design Benchmark, Gemini 3.8 Flash TTS đạt tổng điểm 71.4, cùng với xếp hạng 60.8 dẫn đầu danh mục về mô hình hóa giọng địa phương.
Trong Chỉ số Chất lượng Tổng thể của Hume AI, Gemini 3.8 Flash TTS chiếm vị trí dẫn đầu trong khi Gemini 3.8 Flash-Lite TTS giành vị trí thứ hai, vượt qua các tiêu chuẩn cơ sở trước đó được thiết lập bởi Gemini 3.1 Flash TTS.
Các thử nghiệm mù đôi trên người được thực hiện thông qua Voice Arena đã xác nhận ưu thế về sở thích đối với các ngôn ngữ khu vực, bao gồm tiếng Nhật, tiếng Bồ Đào Nha Brazil, tiếng Việt, tiếng Ả Rập chuẩn hiện đại, tiếng Tây Ban Nha Mexico và tiếng Hindi.

Dàn dựng đa loa và các lượt tổng hợp mở rộng là trọng tâm chính. Các kịch bản đơn lẻ điều khiển các cuộc trao đổi giữa hai người nói, giúp duy trì sự luân phiên hội thoại tự nhiên và sự tách biệt giọng nói trong các đoạn đối thoại kéo dài.
Chất lượng âm thanh và âm sắc nhân vật vẫn ổn định qua các tệp kéo dài nhiều giờ, giúp giảm thiểu sự suy giảm chất lượng giọng nói trong quá trình ghi âm sách nói và podcast nhiều tập.
Người viết có thể chèn các dấu hiệu âm thanh phi ngôn ngữ trực tiếp vào văn bản sản xuất, thêm các thẻ như <laughs>, <sigh> hoặc <gasp> vào các dòng, cùng với các từ đệm phản ứng như |mhm| và |yeah| để cân bằng nhịp độ hội thoại.
Các biện pháp kiểm soát an toàn của Google cho các mô hình giọng nói Gemini 3.8 Flash TTS
Các đường ống nhân bản giọng nói dựa vào các bước kiểm tra danh tính bắt buộc để chống lại rủi ro giả mạo. Việc tạo lại một hồ sơ giọng nói yêu cầu bản ghi tham chiếu dài 30 giây kèm theo bản ghi đồng ý bằng lời nói rõ ràng do chính chủ sở hữu giọng nói thực hiện. Google xác thực sự khớp âm thanh giữa cả hai bản ghi trước khi xử lý các hồ sơ tùy chỉnh.
Các tệp âm thanh được tạo ra sẽ nhúng các hình mờ âm thanh SynthID không thể nhận thấy và siêu dữ liệu nguồn gốc C2PA mã hóa trực tiếp vào dạng sóng xuất ra, đảm bảo các công cụ phát hiện hạ nguồn có thể xác định được các tài sản giọng nói tổng hợp.
Việc triển khai trong môi trường doanh nghiệp đã bắt đầu trên nhiều hệ sinh thái phần mềm. Các nhà phát triển phần mềm có thể truy cập cả Flash TTS và Flash-Lite TTS thông qua Google AI Studio và Gemini API tiêu chuẩn, kết nối với các khung phát triển được vận hành bởi Agora, LiveKit, Pipecat và Vercel. Các tích hợp thương mại sớm bao gồm Figma, HeyGen, Linguana, Wondercraft, 99.co và Ollang cho dịch thuật truyền thông khu vực và tự động hóa dịch vụ khách hàng.
Người dùng cuối nhận được Flash TTS trực tiếp bên trong Gemini Notebook, trong khi Google Vids tích hợp Flash-Lite TTS. Khách hàng Gemini Enterprise sẽ nhận được quyền truy cập API quản trị trong đợt triển khai sắp tới.
Xem thêm: U.S. TRANSCOM triển khai AI ngẫu nhiên để bảo mật hậu cần quân sự

Bạn muốn tìm hiểu thêm về AI và dữ liệu lớn từ các nhà lãnh đạo ngành? Hãy xem AI & Big Data Expo diễn ra tại Amsterdam, California và London. Sự kiện toàn diện này là một phần của TechEx và được tổ chức cùng với các sự kiện công nghệ hàng đầu khác bao gồm IoT Tech Expo và Cyber Security & Cloud Expo. Nhấp vào đây để biết thêm thông tin.
AI News được vận hành bởi TechForge Media. Khám phá các sự kiện và hội thảo trực tuyến về công nghệ doanh nghiệp sắp tới tại đây.
Bài viết được AI dịch và tổng hợp tự động từ Artificial Intelligence News (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.