Mô hình
Google ra mắt Gemini 3.8 Flash và Flash-Lite TTS: Đột phá khả năng kiểm soát giọng nói
(giờ Việt Nam)
Tóm tắt AI
Google vừa giới thiệu bộ đôi mô hình Gemini 3.8 Flash TTS và Flash-Lite TTS, cho phép kiểm soát chi tiết từng dòng thoại với hỗ trợ hơn 100 ngôn ngữ và 2000 tùy chọn giọng nói có sẵn.
Chính văn · Bản dịch AI
Theo IT ngày 23 tháng 9, Google hôm nay đã công bố bổ sung hai mô hình chuyển văn bản thành giọng nói (TTS) mới vào gia đình Gemini. Các mô hình này chuyển đổi việc tạo giọng nói từ các thiết lập tĩnh sang studio sáng tạo năng động, giúp người sáng tạo, nhà phát triển và doanh nghiệp tạo ra trải nghiệm âm thanh phong phú, biểu cảm hơn, đồng thời cải thiện trải nghiệm người dùng cho các sản phẩm như Gemini Notebook và Google Vids.

Hai mô hình mới bao gồm Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS, với định vị khác nhau:
- Gemini 3.8 Flash TTS: Hướng tới mục tiêu sáng tạo chuyên sâu và thiết kế nhân vật, cho phép tạo giọng nói hoàn toàn mới từ đầu thông qua các gợi ý bằng ngôn ngữ tự nhiên. Mô hình này giúp thổi hồn vào các nhân vật trong trò chơi, sách nói nhập vai, podcast và phương tiện tương tác, đồng thời cho phép kiểm soát tinh vi về chỉ dẫn diễn xuất, nhịp điệu, chuyển đổi phương ngữ, v.v.
- Gemini 3.8 Flash-Lite TTS: Hướng tới các kịch bản quy mô lớn với hiệu quả chi phí cao, được tối ưu hóa cho việc lồng tiếng số lượng lớn, sáng tạo nội dung âm thanh và các tác nhân giọng nói biểu cảm, cho phép kiểm soát chi tiết về cao độ, nhịp điệu và các sắc thái biểu cảm.
Theo tìm hiểu của IT, người dùng có thể mở rộng từ 30 giọng nói gốc ban đầu lên thư viện giọng nói không giới hạn. Các tính năng cụ thể của mô hình bao gồm:
- Thiết kế giọng nói tạo sinh: Có thể tùy chỉnh nhân vật, giọng địa phương và đặc điểm giọng nói bằng gợi ý ngôn ngữ tự nhiên, hỗ trợ hơn 100 ngôn ngữ và phương ngữ để tạo giọng nói tùy chỉnh từ đầu.
- Thư viện giọng nói mở rộng: Truy cập hơn 2.000 giọng nói có sẵn, bao phủ nhiều ngôn ngữ, bao gồm các biến thể khu vực như tiếng Tây Ban Nha Mexico, tiếng Pháp Quebec, tiếng Anh Scotland, v.v.
- Sao chép giọng nói: Chỉ cần 30 giây mẫu âm thanh để tái tạo các đặc điểm giọng nói nhất quán, tích hợp xác thực sự đồng ý, hình mờ SynthID và thông tin xác thực C2PA để bảo vệ nhà phát triển và tài năng giọng nói.
- Lưu và mở rộng: Có thể lưu và quản lý các giọng nói tùy chỉnh, đảm bảo hiệu suất nhất quán trong các dự án dài hạn và giảm thiểu hiện tượng trôi giọng (drift).
- Phối trộn giọng nói: Sắp ra mắt, người dùng có thể chọn một giọng nói từ thư viện, tinh chỉnh âm sắc, cao độ, nhịp điệu và giọng địa phương, đồng thời sử dụng các gợi ý để điều chỉnh đặc điểm.
Sau khi chọn giọng nói, cả hai mô hình TTS đều cho phép người dùng kiểm soát chính xác cách thể hiện từng dòng thoại:
- Hướng dẫn diễn xuất từng dòng: Người dùng có thể viết chỉ dẫn sân khấu của riêng mình hoặc để Gemini hướng dẫn cách thể hiện thông qua các gợi ý kịch bản tự nhiên, từ phong thái nhân viên chăm sóc khách hàng bình tĩnh đến các cảnh hồi hộp thì thầm.
- Tạo nội dung dài: Duy trì chất lượng giọng nói cao, nhịp điệu tự nhiên và âm sắc nhân vật trong nhiều giờ âm thanh liên tục với độ trôi giọng cực thấp, rất phù hợp cho podcast và sách nói.
- Dàn dựng kịch bản hai giọng nói tự nhiên: Có thể hướng dẫn liền mạch các cuộc hội thoại nhiều lượt từ một kịch bản duy nhất, đồng thời giữ cho hai giọng nói tách biệt rõ ràng, tạo ra sự luân phiên đối thoại tự nhiên.
- Chèn âm thanh và phản hồi nền theo kịch bản: Có thể thêm các gợi ý phi ngôn ngữ (như <laughs>, <sigh>, <gasp>) và các từ đệm lắng nghe chủ động (như mhm hoặc yeah) để đạt được thời điểm hài hước và nhịp điệu phản ứng chính xác, tăng thêm chất lượng đối thoại chân thực.
Về hiệu suất, Gemini 3.8 Flash TTS đứng đầu tổng thể trong bài kiểm tra chuẩn thiết kế giọng nói của Hume AI (71,4 điểm) và cũng dẫn đầu về khả năng mô hình hóa giọng địa phương (60,8 điểm).
Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS đạt được hiệu suất biểu cảm thực sự mà không làm giảm độ tin cậy, lần lượt chiếm vị trí thứ nhất và thứ hai trong chỉ số chất lượng tổng thể của Hume AI. So với Gemini 3.1 Flash TTS, các mô hình này có những cải tiến đáng kể trong các trường hợp sử dụng rộng rãi như nội dung định dạng dài và điều khiển kịch bản hai loa.
Trong đánh giá ưu tiên của con người theo phương pháp mù tại Voice Arena, Gemini 3.8 Flash và Flash-Lite TTS chiếm ưu thế so với các đối thủ cạnh tranh trên các ngôn ngữ chính toàn cầu (tiếng Nhật, tiếng Bồ Đào Nha Brazil, tiếng Việt, tiếng Ả Rập hiện đại, tiếng Tây Ban Nha Mexico và tiếng Hindi). Với sự hỗ trợ cho hơn 100 ngôn ngữ, các mô hình này giúp người sáng tạo, nhà phát triển và doanh nghiệp tạo ra trải nghiệm giọng nói đa ngôn ngữ chất lượng cao trên toàn cầu.
Google đã tích hợp các biện pháp bảo vệ nghiêm ngặt vào các tính năng tạo và sao chép giọng nói để giúp bảo vệ tài năng giọng nói, tôn trọng danh tính và đảm bảo tính minh bạch của nội dung. Đối với việc sao chép giọng nói, hệ thống sử dụng xác thực sự đồng ý: người dùng phải cung cấp bản ghi âm đồng ý bằng lời nói từ chủ sở hữu giọng nói, sau đó khớp với người nói tham chiếu mới có thể tạo giọng nói.
Mỗi đoạn âm thanh do mô hình Gemini Audio tạo ra đều mang hình mờ SynthID khó nhận biết, được lồng trực tiếp vào đầu ra âm thanh, đảm bảo có thể phát hiện giọng nói do AI tạo ra, giúp ngăn chặn thông tin sai lệch.
Kể từ hôm nay, các nhà phát triển có thể trải nghiệm các tính năng tạo giọng nói mới này trong Google AI Studio. Người dùng có thể tạo danh tính giọng nói hoàn toàn mới từ đầu thông qua gợi ý, hoặc sao chép giọng nói của chính mình, sau đó đưa chúng trực tiếp vào trình chỉnh sửa kịch bản hai loa để hướng dẫn cách thể hiện từng dòng.
Cả hai mô hình đã được gửi đến các nhà phát triển và có thể sử dụng trong Gemini API và Google AI Studio; đối với người dùng doanh nghiệp, chúng sẽ sớm ra mắt thông qua API trong Gemini Enterprise; đối với tất cả người dùng, Gemini 3.8 Flash TTS có sẵn trong Gemini Notebook và Gemini 3.8 Flash-Lite TTS có sẵn trong Google Vids.
Cần lưu ý rằng, việc sao chép giọng nói thông qua AI Studio không khả dụng tại Illinois, Texas, Khu vực Kinh tế Châu Âu, Vương quốc Anh, Thụy Sĩ và Ấn Độ.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.