The Decoder: AI News
Điểm AI 70/100

Sản phẩm

Google ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS: Thiết kế giọng nói AI từ mô tả văn bản

(giờ Việt Nam)

Tóm tắt AI

Google giới thiệu bộ đôi mô hình Flash TTS hỗ trợ hơn 100 ngôn ngữ, cho phép tạo giọng nói tùy chỉnh qua mô tả văn bản hoặc sao chép giọng nói từ mẫu 30 giây, tích hợp sẵn watermark SynthID để bảo mật.

Chính văn · Bản dịch AI

Google's new Flash TTS models let you design AI voices from scratch using text descriptions

Google đang giới thiệu Gemini 3.8 Flash TTS và Flash-Lite TTS, hai mô hình mới phục vụ tạo giọng nói. Flash TTS có thể tạo ra giọng nói mới từ các mô tả bằng văn bản, và cả hai mô hình đều hỗ trợ hơn 100 ngôn ngữ, cho phép người dùng thêm chỉ dẫn sân khấu vào từng dòng thoại.

Theo Google, Gemini 3.8 Flash TTS được thiết kế cho các dự án sáng tạo như nhân vật trò chơi, sách nói và podcast, trong khi Gemini 3.8 Flash-Lite TTS tập trung vào việc tạo giọng nói chi phí thấp ở quy mô lớn cho lồng tiếng, nội dung âm thanh và các tác nhân giọng nói.

Flash TTS cho phép người dùng tạo giọng nói từ các mô tả bằng văn bản

Với Gemini 3.8 Flash TTS, người dùng có thể thiết kế giọng nói từ đầu. Theo Google, một câu lệnh văn bản có thể xác định vai trò, giọng địa phương và các đặc điểm giọng nói trên nhiều ngôn ngữ và phương ngữ khác nhau. Đối với những người không muốn bắt đầu từ con số không, Google cung cấp một thư viện gồm hơn 2.000 giọng nói cài sẵn, bao gồm các biến thể vùng miền như tiếng Tây Ban Nha Mexico, tiếng Pháp Quebec và tiếng Anh Scotland.

Nội dung media · xem tại bài gốcMở bài gốc ↗

Tính năng nhân bản giọng nói có thể xây dựng hồ sơ giọng nói từ một mẫu âm thanh dài 30 giây. Để sử dụng, người có giọng nói được nhân bản phải ghi âm một tuyên bố đồng ý, và giọng nói trong bản ghi đó phải khớp với mẫu. Mọi đoạn clip do các mô hình âm thanh Gemini tạo ra đều mang một hình mờ SynthID không thể nghe thấy để giúp phát hiện giọng nói do AI tạo ra, theo Google.

Google cũng đã công bố "Voice Remixing", một tính năng cho phép người dùng điều chỉnh âm sắc, cao độ, nhịp độ và giọng địa phương của các giọng nói trong thư viện, nhưng tính năng này hiện chưa khả dụng.

Chỉ dẫn kịch bản giúp người dùng kiểm soát lời thoại và cách truyền đạt

Cả hai mô hình đều cho phép người dùng viết chỉ dẫn cho từng dòng hoặc để mô hình tự diễn giải các gợi ý kịch bản. Google cho biết các mô hình có thể tạo ra hàng giờ âm thanh với độ "trôi loa" tối thiểu, nghĩa là giọng nói hầu như không thay đổi theo thời gian.

Nội dung media · xem tại bài gốcMở bài gốc ↗

Theo công ty, chế độ hai giọng nói tạo ra lời thoại từ một kịch bản duy nhất trong khi vẫn giữ cho các giọng nói riêng biệt. Người dùng cũng có thể viết kịch bản cho tiếng cười, tiếng thở dài và các âm thanh như "mhm" để đặt các phản ứng và khoảng dừng chính xác tại nơi họ muốn.

Nội dung media · xem tại bài gốcMở bài gốc ↗

Trong hai bài kiểm tra của riêng tôi, tôi đã sử dụng một giọng nói cài sẵn với câu lệnh phong cách yêu cầu nó bắt chước một người Berlin khó tính nói tiếng Anh với giọng Đức đặc sệt. Các điều khiển phong cách tạo ra giọng điệu và ngữ điệu thuyết phục, nhưng cả hai bài kiểm tra đều có tiếng rít cao ở nền tại một số thời điểm. Trong một trong số đó, giọng nói cũng bị thay đổi ở cuối clip.

Câu lệnh phong cách: Một người đàn ông Đức bản địa từ Berlin nói tiếng Anh như một ngoại ngữ, với giọng Đức đặc sệt, không thể nhầm lẫn. Anh ta rõ ràng không phải là người nói tiếng Anh bản ngữ: anh ta phát âm các từ tiếng Anh theo cách của người Đức, áp dụng nhịp điệu và ngữ điệu tiếng Đức vào các câu tiếng Anh. "Th" trở thành "z" hoặc "d" ("ze," "sink," "dat"), "w" trở thành "v" ("vat," "vell"), và các phụ âm cuối trở nên cứng hơn ("goot," "bat" thay vì "bad"). Âm "r" là âm họng, không bao giờ là âm "r" của tiếng Anh. Các nguyên âm phẳng và ngắn, thiếu sự mềm mại như trong tiếng Anh Mỹ hoặc Anh.

Giọng nói có âm mũi và hơi căng, ở dải trung, với độ rung khàn và sự chao đảo giống như Kermit, nhưng gai góc hơn và ít giống rối hơn. Nó nghe giống như một người Berlin mệt mỏi lúc 2 giờ sáng.

Cách truyền đạt: nhanh, ngắt quãng, giật cục. Anh ta ngập ngừng một chút khi tìm từ tiếng Anh và đôi khi chèn từ tiếng Đức một cách phẳng lặng mà không dịch nó. Thỉnh thoảng có những đoạn cao độ vút lên đầy bực bội. Khô khan, mỉa mai, không ấn tượng và hơi khó chịu vì phải giải thích bất cứ điều gì—và thậm chí còn khó chịu hơn khi phải làm điều đó bằng tiếng Anh.

Google bắt đầu triển khai cả hai mô hình, quyền truy cập API doanh nghiệp sẽ sớm ra mắt

Google đang triển khai cả hai mô hình thông qua Gemini APIGoogle AI Studio. Flash TTS cũng có sẵn trong Gemini Notebook, trong khi Flash-Lite TTS có sẵn trong Google Vids. Google cho biết quyền truy cập thông qua Gemini Enterprise API sẽ sớm được cung cấp cho cả hai mô hình.

Các nền tảng nhà phát triển bao gồm Agora, LiveKit, PipecatVercel đã hỗ trợ tích hợp thông qua Gemini API. Google chưa liệt kê các điểm cuối khu vực cho các mô hình mới, mặc dù các mô hình TTS trước đây đã cung cấp xử lý dữ liệu tại EU.

Theo Google, dữ liệu từ gói miễn phí được sử dụng để cải thiện sản phẩm của họ, trong khi dữ liệu từ gói trả phí thì không. Giá trả phí được liệt kê bằng đô la Mỹ trên mỗi triệu token, với token văn bản được tính phí cho đầu vào và token âm thanh cho đầu ra.

Thanh toánFlash TTS (đến hết năm 2026)Flash TTS (bắt đầu từ năm 2027)Flash-Lite TTS (đến hết năm 2026)Flash-Lite TTS (bắt đầu từ năm 2027)
Đầu vào văn bản$0.50$1.00$0.50$1.00
Đầu ra âm thanh$9.00$18.00$6.00$12.00

Google cho biết một giây âm thanh được tạo ra tương đương với 25 token âm thanh, nghĩa là một giờ tương đương 90.000 token. Điều đó có nghĩa là một giờ đầu ra âm thanh có giá 0,81 đô la với Flash TTS và 0,54 đô la với Flash-Lite TTS đến hết năm 2026. Vào ngày 1 tháng 1 năm 2027, các chi phí đó tăng lên 1,62 đô la và 1,08 đô la, với đầu vào văn bản được tính phí riêng.

Tin tức AI không cường điệu – Được tuyển chọn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo chuyên sâu "AI Radar" độc quyền sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền truy cập vào phần bình luận của chúng tôi.

Đăng ký ngay

GoogleGemini 3.8Flash TTSAI giọng nóiText-to-Speech

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Google ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS: Thiết kế giọng nói AI từ mô tả văn bản | AIHOT.vn