Google ra mắt mô hình tổng hợp giọng nói Gemini 3.8 Flash TTS
Tổng quan sự kiện
Tóm tắt sự kiện · Thông tin xác thực
Google đã phát hành Gemini 3.8 Flash TTS, hỗ trợ thiết kế giọng nói từ đầu thông qua mô tả văn bản. Công cụ cung cấp thư viện hơn 2000 giọng nói cài sẵn cùng các biến thể vùng miền, hỗ trợ hơn 100 ngôn ngữ, cho phép chỉ dẫn sân khấu theo từng dòng, đối thoại hai nhân vật và các âm thanh phi ngôn ngữ. Việc sao chép giọng nói yêu cầu mẫu âm thanh 30 giây và bản ghi âm xác nhận đồng ý; âm thanh tạo ra sẽ được gắn watermark SynthID. Mô hình được định hướng cho các lĩnh vực sáng tạo như podcast, sách nói, nhân vật trò chơi, hiện đã có mặt trên Gemini API và Google AI Studio, đồng thời khả dụng trên Gemini Notebook, với quyền truy cập API doanh nghiệp sẽ sớm được cập nhật.
Theo bài gốc của sự kiện từ The Decoder: AI News.
Diễn biến mới nhất
Gemini 3.8 Flash TTS và Flash-Lite TTS đã ra mắt trên AI Studio và Gemini API, hỗ trợ tùy chỉnh giọng nói với hơn 100 ngôn ngữ.
Chính chủ · 4 bài
Nghe trực tiếp từ bên liên quan
- X: Artificial Analysis (@ArtificialAnlys)Google phát hành mô hình tổng hợp giọng nói Gemini 3.8 Flash TTS, dẫn đầu bảng xếp hạng về độ ổn định phát âm
- X: Google AI (@GoogleAI)Ra mắt mô hình tổng hợp giọng nói Gemini 3.8 Flash TTS, định vị cho sản xuất sáng tạo độ trung thực cao, hỗ trợ thiết kế nhân vật giọng nói tùy chỉnh từ đầu và cung cấp khả năng kiểm soát chi tiết từng dòng
Dòng thời gian đưa tin
Đang hiện 15 bài · tất cả · mới trước
Hôm nay · 24/09
Gemini 3.8 Flash TTS và Flash-Lite TTS đã ra mắt trên AI Studio và Gemini API, hỗ trợ tùy chỉnh giọng nói với hơn 100 ngôn ngữ
X: Testing Catalog (@testingcatalog)Gemini 3.8 Flash TTS và Flash-Lite TTS đã có mặt trên AI Studio và Gemini API, hỗ trợ tùy chỉnh giọng nói với hơn 100 ngôn ngữ hoặc lựa chọn từ hơn 2000 giọng nói có sẵn; Flash được tích hợp vào Gemini Notebook, còn Flash-Lite được đưa vào Google Vids.
Google DeepMind ra mắt các mô hình chuyển văn bản thành giọng nói Gemini 3.8 Flash và Flash-Lite
X: Hongming (@hongming731)Google DeepMind vừa công bố Gemini 3.8 Flash và Flash-Lite TTS: phiên bản đầu hỗ trợ thiết kế giọng nói bằng ngôn ngữ tự nhiên và hướng dẫn diễn xuất theo từng dòng, phiên bản sau tập trung vào tạo nội dung số lượng lớn. Thông báo cũng nêu rõ việc sao chép giọng nói yêu cầu xác thực quyền sở hữu và tích hợp watermark vào âm thanh được tạo ra.
Google DeepMind giới thiệu các mô hình chuyển văn bản thành giọng nói Gemini 3.8 Flash TTS và Flash-Lite TTS, hỗ trợ tạo giọng nói bằng ngôn ngữ tự nhiên, kiểm soát diễn xuất theo từng dòng, kịch bản hai người nói và sao chép giọng nói từ mẫu khoảng 30 giây
X: Hongming (@hongming731)Google DeepMind ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS: phiên bản đầu tập trung vào sáng tạo giọng nói và thiết kế nhân vật, phiên bản sau hướng tới tạo giọng nói quy mô lớn với chi phí tối ưu, khác biệt với dòng Gemini Live dành cho hội thoại thời gian thực. Flash TTS cho phép tạo giọng nói từ đầu bằng cách chỉ định nhân vật, giọng vùng miền và đặc điểm âm thanh thông qua ngôn ngữ tự nhiên; Google cũng cung cấp hơn 2.000 giọng nói có sẵn. Cả hai mô hình đều hỗ trợ chỉ định tốc độ, ngữ điệu, thay đổi giọng vùng miền và các phản hồi ngắn theo từng dòng trong kịch bản. Google đã trình diễn khả năng kiểm soát kịch bản hai người nói và mô tả năng lực tạo nội dung dài. Hãng cũng làm rõ rằng có thể tái tạo giọng nói được cấp quyền từ mẫu khoảng 30 giây, nhưng trước khi tạo phải cung cấp bản ghi âm xác nhận bằng lời nói khớp với người nói tham chiếu; âm thanh tạo ra sẽ có watermark SynthID và chứng thực nội dung. Trong thông báo, Google dẫn chứng các kết quả dẫn đầu về thiết kế âm thanh, đánh giá chất lượng và thử nghiệm mù đa ngôn ngữ do chính hãng thực hiện. Các nhà phát triển hiện có thể tiếp cận hai mô hình này qua Gemini API và Google AI Studio, đồng thời Google cũng lưu ý về lộ trình triển khai khác nhau trên các nền tảng doanh nghiệp.
Google ra mắt mô hình chuyển đổi văn bản thành giọng nói Gemini 3.8 Flash TTS, khả dụng trên Gemini API và Google AI Studio từ hôm nay
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)Google giới thiệu Gemini 3.8 Flash TTS, hướng tới các tác vụ sáng tạo chuyên sâu và thiết kế nhân vật. Người dùng có thể sử dụng câu lệnh ngôn ngữ tự nhiên để tạo ra giọng nói hoàn toàn mới, đồng thời kiểm soát từng dòng về chỉ dẫn diễn xuất, nhịp điệu, chuyển đổi phương ngữ và các từ đệm. Mô hình hỗ trợ hơn 100 ngôn ngữ và phương ngữ, cung cấp hơn 2000 giọng nói có sẵn, đồng thời có khả năng sao chép giọng nói từ mẫu âm thanh 30 giây (yêu cầu xác thực sự đồng ý, tích hợp watermark SynthID và chứng chỉ C2PA). Mô hình đạt vị trí số 1 trên bảng xếp hạng thiết kế giọng nói của Hume AI với 71,4 điểm, đạt 60,8 điểm về mô hình hóa giọng địa phương, và dẫn đầu trong các bài kiểm tra mù (blind test) tại Voice Arena đối với tiếng Nhật, tiếng Bồ Đào Nha (Brazil), tiếng Việt, tiếng Ả Rập hiện đại, tiếng Tây Ban Nha (Mexico) và tiếng Hindi. Các nhà phát triển có thể sử dụng công cụ này ngay hôm nay qua Gemini API và Google AI Studio; phiên bản doanh nghiệp sẽ sớm ra mắt trên Gemini Enterprise, còn người dùng phổ thông có thể trải nghiệm qua Gemini Notebook.
Google ra mắt mô hình tổng hợp giọng nói Gemini 3.8 Flash TTS
The Decoder: AI NewsGoogle đã phát hành Gemini 3.8 Flash TTS, hỗ trợ thiết kế giọng nói từ đầu thông qua mô tả văn bản. Công cụ cung cấp thư viện hơn 2000 giọng nói cài sẵn cùng các biến thể vùng miền, hỗ trợ hơn 100 ngôn ngữ, cho phép chỉ dẫn sân khấu theo từng dòng, đối thoại hai nhân vật và các âm thanh phi ngôn ngữ. Việc sao chép giọng nói yêu cầu mẫu âm thanh 30 giây và bản ghi âm xác nhận đồng ý; âm thanh tạo ra sẽ được gắn watermark SynthID. Mô hình được định hướng cho các lĩnh vực sáng tạo như podcast, sách nói, nhân vật trò chơi, hiện đã có mặt trên Gemini API và Google AI Studio, đồng thời khả dụng trên Gemini Notebook, với quyền truy cập API doanh nghiệp sẽ sớm được cập nhật.
Google ra mắt hai mô hình chuyển văn bản thành giọng nói mới là gemini-3.8-flash-tts và gemini-3.8-flash-lite-tts
Simon Willison BlogGoogle phát hành hai mô hình chuyển văn bản thành giọng nói Gemini mới: gemini-3.8-flash-tts và gemini-3.8-flash-lite-tts, đi kèm thư viện hơn 2.000 giọng nói, đồng thời hỗ trợ tạo giọng nói tùy chỉnh từ mẫu âm thanh 30 giây của chính người dùng hoặc các mẫu âm thanh được cấp quyền sử dụng.
Hôm qua · 23/09
Ra mắt Gemini 3.8 Flash TTS: Tự tin khẳng định là mô hình chuyển đổi văn bản thành giọng nói (TTS) đạt chuẩn SOTA mới
X: Logan Kilpatrick (@OfficialLoganK)Thông báo ra mắt Gemini 3.8 Flash TTS, định vị là mô hình TTS đạt chuẩn SOTA mới: Mang đến trải nghiệm thiết kế âm thanh hoàn toàn mới với hơn 2.000 giọng nói sẵn sàng cho sản xuất, tính năng sao chép giọng nói và hỗ trợ 100 ngôn ngữ; tính năng voice remixing sẽ sớm ra mắt. Theo thông báo, mô hình này hiện đang đứng đầu bảng xếp hạng về giọng nói của Hume AI.
Google phát hành mô hình tổng hợp giọng nói Gemini 3.8 Flash TTS, dẫn đầu bảng xếp hạng về độ ổn định phát âm
X: Artificial Analysis (@ArtificialAnlys)Chính chủGoogle phát hành mô hình chuyển đổi văn bản thành giọng nói Gemini 3.8 Flash TTS, hỗ trợ giọng nói cài sẵn và sao chép giọng nói. Trong các bài kiểm tra của nhà phát hành, mô hình đạt vị trí số 1 về độ ổn định phát âm với 89,5%, đứng thứ 2 trên Provider Voice Arena với 1.263 Elo. Tốc độ xử lý đạt 44,1 ký tự mỗi giây (nhanh gấp khoảng 2,7 lần thời gian thực), với mức giá 32,98 USD cho mỗi triệu ký tự, cao hơn thế hệ Gemini 3.1 Flash TTS trước đó nhưng thấp hơn đáng kể so với Eleven v3.
Tác giả thông báo các mô hình chuyển đổi văn bản thành giọng nói và thiết kế âm thanh mới nhất đã ra mắt, hiện khả dụng trên AI Studio
X: Ammaar Reshi (@ammaar)Tác giả thông báo các mô hình chuyển đổi văn bản thành giọng nói và thiết kế âm thanh mới nhất đã có mặt trên AI Studio. Các tính năng bao gồm cung cấp hàng nghìn âm sắc mới để lựa chọn, hỗ trợ sao chép giọng nói người dùng trong vòng 30 giây, thiết kế âm thanh thông qua câu lệnh (prompt) và cung cấp các thẻ biểu cảm để kiểm soát hoàn toàn.
Google ra mắt mô hình chuyển đổi văn bản thành giọng nói Gemini 3.8 Flash TTS, hướng tới các ứng dụng sáng tạo chuyên sâu, người dùng có thể trải nghiệm ngay trên Google AI Studio
IT HomeGoogle công bố ra mắt mô hình chuyển đổi văn bản thành giọng nói Gemini 3.8 Flash TTS, tập trung vào thiết kế nhân vật và sáng tạo chuyên sâu. Mô hình cho phép tạo giọng nói mới từ đầu thông qua gợi ý bằng ngôn ngữ tự nhiên, hỗ trợ hướng dẫn diễn xuất từng dòng, tạo văn bản dài, dàn dựng kịch bản hai giọng nói gốc, cùng tính năng sao chép giọng nói (bao gồm xác thực sự đồng ý và gắn watermark SynthID). Mô hình này đứng đầu bảng xếp hạng thiết kế giọng nói của Hume AI (71,4 điểm), đã được cung cấp cho các nhà phát triển thông qua Gemini API, Google AI Studio và Gemini Notebook. Lưu ý: Tính năng sao chép giọng nói qua AI Studio hiện không khả dụng tại Illinois, Texas, Khu vực Kinh tế Châu Âu, Vương quốc Anh, Thụy Sĩ và Ấn Độ.
Google Gemini 3.8 Flash TTS đã chính thức có mặt trên Google AI Studio và API
X: Testing Catalog (@testingcatalog)Theo báo cáo gốc, Gemini 3.8 Flash TTS đã có mặt trên Google AI Studio và API, được mệnh danh là mô hình TTS hàng đầu hỗ trợ thiết kế giọng nói (Voice Design) và điều khiển kịch bản hai người nói. Người dùng có thể tùy chỉnh tính cách giọng nói, hướng dẫn diễn xuất từng dòng và thêm các hiệu ứng nhấn nhá cho giọng nói.
Google giới thiệu mô hình tạo giọng nói Gemini 3.8 Flash TTS, chính thức mở quyền truy cập trên Gemini API và Google AI Studio từ hôm nay
Hacker News: AI bài nổi bậtGoogle công bố ra mắt Gemini 3.8 Flash TTS, định vị là mô hình tạo giọng nói hướng tới mục tiêu chỉ đạo sáng tạo chuyên sâu và thiết kế nhân vật. Mô hình này cho phép tạo giọng nói mới từ đầu thông qua các câu lệnh ngôn ngữ tự nhiên, đồng thời hỗ trợ kiểm soát chi tiết từng dòng về diễn xuất, nhịp điệu và chuyển đổi phương ngữ. Gemini 3.8 Flash TTS hỗ trợ tạo âm thanh dài, dàn dựng kịch bản cho hai người nói và các gợi ý phi ngôn ngữ theo kịch bản. Mô hình này xếp hạng nhất trong tiêu chuẩn thiết kế giọng nói của Hume AI với 71,4 điểm, dẫn đầu về mô hình hóa giọng địa phương với 60,8 điểm, đồng thời đứng đầu trong các bài kiểm tra mù tại Voice Arena đối với tiếng Nhật, tiếng Bồ Đào Nha (Brazil), tiếng Việt, tiếng Ả Rập hiện đại, tiếng Tây Ban Nha (Mexico) và tiếng Hindi. Các nhà phát triển có thể sử dụng mô hình này thông qua Gemini API và Google AI Studio từ hôm nay, phiên bản API doanh nghiệp sẽ sớm có mặt trên Gemini Enterprise, còn người dùng phổ thông có thể trải nghiệm tại Gemini Notebook.
Ra mắt mô hình tổng hợp giọng nói Gemini 3.8 Flash TTS, định vị cho sản xuất sáng tạo độ trung thực cao, hỗ trợ thiết kế nhân vật giọng nói tùy chỉnh từ đầu và cung cấp khả năng kiểm soát chi tiết từng dòng
X: Google AI (@GoogleAI)Chính chủNguyên văn thông báo ra mắt Gemini 3.8 Flash TTS, được định vị cho các tác vụ sáng tạo đòi hỏi độ trung thực cao như trò chơi, sách nói nhập vai và podcast. Công cụ này hỗ trợ thiết kế nhân vật giọng nói tùy chỉnh từ con số không và cung cấp khả năng kiểm soát chi tiết đến từng dòng. Thông báo cho biết mô hình có thể tạo giọng nói tùy chỉnh bằng hơn 100 ngôn ngữ, cung cấp hơn 2.000 giọng nói có sẵn và hỗ trợ các gợi ý tự nhiên như <laughs>, |mhm|. Đơn vị phát hành không được nêu tên cụ thể trong văn bản gốc.
Ra mắt mô hình chuyển văn bản thành giọng nói Gemini 3.8 Flash TTS, hỗ trợ thiết kế giọng nói tùy chỉnh với giọng vùng miền và đặc điểm riêng biệt
X: Google DeepMind (@GoogleDeepMind)Chính chủThông báo chính thức về việc phát hành mô hình chuyển văn bản thành giọng nói Gemini 3.8 Flash TTS mới, cho phép tạo và triển khai âm thanh tùy chỉnh, hỗ trợ thiết kế giọng nói với các đặc điểm và giọng vùng miền độc đáo.
Google ra mắt Gemini 3.8 Flash TTS, mở quyền truy cập cho nhà phát triển thông qua Gemini API và AI Studio, trong khi phiên bản doanh nghiệp và kênh Gemini Notebook sẽ có lộ trình riêng
Google DeepMind: BlogChính chủGoogle công bố ra mắt Gemini 3.8 Flash TTS, hướng tới mục tiêu hỗ trợ sáng tạo chuyên sâu và thiết kế nhân vật. Mô hình hỗ trợ tạo giọng nói tùy chỉnh từ đầu bằng gợi ý ngôn ngữ tự nhiên, hướng dẫn diễn xuất theo từng dòng, hỗ trợ hơn 100 ngôn ngữ và cung cấp tính năng sao chép giọng nói kèm xác thực sự đồng ý, hình mờ SynthID cùng chứng chỉ C2PA. Mô hình này đã giành vị trí dẫn đầu trên bảng xếp hạng Hume AI Voice Design Benchmark (71.4) và đạt thứ hạng cao trong các bài kiểm tra mù đa ngôn ngữ tại Voice Arena. Ngay khi ra mắt, mô hình đã được mở cho nhà phát triển thông qua Gemini API và Google AI Studio; kênh dành cho doanh nghiệp thông qua Gemini Enterprise sẽ sớm được triển khai, đồng thời tích hợp vào Gemini Notebook cho tất cả người dùng; tính năng phối lại giọng nói cũng sẽ sớm ra mắt.