Sản phẩm
Gradium ra mắt Voice Design: Tạo giọng nói AI độc bản chỉ từ văn bản mô tả
(giờ Việt Nam)
Tóm tắt AI
Gradium vừa giới thiệu Voice Design, công cụ cho phép tạo ra các giọng nói tổng hợp mới hoàn toàn chỉ trong vài giây thông qua mô tả văn bản mà không cần âm thanh mẫu. Công cụ hiện hỗ trợ 5 ngôn ngữ và đã mở miễn phí cho người dùng trên nền tảng của hãng.
Bản dịch AI

Các đội ngũ phát triển voice agent luôn vấp phải cùng một rào cản. Danh mục có sẵn 400 giọng nói nhưng yêu cầu công việc lại đòi hỏi một giọng không có trong đó: một lễ tân người Quebec cho đại lý xe ở Montreal, hay một người dẫn chuyện ngoài 60 tuổi với phong thái uy nghiêm của một giảng viên. Các yêu cầu thực tế luôn vượt xa bất kỳ danh mục nào, và công nghệ nhân bản (cloning) giúp thu hẹp khoảng cách này từng người một, với mỗi giọng nói đều phải đi kèm quy trình tìm nguồn, xin phép và cấp phép.
Gradium, công ty AI về giọng nói có trụ sở tại Paris tách ra từ phòng thí nghiệm nghiên cứu Kyutai, đã đưa ra một giải pháp khác biệt. Voice Design đọc mô tả bằng văn bản và trả về những giọng nói hoàn toàn mới chỉ trong vài giây. Không cần âm thanh tham chiếu, không cần người lồng tiếng, không cần lo về vấn đề bản quyền.
Liệu nó có khả thi để triển khai? Có, Voice Design hiện đã hoạt động trên Gradium API và trong Studio, miễn phí cho mọi gói bao gồm cả gói miễn phí. Một giọng nói được lưu lại sẽ chạy trên cùng điểm cuối (endpoint) streaming Text-to-Speech như bất kỳ giọng nói nào trong danh mục, với cùng độ trễ và định dạng đầu ra.
Bản mô tả casting chính là API
Mô tả là đầu vào duy nhất mà mô hình nhận được. Tài liệu của Gradium liệt kê các thuộc tính mà mô hình phản hồi, và chúng đọc giống như một thông báo tuyển diễn viên: giới tính, độ tuổi, giọng địa phương hoặc nguồn gốc, cao độ, tốc độ, năng lượng, âm sắc và độ vang, âm vực và phong cách, cùng với công việc mà giọng nói đó đảm nhận. Các mô tả có độ dài từ 1 đến 500 ký tự bằng tiếng Anh, Pháp, Tây Ban Nha, Bồ Đào Nha hoặc Đức. Gradium khuyên nên kết thúc mô tả bằng mục đích sử dụng dự kiến, vì điều này giúp định hướng cách truyền đạt và âm vực thay vì chỉ tập trung vào màu sắc của giọng nói.
Một yêu cầu sẽ trả về từ 1 đến 5 ứng viên, thường sẵn sàng trong 3 đến 5 giây. Đây là các biến thể của một nhân vật duy nhất, vì vậy một nhân vật khác đồng nghĩa với một mô tả khác, chứ không phải là thêm các mẫu thử.
Từ ứng viên đến giọng nói hoàn thiện
Quy trình bao gồm bốn lệnh gọi. POST /voice-generator/generate tạo ra các ID ứng viên với trạng thái ready: false. GET /voice-generator/embeddings thực hiện thăm dò cho đến khi trạng thái thay đổi. Mỗi ứng viên sẽ được nghe thử thông qua điểm cuối TTS thông thường, sử dụng ID ứng viên làm voice_id. POST /voices/from-embedding sẽ chuyển đổi ứng viên bạn chọn thành giọng nói chính thức.
Các ứng viên có ba hạn chế mà các giọng nói đã chuyển đổi không gặp phải: văn bản nghe thử giới hạn ở 100 ký tự, chỉ hỗ trợ REST, và các dịch vụ TTS WebSocket và Speech-to-Speech sẽ từ chối chúng. Các ứng viên chưa chuyển đổi sẽ bị xóa sau 30 ngày. Việc chuyển đổi là miễn phí, xóa bỏ thời hạn hết hạn và sử dụng một vị trí giọng nói tùy chỉnh dùng chung với các giọng nhân bản. Gói miễn phí có 5 vị trí, các gói trả phí có 1.000 vị trí.
Việc lấy mẫu được thiết kế cố tình không mang tính tất định. Đội ngũ Gradium mở rộng mô tả trước, và phần mở rộng đó thay đổi theo từng yêu cầu, vì vậy cùng một câu lệnh (prompt) với một hạt giống (seed) cố định vẫn tạo ra giọng nói khác nhau.
Điểm chuẩn và cách đọc kết quả
Gradium đã thực hiện một bài kiểm tra nghe mù (blind test) theo cặp trên các câu lệnh về giọng địa phương thông qua sáu hệ thống thiết kế giọng nói có API công khai và năm ngôn ngữ. Người bản ngữ nghe hai đoạn âm thanh không dán nhãn và chọn đoạn khớp hơn, hoặc chọn hòa. Qua 7.627 lượt so sánh, Gradium báo cáo tỷ lệ thắng 72,6% so với các đối thủ, dẫn trước 13,6 điểm so với eleven_ttv_v3 của ElevenLabs (59,0%), tiếp theo là Inworld (44,8%), Fish Audio (36,7%) và MiniMax (31,7%). Tỷ lệ thắng được tính bằng số trận thắng cộng với một nửa số trận hòa, vì vậy 50% là mức trung bình. Gradium đứng đầu ở cả năm ngôn ngữ. Biên độ dẫn trước lớn nhất nằm ở các giọng địa phương mà hầu hết các danh mục khác thường làm phẳng: tiếng Pháp Quebec (97%), tiếng Tây Ban Nha Rioplatense (86%), tiếng Đức Bavaria (85%), tiếng Tây Ban Nha Colombia và tiếng Bồ Đào Nha châu Phi (83%).
Một mô hình đánh giá trên cùng tập câu lệnh cũng cho kết quả tương tự. Gemini 3.1 Pro đã chấm điểm các đoạn âm thanh không dán nhãn từ 1 đến 5 và đưa ra bảng xếp hạng tương tự: Gradium 4.06, ElevenLabs 3.86, Inworld 3.64, Fish Audio 3.51. Ngoài ra, trang sản phẩm tuyên bố đạt 83,4% độ tuân thủ câu lệnh trên tập dữ liệu tiếng Anh của InstructTTSEval, một điểm chuẩn học thuật về khả năng tuân thủ hướng dẫn trong TTS. (Lưu ý: Tất cả các con số này đều do nhà cung cấp thiết kế và thực hiện.)
Những điểm chính cần lưu ý
Hãy xem qua các chi tiết kỹ thuật và Tài liệu. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ thành viên của chúng tôi cũng như Đăng ký Bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, Trang Hugging Face, Phát hành sản phẩm, Hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có giá trị thực tiễn.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.