TechCrunch: AI
85

Tin ngành

Fish Audio huy động 50 triệu USD để phát triển mô hình giọng nói AI cho nhà sáng tạo

(giờ Việt Nam)

Tóm tắt AI

Fish Audio vừa gọi vốn thành công 50 triệu USD nhờ sở hữu thư viện hơn 15.000 giọng nói AI và đạt doanh thu định kỳ hàng năm 21 triệu USD. Dự án mã nguồn mở Fish Speech của hãng hiện đang thu hút sự chú ý lớn với hơn 31.000 sao trên GitHub.

Bản dịch AI

Fish Audio raises $50M seed to build AI voice models for creators and enterprises

Thị trường cho các mô hình giọng nói do AI tạo ra đang vô cùng lớn mạnh. Các trường hợp sử dụng sáng tạo đòi hỏi các mô hình giọng nói AI phải biểu cảm hơn, trong khi các doanh nghiệp muốn tự động hóa dịch vụ khách hàng và vận hành bán hàng lại cần chúng có khả năng điều khiển linh hoạt hơn.

Fish Audio, công ty có trụ sở tại Palo Alto, muốn đáp ứng tất cả các nhu cầu đó với thư viện gồm hơn 15.000 tùy chọn điều khiển ngôn ngữ tự nhiên. Kể từ khi ra mắt vào năm ngoái, startup này hiện đã có hơn 8 triệu người sử dụng các phiên bản mã nguồn mở hoặc phiên bản lưu trữ trên nền tảng của họ, và hiện đang tạo ra doanh thu định kỳ hàng năm là 21 triệu USD.

Để tiếp tục đà phát triển đó, startup này cho biết vào thứ Ba rằng họ đã huy động được 50 triệu USD trong vòng gọi vốn hạt giống do Coreline Ventures và Capital Today dẫn đầu. Vòng gọi vốn này cũng có sự tham gia của 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners và HF0.

Fish Audio khởi đầu là một dự án nhỏ của cựu nghiên cứu viên NVIDIA, Shijia Liao. Vì thất vọng với các giọng nói tổng hợp thiếu cảm xúc trên thị trường, anh đã huấn luyện một mô hình tạo giọng nói trên một GPU duy nhất và chia sẻ nó dưới dạng mã nguồn mở. Kho lưu trữ Fish Speech trên GitHub hiện đã có hơn 31.000 lượt sao (stars) và được sử dụng bởi các nhà phát triển độc lập, nhà thiết kế trò chơi điện tử và những người sáng tạo nội dung.

Công ty đã ra mắt năm mô hình trong năm qua: bốn mô hình tạo giọng nói và một mô hình chuyển đổi giọng nói thành văn bản. Họ đã mở mã nguồn cho ba trong số các mô hình tạo giọng nói của mình, nhưng mô hình S2.1 Pro mới nhất chỉ khả dụng thông qua API trả phí.

Fish Audio cung cấp các gói đăng ký hàng tháng trả phí phù hợp cho người sáng tạo và các nhóm, cho phép mở khóa một số phút tạo giọng nói nhất định cùng các tính năng nhân bản giọng nói. Công ty cũng cung cấp phiên bản doanh nghiệp cho các API và nền tảng của mình, đồng thời cho biết các tổ chức như HeyGen, Sanas và Plaud đã và đang sử dụng dịch vụ này.

"Mỗi doanh nghiệp đều có các trường hợp sử dụng và ưu tiên khác nhau. Ví dụ, các công ty như HeyGen, vốn sử dụng giọng nói của chúng tôi để vận hành các AI avatar, muốn giọng nói phải chân thực; một studio trò chơi sẽ muốn giọng nói biểu cảm cho nhân vật của họ; và các công ty về tác nhân giọng nói như LiveKit lại muốn những giọng nói nghe tự nhiên hơn và có độ trễ thấp, đủ biểu cảm cho các cuộc gọi," Cao cho biết.

Một cách mà startup này xây dựng thư viện giọng nói là đơn giản yêu cầu người dùng gửi giọng nói của chính họ để huấn luyện các mô hình và trả thù lao cho họ nếu giọng nói đó được sử dụng. Tuy nhiên, điều này đã gây ra một số rắc rối vài tháng trước, khi một số người sáng tạo cho rằng giọng nói của họ đã bị tải lên Fish Audio mà không có sự đồng ý của họ. Startup này đã có sẵn quy trình gỡ bỏ nội dung theo DMCA để giải quyết các mối lo ngại như vậy, nhưng bản thân việc gỡ bỏ lại mất rất nhiều thời gian.

CEO và đồng sáng lập của Fish Audio, Rissa Cao, chia sẻ với TechCrunch rằng công ty hiện đã tự động hóa quy trình gỡ bỏ. Người sáng tạo có thể dễ dàng gửi một đoạn mẫu giọng nói ngắn hoặc hợp đồng để chứng minh giọng nói được tải lên thuộc về họ, và giọng nói đó sẽ được gỡ khỏi nền tảng của startup trong chưa đầy 3 phút, cô cho biết.

Tuy nhiên, điều đó không ngăn cản được việc ai đó tải lên giọng nói của một nghệ sĩ mà họ không hề hay biết. Và cho đến khi nghệ sĩ đó phát hiện ra, giọng nói của họ sẽ tiếp tục được sử dụng trên nền tảng cho đến khi họ nộp đơn yêu cầu gỡ bỏ.

Oskue Honda, đối tác tại Coreline Ventures, cho biết một mô hình dựa vào cộng đồng chỉ hoạt động hiệu quả khi người sáng tạo tin tưởng vào nền tảng.

"Cách tiếp cận lấy cộng đồng làm trung tâm chỉ có thể trở thành lợi thế bền vững nếu người sáng tạo tin tưởng vào nền tảng. Điều đó có nghĩa là sự đồng thuận, tính minh bạch và quyền ghi công phải được tích hợp vào sản phẩm thay vì chỉ được xem xét sau cùng. Tôi tin rằng ngành công nghiệp cần hướng tới việc xác thực quyền sở hữu giọng nói, các điều khoản cấp phép rõ ràng, quy trình báo cáo và gỡ bỏ dễ dàng, và cuối cùng là các mô hình chia sẻ doanh thu, nơi người sáng tạo được hưởng lợi về tài chính khi giọng nói của họ được cấp phép hoặc sử dụng cho mục đích thương mại," ông nói.

Cao cho biết khi startup chỉ cung cấp sản phẩm dưới dạng dự án mã nguồn mở với các gói dành cho người sáng tạo, họ vận hành hiệu quả và không cần vốn. Nhưng họ muốn phát triển các mô hình tiên tiến hơn, đồng thời muốn đáp ứng nhu cầu của các doanh nghiệp khi sự quan tâm từ nhà đầu tư ngày càng tăng, điều này đã thúc đẩy họ tìm kiếm nguồn vốn.

Hướng tới tương lai, Fish Audio dự định phát hành một mô hình hiểu âm thanh trong năm nay. Họ cũng đang xây dựng một mô hình chuyển đổi giọng nói thành giọng nói (speech-to-speech).

Thị trường tạo giọng nói đang rất đông đúc, với các công ty như ElevenLabs, WellSaid, Cartesia, Speechify, Async (trước đây là Podcastle) và Krisp đang cạnh tranh để giành lấy ví tiền của người sáng tạo và doanh nghiệp.

Theo Rico Mallozzi, đối tác tại 359 Capital, các tùy chọn điều khiển chi tiết dành cho nhà phát triển và việc huấn luyện mô hình tiết kiệm chi phí sẽ giúp Fish Audio cạnh tranh tốt hơn với các phòng thí nghiệm AI lớn.

"Tôi nghĩ những gì họ đã xây dựng được, các mô hình hiện đại nhất, với đội ngũ hiện có, so với một số phòng thí nghiệm hoặc công ty AI được tài trợ tốt khác, là điều đáng kinh ngạc. Nó cho thấy sự nhạy bén về kỹ thuật của họ trong việc thu hẹp khoảng cách giữa giọng nói nhân tạo và giọng nói giống con người," Mallozzi nói với TechCrunch qua một cuộc gọi.

Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.

Ivan MehtaEvent Logo
Fish AudioAI VoiceGọi vốnCông nghệ âm thanhStartup AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ TechCrunch: AI. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.