Hướng dẫn
Trò chuyện cùng CEO ElevenLabs: Định giá 22 tỷ USD và doanh thu ARR đạt 600 triệu USD
(giờ Việt Nam)
Tóm tắt AI
TechCrunch phỏng vấn CEO Mati Staniszewski về sự bùng nổ của ElevenLabs, với doanh thu định kỳ hàng năm (ARR) đạt 600 triệu USD, trong đó hơn 55% đến từ khối doanh nghiệp và mức định giá ấn tượng 22 tỷ USD.
Chính văn · Bản dịch AI

ElevenLabs xây dựng lớp giọng nói cho AI, các mô hình chuyển đổi văn bản thành giọng nói nghe như người thật. Hầu hết mọi người bắt gặp nó khi đang trò chuyện với dịch vụ khách hàng — thường là mà không hề hay biết. Ví dụ, Klarna sử dụng nó để hỗ trợ điện thoại tuyến đầu cho 35 triệu khách hàng tại Mỹ. Deutsche Telekom, Cisco, Adobe và ngày càng nhiều chính phủ cũng làm như vậy. ElevenLabs cũng bán dịch vụ cho các nhà sáng tạo, những người sử dụng nền tảng của họ cho sách nói, lồng tiếng và âm nhạc.
Họ không đơn độc trong lĩnh vực này. Trên thực tế, họ ngày càng chạm trán với chính khách hàng của mình, bao gồm Decagon, một nền tảng AI hội thoại đã huấn luyện sản phẩm giọng nói của họ trên ElevenLabs và hiện đang cạnh tranh với chính công ty này. Nhưng các nhà đầu tư của họ dường như không quá lo lắng. Công ty, vốn cho biết đang đạt tốc độ doanh thu định kỳ hàng năm là 600 triệu USD, hiện được báo cáo là được định giá ở mức 22 tỷ USD bởi các nhà đầu tư, mặc dù mới chỉ hoạt động được bốn năm.
Để hiểu rõ hơn, tôi đã phỏng vấn đồng sáng lập kiêm CEO của ElevenLabs, Mati Staniszewski, tại Nrth ở Toronto, một hội nghị khởi nghiệp địa phương trước đây có tên là Elevate. Chúng tôi đã đề cập đến nhiều chủ đề trong thời gian ngắn, bao gồm việc liệu các doanh nghiệp có nên thông báo cho khách hàng khi họ đang nói chuyện với AI hay không (ông ấy nghĩ là nên), và liệu ông ấy có thể thảo luận về biên lợi nhuận gộp của công ty hay không. Không có gì ngạc nhiên khi Staniszewski nói rằng ông không thể thảo luận chi tiết, nhưng ông khẳng định rõ ràng rằng mình không ngại việc biên lợi nhuận bị thu hẹp hơn nữa nếu điều đó đồng nghĩa với việc mở rộng thị phần của công ty.
Cuộc trò chuyện của chúng tôi dưới đây đã được tóm tắt và biên tập nhẹ. Bạn có thể xem toàn bộ cuộc trò chuyện tại đây.
Bạn đã tham gia cùng chúng tôi tại TechCrunch Disrupt năm ngoái, nơi bạn nói rằng các mô hình âm thanh sẽ trở thành hàng hóa phổ thông trong vòng vài năm. Bây giờ bạn đánh giá dự đoán đó như thế nào?
Vẫn còn rất nhiều việc phải làm, và sự khác biệt về chất lượng mà bạn có thể đạt được ở cấp độ mô hình vẫn còn rất đáng kể. Nếu nhìn về dài hạn, có lẽ từ ba đến năm năm nữa, những khác biệt đó sẽ nhỏ hơn. Điều chúng tôi muốn làm, và là những người đầu tiên làm được, là vượt qua bài kiểm tra Turing cho AI hội thoại. Bạn cần kết hợp trí thông minh, nhưng bạn cũng cần trí tuệ cảm xúc. Bạn cần hiểu cảm xúc của đối phương để có thể nói chậm lại hoặc nói to hơn. Điều đó vẫn chưa được thực hiện.
Tỷ lệ phần trăm doanh nghiệp hiện nay là bao nhiêu?
Chúng tôi hiện đạt 600 triệu USD ARR. Hơn 55% là doanh nghiệp truyền thống, và một tỷ lệ lớn trong 45% [còn lại] là các doanh nghiệp vừa và nhỏ, nhà phát triển, người xây dựng, nhà sáng tạo.
Giống như những người khác trong ngành AI, bạn đang ngày càng cạnh tranh với chính khách hàng của mình. Decagon đã huấn luyện sản phẩm giọng nói của họ trên bạn và hiện đang chạy các truy vấn thông qua các mô hình của riêng họ.
Ranh giới ngày càng trở nên mờ nhạt. Khi chúng ta nghĩ về các công ty mô hình, công ty nền tảng, công ty ứng dụng, trong quá khứ bạn sẽ có những phân chia rất rõ ràng về nơi bắt đầu và kết thúc. Ngày nay, ranh giới đó mờ nhạt hơn nhiều. Trong trường hợp của Anthropic, những gì từng là một công ty mô hình chắc chắn đã trở thành một nền tảng và ngày càng có nhiều ứng dụng rộng rãi. Tôi nghĩ điều này sẽ tiếp tục.
Khách hàng của bạn có thể chọn "lớp suy luận" từ một menu các tùy chọn tại ElevenLabs. Bạn thấy gì về việc sử dụng các mô hình phòng thí nghiệm tiên phong (frontier lab models) so với các mô hình mở (open-weight)?
Đó không hẳn là một lựa chọn nhị phân. Trong trải nghiệm khách hàng, nếu bạn gọi điện đến và chỉ để lấy thông tin, bạn không thực hiện bất kỳ hành động nào — bạn có thể sử dụng rất nhiều mô hình mã nguồn mở vì cơ sở tri thức của bạn xác định thế nào là một trải nghiệm tốt. Nhưng nếu đó là dịch vụ tài chính, bạn muốn được xác thực, bạn muốn thông tin về một giao dịch, có thể là hoàn tiền. Không có chỗ cho sai sót. Ở đây, các mô hình tiên phong vẫn sẽ dẫn đầu.
Một số mô hình mở đó là của Trung Quốc. Chính phủ Mỹ là khách hàng. Các chính phủ châu Âu là khách hàng. Những cuộc trò chuyện đó diễn ra như thế nào?
Rất khác biệt. Trong mỗi lần triển khai, các mô hình và giọng nói chúng tôi triển khai sẽ phụ thuộc vào từng trường hợp. Nếu chúng tôi làm việc với chính phủ Ba Lan hoặc Brazil, họ có những yêu cầu riêng. Đó có thể là mô hình mở, mô hình đóng, hoặc mô hình tự tinh chỉnh của riêng họ. [Tại Ba Lan,] đó là một trường hợp về chăm sóc sức khỏe. Bạn có bệnh nhân đặt lịch hẹn qua hệ thống y tế công cộng, và 18% không bao giờ đến. Việc triển khai là các tác nhân (agent) gọi điện và nhắc nhở bạn. Họ có một tập hợp các mô hình được tối ưu hóa dựa trên kiến thức của họ, và chúng tôi tích hợp trong khi vẫn đảm bảo lưu trữ dữ liệu tại chỗ.
Các doanh nghiệp có nên tiết lộ khi ai đó đang nói chuyện với một tác nhân thay vì một con người không?
Tôi nghĩ vào thời điểm này nên có sự tiết lộ. Hiện tại, mọi người chưa quen với điều đó, và mô hình chung là bạn không muốn cảm thấy bị lừa dối trong cuộc gọi đó. Nhưng trong năm năm nữa, khi mọi người đều có tác nhân riêng làm việc thay cho mình, bạn sẽ gọi điện và mong đợi gặp một tác nhân. Khi đó, tôi nghĩ xã hội sẽ thay đổi. Có những cách tốt để thực hiện việc này — nếu phải chờ 30 phút để gặp người thật, hãy đưa ra cho khách hàng một lựa chọn. Trong hầu hết các trường hợp, họ chọn tác nhân và sau đó họ ngạc nhiên vì trải nghiệm tốt đến thế nào.
Biên lợi nhuận gộp của bạn là bao nhiêu, xét đến chi phí bạn phải trả cho các mô hình và suy luận?
Tôi sẽ đưa ra một câu trả lời mơ hồ. Vì chúng tôi có yếu tố nghiên cứu đó, chúng tôi có thể tinh chỉnh và giới hạn các mô hình theo những cách cực kỳ thông minh. Nhưng nếu có thể chuyển bất kỳ khoản tiết kiệm nào cho khách hàng, chúng tôi sẽ làm điều đó. Điều quan trọng nhất vẫn là chứng minh giá trị và đồng hành cùng khách hàng. Vì vậy, nếu chúng tôi có thể đầu tư và chứng minh giá trị đó, chúng tôi không ngại việc biên lợi nhuận thấp hơn để thực sự cùng nhau hưởng lợi khi giá trị được tạo ra trong năm năm tới.
Bạn có hàng triệu giờ gọi dịch vụ khách hàng. Bạn có huấn luyện trên đó không? Bao nhiêu phần trăm dữ liệu huấn luyện của bạn là dữ liệu tổng hợp (synthetic)?
Ở một số công ty nhất định, chúng tôi cùng nhau tạo ra các mô hình. Họ muốn một mô hình cụ thể cho trường hợp sử dụng của họ. Ngoài ra, phần lớn việc huấn luyện không nằm ở khối lượng dữ liệu, mà là chú thích dữ liệu. Chúng tôi có hàng ngàn người làm việc nội bộ theo hợp đồng giúp chúng tôi chú thích không chỉ những gì đã được nói, mà còn là khi nào mọi người đang nói, cách họ nói, và những cảm xúc nào đã được sử dụng. Chúng tôi đã phải mời các huấn luyện viên giọng nói để có thể phát hiện giọng địa phương một cách chính xác.
Có thông tin cho rằng bạn đang nhắm đến năm 2028 để IPO. Bạn có thể xác nhận điều đó không?
Chúng tôi muốn tạo ra một công ty đứng vững trước thử thách của thời gian. Chúng tôi đang chuẩn bị nền tảng để có thể thực hiện điều đó trong những năm tới. Nhưng liệu chúng tôi có làm hay không sẽ phụ thuộc vào thời điểm và hoàn cảnh.
'Những năm tới' là một khoảng thời gian rất mơ hồ.
[Cười.]
Hậu trường: Quan điểm của bạn về việc liệu các phòng thí nghiệm tiên phong có nên chậm lại không?
Mọi người đều đồng lòng làm việc cùng nhau để tìm cách điều chỉnh tốc độ. Liệu họ có nên công khai về điều đó hay không, và nó nên liên quan đến bao nhiêu phần trong các cuộc thảo luận truyền thông hoặc quy định, đó là một chủ đề khác. Nhưng vâng, tất cả chúng ta nên thực hiện các biện pháp phòng ngừa đúng đắn khi triển khai công nghệ. Chúng tôi không huấn luyện các mô hình văn bản và khía cạnh trí thông minh của các mô hình, đó mới là chìa khóa cốt lõi của cuộc tranh luận.
Liệu ElevenLabs có thể bị phơi bày theo cách mà Hugging Face đã từng gặp phải không?
Chúng tôi đã tiến thêm một bước, vì chúng tôi không triển khai các thành phần tự sao chép hoặc đệ quy trong trí tuệ của các tác nhân (agents). Công nghệ của chúng tôi không cho phép bạn để các tác nhân tự tạo ra thêm tác nhân khác. Mọi khách hàng đều phải trải qua quy trình KYC. Rủi ro an ninh mạng chắc chắn là một mối đe dọa đối với thế giới rộng lớn hơn, nhưng chúng tôi đã thiết lập sẵn một bộ các biện pháp phòng ngừa hiệu quả.
Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong công tác biên tập của chúng tôi.


Bài viết được AI dịch và tổng hợp tự động từ TechCrunch: AI. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.