IT Home
Điểm AI 64/100

Mô hình

ElevenLabs ra mắt mô hình giọng nói v4 và v4 Turbo: Hỗ trợ hơn 90 ngôn ngữ, chỉ cần 10 giây để sao chép giọng nói

(giờ Việt Nam)

Tóm tắt AI

ElevenLabs vừa trình làng hai mô hình v4 và v4 Turbo với khả năng kiểm soát cảm xúc tốt hơn, độ trễ thấp và hỗ trợ hơn 90 ngôn ngữ. Người dùng hiện có thể sao chép giọng nói cá nhân chỉ với 10 giây dữ liệu âm thanh đầu vào.

Chính văn · Bản dịch AI

IT ngày 29 tháng 9 đưa tin, ElevenLabs đã chính thức ra mắt hai mô hình giọng nói hoàn toàn mới vào thứ Hai theo giờ địa phương, lần lượt là ElevenLabs v4 và v4 Turbo. Các phiên bản mô hình mới được tăng cường khả năng kiểm soát biểu cảm cảm xúc, giảm độ trễ phản hồi của các tác nhân giọng nói (voice agents), đồng thời hỗ trợ hơn 90 ngôn ngữ.

Công ty đã phát hành mô hình v3 vào năm ngoái và đã giới thiệu trước thế hệ mô hình mới tại một sự kiện tổ chức ở Warsaw đầu năm nay. Dòng v4 sử dụng kiến trúc hoàn toàn mới, đạt được khả năng kiểm soát giọng nói tinh vi hơn và sao chép giọng nói với tốc độ nhanh hơn. Theo thông tin chính thức, với v4, người dùng chỉ cần 10 giây dữ liệu âm thanh là có thể hoàn tất việc sao chép giọng nói.

Về khía cạnh sáng tạo nội dung, khi đọc các đoạn văn bản dài, mô hình mới có thể duy trì tốt hơn các đặc điểm âm sắc của người nói; trong quá trình đọc, mô hình còn có thể ghi nhớ ngữ cảnh văn bản trước sau để điều chỉnh giọng điệu cho phù hợp. ElevenLabs từng giới thiệu các thẻ nội dòng (inline tags) trong phiên bản v3 để thiết lập cảm xúc giọng nói; đến v4, tính năng thẻ đã được mở rộng hơn nữa, cho phép người dùng chồng nhiều thẻ lên nhau và mô hình sẽ thực hiện theo thứ tự ưu tiên của các thẻ đó.

Phiên bản mô hình cũ hỗ trợ 70 ngôn ngữ. Sau khi được tối ưu hóa, số lượng ngôn ngữ được hỗ trợ trong phiên bản mới đã tăng lên 90. Công ty khởi nghiệp này cho biết chất lượng tổng hợp tiếng Nhật, tiếng Bồ Đào Nha (Brazil), tiếng Quan Thoại và tiếng Quảng Đông đã có sự cải thiện đáng kể nhất.

Trong năm qua, mảng kinh doanh cuộc gọi thoại doanh nghiệp của ElevenLabs đã mở rộng nhanh chóng, hiện hơn 55% doanh thu của công ty đến từ các doanh nghiệp lớn. Phía công ty chỉ ra rằng, mô hình mới rất phù hợp với các kịch bản tác nhân giọng nói: độ trễ thấp hơn mang lại trải nghiệm hội thoại mượt mà hơn. Ngoài ra, khi mô hình ngôn ngữ lớn (LLM) ở phía backend bắt đầu xuất ra câu trả lời, v4 có thể đồng thời tạo ra âm thanh giọng nói. Không chỉ vậy, mô hình này còn có khả năng xử lý khác biệt các tình huống như hội thoại tranh luận, yêu cầu leo thang và chờ cuộc gọi, từ đó giải quyết các vấn đề kinh doanh tốt hơn.

Đầu năm nay, ElevenLabs đã nhận được khoản đầu tư 500 triệu USD từ Sequoia Capital (Lưu ý của IT: tỷ giá hiện tại tương đương khoảng 3,36 tỷ nhân dân tệ), đưa định giá sau đầu tư của vòng này lên 11 tỷ USD (tỷ giá hiện tại tương đương khoảng 73,914 tỷ nhân dân tệ). Hiện đã có tin đồn cho rằng công ty đang chuẩn bị cho một vòng gọi vốn mới với mục tiêu định giá có thể đạt 22 tỷ USD (tỷ giá hiện tại tương đương khoảng 147,829 tỷ nhân dân tệ). Tốc độ doanh thu hàng năm (ARR) của ElevenLabs đã tăng từ khoảng 330 triệu USD (tỷ giá hiện tại tương đương khoảng 2,217 tỷ nhân dân tệ) vào đầu năm lên hơn 600 triệu USD (tỷ giá hiện tại tương đương khoảng 4,032 tỷ nhân dân tệ). Công ty cũng đang tích cực tuyển dụng tại nhiều thị trường như Ấn Độ, châu Âu, Brazil, với tổng số nhân viên hiện đã vượt quá 800 người.

Trong một cuộc phỏng vấn gần đây với TechCrunch, đồng sáng lập kiêm Giám đốc điều hành Mati Staniszewski cho biết công ty có kế hoạch IPO "trong vài năm tới", nhưng không đưa ra mốc thời gian cụ thể.

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Xem toàn bộ
ElevenLabs ra mắt các mô hình Eleven v4 và v4 Turbo
ElevenLabs ra mắt mô hình giọng nói v4 và v4 Turbo: Hỗ trợ hơn 90 ngôn ngữ, chỉ cần 10 giây để sao chép giọng nói | AIHOT.vn