Nghiên cứu
Miso One: Mô hình TTS 8B mã nguồn mở với khả năng giả lập giọng nói người thật cực nhanh
(giờ Việt Nam)
Tóm tắt AI
Miso One là mô hình chuyển văn bản thành giọng nói (TTS) 8B tham số, hỗ trợ nhân bản giọng nói chỉ với mẫu ngắn, độ trễ 110ms và cho phép tự lưu trữ dữ liệu cục bộ.
Bản dịch AI
Miso One đã chính thức được phát hành, mang đến một mô hình chuyển văn bản thành giọng nói (TTS) mã nguồn mở với 8 tỷ tham số. Mục tiêu cốt lõi của mô hình là mô phỏng sự ấm áp và nhịp điệu trong cách đọc của con người một cách chân thực nhất.
Điểm nổi bật của Miso One là khả năng sao chép giọng nói chỉ với một mẫu âm thanh ngắn. Hệ thống đạt hiệu suất ấn tượng với độ trễ suy luận chỉ 110ms, đảm bảo trải nghiệm phản hồi nhanh chóng cho người dùng.
Về tính bảo mật và quyền riêng tư, trọng số của mô hình đã được công khai trên GitHub. Người dùng có thể tự lưu trữ (self-host) mà không cần phụ thuộc vào API, đảm bảo dữ liệu âm thanh luôn được xử lý cục bộ và không rời khỏi thiết bị.
Hiện tại, nhà phát triển đã ra mắt bản demo trực tuyến để người dùng có thể trải nghiệm trước khi quyết định tải mã nguồn về. Ngoài ra, dịch vụ truy cập thông qua API cũng đang được lên kế hoạch phát hành trong thời gian tới.
Ý chính từ bài gốc
- Miso One là mô hình TTS mã nguồn mở với 8 tỷ tham số.
- Tập trung tái tạo sự ấm áp và nhịp điệu tự nhiên của giọng người.
- Hỗ trợ sao chép giọng nói nhanh chóng chỉ với mẫu âm thanh ngắn.
- Độ trễ suy luận thấp, chỉ 110ms.
- Hỗ trợ tự lưu trữ (self-host), đảm bảo dữ liệu không rời khỏi máy.
- Đã có bản demo trực tuyến; API sẽ sớm được ra mắt.
Bài viết được AI dịch và tổng hợp tự động từ X/Twitter. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.