Nghiên cứu
SwanTale: Mô hình hợp nhất tạo giọng nói và âm thanh đa người dùng với khả năng zero-shot
(giờ Việt Nam)
Tóm tắt AI
SwanTale là mô hình đột phá hỗ trợ tạo âm thanh và giọng nói đa người dùng thông qua điều khiển bằng lệnh hoặc zero-shot, kết hợp kỹ thuật SwanVAE và Unified MoE để đạt hiệu suất vượt trội.
Bản dịch AI
Xem PDF HTML (thử nghiệm)
DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)
Lịch sử gửi bài
Từ: Yu Zhang [xem email] [v1] Thứ Hai, ngày 3 tháng 8 năm 2026 10:20:52 UTC (1.453 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (Nổi bậtBài nghiên cứu). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.