Nghiên cứu đề xuất phương pháp huấn luyện mô hình TTS nhỏ gọn bằng cách sử dụng mô hình sao chép giọng nói lớn làm nguồn dữ liệu tổng hợp, giúp tối ưu hóa hiệu năng cho các ngôn ngữ ít tài nguyên như tiếng Thái.
AuK Technical Report An Open-Source Foundational Model for Speech Generation and Editing paper: ht…
DịchAuK là mô hình nền tảng mã nguồn mở mới, hỗ trợ khả năng tạo và chỉnh sửa giọng nói linh hoạt. Đây là bước tiến đáng chú ý cho cộng đồng nghiên cứu âm thanh AI.
Gradium vừa giới thiệu Voice Design, công cụ cho phép tạo ra các giọng nói tổng hợp mới hoàn toàn chỉ trong vài giây thông qua mô tả văn bản mà không cần âm thanh mẫu. Công cụ hiện hỗ trợ 5 ngôn ngữ và đã mở miễn phí cho người dùng trên nền tảng của hãng.
Đội ngũ dots của Xiaohongshu vừa công bố mô hình tổng hợp giọng nói (TTS) end-to-end với 2 tỷ tham số, đạt hiệu suất vượt trội về độ chính xác nội dung và khả năng mô phỏng giọng nói trên bộ đánh giá Seed-TTS-Eval.
Vì sao đáng đọc: Đây là bước tiến đáng chú ý trong lĩnh vực TTS mã nguồn mở, mang lại hiệu năng cạnh tranh cao và giá trị thực tiễn cho cộng đồng phát triển AI.
Dots.tts là mô hình TTS 2 tỷ tham số sử dụng cơ chế tự hồi quy trong không gian ẩn liên tục, loại bỏ hoàn toàn token rời rạc để đạt độ chính xác và tính tự nhiên vượt trội, đồng thời hỗ trợ mạnh mẽ cho các tác vụ chỉnh sửa giọng nói.
Thêm 1 nguồn khác đưa tinWeChat: Xiaohongshu Tech (dots.llm)
Vì sao đáng đọc: Đây là bước tiến kỹ thuật quan trọng trong lĩnh vực TTS, giải quyết hạn chế của token rời rạc. Việc mã nguồn mở hoàn toàn cùng hiệu suất SOTA khiến nó trở thành tin tức giá trị.
Tổng 5 tin, không còn tin nào nữa
40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (26 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả
Chủ đề
Kênh
Đang lọc:Thẻ: Tổng hợp giọng nói
Toàn bộ tin AI · Thẻ “Tổng hợp giọng nói” | AIHOT.vn