Hugging Face Daily Papers
85

Nghiên cứu

OmniVAE: Mô hình VAE đa phương thức giúp đồng bộ hóa âm thanh và video trong tạo sinh

(giờ Việt Nam)

Tóm tắt AI

OmniVAE là mô hình VAE được huấn luyện đồng thời, giúp căn chỉnh không gian tiềm ẩn giữa âm thanh và video thông qua mục tiêu đối lập, từ đó giải quyết thách thức về sự thiếu đồng bộ trong các mô hình tạo sinh đa phương thức hiện nay.

Bản dịch AI

Tác giả: Jun Zhan, Chen Yang, Yitian Gong, Donghua Yu, Kuangwei Chen, Wenbo Zhang, Kexin Huang, Qi Luo, Zhe Xu, Ying Zhu, Jin Wang, Tengyue Zhang, Qi Chen, Cheng Chang, Songlin Wang, Junqi Dai, Jiasheng Ye, Xiaogui Yang, Tianyi Liang, Xiangyu Peng, Zhaoye Fei, Shimin Li, Qinyuan Cheng, Xie Chen, Xinchi Chen, Xipeng Qiu

Xem PDF

DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Jun Zhan [xem email] [v1] Chủ nhật, 26 tháng 7 năm 2026 21:51:28 UTC (13.600 KB)

AIĐa phương thứcVAETạo sinhNghiên cứu AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.