Nghiên cứu
OmniVAE: Mô hình VAE đa phương thức giúp đồng bộ hóa âm thanh và video trong tạo sinh
(giờ Việt Nam)
Tóm tắt AI
OmniVAE là mô hình VAE được huấn luyện đồng thời, giúp căn chỉnh không gian tiềm ẩn giữa âm thanh và video thông qua mục tiêu đối lập, từ đó giải quyết thách thức về sự thiếu đồng bộ trong các mô hình tạo sinh đa phương thức hiện nay.
Bản dịch AI
Tác giả: Jun Zhan, Chen Yang, Yitian Gong, Donghua Yu, Kuangwei Chen, Wenbo Zhang, Kexin Huang, Qi Luo, Zhe Xu, Ying Zhu, Jin Wang, Tengyue Zhang, Qi Chen, Cheng Chang, Songlin Wang, Junqi Dai, Jiasheng Ye, Xiaogui Yang, Tianyi Liang, Xiangyu Peng, Zhaoye Fei, Shimin Li, Qinyuan Cheng, Xie Chen, Xinchi Chen, Xipeng Qiu
Xem PDF
DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)
Lịch sử gửi bài
Từ: Jun Zhan [xem email] [v1] Chủ nhật, 26 tháng 7 năm 2026 21:51:28 UTC (13.600 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.