HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Điểm AI 36/100

Nghiên cứu

ViRDM: Đột phá tạo video nhân quả ít bước bằng khớp phân phối biểu diễn

(giờ Việt Nam)

Tóm tắt AI

ViRDM là phương pháp hậu huấn luyện video không cần mô hình giáo viên hay bộ phân biệt, giúp tối ưu hóa việc tạo video nhân quả chỉ với 20 bước cập nhật, đạt hiệu suất vượt trội trên VBench với chi phí tính toán thấp.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

Tóm tắt: Khuếch tán video tự hồi quy (AR) ít bước cho phép tạo luồng với độ trễ thấp, nhưng các phương pháp hậu huấn luyện hiện có chủ yếu dựa vào Distribution Matching Distillation (DMD), đòi hỏi cả một mô hình giáo viên (teacher) tiền huấn luyện lớn và một mô hình đánh giá (critic) trực tuyến để ước tính sự khác biệt về phân phối thông qua các điểm số khuếch tán. Trong nghiên cứu này, chúng tôi đặt câu hỏi liệu có thể loại bỏ chồng mô hình giáo viên-đánh giá tiêu tốn tài nguyên này bằng cách chỉ hậu huấn luyện mô hình tạo (generator) dựa trên một phân phối mục tiêu đã tính toán trước hay không. Lấy cảm hứng từ representation distribution matching (RDM) cho việc tạo ảnh một bước, chúng tôi nghiên cứu một cách hệ thống việc chuyển đổi nó sang tạo video nhân quả (causal) ít bước và xác định ba rào cản chính: đường dẫn gradient khó xử lý về bộ nhớ, chế độ tối ưu hóa video khác biệt, và các phân phối biểu diễn không ràng buộc đủ động lực học thời gian. Chúng tôi giới thiệu ViRDM, một công thức hậu huấn luyện video không cần giáo viên và đánh giá, giải quyết các rào cản này theo trình tự. Bằng cách kết hợp RDM với giám sát clean-exit cắt tỉa ngẫu nhiên, bộ giải mã VAE nhẹ, và các tích vector-Jacobian theo giai đoạn, ViRDM giúp việc khớp phân phối biểu diễn trở nên khả thi về bộ nhớ cho các chuỗi video nhân quả nhiều bước. Chúng tôi thiết lập thêm các chế độ khởi tạo và quần thể tạo hiệu quả cho RDM video, đồng thời giới thiệu phương pháp chính quy hóa động lực học nhẹ để bù đắp cho các động lực học thời gian bị thiếu ràng buộc. ViRDM biến việc chưng cất ba mạng lưới thành hậu huấn luyện chỉ dành cho mô hình tạo, giảm mức sử dụng bộ nhớ GPU và thời gian huấn luyện trong khi cải thiện chất lượng video. Chỉ với 20 lần cập nhật mô hình tạo, công thức này đạt 84,87 điểm trên đánh giá VBench chính thức, vượt qua cơ sở nhân quả ít bước tốt nhất trước đó 0,36 điểm, trong khi chỉ tiêu tốn 16 giờ GPU A100. Chúng tôi cũng báo cáo các kết quả khám phá cho thấy tiềm năng của cùng công thức này đối với ngân sách lấy mẫu nhân quả thấp hơn và cho việc tạo hai chiều một, hai và bốn bước.

Bình luận:Báo cáo kỹ thuật
Chủ đề:Thị giác máy tính và Nhận dạng mẫu (cs.CV)
Trích dẫn là:arXiv:2609.28923 [cs.CV]
(hoặc arXiv:2609.28923v1 [cs.CV] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.28923 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Zichong Meng [xem email] [v1] Thứ Năm, 24 tháng 9 năm 2026 02:07:07 UTC (43.838 KB)

Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

ViRDM: Đột phá tạo video nhân quả ít bước bằng khớp phân phối biểu diễn | AIHOT.vn