Hugging Face Daily Papers
Điểm AI 85/100

Nghiên cứu

FlashForward: Tăng tốc tạo video tự hồi quy nhờ tái sử dụng KV Cache

(giờ Việt Nam)

Tóm tắt AI

FlashForward tối ưu hóa quá trình tạo video bằng cách tái sử dụng KV cache ngay trong quá trình khử nhiễu, loại bỏ các bước tính toán dư thừa và cho phép xử lý song song các phân đoạn video trên GPU.

Chính văn · Bản dịch AI

Tác giả: Yikai Wang, Xiao Han, Mengmeng Xu, Juan Camilo Perez, Yiannis Douratsos, Sen He, Zijian Zhou, Fei Zhang, Zhaochong An, Juan-Manuel Perez-Rua, Chen Change Loy, Tao Xiang

Xem PDF HTML (thử nghiệm)

Tóm tắt: Khuếch tán video tự hồi quy ít bước (few-step autoregressive video diffusion) tạo ra video dài bằng cách chia video thành các đoạn thời gian và tạo từng đoạn một, mỗi đoạn thông qua một chuỗi ngắn các giai đoạn khử nhiễu. Để ghi nhớ các đoạn đã được tạo, các phương pháp trước đây tái tạo bộ nhớ đệm key-value (KV) sạch hoặc ít nhiễu hơn bằng các lượt truyền bổ sung để xây dựng bộ nhớ đệm mà không làm tăng latent đầu ra. Tuy nhiên, bản thân mỗi lượt truyền khử nhiễu đã tính toán KV đang xử lý của đoạn hiện tại. Chúng tôi giới thiệu FlashForward, phương pháp trực tiếp tái sử dụng bộ nhớ đệm này để tránh các lượt truyền mô hình nặng nề chỉ nhằm cập nhật bộ nhớ đệm. Sau khi đoạn hiện tại hoàn thành một giai đoạn khử nhiễu, bộ nhớ đệm theo giai đoạn của nó đã sẵn sàng cho đoạn tiếp theo. Do đó, việc gán một GPU cho mỗi giai đoạn cho phép các đoạn khác nhau chiếm dụng các giai đoạn khác nhau cùng một lúc. Sự sẵn sàng sớm này phải trả giá bằng chất lượng: lịch sử khớp theo giai đoạn thu được bị nhiễu, gây ra hiện tượng trôi hình ảnh và chuyển động giữa các đoạn. Để bổ sung, FlashForward tạo ra các anchor latent sạch phụ trợ thưa thớt trước khi vùng tương ứng được tạo, nhờ đó các quỹ đạo tạo có thể được ổn định bằng cách điều kiện hóa hai chiều này. Hai bộ nhớ hoạt động ở các quy mô thời gian khác nhau: KV anchor sạch thưa thớt cung cấp hướng dẫn cấu trúc hai chiều thô, tầm xa, trong khi lịch sử khớp theo giai đoạn dày đặc bảo toàn sự tiến hóa chi tiết, gần đây. Với tối đa bốn GPU, FlashForward chạy nhanh hơn $1,16$--$1,69\times$ so với HiAR và nhanh hơn $1,42$--$2,92\times$ so với Self-Forcing đối với video 16 FPS dài 20 giây trở lên trên các quy mô backbone 1.3B và 14B ở độ phân giải 480p và 720p. Trên VBench, đối với mô hình 1.3B ở 480p, nó đạt điểm số cao hơn và duy trì sự ổn định ở thời lượng dài hơn, chứng minh rằng FlashForward tạo ra các video chất lượng cao và nhất quán về mặt thời gian trên các thời lượng 20 giây, 35 giây và 65 giây với tốc độ tạo nhanh hơn nhiều.

Bình luận:Trang PJ: liên kết https này
Chủ đề:Thị giác máy tính và Nhận dạng mẫu (cs.CV); Trí tuệ nhân tạo (cs.AI); Học máy (cs.LG); Đa phương tiện (cs.MM)
Trích dẫn là:arXiv:2609.32540 [cs.CV]
(hoặc arXiv:2609.32540v1 [cs.CV] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.32540 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Yikai Wang [xem email] [v1] Thứ Bảy, 26 tháng 9 năm 2026 12:19:50 UTC (12.566 KB)

Video DiffusionTối ưu hóa AIKV CacheFlashForwardGenerative AI

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

FlashForward: Tăng tốc tạo video tự hồi quy nhờ tái sử dụng KV Cache | AIHOT.vn