Nghiên cứu
Tổng quan về cơ chế bộ nhớ trong tạo video tự hồi quy: Cách quá khứ định hình tương lai
(giờ Việt Nam)
Tóm tắt AI
Bài báo hệ thống hóa các cơ chế bộ nhớ trong mô hình tạo video tự hồi quy (AR), phân tích cách lưu trữ thông tin lịch sử để duy trì tính nhất quán cho các khung hình tương lai. Nghiên cứu cũng chỉ ra các thách thức về kiến trúc bộ nhớ linh hoạt và tiêu chuẩn đánh giá hiệu năng.
Chính văn · Bản dịch AI
Tác giả: Harold Haodong Chen, Rongjin Guo, Disen Lan, Wen-Jie Shu, Hongfei Zhang, Hanzhe Hu, Shengtao Yao, Zixin Zhang, Guibin Zhang, Zhefan Rao, Jinxiu Liu, Yexin Liu, Rui Peng, Yuhao Liu, Bin Ren, Shuai Yang, Yukang Chen, Salman Khan, Ying-Cong Chen, Ser-Nam Lim, Rynson W.H. Lau, Nicu Sebe, Yu Cheng, Ming-Hsuan Yang, Qifeng Chen
Tóm tắt: Những tiến bộ trong các mô hình tạo sinh đã cải thiện độ trung thực của video, cho phép tạo video dài, mô hình hóa thế giới tương tác và các môi trường hình ảnh biến đổi. Tạo video tự hồi quy (AR) mở rộng các chuỗi hình ảnh thông qua các triển khai nhân quả. Tuy nhiên, một nút thắt cơ bản đã xuất hiện: khi chuỗi được tạo ra mở rộng, các mô hình thực tế phải hoạt động trong các giới hạn nghiêm ngặt về cửa sổ ngữ cảnh, lưu trữ và tính toán. Hệ quả là, các thông tin lịch sử quan trọng, ví dụ như danh tính thực thể, trạng thái động và các thay đổi nhân quả do can thiệp, thường rời khỏi ngữ cảnh hoạt động trước khi sự liên quan của chúng giảm đi. Việc vượt qua hạn chế này và duy trì tính bền vững theo thời gian tạo thành một vấn đề bộ nhớ cơ bản. Chúng tôi trình bày một bài đánh giá có hệ thống và toàn diện về các cơ chế bộ nhớ trong tạo video AR. Chúng tôi xây dựng khái niệm bộ nhớ theo hướng vận hành như là thông tin lịch sử bền vững được duy trì qua các bước AR bên ngoài, có khả năng ảnh hưởng đến quá trình tạo trong tương lai ngay cả khi bằng chứng gốc không còn khả dụng cục bộ. Dựa trên khung thống nhất này, chúng tôi tổ chức tài liệu thông qua năm góc nhìn bổ sung: (I) Hình thức, các vật mang đại diện của lịch sử; (II) Chức năng, thông tin ngữ nghĩa và vật lý cụ thể cần được bảo tồn; (III) Vận hành, vòng đời của việc ghi, đọc, cập nhật, quản lý và tích hợp bộ nhớ; (IV) Học tập, tối ưu hóa các hành vi bộ nhớ dưới các triển khai vòng lặp kín; và (V) Đánh giá, các mô hình để chẩn đoán khả năng bộ nhớ thực sự. Chúng tôi kết luận bằng cách tổng hợp các thách thức mở, bao gồm các kiến trúc bộ nhớ có thể kết hợp và nhận biết tài nguyên, cập nhật trạng thái đáng tin cậy, học tập tự triển khai và đánh giá tiêu chuẩn hóa. Bằng cách kết nối các biểu diễn, cơ chế và mô hình học tập, bài báo này thiết lập một nền tảng có cấu trúc để phát triển các hệ thống tạo video đáng tin cậy, có điều kiện bộ nhớ.
| Chủ đề: | Thị giác máy tính và Nhận dạng mẫu (cs.CV) |
| Trích dẫn là: | arXiv:2609.28466 [cs.CV] |
| (hoặc arXiv:2609.28466v1 [cs.CV] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.28466 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Disen Lan [xem email] [v1] Thứ Tư, 23 tháng 9 năm 2026 17:54:52 UTC (32.269 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.