Nghiên cứu
TT-VidT: Tách biệt trục thời gian để tiền huấn luyện video tập trung vào chuyển động hiệu quả
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu giới thiệu TT-VidT, một phương pháp tiền huấn luyện video sử dụng Temporal Transfer Layer và Diff Compression để tối ưu hóa khả năng biểu diễn chuyển động, giúp tách biệt hiệu quả giữa thông tin hình ảnh tĩnh và sự thay đổi giữa các khung hình.
Chính văn · Bản dịch AI
Tóm tắt: Các so sánh trong học tự giám sát video thường đánh giá toàn bộ quy trình huấn luyện thay vì tách biệt chính phương pháp đó: kiến trúc, mục tiêu, dữ liệu đầu vào, lịch trình, quy mô và dung lượng bộ giải mã đều có thể thay đổi cùng lúc. Điều này gây khó khăn trong việc xác định lựa chọn nào tạo ra các biểu diễn ưu tiên chuyển động, vốn tập trung vào sự thay đổi giữa các khung hình trong khi vẫn giữ lại các đặc điểm hình ảnh hữu ích. Chúng tôi giải quyết vấn đề này bằng một nghiên cứu đối sánh $4 \times 6 = 24$ kiến trúc-mục tiêu với quy mô bộ mã hóa khoảng 170M ~ 190M trên ~1,7 triệu clip OpenVid và Moments-in-Time v2 trong 8 epoch, đồng thời đề xuất TT-VidT. TT-VidT kết hợp đường dẫn không gian theo từng khung hình ViT-B/16 được khởi tạo từ DINOv3 với một Temporal Transfer Layer nhỏ gọn, được huấn luyện bằng Diff Compression để tái tạo các khung hình mục tiêu từ một mỏ neo hình ảnh khung hình đầu tiên và các token chuyển động đặc thù của khung hình. Kết quả khảo sát cho thấy TT3D với Diff Compression, chứ không phải bất kỳ thành phần nào đứng riêng lẻ, đã đạt đến chế độ nhạy cảm với chuyển động mạnh mẽ nhất, và các thử nghiệm cắt bỏ bộ giải mã cho thấy ưu thế của một bộ giải mã video tiền huấn luyện nhỏ gọn. Trong so sánh cuối cùng, TT-VidT dẫn đầu đồng thời trên các tập tinh chỉnh Jester, Something-Something V2, ARID và Diving48, cải thiện từ 54% ~ 121% so với phương pháp không phải TT mạnh nhất, trong khi sử dụng ít hơn 48% FLOPs bộ mã hóa so với DisMo và ít hơn 55% so với VideoMAE hoặc V-JEPA2. HMDB51, IARD và EPIC-Kitchens củng cố cho khẳng định này.
| Bình luận: | được chấp nhận tại nhánh chính của NeurIPS 2026 |
| Chủ đề: | Thị giác máy tính và Nhận dạng mẫu (cs.CV) |
| Trích dẫn là: | arXiv:2609.33419 [cs.CV] |
| (hoặc arXiv:2609.33419v1 [cs.CV] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.33419 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Shih Ying Yeh [xem email] [v1] Chủ nhật, 27 tháng 9 năm 2026 10:09:23 UTC (4.992 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.