Nghiên cứu giới thiệu WROP, bộ dữ liệu gồm 1,5 triệu mẫu mô phỏng nhằm huấn luyện và đánh giá khả năng nhận thức vật lý của 14 mô hình video, tập trung vào khái niệm duy trì vật thể (object permanence) giống con người.
Vì sao đáng đọc: Đề tài nghiên cứu chuyên sâu, giải quyết vấn đề cốt lõi trong việc phát triển trí tuệ nhân tạo có khả năng hiểu vật lý thế giới thực, rất có giá trị cho cộng đồng AI.
VC-Attention là giải pháp không cần huấn luyện giúp tăng tốc và duy trì độ chính xác cho các mô hình Diffusion bằng cách xử lý nhiễu giá trị (value outliers) và tối ưu hóa hàm Softmax, giải quyết nút thắt chi phí tính toán trong các chuỗi video dài.
Hướng dẫn kỹ thuật chuyển video tham chiếu thành Depth Map để điều khiển AI tạo video. Cách này giúp giữ nguyên chuyển động, góc máy và bố cục mà không bị ảnh hưởng bởi trang phục hay phong cách của video gốc.
VGI-Bench Probing Visual Intelligence in Video Generation Models paper: https://huggingface.co/pap...
DịchVGI-Bench là bộ tiêu chuẩn mới giúp đo lường khả năng hiểu và xử lý hình ảnh của các mô hình tạo video hiện nay, cung cấp cái nhìn sâu sắc về trí tuệ thị giác trong AI.
Các nhà nghiên cứu từ NUS và Oxford giới thiệu V-RAE, phương pháp sử dụng các mô hình thị giác tiền huấn luyện để xây dựng không gian tiềm ẩn giàu ngữ nghĩa, giúp cải thiện hiệu quả tạo và dự đoán video thay vì chỉ tập trung vào tái tạo pixel truyền thống.
Wan 3.0 is now available on @ComfyUI! 30 seconds. One generation. More room for your story. Explore …
DịchAlibaba vừa tích hợp mô hình Wan 3.0 vào ComfyUI, cho phép tạo video dài 30 giây với khả năng nâng cấp từ 480p lên 1080p sắc nét, mở ra nhiều tiềm năng sáng tạo cho người dùng.
Phương pháp Latent Dynamics Reasoning (LDR) cải thiện độ chính xác vật lý cho mô hình video bằng cách tích hợp các quy luật chuyển động thay vì chỉ khớp pixel, giúp dự đoán các kịch bản ngoài phân phối tốt hơn.