Nghiên cứu
GeoVerse: Tổng hợp góc nhìn mới nhất quán trong không gian tiềm ẩn hình học
(giờ Việt Nam)
Tóm tắt AI
GeoVerse kết hợp khả năng tái tạo cấu trúc 3D từ mô hình nền tảng với tri thức hình ảnh từ Wan2.2 VACE để tạo ra các góc nhìn mới nhất quán, giải quyết vấn đề thiếu hụt dữ liệu trong các phương pháp tổng hợp hình ảnh truyền thống.
Chính văn · Bản dịch AI
Tóm tắt: Việc tổng hợp góc nhìn mới từ các hình ảnh thưa thớt đòi hỏi phải cân bằng giữa việc tái tạo trung thực các vùng đã quan sát và hoàn thiện hợp lý các nội dung chưa thấy, đồng thời duy trì tính nhất quán của thế giới qua các góc nhìn. Các phương pháp dựa trên hình học hiện có bảo toàn cấu trúc cảnh quan sát được nhưng thường gặp khó khăn trong việc hoàn thiện các vùng chưa thấy, trong khi các mô hình tạo video cung cấp các tiền đề về ngoại hình phong phú nhưng lại tích tụ sự thiếu nhất quán trong quá trình tạo góc nhìn tuần tự. Chúng tôi đề xuất GeoVerse, một khung làm việc tổng hợp các góc nhìn mới nhất quán với thế giới bằng cách thực hiện tạo hình trong không gian tiềm ẩn hình học của một mô hình nền tảng 3D đã được huấn luyện trước và đưa vào các tiền đề ngoại hình từ một mô hình tạo video. Cụ thể, GeoVerse trích xuất các đặc trưng đa cấp từ Wan2.2 VACE và đưa chúng vào mô hình khuếch tán tiềm ẩn hình học thông qua một bộ điều hợp kiểu ControlNet, kết hợp các tiền đề ngoại hình đã học từ video để tăng cường khả năng hoàn thiện cấu trúc. Để thực thi tính nhất quán giữa các góc nhìn, một bộ nhớ không gian toàn cục liên tục tổng hợp nội dung đã quan sát và đã tổng hợp, chiếu lại hướng dẫn căn chỉnh mục tiêu để neo các dự đoán tiếp theo vào một biểu diễn cảnh chung. Các thí nghiệm mở rộng trên nhiều tập dữ liệu khác nhau cho thấy chất lượng hình ảnh và tính nhất quán hình học được cải thiện, với PSNR cao hơn 2,23 dB trên DL3DV và ATE thấp hơn 32,4% trên Mip-NeRF360 so với GLD.
| Bình luận: | Trang dự án: this https URL |
| Chủ đề: | Thị giác máy tính và Nhận dạng mẫu (cs.CV) |
| Trích dẫn là: | arXiv:2609.35734 [cs.CV] |
| (hoặc arXiv:2609.35734v1 [cs.CV] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.35734 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử nộp bài
Từ: Kerui Ren [xem email] [v1] Thứ Hai, 28 tháng 9 năm 2026 17:51:48 UTC (12.675 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.