‹ Quay lạiTinh chọnĐiểm AI 88/100
Hugging Face Daily Papers
Tinh chọnĐiểm AI 88/100

Nghiên cứu

Huấn luyện khả năng duy trì vật thể trong các mô hình thế giới (World Models)

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu giới thiệu WROP, bộ dữ liệu gồm 1,5 triệu mẫu mô phỏng nhằm huấn luyện và đánh giá khả năng nhận thức vật lý của 14 mô hình video, tập trung vào khái niệm duy trì vật thể (object permanence) giống con người.

Chính văn · Bản dịch AI

Tác giả: Haotian Zhang, Fengyuan Yu, Dezhi Luo, Haoran Sun, Zehong Zhao, Qingying Gao, Yihan Li, Siyuan An, Huayi Qin, Yilan Zhang, Zhengze Jiang, Pinyuan Feng, Renrui Zhang, Ziyu Guo, Letian Wang, Mengyue Yang, Kangfu Mei, Maijunxian Wang, Ran Ji, Vikash Kumar, Freda Shi, Chandra Sripada, Vincent C. Muller, Philip Torr, Alan Yuille, Nikolaus Kriegeskorte, Felix Juefei-Xu, Lvmin Zhang, Jieneng Chen, Yilun Du, Hokin Deng

Xem PDF HTML (thử nghiệm)

Tóm tắt: Sự tồn tại khách quan và tính rắn chắc là những đặc điểm nổi bật trong nhận thức tiên nghiệm của con người. Các nghiên cứu gần đây cho thấy các mô hình tạo video, một lớp mô hình thế giới tiêu biểu hiện nay, đã bắt đầu bộc lộ những khả năng suy luận mới nổi, khiến chúng trở thành ứng viên lý tưởng để xây dựng trí tuệ vật lý giống con người. Liệu các mô hình video có khả năng nhận thức sự tồn tại khách quan hay không? Nếu chưa, liệu chúng ta có thể huấn luyện chúng bằng một tập dữ liệu lấy cảm hứng từ nhận thức cốt lõi? Chúng tôi giới thiệu WROP (World Reasoning with Object Permanence), một cơ sở hạ tầng dữ liệu gồm 150 tác vụ được thiết kế thủ công lấy cảm hứng từ khoa học nhận thức, chia thành sáu danh mục nhận thức. Chúng tôi xây dựng các trình tạo Blender giúp ngẫu nhiên hóa tốc độ, ánh sáng, góc máy và các tham số gây nhiễu khác trong khi vẫn bảo toàn cấu trúc nhận thức của từng tác vụ, tạo ra hơn 10.000 mẫu cho mỗi tác vụ. Chúng tôi phát hành một kho dữ liệu huấn luyện gồm 1,5 triệu mẫu và một bài kiểm tra gồm 300 câu hỏi. Trong bài kiểm tra này, chúng tôi đánh giá 14 mô hình video: 3 mô hình tham chiếu-thành-video, 7 mô hình chỉnh sửa và 4 mô hình tiếp nối, trong đó có PWM-WROP, mô hình thế giới 16B của chúng tôi. Trong một nghiên cứu Elo mù theo cặp, PWM-WROP xếp hạng nhất trong số các mô hình tiếp nối và thứ ba chung cuộc, chỉ đứng sau sự ngang bằng về mặt thống kê giữa hai mô hình tham chiếu-thành-video. Chúng tôi công bố dữ liệu, bài kiểm tra, câu trả lời của mô hình, điểm số, trọng số và PWM, ngăn xếp huấn luyện native-PyTorch của chúng tôi trên AWS Trainium2.

Bình luận:26 trang, 9 hình ảnh, 5 bảng. Trang dự án: this https URL
Chủ đề:Trí tuệ nhân tạo (cs.AI); Thị giác máy tính và Nhận dạng mẫu (cs.CV)
Trích dẫn là:arXiv:2609.28654 [cs.AI]
(hoặc arXiv:2609.28654v1 [cs.AI] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.28654 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Hokin Deng [xem email] [v1] Thứ Tư, 23 tháng 9 năm 2026 18:02:12 UTC (3.680 KB)

World ModelsVideo GenerationNhận thức AIWROPNghiên cứu AI

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Huấn luyện khả năng duy trì vật thể trong các mô hình thế giới (World Models) | AIHOT.vn