# Huấn luyện khả năng duy trì vật thể trong các mô hình thế giới (World Models)

- Nguồn: Hugging Face Daily Papers
- Thời gian phát hành: 2026-09-25 07:00 (giờ Việt Nam)
- Điểm AI: 88/100
- Nhãn AIHOT: Tinh chọn
- Link AIHOT.vn: https://aihot.vn/items/6fb2f8be2977442f
- Link gốc: https://arxiv.org/abs/2609.28654

## Lý do tinh chọn

Đề tài nghiên cứu chuyên sâu, giải quyết vấn đề cốt lõi trong việc phát triển trí tuệ nhân tạo có khả năng hiểu vật lý thế giới thực, rất có giá trị cho cộng đồng AI.

## Tóm tắt AI

Nghiên cứu giới thiệu WROP, bộ dữ liệu gồm 1,5 triệu mẫu mô phỏng nhằm huấn luyện và đánh giá khả năng nhận thức vật lý của 14 mô hình video, tập trung vào khái niệm duy trì vật thể (object permanence) giống con người.

## Thân bài

Tác giả: [Haotian Zhang](https://arxiv.org/search/cs?searchtype=author&query=Zhang,+H), [Fengyuan Yu](https://arxiv.org/search/cs?searchtype=author&query=Yu,+F), [Dezhi Luo](https://arxiv.org/search/cs?searchtype=author&query=Luo,+D), [Haoran Sun](https://arxiv.org/search/cs?searchtype=author&query=Sun,+H), [Zehong Zhao](https://arxiv.org/search/cs?searchtype=author&query=Zhao,+Z), [Qingying Gao](https://arxiv.org/search/cs?searchtype=author&query=Gao,+Q), [Yihan Li](https://arxiv.org/search/cs?searchtype=author&query=Li,+Y), [Siyuan An](https://arxiv.org/search/cs?searchtype=author&query=An,+S), [Huayi Qin](https://arxiv.org/search/cs?searchtype=author&query=Qin,+H), [Yilan Zhang](https://arxiv.org/search/cs?searchtype=author&query=Zhang,+Y), [Zhengze Jiang](https://arxiv.org/search/cs?searchtype=author&query=Jiang,+Z), [Pinyuan Feng](https://arxiv.org/search/cs?searchtype=author&query=Feng,+P), [Renrui Zhang](https://arxiv.org/search/cs?searchtype=author&query=Zhang,+R), [Ziyu Guo](https://arxiv.org/search/cs?searchtype=author&query=Guo,+Z), [Letian Wang](https://arxiv.org/search/cs?searchtype=author&query=Wang,+L), [Mengyue Yang](https://arxiv.org/search/cs?searchtype=author&query=Yang,+M), [Kangfu Mei](https://arxiv.org/search/cs?searchtype=author&query=Mei,+K), [Maijunxian Wang](https://arxiv.org/search/cs?searchtype=author&query=Wang,+M), [Ran Ji](https://arxiv.org/search/cs?searchtype=author&query=Ji,+R), [Vikash Kumar](https://arxiv.org/search/cs?searchtype=author&query=Kumar,+V), [Freda Shi](https://arxiv.org/search/cs?searchtype=author&query=Shi,+F), [Chandra Sripada](https://arxiv.org/search/cs?searchtype=author&query=Chandra), [Vincent C. Muller](https://arxiv.org/search/cs?searchtype=author&query=Muller,+V+C), [Philip Torr](https://arxiv.org/search/cs?searchtype=author&query=Torr,+P), [Alan Yuille](https://arxiv.org/search/cs?searchtype=author&query=Yuille,+A), [Nikolaus Kriegeskorte](https://arxiv.org/search/cs?searchtype=author&query=Kriegeskorte,+N), [Felix Juefei-Xu](https://arxiv.org/search/cs?searchtype=author&query=Juefei-Xu,+F), [Lvmin Zhang](https://arxiv.org/search/cs?searchtype=author&query=Zhang,+L), [Jieneng Chen](https://arxiv.org/search/cs?searchtype=author&query=Chen,+J), [Yilun Du](https://arxiv.org/search/cs?searchtype=author&query=Du,+Y), [Hokin Deng](https://arxiv.org/search/cs?searchtype=author&query=Deng,+H)

[Xem PDF](https://arxiv.org/pdf/2609.28654) [HTML (thử nghiệm)](https://arxiv.org/html/2609.28654v1)

> Tóm tắt: Sự tồn tại khách quan và tính rắn chắc là những đặc điểm nổi bật trong nhận thức tiên nghiệm của con người. Các nghiên cứu gần đây cho thấy các mô hình tạo video, một lớp mô hình thế giới tiêu biểu hiện nay, đã bắt đầu bộc lộ những khả năng suy luận mới nổi, khiến chúng trở thành ứng viên lý tưởng để xây dựng trí tuệ vật lý giống con người. Liệu các mô hình video có khả năng nhận thức sự tồn tại khách quan hay không? Nếu chưa, liệu chúng ta có thể huấn luyện chúng bằng một tập dữ liệu lấy cảm hứng từ nhận thức cốt lõi? Chúng tôi giới thiệu WROP (World Reasoning with Object Permanence), một cơ sở hạ tầng dữ liệu gồm 150 tác vụ được thiết kế thủ công lấy cảm hứng từ khoa học nhận thức, chia thành sáu danh mục nhận thức. Chúng tôi xây dựng các trình tạo Blender giúp ngẫu nhiên hóa tốc độ, ánh sáng, góc máy và các tham số gây nhiễu khác trong khi vẫn bảo toàn cấu trúc nhận thức của từng tác vụ, tạo ra hơn 10.000 mẫu cho mỗi tác vụ. Chúng tôi phát hành một kho dữ liệu huấn luyện gồm 1,5 triệu mẫu và một bài kiểm tra gồm 300 câu hỏi. Trong bài kiểm tra này, chúng tôi đánh giá 14 mô hình video: 3 mô hình tham chiếu-thành-video, 7 mô hình chỉnh sửa và 4 mô hình tiếp nối, trong đó có PWM-WROP, mô hình thế giới 16B của chúng tôi. Trong một nghiên cứu Elo mù theo cặp, PWM-WROP xếp hạng nhất trong số các mô hình tiếp nối và thứ ba chung cuộc, chỉ đứng sau sự ngang bằng về mặt thống kê giữa hai mô hình tham chiếu-thành-video. Chúng tôi công bố dữ liệu, bài kiểm tra, câu trả lời của mô hình, điểm số, trọng số và PWM, ngăn xếp huấn luyện native-PyTorch của chúng tôi trên AWS Trainium2.

| Bình luận: | 26 trang, 9 hình ảnh, 5 bảng. Trang dự án: this https URL |
| --- | --- |
| Chủ đề: | Trí tuệ nhân tạo (cs.AI); Thị giác máy tính và Nhận dạng mẫu (cs.CV) |
| Trích dẫn là: | arXiv:2609.28654 [cs.AI] |
|  | (hoặc arXiv:2609.28654v1 [cs.AI] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.28654 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Hokin Deng [xem email](https://arxiv.org/show-email/b3ea3ed1/2609.28654)] [v1] Thứ Tư, 23 tháng 9 năm 2026 18:02:12 UTC (3.680 KB)
