Nghiên cứu
InternW0: Mô hình thế giới vật lý nền tảng cho tương tác thực tế hiệu quả
(giờ Việt Nam)
Tóm tắt AI
Phòng thí nghiệm AI Thượng Hải ra mắt InternW0, mô hình thế giới vật lý sử dụng kiến trúc video-hành động bất đối xứng để tối ưu hóa dự đoán hình ảnh dài hạn và điều khiển robot liên tục với hiệu suất cao.
Chính văn · Bản dịch AI
Tác giả: Jisong Cai, Yao Mu, Ganlin Yang, Zhe Cao, Zhangzheng Tu, Xing Gao, Kailin Li, Xinyu Zhan, Lixin Yang, Yangkun Zhu, Haoxiang Ma, Ming Zhou, Qiaojun Yu, Yufei Xue, Liqun He, Yifei Yao, Yifan Zhu, Long Ling, Bingqi Jiang, Haoyu Guo, Xueyue Zhu, Bowen Zhou, Bin Zhao, Tianfan Xue, Chunhua Shen, Weinan Zhang
Tóm tắt: Trí tuệ vật lý đòi hỏi nhiều hơn là chỉ dự đoán thế giới sẽ phát triển như thế nào: các dự đoán phải có khả năng thực thi khi thế giới liên tục thay đổi. Chúng tôi giới thiệu InternW0, phiên bản đầu tiên của dòng mô hình thế giới vật lý InternW từ Phòng thí nghiệm AI Thượng Hải, được xây dựng dựa trên các giao diện đa phương thức (omnimodal), xử lý đa tần số không đồng bộ và mô hình hóa vật lý cục bộ dưới các quan sát một phần và ảnh hưởng từ bên ngoài. InternW0 học đồng thời động lực học hình ảnh tương lai và điều khiển robot liên tục thông qua kiến trúc video-hành động bất đối xứng với kỹ thuật flow matching. Một chuyên gia video dung lượng cao cung cấp bối cảnh dự đoán dài hạn, trong khi một chuyên gia hành động nhẹ hoạt động ở thang thời gian nhanh hơn. Thay vì tái tạo tương lai cho mỗi lần cập nhật hành động, InternW0 tái sử dụng K/V theo từng lớp và điều chỉnh nó cho các trạng thái mới quan sát được thông qua định tuyến bối cảnh dựa trên quan sát. Các giao diện chuyên biệt theo miền và soft prompt hỗ trợ các hiện thân không đồng nhất, trong khi quá trình hậu huấn luyện nhận thức tiếp xúc kết hợp các tín hiệu lực và xúc giác cho các thao tác đòi hỏi tiếp xúc cao. Chúng tôi huấn luyện InternW0 trên khoảng 7.200 giờ dữ liệu robot và dữ liệu góc nhìn thứ nhất (egocentric) không đồng nhất, bao gồm EgoLab, một tập dữ liệu góc nhìn thứ nhất trong phòng thí nghiệm thực tế dài 275 giờ. Đánh giá bao gồm các tiêu chuẩn mô phỏng và các nhiệm vụ khoa học trong thế giới thực, bao gồm quy trình tổng hợp khung hữu cơ kim loại 15 giai đoạn và thao tác khéo léo nhận thức lực và tiếp xúc 5 giai đoạn cho việc hút mẫu định lượng đa năng. Những kết quả này thúc đẩy các mô hình thế giới vật lý có khả năng mở rộng, không đồng bộ và bản địa khoa học cho các tương tác thế giới thực hiệu quả và phổ quát.
| Bình luận: | Báo cáo kỹ thuật về các mô hình thế giới, 24 trang, 8 hình ảnh và 7 bảng biểu |
| Chủ đề: | Robot (cs.RO); Trí tuệ nhân tạo (cs.AI) |
| Trích dẫn là: | arXiv:2609.27656 [cs.RO] |
| (hoặc arXiv:2609.27656v1 [cs.RO] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.27656 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Weinan Zhang [xem email] [v1] Thứ Tư, 23 tháng 9 năm 2026 10:20:56 UTC (8.545 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.