Nghiên cứu
Tác nhân lập trình tự tiến hóa: Từ mã nguồn kỹ thuật số đến trí tuệ thế giới vật lý
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu giới thiệu Physical Coding, phương pháp biểu diễn trạng thái và hành động dưới dạng mã nguồn, kết hợp với hệ thống HexaAnything để điều khiển robot thông qua phản hồi thực tế.
Chính văn · Bản dịch AI
Tác giả: Hongcheng Gao, Jingjing Zhou, Zelin Zheng, Shijia Ge, Jay Zhu, Yazhe Wang, Jianshu Zeng, Xuan Shangguan, Di Wu, Lingyu He, Zhiqi Jia, Sihang Wu, Xiao He
Tóm tắt: Các mô hình tầm nhìn-ngôn ngữ-hành động (VLA) và mô hình thế giới-hành động (WAM) ánh xạ trực tiếp các quan sát và chỉ dẫn thành hành động của robot. Sự trực tiếp này gắn chặt chính sách với quá trình huấn luyện: những thay đổi nhỏ về bố cục hoặc góc nhìn đều gây ra lỗi, và các chỉ dẫn có khả năng tổng quát hóa kém. Nguyên nhân gốc rễ nằm ở cách biểu diễn: các yêu cầu tác vụ, điều kiện, tiến độ và khả năng phục hồi sau lỗi được mã hóa ngầm trong các chuỗi hành động, khiến chúng khó kiểm tra hoặc sửa đổi. Các tác nhân mã hóa kỹ thuật số cung cấp một tiền lệ: LLM gọi các công cụ, xác minh kết quả và sửa đổi dựa trên phản hồi dưới dạng mã thực thi. Mô hình làm việc tương tự gồm trạng thái rõ ràng, khả năng thực thi có thể quản lý và các quy trình có thể sửa đổi là nền tảng cho sự tổng quát hóa và thực thi dài hạn trong thế giới vật lý, cho phép trải nghiệm vật lý quay trở lại dưới dạng các chương trình, bộ nhớ hoặc bằng chứng có thể tái sử dụng. Chúng tôi đề xuất Physical Coding, biểu diễn trạng thái tác vụ và quá trình thực thi dưới dạng mã. Code as World ghi lại các đối tượng, mối quan hệ, ràng buộc và tiến độ; Code as Policy tổ chức việc lập kế hoạch, xác minh, phục hồi và thực thi. Chúng tôi xây dựng HexaAnything, công cụ gọi các tác vụ nhận thức, lập kế hoạch và điều khiển, bao gồm cả các chính sách VLA/WAM, và đưa ra các quyết định trong vòng lặp từ phản hồi bên ngoài. Các dấu vết đã xác minh trở thành dữ liệu và bộ nhớ, cho phép sự tiến hóa từ các công cụ và Harness đến trọng số mô hình, kiến trúc, và cuối cùng là thiết kế phần cứng và tác vụ. Trên RoboCasa365, HexaAnything cải thiện tỷ lệ thành công tổng thể và đối với các tác vụ Composite-Unseen so với XR-1 VLA, và HexaModel được huấn luyện bằng Harness của nó vượt trội hơn mô hình cơ sở trên mọi phân đoạn, cho thấy các dấu vết mã hóa đã nội hóa quá trình thực thi vật lý. Trên PhyBench và robot AgileX hai cánh tay, tác nhân tự động hoàn thành các thí nghiệm vật lý và hầu hết các tác vụ trên bàn, thường nhanh hơn các kết quả đã công bố. Chúng tôi quan sát thấy sự tự tiến hóa của dữ liệu, mô hình và công cụ; các nghiên cứu tương lai hướng tới việc nội hóa trọng số, tự động thiết kế lại kiến trúc, ngôn ngữ, biểu diễn và tác vụ, cũng như triển khai trong sản xuất và khoa học.
| Bình luận: | Báo cáo kỹ thuật |
| Chủ đề: | Robot học (cs.RO) |
| Trích dẫn là: | arXiv:2609.35432 [cs.RO] |
| (hoặc arXiv:2609.35432v1 [cs.RO] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.35432 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Jingjing Zhou [xem email] [v1] Thứ Hai, 28 tháng 9 năm 2026 15:38:07 UTC (20.281 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.