HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Điểm AI 43/100

Nghiên cứu

World Action Agent: Điều khiển robot thông qua VLM và kỹ thuật diễn tập hành động

(giờ Việt Nam)

Tóm tắt AI

World Action Agent (WAA) là khung đa tác nhân cho phép VLM điều khiển robot trực tiếp trong không gian làm việc thị giác, thông qua các tính năng như chế độ xem tiếp xúc, diễn tập hành động và hiệu chỉnh trực quan.

Chính văn · Bản dịch AI

Tác giả: Yehang Zhang, Haojian Huang, Yifan Chang, Jianchong Su, Bohan Zhou, Yingjie Xu, Wosong Chen, Tianhao Zhou, Chenxu Wang, Tianyi Zhang, Yangkai Wei, Wenqian Li, Shiyuan Deng, Yinchuan Li, Ying-Cong Chen, Zexi Li

Xem PDF HTML (thử nghiệm)

Tóm tắt: Các mô hình thị giác-ngôn ngữ (VLM) đa năng mang lại kiến thức sâu rộng và khả năng suy luận không gian cho việc điều khiển robot, tuy nhiên các hệ thống hiện tại hoặc sử dụng chúng một cách gián tiếp để dự đoán các ràng buộc hoặc viết chương trình, hoặc chỉ cung cấp cho chúng cái nhìn về khung cảnh thay vì một thế giới để hành động. Chúng tôi giới thiệu World Action Agent (WAA), một hệ thống đa tác nhân cho phép các VLM điều khiển robot bằng các công cụ cơ bản, đưa ra mọi quyết định trong một không gian làm việc hành động trực quan. Không gian làm việc này có ba đặc tính. Các góc nhìn tiếp xúc (Contact views), được chọn tự động từ hình học của khung cảnh, hiển thị khung cảnh xung quanh tương tác hiện tại. Diễn tập hành động (Action rehearsal) biến mỗi hành động thành một đề xuất có thể chỉnh sửa mà tác nhân, một mình hoặc thông qua Imagination Agent, sẽ xem trước và sửa đổi dựa trên phản hồi lập kế hoạch trước khi thực thi. Hiệu chỉnh trong khung nhìn (In-view correction) khép kín vòng lặp giữa quan sát, diễn tập và thực thi cấp thấp, cho phép tác nhân loại bỏ các sai lệch còn sót lại ngay trong khung nhìn nơi nó quan sát chúng. Thông qua cùng một không gian làm việc, WAA thu nhận kiến thức quy trình hiện thân theo hai cách: nó phát triển các kỹ năng đa phương thức từ video chuyên gia và sự hướng dẫn của con người dưới sự đánh giá dựa trên bằng chứng và tham vấn chúng thông qua Skill Agent, đồng thời các dấu vết tương tác của nó huấn luyện các VLM nhỏ hơn để điều khiển cùng một hệ thống. Trên LIBERO-Pro, WAA với các kỹ năng chỉ được phát triển từ LIBERO-90 đạt tỷ lệ thành công trung bình 75,6% - mức hiện đại nhất (state-of-the-art), vượt trội hơn các VLA đầu-cuối, các tác nhân code-as-policy và một cơ sở visual-harness với cùng cấu trúc nền; các kỹ năng tương tự vẫn hiệu quả trên robosuite mà không cần học thêm. Việc tinh chỉnh Qwen3.5-9B trên các dấu vết của hệ thống giúp nâng tỷ lệ thành công ngoài phạm vi (out-of-domain) từ 1,7% lên 43,3%.

Bình luận:Đang trong quá trình thực hiện
Chủ đề:Robot học (cs.RO); Trí tuệ nhân tạo (cs.AI)
Trích dẫn là:arXiv:2609.29964 [cs.RO]
(hoặc arXiv:2609.29964v1 [cs.RO] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.29964 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Yehang Zhang [xem email] [v1] Thứ Năm, 24 tháng 9 năm 2026 15:19:39 UTC (23,234 KB)

Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

World Action Agent: Điều khiển robot thông qua VLM và kỹ thuật diễn tập hành động | AIHOT.vn