Nghiên cứu
DeltaWAM: Mô hình hành động thế giới dựa trên sự thay đổi cho thao tác hai tay robot
(giờ Việt Nam)
Tóm tắt AI
DeltaWAM tối ưu hóa việc điều khiển robot bằng cách dự đoán các thay đổi hình ảnh thay vì toàn bộ khung hình, kết hợp với bộ nhớ Streaming Delta Memory để giảm tải xử lý, giúp tăng đáng kể tỷ lệ thành công trong các tác vụ thao tác phức tạp.
Chính văn · Bản dịch AI
Tóm tắt: Các mô hình hành động thế giới (World-action models - WAMs) chuyển giao các tiền đề về thị giác và chuyển động từ các trình tạo video được huấn luyện trước sang điều khiển robot bằng cách mô hình hóa đồng thời động lực học thị giác và các hành động. Tuy nhiên, các WAM hiện có dự đoán các khung hình tương lai dày đặc trong quá trình huấn luyện, mô hình hóa lặp đi lặp lại các nội dung hầu như không thay đổi và kết hợp động lực học có điều kiện hành động với các biến thể ngoại hình không đáng kể. Tại thời điểm suy luận, việc xử lý từng quan sát hoàn chỉnh bằng chuyên gia video nặng nề gây ra nút thắt cổ chai cho việc tạo hành động trong vài bước. Theo đó, chúng tôi đề xuất DeltaWAM, mô hình dự đoán đồng thời các thay đổi thị giác (visual deltas) và hành động bằng cách sử dụng các luồng neo dày đặc (dense-anchor), thay đổi thưa thớt (sparse-delta) và hành động, với ba kiến trúc khác nhau về biểu diễn và chia sẻ tính toán. Chúng tôi phát triển thêm Streaming Delta Memory (SDM), giúp cập nhật ngữ cảnh neo được lưu trong bộ nhớ đệm bằng các thay đổi quan sát được nhỏ gọn, giảm bớt việc xử lý nặng nề của chuyên gia video. Trên RoboTwin, DeltaWAM với SDM cải thiện tỷ lệ thành công trung bình so với Fast-WAM từ 81,3% lên 85,4% trong môi trường sạch và từ 75,8% lên 83,9% trong điều kiện ngẫu nhiên hóa thị giác. Ba kiến trúc này giảm FLOPs huấn luyện từ 17,78-23,77%, trong khi SDM giảm độ trễ suy luận một bước và FLOPs lần lượt là 36,57% và 31,55%; các đánh giá trong thế giới thực cho thấy tỷ lệ thành công tổng thể và tiến độ chuẩn hóa cao nhất trong số các chính sách được đánh giá. Mã nguồn: URL này. Trang web: URL này.
| Chủ đề: | Thị giác máy tính và Nhận dạng mẫu (cs.CV); Robot học (cs.RO) |
| Trích dẫn là: | arXiv:2609.28811 [cs.CV] |
| (hoặc arXiv:2609.28811v1 [cs.CV] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.28811 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Zeyu Zhang [xem email] [v1] Thứ Tư, 23 tháng 9 năm 2026 21:45:16 UTC (3.049 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.