# DeltaWAM: Mô hình hành động thế giới dựa trên sự thay đổi cho thao tác hai tay robot

- Nguồn: Hugging Face Daily Papers
- Thời gian phát hành: 2026-09-25 07:00 (giờ Việt Nam)
- Điểm AI: 85/100
- Link AIHOT.vn: https://aihot.vn/items/715c06cb6dca3141
- Link gốc: https://arxiv.org/abs/2609.28811

## Tóm tắt AI

DeltaWAM tối ưu hóa việc điều khiển robot bằng cách dự đoán các thay đổi hình ảnh thay vì toàn bộ khung hình, kết hợp với bộ nhớ Streaming Delta Memory để giảm tải xử lý, giúp tăng đáng kể tỷ lệ thành công trong các tác vụ thao tác phức tạp.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.28811) [HTML (thử nghiệm)](https://arxiv.org/html/2609.28811v1)

> Tóm tắt: Các mô hình hành động thế giới (World-action models - WAMs) chuyển giao các tiền đề về thị giác và chuyển động từ các trình tạo video được huấn luyện trước sang điều khiển robot bằng cách mô hình hóa đồng thời động lực học thị giác và các hành động. Tuy nhiên, các WAM hiện có dự đoán các khung hình tương lai dày đặc trong quá trình huấn luyện, mô hình hóa lặp đi lặp lại các nội dung hầu như không thay đổi và kết hợp động lực học có điều kiện hành động với các biến thể ngoại hình không đáng kể. Tại thời điểm suy luận, việc xử lý từng quan sát hoàn chỉnh bằng chuyên gia video nặng nề gây ra nút thắt cổ chai cho việc tạo hành động trong vài bước. Theo đó, chúng tôi đề xuất DeltaWAM, mô hình dự đoán đồng thời các thay đổi thị giác (visual deltas) và hành động bằng cách sử dụng các luồng neo dày đặc (dense-anchor), thay đổi thưa thớt (sparse-delta) và hành động, với ba kiến trúc khác nhau về biểu diễn và chia sẻ tính toán. Chúng tôi phát triển thêm Streaming Delta Memory (SDM), giúp cập nhật ngữ cảnh neo được lưu trong bộ nhớ đệm bằng các thay đổi quan sát được nhỏ gọn, giảm bớt việc xử lý nặng nề của chuyên gia video. Trên RoboTwin, DeltaWAM với SDM cải thiện tỷ lệ thành công trung bình so với Fast-WAM từ 81,3% lên 85,4% trong môi trường sạch và từ 75,8% lên 83,9% trong điều kiện ngẫu nhiên hóa thị giác. Ba kiến trúc này giảm FLOPs huấn luyện từ 17,78-23,77%, trong khi SDM giảm độ trễ suy luận một bước và FLOPs lần lượt là 36,57% và 31,55%; các đánh giá trong thế giới thực cho thấy tỷ lệ thành công tổng thể và tiến độ chuẩn hóa cao nhất trong số các chính sách được đánh giá. Mã nguồn: [URL này](https://github.com/AIGeeksGroup/DeltaWAM). Trang web: [URL này](https://aigeeksgroup.github.io/DeltaWAM).

| Chủ đề: | Thị giác máy tính và Nhận dạng mẫu (cs.CV); Robot học (cs.RO) |
| --- | --- |
| Trích dẫn là: | arXiv:2609.28811 [cs.CV] |
|  | (hoặc arXiv:2609.28811v1 [cs.CV] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.28811 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Zeyu Zhang [xem email](https://arxiv.org/show-email/426ce21b/2609.28811)] [v1] Thứ Tư, 23 tháng 9 năm 2026 21:45:16 UTC (3.049 KB)
