# MemBodied: Cơ chế bộ nhớ liên kết tuần hoàn cho các mô hình Vision-Language-Action

- Nguồn: HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
- Thời gian phát hành: 2026-09-23 07:00 (giờ Việt Nam)
- Điểm AI: 43/100
- Link AIHOT.vn: https://aihot.vn/items/b3a8ea7363545c26
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmueysbuw03kfroodm01uml4g
- Link gốc: https://arxiv.org/abs/2609.28256

## Tóm tắt AI

MemBodied là cơ chế bộ nhớ tình huống cố định giúp các mô hình VLA duy trì trạng thái liên kết và các điểm neo bối cảnh, thay thế việc chồng chéo dữ liệu quan sát lịch sử thô.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.28256) [HTML (thử nghiệm)](https://arxiv.org/html/2609.28256v1)

> Tóm tắt: Các mô hình Vision-Language-Action cung cấp nền tảng vững chắc cho việc điều khiển robot đa năng, tuy nhiên phần lớn các chính sách (policies) hiện nay không lưu giữ và tận dụng thông tin cấp độ tập dữ liệu (episode-level) ngoài quan sát hiện tại. Hạn chế này gây ra hậu quả trong các tác vụ thao tác phụ thuộc vào lịch sử, vốn đòi hỏi thông tin chỉ có trong các quan sát quá khứ. Việc lưu giữ các quan sát quá khứ trong ngữ cảnh có thể hỗ trợ khôi phục thông tin này, nhưng phải trả giá bằng việc ngữ cảnh ngày càng phình to và độ trễ suy luận tăng cao. Do đó, chúng tôi giới thiệu MemBodied, một bộ nhớ tập dữ liệu có kích thước cố định với hai thành phần bổ trợ: trạng thái liên kết (associative state) ghi lại các tương tác giữa các lần gọi chính sách và điểm neo tập dữ liệu (episode anchor) lưu giữ biểu diễn cô đọng của cảnh ban đầu để làm tham chiếu. Tại mỗi lần gọi chính sách, mô hình điều kiện hóa việc tạo hành động dựa trên đầu vào hiện tại và các thành phần bộ nhớ, thay vì sử dụng trực tiếp các quan sát quá khứ. Trên năm tác vụ RMBench được đánh giá đòi hỏi khả năng ghi nhớ, MemBodied đạt tỷ lệ thành công trung bình gấp $7,81\times$ so với chính sách không trạng thái (stateless policy) và gấp $2,98\times$ so với bộ nhớ tái phát (recurrent memory) thông thường, đồng thời vượt trội hơn $1,3\times$ so với mô hình cơ sở tăng cường bộ nhớ mạnh nhất với số lượng tham số bổ sung ít hơn $10\times$. Trên bộ tác vụ LIBERO-Long có khả năng quan sát đầy đủ, mô hình đạt 90,6%, cải thiện 5,4% so với chính sách $\pi_0$ không trạng thái. Những kết quả này củng cố vị thế của MemBodied như một giải pháp thay thế thiết thực cho việc mở rộng ngữ cảnh chính sách trong các tác vụ thao tác phụ thuộc vào lịch sử.

| Chủ đề: | Robot (cs.RO); Trí tuệ nhân tạo (cs.AI); Thị giác máy tính và Nhận dạng mẫu (cs.CV) |
| --- | --- |
| Trích dẫn là: | arXiv:2609.28256 [cs.RO] |
|  | (hoặc arXiv:2609.28256v1 [cs.RO] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.28256 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Tej Deep Pala [xem email](https://arxiv.org/show-email/52812377/2609.28256)] [v1] Thứ Tư, 23 tháng 9 năm 2026 15:19:19 UTC (964 KB)
