Nghiên cứu
EmbodiedMemory-Bench: Bộ tiêu chuẩn đánh giá trí nhớ dài hạn cho tác nhân AI trong môi trường thực
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu giới thiệu EMem-Bench, bộ tiêu chuẩn gồm 2.554 tình huống tương tác nhằm đánh giá khả năng ghi nhớ và cập nhật trạng thái môi trường của các tác nhân AI trong các nhiệm vụ dài hạn.
Chính văn · Bản dịch AI
Tóm tắt: Tương tác hiện thân dài hạn đòi hỏi các tác nhân phải lưu giữ và liên tục cập nhật thông tin về môi trường khi chúng quan sát, hành động và đối mặt với thay đổi. Tuy nhiên, các tác nhân hiện nay vẫn gặp khó khăn trong việc duy trì bộ nhớ này một cách đáng tin cậy. Phân tích của chúng tôi chỉ ra hạn chế này xuất phát từ bốn thiếu sót chính: bộ nhớ thị giác chi tiết yếu, khả năng theo dõi trạng thái thế giới động không đáng tin cậy, thất bại trong việc ghi lại trạng thái thế giới được tiết lộ qua kết quả tương tác, và khả năng khái quát hóa hạn chế từ kinh nghiệm trước đó. Tuy nhiên, các tiêu chuẩn đánh giá hiện có không trực tiếp đo lường các khả năng bộ nhớ này trong quá trình tương tác hiện thân dài hạn. Để giải quyết khoảng trống này, chúng tôi giới thiệu EmbodiedMemory-Bench (EMem-Bench), bao gồm 2.554 tập tương tác trên bốn nhóm tác vụ. EMem-Bench yêu cầu các tác nhân xây dựng và cập nhật bộ nhớ từ lịch sử tương tác, sau đó sử dụng nó để hoàn thành một tác vụ sau đó bằng cách hành động trong môi trường. Chúng tôi cũng giới thiệu Embodied-Memorizer (EMem), một hệ thống bộ nhớ ngoài giúp tổ chức trải nghiệm hiện thân thành các bộ nhớ không gian, sự kiện và cảnh quan. Chúng tôi cũng huấn luyện EMem-8B, một chính sách 8B có khả năng quản lý và sử dụng các bộ nhớ này. Chúng tôi đánh giá một loạt các MLLM mã nguồn mở và độc quyền cùng các hệ thống bộ nhớ đa phương thức tiêu biểu. Kết quả cho thấy các mô hình hiện tại vẫn còn yếu và không đồng đều trên bốn thách thức này. Với các mô hình nền tảng tương đương, EMem đạt hiệu suất tổng thể tốt nhất trong số các hệ thống bộ nhớ được đánh giá và cải thiện cả các mô hình mã nguồn mở lẫn độc quyền, trong khi EMem-8B tiếp tục cải thiện so với mô hình nền tảng của nó. Trang dự án: đường dẫn https này
| Chủ đề: | Thị giác máy tính và Nhận dạng mẫu (cs.CV) |
| Trích dẫn là: | arXiv:2609.28236 [cs.CV] |
| (hoặc arXiv:2609.28236v1 [cs.CV] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.28236 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Lizhou Liang [xem email] [v1] Thứ Tư, 23 tháng 9 năm 2026 15:00:42 UTC (7.479 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.