Nghiên cứu
Spatial-Interactor: Nâng cao khả năng suy luận không gian cho VLM thông qua tương tác vật lý
(giờ Việt Nam)
Tóm tắt AI
Spatial-Interactor là khung huấn luyện mới giúp các mô hình ngôn ngữ thị giác (VLM) hiểu được sự thay đổi trạng thái vật lý thông qua các quỹ đạo tương tác, thay vì chỉ dựa vào các câu hỏi tĩnh truyền thống.
Chính văn · Bản dịch AI
Tóm tắt: Suy luận không gian là yếu tố thiết yếu để các mô hình thị giác-ngôn ngữ (VLM) có thể hiểu và hành động trong thế giới vật lý. Việc suy luận trong các môi trường động đòi hỏi VLM phải nhận thức được các chuyển đổi trạng thái cục bộ do chuyển động của vật thể và thay đổi góc nhìn gây ra, đồng thời tích hợp chúng qua các quỹ đạo dài để duy trì trạng thái không gian được cập nhật; tuy nhiên, các VLM hiện nay vẫn còn hạn chế ở cả hai khả năng này. Việc huấn luyện không gian hiện tại chủ yếu tập trung vào các câu hỏi tĩnh về thuộc tính vật thể và quan hệ không gian, cung cấp sự giám sát trực tiếp hạn chế cho các chuyển đổi trạng thái; ngược lại, các quỹ đạo tương tác kết nối một cách tự nhiên quan sát trước đó, hành động và quan sát tiếp theo, mang lại sự giám sát trực tiếp cho các chuyển đổi trạng thái cục bộ, trong khi các quỹ đạo hoàn chỉnh tiết lộ sự phụ thuộc giữa các chuyển đổi liên tiếp. Do đó, chúng tôi giới thiệu Spatial-Interactor, một khung huấn luyện VLM mô hình hóa các chuyển đổi trạng thái trong thế giới vật lý thông qua tương tác, tổ chức quá trình học tập này thành chương trình giảng dạy ba cấp độ bao gồm L1 chuyển đổi trạng thái thế giới thụ động, L2 chuyển đổi trạng thái bản thân chủ động và L3 quỹ đạo tương tác dài hạn. Theo đó, chúng tôi xây dựng tập dữ liệu Learning from Spatial Interaction (LSI-108K) từ các quỹ đạo tương tác mô phỏng và thực tế, với các tác vụ được căn chỉnh theo mục tiêu của từng cấp độ. Chiến lược huấn luyện hai giai đoạn của chúng tôi áp dụng Supervised Fine-Tuning (SFT) cho L1 và L2 để mô hình hóa chuyển đổi cục bộ, và On-Policy Distillation (OPD) sau đó sử dụng phương pháp chưng cất bản thân đặc quyền: một nhánh giáo viên được cung cấp các mô tả chuyển đổi cấp phân đoạn sẽ giám sát CoT on-policy của học viên, giúp học viên học cách tích hợp các chuyển đổi liên tiếp qua các quỹ đạo dài L3. Các thí nghiệm trên nhiều VLM và các tiêu chuẩn không gian cho thấy sự cải thiện nhất quán trong việc mô hình hóa chuyển đổi cục bộ và tích hợp dài hạn.
| Chủ đề: | Trí tuệ nhân tạo (cs.AI); Học máy (cs.LG) |
| Trích dẫn là: | arXiv:2609.23038 [cs.AI] |
| (hoặc arXiv:2609.23038v1 [cs.AI] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.23038 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Kaixiang Yao [xem email] [v1] Thứ Bảy, 19 tháng 9 năm 2026 14:13:59 UTC (37.806 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.