Apple Machine Learning Research
85

Nghiên cứu

MoMo: Kiểm soát phong cách vận động trong thao tác robot thông qua phân đoạn hành động không gian-thời gian

(giờ Việt Nam)

Tóm tắt AI

MoMo là khung học bắt chước hai giai đoạn giúp robot điều chỉnh phong cách thực hiện hành động dựa trên các điều kiện môi trường và nhiệm vụ cụ thể, cho phép tạo ra các chuyển động linh hoạt và ổn định trong thực tế.

Bản dịch AI

MoMo: Dial Motion Mode in Robot Manipulation with Spatiotemporal Action Tokenization

Tác giả: Yuhan Hu, Hugues Thomas, Peide Huang, Mouli Sivapurapu, Benoit Landry, Arto Kivila

Để vận hành hiệu quả trong các bối cảnh đa dạng, robot không chỉ cần thực hiện chính xác các tác vụ thao tác mà còn phải điều chỉnh cách thức thực hiện hành động sao cho phù hợp với tác vụ, đối tượng và môi trường tương tác. Chúng tôi đặt câu hỏi liệu sự biến đổi ở cấp độ thực thi này có thể được học như một yếu tố hành vi có thể tái sử dụng và chia sẻ giữa các tác vụ hay không. Chúng tôi giới thiệu MoMo, một khung học bắt chước (imitation-learning) gồm hai giai đoạn, bao gồm một bộ mã hóa hành động không gian-thời gian (spatiotemporal action tokenizer) và một transformer sao chép hành vi (behavior-cloning transformer) nhận đầu vào là tác vụ và điều kiện chế độ chuyển động liên tục. Qua sáu tác vụ thao tác trên robot thực tế, việc thay đổi điều kiện này tạo ra các hành vi ổn định, năng động và trung gian mà người đánh giá có thể phân biệt được, đồng thời khác biệt về tốc độ khớp, gia tốc và góc tiếp cận của bộ phận chấp hành cuối (end-effector). Đối với các tác vụ chỉ được minh họa ở một chế độ, MoMo vẫn chuyển đổi sang chế độ được yêu cầu dù chưa từng thấy trước đó mà vẫn đảm bảo phần lớn thành công của tác vụ. Nhìn chung, những kết quả này cung cấp bằng chứng về khả năng tổng quát hóa thành phần (compositional generalization) đối với các tổ hợp tác vụ-chế độ chưa từng thấy và cho thấy chế độ chuyển động có thể được tái sử dụng giữa các tác vụ để kiểm soát cách thức thực hiện một kỹ năng thao tác.

Các bài đọc và cập nhật liên quan.

Việc huấn luyện các chính sách thao tác cho robot hình người bằng dữ liệu đa dạng giúp tăng cường độ bền bỉ và khả năng tổng quát hóa trên các tác vụ và nền tảng khác nhau. Tuy nhiên, việc học chỉ từ các minh họa của robot đòi hỏi nhiều công sức, cần thu thập dữ liệu điều khiển từ xa (tele-operated) tốn kém và khó mở rộng. Bài báo này nghiên cứu một nguồn dữ liệu có khả năng mở rộng hơn, đó là các minh họa từ góc nhìn người thứ nhất (egocentric), để làm dữ liệu huấn luyện xuyên thực thể (cross-embodiment) cho việc học của robot. Chúng tôi…

Đọc thêm

Các khối Convolution-BatchNorm (ConvBN) là thành phần không thể thiếu trong nhiều tác vụ thị giác máy tính và các lĩnh vực khác. Một khối ConvBN có thể hoạt động ở ba chế độ: Train (Huấn luyện), Eval (Đánh giá) và Deploy (Triển khai). Trong khi chế độ Train là bắt buộc để huấn luyện mô hình từ đầu, chế độ Eval phù hợp cho học chuyển đổi (transfer learning) và các ứng dụng khác, còn chế độ Deploy được thiết kế để triển khai mô hình. Bài báo này tập trung vào sự đánh đổi giữa tính ổn định và hiệu quả trong…

Đọc thêm

Robot họcHọc bắt chướcApple ResearchĐiều khiển chuyển độngAI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.