IT Home
92

Sản phẩm

Robot tự học kỹ năng mới chỉ qua video ngắn với khung HOST mã nguồn mở

(giờ Việt Nam)

Tóm tắt AI

Khung HOST cho phép robot học kỹ năng mới từ video người thực chỉ dài vài chục giây với hiệu suất vượt trội, giúp giảm 50 lần dữ liệu và tăng 500 lần tốc độ học so với các phương pháp truyền thống.

Bản dịch AI

Theo tin từ IT ngày 3 tháng 8, Zibianliang Robot (Tự Biến Lượng Robot) hôm nay đã công bố và mã nguồn mở khung làm việc HOST (Human-to-robot One-Shot Skill AcquisiTion - Thu nhận kỹ năng một mẫu từ người sang robot), được tuyên bố là "cho phép robot học kỹ năng mới chỉ bằng cách quan sát một đoạn video dài vài chục giây của con người, đồng thời vẫn giữ nguyên các kỹ năng đã thành thạo trước đó."

IT tìm hiểu từ thông tin chính thức rằng, HOST áp dụng một phương pháp mang tính đột phá: thay vì dịch các hành động của con người sang hành động của robot và cố gắng bắt chước, nó để robot hình dung kết quả sau khi thực hiện hành động trước, sau đó mới phân tách các hành động cần thực hiện từ kết quả đó. Hiệu quả của phương pháp mới này rất đáng kinh ngạc: tỷ lệ thành công khi robot học kỹ năng từ một đoạn video dài 29 giây của con người lên tới 62%, vượt xa mức cơ sở zero-shot là 45%. So với phương án Pi-0.5 + tinh chỉnh (fine-tuning), lượng dữ liệu mà HOST yêu cầu giảm 50 lần và tốc độ học kỹ năng tăng 500 lần.

Ý tưởng của HOST bắt nguồn từ lý thuyết "học tập qua quan sát" trong khoa học nhận thức: khi đối mặt với những nhiệm vụ xa lạ, con người không cần thông qua luyện tập lâu dài hay thử sai toàn diện, mà sử dụng khả năng tiên nghiệm để mô phỏng kết quả mong đợi của hành động trong não bộ, sau đó mới thực hiện hành động tương ứng. Các nhà nghiên cứu tại Zibianliang đã lấy cảm hứng từ điều này, chuyển đổi phương án học tập của HOST từ "vòng lặp tinh chỉnh khi huấn luyện" sang "thu nhận kỹ năng khi suy luận", cho phép robot học kỹ năng mới thông qua việc quan sát con người thực hiện nhiệm vụ.

Vấn đề đầu tiên mà robot cần giải quyết là: làm thế nào để căn chỉnh tiến độ thực hiện nhiệm vụ của chính mình với tiến độ trong video?

Ví dụ: cùng làm việc trong 10 giây, người trong video có thể đã thái xong rau và bắt đầu xào nấu, trong khi robot vẫn đang thái rau. Nếu chỉ căn chỉnh theo thời gian, robot sẽ bị lệch tiến độ nhiệm vụ.

Để giải quyết vấn đề này, cách tiếp cận của HOST là "căn chỉnh theo tiến độ nhiệm vụ". HOST sẽ chuyển đổi từng khung hình video và từng bước thao tác của robot thành các vector trong cùng một không gian vector; sau đó sử dụng thuật toán "Dynamic Time Warping" (Căn chỉnh thời gian động) để tự động căn chỉnh "khung hình thứ X của video con người với bước thứ Y của thao tác robot". Nhờ đó, khi robot thực hiện đến mỗi bước, hình ảnh nó nhìn thấy luôn được căn chỉnh đồng bộ với tiến độ nhiệm vụ.

Nhờ phương pháp này, HOST đã giảm sai số thời gian trong việc căn chỉnh tiến độ nhiệm vụ xuống một bậc độ lớn, giúp robot đạt được sự đồng bộ chính xác giữa việc thực hiện và video minh họa.

Phần cốt lõi của HOST là một mô hình chiến lược phân tầng có chức năng dự đoán thị giác. Nó áp dụng kiến trúc MoT (Mixture of Tokens) hai chuyên gia, hoạt động như hai bộ não phân công rõ ràng: "bộ não thị giác" (chuyên gia video) chuyên xử lý hình ảnh video, xác định tiến độ nhiệm vụ và dự đoán viễn cảnh tương lai; "bộ não hành động" (chuyên gia hành động) chịu trách nhiệm chuyển đổi viễn cảnh dự đoán thành các hành động cần thực hiện và kiểm soát quá trình thực thi.

Khi huấn luyện mô hình, đội ngũ Zibianliang chia quá trình huấn luyện thành hai giai đoạn: "huấn luyện sơ bộ đồng thể" và "huấn luyện video người-máy". Trong giai đoạn huấn luyện sơ bộ đồng thể, robot học cách dự đoán trạng thái sau khi hoàn thành nhiệm vụ và tạo ra các hành động tương ứng thông qua việc học các video robot tự thực hiện nhiệm vụ. Trong giai đoạn huấn luyện video người-máy, robot học sâu hơn từ video minh họa của con người, chuyển đổi quá trình con người thực hiện nhiệm vụ thành kết quả nhiệm vụ dưới góc nhìn của robot, sau đó suy luận các hành động cần thiết để hoàn thành nhiệm vụ dựa trên kết quả mục tiêu, từ đó hiện thực hóa việc chuyển đổi kỹ năng từ minh họa của con người sang robot.

Hiện tại, bài báo nghiên cứu và mã nguồn của HOST đã được công khai hoàn toàn. Trong tương lai, khi làm việc nhà, robot được kỳ vọng sẽ thoát khỏi quy trình thu thập dữ liệu và huấn luyện chuyên biệt, có thể học kỹ năng mới chỉ thông qua các minh họa trực quan từ con người.

Tham khảo

Trang chủ dự án

Liên kết bài báo khoa học

Liên kết Github

Liên kết Huggingface

Tuyên bố quảng cáo: Các liên kết chuyển hướng bên ngoài trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian chọn lọc, kết quả chỉ mang tính chất tham khảo, tất cả các bài viết của IT đều bao gồm tuyên bố này.

RobotHọc máyHOSTThị giác máy tínhAIHOT
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.