Mô hình
Xiaomi ra mắt mô hình chiến lược robot Xiaomi-Robotics-1
(giờ Việt Nam)
Tóm tắt AI
Xiaomi giới thiệu Xiaomi-Robotics-1, mô hình kết hợp tiền huấn luyện UMI quy mô lớn với dữ liệu thực tế, giúp robot đạt hiệu suất SOTA và học tác vụ mới chỉ với chưa đầy 10 giờ dữ liệu mẫu.
Bản dịch AI
Phá vỡ rào cản dữ liệu. Mở rộng quy mô các mô hình chính sách robot với tiền huấn luyện không phụ thuộc vào hình thể (embodiment-free).
Các mô hình nền tảng trong lĩnh vực ngôn ngữ và thị giác liên tục mở rộng giới hạn nhờ tuân theo các định luật mở rộng thực nghiệm: năng lực tỉ lệ thuận với dữ liệu, tham số và tài nguyên tính toán. Lĩnh vực robot học đã bỏ lỡ điều này. Dữ liệu quy mô lớn, chất lượng cao rất khó tìm, và sự khan hiếm đó, hơn bất kỳ yếu tố nào khác, đã kìm hãm khả năng mở rộng của các mô hình chính sách. Những gì robot có thể làm dưới điều kiện huấn luyện quy mô lớn thực sự vẫn là một câu hỏi bỏ ngỏ. Chúng tôi thực hiện một bước tiến để giải đáp câu hỏi đó. Xiaomi-Robotics-1 kết hợp tiền huấn luyện không phụ thuộc vào hình thể (UMI) quy mô lớn với một lượng dữ liệu robot thực tế vừa phải trong giai đoạn hậu huấn luyện. Chúng tôi nghiên cứu cách mô hình vận hành khi được mở rộng quy mô.
Dữ liệu
Mọi khả năng của Xiaomi-Robotics-1 đều bắt nguồn từ dữ liệu. Để tiền huấn luyện, chúng tôi sử dụng 100.000 giờ quỹ đạo không phụ thuộc vào hình thể (UMI) trải dài trên hơn 1.700 kịch bản (hộ gia đình, cơ sở thương mại, địa điểm công nghiệp và không gian ngoài trời), bao phủ một loạt các tác vụ đa dạng. Chúng tôi phát triển một quy trình tự động gán nhãn có khả năng mở rộng, trước tiên chia các quỹ đạo thành các phân đoạn có độ dài cố định, sau đó chú thích từng phân đoạn bằng các mô tả ngôn ngữ về sự chuyển đổi trạng thái của cảnh.

Đối với giai đoạn hậu huấn luyện, chúng tôi tận dụng các tập dữ liệu đa hình thể bao gồm dữ liệu robot nội bộ, dữ liệu robot mã nguồn mở đã qua chọn lọc và một tập hợp dữ liệu UMI chất lượng cao. Đối với dữ liệu nội bộ, chúng tôi đã thu thập hơn 7.200 giờ dữ liệu robot thực tế tại các ngôi nhà thực, bao gồm các tác vụ như dọn dẹp ghế sofa, sắp xếp tủ giày và cất đồ dùng nhà bếp. Dữ liệu UMI được chú thích thủ công theo các phân đoạn thời gian và gợi ý hướng dẫn, khác với các mô tả chuyển đổi trạng thái được tự động gán nhãn trong dữ liệu tiền huấn luyện.

Phương pháp
Tuân theo mô hình huấn luyện của các LLM, quá trình huấn luyện Xiaomi-Robotics-1 bao gồm hai giai đoạn: tiền huấn luyện và hậu huấn luyện. Giai đoạn đầu học các biểu diễn tổng quát để tạo hành động từ dữ liệu UMI quy mô lớn, trong khi giai đoạn hậu huấn luyện căn chỉnh mô hình với các hình thể robot thực tế và khả năng tuân thủ hướng dẫn.
Tiền huấn luyện tập trung vào tính bao quát: tiếp xúc mô hình với thế giới thực nhiều nhất có thể. Chúng tôi sử dụng dữ liệu UMI không phụ thuộc vào hình thể đã mô tả ở trên, bao gồm phạm vi rộng lớn các môi trường và tác vụ. Ở quy mô này, việc gán nhãn thủ công là không khả thi. Do đó, chúng tôi đã xây dựng một quy trình chú thích tự động được hỗ trợ bởi một mô hình ngôn ngữ-thị giác (VLM) mạnh mẽ. Các video dài được chia thành các đoạn clip có độ dài cố định, và VLM mô tả sự chuyển đổi trạng thái của các bộ phận gắp và các vật thể tương tác trong mỗi clip. Kết quả là một kho dữ liệu khổng lồ về các quỹ đạo thao tác trong thế giới thực, mỗi quỹ đạo đều được chú thích bằng các mô tả ngôn ngữ chính xác. Những dữ liệu này cho phép mô hình học cách tạo ra hành động điều khiển cảnh vật hướng tới các chuyển đổi trạng thái được mô tả bằng ngôn ngữ.
Một phát hiện đáng khích lệ là quá trình tiền huấn luyện cho thấy hành vi mở rộng quy mô rất rõ ràng: khi dữ liệu và kích thước mô hình tăng lên, sai số hành động trên tập kiểm chứng giảm dần đều.

Hậu huấn luyện nhằm mục đích căn chỉnh các khả năng tạo hành động mạnh mẽ thu được từ tiền huấn luyện với các hình thể robot thực tế và khả năng tuân thủ hướng dẫn bằng ngôn ngữ tự nhiên theo hai trục. Căn chỉnh hình thể sử dụng dữ liệu robot thực tế đa hình thể chất lượng cao để ánh xạ khả năng tạo hành động tổng quát sang các robot thực tế. Căn chỉnh hướng dẫn chuyển đổi mô hình từ "tạo hành động dựa trên mô tả về sự chuyển đổi trạng thái của cảnh" sang "hiểu một hướng dẫn bằng ngôn ngữ tự nhiên và thực thi trực tiếp".
Sau khi hậu huấn luyện, Xiaomi-Robotics-1 có thể được sử dụng ngay lập tức để thực hiện hàng loạt các tác vụ thao tác di động trong thế giới thực. Chúng tôi đánh giá mô hình đã qua hậu huấn luyện trong các môi trường chưa từng thấy với các đối tượng chưa từng gặp để hiểu liệu các hành vi mở rộng quy mô từ tiền huấn luyện có thể chuyển đổi sang hiệu suất robot thực tế sau khi hậu huấn luyện hay không.
Câu trả lời là có. Khi chúng tôi tăng lượng dữ liệu tiền huấn luyện và kích thước mô hình, tỷ lệ thành công của robot thực tế tăng lên đều đặn và có thể dự đoán được. Nghĩa là, một mô hình tiền huấn luyện mạnh hơn sẽ mang lại hiệu suất robot thực tế tốt hơn. Các lợi ích từ việc mở rộng quy mô không có dấu hiệu bão hòa: tỷ lệ thành công của robot thực tế sau hậu huấn luyện tiếp tục cải thiện khi mô hình tiêu thụ nhiều dữ liệu hơn hoặc được mở rộng quy mô trong quá trình tiền huấn luyện.

Ứng dụng
Sau khi hậu huấn luyện, Xiaomi-Robotics-1 có thể đóng vai trò là một mô hình nền tảng robot mạnh mẽ cho các ứng dụng hạ nguồn. Chúng tôi đưa Xiaomi-Robotics-1 vào sử dụng trong hai bối cảnh hạ nguồn bổ trợ cho nhau. Khả năng thích ứng hiệu quả với các tác vụ mới giúp chuyên biệt hóa mô hình cho các tác vụ robot thực tế hoàn toàn mới, có độ phức tạp cao chỉ từ vài giờ dữ liệu mỗi tác vụ. Các bộ tiêu chuẩn đánh giá trong môi trường mô phỏng kiểm tra năng lực của nó trong các bộ công cụ chính thống chú trọng vào khả năng tổng quát hóa.
Xiaomi-Robotics-1 có thể học các tác vụ mới với hiệu quả dữ liệu cao. Mô hình tiếp thu các tác vụ như đóng gói điện thoại, nạp giấy máy in, bỏ quần áo vào máy giặt và đóng gói hộp chỉ từ vài giờ trình diễn robot thực tế mỗi tác vụ. Với trung bình dưới 10 giờ trình diễn mỗi tác vụ, nó đã đạt tỷ lệ thành công tổng thể 75%, gần gấp đôi so với mức cơ sở π0.5 (40%) ở cùng ngân sách; nâng ngân sách lên trung bình dưới 40 giờ giúp nâng tỷ lệ thành công tổng thể lên 85%.
Đánh giá về khả năng học tập hiệu quả các tác vụ mới. Mỗi ô hiển thị tỷ lệ thành công (%), giá trị càng cao càng tốt. XR-1 = Xiaomi-Robotics-1.
Chúng tôi đánh giá Xiaomi-Robotics-1 trên bốn bộ tiêu chuẩn mô phỏng chính thống. Nó đạt được kết quả tiên tiến nhất (state-of-the-art) trên cả bốn bộ tiêu chuẩn. Bảng báo cáo tỷ lệ thành công trung bình và mức tăng tương đối so với vị trí thứ hai. Những kết quả này cho thấy các lợi ích về khả năng tổng quát hóa và mở rộng quy mô của Xiaomi-Robotics-1 được chuyển đổi sang đánh giá mô phỏng tiêu chuẩn.
Đánh giá mô phỏng. Tất cả các bộ tiêu chuẩn đều báo cáo tỷ lệ thành công trung bình (%). XR-1 = Xiaomi-Robotics-1; Rel. Gain (Mức tăng tương đối) = (XR-1 − tốt thứ 2) / tốt thứ 2. Giá trị càng cao càng tốt.
Kết luận
Xiaomi-Robotics-1 chứng minh một lộ trình thực tiễn để mở rộng quy mô các mô hình nền tảng robot: tiền huấn luyện UMI không phụ thuộc vào hình thể quy mô lớn giúp phá vỡ nút thắt dữ liệu robot, trong khi việc căn chỉnh với robot thực tế và hướng dẫn giúp chuyển đổi khả năng tổng quát đó sang các robot vật lý. Kết quả cho thấy mô hình mở rộng quy mô một cách ổn định theo khối lượng dữ liệu và kích thước mô hình trong quá trình tiền huấn luyện, và hành vi mở rộng này chuyển đổi trực tiếp sang giai đoạn hậu huấn luyện, nơi một mô hình tiền huấn luyện mạnh hơn mang lại hiệu suất robot thực tế tốt hơn ngay khi sử dụng trong các môi trường chưa từng thấy. Mô hình nền tảng thu được có khả năng thích ứng với các tác vụ mới từ dữ liệu tối thiểu và đạt hiệu suất tiên tiến nhất trên bốn bộ tiêu chuẩn mô phỏng đầy thách thức chú trọng vào khả năng tổng quát hóa.
Cuối cùng, chúng tôi trình bày một đoạn phim chưa cắt về việc đóng gói hành lý.
Trích dẫn
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.