Nghiên cứu
Axis Robotics ra mắt AXIS: Công cụ dữ liệu trên trình duyệt với hơn 50.000 quỹ đạo robot
(giờ Việt Nam)
Tóm tắt AI
AXIS giải quyết nút thắt dữ liệu robot bằng cách đưa việc thu thập dữ liệu lên trình duyệt web, cung cấp 207 tác vụ và hơn 50.000 quỹ đạo thực tế giúp cải thiện đáng kể hiệu suất huấn luyện mô hình so với các phương pháp truyền thống.
Bản dịch AI

Các tập dữ liệu thao tác robot (robot manipulation datasets) đã phát triển chậm hơn nhiều so với các mô hình được huấn luyện trên chúng, chủ yếu là do việc thu thập dữ liệu vẫn còn khép kín và tập trung. Các chuyên gia vận hành thu thập các bản trình diễn trên phần cứng phòng thí nghiệm, xử lý ngoại tuyến và xuất bản một bộ benchmark cố định không bao giờ được mở rộng thêm. Một nhóm nghiên cứu từ Axis Robotics, UC Berkeley, Georgia Tech, NTU… đang đề xuất một hướng tiếp cận khác cho vấn đề này. Hệ thống của họ, AXIS, chuyển việc thu thập bản trình diễn lên trình duyệt, gửi mọi thứ khác đến các GPU backend và coi tập dữ liệu là một thực thể không ngừng mở rộng thay vì là thứ chỉ được phát hành một lần.
Liệu nó có thể triển khai được không? Một phần. Mã nguồn huấn luyện được công khai dưới dạng lớp patch trên OpenPI, và nền tảng điều khiển từ xa (teleoperation) hoạt động trực tiếp trên mọi trình duyệt. Tập dữ liệu trên Hugging Face được giới hạn ở mức 2.36 TB và chỉ dành cho mục đích học thuật phi thương mại. Không có checkpoint chính sách (policy checkpoints) nào được công bố.
Sự phân tách giữa trình duyệt và backend
Quyết định cốt lõi của hệ thống là sự bất đối xứng. Những người đóng góp điều khiển từ xa một robot Franka Research 3 với bộ kẹp song song (parallel-jaw gripper) bên trong giao diện frontend MuJoCo WebAssembly, sử dụng bàn phím, chuột, cần điều khiển ảo hoặc tay cầm chơi game. Việc tính toán vật lý và kết xuất Three.js chạy tách biệt khỏi luồng giao diện React, vì vậy các mẫu trạng thái-hành động (state-action samples) được ghi lại vẫn đồng bộ với trình mô phỏng thay vì giao diện. Mọi tác vụ tốn kém đều diễn ra ở nơi khác: kết xuất trên 8x GPU RTX 4090, huấn luyện và đánh giá trên 8x GPU A100.
Các tác vụ tự được tạo ra thay vì soạn thảo thủ công. TaskGen phân tách một chỉ dẫn ngôn ngữ thành các cấu hình tác vụ, cảnh và đối tượng, truy xuất hoặc tạo các lưới (meshes) thông qua quy trình image-to-3D, thay đổi kích thước chúng về kích thước vật lý hợp lý, sau đó đề xuất một bố cục 2.5D. Một trình giám sát bố cục sẽ xác thực cảnh đã được khởi tạo và di chuyển, xoay hoặc tạo lại các đối tượng khi các ràng buộc không được đáp ứng. Mỗi tác vụ đi kèm với một trình kiểm tra thành công có cấu trúc, được backend chạy lại thay vì tin tưởng vào cờ thành công của frontend.
Tập dữ liệu chứa những gì
Bản snapshot được phát hành chứa 207 tác vụ, 50.129 tập (episodes) và hơn 60.000 biến thể tác vụ hoặc cảnh trên bảy danh mục cảnh. Mỗi quỹ đạo (trajectory) mang theo siêu dữ liệu tác vụ, hiện thân (embodiment), phiên bản trình mô phỏng, trạng thái robot và đối tượng, hành động, nhãn thành công, cùng các quan sát RGB-D từ góc nhìn thứ ba và từ cổ tay. Bài báo ghi nhận sự đóng góp của hơn 70.000 thành viên cộng đồng.
Việc làm sạch dữ liệu được coi là một giai đoạn sản xuất. Các mẫu có biến thiên khớp dưới 5e-3 bị loại bỏ vì coi là tĩnh, bộ lọc Savitzky-Golay với cửa sổ 15 và bậc đa thức 3 làm mượt chuyển động liên tục, và các đường cong cubic spline lấy mẫu lại từ 6 Hz đến 8 Hz mà giao diện web tạo ra lên mục tiêu 20 Hz. Bảng 1 thể hiện sự đánh đổi một cách trung thực: gia tốc trung bình giảm từ 1.3539 xuống 0.4885 và độ giật (jerk) trung bình giảm từ 11.5899 xuống 2.2243, trong khi tỷ lệ thành công khi phát lại giảm từ 100% xuống 86.2%.
Các tập đã làm sạch sau đó được phát lại trong IsaacSim từ trạng thái trình mô phỏng đã đóng gói với tính năng tính toán vật lý bị vô hiệu hóa, nhờ đó quỹ đạo đã xác minh vẫn giữ được tính xác thực trong khi các cảnh, camera, vật liệu và ánh sáng được ngẫu nhiên hóa xung quanh nó. Đầu ra là hình ảnh RGB ray-traced 256×256 từ một camera góc nhìn thứ ba cố định và một camera gắn cổ tay, với độ sâu (depth) mặc định bị tắt.
Kết quả trên LIBERO-Plus
Mọi điều kiện đều bắt đầu từ checkpoint π0.5 đã phát hành, một backbone PaliGemma Gemma-2B với chuyên gia hành động Gemma-300M, tùy chọn tiếp tục huấn luyện trước trên một tập dữ liệu mô phỏng (sim corpus), sau đó tinh chỉnh trên LIBERO với các siêu tham số giống hệt nhau. Việc huấn luyện trước là trên toàn bộ mô hình mà không dùng LoRA, sử dụng hàm mất mát flow-matching trên các đoạn hành động 10 bước trong 100.000 bước, theo sau là 30.000 bước hậu huấn luyện LIBERO.
π0.5 cộng với AXIS-100% đạt 88.8 điểm tổng thể trên LIBERO-Plus so với 83.9 của π0.5 nguyên bản và 57.5 của RoboCasa365 được kiểm soát dựa trên số lượng quỹ đạo. Bản tóm tắt trích dẫn các con số 5.8% và 37.3%; cả hai đều là các số liệu tương đối được chuẩn hóa theo đường cơ sở 83.9, vì vậy khoảng cách điểm 4.9 và 31.3 là cách đọc chính xác hơn. Khả năng mở rộng được duy trì ở cấp độ tổng hợp, từ 84.7 đến 85.7 rồi 88.8 trên các snapshot 25%, 50% và 100%.
Theo từng trục, mức tăng lớn nhất nằm ở nơi quy trình tăng cường dữ liệu thực sự thực hiện ngẫu nhiên hóa: Nhiễu cảm biến (Sensor Noise) +13.7 và Camera +11.3. Nền (Background) tăng 3.7, tư thế Robot 3.8, Bố cục (Layout) 2.6. Ánh sáng và Ngôn ngữ bị giảm, lần lượt là 1.7 và 1.3. Camera cũng giảm xuống 68.8 tại AXIS-50%, thấp hơn mức cơ sở 72.5, trước khi phục hồi. Khả năng mở rộng nhất quán ở cấp độ tổng hợp và có độ nhiễu theo từng trục.
Công cụ giải thích tương tác
Những điểm chính cần lưu ý
Hãy xem Bài báo, Trang dự án, Tập dữ liệu và Nền tảng. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML của chúng tôi và Đăng ký Bản tin của chúng tôi. Khoan đã! bạn có dùng Telegram không? bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Cần hợp tác với chúng tôi để quảng bá GitHub Repo HOẶC Trang Hugging Face HOẶC Bản phát hành sản phẩm HOẶC Hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có thể hành động được.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.