Sản phẩm
NVIDIA mã nguồn mở OSMO: Điều phối huấn luyện AI, mô phỏng và thử nghiệm robot chỉ với một file YAML
(giờ Việt Nam)
Tóm tắt AI
NVIDIA vừa ra mắt OSMO, công cụ điều phối workflow dựa trên Kubernetes giúp đồng bộ hóa quy trình huấn luyện GPU, mô phỏng RTX và thử nghiệm phần cứng robot thực tế thông qua cấu hình YAML duy nhất.
Bản dịch AI

Các nhà phát triển robot không chỉ có một vấn đề về tính toán. Họ có tới 3 vấn đề. Một chính sách (policy) được huấn luyện trên các cụm GB200 hoặc H100, được thử nghiệm trong Isaac Sim trên các GPU RTX, sau đó được xác thực trên Jetson gắn bên trong một robot thực tế. Mỗi tầng có cụm máy chủ riêng, bộ lập lịch riêng và các tập lệnh kết nối (glue scripts) riêng. NVIDIA OSMO là câu trả lời của NVIDIA cho sự phân mảnh đó: một trình điều phối quy trình làm việc (workflow orchestrator) mã nguồn mở, dựa trên Kubernetes, cho phép một nhóm mô tả toàn bộ quy trình trong một tệp YAML duy nhất và chạy nó trên mọi tầng mà không cần can thiệp vào mã hạ tầng.
Có thể triển khai được không? Có. OSMO được cấp phép theo Apache-2.0, cung cấp các Helm chart và container trên NGC, đồng thời có tính năng khởi động nhanh cục bộ (local quickstart) cho phép chạy toàn bộ mặt phẳng điều khiển (control plane) trên một máy trạm với KIND.
Bài toán ba máy tính
NVIDIA định nghĩa AI vật lý là một bài toán ba máy tính. Việc huấn luyện diễn ra trên các GPU trung tâm dữ liệu. Mô phỏng, vật lý và kết xuất cảm biến diễn ra trên phần cứng RTX cấp máy trạm. Việc triển khai và thử nghiệm phần cứng trong vòng lặp (HIL) diễn ra trên các thiết bị biên như Jetson AGX Thor, thường là tại chỗ. Mỗi tầng thường có bộ công cụ riêng và các điểm chuyển giao là nơi các tập lệnh tùy chỉnh tích tụ.
OSMO coi cả 3 tầng này là các backend của một mặt phẳng điều khiển duy nhất. Mỗi backend là một cụm Kubernetes được đăng ký thông qua CLI. Các quy trình làm việc không bao giờ gọi tên cụm máy chủ. Thay vào đó, chúng gọi tên một nền tảng (ví dụ: gb200, rtx-pro-6000 hoặc jetson-agx-thor) và OSMO sẽ điều hướng tác vụ đến một nhóm (pool) cung cấp nền tảng đó.
Quy trình làm việc trông như thế nào
Ví dụ điển hình trong kho lưu trữ (repo) là 3 tác vụ được liên kết với nhau bằng dữ liệu:
Các phụ thuộc đến từ đầu vào, tính bền vững đến từ đầu ra và vị trí thực thi đến từ nền tảng. Hướng dẫn sử dụng bao gồm các nhóm tác vụ nối tiếp và song song, mẫu Jinja cho các quy trình làm việc có tham số, chính sách thử lại và các mức ưu tiên CAO/BÌNH THƯỜNG/THẤP với khả năng chiếm quyền ưu tiên và mượn GPU giữa các nhóm.
Các khả năng chính
Trình giải thích tương tác: Xem cách OSMO điều hướng một quy trình làm việc qua 3 tầng tính toán
Nhấn "Run workflow" để xem cách OSMO lập lịch cho ví dụ trong README theo từng tác vụ. Nhấp vào bất kỳ tầng hoặc số bước nào để kiểm tra những gì diễn ra tại đó.
Những điểm chính cần lưu ý
Hãy xem GitHub, Tài liệu, Bản phát hành, Cookbook và trang NVIDIA OSMO. Mọi công lao đều thuộc về các nhà nghiên cứu của dự án này. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia cộng đồng ML SubReddit với hơn 150 nghìn thành viên của chúng tôi cũng như đăng ký nhận Bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, bản phát hành sản phẩm hoặc hội thảo trực tuyến của bạn? Hãy kết nối với chúng tôi.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.