# Microsoft ra mắt tính năng giảm tải suy luận cho robot, tối ưu hiệu suất và thời lượng pin

- Nguồn: Microsoft Research Blog
- Thời gian phát hành: 2026-09-23 23:01 (giờ Việt Nam)
- Điểm AI: 53/100
- Link AIHOT.vn: https://aihot.vn/items/8cc1cb29a05ec0fc
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmueb5n5m0u2progh6ebcvpuw
- Link gốc: https://www.microsoft.com/en-us/research/blog/offloaded-inference-for-real-world-physical-ai-robotics

## Tóm tắt AI

Microsoft Research tích hợp khả năng giảm tải suy luận vào Physical AI Toolchain, cho phép phân bổ khối lượng công việc AI của robot giữa thiết bị, biên và đám mây thông qua Kubernetes, giúp tăng hiệu suất vận hành thực tế.

## Thân bài

![Offloaded inference for real-world physical AI robotics](https://www.microsoft.com/en-us/research/wp-content/uploads/2026/09/PhysicalAI-TWLIFB-1200x627-1.jpg)

![ Two images showing the robot performing the same task of handing over a tape from one robot arm to another. The videos show that while the task succeeds when the inference latency is low, the handove](https://www.microsoft.com/en-us/research/wp-content/uploads/2026/09/PhysicalAI-BlogHeroFeature-1400x788-1.jpg)

### Tổng quan

- Thách thức một giả định cốt lõi trong AI robot: Nghiên cứu của chúng tôi cho thấy việc chạy suy luận (inference) AI vật lý hoàn toàn trên GPU tích hợp sẵn có thể hạn chế hiệu suất, thời lượng pin và khả năng mở rộng của robot, đồng thời việc chuyển tải (offloading) suy luận sang các GPU ở biên (edge) hoặc đám mây (cloud) có thể mang lại những lợi thế đáng kể.
- Chứng minh những lợi ích có thể đo lường được của việc chuyển tải suy luận: Trên các khối lượng công việc thao tác di động tiêu biểu, việc chuyển tải đã cải thiện tỷ lệ thành công của tác vụ, cho phép sử dụng các mô hình AI lớn hơn và giúp robot phản ứng hiệu quả hơn trong các môi trường thực tế, năng động.
- Kéo dài thời gian hoạt động của robot: Thay thế phần cứng AI tích hợp tiêu tốn nhiều năng lượng bằng phần cứng tích hợp nhẹ hơn và suy luận từ xa có thể cải thiện đáng kể thời lượng pin, cho phép robot hoạt động lâu hơn giữa các lần sạc.
- Giới thiệu khả năng mới trong Physical AI Toolchain: Các nhà phát triển hiện có thể đóng gói (containerize), triển khai và điều phối các khối lượng công việc AI robot trên robot, cơ sở hạ tầng biên và đám mây bằng cách sử dụng các công cụ dựa trên Kubernetes cho suy luận phân tán.

AI vật lý sẵn có, với việc robot hỗ trợ người dùng trong các tình huống sản xuất, gia đình và kho bãi, mang lại tiềm năng to lớn để cải thiện sự an toàn, năng suất và hỗ trợ cho nhiều loại tác vụ. Theo nhiều cách, AI cho thế giới vật lý đại diện cho một biên giới lớn của AI. AI vật lý phải hoạt động trong các môi trường mở, khó dự đoán, tương tác với cả robot khác lẫn con người và làm việc với nhiều hình thái (embodiments) đa dạng. Để hiện thực hóa tầm nhìn này đòi hỏi những tiến bộ trên ba phương diện: phần cứng robot, các mô hình AI hiện thân (embodied AI) và cơ sở hạ tầng hệ thống cho việc huấn luyện và suy luận. Trong khi phần cứng robot và các mô hình AI đã tiến bộ nhanh chóng trong những năm gần đây, chúng tôi tập trung vào một khía cạnh tương đối ít được chú trọng: cơ sở hạ tầng suy luận của AI vật lý. Việc cho phép robot vận hành hiệu quả và an toàn trong thế giới vật lý sẽ đòi hỏi các hệ thống tinh vi để xử lý khối lượng lớn các tính toán suy luận phân tán.

Ngày nay, cách tiếp cận phổ biến đối với AI vật lý là trang bị một GPU trên robot, ví dụ như bằng cách kết nối GPU trực tiếp vào robot. Trong mô hình này, suy luận của robot sẽ bị giới hạn trong GPU tích hợp và cung cấp cho robot các đoạn mã và chuỗi hành động cần thiết để thực hiện các tác vụ của nó. Mặc dù việc lập kế hoạch cấp cao có thể được thực hiện trên đám mây, nhưng việc thực thi tác vụ thường vẫn gắn liền với chính robot đó. Chúng tôi thách thức giả định này. Khi các mô hình AI vật lý ngày càng tăng về quy mô và độ tinh vi, những hạn chế của tính toán tích hợp trở nên ngày càng rõ rệt. GPU tiêu thụ nhiều năng lượng, làm giảm thời lượng pin, tăng chi phí và trọng lượng, đồng thời có thể hạn chế khả năng chạy các thế hệ mô hình AI mới nhất.

Để hiểu rõ hơn về các tác động hệ thống của AI vật lý, chúng tôi đã thực hiện nghiên cứu hệ thống đầu tiên về khối lượng công việc của robot. Chúng tôi tập trung vào thao tác robot di động, với tác vụ điển hình như “kiểm tra rác trong bếp và bỏ vào thùng rác”. Một tác vụ như vậy bao gồm việc lập kế hoạch đường đi đến nhà bếp, nhận diện môi trường để tìm rác, điều hướng đến chỗ rác, nhặt rác và điều hướng quay lại thùng rác để xử lý. Chúng tôi đã đánh giá các mô hình tiêu biểu trên ba khả năng cốt lõi: lập bản đồ và lập kế hoạch ngữ nghĩa, điều hướng và thao tác, như được tóm tắt trong Hình 2.

![Mobile robotic manipulation involves the components of semantic mapping & planning, manipulation, and safe navigation. The table above lists the state-of-the-art models used for each of these componen](https://www.microsoft.com/en-us/research/wp-content/uploads/2026/09/FIG-2_-PhysicalAI.png)

Việc chuyển tải suy luận AI vật lý ra khỏi robot đã cải thiện thời gian phản hồi và độ chính xác, cùng với thời lượng pin và chi phí. Chúng tôi đã đánh giá các mô hình suy luận trên một loạt các cấu hình tính toán tích hợp, biên và đám mây. Thông tin chi tiết về phần cứng thử nghiệm cụ thể có sẵn trong [báo cáo kỹ thuật](https://www.microsoft.com/en-us/research/publication/offload-or-overload-a-platform-measurement-study-of-mobile-robotic-manipulation-workloads/) của chúng tôi.

![Diagram showing that offloading Physical AI inference from robots improves performance, battery efficiency, and cost.](https://www.microsoft.com/en-us/research/wp-content/uploads/2026/09/Figure_Physical-AI.png)

Lợi ích về hiệu suất tác vụ: Đánh giá của chúng tôi cho thấy việc chuyển tải suy luận có thể cải thiện đáng kể hiệu suất của robot trong các khối lượng công việc lập bản đồ, lập kế hoạch, điều hướng và thao tác. Một số GPU nhỏ hơn không thể đáp ứng được ngăn xếp thao tác di động. Trên các GPU có đủ bộ nhớ, việc lập bản đồ và lập kế hoạch chậm hơn tới 383% so với A100, do đó hạn chế khả năng của robot trong các không gian năng động. Điều hướng cho thấy mức giảm 30% trong việc phát hiện chướng ngại vật kịp thời với các GPU nhẹ hơn. Mặc dù các mô hình VLA không chậm lại đáng kể với các GPU nhỏ hơn, nhưng mức độ chậm lại vẫn đủ để làm giảm độ chính xác của chúng xuống 50%. Nói cách khác, các GPU tích hợp đã hạn chế hiệu suất của robot trong khi việc chuyển tải suy luận của chúng sang GPU tại chỗ hoặc đám mây giúp tăng cường hoạt động của chúng, như được hiển thị trong các video bên dưới và được định lượng trong các biểu đồ. Khi các mô hình AI vật lý tiếp tục tăng về quy mô và độ phức tạp, lợi ích của việc chuyển tải có khả năng sẽ càng trở nên rõ rệt hơn.

_Nội dung media · xem tại bài gốc_

Hình 3a: Video hiển thị tác vụ bàn giao với các GPU tích hợp.

_Nội dung media · xem tại bài gốc_

Hình 3b: Video hiển thị tác vụ bàn giao khi suy luận được chuyển tải.

![Robots can support GPUs such as Jetson Nano and Orin AGX onboard. The graphs above show that the success rate of object handover and navigation are low with onboard GPUs, but increase substantially wi](https://www.microsoft.com/en-us/research/wp-content/uploads/2026/09/Fig4_PhysicalAI.png)

Lợi ích về thời lượng pin: Ngoài hiệu suất, các GPU tích hợp cũng làm tiêu hao đáng kể thời lượng pin của robot. Chúng tôi đã so sánh mức tăng thời lượng pin bằng cách thay thế GPU tích hợp bằng bo mạch Raspberry Pi-5 và chuyển tất cả dữ liệu sang GPU được chuyển tải. Các GPU tích hợp lớn hơn, chẳng hạn như Jetson Thor, đã làm tiêu hao pin robot tới 160% (hoặc vài giờ) ngay cả đối với những robot lớn hơn.

![Battery lifetime of the Stretch-3 robot can improve by over 100% when their GPU inference is offloaded out of the robot.](https://www.microsoft.com/en-us/research/wp-content/uploads/2026/09/Fig5_PhysicalAI.png)

Các kết quả trên cho thấy việc chuyển tải suy luận GPU ra khỏi robot là rất quan trọng để hoạt động trong thế giới mở với các mô hình lớn và thời lượng pin dài. Tuy nhiên, việc chuyển tải suy luận ra khỏi robot liên quan đến một sự đánh đổi phức tạp giữa hiệu suất, độ trễ mạng, băng thông và tài nguyên GPU khả dụng. Chúng tôi tin rằng [nghiên cứu đo lường](https://www.microsoft.com/en-us/research/publication/offload-or-overload-a-platform-measurement-study-of-mobile-robotic-manipulation-workloads/) của chúng tôi sẽ cung cấp thông tin cho việc thiết kế các hệ thống suy luận AI vật lý.

CHUỖI PODCAST

### Kiểm thử và Đánh giá AI: Những bài học từ Khoa học và Công nghiệp

Khám phá cách Microsoft học hỏi từ các lĩnh vực khác để thúc đẩy việc đánh giá và kiểm thử như một trụ cột của quản trị AI.

### Bộ công cụ cho việc chuyển tải tự động

Chúng tôi đã xây dựng một bộ công cụ để dễ dàng chuyển tải suy luận ra khỏi robot và phân phối suy luận giữa GPU biên và đám mây. Kubernetes là một nền tảng tự nhiên để cung cấp sự trừu tượng hóa đồng nhất nhằm phân phối AI robot giữa tính toán của robot, GPU biên và chuyển tải sang đám mây. Bộ công cụ cho phép đóng gói và chuyển tải tự động các khối lượng công việc robot bằng cách sử dụng các thông số kỹ thuật khai báo, phân phối các container AI vật lý với các chính sách thông minh sử dụng Kubernetes, và tích hợp với các trình mô phỏng robot, LeRobot và ROS2 để phát triển dễ dàng. Chuỗi các bước dưới đây cho thấy cách bộ công cụ có thể được nhắc nhở về những gì cần chuyển tải, và cách nó tạo ra một container riêng biệt cho suy luận GPU và thực hiện chuyển tải.

Microsoft gần đây đã phát hành [Physical AI Toolchain (mở trong tab mới)](https://github.com/microsoft/physical-ai-toolchain/tree/main) để vận hành trí tuệ vật lý trên quy mô lớn. Physical AI Toolchain là một framework mã nguồn mở, sẵn sàng cho sản xuất, tích hợp các dịch vụ đám mây [Microsoft Azure (mở trong tab mới)](https://azure.microsoft.com/) với ngăn xếp AI vật lý của [NVIDIA (mở trong tab mới)](https://developer.nvidia.com/), giúp các nhà phát triển robot và AI vật lý tăng tốc tự động hóa và mở rộng quy mô quản lý dữ liệu, tăng cường và đánh giá trên các quy trình nhận thức, di chuyển, học bắt chước và học tăng cường. Chúng tôi công bố việc bổ sung một khả năng tiên phong trong ngành về suy luận AI vật lý ngoại vi (offloaded) cho robot như một phần của Physical AI Toolchain. Bản phát hành này bao gồm các dự án ví dụ về việc chuyển tải suy luận cho SO-101 và UR10e. Các video dưới đây cho thấy quá trình chuyển tải suy luận của [mô hình Rho của Microsoft](https://www.microsoft.com/en-us/research/story/advancing-ai-for-the-physical-world/), nhắm đến các robot hai tay, sang GPU Jetson Thor, vốn điều khiển các hành động của [robot Mobile Aloha (mở trong tab mới)](https://mobile-aloha.github.io/).

_Nội dung media · xem tại bài gốc_

Hình 7a: Chuyển tải suy luận GPU của mô hình Rho từ Microsoft điều khiển robot Mobile Aloha để tương tác với BusyBox nhằm nhấn nút màu xanh.

_Nội dung media · xem tại bài gốc_

Hình 7b: Chuyển tải suy luận GPU của mô hình Rho từ Microsoft điều khiển robot Mobile Aloha để tương tác với BusyBox nhằm xoay núm vặn đến vị trí 4.

Hãy trải nghiệm tính năng chuyển tải suy luận, xem mã nguồn và cho chúng tôi biết phản hồi của bạn. Chúng tôi đã thử nghiệm tính năng này với nhiều trường hợp sử dụng thực tế và rất mong được lắng nghe về trải nghiệm triển khai của bạn.
