Mô hình
InnoGrit hợp tác cùng Thanh Hoa và Thượng Hải ra mắt mã nguồn mở APXInf: Đột phá hiệu năng cho AI trên thiết bị
(giờ Việt Nam)
Tóm tắt AI
APXInf là công cụ suy luận tối ưu cho AI hiện thân (embodied AI), giúp giải quyết bài toán triển khai quy mô lớn tại biên với hiệu năng Pi 0.5 đạt mức SOTA.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
2026-09-15 18:43:28 Nguồn: QbitAI
Chiếm lĩnh "dặm cuối" để hiện thực hóa quy mô hóa trí tuệ thể chất (Embodied AI)!
Các mô hình thể chất ngày nay đã có thể hiểu được môi trường, nắm bắt chỉ dẫn và chuyển đổi thông tin nghe nhìn thành các quyết định hành động cho robot. Tuy nhiên, robot cuối cùng vẫn phải làm việc liên tục trong thế giới vật lý — từ "mắt nhìn thấy" đến "não ra quyết định" rồi đến "tay chân cử động", toàn bộ quy trình cần hoàn thành một vòng lặp khép kín trong thời gian cực ngắn. Đây cũng là rào cản cốt lõi không thể tránh khỏi để đưa trí tuệ thể chất từ bản Demo tiến tới ứng dụng quy mô lớn.
Khi một mô hình thể chất vận hành tốt trên đám mây được đưa vào phần cứng robot, vấn đề đầu tiên cần đối mặt thường không phải là "mô hình có đủ thông minh hay không", mà là chính hệ thống suy luận (inference system):
Đối với chatbot trên đám mây, độ trễ vài trăm mili giây có thể chỉ là sự khác biệt nhỏ về trải nghiệm; nhưng đối với robot cần cảm nhận liên tục, ra quyết định nối tiếp và điều khiển thời gian thực, vài trăm mili giây có thể dẫn đến tình trạng trễ hành động, quỹ đạo không liền mạch, thậm chí thất bại trong các nhiệm vụ phức tạp.
Khi robot tiến tới triển khai quy mô lớn, một "bài toán kinh tế" thực tế hơn sẽ xuất hiện: chi phí tính toán, mức tiêu thụ điện năng và hiệu suất sử dụng tài nguyên phần cứng hạn chế.
Do đó, điều mà việc quy mô hóa trí tuệ thể chất cần không phải là đơn giản "bê" khung suy luận từ đám mây sang robot, mà là một hệ thống suy luận được thiết kế riêng cho các kịch bản tại biên (edge): trong điều kiện hạn chế về tính toán, điện năng và chi phí, hệ thống phải cân bằng được giữa Batch nhỏ, độ trễ thấp, tương tác thời gian thực liên tục và khai thác tối đa giới hạn hiệu năng phần cứng.

Hôm nay, InnoPeak phối hợp cùng Đại học Thanh Hoa và Đại học Giao thông Thượng Hải chính thức mã nguồn mở công cụ suy luận tại biên cho trí tuệ thể chất — APXInf, chiếm lĩnh vị trí tiên phong trong khâu cốt lõi giúp trí tuệ thể chất chuyển mình từ năng lực mô hình sang triển khai quy mô lớn. APXInf hỗ trợ các nền tảng tính toán phổ biến như RTX 4090, Jetson Orin, Jetson Thor, bao phủ toàn bộ chuỗi quy trình từ phát triển mô hình, kiểm chứng hiệu quả đến triển khai trên robot. Mục tiêu của nó không chỉ là giúp mô hình thể chất "chạy được" trên robot thực tế, mà còn là "chạy nhanh, chạy ổn định và dễ dàng tích hợp mở rộng cũng như lặp lại liên tục" trong điều kiện tài nguyên hạn chế.
Hiện tại, APXInf đã đạt được:
Thông qua việc tối ưu hóa suy luận hệ thống cho các kịch bản tại biên của robot, APXInf hy vọng có thể rút ngắn hơn nữa "dặm cuối" để đưa trí tuệ thể chất từ giai đoạn POC (Proof of Concept) đến triển khai quy mô lớn.

Địa chỉ mã nguồn mở:
01 Giúp mô hình thể chất chạy nhanh hơn, ổn định hơn và linh hoạt hơn trên robot
Việc quy mô hóa trí tuệ thể chất hiện nay thực tế đang đối mặt với hai nhóm nhu cầu đồng thời:
Một phía là yêu cầu khắt khe từ phần cứng robot đối với hệ thống suy luận: hiệu năng tối thượng, độ trễ thấp, tiêu thụ điện năng thấp và độ ổn định cao;
Phía còn lại là nhu cầu kỹ thuật ngày càng mạnh mẽ từ các nhà phát triển: mô hình có thể tích hợp nhanh, năng lực có thể kiểm chứng linh hoạt và hệ thống có thể mở rộng liên tục.
Nhưng thực tế là, hiệu năng và hiệu quả kỹ thuật thường rất khó để đạt được cùng lúc.
Một số giải pháp hiện có có thể chạy nhanh nhưng đòi hỏi sự thích ứng tầng dưới và tích hợp kỹ thuật phức tạp; một số giải pháp chạy ổn định nhưng khó đáp ứng độ trễ thấp cần thiết cho điều khiển robot thời gian thực; một số khác dù giao diện đơn giản nhưng khi đối mặt với các mô hình khác nhau, phần cứng khác nhau và kiến trúc VLA liên tục thay đổi, chi phí mở rộng vẫn rất cao.
APXInf hiếm hoi thay lại cân bằng được cả hiệu năng và hiệu quả kỹ thuật, giúp mô hình thể chất chạy "nhanh hơn, ổn định hơn và linh hoạt hơn" trên robot.
1. "Nhanh" hơn: Tối ưu hóa hiệu năng suy luận SOTA từ đầu đến cuối, biến điều khiển thời gian thực thành hiện thực
Sự "nhanh" của APXInf không chỉ đơn thuần theo đuổi hiệu năng đỉnh của một toán tử mô hình đơn lẻ, mà là tối ưu hóa từ đầu đến cuối (end-to-end) xoay quanh chuỗi thực thi thực tế của robot. Thông qua các tầng tối ưu hóa như Pipeline, Graph, Kernel và lượng tử hóa, độ trễ suy luận end-to-end của mô hình thể chất được giảm thiểu. Đồng thời, thông qua thiết kế hệ thống với các đặc tính dư thừa, hệ thống thực thi (runtime) được tùy chỉnh cho mô hình, vừa nhẹ hơn vừa khai thác hiệu năng tối đa, kết hợp với công nghệ Agent4Kernel để hợp nhất các toán tử đã được tối ưu hóa cực hạn, đạt hiệu năng SOTA:

Trên Thor, APXInf đã giảm độ trễ suy luận end-to-end của PI 0.5 FP8 từ 278ms xuống dưới 26ms, tần suất đạt 38.46 Hz, cung cấp không gian phản hồi dồi dào hơn cho việc cảm nhận và điều khiển robot thời gian thực.
Độ trễ suy luận giảm 10.7 lần đối với robot đồng nghĩa với vòng lặp "cảm nhận - quyết định - hành động" nhanh hơn, đồng thời tạo cơ hội cho mô hình thể chất tiến vào trạng thái làm việc thời gian thực hơn trên robot thực tế.
2. "Ổn định" hơn: Khung nguyên bản đáng tin cậy, hướng tới vận hành ổn định lâu dài
Suy luận tại biên của robot không kết thúc ở việc "chạy thông suốt một lần". Nó phải đối mặt với môi trường phức tạp bao gồm vận hành thời gian dài, cảm nhận và điều khiển liên tục, tài nguyên tính toán hạn chế, cùng nhiều mô-đun như cảm nhận, suy luận, điều khiển chạy đồng thời. Đối với robot, điều thực sự khó chấp nhận không phải là thỉnh thoảng "chậm một chút", mà là sự rung lắc, bất thường, gián đoạn trong quá trình vận hành liên tục, hoặc thậm chí khiến toàn bộ hệ thống mất ổn định do các vấn đề về bộ nhớ, đồng thời hoặc quản lý tài nguyên.
Do đó, sự "ổn định" của APXInf nhấn mạnh vào tính dự đoán và khả năng vận hành liên tục trong môi trường triển khai thực tế.
Kiến trúc sáng tạo: Runtime tối giản được xây dựng bằng ngôn ngữ hệ thống Rust + Giao diện Python dễ sử dụng

Đây cũng là lựa chọn kiến trúc của APXInf cho việc triển khai robot thực tế: vừa theo đuổi hiệu năng tại biên, vừa chú trọng tính ổn định vận hành lâu dài của hệ thống, đồng thời giảm thiểu tối đa rào cản sử dụng cho nhà phát triển.
3. "Linh hoạt" hơn: Giảm chi phí tích hợp và tối ưu hóa, mô hình mới cho hệ thống suy luận hướng tới sự tiến hóa Agentic Native
Nếu những nỗ lực trước đó đã giải quyết được hai bài toán "chạy có đủ nhanh không" và "có chạy ổn định lâu dài được không", thì vấn đề tiếp theo mà APXInf quan tâm là: đối mặt với các mô hình thể chất ngày càng phong phú và hệ thống thể chất ngày càng phức tạp, làm thế nào để mô hình được tích hợp nhanh hơn, linh hoạt hơn và liên tục lặp lại tối ưu hóa?
Các công cụ suy luận truyền thống thường sử dụng kỹ thuật biên dịch hoặc giảm độ khó phát triển để giải quyết vấn đề tích hợp mô hình mới, nhưng thường khó cân bằng giữa hiệu năng tối thượng và hiệu quả tích hợp. Ngày nay, năng lực của các mô hình lớn thay đổi từng ngày, chúng ta có thể vừa duy trì tối ưu hóa cực hạn cho mô hình, vừa sử dụng Agentic Engineering để nhanh chóng hiện thực hóa việc thích ứng và tích hợp mô hình mới — năng lực này không chỉ tăng tốc quá trình nghiên cứu và phát triển của chính chúng ta, mà còn mở ra cho các nhà phát triển APXInf, giúp việc tích hợp và tối ưu hóa các mô hình tự nghiên cứu của người dùng trở nên đơn giản và linh hoạt hơn.
Vì vậy, ngay từ khi thiết kế, APXInf đã lấy việc thích ứng với quy trình R&D của Agentic Engineering làm điểm xuất phát, tư duy lại thiết kế hệ thống của công cụ suy luận. Thông qua các phương pháp như đặc tính dư thừa, cô lập chức năng, mô hình hộp công cụ, APXInf nâng cao đáng kể mức độ tương thích với Agentic Engineering, hạ thấp ngưỡng R&D, giúp Token có thể chuyển hóa thành năng suất một cách thuận tiện và hiệu quả hơn.
APXInf cũng sẽ tiếp tục khám phá và lặp lại hướng tới Agentic Native. Chúng tôi hy vọng những gì APXInf mang lại không chỉ là hạ thấp ngưỡng triển khai cho một mô hình đơn lẻ, mà là khám phá một mô hình xây dựng hệ thống suy luận hoàn toàn mới cho kỷ nguyên Agentic Engineering: để công cụ suy luận không còn chỉ là một Runtime thực thi mô hình thụ động, mà là cầu nối kết nối mô hình, phần cứng, robot và nhà phát triển, thúc đẩy sự tiến hóa của Agentic Infra.
02 Danh mục mã nguồn mở
APXInf lần đầu tiên hỗ trợ hai mô hình thể chất: PI 0.5, WALL-OSS.
Hỗ trợ phần cứng Jetson Orin, Jetson Thor và RTX 4090, đồng thời cung cấp phương thức tích hợp mô hình thống nhất.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.