QbitAI
92

Mô hình

Đưa GPT-6 Astra vào cơ thể robot: Đại học Thanh Hoa và InnoGrit ra mắt dự án mã nguồn mở RPent

(giờ Việt Nam)

Tóm tắt AI

Dự án RPent đánh dấu bước tiến mới trong việc hiện thực hóa các tác nhân trí tuệ nhân tạo có khả năng thực hiện công việc thực tế trong thế giới vật lý thông qua cơ thể robot.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

21-09-2026 14:22:37 Nguồn: QbitAI

Tác nhân trí tuệ thể chất (Embodied AI) thực sự làm việc trong thế giới vật lý

Yun Zhong, đưa tin từ Aofeisi

QbitAI | Kênh chính thức QbitAI

Các tác nhân trong thế giới kỹ thuật số như Codex hay Claude Code đã cho chúng ta thấy một phương thức làm việc hoàn toàn mới và hiệu quả: các mô hình lớn (Large Models) hiểu mục tiêu, phân tách nhiệm vụ, gọi các công cụ phù hợp và liên tục điều chỉnh kế hoạch dựa trên kết quả thực thi cho đến khi hoàn thành nhiệm vụ.

Với việc GPT-6 Astra bắt đầu được thử nghiệm vận hành robot thực tế, mô hình tác nhân "để mô hình lớn đóng vai trò là bộ não ra quyết định" đang dần tiến vào thế giới vật lý.

Đồng thời, điều này cũng khiến một vấn đề từng rất xa vời trở nên ngày càng cụ thể:

Liệu các mô hình lớn đa năng có thể trở thành "bộ não" của robot, giúp robot thực sự hoàn thành các nhiệm vụ phức tạp trong thế giới thực?

Tuy nhiên, robot không đối mặt với những dòng mã có thể hoàn tác bất cứ lúc nào. Trong thế giới vật lý, môi trường liên tục thay đổi, trạng thái không thể quan sát toàn diện, và một khi hành động đã xảy ra thì rất khó để rút lại. Các thao tác tinh vi như gắp, lắp ráp, cắm rút... đòi hỏi những mô hình và khả năng điều khiển chuyên biệt hơn.

Tác nhân trong thế giới vật lý không chỉ cần "hiểu rõ", mà còn phải "nhìn thấy được, làm được, phản ứng nhanh" và "ghi nhớ được".

Hôm nay, cơ sở hạ tầng cho tác nhân trí tuệ thể chất mang tên RPent, do Đại học Thanh Hoa, InnoGrit và Zhengxing Innovation đồng khởi xướng, đã chính thức được mã nguồn mở.

RPent hướng tới thế giới vật lý thực tế, kết nối khả năng hiểu và lập kế hoạch nhiệm vụ của các mô hình lớn đa năng, khả năng thao tác tinh vi của các mô hình chuyên gia như VLA, cùng với bộ nhớ, công cụ và giao diện robot. Điều này tạo thành một vòng lặp khép kín hoàn chỉnh từ nhận thức, ra quyết định, thực thi đến phản hồi và sửa lỗi, giúp tác nhân liên tục thích nghi với những thay đổi của môi trường, đồng thời đúc kết các kinh nghiệm đã được kiểm chứng thành những khả năng có thể tái sử dụng, từ đó không ngừng học hỏi và tiến hóa trong quá trình tương tác liên tục với môi trường vật lý. Trong bài kiểm tra chuẩn LIBERO-PRO, hệ thống đạt tỷ lệ thành công 92,6% và tối ưu hóa tốc độ hoàn thành nhiệm vụ từ đầu đến cuối (end-to-end) lên gấp hơn 7 lần.

RPent được xây dựng bởi đội ngũ nòng cốt của khung học tăng cường thể chất quy mô lớn RLinf, tiếp nối những tích lũy kỹ thuật của đội ngũ này trong lĩnh vực cơ sở hạ tầng trí tuệ thể chất.

Liên kết mã nguồn mở: https://github.com/RLinf/RPent

Trình diễn hiệu quả thực tế của RPent: Từ "biết chuyển động" đến "biết làm việc"

Trong video này, RPent đã trình diễn nhiều nhiệm vụ mở thú vị: robot đổ bi thép vào bát, phối hợp hai tay để lau đĩa, và chủ động di chuyển vật cản để tìm chiếc thìa bị giấu dưới bát.

Đáng chú ý là những nhiệm vụ này không cần phải huấn luyện một chiến lược chuyên biệt cho từng kịch bản. Sự thay đổi thực sự của robot là bắt đầu chuyển từ "thực hiện các hành động đã học" sang "hiểu nhiệm vụ, gọi các khả năng và điều chỉnh hành động dựa trên sự thay đổi của môi trường".

1. Ví dụ, khi nhiệm vụ thay đổi thành "đặt bộ đồ ăn sạch vào thùng giấy", đối mặt với cùng một chiếc đĩa màu xanh, VLA đóng băng (frozen VLA) sẽ chỉ áp dụng các hành động đã học trong quá trình huấn luyện và đặt nhầm nó vào giỏ kim loại;

Trong khi đó, với RPent, tác nhân sẽ quan sát môi trường hiện tại trước, sau đó chọn vị trí đặt dựa trên mục tiêu mới. Trong quá trình thực thi, nếu định vị thị giác có sai lệch, nó sẽ kiểm tra kết quả, loại bỏ mục tiêu sai và định vị lại chiếc đĩa trên tay. Khi nhiệm vụ thay đổi, robot cũng có thể thay đổi hành động theo.

2. Trong một nhiệm vụ khác, robot cần đọc nhãn hiệu trên thân chai và túi để đặt các loại đồ uống khác nhau vào đúng túi tương ứng.

Sau khi gắp chai, nó sẽ thực hiện một thao tác nâng thử nhỏ để xác nhận độ ổn định của việc kẹp;

Khi lộ trình di chuyển ban đầu không khả thi, nó sẽ điều chỉnh tư thế cổ tay để tiếp tục thực hiện.

Tiếp theo, đối mặt với chiếc thìa bị bát che khuất, robot không cố gắng gắp trực tiếp mà di chuyển hai chiếc bát ra trước để mục tiêu có thể nhìn thấy và tiếp cận được.

Những gì được trình diễn ở đây không còn là một chuỗi hành động được lập trình sẵn, mà là một vòng lặp khép kín hoàn chỉnh "quan sát - phán đoán - thực thi - sửa lỗi".

3. Hai nhiệm vụ cuối cùng minh họa rõ hơn khả năng tái sử dụng các kỹ năng sẵn có của RPent.

Robot có thể kết hợp lại các kỹ năng vốn dùng để "nhấc và đặt vật chứa" để thực hiện việc đổ bi thép; hoặc kết hợp hành động gắp với sự phối hợp hai tay và tiếp xúc liên tục để hoàn thành việc cầm đĩa, lau chùi và cất giữ.

Sau khi khám phá thành công, RPent sẽ đúc kết logic nhiệm vụ đã được kiểm chứng thành Task Card (Thẻ nhiệm vụ); khi thực hiện lại, RPent có thể kích hoạt Flash Mode, sử dụng trực tiếp quy trình này thông qua Task Card, chỉ điều chỉnh dựa trên trạng thái thị giác hiện tại, tránh việc phải gọi lại mô hình lớn ở mỗi bước, từ đó giảm thiểu hiệu quả độ trễ khi thực thi của tác nhân trí tuệ thể chất.

Toàn bộ bản Demo này không nhằm mục đích trình diễn "robot đã học thêm được vài động tác", mà là một vấn đề quan trọng hơn: khi robot bước vào thế giới mở, nơi các nhiệm vụ, vật thể và chướng ngại vật mới liên tục xuất hiện, liệu nó có thể giống như con người, tổ chức lại các kỹ năng sẵn có để hoàn thành các nhiệm vụ nằm ngoài phân phối huấn luyện hay không?

Những gì RPent đang khám phá chính là hình thái của một tác nhân trí tuệ thể chất như vậy.

Robot không còn chỉ thực hiện một chỉ lệnh cố định, mà có khả năng hiểu mục tiêu, gọi các khả năng, ứng phó với thay đổi và đúc kết một lần thành công thành kinh nghiệm có thể tái sử dụng cho lần sau. Đây chính là hình hài sơ khai của tác nhân trí tuệ thể chất.

Tư duy thiết kế cốt lõi của RPent

Sự phát triển của trí tuệ thể chất hiện nay đang dần hình thành hai lộ trình kỹ thuật khác biệt.

Một là lộ trình VLA end-to-end thuần túy.

Sử dụng một mô hình thị giác-ngôn ngữ-hành động để trực tiếp tiếp nhận quan sát và xuất ra hành động. Cách này thực hiện các thao tác tinh vi rất tốt, nhưng một khi nhiệm vụ trở nên dài hơn, ngôn ngữ phức tạp hơn hoặc kịch bản bị nhiễu, nó sẽ nhanh chóng suy giảm hiệu suất.

Hai là lộ trình tác nhân mô hình lớn thuần túy (như các công trình kiểu CAP-X).

Với việc các mô hình đa năng thế hệ GPT-6 đang nhanh chóng mở rộng phạm vi bao phủ các nhiệm vụ thể chất, việc mô hình lớn trực tiếp xuất ra hành động đã có thể thực hiện được khá nhiều nhiệm vụ — nhưng nó vẫn có những điểm yếu rõ rệt về độ chính xác ở cấp độ dưới centimet, độ trễ thực thi và khả năng "càng dùng càng mạnh".

Hai lộ trình này không đơn thuần là sự thay thế lẫn nhau, mà tương ứng với các cấp độ năng lực khác nhau:

RobotGPT-6Embodied AIMã nguồn mởĐại học Thanh Hoa
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.