Mô hình
Unitree và Agibot dùng chung một bộ não: Bản demo mô hình bí ẩn gây sốt với 10 phút quay liền mạch
(giờ Việt Nam)
Tóm tắt AI
Hai gã khổng lồ robot Unitree và Agibot gây bất ngờ khi cùng vận hành trên một mô hình AI duy nhất, thể hiện khả năng điều khiển robot phức tạp qua video demo dài 10 phút không cắt ghép.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
26/08/2026 13:52:06 Nguồn: QbitAI
Noah đưa tin từ Aofeisi
QbitAI | Kênh chính thức QbitAI
Các công ty trí tuệ nhân tạo hiện thân (Embodied AI) hiện nay thường quay các video demo tinh xảo và cường điệu như quảng cáo, nhưng bạn đã bao giờ xem một video chân thực, không hề qua chỉnh sửa chưa?

Vài ngày trước, một người bạn trong ngành đã gửi cho tôi một đoạn demo dài 10 phút, quay liền mạch từ đầu đến cuối, không cắt ghép, không điều khiển từ xa, không lệnh thủ công, thậm chí có phần thô sơ, nhưng nội dung trình diễn đã khiến tôi phải ngồi lặng người, cảm xúc khó mà bình ổn lại được (doge).
Trong video, robot vươn tay ra ngoài cửa sổ để lau kính, khi không với tới chỗ cao, nó biết tự bê thùng để làm bệ đứng, và khi nhiệm vụ dài hạn bị gián đoạn, nó vẫn có thể khôi phục lại một cách chính xác...
Điều bùng nổ hơn nữa là trong video xuất hiện đồng thời robot của Unitree và Agibot. Hai "đối thủ cạnh tranh" với kiến trúc phần cứng, bậc tự do chuyển động và hệ thống cảm biến hoàn toàn khác biệt này lại cùng sử dụng một "bộ não", phối hợp và cộng tác chặt chẽ với nhau. Đây là mẫu hình về bộ não chung đa nền tảng hiếm thấy trên toàn cầu.
Không hề nói quá khi cho rằng, đây có thể là một đoạn demo đủ sức viết lại nhận thức của ngành công nghiệp Embodied AI toàn cầu, lật đổ các đánh giá kỹ thuật hiện tại, thậm chí có thể thay đổi cả Scaling Law...
Rốt cuộc thì đây là "thần thánh" phương nào?
Phân tích từng khung hình, toàn những cảnh kinh điển
Lượng thông tin trong video này thực sự quá lớn. Tôi đã nghiêm túc phân tích từng khung hình và càng xem càng thấy cuốn.
Địa điểm quay là một căn phòng trọ rộng khoảng 15m², đồ đạc dày đặc, lối đi hẹp đến mức xoay người cũng khó. Trong môi trường này, gần như không có khả năng điều khiển từ xa (không đủ chỗ đứng cho người) hay kịch bản được lập trình sẵn.

Ngay từ thiết kế môi trường, video này đã khẳng định với mọi người rằng: đây chỉ có thể là một video về robot tự học, tự tiến hóa và tự ra quyết định hoàn toàn.
Hai robot cùng làm việc nhà song song trong một không gian, cảm nhận ranh giới và lập kế hoạch đường đi theo thời gian thực.
Xuyên suốt không va chạm, không lạc đường, không dừng lại, thích ứng hoàn hảo với môi trường thực tế phức tạp và xa lạ, ngay cả phiên bản robot "bị thương" đang bị buộc dây cũng thể hiện sự linh hoạt cực kỳ cao.
Toàn bộ video không cắt cảnh, không quay lại, cũng không có sự can thiệp của lệnh thủ công.
Ngay từ nhiệm vụ đầu tiên, robot đã thể hiện khía cạnh "tinh tế" vượt xa trí tưởng tượng của con người.
Một robot Unitree dùng cây gạt nước để lau kính. Ai từng dùng cây gạt nước đều biết, nếu lực nhẹ quá thì không sạch, mạnh quá thì phát ra tiếng kêu, đòi hỏi khả năng kiểm soát lực và cảm nhận không gian còn khó hơn dùng giẻ lau. Thế mà nó lại chọn ngay độ khó "địa ngục" này.
Chỉ thấy robot lau vài cái, có một chỗ không sạch, nó thực sự tự phán đoán: vết bẩn có thể nằm ở phía bên ngoài.
Thế là nó thực hiện một loạt động tác mà tôi chưa từng thấy: nghiêng người, ngả ra sau, thò đầu, vươn tay, đưa tay cầm cây gạt nước ra ngoài cửa sổ. (Vững như kiềng ba chân)
Một số mô hình Embodied AI hiện nay chỉ có thể đạt đến giới hạn là kiểm soát lực tốt, còn robot này, trên nền tảng kiểm soát mô-men xoắn chính xác, đã kết hợp hoàn hảo với khả năng cảm nhận môi trường không gian (vươn tay ra mà không va vào khung cửa) và giải toán động lực học.
Không chỉ đạt đỉnh cao ngành về năng lực đơn lẻ, mô hình còn thể hiện sự thống nhất "ba trong một".
Điều khiến tôi lâu không thể bình tâm hơn là khi không thể lau sạch, nó lập tức suy luận và ra quyết định vươn tay ra ngoài cửa sổ. Đây là lần đầu tiên tôi thấy một mô hình tự suy luận và tự tiến hóa giống như con người.
Điều này phản ánh đầy đủ việc mô hình đã hợp nhất thị giác, xúc giác, động lực học thành một cảm nhận thống nhất và có khả năng tự tiến hóa. Lần này, cuối cùng tôi cũng tin rằng robot thực sự có thể làm việc, hơn nữa, sẽ làm việc hoàn hảo hơn cả con người.
Sau khi lau kính xong, robot Unitree nhẹ nhàng đặt cây gạt nước về vị trí cũ, điểm đặt chính xác, động tác liền mạch.
Đừng xem thường động tác kết thúc này, nó có nghĩa là robot đã hoàn thành quy trình khép kín "lấy dụng cụ - thực hiện - cất giữ".
Robot Agibot bên cạnh đi đến gần máy giặt, lấy đệm ghế đã giặt sạch đặt lên ghế sofa, sau đó quay lại lấy tiếp búp bê đã giặt sạch, đặt chính xác vào tủ quần áo tầng hai, mỗi món đồ đều trở về đúng vị trí của nó.
Việc robot Agibot vô tình va vào kính càng chứng minh đây là quyết định tự chủ của robot, vì camera đôi khi không giải quyết được độ phản chiếu của kính, trong khi nếu người điều khiển từ xa thì có thể làm được (doge).

Hai cảnh này là hình ảnh thu nhỏ của những năng lực cơ bản nhất trong video 10 phút. Trong các nhiệm vụ dài hạn, mỗi nhiệm vụ đều được hoàn thành mượt mà, chính xác và dứt khoát, không hề bị tích lũy sai số hay làm tệ đi khi nhiệm vụ trở nên nhiều và dài hơn.
Điều này đã giải quyết được nhược điểm lớn nhất của các mô hình VLA truyền thống là sợ các chuỗi nhiệm vụ dài.
Chỉ xét riêng về biểu hiện động tác, mô hình chắc chắn đã sử dụng một kiến trúc hoàn toàn mới. Trong chuỗi nhiệm vụ siêu dài 10 phút, nó liên tục sửa lỗi, xuất kết quả ổn định, mỗi động tác đều chính xác và có thể kiểm soát, độ bền bỉ (robustness) xứng đáng đứng đầu ngành.
Tiếp theo, trong hình xuất hiện tiếng chuông báo thức. (Vặn to âm lượng nghe kỹ, không rõ lắm)
Ban đầu tôi không hiểu ý đồ của tiếng chuông, sau khi xem đi xem lại mới phát hiện, chuông báo thức là một loại nhắc nhở đã được thiết lập, nó làm gián đoạn nhiệm vụ hiện tại của hai robot để bắt đầu thực hiện nhiệm vụ đặc biệt là dọn dẹp mặt bàn và tủ lạnh.
Điều kỳ diệu là sau khi dọn dẹp xong mặt bàn và tủ lạnh, robot tiếp tục khôi phục thực hiện nhiệm vụ trước khi bị gián đoạn, điều này cho thấy mô hình có khả năng bị ngắt quãng bất cứ lúc nào, tiếp tục làm việc tại điểm dừng và khôi phục nhiệm vụ.
So với các bản demo trên thị trường chỉ có thể hoàn thành một nhiệm vụ và phải được chăm sóc kỹ lưỡng, đoạn video thô sơ này cho thấy khả năng siêu việt của robot trong môi trường làm việc thực tế: không chỉ bền bỉ mà còn có thể "làm hai việc cùng lúc".
Tiếp theo là cả một quy trình dài dọn dẹp nhà cửa: robot Unitree lấy túi đựng đồ đặt lên bàn, robot Agibot nhìn thấy thực phẩm trên tủ lạnh, phán đoán cần phải bảo quản lạnh nên thực hiện ngay lập tức, đồng thời tiện tay lấy ra thực phẩm cần rã đông (tôi đoán đội ngũ bí ẩn này có thể đang ám chỉ rằng robot sắp có thể nấu được bữa cơm bốn món một canh rồi).
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.