Mô hình
Đội ngũ AI hiện thân bí ẩn tung loạt demo gây sốc: Lộ diện lộ trình công nghệ mô hình tự tiến hóa
(giờ Việt Nam)
Tóm tắt AI
Nhóm nghiên cứu về AI hiện thân (Embodied AI) vừa công bố loạt video demo ấn tượng, hé lộ hướng đi đột phá trong việc phát triển các mô hình có khả năng tự tiến hóa và thích nghi với môi trường thực tế.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
03-09-2026 09:31:45 Nguồn: QbitAI
Noah, đưa tin từ Aofeisi
QbitAI | Kênh chính thức QbitAI
Bạn còn nhớ đoạn video 10 phút quay liền mạch (one-take) đầy bí ẩn đang lan truyền trong giới robot hình người (embodied AI) tuần trước không?
Ngay khi video xuất hiện, cư dân mạng đã thốt lên: Không thể tin nổi, cứ như thể thứ gì đó đến từ ngoài hành tinh vậy…
Thậm chí họ còn dành cho nó đánh giá cao nhất: Đây là do AI tạo ra phải không?!
Những người trong ngành đổ xô đi tìm hiểu xem đây là sản phẩm của bên nào, nghe nói có những công ty hàng đầu đã phải mở cuộc họp khẩn để nghiên cứu… Hộp thư của chúng tôi cũng bị cư dân mạng "oanh tạc" vì tò mò.
Sau khi xem xong đoạn video 10 phút quay liền mạch này, mọi người đều nói rằng khoảnh khắc "ChatGPT" của lĩnh vực robot hình người có lẽ đã thực sự đến. Có người gọi đây là cột mốc quan trọng của robot hình người, cũng có người cho rằng đây là một kiến trúc đột phá. Bởi vì nó cho thấy:
Tất nhiên, vì robot thể hiện quá mức "khoa học viễn tưởng", một số người hoài nghi vẫn đặt câu hỏi: Liệu đây có phải là điều khiển từ xa (teleoperation) không? (Mặc dù nhóm phát triển nói rằng trong không gian nhỏ hẹp như vậy, họ thực sự không biết làm sao để điều khiển từ xa).
Và cách nhóm bí ẩn này phản hồi lại những nghi ngờ cũng rất đặc biệt: Họ tung ra thêm vài bản demo khác, vẫn thô sơ, vẫn quay liền mạch, như muốn nói rằng:
"Trí tuệ, dù bạn có tin hay không, nó thực sự sắp đến rồi."

Nhờ bài viết đầu tiên, chúng tôi đã liên hệ được với nhóm phát triển mô hình bí ẩn này và bày tỏ thắc mắc – tại sao không trực tiếp đứng ra nhận? Câu trả lời nhận được là: Mô hình cũng giống như con người, hãy để chính nó lên tiếng.
Chúng tôi được biết, mật danh nội bộ của mô hình bí ẩn này là "MVP", viết tắt của: Khả năng của mô hình giống như người thật (Make Veritable People). Họ nói rằng có thể dịch nôm na là: "Hãy làm người đi" (doge).
Mô hình lớn "Hãy làm người đi".
Và qua những bản Demo được tung ra lần này, từ màn thể hiện có thể thấy, robot "thực sự đã làm người". Nó suy nghĩ như con người, tự đưa ra quyết định, cử động mượt mà và logic tự nhất quán. Hơn nữa, nghe nhóm phát triển nói, họ sắp cho robot tự ra đường, trong môi trường mở, để mọi người trực tiếp kiểm chứng.
Video 1: Phối hợp tay mắt nhịp nhàng, hiểu biết sâu sắc về động lực học
http://www.qbitai.com/wp-content/uploads/2026/09/20260902-135110.mp4
Nếu bạn đang cầm một cốc nước, có người chọc vào cánh tay bạn, liệu bạn có thể phản ứng tức thì để nước không bị đổ không?
Robot tay trái cầm một chiếc cốc chứa nước, dưới sự xô đẩy (thô lỗ) bằng gậy của con người, nó né sang một bên rồi bình tĩnh trở về vị trí cũ, nước trong cốc không đổ dù chỉ một giọt.
Nếu bạn đang cầm một cốc nước, có người chọc vào cánh tay bạn, đồng thời đẩy đổ lon nước ngọt bên cạnh, liệu bạn có thể phản ứng tức thì để nước không đổ và đảm bảo lon nước ngọt không rơi không?
Con người tiếp tục đẩy ba lon nước ngọt trên bàn từ phía bên phải, cánh tay phải của nó bất ngờ đỡ lấy các lon nước cùng lúc.
Robot thể hiện như một bậc thầy Thái Cực Quyền, vừa biết cách hóa giải lực, triệt tiêu những cú va chạm của đối thủ một cách vô hình, lại vừa biết chừng mực, điều tiết lực đạo vừa vặn.
Hơn nữa, nhìn kỹ mà xem, khi các lon nước bị đẩy, cánh tay trái đang cầm nước vẫn chưa kịp hồi phục, robot đã dùng tay phải đỡ lấy các lon nước.
Cảnh tượng này, đừng nói là robot, thực tế đã vượt xa nhiều người rồi, mọi người có thể thử xem liệu mình có thể dùng hai tay hoàn thành đồng thời hai nhiệm vụ này không. (doge)
Các mô hình VLA và WAM phổ biến hiện nay có một nhược điểm: một khi đối mặt với các tác vụ cần suy luận vật lý như vật cản, tiếp xúc, biến dạng... thì dễ bị lỗi. Bởi vì chúng chỉ đang bắt chước hình dáng của hành động chứ không hiểu các quy luật vật lý đằng sau.
Còn mô hình "Hãy làm người đi" dường như đã trang bị cho robot một "bộ não vật lý". Chính sự thống nhất giữa dự đoán động lực học và trạng thái dài hạn mới giúp quỹ đạo chuyển động tự nhiên đáp ứng được tính khả thi về mặt động lực học.
Nhìn từ tốc độ phản ứng và độ mượt mà của hành động, các cử động của robot không còn là "đoán" dựa trên việc học thuộc lòng dữ liệu, mà là "học" dựa trên sự hiểu biết về các quy luật vật lý, giống như con người.
Có lẽ đó là sự khác biệt giữa "bắt chước máy móc" và "thấu hiểu bản chất".
Video 2: Sự hiểu biết về không gian, thuộc tính vật thể và tổng kết thói quen con người
Trong video thứ hai, robot hình người chính thức tiếp quản việc nhà. Và nhóm phát triển mô hình "Hãy làm người đi" cho biết đây là video quay cảnh robot hoàn thành nhiệm vụ này theo phương thức zero-shot. (Nếu là thật, thì khả năng tổng quát hóa này quá vô đối!)
Họ cho biết, tỷ lệ thành công zero-shot của mô hình đã đạt 80%.
Tôi đặt tên cho video này là "Robot mắc bệnh sạch sẽ: Phòng khách không được bừa bộn" (doge).
Chỉ thấy robot đặt con búp bê nhỏ trên tay về lại kệ để đồ ở lối vào, đúng kiểu "của nơi nào trả về nơi đó". Tiếp theo, nó kéo giỏ đựng đồ lộn xộn về phía mình, hơi ngồi xổm xuống, lần lượt lấy ra chiếc mũ màu đen và vòng tập thể dục màu tím, treo chúng lên giá treo quần áo một cách vững chãi.
Cuối cùng, nó lấy từ trong giỏ ra một chiếc đệm hoa lớn, rõ ràng là nó có thể cúi người, nhưng lần này, nó chọn cách ném nhẹ, chiếc đệm rơi trúng vào ghế sofa.
Xuyên suốt cả quá trình, dù hành động của robot chưa hẳn là nhanh thoăn thoắt, nhưng lại mang đến cảm giác mọi thứ đều nằm trong tầm kiểm soát.
Sự hiểu biết của robot về không gian và thuộc tính vật thể đã rất giống con người: nó biết vật thể có thể kéo lê trên sàn trơn, mũ và vòng tập thể dục dạng hình tròn có thể treo được, còn chiếc đệm phẳng sẽ tự trải ra.
Thậm chí nó còn biết "lười biếng", cái gì có thể ném được thì tuyệt đối không tốn công cúi người. (Đúng là người lười thúc đẩy khoa học phát triển, robot lười thúc đẩy trí tuệ tiến hóa mà.)
Các mô hình phổ biến hiện nay tạm thời chưa đạt được khả năng tổng quát hóa giống như con người. VLA dựa vào "sức mạnh tính toán" để ép kết quả, hễ gặp cảnh lạ là dễ sụp đổ; còn WAM thì giống như lắp ghép Lego, học quá cứng nhắc, chỉ cần thay đổi một chút là không còn linh hoạt nữa.





Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.