QbitAI
92

Mô hình

Khám phá RSI: Mô hình thế giới mới từ Shengshu giúp robot tự tiến hóa

(giờ Việt Nam)

Tóm tắt AI

Mô hình thế giới RSI tích hợp xúc giác, bộ nhớ và dữ liệu bản ngã, mở ra khả năng tự tiến hóa đột phá cho robot.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

12/09/2026 16:15:31 Nguồn: QbitAI

Xúc giác, trí nhớ, dữ liệu Ego, tự tiến hóa... mô hình thế giới này có tất cả

Lin Fangzhou, đưa tin từ Aofeisi

QbitAI | Kênh chính thức QbitAI

Khi robot học cách vặn bóng đèn, nếu vặn lệch, ai sẽ chỉ cho nó biết vấn đề nằm ở đâu và lần sau cần sửa như thế nào?

Đây chính là lý do khiến khả năng "tự tiến hóa" của robot trở nên đáng mong đợi: Con người không thể làm mẫu cho nó trong mọi tình huống. Để robot làm việc ngày càng tốt hơn, nó cần có cách đánh giá kết quả hành động và tiếp tục học hỏi từ những phản hồi đó.

Motus2, sản phẩm mới nhất vừa được VAST (Shengshu Technology) công bố, đã thực hiện một bước thử nghiệm ấn tượng trong lĩnh vực này, tiến sâu vào vùng nước sâu của nghiên cứu trí tuệ hiện thân (Embodied AI) hiện nay.

Ngoài "tự tiến hóa", nó còn mang ý nghĩa của một sự tổng hợp: xúc giác, thao tác khéo léo, dữ liệu Ego... hầu hết các từ khóa nóng hổi trong giới trí tuệ hiện thân hiện nay đều có thể tìm thấy sự tương ứng trong mô hình thế giới này.

Vào tháng 2 năm nay, khi thế hệ tiền nhiệm Motus ra mắt, khái niệm mô hình hành động thế giới thậm chí còn chưa hoàn thiện, nhưng Motus đã đạt tỷ lệ thành công tuyệt đối cao hơn Pi-0.5 hơn 35% trong 50 bài kiểm tra tác vụ phổ quát.

Trên nền tảng mô hình thế hệ trước, Motus2 mở rộng thêm các phương thức như thị giác, ngôn ngữ, hành động và xúc giác, đồng thời thắp sáng ba "cây kỹ năng" trong cùng một mô hình: hành động, dự đoán và đánh giá.

Nó vừa có thể bắt tay vào làm việc, vừa có thể "hình dung trước" điều gì sẽ xảy ra sau hành động, lại vừa có thể tự chấm điểm cho bản thân sau khi hoàn thành. Ba khả năng này kết nối liền mạch, tạo thành một vòng lặp khép kín.

Cuối cùng, mô hình thế giới đã hiện thực hóa khả năng tự tiến hóa.

Mô hình hiện thực hóa vòng lặp tự tiến hóa và lặp lại

Tôi sẽ dùng ba từ khóa để giúp bạn nhanh chóng hiểu về Motus2.

Từ khóa đầu tiên là: Tự tiến hóa, đây là thay đổi cốt lõi nhất của Motus2 so với thế hệ trước.

Các mô hình chiến lược robot truyền thống học theo cách: Nhìn thấy trạng thái này, bước tiếp theo nên làm gì.

Đây cũng là mô hình chủ đạo của ngành hiện nay, nơi các mô hình chỉ ghi nhớ mối liên hệ thống kê "thấy A thì làm B", mà không hiểu tại sao B lại dẫn đến kết quả C mong đợi. Một khi môi trường thay đổi, chiến lược thiếu nhận thức nhân quả này sẽ nhanh chóng thất bại.

Trong khi đó, Motus2 đặt ba khả năng vào cùng một mô hình:

Quan trọng hơn, ba khả năng hành động, dự đoán và đánh giá không còn độc lập với nhau mà bắt đầu tạo thành một vòng lặp khép kín:

Tạo hành động → Dự đoán hậu quả → Đánh giá kết quả → Cập nhật chiến lược

Kết quả do chính mô hình dự đoán và đánh giá trở thành phản hồi để cải thiện chiến lược của bản thân; chiến lược sau khi cải thiện lại bước vào vòng lặp tiếp theo. Đây cũng là bước khám phá sơ khởi của Motus2 về Tự cải thiện đệ quy (Recursive Self-Improvement - RSI).

Cần làm rõ rằng, "tự tiến hóa" ở đây đề cập đến việc sử dụng các phản hồi dự đoán và giá trị của chính mô hình để liên tục cải thiện chiến lược, không có nghĩa là robot đã có thể tự học vô hạn trong môi trường mở.

Điều này được thực hiện như thế nào?

Muốn một mô hình vừa có thể "bắt tay vào việc" vừa biết "dự đoán tương lai", trước hết phải giải quyết một vấn đề cốt lõi: Tuyệt đối không được để nó "nhìn trộm" kết quả sau khi thực hiện hành động trước khi nó thực hiện hành động đó.

Đây là hành vi gian lận về mặt thời gian, một khi xảy ra, dù mô hình có vẻ thông minh trên tập dữ liệu huấn luyện, nó sẽ lộ tẩy ngay lập tức khi chuyển sang bối cảnh thực tế. Đây cũng là lý do khiến nhiều phương án huấn luyện "tạo video + điều khiển hành động" trước đây thất bại – mô hình đã học cách dùng các khung hình thị giác tương lai để "suy ngược" lại hành động hiện tại, thay vì thực sự học cách ra quyết định.

Do đó, Motus2 bắt đầu áp dụng luồng thông tin Action-first (Ưu tiên hành động) từ giai đoạn huấn luyện trung gian trong lĩnh vực robot.

Điều này tương đương với việc thiết lập trình tự cho mô hình: Trước tiên tạo hành động dựa trên quan sát hiện tại, sau đó dự đoán kết quả do hành động mang lại, cuối cùng đánh giá tốt xấu của kết quả đó.

Khi mô hình đã xác định rõ mối quan hệ trước sau của luồng thông tin, bước tiếp theo là biến kết quả dự đoán thành tín hiệu ra quyết định và học tập. Motus2 thực hiện điều này từ giai đoạn suy luận và giai đoạn huấn luyện.

Ở giai đoạn suy luận, Motus2 sử dụng phương pháp gọi là lập kế hoạch Best-of-N: Mô hình suy nghĩ trước một vài hành động ứng viên, hình dung hình ảnh sau khi thực hiện, sau đó để mô hình giá trị chấm điểm và chọn ra hành động có điểm cao nhất để thực hiện. Sau khi thực hiện một đoạn ngắn, robot quan sát lại thế giới thực và bắt đầu vòng tiếp theo.

Điều này tương đương với việc cho robot một cơ hội so sánh các phương án để tối ưu hóa việc lựa chọn hành động hiện tại.

Cách làm này không mới trong các thuật toán học tăng cường và lập kế hoạch, các phương pháp RL dựa trên mô hình (model-based RL) như Dreamer đã sớm kiểm chứng tư duy "mô phỏng trong não trước, sau đó chọn hành động tối ưu"; điểm mới của Motus2 nằm ở việc đưa logic này vào một mô hình lớn video-hành động vốn chỉ dùng để tạo hành động, thay vì huấn luyện riêng một trình mô phỏng nhẹ.

Ở giai đoạn huấn luyện, điểm số của các hành động ứng viên sẽ được chuyển đổi thành tín hiệu cập nhật chiến lược, các phương án có điểm cao nhận được sự hướng dẫn tích cực mạnh mẽ hơn, các phương án điểm thấp dần dần bị mô hình loại bỏ. Nhóm nghiên cứu gọi đây là "Học tăng cường dựa trên mô hình (MBRL)".

Giai đoạn này chỉ cập nhật các tham số liên quan đến hành động, phần dự đoán và đánh giá được giữ nguyên để tránh việc tín hiệu phản hồi làm chệch hướng mô hình đã học được.

Ví dụ, lập kế hoạch khi suy luận giống như việc nghĩ ra nhiều cách giải khi làm bài tập để cố gắng làm đúng câu hỏi trước mắt; còn cập nhật chiến lược khi huấn luyện giống như việc nắm vững phương pháp giải tốt hơn thông qua luyện tập, giúp lần sau dễ làm đúng hơn. Cả hai đều cải thiện hiệu suất, nhưng cái sau mới thực sự thay đổi những gì mô hình đã học được.

Cơ chế này cũng thay đổi định nghĩa về giá trị dữ liệu trong lĩnh vực hiện thân, dữ liệu thất bại cũng có công dụng khác với các ví dụ thành công.

Trước đây, ngành công nghiệp phụ thuộc rất nhiều vào "quỹ đạo hoàn hảo", các quỹ đạo thất bại hầu hết bị lọc bỏ như nhiễu; nhưng trong vòng lặp của Motus2, quỹ đạo thành công cho robot biết "cách giải tích cực", trong khi quỹ đạo thất bại được dùng để học hậu quả hành động và đánh giá kết quả, giúp mô hình nhận diện được những hành động nào không thúc đẩy được tác vụ.

RobotMô hình thế giớiShengshuTự tiến hóaAI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.