Mô hình
WRC 2026: Shengshu Technology công bố lộ trình 5 cấp độ phát triển mô hình thế giới tổng quát
(giờ Việt Nam)
Tóm tắt AI
Tại Hội nghị Robot Thế giới 2026, Shengshu Technology đã giới thiệu lộ trình phát triển đột phá cho mô hình thế giới tổng quát (General World Model), định hình các giai đoạn tiến hóa từ nhận thức cơ bản đến khả năng suy luận và tương tác phức tạp.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
25/08/2026 09:46:56 Nguồn: QbitAI
Chiều ngày 19 tháng 8, diễn đàn nhánh thuộc Hội nghị Robot Thế giới với chủ đề “Hành trình tiến hóa của mô hình lớn trí tuệ hiện thân: Từ phân cấp kỹ thuật đến ứng dụng công nghiệp” đã được tổ chức tại Trung tâm Triển lãm Quốc tế Yichuang Bắc Kinh. Nhà sáng lập kiêm Giám đốc khoa học của Shengshu Technology, đồng thời là ACM/IEEE/AAAI Fellow, ông Chu Quân đã có bài phát biểu quan trọng, công bố những thành tựu nghiên cứu mới nhất của đội ngũ và trình bày một cách hệ thống lộ trình phát triển năm cấp độ của mô hình thế giới tổng quát.
Ông Chu Quân cho biết: “Dưới góc nhìn phát triển của các mô hình lớn, điều chúng tôi muốn xây dựng không chỉ là một mô hình chuyên dụng phục vụ cho một nhiệm vụ hay kịch bản cụ thể, mà là một mô hình nền tảng tổng quát có khả năng hiểu thế giới, dự đoán tương lai và thực hiện hành động.”

Xuất phát từ nguyên lý cơ bản (first principles) để định nghĩa mô hình thế giới tổng quát
Mô hình thế giới đã mở rộng sang các lĩnh vực như tạo video, mô phỏng môi trường, ra quyết định cho robot và điều khiển hành động, nhưng ngành công nghiệp vẫn thiếu sự đồng thuận về việc “như thế nào mới được gọi là một mô hình thế giới tổng quát”.
Khi con người học đi xe đạp hoặc lái xe, họ dần chuyển từ trạng thái không phối hợp ban đầu sang ổn định và chính xác. Lý do quan trọng là trong quá trình tương tác liên tục với thế giới bên ngoài, não bộ đã hình thành một “mô hình nội tại” về cách thế giới vận hành.
Mô hình thế giới tổng quát cũng cần ba năng lực liên kết chặt chẽ với nhau:
“Mô hình thế giới tổng quát không phải là một bộ tạo, bộ mô phỏng, mô hình hành động robot hay mô hình chiến lược đơn lẻ, cũng không phải là các mảnh ghép rời rạc hay sự kết nối tuyến tính đơn giản của những năng lực này, mà là một hệ thống phản hồi khép kín nơi ba năng lực được kết hợp với nhau,” ông Chu Quân nhấn mạnh. Hành động không chỉ là đầu ra của mô hình mà còn làm thay đổi môi trường, tạo ra thông tin mới và bước vào vòng lặp tiếp theo của việc hiểu, dự đoán và ra quyết định.

Dữ liệu, kiến trúc và sức mạnh tính toán: Ba yếu tố cốt lõi để xây dựng mô hình thế giới tổng quát
Để xây dựng mô hình thế giới tổng quát, vẫn không thể tách rời ba yếu tố cơ bản của mô hình lớn: dữ liệu, kiến trúc và sức mạnh tính toán.
Về dữ liệu, mô hình thế giới tổng quát cần một kim tự tháp dữ liệu đa tầng, đi từ quan sát dần tiến tới hành động: bắt đầu từ lượng lớn video trên mạng, dần mở rộng sang video trong các lĩnh vực cụ thể, video góc nhìn thứ nhất của con người, các bản ghi thao tác của con người và dữ liệu tương tác thực tế của robot.
Càng gần tầng dưới, quy mô dữ liệu càng lớn và độ bao phủ càng rộng; càng gần tầng trên, dữ liệu tuy khan hiếm và chi phí cao hơn nhưng lại có thể thiết lập trực tiếp mối liên hệ giữa nhiệm vụ, hành động và kết quả vật lý. Dữ liệu tổng hợp có thể xuyên suốt mọi tầng của kim tự tháp. Đồng thời, “dữ liệu không hoàn hảo” cũng có giá trị quan trọng: những lần thử nghiệm thất bại, các hành động sửa lỗi và quá trình phục hồi đều chứa đựng các tín hiệu học tập hiệu quả, giúp robot học cách phục hồi sau thất bại.

Ở cấp độ kiến trúc, mô hình thế giới tổng quát cần xử lý thống nhất các thông tin đa phương thức như hình ảnh, video, ngôn ngữ và hành động của robot. MoT (Mixture-of-Transformers) thông qua việc cấu hình các tham số chuyên biệt cho từng phương thức và thực hiện tương tác thông tin đa phương thức bằng cơ chế chú ý (attention) chia sẻ, giúp việc hiểu môi trường, dự đoán trạng thái thế giới và tạo hành động có thể được phối hợp hoàn thành trong cùng một mô hình. Motubrain – mô hình hành động thế giới của Shengshu Technology – chính là dựa trên kiến trúc này, mô hình hóa thống nhất việc hiểu, dự đoán và hành động, phá vỡ sự chia cắt năng lực của các giải pháp phân tách mô-đun truyền thống, đồng thời nâng cao hiệu suất sử dụng dữ liệu không đồng nhất và khả năng chuyển đổi giữa các nhiệm vụ.
Sức mạnh tính toán ảnh hưởng đồng thời đến quá trình tiền huấn luyện quy mô lớn và triển khai thời gian thực. Việc tạo video ngoại tuyến có thể chấp nhận độ trễ nhất định, nhưng tương tác thời gian thực và điều khiển robot phải hoàn thành việc dự đoán và ra quyết định trước khi môi trường thay đổi. Do đó, cơ sở hạ tầng huấn luyện, tăng tốc suy luận, chưng cất mô hình và cơ chế chú ý hiệu quả đều là những hỗ trợ quan trọng để mô hình thế giới tổng quát đi vào ứng dụng thực tế.
Mô hình thế giới tổng quát tiến hóa như thế nào? Lộ trình năm cấp độ xác định hướng đi nâng cấp
Xuất phát từ mục tiêu của mô hình nền tảng tổng quát, mô hình thế giới tổng quát có thể được chia thành năm cấp độ tiến hóa dần dần. Đây không phải là các hướng sản phẩm tách biệt, mà là quá trình tự chủ của mô hình liên tục được nâng cao khi sự hiểu biết về thế giới ngày càng sâu sắc và tương tác với thế giới ngày càng mạnh mẽ. Trong vài năm qua, thực tiễn nghiên cứu và triển khai của Shengshu Technology đã bao phủ ba cấp độ đầu tiên.

L1: Tạo thế giới (World Generation)
Bước đầu tiên là để mô hình học cách tạo ra quá trình tiến hóa của thế giới một cách nhất quán. Video chính là vật mang điển hình nhất ở giai đoạn này, nó giúp mô hình học về đối tượng, chuyển động, quan hệ không gian và thay đổi theo thời gian, đặt nền tảng cho việc hiểu và dự đoán thế giới sâu hơn.
Năm 2024, Shengshu Technology ra mắt mô hình lớn tạo video Vidu, thông qua việc liên tục cải thiện chất lượng video, tính nhất quán theo thời gian và khả năng mô hình hóa động lực học thế giới, đã hoàn thành bước thực nghiệm đầu tiên của giai đoạn L1.
L2: Tương tác với thế giới (Interactive World)
Trên nền tảng năng lực tạo, mô hình bắt đầu tiếp nhận đầu vào thời gian thực và liên tục thay đổi nội dung tiếp theo dựa trên ngôn ngữ, giọng nói hoặc tín hiệu điều khiển, chuyển từ “tạo một lần” sang “tương tác liên tục”.
Vidu S1 ra mắt vào tháng 7 năm 2026 đã thúc đẩy năng lực này lên giai đoạn tương tác thời gian thực. Người dùng có thể can thiệp vào quá trình tạo thông qua giọng nói theo thời gian thực, liên tục ảnh hưởng đến nội dung diễn ra tiếp theo, cho phép mô hình tiến hóa thế giới một cách linh hoạt dựa trên đầu vào bên ngoài.
L3: Hành động trong thế giới (Actionable World)
Tiến thêm một bước nữa, mô hình bắt đầu từ thế giới kỹ thuật số bước vào thế giới vật lý. Lúc này, việc hiểu môi trường, dự đoán tương lai và tạo hành động cần được thống nhất thực sự, giúp mô hình không chỉ phán đoán điều gì đang xảy ra trong thế giới mà còn trực tiếp tạo ra các hành động mà robot có thể thực hiện, đồng thời liên tục điều chỉnh dựa trên phản hồi thực tế.
Motus và Motubrain đánh dấu bước tiến của Shengshu Technology từ tạo video sang hành động vật lý. Motus được phát hành và mở mã nguồn hoàn toàn vào tháng 12 năm 2025; Motubrain ra mắt vào tháng 4 năm 2026 đã thống nhất việc hiểu môi trường, dự đoán trạng thái thế giới và tạo quỹ đạo hành động vào cùng một mô hình, thúc đẩy mô hình thế giới tổng quát từ “suy diễn thị giác” tiến tới “ra quyết định vật lý”.
So với Motus, tốc độ suy luận của Motubrain tăng khoảng 10 lần, khi thích ứng với thân máy robot mới, chỉ cần 50 đến 100 mẫu dữ liệu thao tác của con người. Trong bài kiểm tra chuẩn RoboTwin 2.0, kết quả đạt 96,1 điểm, đứng đầu bảng xếp hạng. Hiện tại, Motubrain đã được xác thực trên gần mười loại thân máy bao gồm Galaxy General, Stardust Intelligence, Qianxun Intelligence, v.v., thể hiện khả năng tổng quát hóa trong các nhiệm vụ dài hạn, kịch bản đa nhiệm và các hình thái robot khác nhau.
L4: Tác nhân thế giới tự chủ (Autonomous World Agent)
Sau khi có năng lực hành động thực tế, mô hình cần tiến xa hơn tới việc tự ra quyết định, có khả năng chủ động nhận thức môi trường xung quanh các mục tiêu dài hạn, phân tách nhiệm vụ, khám phá các trạng thái chưa biết và lập kế hoạch hành động liên tục.
L5: Người điều phối thế giới (World Orchestrator)
Ở cấp độ cao hơn, mô hình không chỉ điều khiển một tác nhân đơn lẻ mà có khả năng điều phối robot, tác nhân kỹ thuật số, con người, công cụ và các nguồn lực khác để hoàn thành việc phân bổ nhiệm vụ phức tạp và cộng tác đa tác nhân.
Từ L1 đến L5, năng lực tiến triển theo từng tầng. Nếu không có sự học hỏi và dự đoán về quy luật tiến hóa của thế giới, sẽ khó hình thành sự tương tác ổn định, liên tục; nếu không có phản hồi môi trường từ hành động thực tế, cũng khó phát triển thêm các năng lực tự học, lập kế hoạch dài hạn và phối hợp phức tạp.
Hướng tới L4, L5, cần vượt qua sáu thách thức then chốt
Hiện tại, từ L1 đến L3 đã hình thành các thực tiễn kỹ thuật tương đối cụ thể, nhưng vẫn còn khoảng cách so với trí tuệ thế giới cấp cao hơn. Các mô hình video vẫn cần liên tục cải thiện chất lượng tạo, khả năng kiểm soát và tính nhất quán không gian - thời gian; trong khi đó, các mô hình hành động thế giới cần nâng cao hơn nữa tính ổn định, khả năng tổng quát hóa và hiệu suất thực thi trong các môi trường thực tế phức tạp và mở hơn.
Để tiếp tục tiến tới L4 và L5, cần phải vượt qua sáu thách thức then chốt:
Xoay quanh hướng đi này, Shengshu Technology sẽ tiếp tục củng cố ba cấp độ: tạo thế giới, tương tác với thế giới và hành động trong thế giới, đồng thời bổ sung các năng lực như hình thành mục tiêu, chủ động khám phá, học tập liên tục và trí nhớ dài hạn, đặt nền móng cho các tác nhân thế giới tự chủ cấp cao hơn. Mục tiêu dài hạn hơn là xây dựng một nền tảng tổng quát có khả năng liên tục hiểu thế giới, dự đoán hậu quả của các hành động khác nhau, tự chủ hành động trong các ràng buộc rõ ràng và không ngừng học hỏi, tiến hóa từ những phản hồi thực tế.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.