Mô hình
Moqi trình làng tại WRC: Cuộc cách mạng 'bộ não hiện thân' đằng sau các nhiệm vụ robot đường dài
(giờ Việt Nam)
Tóm tắt AI
Moqi Intelligence lần đầu ra mắt hệ thống kiến trúc mô hình trí tuệ hiện thân MoRA tại Trung Quốc, đánh dấu bước tiến mới trong khả năng thực thi nhiệm vụ thực tế của robot.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
20:37:34, 20/08/2026 Nguồn: QbitAI
MORPHI lần đầu tiên ra mắt hệ thống tại thị trường nội địa, công khai trình diễn kiến trúc mô hình trí tuệ hiện thân (embodied AI) mới nhất mang tên MoRA.
Từ ngày 19 đến 23 tháng 8, Hội nghị Robot Thế giới (WRC 2026) đã diễn ra tại Trung tâm Triển lãm Quốc tế Bắc Nhân Diệc Sáng, Bắc Kinh. Chỉ sau nửa năm thành lập, doanh nghiệp trí tuệ hiện thân MORPHI đã có màn ra mắt hệ thống đầu tiên tại thị trường nội địa, công khai trình diễn kiến trúc mô hình trí tuệ hiện thân mới nhất MoRA, đồng thời chính thức giới thiệu robot bánh xe MORPHI KINO, được thiết kế để thích ứng với các nhiệm vụ dài hạn trong gia đình. Từ "bộ não hiện thân" đến phần cứng, MORPHI phát triển song song cả hai hướng, thúc đẩy robot đa năng vượt qua giới hạn từ "trình diễn hành động đơn lẻ" sang "thực thi nhiệm vụ liên tục", mở ra nhiều khả năng hơn cho trí tuệ hiện thân từ các bản Demo bước ra thế giới thực.

"Thực chiến nhiệm vụ dài hạn" của một robot làm việc nhà hoàn toàn tự chủ.
Tại Hội nghị Robot Thế giới năm nay, robot đa năng của MORPHI đã có màn ra mắt công chúng lần đầu tiên. Robot bánh xe MORPHI KINO hoạt động tích cực tại các khu vực trình diễn Demo, hoàn thành nhiều thao tác tại chỗ như giao hộp mù, tương tác chụp ảnh, dọn dẹp nhà cửa, nhặt và đặt đồ vật.
Trong đó, điểm thu hút khán giả dừng chân tham quan nhất chính là màn trình diễn nhiệm vụ gia đình dài hạn kéo dài 15 phút, xuyên khu vực và đa bước do robot bánh xe MORPHI KINO tự chủ thực hiện. Trong môi trường gia đình mô phỏng, robot kết nối chuỗi các công việc nhà hàng ngày như dọn dẹp phòng khách, sắp xếp bàn trà, bổ sung đồ uống vào tủ lạnh, giặt sấy và gấp quần áo. Màn trình diễn đã thể hiện đầy đủ năng lực kỹ thuật của robot trong việc nhận diện môi trường, hiểu đồ vật, lập kế hoạch nhiệm vụ dài hạn, thực thi liên tục và thao tác phức tạp bằng hai tay, đồng thời kiểm chứng khả năng thích ứng của robot với không gian hẹp và bố cục nhà ở thực tế.
Tại gian hàng của MORPHI, robot tự lập kế hoạch lộ trình di chuyển đến cạnh bàn trà, nhận diện chính xác các loại rác như khăn giấy vo tròn và chai nước khoáng, sau đó nhặt và bỏ vào thùng rác; tiếp đó thu dọn các vật dụng lộn xộn trên bàn trà vào khay để hoàn tất công việc dọn dẹp cơ bản phòng khách. Theo các kỹ thuật viên tại hiện trường, đằng sau việc dọn dẹp mặt bàn tưởng chừng đơn giản là sự thử thách tổng hợp của nhiều công nghệ như nhận diện thị giác, lập kế hoạch tư thế và kiểm soát lực nắm: đối mặt với không gian mặt bàn lộn xộn, robot cần định vị chính xác mục tiêu, dùng lực phù hợp để nắm bắt, sau đó đặt vào đúng vị trí, mỗi bước đều không thể thiếu sự điều phối chính xác của thuật toán.

Hình: Robot bánh xe MORPHI KINO dọn dẹp mặt bàn.
Sau khi dọn dẹp phòng khách xong, robot di chuyển đến trước tủ lạnh để kiểm tra kho đồ uống; sau khi phát hiện thiếu hụt, nó di chuyển đến bàn trong nhà lấy nước khoáng, hoàn thành việc bổ sung vào tủ lạnh rồi đóng cửa tủ. Đối với robot, việc mở cửa không hề dễ dàng: vị trí tay nắm, góc mở cửa và lực thao tác đều cần dựa vào cảm biến thị giác và cảm biến lực để nhận diện theo thời gian thực, đồng thời điều chỉnh linh hoạt độ cao thân máy và tư thế tay để tìm điểm thao tác tối ưu. Chính nhờ bộ năng lực này, robot có thể tự chủ hoàn thành quy trình tiếp tế vật tư hoàn chỉnh từ kiểm kê, lấy hàng, bổ sung đến đóng cửa, giúp chia sẻ hiệu quả gánh nặng việc nhà cho con người.

Hình: Robot bánh xe MORPHI KINO lấy nước bổ sung hàng.
Quy trình làm việc nhà tiếp tục, robot tiến đến khu vực giặt sấy. Nó mở máy sấy, lấy quần áo đã sấy khô cho vào giỏ sạch; ngay sau đó mở máy giặt, lấy quần áo ướt ra rồi đóng cửa máy giặt; tiếp tục cho quần áo ướt vào máy sấy, đóng cửa, nhấn nút nguồn và nút khởi động để bắt đầu chương trình sấy; cuối cùng quay lại bàn gấp, hoàn thành việc sắp xếp, gấp và xếp gọn quần áo đã sấy khô trong giỏ.

Hình: Robot bánh xe MORPHI KINO gấp quần áo.
Nhân viên tại hiện trường giới thiệu với khán giả rằng, chuỗi hành động lấy, đặt và gấp quần áo của robot mang tính đại diện rất cao: nó không còn giới hạn ở khả năng nắm và đặt đồ vật cơ bản, mà đòi hỏi robot phải nắm vững khả năng điều khiển các thiết bị gia dụng phức tạp – nhấn nút, nhận diện vị trí nút bấm, kiểm soát lực nhấn. Đây cũng là ngưỡng cửa cốt lõi mà robot phải vượt qua để thực sự bước vào môi trường gia đình.
Toàn bộ màn trình diễn thực chiến nhiệm vụ gia đình dài hạn kéo dài 15 phút đã thể hiện trực quan năng lực tổng hợp của robot bánh xe MORPHI KINO, đó là sự phối hợp nhịp nhàng giữa khung gầm di động, thân mình, hai cánh tay, cùng các đơn vị cảm biến thị giác và lực. Điểm sáng không nằm ở việc phô diễn một linh kiện hay kỹ thuật đơn lẻ, mà là trình bày robot như một hệ thống hiện thân hoàn chỉnh, không chỉ hiểu mục tiêu nhiệm vụ mà còn có thể liên tục thúc đẩy môi trường thực tế tiến tới trạng thái mục tiêu trong thời gian dài.
MoRA đưa mục tiêu, trí nhớ và tiến độ vào mô hình chiến lược.
Làm thế nào để biến robot từ một bản Demo ấn tượng thành một sản phẩm thực sự làm việc trong gia đình và nhà máy đã trở thành chủ đề được ngành công nghiệp trí tuệ hiện thân quan tâm rộng rãi. Đằng sau khả năng hành động bền bỉ của phần cứng là năng lực ra quyết định thông minh có thể tiến hóa của mô hình hiện thân.
Hiện nay, giải pháp kỹ thuật phổ biến trong lĩnh vực hiện thân là sử dụng kiến trúc hệ thống kép phân tầng: System 2 (mô hình ngôn ngữ lớn nhận thức cấp cao) + System 1 (mô hình chiến lược robot). Kiến trúc mô hình này giúp robot bước đầu có khả năng hoàn thành các nhiệm vụ dài hạn, nhưng cũng để lại những nút thắt về cấu trúc. Trong mô hình phân công hiện tại, trí tuệ chủ thể của nhiệm vụ – duy trì mục tiêu, quản lý trí nhớ, theo dõi tiến độ và phục hồi lỗi – gần như hoàn toàn nằm ở tầng nhận thức System 2; trong khi System 1, vốn tương tác trực tiếp với thế giới vật lý, lại bị xem nhiều hơn như một bộ thực thi hành động cho các nhiệm vụ con hiện tại.
Vấn đề nằm chính ở đây. Chỉ dựa vào việc tăng cường khả năng lập kế hoạch của System 2 không thể giải quyết triệt để vấn đề thực thi theo trình tự thời gian dài trong thế giới thực. Ở tầng System 1 tồn tại hai hạn chế chính: Thứ nhất, khả năng giao tiếp mục tiêu hạn chế, dẫn đến việc tuân thủ chỉ dẫn kém và thiếu tính khái quát hóa, không hỗ trợ chỉ dẫn bằng hình ảnh, khó xử lý các chỉ dẫn có cấu trúc đa giai đoạn. Thứ hai, việc thực thi chủ yếu dựa trên phản ứng ngắn hạn, mô hình thiếu trí nhớ thực thi đa mức độ và nhận thức về tiến độ nhiệm vụ.
Thế giới vật lý thực tế đầy rẫy sự bất định. Một robot thực sự có thể làm việc liên tục không thể cứ mỗi bước đi lại phải đợi "bộ não" ra lệnh.
Đối mặt với những nút thắt chung của ngành, cách đây không lâu, MORPHI đã công bố kiến trúc mô hình trí tuệ hiện thân tự phát triển MoRA (MORPHI Reasoning and Autonomy), và đề xuất một cách hệ thống lộ trình công nghệ mô hình hiện thân "Agentic-Native": để đạt được khả năng thực thi nhiệm vụ theo trình tự thời gian dài tốt hơn, các năng lực Agentic (tác nhân) phải tồn tại nguyên bản trong mô hình chiến lược.

Hình: Kiến trúc mô hình hiện thân MoRA của MORPHI.
System 1 được MORPHI tái cấu trúc gọi là mô hình hành động hiện thân Agentic-Native, sở hữu ba năng lực cốt lõi: Thứ nhất, Goal-Conditioned Execution (thực thi liên tục dựa trên mục tiêu), tức là mô hình tiếp nhận mục tiêu bằng văn bản hoặc hình ảnh và liên tục hành động xoay quanh mục tiêu trong suốt quá trình thực thi; Thứ hai, Multi-Granularity Memory (xây dựng trí nhớ đa tầng ngắn, trung và dài hạn theo sự phát triển công nghệ), tức là hỗ trợ thực thi dài hạn thông qua trí nhớ ngắn, trung và dài hạn; Thứ ba, Progress-Aware Closed Loop (vòng lặp có nhận thức tiến độ), tức là không chỉ xuất ra hành động mà còn xuất ra trạng thái nhiệm vụ, tiến độ và dự đoán tiếp theo. Trên cơ sở đó, MORPHI định nghĩa lại ranh giới và phương thức hợp tác của hệ thống kép.
System 2 là trung tâm nhận thức lấy thế giới vật lý làm ngữ cảnh nguyên bản, đảm nhận ba chức năng cốt lõi: hiểu ý định, kết hợp các ràng buộc vật lý để giải mã mục tiêu thực sự của người dùng; lập kế hoạch nhiệm vụ, phân tách ý định thành luồng nhiệm vụ có thể thực thi, điều phối System 1 thực hiện và giám sát liên tục trong quá trình thực thi; biểu đạt đa phương thức, giao tiếp phản hồi với người dùng thông qua giọng nói, hành động và biểu cảm.
System 1 là động cơ thực thi hiện thân Agentic-Native. Nó tiếp nhận đầu vào là mục tiêu nhiệm vụ có cấu trúc (Goal) được định nghĩa bằng văn bản và hình ảnh, liên tục xuất ra các hành động toàn thân; duy trì trí nhớ thực thi với các mức độ chi tiết khác nhau, tự chủ đánh giá tiến độ nhiệm vụ; khi gặp giới hạn năng lực hoặc trạng thái bất thường, chủ động gửi yêu cầu can thiệp tới System 2. Nó không phải là tay chân thụ động chờ lệnh, mà là một chủ thể thực thi có thể gánh vác mục tiêu và tự mình tiến về phía trước.
Mối quan hệ giữa hai bên có thể tóm tắt là: System 2 hiểu và tổ chức mục tiêu, còn System 1 gánh vác và thúc đẩy mục tiêu trong các hành động hiện thân liên tục. Nói ngắn gọn, bên trước quyết định phải hoàn thành cái gì, bên sau liên tục biến nó thành hiện thực.
Giá trị của sự phân công này nằm ở bước nhảy vọt kép về hiệu suất và tính bền vững. Các tương tác vật lý tần suất cao, điều chỉnh chi tiết, theo dõi tiến độ được giao cho System 1 xử lý nguyên bản, đảm bảo tính thời gian thực và liên tục; các công việc tần suất thấp như hiểu mục tiêu, lập kế hoạch tổng thể, xử lý bất thường được giao cho System 2, đảm bảo tính linh hoạt và thông minh. Mỗi bên làm tốt chức năng của mình, thay vì dồn hết trí tuệ lên tầng trên và để tầng dưới chỉ làm nhiệm vụ phản xạ.
Biến dữ liệu vận hành thực tế thành tín hiệu huấn luyện mô hình có thể mở rộng.
Và mô hình nguyên bản này có thể thành công chính là nhờ sự giao thoa của hai "đường ngầm" mà MORPHI đã bố trí từ lâu – dữ liệu thực tế chất lượng cao và hạ tầng (Infra) có khả năng tiêu hóa dữ liệu quy mô lớn.
Hoàng Thanh Cầu (Huang Qingqiu), đồng sáng lập kiêm CTO của MORPHI, cho rằng bản chất của mô hình thực chất là nén thông tin và chuyển đổi phương thức, giới hạn năng lực của mô hình phụ thuộc vào số lượng tham số. Hiện nay, những cải tiến về kiến trúc mô hình của các công ty hiện thân chủ yếu tập trung vào việc nâng cao hiệu suất hấp thụ dữ liệu, thực tế ảnh hưởng tương đối thấp đến giới hạn năng lực của mô hình. Trong khi đó, hiệu suất có thể được bù đắp bằng nhiều dữ liệu hơn và thời gian huấn luyện dài hơn. Trong thời điểm mọi người đều hô hào dữ liệu "10 triệu giờ", "100 triệu giờ", thì dữ liệu hiện thân mà ngành công nghiệp tiếp cận hôm nay "chất lượng vẫn chưa đủ cao" và thiếu tiêu chuẩn thống nhất. Do đó, để trí tuệ hiện thân tạo ra scaling law (quy luật quy mô), tiền đề là dữ liệu phải có khả năng scale up (mở rộng); và chất lượng dữ liệu trong kịch bản thực tế quan trọng hơn nhiều so với số lượng dữ liệu.

Hình: Thu thập dữ liệu vận hành thực tế của MORPHI.
Tương ứng với đó, trong việc thu thập dữ liệu, MORPHI đi theo lộ trình "thiết bị tự phát triển + đi sâu vào kịch bản": Một mặt, tự phát triển hệ thống thu thập dữ liệu thế giới thực MORPHI Sense Kit, có thể tái tạo quỹ đạo ở mức milimet trong các kịch bản cực đoan như bề mặt ít vân, phản quang cao, đảm bảo độ chính xác và khả năng sử dụng của dữ liệu; mặt khác, thúc đẩy thiết bị thu thập dữ liệu đi sâu vào các kịch bản thương mại như khách sạn, căn hộ dịch vụ, để nhân viên vận hành trực tiếp tạo ra dữ liệu thực tế, tránh sai lệch phân phối do dữ liệu dàn dựng. Trên cơ sở đó, MORPHI đã xây dựng hệ thống bánh đà dữ liệu hoàn chỉnh từ thu thập đến lặp lại mô hình. Hiện tại, MORPHI đã tích lũy được 30.000 giờ dữ liệu kịch bản thực tế, dự kiến trong năm nay sẽ hoàn thành kho dự trữ 150.000 đến 200.000 giờ dữ liệu, liên tục cung cấp nguyên liệu huấn luyện chất lượng cao cho việc lặp lại mô hình MoRA.
Việc hiện thực hóa trí tuệ hiện thân chưa bao giờ là sự đột phá của một thuật toán đơn lẻ, mà là một kỹ thuật hệ thống phức tạp với sự kết hợp sâu sắc giữa mô hình, phần cứng và dữ liệu. Chỉ sau nửa năm thành lập, MORPHI đã dần hoàn thiện bố cục công nghệ toàn diện từ kiến trúc mô hình, phối hợp phần mềm - phần cứng, vòng lặp dữ liệu đến khả năng khái quát hóa xuyên kịch bản. Trong cuộc chạy marathon trí tuệ hiện thân này, MORPHI đã thoát khỏi sự cạnh tranh kỹ thuật đơn điểm và tìm thấy rào cản cạnh tranh cấp hệ thống đầy khác biệt.
Bài viết này do MORPHI cung cấp, QbitAI được ủy quyền đăng tải lại, quan điểm thuộc về tác giả gốc.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.