Thủ thuật
Mô hình thế giới và hạ tầng thông minh: Góc nhìn đa chiều về làn sóng robot tự hành
(giờ Việt Nam)
Tóm tắt AI
Bài viết tổng hợp những thảo luận chuyên sâu từ sự kiện WRC về tương lai của robot có thân thể (embodied AI), tập trung vào vai trò của mô hình thế giới và hạ tầng công nghệ trong việc định hình kỷ nguyên mới.
Bản dịch AI


Làm thế nào để robot có thể thực sự hiểu được thế giới? Và nền tảng nào nên được dùng làm trụ cột cho trí tuệ đó?
Tại Hội nghị Robot Thế giới 2026 vừa kết thúc, một loạt các sản phẩm, công nghệ và ứng dụng mới đã được giới thiệu, phô diễn trạng thái hiện tại của Trí tuệ nhân tạo hiện thân (Embodied Artificial Intelligence). Trong khi đó, hàng loạt bài thuyết trình tiên phong và các cuộc tranh luận sôi nổi tiếp tục mở ra những khả năng mới cho tương lai của lĩnh vực này.
Vào chiều ngày 21 tháng 8, sự kiện đặc biệt "Làn sóng mới của Embodied AI: Mô hình thế giới và Hạ tầng thông minh", do Yunqi Capital và SEE Fund đồng tổ chức, với sự hỗ trợ của Mars Accelerator và Chi hội Khoa Kỹ thuật Điện tử thuộc Hội Cựu sinh viên Đại học Thanh Hoa, đã diễn ra thành công tốt đẹp. Đây là năm thứ năm liên tiếp Yunqi tham gia Hội nghị Robot Thế giới, cùng các chuyên gia trong ngành thảo luận về những thay đổi mới nhất trong lĩnh vực Embodied AI.
Sự kiện tập trung vào hai chủ đề nóng: mô hình thế giới (world models) và hạ tầng thông minh. Các khách mời bao gồm các nhóm nghiên cứu tiên phong từ các trường đại học, các nền tảng mô hình lớn và điện toán đám mây hàng đầu trong nước, cùng các công ty khởi nghiệp đang phát triển mô hình thế giới, thân robot, ứng dụng, cũng như hạ tầng dữ liệu và tính toán. Sự kiện cũng thu hút hơn 200 người tham dự từ cộng đồng nghiên cứu, đầu tư và công nghiệp Embodied AI. Trong hơn ba giờ, các cuộc thảo luận trải dài từ phương pháp kỹ thuật đến hiệu quả dữ liệu, hạ tầng tính toán và triển khai thực tế — nơi các diễn giả và khán giả cùng khám phá những yếu tố cần thiết để Embodied AI tiến tới giai đoạn tiếp theo.

Trước khi hình thành sự đồng thuận, làm thế nào để đánh giá phương hướng?
Những điểm nóng và đội ngũ mới liên tục xuất hiện, nhưng các phương pháp kỹ thuật vẫn còn xa mới đạt được sự thống nhất. Làm thế nào để đánh giá phương hướng? Đây là mối quan tâm chung của hai đơn vị đồng tổ chức là Yunqi Capital và SEE Fund. Cả hai đều là những nhà đầu tư trong nước sớm nhất cam kết với làn sóng Embodied AI, và trong những năm gần đây đã xây dựng...
"Là những nhà đầu tư giai đoạn đầu, chúng tôi đã khá quen với việc theo đuổi các hướng đi và giai đoạn mà câu trả lời chưa hình thành và các lộ trình kỹ thuật chưa thống nhất. Nhiều thay đổi công nghệ quan trọng nhất thực tế lại có giá trị nhất trước khi sự đồng thuận của ngành được thiết lập."
Yi Han, Giám đốc điều hành tại Yunqi Capital, giải thích trong bài phát biểu khai mạc rằng kể từ khi thành lập vào năm 2014, Yunqi vẫn luôn tập trung vào đầu tư công nghệ giai đoạn đầu, đồng hành cùng hơn 200 công ty khởi nghiệp công nghệ trong suốt hơn một thập kỷ qua. Từ rất lâu trước khi Embodied AI trở thành chủ đề nóng trên thị trường vốn đầu tư mạo hiểm, Yunqi đã bắt đầu đầu tư vào các hướng đi liên quan và dần dần xây dựng một bố cục hệ thống.
Ông lưu ý rằng trọng tâm của ngành công nghiệp robot đang chuyển dịch từ việc làm thế nào để nhận thức thế giới và đạt được khả năng vận động mạnh mẽ hơn, sang việc làm thế nào để thực sự hiểu thế giới vật lý. Điều này đòi hỏi robot không chỉ nhận diện những gì chúng thấy, mà còn phải hiểu các mối quan hệ không gian, quan hệ nhân quả và các quy luật vật lý — đồng thời đưa ra các dự đoán và điều chỉnh. Chính từ yêu cầu này mà các mô hình thế giới đã thu hút được sự chú ý rộng rãi.
Nhưng dù là VLA hay mô hình thế giới, "chúng ta còn lâu mới có những câu trả lời thống nhất." Yi Han chỉ ra rằng ngoài bản thân các mô hình, việc thu thập dữ liệu, hỗ trợ tính toán và cách kết hợp mô phỏng với dữ liệu thực tế cũng quan trọng không kém đối với các bước tiếp theo của Embodied AI.

Yi Han, Giám đốc điều hành, Yunqi Capital
Với các lộ trình kỹ thuật chưa hội tụ, các công ty khởi nghiệp và nguồn vốn đã đổ vào nhanh chóng. Làm thế nào để nhìn nhận sự gia tăng này?
Ma Lin, Đối tác quản lý của SEE Fund, cho biết trong bài phát biểu khai mạc rằng SEE Fund đã bắt đầu đầu tư vào lĩnh vực Embodied AI từ năm 2023 và đã thiết lập một chuỗi cung ứng. Mặc dù thị trường Embodied AI đã chứng kiến hoạt động gây quỹ sôi nổi trong năm nay, nhưng điều quan trọng hơn định giá ngắn hạn là liệu các công ty có đang đi đúng hướng và thực hiện đúng những việc cần làm hay không.
Từ các Hội nghị Robot Thế giới, các chương trình Gala Xuân và các cuộc thi robot gần đây, khả năng của robot đã liên tục được cải thiện. "Sự chuyển đổi mà Embodied AI và robot sẽ mang lại cho ngành công nghiệp — và cho thế giới — không còn xa vời." Nhưng ông cũng thẳng thắn nói thêm rằng mặc dù Embodied AI tổng quát là mục tiêu, nhưng nó "không thể đạt được trong một sớm một chiều." Các quy luật ngành (industry) vẫn phải được tôn trọng và sự tiến bộ phải diễn ra một cách vững chắc.
Embodied AI sẽ mang lại giá trị gia tăng cho nhân loại — làm những gì con người không thể và vươn tới những nơi con người chưa từng đặt chân đến. Đây là hướng đi xứng đáng nhận được nhiều sự quan tâm hơn từ toàn ngành.

Ma Lin, Đối tác quản lý, SEE Fund
Từ thực tiễn:
Cách AI hiểu thế giới vật lý
Với các lộ trình kỹ thuật chưa hội tụ, các khám phá theo những hướng khác nhau đã đi sâu vào việc huấn luyện mô hình hiện thân và các kịch bản thực tế. Trong các bài thuyết trình chính, ba khách mời đã dựa trên thực tiễn để chia sẻ cách các phương pháp mô hình lớn đang thâm nhập vào các kịch bản hiện thân, cách vật lý...

Các phương pháp mô hình lớn thâm nhập vào các kịch bản hiện thân như thế nào?
(Tiếp nối tiêu đề trên)
Dựa trên các nền tảng mô hình lớn và thực tiễn công nghiệp, Yang Liwei, Phó chủ tịch của Volcano Engine, đã giới thiệu những khám phá của dòng mô hình Doubao trong tương tác đa phương thức thời gian thực, kết nối nhận thức và thực thi, cũng như hậu huấn luyện và học tăng cường, thông qua các trường hợp như hướng dẫn viên bảo tàng.
Các phương pháp đã được kiểm chứng trong lĩnh vực mô hình lớn đang bắt đầu thâm nhập vào các kịch bản hiện thân. Yang Liwei lấy In-Context Learning làm ví dụ: các mô hình ngôn ngữ lớn có thể thích nghi với các nhiệm vụ mới mà không cần cập nhật tham số, chỉ bằng cách đọc một vài ví dụ. Trí tuệ hiện thân có thể tận dụng phương pháp này, nhưng cần tăng cường sự phong phú của các phương thức ngữ cảnh, độ dài thời gian và dung lượng cửa sổ.
Hiệu quả dữ liệu cũng quan trọng không kém. Dữ liệu UMI hiện tại đã đạt tới hàng triệu hoặc thậm chí hàng chục triệu giờ, mà không nhất thiết mang lại sự cải thiện khả năng tương ứng. Yang Liwei tin rằng việc cải thiện chất lượng dữ liệu vẫn đòi hỏi phải giải quyết các vấn đề bao gồm thống nhất biểu diễn đa phương thức, độ trung thực của kịch bản thực tế và trích xuất thông tin tiên nghiệm có lợi cho các hành động hạ nguồn.
Yang Liwei, Phó chủ tịch, Volcano Engine
Vượt ra ngoài việc "tích lũy tài sản",
Nâng cao hiệu quả mở rộng (scaling)
Yonglu Li, Phó giáo sư tại Trường Trí tuệ nhân tạo, Đại học Giao thông Thượng Hải, đã trình bày về "Mô hình thế giới và Học trực giác vật lý", giới thiệu nghiên cứu của nhóm ông về việc huấn luyện các mô hình để hiểu các mối quan hệ hình học, thay đổi vật lý và các nhiệm vụ dài hạn bằng cách sử dụng dữ liệu thực tế, video internet, trò chơi và mô phỏng.
Theo quan điểm của ông, học bắt chước (imitation learning) và học tăng cường (reinforcement learning) đã hình thành các mô hình tương đối trưởng thành, với sự hội tụ kỹ thuật ngày càng tăng trên toàn ngành — "điều này cho thấy ngành đã đạt được sự đồng thuận." Nhưng các phương pháp hiệu quả vẫn đòi hỏi sự "tích lũy tài sản" liên tục. Sau khi dữ liệu đạt đến hàng triệu hoặc hàng chục triệu giờ, việc lưu trữ, truy xuất và huấn luyện phân tán cũng mở rộng sự cạnh tranh sang năng lực hạ tầng.
Tuy nhiên, "giờ" có thể không phải là đơn vị tốt nhất để đo lường giá trị dữ liệu; điều quan trọng là liệu dữ liệu có cải thiện khả năng của mô hình hay không. Yonglu Li giới thiệu rằng nhóm của ông cũng đang thử nghiệm sử dụng dữ liệu chi phí thấp từ trò chơi và mô phỏng để huấn luyện "trực giác vật lý" cho mô hình, và đo lường khả năng tổng quát hóa thông qua hiệu suất chéo nhiệm vụ và lượng dữ liệu cần thiết để thích nghi với các nhiệm vụ mới.
Yonglu Li, Phó giáo sư, Trường Trí tuệ nhân tạo, Đại học Giao thông Thượng Hải
Làm thế nào để các mô hình thế giới vượt qua
Rào cản "Độ tin cậy vật lý"?
Một mô hình thế giới "trông có vẻ thật" — liệu điều đó có nghĩa là nó tuân thủ các quy luật vật lý và có thể thực sự phục vụ hành động của robot? Dingkang Yang, Đồng sáng lập và CTO của Feijiekesi, một công ty trong danh mục đầu tư giai đoạn đầu của Yunqi Capital, đã chia sẻ những khám phá của nhóm ông trong việc "Tạo ra, Hiểu và Mô phỏng thế giới vật lý."
Bài viết được AI dịch và tổng hợp tự động từ elsewhere:. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.