Tin ngành
Dẹp bỏ khái niệm 'Mô hình thế giới' đi!
(giờ Việt Nam)
Tóm tắt AI
Bài viết phản biện gay gắt về sự cường điệu hóa khái niệm 'mô hình thế giới' trong AI hiện nay, cho rằng đây chỉ là chiêu trò marketing thay vì bước tiến thực sự về trí tuệ nhân tạo.
Bản dịch AI

@Zhiyan Chen
Câu chuyện bắt đầu từ một thời điểm rất, rất xa xưa.
Hai mươi năm trước, Che Haoxuan đang học lớp ba, và trong lớp có một cậu bạn để lại ấn tượng sâu sắc. Đó là một học sinh giỏi, và mỗi ngày sau giờ học, người nhà đều lái xe đến đón cậu bé về.
Che nghĩ rằng cậu bạn này chắc hẳn phải hạnh phúc lắm.
Nhưng một ngày nọ, cậu bắt đầu tự hỏi: Nếu mình là cậu ấy, thế giới sẽ trông như thế nào? Cậu tò mò không biết liệu cùng một thế giới đó có thể hiện ra hoàn toàn khác biệt qua đôi mắt của một người khác hay không.
Tôi biết bạn đang nghĩ gì: thì sao chứ?
Đây là câu chuyện chính Che đã kể cho tôi. Hai mươi năm sau, ở tuổi 29, cậu thành lập XGEN với hy vọng xây dựng một "Cánh cửa thần kỳ" (Door of Anywhere) — một cổng kết nối biến những thế giới vốn chỉ có thể tưởng tượng trong tâm trí thành những nơi bạn thực sự có thể bước vào.
Khái niệm này hơi phức tạp.
"Vậy, đây có phải là một mô hình thế giới (world model) không?" tôi hỏi.
"Quên nó đi!" Che đáp gần như ngay lập tức, rồi đưa ra một khái niệm thậm chí còn khó nắm bắt hơn: mô hình trải nghiệm tương tác, một mô hình trải nghiệm chủ quan. Cậu gọi những gì XGEN đang xây dựng là "mô phỏng thế giới tạo sinh" (generative world simulation).
Dưới đây là nỗ lực của tôi nhằm kể lại câu chuyện của Che Haoxuan.
Quái vật ở Guomao, Cảnh sát và Thế giới thứ hai
"Nếu một con quái vật đột nhiên xuất hiện ở khu vực Guomao của Bắc Kinh thì sao? Điều gì sẽ xảy ra với thế giới đó?"
Để giải thích Cánh cửa thần kỳ này thực sự là gì, Che đưa ra một kịch bản kỳ lạ. Cậu nói nếu bạn yêu cầu AI ngày nay tạo ra một video về cảnh này, bạn sẽ thấy một con quái vật leo lên các tòa nhà, cắn người, đập phá các tòa tháp, và đám đông chạy tán loạn trong hoảng loạn.
Nhưng vấn đề nằm ở chỗ: "Cảnh sát sẽ không đến."
Không có cảnh sát, bởi vì quá trình tạo sinh của AI không tính đến các quy luật tiềm ẩn của thế giới này: ai đó sẽ rút điện thoại ra — có một nghề gọi là cảnh sát — cảnh sát sẽ đến khi được gọi — họ xuất hiện ở nơi mọi người có thể nhìn thấy họ.
Vì vậy, Che muốn tạo ra hai thế giới.
Thế giới thứ nhất là những gì mắt người nhìn thấy. "Bạn lang thang qua một thế giới, và nó thay đổi theo góc nhìn chủ quan của bạn."
Thế giới thứ hai là những gì mắt người không thể nhìn thấy. "Ví dụ, Tổng thống Mỹ đang làm gì ngay lúc này? Đang ngủ, đang uống nước, hay làm gì đó khác. Tôi không biết, nhưng ông ấy thực sự tồn tại ở một trạng thái nào đó vào lúc này."
Các mô hình tạo sinh hình ảnh trước đây hầu như chỉ xử lý thế giới thứ nhất. "Nếu bạn không nhìn thấy nó, nó không tồn tại; nếu nó không tồn tại, AI không thể mô hình hóa nó." Theo lý thuyết của Che, nếu không có thế giới thứ hai, ngay cả khi con quái vật đập phá Guomao suốt một giờ, cảnh sát cũng sẽ không bao giờ xuất hiện.
Che muốn thế giới thứ hai tồn tại dưới một hình thức khác: các trạng thái (states). Thế giới không nhìn thấy không cần phải vẽ ra từng khung hình — nó chỉ cần được ghi nhớ, được suy luận — ai đang ở đâu, chuyện gì vừa xảy ra, mỗi thực thể nắm giữ những ký ức và mục tiêu gì, một hành động sẽ kích hoạt những thay đổi nào. Chỉ khi nó đi vào tầm nhìn, nó mới được kết xuất (render) thành các điểm ảnh (pixels).
Về mặt kiến trúc, lớp Trạng thái thế giới (World State layer) xử lý động lực học và các chuyển đổi trạng thái, trong khi lớp Kết xuất (Render layer) chuyển đổi những gì chủ thể nhìn thấy tại thời điểm đó thành các điểm ảnh. Cả hai được huấn luyện riêng biệt nhưng phối hợp với nhau trong cùng một kiến trúc phân cấp.
Có một điểm tham chiếu trong ngành cho phương pháp này: Genie.
Genie là một dòng mô hình từ Google DeepMind, và là lộ trình "mô hình thế giới" tiêu biểu nhất hiện nay: nó không tạo ra video để xem thụ động, mà tạo ra các môi trường mà con người có thể bước vào, vận hành bên trong và các môi trường đó phản hồi lại những thao tác đó. Genie 2, ra mắt vào tháng 12 năm 2024, có thể tạo ra các môi trường tương tác có thể khám phá bằng bàn phím và chuột chỉ từ một hình ảnh duy nhất. DeepMind tuyên bố các môi trường được tạo ra này có thể kéo dài tới một phút, mặc dù hầu hết các bản demo chỉ chạy từ 10 đến 20 giây.
Theo lời Che, XGEN đại diện cho một sự cải tiến đối với phương pháp của Genie. Trọng tâm hiện tại của họ là "tính nhất quán dài hạn" (long-horizon consistency) — không phải làm cho vài giây video trông mạch lạc, mà là cố gắng giữ cho các nhân vật, trạng thái và quan hệ nhân quả tự nhất quán sau khi một thế giới đã vận hành trong hàng chục phút.
Khi tôi hỏi điều này cuối cùng có thể lớn đến mức nào, Che nói: "Mọi người có thể bước vào phim ảnh, anime, tiểu thuyết và sống cùng các nhân vật; robot có thể học cách làm mọi thứ trong thế giới ảo và mang những kỹ năng đó trở lại thực tế. Internet đã kết nối một thế giới; chúng tôi muốn mọi người có thể tự tạo ra thế giới của riêng mình."
Trước khi thành lập XGEN, Che đã có một nỗ lực theo hướng này.
Từ tháng 5 đến tháng 9 năm 2024, cậu thực tập tại Tencent IEG, nơi cậu là tác giả chính hoàn thành GameGen-X. Nó có thể tạo ra video trò chơi thế giới mở từ văn bản, chấp nhận các lệnh văn bản có cấu trúc và điều khiển bằng bàn phím. Khi người chơi di chuyển nhân vật hoặc thực hiện hành động, mô hình tiếp tục tạo ra các thay đổi về môi trường và nhân vật dựa trên phân đoạn video hiện tại. Không giống như các trò chơi truyền thống với bản đồ và tài nguyên được tạo sẵn, cả môi trường và nhân vật đều do mô hình tạo ra.
Bài báo liên quan sau đó đã được chấp nhận tại hội nghị học máy hàng đầu ICLR 2025. Bài báo định nghĩa GameGen-X là mô hình Transformer khuếch tán (diffusion Transformer) đầu tiên hỗ trợ đồng thời việc tạo video trò chơi thế giới mở và điều khiển tương tác.
GameGen-X được phát hành trước Genie 2. Khi Genie 2 ra mắt, Che đã viết trên trang cá nhân rằng Genie 2 và GameGen-X là hai tác phẩm duy nhất vào thời điểm đó không phụ thuộc vào các thế giới trò chơi có sẵn, có khả năng tạo ra các môi trường mới. Trong cùng bài đăng đó, cậu thừa nhận rằng đội ngũ kia đã tiến xa hơn về sự đa dạng trong điều khiển, bộ nhớ ngắn hạn và sự xuất hiện hành vi (behavioral emergence).
Tôi hỏi cậu: nếu mục tiêu là xây dựng những thế giới chưa biết, tại sao vẫn phải có một "góc nhìn chủ quan"?
"Để mô hình hóa một thế giới hoàn toàn khách quan, bạn cần phải khai thác hết tất cả dữ liệu trên thế giới. Tôi nghĩ điều đó là không thể." Cậu lấy ví dụ về AlphaGo: nó không giải hết tất cả các nước đi có thể, mà định hình lại vấn đề từ "tìm ra nước đi tối ưu" thành "mạnh hơn con người giỏi nhất".
Sự nhấn mạnh của XGEN vào "góc nhìn chủ quan" cũng tuân theo triết lý tương tự.
"Nếu một người bị nhốt trong phòng, các tín hiệu họ có thể gửi, những thay đổi họ có thể kích hoạt — những điều đó có thể được bao phủ." Che tin rằng từ góc nhìn chủ quan, chỉ có ba tương tác có thể xảy ra với thế giới: thao tác, điều hướng và giao tiếp.
Do đó, góc nhìn chủ quan vẽ ra một ranh giới xung quanh thế giới vô tận: mô hình không cần phải tính toán đồng thời mọi chuyển động của mọi người trong thành phố, ánh sáng của mọi căn phòng, sự thay đổi điểm ảnh của mọi vật thể — nó chỉ cần duy trì các trạng thái liên quan đến chủ thể hiện tại và các hành động có thể xảy ra của họ. Khi chủ thể di chuyển, vận hành hoặc giao tiếp, các phần liên quan sẽ được gọi lên và mở ra.
Nói một cách đơn giản hơn, "mô hình trải nghiệm chủ quan" của XGEN không theo đuổi sự bao phủ toàn diện, mà chỉ theo đuổi tính hợp lý — những phần không nhìn thấy cần được mô hình hóa với chi phí đủ thấp để khi chúng xuất hiện trong tầm nhìn, chúng không phá vỡ ảo giác.
Lưu Bang, con la bướng bỉnh và một khả năng khác
Chúng tôi đang ngồi trong một nhà hàng phương Tây ở Bắc Kinh khi cậu nói tất cả những điều này.
Trong hai giờ đầu tiên, Che gần như nói hết mọi thứ. Công nghệ, sản phẩm, gây quỹ, tổ chức — các chủ đề liên tục thay đổi, và cậu hiếm khi dừng lại.
Bài viết được AI dịch và tổng hợp tự động từ elsewhere:. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.