QbitAI
85

Mô hình

Cựu binh Thung lũng Silicon từng đặt cược vào SpaceX nay rót vốn cho startup mô hình thế giới của Trung Quốc

(giờ Việt Nam)

Tóm tắt AI

Khi AI bắt đầu khả năng 'diễn tập' trước một trận mưa bão, startup này đang thu hút sự chú ý lớn nhờ công nghệ mô hình thế giới đột phá.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

05-09-2026 22:46:15 Nguồn: QbitAI

Khi AI bắt đầu "diễn tập" cho một trận mưa bão

Yun Zhong, đưa tin từ QbitAI | Official Account QbitAI

Trong ba năm qua, AI đã chứng minh rằng nó có thể hiểu được ngôn ngữ của con người. Nhưng điều đáng ngại là nó vẫn chưa thể hiểu được thế giới vật lý mà chúng ta đang sống.

Việc các mô hình lớn (Large Models) thiếu đi con đường kết nối với thế giới vật lý không phải là lời cảnh báo suông.

Tháng 7 năm 2026, cả miền Nam và miền Bắc Trung Quốc đồng loạt đối mặt với những trận lũ lụt nghiêm trọng.

Tại miền Nam, do ảnh hưởng kết hợp của bão Maysak và gió mùa Tây Nam, Quảng Tây đã phải hứng chịu những đợt mưa lớn kéo dài. Lượng mưa tại nhiều trạm ở Hoành Châu, Tân Dương thuộc thành phố Nam Ninh đã phá vỡ kỷ lục lịch sử, hồ chứa Liulan bị vỡ đập.

Từ lúc phát hiện đỉnh lũ bất thường đến khi đập vỡ, thời gian vàng để bộ chỉ huy xử lý chưa đầy 30 phút. Sông Úc Giang tại Quý Cảng xuất hiện trận lũ lớn nhất kể từ năm 2001, mực nước đỉnh lũ vượt mức báo động 5,68 mét, một khu giáo dục bị ngập sâu gần đến tầng ba, hàng chục nghìn giáo viên và học sinh bị mắc kẹt, toàn khu vực phải sơ tán khẩn cấp 187.000 người.

Gần như cùng thời điểm, miền Bắc cũng không yên ả: Dù bão Bavi không trực tiếp đổ bộ vào Đông Bắc, nhưng thông qua việc vận chuyển hơi nước từ xa và các dải mây ngoại vi, nó đã gây ra mưa lớn tại khu vực này. Một con phố ở Thẩm Dương ghi nhận lượng mưa 310,6 mm trong 10 giờ, gần bằng lượng mưa nửa năm của thành phố này; 17 con sông xuất hiện lũ vượt mức báo động, hơn 80 hồ chứa vượt mực nước giới hạn lũ.

Đây chính là điểm yếu của các mô hình ngôn ngữ lớn. Bạn có thể nạp cho nó toàn bộ tài liệu thủy lợi về lũ lụt trong lịch sử nhân loại, nó có thể viết ra một bản hướng dẫn phòng chống thiên tai đầy văn vẻ, nhưng nó không thể trả lời những câu hỏi then chốt nhất trước thảm họa:

Nước từ đâu đến, đi về đâu, mấy phút nữa sẽ tới nơi, và sẽ nhấn chìm những ai. Những câu hỏi này không nằm trong văn bản, mà nằm trong thế giới vật lý.

AI giỏi hiểu ngôn ngữ, nhưng lại thiếu khả năng nhận thức, suy luận và ra quyết định đối với thế giới vật lý.

Thời tiết cực đoan xảy ra thường xuyên, và điểm yếu này đang trở thành cái giá ngày càng đắt đỏ.

Ngập lụt đô thị, lũ lụt lưu vực, lũ quét hằng năm đều thử thách hệ thống ứng phó khẩn cấp, nhưng nước chảy về đâu, ngập đến chỗ nào, cứu ở đâu trước, những quyết định then chốt đó vẫn không thể thiếu sự phán đoán của các chuyên gia.

Căn bệnh tương tự cũng xuất hiện ở những nơi khác:

Trong nền kinh tế tầm thấp (low-altitude economy), việc phân chia không phận, sắp xếp đường bay, xác định xung đột vẫn dựa vào kinh nghiệm thủ công và bản vẽ tĩnh.

Trong lĩnh vực trí tuệ hiện thân (embodied AI), sau khi robot bước ra khỏi phòng thí nghiệm, dù đã có thể cảm nhận được vật thể và môi trường, nhưng khi đối mặt với những thay đổi động phức tạp, khả năng dự đoán và suy luận về trạng thái tương lai vẫn chưa đủ tin cậy.

Trong tất cả các kịch bản này, thứ mà các mô hình ngôn ngữ lớn còn thiếu chính là một bài học: khả năng ra quyết định trong thế giới thực.

Một sự đồng thuận đang dần hình thành

Nhận thức của ngành về điểm yếu này đang chuyển từ cảm giác mơ hồ thành sự đồng thuận rõ ràng.

QbitAI Think Tank trong "Báo cáo nghiên cứu Trí tuệ không gian 2025" đã đưa ra một khung lý thuyết được trích dẫn rộng rãi: Trí tuệ không gian là hệ thống AI dựa trên thông tin thị giác 3D để hiểu, suy luận, tạo lập và tương tác. Lái xe tự động, tạo lập 3D, trí tuệ hiện thân là các lĩnh vực ứng dụng ở các mức độ trưởng thành khác nhau, còn mô hình thế giới (world model) chính là trạng thái cuối cùng của sự phát triển trí tuệ không gian, là hiệp hai của sự phát triển trí tuệ nhân tạo.

Cái gọi là mô hình thế giới chính là biểu đạt nội tại về cách thế giới vận hành được xây dựng từ lượng dữ liệu khổng lồ, có thể suy luận hậu quả của hành động và dự đoán tương lai.

Nói cách khác, ai bù đắp được điểm yếu về hiểu thế giới vật lý và suy luận ra quyết định, người đó sẽ giành được tấm vé vào cửa cho hiệp hai của AI.

Tháng 11 năm 2025, Fei-Fei Li đã đăng tải một bài viết dài tại Thung lũng Silicon, tóm tắt việc tạo lập, đa phương thức và tương tác là những trụ cột quan trọng của mô hình thế giới trí tuệ không gian. World Labs của bà sau đó đã ra mắt công cụ R2S2R, lần đầu tiên khép kín quy trình từ tạo lập thế giới đến huấn luyện, đánh giá và triển khai robot thực tế; năm trường đại học gồm Đại học Bắc Kinh, Đại học Thanh Hoa, Đại học Hàng không Vũ trụ Bắc Kinh, Đại học Giao thông Thượng Hải và Đại học Khoa học và Công nghệ Trung Quốc đã cùng khởi xướng bài kiểm tra TriWorldBench, thúc đẩy mô hình thế giới từ tạo lập thị giác tiến tới hiểu thế giới; các tên tuổi như Alibaba, TransMind cũng lần lượt đứng đầu bảng xếp hạng đánh giá uy tín WorldArena.

Khái niệm, đánh giá, vốn đầu tư – ba thế lực cùng lúc tham gia cho thấy đường đua này đã bước qua giai đoạn chỉ biết "kể chuyện".

Ngày 1 tháng 9, World Labs ra mắt mô hình thế giới thế hệ mới Atlas, được Fei-Fei Li gọi là một cột mốc quan trọng. Nó được huấn luyện trước từ đầu, xử lý nguyên bản bốn phương thức: văn bản, hình ảnh, video và 3D, tạo ra video 1440p dài tối đa 1 phút với khả năng kiểm soát camera chính xác đến từng pixel, tái tạo thế giới 3D tường minh từ đám mây điểm và 3D Gaussian Splatting từ vài bức ảnh.

Atlas tích hợp việc tạo lập, tái tạo và mô phỏng vào cùng một mô hình lấy không gian 3D làm cốt lõi, thiết lập nên một "trình mô phỏng thế giới".

Vậy, liệu chúng ta đã thực sự chuyển từ việc tạo ra một thế giới đẹp mắt sang tạo ra một thế giới có thể sử dụng được chưa?

Nếu Atlas gặp phải những trận mưa bão mùa hè năm nay, giả sử nó có thể tái tạo hình dạng hình học của một con sông từ ảnh chụp, liệu nó có thực sự suy luận được nước sông sẽ chảy về đâu trong đợt mưa bão tiếp theo, và ngôi làng nào ở hạ lưu cần được sơ tán trước khi đập vỡ?

Hiện tại, ngay cả khi mô hình thế giới đã đạt được khả năng tạo video không gian 3D cấp pixel, thì mô phỏng vật lý, huấn luyện chiến lược và đánh giá hiệu quả vẫn thuộc về một đường ống công cụ khác. Các mô hình thế giới sử dụng công nghệ tiêu biểu như 3D Gaussian, chỉ tập trung vào tái tạo và tạo lập, vẫn đang cố gắng làm cho thế giới trông "thật" hơn. Trong khi đó, phòng chống thiên tai và ứng phó khẩn cấp cần những quyết định sớm hơn, chính xác hơn và có thể kiểm chứng được. Giữa hai bên vẫn còn khoảng cách là các khâu kỹ thuật cứng nhắc và chậm chạp như tính toán mô phỏng, biên động và hệ thống kiểm chứng.

Ngay cả những đội ngũ giỏi nhất thế giới vẫn đang chinh phục ngọn núi của hiệp một, điều này chứng tỏ con đường từ tạo lập đến ra quyết định trong hiệp hai chính là lỗ hổng chung của toàn ngành, và cũng là lý do thực sự khiến sự đồng thuận này hình thành.

Các mô hình thế giới trong video trình diễn ngày càng nhiều, nhưng những mô hình thế giới có thể bước vào thế giới thực để ra quyết định vẫn còn rất khan hiếm.

Nhưng thảm họa không bao giờ chờ đợi ai. Trong khung thời gian vài phút, một hệ thống chỉ biết tạo ra những hình ảnh chân thực sẽ chẳng giúp ích được gì. Một hệ thống thực sự hữu ích phải đưa được toàn bộ thung lũng, thậm chí cả thế giới vào một bản sao có thể suy luận được trước khi thảm họa xảy ra.

Một vấn đề đang được coi trọng và một bản trả lời đầy nghiêm túc

Vấn đề đã được đặt ra, các giải pháp cũng đang được ấp ủ, và tín hiệu này đến từ một sân khấu khởi nghiệp cấp quốc gia.

Từ ngày 26 đến 29 tháng 8, Hội nghị thượng đỉnh khởi nghiệp toàn cầu HICOOL 2026 đã được tổ chức tại Bắc Kinh. Đây là sự kiện khởi nghiệp toàn cầu do Bắc Kinh dốc sức xây dựng, với 10.209 dự án khởi nghiệp và 13.472 nhà khởi nghiệp từ 141 quốc gia và khu vực cùng tranh tài, cả hai con số đều phá vỡ kỷ lục lịch sử.

Sau bảy năm tổ chức, sức nặng của HICOOL nằm ở bảng thành tích sau cuộc thi. Hệ sinh thái HICOOL đã ươm tạo thành công 5 công ty niêm yết, 18 kỳ lân, 219 doanh nghiệp "chuyên tinh đặc tân" (chuyên biệt, tinh tế, đặc sắc, đổi mới), tổng số vốn huy động sau cuộc thi của các dự án đạt giải đã vượt mốc 70 tỷ nhân dân tệ. Việc HICOOL trao giải cho hạng mục nào, ở một mức độ nào đó, chính là lá phiếu cho xu hướng của ngành.

Giải nhất của cuộc thi năm nay đã được trao cho lĩnh vực trí tuệ không gian và mô hình thế giới. Đơn vị đạt giải là Feidu Technology, một doanh nghiệp "tiểu khổng lồ" trọng điểm cấp quốc gia, với thành quả đạt giải là mô hình trí tuệ không gian tự phát triển mang tên "Zhengrong Large Model".

量子位的朋友们
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.