The Decoder: AI News
95

Mô hình

World Labs ra mắt Atlas: Mô hình AI tạo dựng và mô phỏng thế giới 3D từ vài tấm ảnh

(giờ Việt Nam)

Tóm tắt AI

Được đồng sáng lập bởi Fei-Fei Li, Atlas cho phép tái tạo không gian 3D chân thực từ ít ảnh đầu vào, hỗ trợ xuất dữ liệu 3D chuyên sâu và video 1440p có thể điều khiển.

Bản dịch AI

World Labs unveils Atlas, a single AI model that generates, reconstructs, and simulates 3D worlds from just a few photos

World Labs mô tả Atlas là một omni-model (mô hình toàn năng) được huấn luyện từ đầu trên dữ liệu văn bản, hình ảnh, video và dữ liệu 3D. Mọi đầu vào đều được neo vào một vị trí cụ thể trong không gian 3D thay vì được xử lý như một chuỗi phẳng. Công ty gọi sự hiểu biết không gian chung này là "spatial context" (ngữ cảnh không gian), và đây chính là thứ mà mô hình sử dụng để tạo ra từng khung hình hoặc góc nhìn mới. Theo World Labs, việc neo dữ liệu này giúp Atlas khác biệt so với các mô hình ngôn ngữ hoặc video thuần túy.

Fei-Fei Li đã nêu chính xác vấn đề này trong một bài luận vào tháng 11 năm 2025. Bà lập luận rằng các mô hình ngôn ngữ đa phương thức và mô hình khuếch tán video hiện nay chia nhỏ dữ liệu thành các chuỗi một hoặc hai chiều, điều này khiến ngay cả những tác vụ không gian đơn giản cũng trở nên khó khăn một cách không cần thiết. Điều cần thiết là các kiến trúc tổ chức việc token hóa, ngữ cảnh và bộ nhớ theo cách nhận thức được không gian 3D hoặc 4D.

Một phút video ở độ phân giải 1440p

Đối với việc tạo hình ảnh có kiểm soát camera, Atlas lấy một hoặc nhiều hình ảnh và tạo ra các góc nhìn mới tại các vị trí và góc máy được chọn tùy ý. Chuyển động của camera được truyền dưới dạng đầu vào hình học trực tiếp thay vì được mô tả thông qua các câu lệnh văn bản (text prompts) như cách nhiều mô hình video yêu cầu.

Mô hình xuất ra video dài tối đa một phút ở độ phân giải 1440p. Người dùng có thể tự mình kiểm soát mọi cảnh quay thay vì "kéo cần gạt trên máy đánh bạc", như cách World Labs ví von, nhằm vạch ra ranh giới giữa việc tạo nội dung có kiểm soát và kết quả ngẫu nhiên.

A three-part view showing an input image of a vine-covered cathedral, a sketched camera path, and the generated output image of the same hall from a new perspective.

Đối với tái tạo không gian, Atlas xây dựng lại các cảnh thực từ chỉ một đến vài chục hình ảnh đầu vào mà không cần thiết bị ghi hình chuyên dụng. Càng nhận được nhiều hình ảnh, mô hình càng ít phải tự suy luận để lấp đầy các khoảng trống từ kiến thức của chính nó.

Theo World Labs, chỉ với hai hoặc ba hình ảnh, Atlas đã mang lại kết quả chính xác và vượt trội hơn các mô hình 3D chuyên dụng. Nó cũng có thể xử lý hơn một trăm đầu vào. Trong một bản demo, mô hình đã dần dần lắp ghép khu Main Quad của Stanford từ 25 bức ảnh chụp ở mặt đất và tạo ra các góc nhìn từ trên cao của khuôn viên trường.

Aerial view of the San Francisco skyline with the Transamerica Pyramid, with the street-level input photo shown as a small inset in the lower left.

Đây là nơi các mô hình hiện tại thường bộc lộ điểm yếu. Trong một so sánh thuộc khuôn khổ OpenWorldLib, các hệ thống như VGGT và InfiniteVGGT đã cho thấy sự thiếu nhất quán về hình học và kết cấu bị nhòe ngay khi camera di chuyển đáng kể.

Đầu ra 3D nguyên bản và mô phỏng robot

Atlas có thể xuất kết quả dưới dạng dữ liệu 3D thực thụ, không chỉ là hình ảnh hay video, vì nó xử lý thông tin chiều sâu song song với RGB. Các định dạng được hỗ trợ bao gồm point clouds (đám mây điểm) và 3D Gaussian splats, giúp xây dựng một cảnh từ nhiều điểm dữ liệu không gian nhỏ có thể được quan sát mượt mà từ mọi góc độ. Điều này tương thích với cách biểu diễn được sử dụng trong Marble, sản phẩm hiện có của công ty.

A living room reconstructed as a point cloud with sofa, rug, and fireplace, floating above a grid floor, with marked camera positions and a blue camera path.

Với tư cách là một trình mô phỏng, Atlas mô hình hóa không gian và thời gian cùng nhau. Từ các đoạn phim được quay bởi chỉ vài chiếc camera, nó có thể tạo ra hiệu ứng "bullet time" giúp đóng băng một cảnh quay và cho phép người dùng quan sát từ những góc độ vốn không thể thực hiện được. Đoạn phim demo được quay bằng một vài chiếc điện thoại thông minh và camera hành trình, không phải thiết bị chuyên nghiệp.

Đối với lĩnh vực robot, Atlas đóng vai trò là công cụ real-to-sim (từ thực tế sang mô phỏng). Nó tái tạo một căn phòng và tạo ra dữ liệu hình ảnh cũng như chiều sâu mà các cảm biến của robot mô phỏng sẽ nhìn thấy dọc theo lộ trình của nó. Chỉ từ vài bức ảnh, người dùng có thể mô phỏng và thay đổi các tác vụ cầm nắm và di chuyển bằng cách thay thế các đối tượng, vị trí, ánh sáng hoặc phông nền. Mục tiêu là tạo ra dữ liệu huấn luyện đa dạng cho robot mà không cần phải ghi lại mọi tình huống trong thế giới thực.

World Labs đã trình diễn phương pháp này vào tháng 8 năm 2026 với công cụ real-to-sim-to-real dưới dạng một sản phẩm độc lập. Công cụ đó tạo ra hàng ngàn biến thể từ một tác vụ thực tế duy nhất và huấn luyện các mô hình điều khiển hoàn toàn trong môi trường mô phỏng. Theo công ty, trên năm nền tảng robot, các mô hình đã chạy trong một giờ mỗi lần mà không cần sự can thiệp của con người. Công nghệ này bắt nguồn từ SceniX, một startup mà World Labs đã mua lại vào tháng 7.

Công ty cho biết tạo hình ảnh từ văn bản không phải là trọng tâm chính, nhưng Atlas cũng có thể tuân theo các câu lệnh phức tạp, kết xuất văn bản, tạo ra các phong cách hình ảnh khác nhau và tạo ra ảnh toàn cảnh 360 độ.

Tốc độ từ mô hình ngôn ngữ, chất lượng từ mô hình khuếch tán

Atlas kết hợp các ý tưởng từ cả mô hình ngôn ngữ và mô hình video. Nó tạo ra kết quả từng phần một giống như mô hình ngôn ngữ, vì vậy nó có thể sử dụng các kỹ thuật tăng tốc tương tự, chẳng hạn như KV caching. Nhưng nó cũng sử dụng nguyên lý khuếch tán từ các mô hình hình ảnh và video, dần dần lọc kết quả từ nhiễu. Khía cạnh đó cho phép nó tiếp cận các phương pháp giúp rút ngắn quá trình khử nhiễu hoặc nâng cao chất lượng hình ảnh.

World Labs cho biết không có điểm chuẩn (benchmark) đơn lẻ nào nắm bắt được hết những gì Atlas có thể làm, nhưng họ chỉ ra hai bộ thử nghiệm. Trong việc tạo hình ảnh có kiểm soát camera được đánh giá bởi các chuyên gia con người bên ngoài, và trong việc tái tạo 3D từ ít góc nhìn, Atlas vượt trội hơn các mô hình chuyên biệt hơn.

Các chuyên gia đánh giá con người ưa chuộng Atlas trong 75% các so sánh với MiniMax H3, 81% với Gemini Omni Flash, 86% với Happy Horse 1.1, 93% với [tên mô hình bị thiếu trong bản gốc], và 94% với Seedance 2.5. Đối với việc tái tạo, Atlas dẫn đầu với sai số trung vị là 25.3, vượt trên Pi3X và VGGT-Ω 1B.

Dot plot with confidence intervals showing the share of human evaluators who prefer Atlas, ranging from 75 percent against MiniMax H3 to 94 percent against Seedance 2.5.

Công ty cho biết hiệu suất của Atlas cải thiện cùng với việc tăng cường tài nguyên tính toán huấn luyện và kỳ vọng xu hướng đó sẽ tiếp tục khi quy mô mở rộng. Atlas sẽ cung cấp sức mạnh cho các phiên bản tương lai của Marble và các sản phẩm khác, hiện đã có sẵn thông qua chương trình truy cập sớm cho các đối tác được chọn.

Bar chart of 3D reconstruction error with Atlas at 25.3, Pi3X at 28.7, π³ at 34.7, VGGT-Ω 1B at 36.4, Depth Anything 3 at 39.3, and MapAnything at 47.7.

Từ những bức ảnh có thể đi bộ qua đến một omni-model

World Labs được thành lập vào năm 2024 bởi Fei-Fei Li, người đã tạo ra ImageNet và lãnh đạo bộ phận AI của Google Cloud từ năm 2017 đến 2018. Công ty đã nhận được vốn đầu tư khi ra mắt từ Andreessen Horowitz, AMD, Intel và Nvidia.

Một hệ thống đầu tiên vào cuối năm 2024 đã xuất hiện, mặc dù người dùng chỉ có thể di chuyển vài mét ảo trước khi chạm vào các ranh giới vô hình. Marble ra mắt vào tháng 11 năm 2025. Vào tháng 2 năm 2026, công ty đã thực hiện vòng gọi vốn 1 tỷ USD từ Autodesk, Andreessen Horowitz, Nvidia và AMD. Bloomberg trước đó đã đưa tin về các cuộc đàm phán ở mức định giá 5 tỷ USD.

Những gì được coi là mô hình thế giới (world model) vẫn còn là vấn đề tranh cãi giữa các nhà nghiên cứu. Một nhóm quốc tế do Đại học Bắc Kinh dẫn đầu đã đề xuất một định nghĩa thống nhất vào tháng 4 năm 2026 thông qua OpenWorldLib, loại trừ các mô hình chuyển đổi văn bản thành video thuần túy vì chúng thiếu các vòng lặp phản hồi với thế giới thực. Việc tái tạo 3D và các trình mô phỏng như trong Atlas đủ điều kiện là những khối xây dựng cốt lõi trong khuôn khổ đó vì chúng cung cấp các môi trường nơi các quy luật vật lý có thể được kiểm chứng.

World LabsFei-Fei LiMô hình thế giớiAI 3DRobot học
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.