QbitAI
95

Mô hình

Fei-Fei Li công bố mô hình thế giới đa phương thức đầu tiên trên thế giới

(giờ Việt Nam)

Tóm tắt AI

Mô hình mới có khả năng tái tạo thế giới 3D chỉ từ một hình ảnh duy nhất, đồng thời hỗ trợ tạo môi trường huấn luyện thực tế cho robot.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

Fei-Fei Li công bố: Mô hình thế giới đa phương thức đầu tiên trên thế giới

02-09-2026 09:07:13 Nguồn: QbitAI

Hoàn thiện thế giới 3D chỉ từ một hình ảnh, còn có thể tạo sân tập cho robot

Tác giả: Yu Yang, đưa tin từ QbitAI

QbitAI | Kênh thông tin chính thức QbitAI

Mô hình thế giới đa phương thức "đầu tiên trên thế giới" đã xuất hiện!

Đến từ World Labs của Fei-Fei Li.

World Labs không ngần ngại dùng những từ ngữ mạnh mẽ cho mô hình thế giới thế hệ mới mang tên Atlas này. Ngoài danh xưng "đầu tiên trên thế giới", slogan của họ cũng nhấn mạnh rõ ràng rằng: lần này, không chỉ đơn thuần là tạo ra một đoạn video có thể tương tác đâu nhé:

Mô hình hóa thế giới, di chuyển camera, mô phỏng không gian và thời gian.

Nghĩa là, Atlas có thể tạo ra hình ảnh và khung hình video với khả năng kiểm soát camera ở cấp độ pixel, đồng thời thực hiện tái tạo 3D. Hơn nữa, nó còn có khả năng hiểu cả không gian và thời gian.

Bản thân Fei-Fei Li coi đây là thành tựu "mang tính cột mốc" của World Labs và đã trực tiếp ghim bài viết này:

Atlas mở ra cánh cửa cho vô số ứng dụng, từ hiệu ứng hình ảnh (VFX) cho đến robot.

Học trò cưng của Fei-Fei Li, Jim Fan – Giám đốc nghiên cứu robot tại NVIDIA – cũng đến ủng hộ và chỉ ra rằng: Đây là một bước tiến lớn trong quy trình Real-to-Sim (từ thực tế sang mô phỏng) trong lĩnh vực robot.

Cụ thể, Atlas là một mô hình Transformer khuếch tán tự hồi quy đa phương thức (multimodal autoregressive diffusion Transformer), với các khả năng bao gồm:

Tạo hình ảnh với kiểm soát camera: Chỉ cần một hình ảnh, Atlas có thể tạo ra hình ảnh và video với khả năng kiểm soát camera ở cấp độ pixel, hỗ trợ xuất video dài tối đa 1 phút với độ phân giải 1440p.

Tái tạo không gian: Atlas có thể tái tạo các cảnh quan thế giới thực dựa trên từ một đến hàng chục hình ảnh đầu vào. Nó không chỉ tạo ra các khung hình từ góc nhìn mới mà còn xuất ra biểu diễn 3D rõ ràng, với hiệu suất vượt trội so với các mô hình hiện tại được huấn luyện chuyên biệt cho tái tạo 3D.

Mô phỏng không gian - thời gian: Atlas có thể mô hình hóa đồng thời không gian và thời gian dựa trên video đầu vào, cho phép thay đổi góc nhìn trong video hiện có, tạo ra các hiệu ứng hình ảnh ấn tượng, đồng thời hỗ trợ quy trình làm việc Real-to-Sim cho robot.

Tạo hình ảnh: Atlas có thể tạo ảnh và ảnh toàn cảnh 360° từ văn bản, tuân thủ các câu lệnh (prompt) phức tạp, kết xuất văn bản chính xác và tạo ra nhiều phong cách hình ảnh đa dạng.

Đối với mô phỏng robot, chỉ cần cung cấp cho Atlas vài bức ảnh, nó có thể tạo ra dữ liệu RGB và dữ liệu chiều sâu chân thực. Nhờ đó, robot có thể được huấn luyện và thử nghiệm trong nhiều không gian mô phỏng đa dạng hơn.

Mô hình thế giới đa phương thức được huấn luyện từ đầu

Về chi tiết kỹ thuật, Atlas là một mô hình toàn năng (omni model).

Mục tiêu của nó là xử lý đồng thời nhiều tác vụ, nhiều loại dữ liệu đầu vào và đầu ra trong một kiến trúc mô hình thống nhất.

Trong đó, kiểm soát không gian là cốt lõi của toàn bộ mô hình.

Để đạt được những mục tiêu này, đội ngũ của Fei-Fei Li đã thiết kế một kiến trúc nền tảng hoàn toàn mới làm cơ sở cho các mô hình thế giới trong tương lai – Transformer khuếch tán tự hồi quy đa phương thức.

Văn bản, hình ảnh, video, dữ liệu 3D... mọi loại đầu vào đều được neo vào không gian ba chiều, từ đó hình thành một ngữ cảnh không gian.

Sau đó, Atlas sẽ tạo ra đầu ra đa phương thức dựa trên ngữ cảnh này.

Nhờ vậy, ví dụ như khi đặt hai hình ảnh tham chiếu không liên quan vào cùng một ngữ cảnh và chỉ định vị trí của chúng trong không gian 3D, Atlas có thể ghép chúng lại thành một thế giới có không gian tự nhiên và liên tục.

Cụ thể hơn, đa phương thức có nghĩa là Atlas có thể xử lý nguyên bản nhiều loại dữ liệu khác nhau, bao gồm văn bản, hình ảnh, tư thế camera, bản đồ chiều sâu 3D, v.v.

Video được biểu diễn dưới dạng chuỗi hình ảnh.

Mỗi hình ảnh và mỗi bản đồ chiều sâu đều tương ứng với một tư thế camera xác định.

Tự hồi quy (autoregressive) có nghĩa là Atlas vận hành trên một chuỗi các phần tử, trong đó mỗi phần tử trong chuỗi có thể thuộc về một trong các phương thức dữ liệu đã đề cập ở trên.

Mỗi khi Atlas tạo ra một đầu ra mới, nó sẽ lấy nội dung của chuỗi đã tồn tại trước đó làm điều kiện.

Thiết kế linh hoạt này vốn dĩ rất phù hợp cho nhiều tác vụ khác nhau.

Mỗi tác vụ, về bản chất, chỉ là một loại chuỗi khác nhau – phần trước là đầu vào, phần sau là đầu ra.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.