Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
92

Mô hình

World Labs ra mắt Atlas: Mô hình thế giới đa phương thức cho trí tuệ không gian

(giờ Việt Nam)

Tóm tắt AI

World Labs giới thiệu Atlas, mô hình thế giới sử dụng kiến trúc Transformer khuếch tán tự hồi quy, có khả năng xử lý đồng thời văn bản, hình ảnh, video và 3D. Mô hình vượt trội trong việc tạo video có kiểm soát camera và tái tạo 3D, mở ra tiềm năng lớn cho mô phỏng không gian.

Bản dịch AI

Atlas: A World Model for Spatial Intelligence

Các mô hình thế giới (world models) có khả năng tạo, tái tạo và mô phỏng bất kỳ thế giới khả thi nào. Chúng hiểu cách các thế giới xuất hiện, vận hành và tiến hóa để chúng ta có thể dựng nên những thế giới tưởng tượng cho người dùng sáng tạo, mô phỏng thế giới thực với độ trung thực cao và hỗ trợ robot lập kế hoạch hành động. Tại World Labs, chúng tôi xây dựng các mô hình thế giới đa năng này nhằm theo đuổi trí tuệ không gian (spatial intelligence).

Hôm nay, chúng tôi giới thiệu Atlas, mô hình thế giới thế hệ tiếp theo của mình. Atlas là một mô hình toàn diện (omni model) mà chúng tôi đã huấn luyện từ đầu để vận hành tự nhiên trên văn bản, hình ảnh, video và 3D. Đây là một mô hình transformer khuếch tán tự hồi quy đa phương thức: tất cả các đầu vào được kết hợp vào một ngữ cảnh không gian chung. Atlas sử dụng ngữ cảnh đó để tạo ra những gì tiếp theo, duy trì tính nhất quán trong không gian 3D với mọi thứ nó đã thấy và hình dung những gì nằm ngoài tầm nhìn đó. Atlas được xây dựng để mở rộng quy mô: hiệu suất của nó cải thiện khi tăng cường tính toán huấn luyện, và chúng tôi kỳ vọng xu hướng này sẽ tiếp tục khi chúng tôi mở rộng quy mô hơn nữa.

Atlas có thể thực hiện một loạt các tác vụ bao gồm tạo, tái tạo và mô phỏng thế giới:

Atlas sẽ cung cấp sức mạnh cho các phiên bản tương lai của Marble và các sản phẩm khác từ World Labs.

Tạo hình dựa trên điều khiển camera

Atlas lấy một hoặc nhiều hình ảnh tham chiếu và tạo ra các góc nhìn mới tại bất kỳ vị trí và góc camera nào bạn chỉ định. Các góc nhìn được tạo ra khớp với nội dung và hình học của hình ảnh đầu vào, ngoại suy một cách mượt mà vượt ra ngoài phạm vi đó để hình dung các phần của cảnh không hiển thị trong đầu vào.

Atlas xử lý nhiều loại cảnh, phong cách hình ảnh và chuyển động camera khác nhau.

Các video được tạo từ một đến sáu hình ảnh đầu vào với các đường di chuyển camera được thiết kế thủ công.

Điều khiển camera chuẩn xác từng pixel

Atlas sử dụng hình học camera chính xác làm loại đầu vào gốc, vượt xa các hướng dẫn dựa trên văn bản thô sơ để điều khiển camera. Điều này cho phép bạn căn khung hình cho mọi cảnh quay và kiểm soát mọi chuyển động.

Trong các ví dụ tại đây, Atlas tạo ra một cảnh hoàn chỉnh từ một hình ảnh đầu vào duy nhất. Nó sử dụng nội dung của hình ảnh đầu vào cùng với kiến thức thế giới sâu rộng của mình để hình dung cảnh đó trông như thế nào từ các góc độ mới. Ví dụ, nó tạo ra mặt sau của robot và dự đoán rằng nên có một bãi cỏ bên cạnh hồ bơi.

Từ một hình ảnh duy nhất, Atlas tạo ra các góc nhìn từ bất kỳ hướng nào. Kéo để thay đổi góc nhìn.

Tạo hình với ngữ cảnh không gian

Tương tự như một LLM, Atlas trước tiên mã hóa các đầu vào của nó thành một ngữ cảnh, sau đó tạo ra các đầu ra dựa trên ngữ cảnh đó. Tuy nhiên, Atlas độc đáo ở chỗ mỗi hình ảnh được đặt tại một vị trí 3D trong không gian; điều này tạo thành một ngữ cảnh không gian.

Việc quản lý ngữ cảnh không gian này mở ra những loại hình kiểm soát sáng tạo hoàn toàn mới. Ví dụ, bạn có thể đặt hai hình ảnh tham chiếu không liên quan vào ngữ cảnh, định vị chúng trong không gian 3D và Atlas sẽ tạo ra một thế giới nội suy mượt mà giữa chúng.

Những ví dụ này chứng minh kiến thức thế giới và khả năng sáng tạo của mô hình; nó hình dung ra các ô cửa, hành lang, góc khuất và các chuyển tiếp khác giữa những hình ảnh đầu vào vốn không liên quan đến nhau.

Chọn khung hình bên trái và bên phải để điền vào ngữ cảnh không gian, và Atlas sẽ khâu chúng lại với nhau.

Video dài có thể kiểm soát

Atlas cho phép bạn tạo các video dài với khả năng kiểm soát chính xác bằng cách kết hợp chuyển động camera và quản lý ngữ cảnh không gian. Bạn thiết kế mọi cảnh và mọi góc camera. Điều này đặt bạn vào vị trí đạo diễn: bạn là người dàn dựng cảnh quay, chứ không phải là người kéo cần gạt của một chiếc máy đánh bạc.

Trong ví dụ dưới đây, chúng tôi tạo một video dài 1 phút ở độ phân giải 1440p bằng cách sử dụng một số lượng nhỏ hình ảnh tham chiếu. Chúng tôi thiết kế thủ công đường di chuyển của camera xuyên qua cảnh quay và Atlas tạo ra một thế giới nhất quán. Các video còn lại trên trang này đã được nén để tối ưu hóa hiệu suất tải trang.

Tái tạo không gian

Atlas tái tạo các không gian thế giới thực từ một hoặc nhiều hình ảnh đầu vào. Nó không yêu cầu thiết bị ghi hình đặc biệt hay hàng trăm góc nhìn dày đặc để tái tạo trung thực các vật thể và cảnh quay. Chúng tôi tin rằng Atlas là một bước tiến lớn trong việc giải quyết vấn đề tổng hợp góc nhìn mới từ các đầu vào thưa thớt, một bài toán cơ bản đã tồn tại hàng thập kỷ trong thị giác máy tính 3D.

Tái tạo từ nhiều hình ảnh

Atlas có thể nhận số lượng góc nhìn đầu vào thay đổi cho một cảnh. Khi các phần của thế giới không hiển thị trong các góc nhìn đầu vào, Atlas hình dung một cách hợp lý để lấp đầy các khoảng trống bằng cách tận dụng kiến thức thế giới phong phú của mình.

Nhưng đôi khi bạn không muốn sự tưởng tượng; bạn có thể muốn một bản tái tạo chính xác của một địa điểm thực tế. Việc cung cấp thêm hình ảnh đầu vào mang lại cho Atlas nhiều ngữ cảnh hơn: nó càng thấy nhiều, nó càng ít phải tưởng tượng. Atlas thường đưa ra các bản tái tạo trung thực chỉ với hai hoặc ba hình ảnh, vượt trội hơn các kết quả tiên tiến nhất từ các mô hình được huấn luyện chuyên biệt chỉ để tái tạo 3D. Tuy nhiên, Atlas cũng có thể sử dụng hơn một trăm hình ảnh đầu vào trong ngữ cảnh không gian của nó, cho phép tái tạo trung thực các môi trường thế giới thực.

Trong ví dụ đầu tiên dưới đây, Atlas tạo ra góc nhìn từ trên không của cảnh quay chỉ từ một bức ảnh chụp ở mặt đất. Khu vườn hiển thị trong bức ảnh đầu vào duy nhất được tái tạo chính xác trong đầu ra của mô hình, nhưng phần còn lại của cảnh quay là do tưởng tượng. Sau khi thêm hình ảnh đầu vào thứ hai về ngôi nhà nhỏ bên cạnh khu vườn, đầu ra của mô hình hiển thị cả khu vườn và ngôi nhà nhỏ, nhưng nó vẫn tưởng tượng ra ngôi nhà ở phía bên trái. Sau khi thêm hình ảnh đầu vào thứ ba về ngôi nhà chính, toàn bộ cảnh quay được mô tả chính xác.

Trong ví dụ thứ hai, chúng tôi xây dựng Main Quad của Stanford từng phần một, bắt đầu với lối vào chính đầy cỏ và kết thúc với những bức tranh khảm đầy màu sắc trang trí trên mặt tiền của Memorial Church. Mặc dù Atlas chỉ nhận từ hai đến hai mươi lăm hình ảnh đầu vào ở mặt đất, nó có thể tạo ra các đường di chuyển từ góc nhìn trên không bay cao phía trên khuôn viên trường.

Tái tạo các đường di chuyển đa dạng

Atlas có thể tạo ra nhiều quỹ đạo khác nhau xuyên qua cùng một cảnh, mang lại những góc nhìn mới về cùng các hình ảnh đầu vào. Dù bạn thay đổi đường di chuyển của camera bao nhiêu lần, cảnh quay vẫn giữ được tính nhất quán.

Trong ví dụ dưới đây, chúng tôi cho thấy rằng với một tập hợp nhỏ các hình ảnh đầu vào, Atlas có thể tạo ra nhiều đường di chuyển camera xuyên qua cùng một cảnh. Các đường di chuyển camera khác nhau có thể nhấn mạnh các phần khác nhau của cảnh quay, hoặc thay đổi tâm trạng bằng cách thay đổi tốc độ, độ dài hoặc độ phức tạp.

Atlas có thể tạo ra nhiều đường di chuyển khác nhau xuyên qua cùng một cảnh bằng cách sử dụng một tập hợp nhỏ các hình ảnh đầu vào.

Đầu ra 3D rõ ràng

Trong các kết quả trên, bạn đã thấy Atlas xuất ra hình ảnh và video 2D, vốn đã đủ cho một số ứng dụng. Nhưng các quy trình làm việc trong robot, trò chơi, thiết kế, VFX và hơn thế nữa thường yêu cầu các đầu ra 3D rõ ràng. Atlas vận hành tự nhiên trên cả khung hình 2D và bản đồ độ sâu 3D, cho phép nó xuất ra các thế giới dưới dạng đám mây điểm (point clouds) hoặc 3D Gaussian splats.

Từ một hình ảnh, Atlas tạo ra các góc nhìn mới và hình học 3D, sau đó chuyển đổi thành 3D Gaussian splats.

Từ một hình ảnh đầu vào duy nhất, Atlas tạo ra một thế giới 3D đầy đủ bằng cách đồng thời tạo các góc nhìn mới và ước tính hình học của chúng. Từ một video về không gian thực, nó dự đoán độ sâu của từng khung hình và kết hợp chúng thành một bản tái tạo 3D. Trong cả hai trường hợp, Atlas đều lấp đầy các vùng mà không camera nào từng nhìn thấy.

Atlas có thể tái tạo đám mây điểm 3D từ các video đầu vào.

Đám mây điểm ước tính hình học của cảnh, nhưng 3D Gaussian splats làm cho nó trở nên hữu dụng. Atlas lấp đầy các khoảng trống còn lại và biến đám mây điểm thành một cảnh splat hoàn chỉnh có thể hiển thị trên thiết bị với độ phân giải và tốc độ khung hình cao. Đây là cùng một biểu diễn được sử dụng trong Marble, cho phép Atlas tích hợp tự nhiên với các sản phẩm còn lại của chúng tôi.

Mô phỏng không gian-thời gian

Atlas đóng vai trò như một trình mô phỏng thế giới. Nó hiểu cả cấu trúc không gian của thế giới và cách thế giới tiến hóa theo thời gian. Việc kết hợp các khả năng không gian và thời gian của nó dẫn đến các ứng dụng mới cho VFX, robot và hơn thế nữa.

World LabsAtlasMô hình thế giớiTrí tuệ không gianAI 3D
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.