Hugging Face Blog
92

Mô hình

NVIDIA ra mắt Cosmos 3 Edge: Bước tiến mới trong mô hình tạo video thế hệ tiếp theo

(giờ Việt Nam)

Tóm tắt AI

NVIDIA giới thiệu Cosmos 3 Edge, mô hình tạo video tiên tiến được tối ưu hóa cho hiệu suất cao, cho phép tạo nội dung hình ảnh động chất lượng vượt trội với độ trễ thấp.

Bản dịch AI

Introducing Cosmos 3 Edge

Quay lại các bài viết

Thế giới thực vô cùng rộng lớn và để vận hành trong đó, các hệ thống AI vật lý cần hiểu cách một khung cảnh thay đổi, dự đoán những gì có thể xảy ra tiếp theo và xác định cách một hành động sẽ tác động đến thế giới.

Các cỗ máy đang vận hành tại biên (edge) trong các nhà máy, kho bãi, bệnh viện và nhiều nơi khác. Để hiểu và hành động trong các môi trường này, chúng cần những mô hình mang lại hiệu suất cấp trung tâm dữ liệu trên các hệ thống bị hạn chế về bộ nhớ.

Hôm nay, chúng tôi ra mắt NVIDIA Cosmos 3 Edge trên kho lưu trữ Cosmos 3 của Hugging Face. Đây là mô hình thế giới mở với 4 tỷ tham số, giúp robot và các tác nhân AI thị giác hiểu được môi trường xung quanh, suy luận trong thời gian thực và tạo ra các hành động cho robot trên các thiết bị biên.

Tải xuống mô hình: https://huggingface.co/nvidia/Cosmos3-Edge

Mô hình mang lại khả năng suy luận hiệu quả về bộ nhớ và thông lượng cao trên các máy tính biên của NVIDIA, bao gồm GPU NVIDIA RTX PRO, NVIDIA DGX, GPU NVIDIA GeForce RTX™, và NVIDIA Jetson, bao gồm cả các mô-đun Jetson T2000 và T3000 vừa được công bố.

Được thiết kế như một mô hình mở nhỏ gọn, có thể đóng vai trò là một mô hình ngôn ngữ thị giác (VLM) nhỏ với thông lượng và độ chính xác tốt nhất trong phân khúc cùng khả năng suy luận thời gian thực.

Là một mô hình hành động thế giới (WAM) đã qua huấn luyện hậu kỳ, Cosmos 3 Edge hoạt động ở độ phân giải điều khiển robot (quan sát 640×360), mang lại khả năng suy luận thời gian thực và tạo ra 32 hành động mỗi lần suy luận trên NVIDIA Jetson Thor - đồng thời đạt được khả năng điều khiển thời gian thực ở tốc độ 15 Hz.

Trong số các mô hình có kích thước tương đương (4 tỷ tham số), Cosmos 3 Edge xếp hạng #1 trên VANTAGE-Bench về phân tích thị giác và đạt trạng thái tiên tiến (state-of-the-art) về học chính sách robot, thiết lập chuẩn mực mới cho cơ sở hạ tầng thông minh và robot.

Cosmos 3 Video

Mô hình hóa thế giới là gì?

Một mô hình thế giới học cách môi trường thay đổi theo thời gian. Nó biểu diễn các đối tượng, chuyển động, mối quan hệ không gian và tác động của các hành động.

Hãy xem xét một robot đang với lấy một vật thể. Việc nhận diện vật thể chỉ là bước đầu tiên. Robot cũng phải hiểu vật thể đó đang ở đâu, bộ phận kẹp của nó đang di chuyển như thế nào, điều gì có thể xảy ra khi tiếp xúc và hành động nào có khả năng hoàn thành nhiệm vụ thành công nhất.

Một mô hình thế giới giúp robot suy luận về các mối quan hệ này. Nó có thể dự đoán kết quả hình ảnh của một hành động, suy luận ra hành động đã gây ra sự thay đổi hoặc tạo ra một hành động để tạo ra kết quả mong muốn.

Cosmos 3 Edge tập hợp những khả năng này vào một mô hình duy nhất, chạy ngay trên thiết bị. Cách biểu diễn chia sẻ của nó cho phép các hệ thống AI vật lý hiểu trạng thái thế giới hiện tại, mô phỏng các tương lai có thể xảy ra và kết nối những tương lai đó với các hành động.

Hai tháp Transformer, một cách biểu diễn chia sẻ

Cosmos 3 kết hợp hai tháp transformer:

Hai tháp này duy trì các lớp chuẩn hóa và mạng perceptron đa lớp riêng biệt. Chúng chia sẻ các lớp chú ý đa phương thức (multimodal attention layers), giúp căn chỉnh thông tin giữa ngôn ngữ, video, âm thanh và hành động.

Thiết kế này cho phép mô hình suy luận về một khung cảnh trước khi tạo ra đầu ra. Tùy thuộc vào nhiệm vụ, Cosmos 3 có thể tạo ra các token suy luận từ tháp tự hồi quy (autoregressive tower) hoặc các token video và hành động đã khử nhiễu từ tháp khuếch tán (diffusion tower).

Mô hình chú ý cũng được điều chỉnh cho phù hợp với từng loại thông tin. Ngôn ngữ sử dụng chú ý nhân quả (causal attention), nơi mỗi token chú ý đến các token đứng trước nó. Các token khuếch tán chú ý rộng hơn đến bối cảnh có sẵn, hỗ trợ việc dự đoán và tạo nội dung nhất quán.

Cùng với nhau, các thành phần này cung cấp cho mô hình một cách biểu diễn chung về những gì đang xảy ra, những gì có thể xảy ra tiếp theo và cách một hành động có thể ảnh hưởng đến kết quả.

ababa

Một cách biểu diễn chung cho hành động

Các hệ thống vật lý mô tả hành động theo những cách khác nhau. Một phương tiện có thể biểu diễn hành động thông qua tư thế và chuyển động của chính nó (ego pose). Một camera sử dụng chuyển động của camera. Một cánh tay robot sử dụng tư thế của bộ phận tác động cuối (end effector), trong khi bàn tay hoặc bộ phận kẹp cũng cần biểu diễn trạng thái nắm giữ.

Cosmos 3 ánh xạ các hiện thân khác nhau này vào một cách biểu diễn hành động chung.

Các hành động được mã hóa thành các vectơ hình học nhỏ gọn nắm bắt:

Điều này tạo ra mối liên kết trực tiếp giữa điều khiển và cấu trúc thị giác của thế giới. Mô hình có thể liên kết các thay đổi trong pixel với chuyển động vật lý, mối quan hệ không gian và các đầu vào điều khiển.

Kết quả là, video được tạo ra trở nên nhiều hơn là một dự đoán hình ảnh. Nó có thể biểu diễn cách thế giới dự kiến sẽ thay đổi để phản ứng lại một hành động. Điều này cung cấp cho các nhà phát triển dữ liệu huấn luyện dựa trên chuyển động, điều khiển và nguyên nhân - kết quả.

Chế độ chính sách (Policy Mode)

Với vai trò là một chính sách, Cosmos 3 dự đoán một hành động cùng với kết quả hình ảnh dự kiến của nó.

Mô hình có thể tạo ra những gì hệ thống nên làm và mô phỏng những gì có khả năng xảy ra tiếp theo. Điều này kết nối trực tiếp việc mô hình hóa thế giới với quá trình huấn luyện và đánh giá chính sách robot.

Đầu vào là trạng thái hiện tại, đầu ra là hành động và kết quả hình ảnh.

Các chế độ này cho phép một mô hình học được nguyên nhân, kết quả và chính sách. Hành động có thể truyền qua mô hình theo cả hai hướng, cho phép Cosmos 3 Edge dự đoán tác động của một hành động hoặc suy luận ra một hành động từ các tác động của nó.

Robot arm picking up a banana

Lệnh (Prompt): Nhặt quả chuối và đặt nó vào đĩa.

Chúng tôi cũng ra mắt Cosmos 3 Edge Policy (DROID): Một chính sách thao tác robot được huấn luyện hậu kỳ trên tập dữ liệu DROID cho các nhiệm vụ gắp và đặt, kèm theo các tập lệnh huấn luyện hậu kỳ.

Các nhà phát triển có thể sử dụng một cụm nhỏ H100 hoặc NVIDIA DGX Station để tinh chỉnh Cosmos 3 Edge một cách hiệu quả cho các khối lượng công việc mục tiêu của họ trước khi triển khai lên các nền tảng tính toán biên và tăng tốc của NVIDIA.

Các mẫu đã qua huấn luyện hậu kỳ để cải thiện hiệu suất

Bên cạnh các mô hình cơ sở, chúng tôi đang phát hành các điểm kiểm tra (checkpoints) huấn luyện hậu kỳ tham chiếu và các công thức huấn luyện để giúp các nhà phát triển điều chỉnh và tối ưu hóa Cosmos 3 cho các ứng dụng của riêng họ.

NVIDIACosmos 3AI tạo videoGenerative AICông nghệ mới
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.