MarkTechPost
92

Mô hình

NVIDIA ra mắt Cosmos 3 Edge: Mô hình thế giới 4 tỷ tham số giúp robot tự suy luận và hành động tại chỗ

(giờ Việt Nam)

Tóm tắt AI

NVIDIA giới thiệu Cosmos 3 Edge, mô hình AI 4 tỷ tham số tối ưu cho thiết bị biên, cho phép robot hiểu môi trường, suy luận thời gian thực và tự thực hiện hành động mà không cần kết nối đám mây.

Bản dịch AI

NVIDIA Releases Cosmos 3 Edge: A 4B-Parameter Open World Model That Reasons and Generates Robot Actions On-Device

NVIDIA vừa ra mắt Cosmos 3 Edge, một mô hình thế giới mở (open world model) với 4 tỷ tham số được xây dựng để chạy trực tiếp trên thiết bị (on-device). Mô hình này giúp robot và các tác nhân AI thị giác hiểu được môi trường xung quanh, suy luận theo thời gian thực và tạo ra các hành động của robot ngay tại chỗ.

Dòng Cosmos 3 bao gồm Cosmos 3 Nano (16B) và Cosmos 3 Super (64B) đã được phát hành vào ngày 31 tháng 5 năm 2026 tại GTC Taipei. Edge là phiên bản thứ ba và cũng là phiên bản nhỏ nhất, với kích thước chỉ bằng khoảng 1/16 so với bản Super.

Vấn đề ở đây rất cụ thể. Các cỗ máy vận hành tại biên (edge) trong các nhà máy, kho bãi và bệnh viện. Chúng cần hiệu suất cấp trung tâm dữ liệu trên các hệ thống bị hạn chế về bộ nhớ. Cosmos 3 Edge nhắm đến việc giải quyết khoảng trống đó.

Mô hình thế giới (world model) làm được gì ở đây?

Một mô hình thế giới học cách môi trường thay đổi theo thời gian. Nó biểu diễn các đối tượng, chuyển động, mối quan hệ không gian và tác động của các hành động.

Hãy xem xét một robot đang vươn tay lấy một vật thể. Việc nhận diện vật thể chỉ là bước đầu tiên. Robot còn phải theo dõi vị trí của vật thể đó, cách bộ phận kẹp di chuyển và điều gì xảy ra khi tiếp xúc. Một mô hình thế giới sẽ suy luận về các mối quan hệ này. Nó có thể dự đoán kết quả hình ảnh của một hành động, suy luận ra hành động đã gây ra sự thay đổi, hoặc tạo ra một hành động để đạt được mục tiêu.

Cosmos 3 Edge mang những khả năng này vào một mô hình duy nhất trên thiết bị. Cách biểu diễn chia sẻ của nó cho phép hệ thống hiểu trạng thái thế giới hiện tại, mô phỏng các tương lai có thể xảy ra và kết nối những tương lai đó với các hành động.

Cosmos 3 sử dụng kiến trúc Mixture-of-Transformers với hai tháp (two towers), được mô tả trong báo cáo kỹ thuật của NVIDIA.

Tháp tự hồi quy (autoregressive tower) xử lý các token thị giác và văn bản để hiểu và suy luận. Tháp khuếch tán (diffusion tower) xử lý các token thị giác, âm thanh và hành động để dự đoán, tạo nội dung và mô phỏng thần kinh.

Hai tháp này duy trì các lớp chuẩn hóa và mạng perceptron đa lớp riêng biệt. Chúng chia sẻ các lớp chú ý đa phương thức (multimodal attention layers), giúp căn chỉnh thông tin giữa ngôn ngữ, video, âm thanh và hành động. Điều này cho phép mô hình suy luận về một cảnh trước khi tạo ra kết quả đầu ra.

Mô hình chú ý (attention pattern) thích ứng với từng phương thức. Ngôn ngữ sử dụng cơ chế chú ý nhân quả (causal attention), nơi mỗi token chú ý đến các token trước đó. Các token khuếch tán chú ý rộng hơn đến ngữ cảnh có sẵn, hỗ trợ việc dự đoán và tạo nội dung nhất quán. Tùy thuộc vào tác vụ, mô hình sẽ phát ra các token suy luận từ tháp tự hồi quy, hoặc các token video và hành động đã khử nhiễu từ tháp khuếch tán.

Cosmos 3 Edge sử dụng một transformer dày đặc 2B cho bộ phận suy luận và tuân theo các quy ước thông điệp tương thích với Qwen3-VL cho đầu vào hình ảnh và video, theo kho lưu trữ Cosmos trên GitHub.

Một cách biểu diễn hành động duy nhất cho mọi hiện thân (embodiment)

Các hệ thống vật lý mô tả hành động theo những cách khác nhau. Một phương tiện sử dụng tư thế và chuyển động của bản thân (ego pose). Một camera sử dụng chuyển động của camera. Một cánh tay robot sử dụng tư thế của bộ phận tác động cuối (end effector), và bộ phận kẹp sẽ bổ sung thêm trạng thái nắm giữ.

Cosmos 3 ánh xạ các hiện thân này vào một cách biểu diễn hành động chung. Các hành động được mã hóa dưới dạng các vectơ hình học nhỏ gọn, nắm bắt được sự tịnh tiến, xoay và trạng thái thao tác.

Điều này kết nối việc điều khiển với cấu trúc thị giác của thế giới. Mô hình liên kết các thay đổi pixel với chuyển động vật lý và các đầu vào điều khiển. Video được tạo ra sau đó không chỉ đơn thuần là một dự đoán. Nó đại diện cho cách thế giới sẽ thay đổi như thế nào để phản ứng lại một hành động.

Các chiều hành động được hỗ trợ phụ thuộc vào hiện thân. Kho lưu trữ Cosmos trên GitHub liệt kê chuyển động camera (9D), phương tiện tự hành (9D), chuyển động góc nhìn thứ nhất (57D), robot một tay (10D), robot hai tay (20D) và robot hình người (29D).

Chế độ chính sách (policy mode) chạy theo cả hai hướng

Với vai trò là một chính sách (policy), Cosmos 3 Edge dự đoán một hành động cùng với hệ quả thị giác dự kiến của nó. Trạng thái hiện tại được đưa vào; một hành động và kết quả thị giác có khả năng xảy ra sẽ được xuất ra.

Luồng hành động diễn ra theo cả hai hướng. Mô hình có thể dự đoán tác động của một hành động, hoặc suy luận ra hành động từ tác động của nó. Điều này kết nối trực tiếp việc mô hình hóa thế giới với quá trình huấn luyện và đánh giá chính sách robot.

NVIDIA cũng đã phát hành Cosmos 3 Edge Policy (DROID). Đây là một chính sách thao tác robot được huấn luyện bổ sung trên tập dữ liệu DROID cho các tác vụ gắp và đặt (pick-and-place), kèm theo các tập lệnh huấn luyện bổ sung. Các nhà phát triển có thể tinh chỉnh trên một cụm H100 nhỏ hoặc NVIDIA DGX Station trước khi triển khai.

Liệu nó có khả thi để triển khai?

Cosmos 3 Edge mang lại khả năng suy luận tiết kiệm bộ nhớ trên các máy tính biên của NVIDIA. Các mục tiêu bao gồm GPU NVIDIA RTX PRO, NVIDIA DGX, GPU GeForce RTX và NVIDIA Jetson, bao gồm cả các mô-đun Jetson T2000 và T3000 mới được công bố.

Là một mô hình hành động thế giới (WAM) đã qua huấn luyện bổ sung, mô hình hoạt động ở độ phân giải điều khiển robot là 640×360 quan sát. Trên NVIDIA Jetson Thor, nó tạo ra 32 hành động mỗi lần suy luận, đồng thời đạt được khả năng điều khiển thời gian thực ở tốc độ 15 Hz. Đối với việc tạo nội dung, phiên bản Edge hỗ trợ độ phân giải 256p và 480p, tốc độ 12–30 khung hình/giây và 50–150 khung hình.

Sử dụng khung Cosmos mở, các nhà phát triển có thể huấn luyện bổ sung Cosmos 3 Edge cho một hiện thân và bộ cảm biến cụ thể trong khoảng một ngày. NVIDIA định vị GeForce RTX 3070 hoặc tốt hơn là nền tảng cục bộ để tạo mẫu.

Những điểm chính cần lưu ý

Nguồn: Bài đăng ra mắt trên Hugging Face, thẻ mô hình Cosmos3-Edge, bộ sưu tập Cosmos 3, báo cáo kỹ thuật của NVIDIA (PDF), Cosmos GitHub, blog nhà phát triển NVIDIA, blog Jetson Thor và NVIDIA Newsroom: Liên minh Nhật Bản.

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt nền tảng truyền thông Trí tuệ nhân tạo Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với người xem.

NVIDIACosmos 3 EdgeRobot AIAI biênMô hình thế giới
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.