Mô hình
NVIDIA ra mắt Alpamayo 2 Super: Mô hình VLA mã nguồn mở 34B cho xe tự lái và Robotaxi
(giờ Việt Nam)
Tóm tắt AI
NVIDIA vừa trình làng Alpamayo 2 Super, mô hình thị giác-ngôn ngữ-hành động (VLA) 34 tỷ tham số được tối ưu cho các tình huống lái xe phức tạp. Mô hình này cho phép thương mại hóa ngay lập tức với giấy phép mở, hứa hẹn thúc đẩy mạnh mẽ công nghệ xe tự hành.
Bản dịch AI

NVIDIA vừa phát hành Alpamayo 2 Super, một mô hình hành động-ngôn ngữ-thị giác (VLA) với 34 tỷ tham số dành cho xe tự lái, theo giấy phép thương mại mở. Mục tiêu thiết kế được công bố là giải quyết các sự kiện "long-tail" (đuôi dài): những tình huống hiếm gặp, có sự tham gia của nhiều tác nhân mà các hệ thống phát hiện và dự đoán truyền thống xử lý kém hiệu quả. Mô hình này kết hợp một backbone VLM 32 tỷ tham số, được xây dựng trên NVIDIA Cosmos 3 Super Reasoner và hậu huấn luyện bằng học tăng cường (reinforcement learning), với một bộ giải mã hành động dựa trên khuếch tán (diffusion-based action decoder) 2,3 tỷ tham số. Chỉ với một lần quét qua video từ hệ thống camera toàn cảnh, mô hình sẽ đưa ra quỹ đạo dự kiến, giải thích nguyên nhân của quỹ đạo đó và một meta-action (siêu hành động).
Liệu mô hình này có thể triển khai được không?
Có, và có thể sử dụng cho mục đích thương mại ngay từ ngày đầu tiên. Các trọng số được phát hành theo OpenMDW-1.1, giấy phép cởi mở của Linux Foundation dành cho việc phân phối mô hình mở; mã nguồn tuân theo Apache 2.0. Giấy phép này bao gồm việc tinh chỉnh (fine-tuning), tạo mô hình phái sinh và phân phối thương mại. NVIDIA đang áp dụng OpenMDW cho toàn bộ dòng Alpamayo, vì vậy các bản phát hành trước đó vốn dành cho R&D giờ đây đã có thể triển khai thương mại mà không cần thêm sự cho phép nào khác.
Đầu vào, đầu ra và dữ liệu huấn luyện
Đầu vào là video RGB từ nhiều camera, văn bản và lịch sử chuyển động của xe (egomotion) kèm theo dấu thời gian. Các notebook công khai đã được xác thực sử dụng sáu camera và bốn khung hình lịch sử cho mỗi camera. Egomotion bao gồm phép tịnh tiến 3D cộng với ma trận xoay 3×3, đa thời điểm.
API quỹ đạo trả về 64 điểm tham chiếu (waypoints) trải dài từ 0,1 đến 6,4 giây với khoảng cách 0,1 giây mỗi điểm. Mỗi điểm tham chiếu mang thông tin XYZ trong hệ quy chiếu của xe và một ma trận xoay 3×3.
Dữ liệu huấn luyện bao gồm khoảng 115.000 giờ video lái xe từ nhiều camera với các chú thích về egomotion và quỹ đạo. Nó bao gồm khoảng 3.700.000 dấu vết Chain-of-Causation (CoC) — các giải thích có cấu trúc và liên kết nhân quả về các quyết định lái xe. Dữ liệu huấn luyện hình ảnh vượt quá một tỷ ảnh.
Các tiêu chuẩn đánh giá (Benchmarks)
Trên LingoQA, Alpamayo 2 Super ghi nhận điểm Lingo-Judge là 79,2 và xếp hạng nhất trong số gần 40 mô hình được đánh giá. Trong các thử nghiệm của NVIDIA, nó đã vượt qua Qwen2.5-VL 72B với 17,0 điểm, Gemini 2.5 Pro với 15,1 điểm và GPT-4o với 23,2 điểm.
Hai con số khác quan trọng đối với công việc lập kế hoạch. Đánh giá vòng kín (closed-loop) với AlpaSim trên 910 kịch bản từ tập dữ liệu PhysicalAI-AV-NuRec cho điểm AlpaSim là 1,50 ± 0,13. Đánh giá vòng hở (open-loop) trên 937 mẫu thử thách từ tập dữ liệu PhysicalAI-AV cho kết quả minADE₆ tại 6,4 giây là 0,911m.
Năm đầu ra từ một mô hình
Đối với mỗi tình huống lái xe, mô hình tạo ra một quỹ đạo, một dấu vết CoC giải thích quyết định, một meta-action như nhường đường hoặc chuyển làn, các nhãn tự động suy luận (reasoning auto-labels) và trả lời câu hỏi bằng hình ảnh với khả năng định vị 2D.
Sự kết hợp đó là điều làm cho bản phát hành này trở nên thú vị về mặt vận hành. Các nhà phát triển có thể liên kết những gì mô hình quan sát được với hành động mà nó đã chọn. Các dấu vết CoC tích hợp với quy trình xác thực an toàn NVIDIA Halos và hỗ trợ an toàn AI phù hợp với tiêu chuẩn ISO/PAS 8800.
Được sử dụng như một công cụ gắn nhãn tự động trên dữ liệu đội xe độc quyền, NVIDIA cho biết mô hình giúp rút ngắn chu kỳ chú thích từ hàng tháng xuống còn vài ngày.
Trình giải thích tương tác
Những điểm chính cần lưu ý
Hãy xem blog của NVIDIA và model card trên Hugging Face. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML của chúng tôi cũng như đăng ký nhận Bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, Hugging Face Page, Product Release hoặc Webinar, v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.