NVIDIA AI Blog
71

Nghiên cứu

NVIDIA công bố 3 nghiên cứu đột phá tại CVPR 2026: Đưa AI vào thực tế qua huấn luyện quy mô lớn

(giờ Việt Nam)

Tóm tắt AI

NVIDIA giới thiệu các mô hình mới giúp AI thực hiện thao tác cầm nắm, tự lái và điều khiển robot thông minh hơn nhờ huấn luyện quy mô lớn, đồng thời ra mắt thư viện tăng tốc curoboV2.

Bản dịch AI

Điều làm cho một bộ kẹp robot trở nên hữu ích không phải là khả năng nhặt một vật thể — mà là khả năng nhặt vật thể tiếp theo, và những vật thể sau đó nữa, bằng một công cụ mà nó chưa từng cầm nắm trước đây.

Điều làm cho một hệ thống xe tự hành trở nên an toàn không chỉ là khả năng suy luận qua các tình huống — mà là khả năng thực hiện điều đó đủ nhanh trên phần cứng thực tế được lắp đặt trong xe.

Điều làm cho một tác nhân ảo trở nên có năng lực chính là việc được tiếp xúc với càng nhiều môi trường khác nhau càng tốt trước khi đối mặt với thế giới thực.

Tại hội nghị Computer Vision and Pattern Recognition (CVPR) năm nay, NVIDIA Research đang trình bày ba bài báo giải quyết từng thách thức này — và chia sẻ một chủ đề chung: việc huấn luyện ở quy mô lớn tạo ra các hệ thống có khả năng tổng quát hóa trên nhiều ứng dụng đa dạng.

Ba bài báo này bao gồm các thách thức khác nhau trong nghiên cứu AI vật lý:

NVIDIA GTC Berlin Registration Is Now Open

Tại CVPR, NVIDIA cũng công bố các kỹ năng mới cho tác nhân AI vật lý, giúp các nhà nghiên cứu và nhà phát triển tăng tốc quá trình phát triển xe tự hành, robot và các hệ thống AI thị giác.

NitroGen và một bài báo khác do NVIDIA thực hiện, PixelDIT, đã được vinh danh là những bài báo lọt vào vòng chung kết xuất sắc nhất tại hội nghị — một danh hiệu chỉ dành cho 15 trong số hơn 4.000 bài báo được chấp nhận tại CVPR.

Mô hình nền tảng đầu tiên cho việc cầm nắm (Grasping)

Hầu hết các hệ thống AI cho việc cầm nắm của robot đều là các hệ thống chuyên biệt.

Một chính sách hành động-ngôn ngữ-thị giác được huấn luyện cho bộ kẹp hai ngón chỉ học cách cầm nắm bằng hai ngón đó. Tương tự, một chính sách cho việc cầm nắm khéo léo sẽ chỉ hoạt động với bộ kẹp đa ngón chuyên dụng mà nó được huấn luyện. Với mỗi hiện thân (embodiment) mới, quy trình này thường phải lặp lại — đòi hỏi dữ liệu huấn luyện mới, tinh chỉnh và xác thực. Hạn chế này có nghĩa là hầu hết các công ty robot chọn một bộ kẹp, huấn luyện cho nó và gắn bó với nó.

How Nations Are Deploying AI for Strategic Priorities

GraspGen-X là mô hình nền tảng đầu tiên cho việc cầm nắm được xây dựng để loại bỏ nút thắt này.

Giống như một mô hình ngôn ngữ lớn có thể áp dụng hiểu biết về ngôn ngữ vào một nhiệm vụ mới mà không cần huấn luyện lại, GraspGen-X áp dụng hiểu biết của nó về hình học và tiếp xúc cho bất kỳ bộ kẹp robot nào mà nó gặp phải. Với hình học của một bộ kẹp mới và một vật thể lạ chưa từng thấy trước đây, mô hình sẽ tạo ra các đề xuất tư thế cầm nắm đáng tin cậy để cho phép robot cầm nắm vật thể đó.

https://blogs.nvidia.com/wp-content/uploads/2026/06/GraspGenX.mp4

Để đạt được điều đó, các nhà nghiên cứu cần một tập dữ liệu không thể thu thập được ở quy mô lớn trong thế giới thực. Họ đã tạo ra 2 tỷ mô phỏng cầm nắm trên hàng ngàn hình dạng vật thể và cấu hình bộ kẹp tổng hợp, bao quát sự đa dạng về các yếu tố hình thức mà một robot được triển khai có thể gặp phải.

Đối với các nhà phát triển robot, mô hình nền tảng này loại bỏ nhu cầu về các chu kỳ huấn luyện cho từng bộ kẹp và có thể được áp dụng ngay lập tức cho một số bộ kẹp phổ biến. GraspGenX có thể được sử dụng kết hợp với curoboV2, một thư viện lập kế hoạch chuyển động tăng tốc bằng CUDA mới, để đạt được các tư thế cầm nắm này trong các môi trường chưa biết.

NVIDIA and Partners Build in America, for America

Dựa trên nền tảng nghiên cứu GraspGen, một bài báo khác là Grasp-MPC — được trình bày tại ICRA 2026 — thúc đẩy bước tiếp theo trong quy trình: chuyển từ tạo tư thế cầm nắm sang thực thi cầm nắm vòng lặp kín.

Dạy xe tự hành suy nghĩ nhanh hơn

Trong những năm gần đây, các nhà nghiên cứu nhận thấy rằng việc để AI suy luận — tạo ra các bước suy nghĩ trung gian trước khi đưa ra câu trả lời — giúp cải thiện đáng kể khả năng ra quyết định của nó.

Đối với xe tự hành, thách thức nằm ở việc thực hiện suy luận đó trên phần cứng bên trong một chiếc xe thực tế. Suy luận chuỗi tư duy (chain-of-thought) dựa trên văn bản tạo ra các từ, và mỗi từ là một token cần thời gian để tạo ra. Trên bộ xử lý chạy bên trong xe, số lượng token là một hạn chế thực sự đối với tốc độ phản hồi của hệ thống.

LCDrive giải quyết vấn đề này bằng cách thay thế các từ bằng các biểu diễn tiềm ẩn (latent representations) được nén.

NVIDIA BioNeMo Agent Toolkit Brings Accelerated AI to Life Sciences Researchers in Claude Science

Thay vì tạo ra các bước suy luận mà con người có thể đọc được, hệ thống suy nghĩ trong một không gian tiềm ẩn nhỏ gọn — các trạng thái nắm bắt thông tin không gian thay vì tạo ra văn bản. Kiến trúc này luân phiên giữa hai loại suy nghĩ: đề xuất các hành động ứng viên, sau đó dự đoán thế giới sẽ trông như thế nào nếu các hành động đó được thực hiện.

Nó sử dụng trạng thái thế giới được dự đoán đó để tinh chỉnh bước tiếp theo của mình. Đó là cùng một vòng lặp suy luận — chỉ là ở dạng hiệu quả hơn về mặt tính toán so với ngôn ngữ tự nhiên.

Kết quả: chất lượng quỹ đạo đầu ra tương đương với suy luận dựa trên văn bản, nhưng chỉ sử dụng khoảng một nửa số token.

Mô hình được xây dựng trên NVIDIA Alpamayo và được huấn luyện bằng sự giám sát từ dữ liệu xe hiện có.

Các tác nhân hiện thân (Embodied Agents) được huấn luyện trong thế giới ảo

Into the Omniverse: Three Workflows for Improving Vision AI Agent Accuracy With Synthetic Data and Fine-Tuning

Isaac GR00T — mô hình nền tảng mở của NVIDIA dành cho robot hình người — được xây dựng trên một nguyên tắc đơn giản: cho mô hình tiếp xúc với đủ các tình huống đa dạng, và nó sẽ tổng quát hóa sang những tình huống mà nó chưa từng thấy.

NitroGen mở rộng nguyên tắc đó sang các môi trường ảo, sử dụng kiến trúc GR00T để huấn luyện một mô hình nền tảng cho các tác nhân hiện thân trên phạm vi rộng lớn của các thế giới ảo.

Trò chơi điện tử cung cấp thứ gì đó khó xây dựng từ đầu: các thế giới có cấu trúc, đa dạng với các mục tiêu xác định và các điều kiện thành công được quy định rõ ràng. Chúng là những môi trường huấn luyện chất lượng cao, có sẵn ở quy mô lớn.

NitroGen coi chúng theo cách đó — như một sân tập cho các tác nhân mà sau này sẽ được huấn luyện để xử lý các tình huống mới lạ trong thế giới thực hoặc thế giới mô phỏng, chẳng hạn như vận hành một robot giúp việc nhà dựa trên các hướng dẫn rộng như: "Cất những món đồ này vào tủ đựng thức ăn."

Được huấn luyện qua hơn 1.000 trò chơi và 40.000 giờ tương tác bằng cách sử dụng mô hình dựa trên GR00T, các tác nhân thu được học cách tổng quát hóa trên các môi trường. Mô hình đã được đánh giá qua một loạt các trò chơi nhập vai hành động, trò chơi đi cảnh (platformers), roguelikes và trò chơi thế giới mở, thể hiện các hành vi chơi game bao gồm chiến đấu, điều hướng và khám phá.

https://blogs.nvidia.com/wp-content/uploads/2026/06/NitroGen.mp4

Các kỹ thuật tương tự cuối cùng có thể giúp kích hoạt các nhân vật không thể chơi (NPC) thích ứng hơn, bạn đồng hành AI và các hệ thống trò chơi bên trong game, cũng như thử nghiệm rộng rãi hơn các môi trường trò chơi phức tạp.

Trong điều kiện ít dữ liệu — nơi một tác nhân chỉ thấy một vài ví dụ về một môi trường mới — việc bắt đầu với NitroGen mang lại cho các tác nhân một lợi thế lớn, cải thiện hiệu suất lên đến 52% so với các phương pháp hiện đại trước đây.

Mô hình là mã nguồn mở, có sẵn trên GitHub và Hugging Face.

Tìm hiểu thêm về NVIDIA tại CVPR và khám phá công việc của NVIDIA Research trong lĩnh vực AI vật lý, thị giác máy tính và các hệ thống tự hành. Bắt đầu với Isaac GR00T và các công cụ robot của NVIDIA.

Ý chính từ bài gốc

  • GraspGen-X là mô hình nền tảng đầu tiên cho phép robot nắm bắt vật thể với bất kỳ loại kẹp nào mà không cần huấn luyện lại.
  • LCDrive tối ưu hóa khả năng suy luận của xe tự lái bằng cách sử dụng biểu diễn tiềm ẩn thay vì văn bản, giúp tăng tốc độ xử lý trên phần cứng.
  • NitroGen sử dụng kiến trúc Isaac GR00T để huấn luyện tác nhân AI trong môi trường ảo, giúp chúng thích nghi tốt hơn với các tình huống mới.
  • Việc huấn luyện ở quy mô lớn trên nhiều môi trường và cấu hình khác nhau là chìa khóa để AI có khả năng tổng quát hóa cao.
  • Các mô hình mới giúp giảm đáng kể nhu cầu thu thập dữ liệu thực tế và chu kỳ huấn luyện chuyên biệt cho từng thiết bị.
Tác tử AIRobot hiện thânBài nghiên cứu/Nghiên cứu
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ NVIDIA Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.