Mô hình
Google DeepMind ra mắt Gemini Robotics 2: Đột phá trí tuệ toàn thân cho robot
(giờ Việt Nam)
Tóm tắt AI
Gemini Robotics 2 tích hợp trí tuệ toàn thân, cho phép robot phối hợp linh hoạt giữa tay, chân và thân mình để thực hiện các tác vụ phức tạp trong môi trường thực tế.
Bản dịch AI
30 tháng 7, 2026 Các mô hình
Carolina Parada
Từ bàn chân đến đầu ngón tay — chúng tôi đang dạy cho robot khả năng điều khiển toàn thân thông minh, sự khéo léo tinh tế và tinh thần đồng đội để hoàn thành hàng loạt các nhiệm vụ phức tạp.
Trong nhiều thập kỷ, chúng ta đã mơ về những robot có thể bước vào thế giới của mình một cách tự nhiên và hỗ trợ con người. Giờ đây, tầm nhìn đó đã tiến thêm một bước quan trọng.
Hầu hết các robot hiện nay đều được lập trình sẵn hoặc điều khiển từ xa cho các chuỗi nhiệm vụ hẹp và lặp đi lặp lại. Chúng thiếu khả năng tự học hỏi hoặc thích nghi với các môi trường không thể dự đoán trước. Hơn nữa, việc chuyển giao các kỹ năng đã học từ cơ thể robot này sang cơ thể robot khác vẫn cực kỳ khó khăn. Để giải quyết những vấn đề khó khăn nhất ở quy mô lớn, robot ở mọi hình dáng và kích thước đều cần các mô hình AI cung cấp khả năng suy nghĩ, hành động và tương tác một cách thông minh để hoàn thành nhiệm vụ một cách an toàn.
Chúng tôi đã chứng minh cách khả năng hiểu đa phương thức của Gemini có thể thúc đẩy hành động trong thế giới thực với Gemini Robotics. Hôm nay, chúng tôi giới thiệu Gemini Robotics 2 - lớp trí tuệ vận hành thế hệ robot thực sự thích ứng tiếp theo. Khi thực hiện những bước đi đầu tiên theo nghĩa đen, bước tiến lớn này mở ra khả năng điều khiển toàn thân thông minh, sự khéo léo tiên tiến và sự hợp tác giữa nhiều robot.
Gemini Robotics 2 cho phép robot suy luận qua từng chuyển động, mở ra phạm vi nhiệm vụ rộng lớn. Ví dụ, nó có thể giúp một robot hình người đi bộ, cúi người, vươn người và thao tác với các đồ vật để dọn dẹp một căn phòng bừa bộn. Nó thậm chí có thể phối hợp với các robot khác để hoàn thành công việc nhanh hơn. Trí tuệ sâu sắc này cũng có thể chạy cục bộ trên thiết bị trong khi thích ứng liền mạch với các cơ thể robot hoàn toàn mới chỉ trong vài giờ.
Chúng tôi hiện thực hóa điều này thông qua ba mô hình có năng lực cao:
Gemini Robotics ER 2, mô hình suy luận của chúng tôi, hiện đã có sẵn trên Google AI Studio và trong bản xem trước riêng tư trên Gemini Enterprise Agent Platform. Các mô hình VLA và On-Device của chúng tôi đã có sẵn cho các đối tác truy cập sớm. Hãy đọc cách đưa các mô hình này vào phần cứng của bạn trên blog Nhà phát triển của chúng tôi.
Robot hình người trong chuyển động: Quản lý các nhiệm vụ toàn thân
Thế giới được xây dựng cho các chuyển động của con người; nó đòi hỏi chúng ta phải vươn người, cúi người và giữ thăng bằng trong những không gian chật hẹp, bừa bộn. Trong khi các mô hình trước đây của chúng tôi điều khiển phần thân trên của robot hình người để thực hiện các nhiệm vụ trên mặt bàn, Gemini Robotics 2 mở rộng AI vật lý sang các chuyển động toàn thân.
Lần đầu tiên, mô hình của chúng tôi có thể điều khiển toàn bộ robot hình người, chuyển đổi ý định thành khả năng điều khiển toàn thân thông minh. Ví dụ, khi điều khiển robot hình người Apollo 2 của Apptronik, chúng ta có thể yêu cầu nó “đặt bình tưới nước vào thùng màu xanh lá cây ở kệ dưới cùng”. Apollo xử lý hướng dẫn, đi đến bàn, nhặt bình tưới nước, bước vài bước đến kệ và đặt nó chính xác vào vị trí đích. Mặc dù robot của chúng tôi cần cải thiện thêm về tốc độ di chuyển, đây là một bước quan trọng hướng tới các kỹ năng cần thiết để hoàn thành các nhiệm vụ phức tạp hơn trong thế giới thực đòi hỏi sự phối hợp toàn thân.
Mang lại sự khéo léo tiên tiến cho bàn tay và bộ kẹp
Để thực sự hữu ích trong gia đình và nơi làm việc, robot cần sự tinh tế. Gemini Robotics 2 mở ra một cấp độ khéo léo vật lý mới trên các thiết bị đầu cuối khác nhau, cho dù robot đang sử dụng bàn tay hay bộ kẹp, giúp robot trở nên hữu ích hơn bao giờ hết.
Mô hình hiện có thể điều khiển bàn tay SharpaWave 5 ngón, 22 bậc tự do trên robot Apollo 2 để hoàn thành các hành động tinh tế như thắt nút hoặc đóng túi zip. Nó cũng có thể vận hành các bộ kẹp song song hai ngón tiêu chuẩn trên nền tảng Franka Duo để thực hiện các nhiệm vụ khéo léo phức tạp (ví dụ: đóng gói chặt). Chúng tôi đang tiếp tục nâng cao mức độ chính xác và tốc độ để đạt được sự khéo léo ở cấp độ con người.
Mở khóa các nhiệm vụ nâng cao với suy luận tác nhân và hợp tác đa robot
Hầu hết các nhiệm vụ trong thế giới thực đòi hỏi nhiều bước trong một khoảng thời gian dài. Để quản lý sự phức tạp này, mô hình suy luận hiện thân (ER) của chúng tôi, Gemini Robotics ER 2, đóng vai trò là bộ não cấp cao của robot, xử lý các hướng dẫn của người dùng và giao tiếp với con người. Nó quan sát căn phòng, suy luận về các bước cần thiết để hoàn thành nhiệm vụ, phối hợp với VLA để thực hiện các hành động và theo dõi tiến độ cho đến khi nhiệm vụ hoàn thành. Thiết lập này cho phép robot thực hiện các nhiệm vụ đa bước phức tạp, tự sửa lỗi nếu một bước thất bại và khái quát hóa cho các tình huống và mục tiêu mới.
Trong bản cập nhật này, chúng tôi cho phép robot thực hiện các chuỗi nhiệm vụ dài hơn một cách đáng tin cậy hơn, kéo dài vài phút và liên quan đến hàng trăm quyết định. Gemini Robotics ER 2 hiện hiểu khi nào nhiệm vụ bắt đầu và kết thúc, đồng thời có thể xác định chính xác thời điểm các sự kiện chính xảy ra, đánh dấu một bước thay đổi trong việc hiểu tiến độ.
Hơn nữa, chúng tôi đang giới thiệu sự hợp tác đa robot. Điều này cho phép các loại robot khác nhau giao tiếp và làm việc cùng nhau để giải quyết các quy trình làm việc phức tạp mà một robot đơn lẻ không thể tự thực hiện.
Thích ứng nhanh các mô hình trên thiết bị cho bất kỳ robot nào
Nhiều ứng dụng robot cần hoạt động mà không có độ trễ mạng hoặc kết nối internet. Gemini Robotics On-Device 2 được xây dựng đặc biệt để xử lý các ràng buộc này — đây là mô hình thị giác-ngôn ngữ-hành động (VLA) hiệu quả nhất của chúng tôi được tối ưu hóa để chạy cục bộ trên các thiết bị robot.
Mô hình này có khả năng đa hiện thân tự nhiên và kế thừa các kỹ thuật “chuyển động chuyển đổi” tiên tiến từ Gemini Robotics 1.5. Chúng tôi hiện có thể thích ứng với các hiện thân robot hai tay mới chỉ với vài giờ thích ứng, thường là với ít hơn 200 ví dụ. Điều này hoạt động ngay cả với các hiện thân mới có hình dạng, cảm biến và bậc tự do khác biệt đáng kể, như được hiển thị bên dưới với một loạt các nhiệm vụ đa dạng được thực hiện bởi các nền tảng Dexmate, SO101 và Trossen.
Thúc đẩy cam kết của chúng tôi đối với robot an toàn và có trách nhiệm
An toàn là nền tảng cho nghiên cứu robot của chúng tôi. Khi robot đạt được nhiều khả năng vật lý hơn, chúng tôi cam kết đảm bảo an toàn và sự liên kết từ đầu đến cuối. Với mỗi bản phát hành, chúng tôi đã thực hiện phương pháp tiếp cận đa lớp kết hợp các biện pháp an toàn vật lý truyền thống với các khung an toàn AI mạnh mẽ.
Gemini Robotics 2 đặc biệt thúc đẩy an toàn robot để điều hướng sự không chắc chắn của thế giới thực và cộng tác cùng con người.
Chúng tôi đang giới thiệu ASIMOV-Agentic, một tiêu chuẩn mới cho việc điều phối an toàn tác nhân và giải quyết sự không chắc chắn. Ví dụ, nó đo lường khả năng của tác nhân suy luận hiện thân trong việc từ chối các lệnh gọi công cụ không an toàn từ VLA. Nó cũng đo lường khả năng của tác nhân trong việc dự đoán liệu một nhiệm vụ có khả thi hay không và chủ động yêu cầu sự can thiệp của con người khi không chắc chắn.
Ngoài ra, với suy luận hiện thân nâng cao, Gemini Robotics ER 2 là mô hình robot an toàn nhất của chúng tôi cho đến nay trong các tiêu chuẩn tuân thủ ràng buộc an toàn và khoảng cách gần với con người. Nó có thể phát hiện tốt hơn khi con người ở gần, kích hoạt các lệnh gọi công cụ an toàn và đưa robot dừng lại an toàn nếu ai đó đến quá gần. Đây là một yêu cầu chính trong các tiêu chuẩn an toàn cộng tác. Đọc Báo cáo kỹ thuật an toàn Gemini Robotics 2 của chúng tôi để biết thêm chi tiết.
Hướng tới AI vật lý đa năng
Gemini Robotics 2 đánh dấu một cột mốc quan trọng trên con đường hướng tới việc giải quyết AGI trong thế giới vật lý. Việc mở khóa tiềm năng thực sự của robot đòi hỏi phải vượt qua quá trình tự động hóa đơn nhiệm vụ để hướng tới trí tuệ đa năng. Bằng cách xây dựng trí tuệ cốt lõi này, mục tiêu của chúng tôi là kích hoạt AI trong thế giới vật lý có thể làm việc cùng con người để giải quyết các thách thức phức tạp.
Khám phá Gemini Robotics 2
Lời cảm ơn: Công trình này được phát triển bởi nhóm Gemini Robotics: Abhijit Ogale, Abhishek Jindal, Adil Dostmohamed, Adrian Collister, Alan Thompson, Alessio Quaglino, Alex Bewley, Alex Hofer, Alex Taeho Kim, Alex X. Lee, Alex Zihao Zhu, Allen Chai, Amaris Paryag, Amit Hampaul, Amy Nommeots-Nomm, Amy Shen, Andre Araujo, Anirudha Majumdar, Anna Volosina, Annie S. Chen, Annie Xie, Anthony Brohan, Antoine Laurens, Arunkumar Byravan, Asaf Revach, Assaf Hurwitz Michaely, Baruch Tabanpour, Ben Moran, Benoit Landry, Bingyi Cao, Bogdan Mazoure, Brandon Hernaez, Brijen Thananjeyan, Bryan Anenberg, Caden Lu, Carl Doersch, Carolina Parada, Charles Shu, Chengda Wu, Christine Chan, Christy Koh, Chuyuan Fu, Claire Cui, Clare Lee, Claudio Fantacci, Connor Schenck, David Rendleman, Deepali Jain, Demetra Brady, Dennis Li, Dhruv Shah, Dimple Vijaykumar, Dirk Ehrlich, Divya Garikapati, Dmitry Kalashnikov, Dre Mahaarachchi, Dushyant Rao, Erik Frey, Fangchen Liu, Francesco Romano, Frankie Garcia, Gabor Simko, Gautam Salhotra, Giulia Vezzani, Grace Popple, Grace Vesom, Graziano Misuraca, Guangyao Zhou, Hagen Soltau, Hanzi Mao, Hao-Tien Lewis Chiang, Harris Chan, Hila Noga, Howard Zhou, Ian Storz, Idan Lev-Yehudi, Ignacio Rocco, Inessa Konstanz, Isaac Reid, Ishita Prasad, Ivan Kapelyukh, J. Chase Kew, Jacky Liang, Jake Varley, James Susilo, Jasmine Hsu, Jerad Kirkland, Jeremy Plassmann, Jessica Lo, Jie Tan, Jimmy Yan, Jingwei Zhang, Jinyu Xie, Jose Enrique Chen, Joshua Ainslie, Joss Moore, Juanita Bawagan, Junkyung Kim, Justin Lidard, Kanishka Rao, Kathryn Quinn Shea, Kaustubh Sridhar, Keerthana Gopalakrishnan, Ken Caluwaerts, Kenneth Oslund, Khimya Khetarpal, Konstantinos Bousmalis, Krista Reymann, Krzysztof Choromanski, Ksenia Konyushkova, Kun Zhang, Kunal Aneja, Laura Graesser, Leen Verburgh, Leonard Hasenclever, Li-Heng Lin, London Chappellet-Volpini, Lucie Kerley, Maria Attarian, Maria Bauza Villalonga, Marissa Giustina, Max McCabe, Meet Kirankumar Dave, Mehdi S. M. Sajjadi, Metin Tokosz-Exley, Michael Neunert, Michael Noseworthy, Michiel Blokzijl, Miguel Rivas, Mithun George Jacob, Mitsuhiko Nakamoto, Mo Dawoud, Mohan Kumar Srirama, Mohit Sharma, Mohit Shridhar, Muinat Abdul, Murilo F. Martins, Nathan Batchelor, Nicolas Heess, Niko Milonopoulos, Norman Di Palo, Oliver Groth, Ouais Alsharif, Padmini Copparapu, Parth Parekh, Paul Ruiz, Paul Wohlhart, Peide Huang, Peng Xu, Peter Pastor, Petko Yotov, Phil Duffy, Philemon Brakel, Rachel Sterneck, Rajkumar Vasudeva Raju, Ravin Kumar, Razvan Surdulescu, René Wagner, Reza Sanatinia, Robert Baruch, Robert Moreno, Rohan Thakker, Roland Hafner, Sajjad Zafar, Sally Jesmonth, Sam Haves, Saminda Abeyruwan, Sandy Han Huang, Scott Crowell, Seliem El-Sayed, Sergey Yaroshenko, Sergio Martinez Abad, Serkan Cabi, Sharath Maddineni, Shuang Li, Sichun Xu, Silvia Cruciani, Skanda Koppula, Skye Yang, Soo Sung, Stefan Welker, Stefani Karp, Stefano Saliceti, Steven Hansen, Stuart Bowers, Sumeet Singh, Svetlana Grant, Takahiro Miki, Takuma Yoneda, Thomas Buschmann, Thomas Lampe, Thomas Power, Thor Schaeff, Tim Hertweck, Tingnan Zhang, Todd McInally, Todor Davchev, Tong Zhao, Travers Rhodes, Tsang-Wei Edward Lee, Vika Koriakin, Vikas Sindhwani, Wenhao Yu, Wentao Yuan, Xiaolin Fang, Yahav Nussbaum, Ying Sheng, Ying Xu, Yuheng Kuang, Yuxiang Yang, Yuxiang Zhou
Vì sự lãnh đạo và hỗ trợ của họ cho nỗ lực này, chúng tôi muốn cảm ơn: Jean-Baptiste Alayrac, Zoubin Ghahramani, Koray Kavukcuoglu và Demis Hassabis. Chúng tôi muốn ghi nhận nhiều nhóm trên khắp Google và Google DeepMind đã đóng góp cho nỗ lực này bao gồm các nhóm Pháp lý, Tiếp thị, Truyền thông, Hội đồng Trách nhiệm và An toàn, Phát triển và Đổi mới có trách nhiệm, Chính sách, Chiến lược và Vận hành, cùng các nhóm Phát triển Kinh doanh và Doanh nghiệp của chúng tôi. Chúng tôi muốn cảm ơn tất cả mọi người trong nhóm Robotics không được đề cập rõ ràng ở trên vì sự hỗ trợ và hướng dẫn liên tục của họ. Cuối cùng, chúng tôi muốn cảm ơn các đối tác của mình: các nhóm Apptronik, Boston Dynamics và Agile Robots vì sự hỗ trợ của họ.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.