Mô hình
Gemini Robotics ER 2: Bước tiến mới của Google trong điều khiển robot bằng AI
(giờ Việt Nam)
Tóm tắt AI
Google DeepMind ra mắt Gemini Robotics ER 2, mô hình nền tảng giúp robot hiểu video, lập kế hoạch nhiệm vụ và phối hợp đa robot để giải quyết các tác vụ thực tế phức tạp.
Bản dịch AI

30 tháng 7, 2026
Gemini Robotics ER 2 đại diện cho một bước tiến đột phá trong việc hỗ trợ robot thông qua khả năng hiểu video, điều phối tác vụ và cộng tác đa robot — giúp robot trở nên hữu ích hơn trong thế giới vật lý.
Steven Hansen
Kỹ sư phần mềm cấp cao (Senior Staff Software Engineer)
Peng Xu
Kỹ sư phần mềm (Staff Software Engineer)

Trình duyệt của bạn không hỗ trợ phần tử âm thanh.
Trình duyệt của bạn không hỗ trợ phần tử âm thanh.
Nghe bài viết
[[duration]] phút
Nội dung này được tạo bởi Google AI. Generative AI đang trong giai đoạn thử nghiệm.
Nội dung này được tạo bởi Google AI. Generative AI đang trong giai đoạn thử nghiệm.
Để robot có thể hỗ trợ con người trong môi trường hàng ngày, khả năng suy luận không gian chính xác là chưa đủ. Robot còn phải tư duy nhanh nhạy, căn thời gian cho các quyết định và suy luận theo tốc độ thời gian thực của thế giới vật lý.
Đó là lý do tại sao hôm nay chúng tôi ra mắt Gemini Robotics ER 2, mô hình "suy luận hiện thân" (embodied reasoning) mạnh mẽ nhất của chúng tôi dành cho robot. Hãy coi Gemini Robotics ER 2 như một bộ não cấp cao cho robot. Nó cho phép robot trò chuyện với con người, hiểu thế giới vật lý và lập kế hoạch cho các tác vụ nhiều bước. Sau đó, nó chuyển giao việc thực thi vận động cho bất kỳ mô hình thị giác-ngôn ngữ-hành động (VLA) cấp thấp nào. Gemini Robotics ER 2 cũng có thể gọi các công cụ như Google Search để tìm kiếm thông tin hoặc bất kỳ hàm nào khác do người dùng định nghĩa. Thiết kế của Gemini Robotics ER 2 cho phép robot "suy nghĩ" về những gì cần làm tiếp theo trong khi vẫn đang thực hiện các hành động của mình.
Gemini Robotics ER 2 đại diện cho một bản nâng cấp đáng kể so với Gemini Robotics ER 1.6. Bằng cách theo dõi các luồng video liên tục, robot giờ đây có thể theo dõi tiến trình của chính mình, thích ứng nếu có sự cố xảy ra và biết chính xác khi nào cần chuyển sang bước tiếp theo. Chúng tôi cũng giới thiệu khả năng cộng tác đa robot, cho phép các robot làm việc cùng nhau trong không gian chung và hoàn thành các quy trình làm việc phức tạp mà một robot đơn lẻ không thể thực hiện được.
Gemini Robotics ER 2 hiện đã có sẵn cho các nhà phát triển thông qua Gemini API, Google AI Studio và bản xem trước riêng tư trên Gemini Enterprise Agent Platform. Để giúp bạn bắt đầu, chúng tôi đang chia sẻ các ví dụ về cách cấu hình mô hình và đưa ra câu lệnh (prompt) để thúc đẩy các tác vụ AI vật lý hữu ích hơn.
Thúc đẩy các khả năng tác nhân vật lý (physical agentic capabilities)
Hầu hết các tác vụ trong thế giới vật lý đều phức tạp và đòi hỏi nhiều bước để hoàn thành. Gemini Robotics ER 2 là một tác nhân vật lý, điều phối các bước cho robot và cho phép nó tự sửa lỗi cũng như khái quát hóa cho các tình huống mới lạ hơn. Để xây dựng một thiết lập tác nhân, các nhà phát triển có thể khai báo các giao diện điều khiển cấp thấp — như các mô hình Vision-Language-Action (VLA) hoặc API điều hướng — dưới dạng công cụ, và truyền phát video, âm thanh hoặc văn bản đa phương thức trực tiếp vào mô hình.
Gemini Robotics ER 2 cải thiện quy trình điều phối công cụ này. Chúng tôi có thể đánh giá hiệu suất của nó với robot trong môi trường mô phỏng, sử dụng điều khiển robot trong thế giới thực và thậm chí kết hợp với con người điều khiển robot từ xa.
Gemini Robotics ER 2 liên tục vượt trội hơn ER 1.6 về khả năng điều phối công cụ trên ba chế độ điều khiển: VLA thực, VLA mô phỏng và điều khiển từ xa bởi con người (human tele-op).

Trong lĩnh vực robot, suy luận cấp cao phụ thuộc vào tốc độ thực thi. Gemini Robotics ER 2 tích hợp vào Gemini Live API, sử dụng điểm cuối truyền phát hai chiều được tối ưu hóa cho các tác vụ nhạy cảm với độ trễ. Kết quả là sự điều phối trôi chảy: Gemini Robotics ER 2 ra lệnh cho các mô hình hành động và API robot để hoàn thành các tác vụ nhiều bước mà không bị gián đoạn bởi những khoảng dừng "dừng lại và suy nghĩ" khó chịu.
Để minh họa điều này, chúng tôi đã xây dựng một bản demo với Spot từ các đối tác của chúng tôi tại Boston Dynamics. Chúng tôi sử dụng Gemini Robotics ER 2 để điều phối các API của Spot, chẳng hạn như điều hướng và chuyển động của bộ phận thao tác, tạo ra một robot tương tác có thể lấy đồ vật cho bạn.
Robot Boston Dynamics Spot được hỗ trợ bởi Gemini Robotics ER 2 lấy một túi bỏng ngô theo lệnh bằng ngôn ngữ tự nhiên.
Mã nguồn có sẵn trên Github cùng với các ví dụ khác.
Mở khóa trí tuệ thời gian để hoàn thành tác vụ một cách mạnh mẽ
Một trong những thách thức khó khăn nhất của robot là biết khi nào một tác vụ đã hoàn thành. Gemini Robotics ER 2 mang đến một bước tiến đột phá trong việc hiểu video và theo dõi tiến trình để xác minh rằng các tác vụ phức tạp — chẳng hạn như vặn chặt bóng đèn hoặc buộc túi rác — đã hoàn thành đúng thông số kỹ thuật trước khi chuyển sang tác vụ tiếp theo.
Trong bản cập nhật này, chúng tôi đã đạt được tiến bộ về hai khả năng nền tảng để hiểu tiến trình tác vụ: phân loại tiến trình và tìm kiếm thời điểm (moment finding).
Phân loại tiến trình liên tục
Phân loại tiến trình đề cập đến khả năng của robot trong việc theo dõi tiến độ hướng tới hoàn thành tác vụ. Trong các đánh giá của mình, chúng tôi gán mỗi khung hình trong luồng video vào năm mức độ tiến trình (0-20%, 20-40%, 40-60%, 60-80%, 80-100%). Bằng cách định lượng tiến trình tác vụ, Gemini Robotics ER 2 cung cấp cho robot nhận thức tình huống theo thời gian thực và cho phép chúng điều chỉnh hành động ngay lập tức hoặc thử lại các bước thất bại mà không cần khởi động lại toàn bộ quy trình làm việc.
Gemini Robotics ER 2 đạt độ chính xác 57,4% trong các tác vụ phân loại tiến trình, vượt trội hơn các mô hình thế hệ trước và các mô hình tiên phong cạnh tranh khác.

Tìm kiếm thời điểm chính xác
Tìm kiếm thời điểm đo lường khả năng của mô hình trong việc xác định chính xác khung hình video nơi một sự kiện quan trọng diễn ra (ví dụ: khi nào cần dừng rót cà phê vào cốc). Gemini Robotics ER 2 đạt được những cải thiện đáng kể về hiệu suất trong việc tìm kiếm thời điểm, cho phép robot chuyển đổi chính xác giữa các tác vụ, xác minh thành công và đề xuất các hiệu chỉnh.
Đối với các tác vụ tìm kiếm thời điểm, Gemini Robotics ER 2 đạt độ chính xác 91,3% và khoảng cách tuyệt đối trung bình là 0,96 giây. Nó cạnh tranh sát sao với các danh mục mô hình lớn hơn nhiều, nhưng mang lại độ chính xác này với chi phí tính toán thấp hơn và tốc độ thực thi nhanh gấp 4 lần — độ trễ dưới một giây thực sự cần thiết để vận hành robot vật lý một cách an toàn trong thế giới thực.

Cộng tác đa robot
Không có robot đơn lẻ nào phù hợp với mọi tác vụ — một robot có bánh xe vượt trội trong nhà, trong khi robot hình người có thể vượt trội trên địa hình không bằng phẳng. Gemini Robotics 2 cho phép cộng tác đa robot, cho phép các cỗ máy đa dạng giao tiếp thông qua sự hiểu biết ngữ nghĩa chung để chuyển giao và hoàn thành các tác vụ phức tạp. Xem cách Gemini Robotics ER 2 cho phép Apollo 2 của Apptronik và Franka F3 Duo cộng tác tại đây.
Bài viết được AI dịch và tổng hợp tự động từ Google DeepMind: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.