Mô hình
Google DeepMind ra mắt Gemini Robotics 2: Bước tiến mới trong điều khiển robot toàn thân và phối hợp đa tác nhân
(giờ Việt Nam)
Tóm tắt AI
Google DeepMind giới thiệu Gemini Robotics 2, bộ ba mô hình AI đột phá giúp robot thực hiện các thao tác linh hoạt, điều khiển toàn thân và phối hợp nhóm hiệu quả trên nhiều nền tảng phần cứng khác nhau.
Bản dịch AI

Google DeepMind vừa ra mắt Gemini Robotics 2, lớp trí tuệ dành cho thế hệ robot tiếp theo của hãng. Bản phát hành này đưa hệ thống vượt xa khả năng thao tác trên mặt bàn để tiến tới điều khiển toàn thân, sự khéo léo của năm ngón tay và khả năng làm việc nhóm giữa nhiều robot. Sản phẩm được cung cấp dưới dạng ba mô hình riêng biệt với ba cấp độ truy cập khác nhau.
Hầu hết các robot hiện nay đều được lập trình sẵn hoặc điều khiển từ xa cho các chuỗi tác vụ hẹp và lặp đi lặp lại. Chúng không thích nghi được với các môi trường khó đoán, và các kỹ năng hiếm khi được chuyển đổi giữa các cơ thể robot khác nhau. Gemini Robotics 2 nhắm đến việc giải quyết cả ba hạn chế này cùng một lúc.
Tóm tắt
3 mô hình và chức năng của chúng
Gemini Robotics 2
Gemini Robotics 2 là mô hình thị giác-ngôn ngữ-hành động (VLA). Nó chuyển đổi đầu vào là thị giác và ngôn ngữ thành điều khiển động cơ. Mô hình này có thể vận hành toàn bộ robot hình người từ bàn chân đến đầu ngón tay, cũng như các robot hai tay khác. Nó cũng xử lý các thao tác khéo léo trên cả bàn tay nhiều ngón và các bộ kẹp song song.
Gemini Robotics ER 2
Gemini Robotics ER 2 là mô hình suy luận hiện thân (ER). Đây là một mô hình ngôn ngữ thị giác đóng vai trò như bộ não cấp cao. Nó giao tiếp với con người, hiểu thế giới vật lý và lập kế hoạch cho các tác vụ đa bước kéo dài vài phút. Theo thẻ mô hình (model card), ER 2 dựa trên Gemini 3.5 Flash. Nó chấp nhận đầu vào xen kẽ văn bản, hình ảnh, video và âm thanh với cửa sổ ngữ cảnh lên tới 128k, và xuất ra văn bản lên tới 64K token.
Gemini Robotics On-Device 2
Gemini Robotics On-Device 2 là mô hình VLA hiệu quả được tối ưu hóa để chạy cục bộ trên robot. Thẻ mô hình cho biết nó được xây dựng trên công nghệ Gemini Robotics 1.5 và các mô hình Gemma chạy trên thiết bị của Google. Đầu vào là văn bản, hình ảnh và cảm nhận bản thể (proprioception) của robot dưới dạng giá trị số. Đầu ra là các hành động của robot dưới dạng giá trị số.
Sự phân công lao động rất quan trọng đối với thiết kế hệ thống. ER 2 lập kế hoạch và theo dõi tác vụ, sau đó bàn giao việc thực thi động cơ cho một VLA được khai báo như một công cụ. Các nhà phát triển đăng ký các giao diện điều khiển cấp thấp, chẳng hạn như mô hình VLA hoặc API điều hướng, dưới dạng các công cụ có thể gọi được. Sau đó, họ truyền trực tiếp video, âm thanh hoặc văn bản đa phương thức vào mô hình.
Điều khiển toàn thân trên Apptronik Apollo 2
Các mô hình Gemini Robotics trước đây chỉ điều khiển phần thân trên của robot hình người cho các tác vụ trên mặt bàn. Gemini Robotics 2 lần đầu tiên mở rộng khả năng điều khiển sang chuyển động toàn thân.
Ví dụ thực tế sử dụng robot Apollo 2 của Apptronik. Với chỉ dẫn “đặt bình tưới nước vào thùng màu xanh lá cây ở kệ dưới cùng,” Apollo đi bộ đến bàn và nhặt bình tưới nước lên. Sau đó, nó bước vài bước đến các kệ và đặt vật thể vào đúng vị trí đích.
Google DeepMind thẳng thắn thừa nhận khoảng cách còn lại. Họ cho biết robot của mình cần cải thiện thêm về tốc độ di chuyển.
Sự khéo léo trên bàn tay và bộ kẹp
Gemini Robotics 2 có thể điều khiển bàn tay SharpaWave 22 bậc tự do với năm ngón tay trên Apollo 2. Các hành động được báo cáo bao gồm thắt nút và đóng túi zip. Cùng một mô hình này cũng vận hành các bộ kẹp song song hai ngón tiêu chuẩn trên nền tảng Franka Duo cho các tác vụ như đóng gói chặt.
Tỷ lệ thành công được báo cáo đến từ một điểm kiểm tra mô hình (model checkpoint) điều khiển ba hiện thân: Apollo 2 với bàn tay SharpaWave, Apollo 2 với bàn tay Inspire, và Franka Duo với bộ kẹp Robotiq.
ER 2: Trí tuệ thời gian và Điều phối công cụ
Bài đăng trên X của nhà phát triển tập trung vào một vấn đề hiếm khi được đánh giá: biết khi nào một tác vụ thực sự hoàn thành.
Phân loại tiến độ:
Mỗi khung hình trong luồng video được gán vào một trong năm cấp độ tiến độ, từ 0-20% đến 80-100%. Gemini Robotics ER 2 đạt độ chính xác 57,4% trong tác vụ này. Google DeepMind báo cáo rằng kết quả này vượt trội hơn các mô hình thế hệ trước và các mô hình tiên phong cạnh tranh khác.
Tìm kiếm thời điểm (Moment finding):
Tính năng này đo lường liệu mô hình có thể xác định chính xác khung hình nơi một sự kiện quan trọng xảy ra hay không. Một ví dụ là thời điểm dừng rót cà phê vào cốc. ER 2 đạt độ chính xác 91,3% với sai số tuyệt đối trung bình là 0,96 giây. Google DeepMind báo cáo rằng nó cạnh tranh sát sao với các danh mục mô hình lớn hơn nhiều ở tốc độ thực thi nhanh gấp 4 lần.
Điều phối công cụ:
ER 2 được đánh giá qua ba chế độ điều khiển: VLA thực, VLA mô phỏng và điều khiển từ xa bởi con người. Nó vượt trội hơn Gemini Robotics ER 1.6 ở cả ba chế độ.
ER 2 tích hợp với Gemini Live API thông qua điểm cuối truyền phát hai chiều. Mục đích được nêu là loại bỏ các khoảng dừng "dừng lại và suy nghĩ" vốn làm gián đoạn việc thực thi đa bước. Nó cũng có thể gọi các công cụ như Google Search hoặc bất kỳ hàm nào do người dùng định nghĩa một cách tự nhiên.
Ba khả năng không gian đã được nâng cấp. Phát hiện thành công và thất bại hiện chạy trên luồng video thô thay vì ảnh chụp tĩnh, giúp phát hiện các sự cố tràn hoặc trượt giữa quá trình thực thi. Đọc thiết bị đo đạc tổng quát mở rộng từ các mặt số tròn sang màn hình kỹ thuật số, thước đo tuyến tính, thước kẻ và nhiệt kế chất lỏng, đã được thử nghiệm trên 10 loại thiết bị. Khả năng trả lời câu hỏi thị giác không gian được cải thiện thông qua các tiến bộ đa phương thức của Gemini.
Google DeepMind đã xây dựng một bản demo với Spot từ Boston Dynamics, sử dụng ER 2 để điều phối các API điều hướng và thao tác của Spot. Mã mẫu có sẵn trong kho lưu trữ robotics-samples.
Gemini Robotics 2 giới thiệu sự hợp tác giữa các loại robot khác nhau. Lý do là không có robot đơn lẻ nào phù hợp với mọi tác vụ. Một robot có bánh xe phù hợp với công việc trong nhà, trong khi robot hình người xử lý địa hình không bằng phẳng tốt hơn.
Các robot giao tiếp thông qua sự hiểu biết ngữ nghĩa chung để bàn giao các tác vụ phụ. Cặp đôi được trình diễn là Apptronik Apollo 2 với Franka F3 Duo.
On-Device 2: Thích nghi với các cơ thể robot mới
Gemini Robotics On-Device 2 nhắm đến các ứng dụng không thể dựa vào độ trễ mạng hoặc kết nối. Nó có khả năng đa hiện thân tự nhiên và kế thừa các kỹ thuật chuyển đổi chuyển động từ Gemini Robotics 1.5.
Google DeepMind báo cáo khả năng thích nghi với các hiện thân hai tay mới chỉ trong vài giờ, thường với ít hơn 200 ví dụ. Điều này áp dụng cho các hiện thân có hình dạng, cảm biến và bậc tự do khác biệt đáng kể. Các nền tảng được trình diễn bao gồm Dexmate, SO101 và Trossen.
Thẻ mô hình công bố so sánh quy mô dữ liệu với On-Device 1 trên các nền tảng chỉ được giới thiệu trong quá trình hậu đào tạo:
Kết quả của SO101 là rõ ràng hơn cả. On-Device 1 hầu như không thể rời khỏi mặt đất, trong khi On-Device 2 vượt qua mức 50%.
Thẻ mô hình cũng liệt kê các hạn chế. On-Device 2 bị hạn chế trong việc khái quát hóa các tác vụ nằm ngoài phân phối (out-of-distribution) và trong việc điều khiển các robot có bậc tự do cao.
Khả dụng
Liên kết ra mắt trên AI Studio sử dụng chuỗi mô hình gemini-robotics-er-2-preview. Các sổ tay hướng dẫn bắt đầu (getting-started notebooks) có trong kho lưu trữ robotics-samples.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.