IT Home
92

Mô hình

Google DeepMind ra mắt Gemini Robotics ER 2: Bước tiến đột phá trong tư duy robot

(giờ Việt Nam)

Tóm tắt AI

Gemini Robotics ER 2 là mô hình suy luận thực thể mạnh mẽ nhất của Google, hỗ trợ phân tích video liên tục, phối hợp đa robot và cải thiện đáng kể độ chính xác trong các tác vụ phức tạp.

Bản dịch AI

Cảm ơn bạn đọc của IT đã gửi tin!

Theo tin từ IT ngày 31 tháng 7, Google DeepMind hôm qua (30 tháng 7) đã đăng tải bài viết công bố ra mắt mô hình Gemini Robotics ER 2, đây là mô hình suy luận hiện thân (embodied reasoning) mạnh mẽ nhất của hãng dành cho robot.

Về định vị, mô hình này có thể được xem là "bộ não cao cấp" của robot, giúp điều phối việc giao tiếp với con người, hiểu thế giới vật lý và lập kế hoạch cho các tác vụ đa bước. Mô hình này sau đó sẽ phân công nhiệm vụ cho các mô hình thị giác-ngôn ngữ-hành động (VLA) cấp thấp hơn và quản lý việc hoàn thành các tác vụ đó.

Về tính năng, so với phiên bản 1.6 trước đây, nhờ khả năng xem video liên tục, mô hình Gemini Robotics ER 2 cho phép robot theo dõi tiến độ vận hành của chính mình, tự điều chỉnh khi có vấn đề phát sinh và nắm bắt chính xác thời điểm để chuyển sang bước tiếp theo. Mô hình cũng có thể gọi trực tiếp Google Search hoặc các hàm tùy chỉnh của nhà phát triển.

Đối với các tác nhân vật lý (physical agents), khi robot đang trong trạng thái thực hiện nhiệm vụ, mô hình Gemini Robotics ER 2 có thể suy luận đồng thời các bước tiếp theo để giảm thiểu tình trạng tạm dừng do quy trình "dừng — suy nghĩ — hành động" truyền thống gây ra. Mô hình này được kết nối với các điểm cuối luồng hai chiều của Gemini Live API, phục vụ cho các tác vụ robot nhạy cảm với độ trễ.

So với Gemini Robotics ER 1.6, ER 2 có khả năng phân tích luồng video liên tục. Nhờ đó, robot có thể theo dõi tiến độ nhiệm vụ của mình, điều chỉnh hoặc thử lại khi hành động xảy ra lỗi và xác định thời điểm chuyển sang bước tiếp theo.

Trong bài kiểm tra phân loại tiến độ nhiệm vụ, độ chính xác của Gemini Robotics ER 2 đạt 57,4%. Khả năng này giúp robot sửa lỗi các bước thất bại mà không cần phải khởi động lại toàn bộ quy trình làm việc.

Trong bài kiểm tra moment-finding (xác định thời điểm quan trọng), mô hình cần tìm ra khung hình video chính xác nơi các sự kiện quan trọng xảy ra, ví dụ như xác định thời điểm dừng rót cà phê vào cốc. Độ chính xác của ER 2 đạt 91,3% với sai số thời gian tuyệt đối trung bình là 0,96 giây.

Google cho biết mô hình này đạt được độ chính xác gần bằng các mô hình lớn hơn với chi phí tính toán thấp hơn, tốc độ thực thi nhanh gấp 4 lần và đáp ứng yêu cầu về độ trễ dưới một giây cần thiết cho việc vận hành robot trong thực tế.

ER 2 còn hỗ trợ cộng tác đa robot. Các loại robot khác nhau có thể giao tiếp và bàn giao nhiệm vụ thông qua việc chia sẻ hiểu biết ngữ nghĩa, từ đó hoàn thành các quy trình công việc phức tạp mà một thiết bị đơn lẻ khó có thể thực hiện độc lập. Google đã trình diễn trường hợp cộng tác giữa Apollo 2 của Apptronik và FR3 Duo của Franka.

Gemini Robotics ER 2 hiện đã được cung cấp công khai cho các nhà phát triển thông qua Gemini API và Google AI Studio; đồng thời, mô hình này cũng đã mở bản xem trước riêng tư trong Gemini Enterprise Agent Platform. Google cũng đã phát hành mã ví dụ về cấu hình mô hình và câu lệnh (prompt).

Tuyên bố quảng cáo: Các liên kết ngoài trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian sàng lọc, kết quả chỉ mang tính chất tham khảo, tất cả các bài viết của IT đều bao gồm tuyên bố này.

GoogleGeminiRobotAICông nghệ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.