Nghiên cứu
AgentHands: Công nghệ tạo cử chỉ tay tương tác cho trợ lý ảo trong không gian XR
(giờ Việt Nam)
Tóm tắt AI
Google giới thiệu AgentHands, hệ thống sử dụng LLM để tạo cử chỉ tay đồng bộ với giọng nói cho trợ lý ảo XR, giúp hướng dẫn thao tác vật lý trong không gian thực tế ảo một cách chính xác.
Bản dịch AI

Khi các trợ lý AI phát triển từ giao diện văn bản đơn giản thành những người bạn đồng hành đa phương thức, chúng ta đang chứng kiến sự chuyển dịch sang hình thức hỗ trợ chủ động và có tính ngữ cảnh cao hơn. Những đổi mới gần đây như Project Astra và Gemini 3.1 Flash Live đã cho phép người dùng thảo luận về môi trường vật lý xung quanh theo thời gian thực, thường sử dụng các lớp phủ khung hình (bounding box) trực quan để xác định vật thể trong luồng camera. Mặc dù các lớp phủ này rất hiệu quả trên màn hình 2D, nhưng việc chuyển đổi sang các nền tảng nhập vai như Android XR lại đặt ra một thách thức độc đáo: làm thế nào để vượt ra ngoài giao diện người dùng (UI) phẳng nhằm tạo ra một cuộc đối thoại thực sự sống động và có nhận thức về không gian?
Để thu hẹp khoảng cách này, chúng tôi giới thiệu AgentHands, được công bố tại CHI 2026, một nguyên mẫu nghiên cứu mang sức mạnh của cử chỉ đồng hành cùng lời nói (co-speech gestures) vào thế giới 3D. Trong giao tiếp giữa người với người, đôi tay không chỉ dùng để chỉ trỏ; chúng còn mô tả hình dáng, mô phỏng hành động và nhấn mạnh các ý chính, tất cả đều được đồng bộ hóa với giọng nói. Bằng cách tận dụng khả năng hiểu không gian của Thực tế mở rộng (XR), AgentHands tái tạo sự cộng hưởng tự nhiên này. Tiếp nối các nghiên cứu trước đây của chúng tôi về Human I/O và Sensible Agent, AgentHands trang bị thêm cho các tác nhân AI những cử chỉ tay biểu cảm, đồng bộ, giúp chuyển đổi các hướng dẫn bằng lời nói trừu tượng thành các minh họa trực quan, vật lý, khiến các cuộc trò chuyện về môi trường xung quanh trở nên tự nhiên và hấp dẫn hơn.
Phân loại cho các tác nhân tay nhập vai trong XR
Để bắt đầu, chúng tôi đã thực hiện một nghiên cứu định hình với các chuyên gia về XR và tương tác người-máy (HCI) tại Google để xác định điều gì làm cho một bàn tay ảo trở nên “dễ hiểu” trong môi trường 3D. Chúng tôi đã chắt lọc những hiểu biết này thành một hệ thống phân loại đa chiều, xác định cách một tác nhân nên sử dụng đôi tay của mình để gắn kết cuộc trò chuyện vào không gian vật lý của người dùng.
Quy trình làm việc của AgentHands
Đổi mới cốt lõi của AgentHands là khả năng ánh xạ tư duy cấp cao của các LLM thành các chuyển động vật lý chính xác, theo thời gian thực, phù hợp với “giọng nói” của tác nhân và môi trường XR của người dùng. Chúng tôi giới thiệu các bước chính sau đây để tạo nên quy trình làm việc của AgentHands.
Nhận thức môi trường
Hệ thống bắt đầu với một mô-đun đăng ký vật thể nhẹ. Sử dụng ánh nhìn (eye gaze) và tái tạo cảnh quan, người dùng có thể nhanh chóng “gắn thẻ” các mục — như một chậu lan hoặc máy tính xách tay — tạo ra một sổ đăng ký không gian với các khung hình 3D mà tác nhân có thể tham chiếu.
Thư viện sự kiện cử chỉ tay
Chúng tôi đã xây dựng một thư viện các hành vi cử chỉ tay theo ba danh mục ngữ nghĩa: a) chỉ trỏ (deictic) để tham chiếu, b) mô phỏng (iconic) để mô tả hành động hoặc hình dáng, và c) biểu cảm (expression) để truyền đạt các tín hiệu xã hội và cảm xúc.
Tư duy nhúng cử chỉ
Khi người dùng đặt câu hỏi, LLM ở phía sau sẽ tạo ra phản hồi bao gồm các GestureEvents (Sự kiện cử chỉ) nội dòng. Mỗi sự kiện được gắn với các từ khóa kích hoạt cụ thể và mã hóa các nguyên tắc cho một hành vi tay theo các chiều phân loại.
Thực thi XR đồng bộ
Một trình phân tích cú pháp cục bộ trên kính XR sẽ điều phối quá trình phát văn bản thành giọng nói (TTS) với công cụ hoạt ảnh. Bằng cách sử dụng dấu thời gian ở cấp độ từ, đôi tay của tác nhân sẽ thực hiện các cử chỉ đồng hành cùng lời nói một cách hoàn hảo, đồng bộ với các từ được nói, cung cấp các tham chiếu không gian rõ ràng và biểu cảm.
Bằng cách tích hợp các mô-đun này, AgentHands tạo ra một cầu nối liền mạch giữa ý định ngôn ngữ và hành động vật lý. Hệ thống chuyển đổi đầu ra LLM tiêu chuẩn thành một màn trình diễn đa phương thức phong phú, nơi các phản hồi của tác nhân được thể hiện thông qua cả lời nói và chuyển động chính xác về không gian, cho phép các hướng dẫn phức tạp được minh họa chính xác tại nơi chúng xảy ra trong môi trường của người dùng.
Các kịch bản ứng dụng
Chúng tôi đã chứng minh cách các cử chỉ nhập vai này, kết hợp với nhận thức không gian của XR, nâng cao sự hiểu biết của chúng ta về môi trường vật lý xung quanh.
Hướng dẫn tương tác: Trong kịch bản chăm sóc hoa lan, tác nhân không chỉ nói “kiểm tra rễ”; nó di chuyển tay đến gốc cây và phác thảo các rễ khí trong khi giải thích chức năng của chúng.
Hướng dẫn kỹ thuật: Đối với các thao tác máy in 3D, tác nhân có thể minh họa chính xác trình tự “xoay và nhấn” cần thiết để điều hướng các núm điều khiển và chọn tệp, giúp các bước giao diện vật lý phức tạp trở nên trực quan.
Đồng hành lối sống: Tác nhân có thể đóng vai trò là huấn luyện viên sức khỏe tương tác với các lựa chọn vật lý của bạn. Ví dụ, tác nhân có thể thực hiện cử chỉ “cảnh báo” tương tác bằng cách nắm tay người dùng kèm theo hiệu ứng hình ảnh để cảnh báo người dùng về các hành vi không lành mạnh.
Nghiên cứu người dùng
Để đánh giá tác động của các cử chỉ này, chúng tôi đã thực hiện một nghiên cứu trong nội bộ nhóm (N = 12) so sánh AgentHands với phương pháp chỉ sử dụng giọng nói. Cả hai điều kiện đều sử dụng cùng một nội dung lời nói do nhà nghiên cứu soạn thảo, đảm bảo sự khác biệt duy nhất là sự hiện diện của đôi tay nhập vai và các cử chỉ đồng bộ của chúng. Những người tham gia đã hoàn thành hai nhiệm vụ quy trình cân bằng giữa việc chăm sóc hàng ngày và vận hành kỹ thuật.
Kết quả
Kết quả xác nhận rằng sự kết hợp giữa XR và cử chỉ đồng hành cùng lời nói cực kỳ hiệu quả cho các tương tác dựa trên không gian. Chúng tôi đã phân tích dữ liệu dựa trên một số chỉ số chính về hiệu quả giao tiếp.
Kết luận và hướng phát triển tương lai
AgentHands đại diện cho một bước tiến tới tương lai nơi các hệ thống AI không chỉ phân tích thế giới của chúng ta mà còn vận hành một cách năng động trong đó. Bằng cách tận dụng các cử chỉ đồng hành cùng lời nói và sức mạnh không gian của XR để gắn kết cuộc trò chuyện vào chuyển động vật lý, chúng ta có thể giảm tải nhận thức cho các tác vụ phức tạp và làm cho điện toán không gian trở nên dễ tiếp cận và lấy con người làm trung tâm hơn.
Khi tiếp tục phát triển cho hệ sinh thái Android XR, chúng tôi đang khám phá các cách để làm cho những cử chỉ này trở nên cá nhân hóa hơn nữa, thích ứng với tay thuận của người dùng hoặc học hỏi các thói quen không gian cụ thể của họ, nhằm tạo ra sự hợp tác giữa người và AI liền mạch hơn nữa.
Lời cảm ơn
Nghiên cứu này chủ yếu được thực hiện bởi Ziyi Liu trong thời gian làm Sinh viên Nghiên cứu tại Google, như một phần của sự hợp tác chung giữa nhiều nhóm. Chúng tôi gửi lời cảm ơn chân thành đến những người đóng góp chính là David Li, Zhongyi Zhou và David Kim vì sự hỗ trợ của họ, và đến Adarsh Kowdle, Guru Somadder và Shahram Izadi vì sự hướng dẫn chiến lược và những đánh giá sâu sắc.





Bài viết được AI dịch và tổng hợp tự động từ Google Research: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.