Tin ngành
Học trò của Fei-Fei Li khởi xướng tiêu chuẩn dữ liệu robot toàn cầu, Lightwheel AI là đại diện duy nhất từ Trung Quốc
(giờ Việt Nam)
Tóm tắt AI
Nhóm nghiên cứu của Fei-Fei Li vừa công bố tiêu chuẩn quốc tế về dữ liệu cho robot có thân thể (embodied AI), với sự góp mặt của Lightwheel AI trong vai trò đối tác duy nhất từ Trung Quốc.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
Học trò của Fei-Fei Li khởi xướng tiêu chuẩn dữ liệu nhân loại học tập (embodied human data) quốc tế, GLM (Guanglun Intelligence) trở thành doanh nghiệp Trung Quốc duy nhất tham gia
24-07-2026 11:27:38 Nguồn: QbitAI
Noah, đưa tin từ AoFeiSi
QbitAI | Tài khoản chính thức QbitAI
Năm 2009, nhóm của Fei-Fei Li chính thức công bố ImageNet.
Sau đó, các nhiệm vụ nhận dạng thị giác quy mô lớn dựa trên nền tảng ImageNet đã lần đầu tiên cho phép các tổ chức khác nhau cùng huấn luyện mô hình và so sánh kết quả xung quanh một bộ dữ liệu, hệ thống phân loại và chỉ số đánh giá chung.
Nhờ vào cơ sở hạ tầng dữ liệu và đánh giá có khả năng mở rộng liên tục và so sánh thống nhất này, nhận dạng hình ảnh và học sâu (deep learning) đã bắt đầu phát triển nhanh chóng.
17 năm sau, Danfei Xu, nghiên cứu sinh tiến sĩ của Fei-Fei Li, bắt đầu tìm kiếm một cơ sở hạ tầng hợp tác tương tự cho lĩnh vực học tập của robot (robot learning).
Danfei Xu hiện là giáo sư trợ lý tại Trường Điện toán Tương tác thuộc Viện Công nghệ Georgia (Georgia Tech), đồng thời là người đứng đầu Phòng thí nghiệm Học tập và Suy luận Robot (RL2). Trong thời gian làm nghiên cứu sinh tiến sĩ tại Đại học Stanford, ông được đồng hướng dẫn bởi Fei-Fei Li và Silvio Savarese. Trong vài năm qua, ông liên tục nghiên cứu một vấn đề: Làm thế nào để robot học hỏi từ các minh họa của con người và chuyển giao những kinh nghiệm đó sang các nhiệm vụ, môi trường và cấu trúc robot khác nhau.

Hướng nghiên cứu này cuối cùng đã hội tụ tại EgoVerse – "Hệ sinh thái dữ liệu thao tác của con người từ góc nhìn thứ nhất".
EgoVerse là một hệ sinh thái và tiêu chuẩn dữ liệu thao tác của con người từ góc nhìn thứ nhất đang không ngừng phát triển. Trong số các đối tác liên minh mới được công khai của EgoVerse, ngoài các tổ chức học thuật như Georgia Tech, Stanford, ETH Zurich và UC San Diego, còn có các công ty như Meta, Scale AI, GLM, Mecka AI, MicroAGI, Trace Labs, v.v.
Điều đáng chú ý nhất là GLM, với tư cách là công ty Trung Quốc duy nhất, đã xuất hiện trên bàn đàm phán tiêu chuẩn toàn cầu quy tụ những "ông lớn" hàng đầu này.
EgoVerse: Điều Danfei muốn làm không chỉ là một bộ dữ liệu
Học tập cho robot từ lâu đã đối mặt với một nghịch lý dữ liệu rõ ràng.
Hiện nay, việc huấn luyện robot vẫn phụ thuộc vào điều khiển từ xa (teleoperation) trên máy thật; mỗi khi thêm một minh họa, cần phải có phần cứng robot, nhân viên vận hành, địa điểm thí nghiệm và quy trình thiết lập lại. Tốc độ thu thập chậm, chi phí cao, và các nhiệm vụ cũng như kịch bản có thể bao phủ cũng rất hạn chế.
Trong khi đó, các hành vi đa dạng của con người vốn dĩ chứa đựng thông tin thị giác, quá trình hành động, tương tác vật thể và chiến lược nhiệm vụ phong phú, rõ ràng là những người thầy tốt hơn cho robot.
Dữ liệu từ góc nhìn thứ nhất của con người cung cấp một lộ trình mới: trước tiên ghi lại cách con người hoàn thành nhiệm vụ trong môi trường thực tế, sau đó chuyển giao những kinh nghiệm này cho các robot khác nhau.
Tuy nhiên, hầu hết các bộ dữ liệu về con người trước đây đều là các dự án mang tính nhất thời.
Các nhóm khác nhau sử dụng thiết bị thu thập, hệ tọa độ, nhãn hành động và định nghĩa nhiệm vụ riêng, khiến dữ liệu sau khi công bố rất khó để mở rộng liên tục. Ngay cả khi hai tổ chức cùng thu thập dữ liệu "đặt cốc lên đĩa", hai bộ dữ liệu đó cũng chưa chắc đã có thể trực tiếp đặt cạnh nhau để huấn luyện.
Do đó, Danfei và các cộng sự không thiết kế EgoVerse thành một bộ dữ liệu tĩnh khác, mà xây dựng nó thành một khung hợp tác "sống".

Phiên bản công khai hiện tại của EgoVerse bao gồm 1362 giờ dữ liệu minh họa của con người, khoảng 80.000 tập (episode), 1965 nhiệm vụ, 240 kịch bản và 2087 người thu thập dữ liệu. Dữ liệu không chỉ bao gồm video góc nhìn thứ nhất mà còn cung cấp tư thế camera, thông tin bàn tay 3D cũng như mô tả ngôn ngữ chi tiết, đồng thời xác thực hiệu quả chuyển giao dữ liệu con người trên các phòng thí nghiệm, nhiệm vụ và cấu trúc robot khác nhau.
Trước khi một tiêu chuẩn thực tế được hình thành, thường cần phải hoàn thành một vài việc:
Để những người tham gia áp dụng cấu trúc dữ liệu chung, tuân thủ ngữ nghĩa nhiệm vụ chung, tạo ra dữ liệu tương thích với nhau và sử dụng các phương pháp thống nhất để kiểm tra xem dữ liệu đó có thực sự hiệu quả hay không.
Những gì EgoVerse đang làm chính là bước này: trước tiên, để dữ liệu học tập của robot trên toàn cầu bắt đầu lưu chuyển theo cùng một "hệ thống ngôn ngữ".
Các bên đồng xây dựng cốt lõi của EgoVerse có nền tảng như thế nào?
Dữ liệu nhân loại học tập không đơn giản chỉ là đeo một chiếc kính, quay một đoạn video rồi thêm vài cái nhãn. Quy trình thu thập hoàn chỉnh bao gồm ít nhất: định nghĩa vấn đề nghiên cứu, phần cứng thu thập, chuyển giao hành động, vận hành quy mô lớn, gắn nhãn dữ liệu và xác thực trên robot. Bất kỳ tổ chức nào cũng khó có thể tự mình hoàn thành tất cả các khâu.
EgoVerse đã tập hợp các trường đại học, học giả và tổ chức hàng đầu trong lĩnh vực học tập của robot để hợp tác toàn cầu, cùng nhau xác định các tiêu chuẩn dữ liệu mang tính thời đại.

Giáo sư Danfei Xu tại Georgia Tech: Đại diện tiêu biểu cho lộ trình thu thập dữ liệu nhân loại học tập, người khởi xướng EgoVerse.
Georgia Tech đảm nhận vai trò trung tâm tổ chức và khung nghiên cứu của EgoVerse. Danfei Xu và nhóm RL2 từ lâu đã tập trung vào việc làm thế nào để robot học hỏi từ dữ liệu con người. Đến với EgoVerse, câu hỏi không còn chỉ là "liệu một nhóm video con người có thể cải thiện một robot cụ thể hay không", mà đã nâng cấp thành: liệu hiệu quả của dữ liệu con người có thể tái lập giữa các phòng thí nghiệm không? Liệu nó có đứng vững trên các cấu trúc robot khác nhau không? Khi quy mô dữ liệu tăng lên, năng lực có tăng trưởng ổn định không? Những loại dữ liệu nào mới thực sự có giá trị chuyển giao?
EgoVerse cho phép các phòng thí nghiệm khác nhau lặp lại thí nghiệm theo các giao thức chia sẻ. Nhiệm vụ đại diện do Viện Công nghệ Georgia phụ trách là object-in-container (vật thể trong vật chứa), Đại học Stanford phụ trách các thao tác tinh vi bằng hai tay, trong khi UC San Diego và ETH Zurich tham gia xác thực các nhiệm vụ hai tay dài hạn. Từ đó, Danfei đã thiết lập một phương thức hợp tác mới, khiến các dữ liệu, thuật toán, robot và phòng thí nghiệm vốn không tương thích với nhau trước đây bắt đầu trả lời cùng một nhóm câu hỏi dưới các giao thức chia sẻ.
Giáo sư Shuran Song tại Stanford: Người phát minh ra UMI, giúp kinh nghiệm thao tác của con người có thể chuyển giao cho robot.
Con người có đôi bàn tay mềm mại và linh hoạt, trong khi robot có thể chỉ có kẹp gắp hai ngón; con người có thể dựa vào xúc giác, kinh nghiệm và sự phối hợp cơ thể để hoàn thành nhiệm vụ, nhưng robot lại cần các biểu diễn quan sát và hành động rõ ràng. Do đó, dữ liệu con người sẽ không tự nhiên trở thành năng lực của robot, mà ở giữa tồn tại một "hố ngăn cách học tập" (embodiment gap).
Phòng thí nghiệm REAL Lab tại Stanford do Shuran Song dẫn dắt là một trong những nhóm đại diện đã khai thông lộ trình này. UMI (Universal Manipulation Interface) do nhóm của bà tiên phong, sử dụng kẹp gắp cầm tay di động để thu thập các thao tác của con người trong môi trường thực tế, sau đó chuyển đổi các minh họa này thành các chiến lược robot có thể triển khai.
Giá trị cốt lõi của UMI là giúp việc thu thập dữ liệu thoát khỏi sự phụ thuộc vào robot cố định và phòng thí nghiệm. Con người có thể mang thiết bị vào môi trường thực tế để thực hiện các nhiệm vụ phức tạp và dài hạn, và các chiến lược học được còn có thể chuyển giao sang các nền tảng robot khác nhau.
Nói một cách đơn giản, điều Stanford muốn giải quyết là: biến kinh nghiệm của con người thành các hành động mà robot có thể thực hiện.
Meta: Cung cấp kính thu thập dữ liệu chuyên dụng cho EgoVerse.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.