QbitAI
85

Mô hình

5 trường đại học hàng đầu công bố bảng xếp hạng mô hình thế giới 3 góc nhìn cho robot

(giờ Việt Nam)

Tóm tắt AI

Lần đầu tiên, một bảng xếp hạng đánh giá khả năng mô phỏng thế giới từ 3 góc nhìn khác nhau của robot đã được công bố, hứa hẹn sẽ là thước đo quan trọng cho sự ổn định của AI trong tương lai.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

Năm trường đại học hàng đầu cùng công bố bảng xếp hạng! Kết quả đánh giá mô hình thế giới ba góc nhìn (three-view world model) đầu tiên dành cho robot đã lộ diện, bảng xếp hạng đang được cập nhật liên tục.

11-08-2026 08:46:23 Nguồn: QbitAI

Mô hình thế giới ba góc nhìn nào ổn định hơn?

Gần đây, TriWorldBench Challenge, được đồng khởi xướng bởi Đại học Bắc Kinh, Đại học Thanh Hoa, Đại học Hàng không và Vũ trụ Bắc Kinh, Đại học Giao thông Thượng Hải và Đại học Khoa học và Công nghệ Trung Quốc, đã chính thức công bố kết quả cập nhật bảng xếp hạng tuần đầu tiên.

Là bảng xếp hạng đánh giá đầu tiên dành cho mô hình thế giới ba góc nhìn của robot, TriWorldBench hướng tới việc thiết lập một hệ thống đánh giá mô hình thế giới hiện thân (embodied world model) toàn diện hơn, thúc đẩy các mô hình thế giới chuyển dịch từ "tạo lập hình ảnh" sang "thấu hiểu thế giới".

Bảng xếp hạng đánh giá toàn diện hiệu suất của các mô hình dựa trên các khía cạnh như tính nhất quán giữa ba góc nhìn, khả năng thực thi nhiệm vụ, và sự hiểu biết về không gian vật lý. Bảng xếp hạng mở cửa cho các nhóm nghiên cứu liên quan trên toàn cầu tham gia, hiện đã thu thập nhiều kết quả đánh giá công khai và sẽ tiếp tục cập nhật trong thời gian tới.

(Địa chỉ bảng xếp hạng: https://www.triworldbench.com/#leaderboard)

图片

Trong tuần thi đấu đầu tiên, mô hình WoVR_Plus từ CASIA-DRL, mô hình BetaBWM từ TONGJI Spatial Intelligence Team và mô hình Fysiverse-Video từ Fysics AI đã chiếm giữ ba vị trí dẫn đầu.

Từ "tạo video" đến "thấu hiểu thế giới", tiêu chuẩn đánh giá mới cho mô hình thế giới hiện thân được các thí sinh công nhận.

Kể từ khi ra mắt, TriWorldBench đã đạt hơn 10.000 lượt truy cập trang web, hơn 200 lượt tải xuống công cụ đánh giá và lưu lượng truy cập hàng ngày vượt quá 1.000 lượt; chỉ trong một tuần ngắn ngủi đã có 14 đội thi chính thức.

Điều này cho thấy trọng tâm cạnh tranh của mô hình thế giới ba góc nhìn đã chuyển từ độ trung thực hình ảnh của một góc nhìn đơn lẻ sang tính nhất quán về không-thời gian và tính logic vật lý tự thân giữa nhiều góc nhìn (head view, left-wrist view, right-wrist view).

Sự khác biệt về thứ hạng hiện nay chủ yếu xuất phát từ hiệu suất của mô hình trong các khía cạnh như căn chỉnh hình học đa góc nhìn, độ chính xác khi thực thi nhiệm vụ và khả năng hiểu động lực học vật lý, thay vì chất lượng cảm nhận của từng khung hình đơn lẻ.

TriWorldBench hướng tới việc thiết lập một khung đánh giá có hệ thống, thực hiện định lượng chính xác và phân tích khả năng giải thích cho các khoảng cách năng lực đa chiều nêu trên, từ đó thúc đẩy mô hình thế giới tiến hóa theo mô hình "nhận thức hiện thân" (embodied cognition).

Làm thế nào để đánh giá một mô hình thế giới có thực sự hiểu được thế giới mà robot đang hiện diện hay không?

img

Bảng xếp hạng này tập trung vào khả năng tạo và hiểu video đa góc nhìn trong các kịch bản thao tác của robot, bao gồm head view (góc nhìn đầu), left-wrist view (góc nhìn cổ tay trái) và right-wrist view (góc nhìn cổ tay phải), với hy vọng thiết lập một tiêu chuẩn đánh giá mô hình thế giới toàn diện hơn, thúc đẩy mô hình thế giới hiện thân chuyển dịch từ "tạo lập hình ảnh" sang "thấu hiểu thế giới".

Từ "tạo video" đến "thấu hiểu thế giới": Tiêu chuẩn đánh giá mới cho mô hình thế giới hiện thân.

Trước đây, việc đánh giá các mô hình tạo video thường tập trung nhiều hơn vào:

Tuy nhiên, đối với mô hình thế giới hiện thân, việc chỉ tạo ra một đoạn video "trông có vẻ chân thực" là chưa đủ.

Robot cần phải đối mặt với một thế giới năng động, liên tục và tuân theo các quy luật vật lý.

Trong các hệ thống robot thực tế, một nhiệm vụ thường được quan sát đồng thời bởi nhiều camera:

Camera trên đầu chịu trách nhiệm cung cấp thông tin môi trường tổng thể, giúp robot hiểu trạng thái nhiệm vụ;

Camera trên cổ tay đặt gần khu vực thao tác, có thể nắm bắt các chi tiết như việc cầm nắm, tiếp xúc.

Các góc nhìn khác nhau không đơn thuần là sự lặp lại thông tin, mà cùng nhau cấu thành nhận thức hoàn chỉnh của robot về thế giới.

Do đó, một mô hình thế giới hiện thân thực sự đáng tin cậy không chỉ cần tạo ra video hợp lý ở một góc nhìn đơn lẻ, mà còn cần đảm bảo:

Nhiều camera cùng nhìn thấy một thế giới duy nhất.

Đây cũng trở thành vấn đề mới cần giải quyết cấp bách trong hệ thống đánh giá mô hình thế giới hiện nay.

TriWorldBench: Hệ thống đánh giá ba góc nhìn dành cho mô hình thế giới hiện thân.

Nhằm giải quyết thách thức cốt lõi về tính nhất quán đa góc nhìn, TriWorldBench Challenge đã đề xuất một hệ thống đánh giá toàn diện dành cho các kịch bản thao tác của robot.

So với phương pháp đánh giá video đơn góc nhìn truyền thống, TriWorldBench chú trọng hơn vào việc liệu mô hình có sở hữu khả năng hiểu thế giới thực hay không.

img

Tính nhất quán đa góc nhìn: Ba camera có mô tả cùng một thế giới hay không?

TriWorldBench trước hết tập trung vào việc liệu ba luồng góc nhìn có thể tương ứng với nhau hay không.

Các video về đầu, cổ tay trái và cổ tay phải do mô hình tạo ra không chỉ cần hợp lý riêng lẻ mà còn cần đảm bảo:

Nói cách khác, ba luồng video không thể chỉ "trông có vẻ hợp lý" một cách riêng biệt, mà còn cần cùng nhau mô tả một quá trình thao tác của robot một cách hoàn chỉnh và mạch lạc.

Khả năng thực thi nhiệm vụ: Robot có thực sự hoàn thành nhiệm vụ hay không?

Đối với robot, tạo video không phải là mục tiêu cuối cùng, hoàn thành nhiệm vụ mới là cốt lõi.

TriWorldBench đánh giá sâu hơn khả năng hiểu của mô hình đối với quá trình thao tác của robot, bao gồm:

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.