Hugging Face Daily Papers
Điểm AI 85/100

Nghiên cứu

HappyWorld-Bench: Bộ tiêu chuẩn đánh giá toàn diện khả năng mô phỏng thế giới của AI

(giờ Việt Nam)

Tóm tắt AI

HappyWorld-Bench là bộ benchmark toàn diện đầu tiên đánh giá độ tin cậy của các mô hình thế giới thông qua khả năng tương tác, khám phá và thay đổi môi trường trên ba nền tảng: video, không gian và thực thể.

Chính văn · Bản dịch AI

Tác giả: Zhiqi Bai, Junai Cai, Yixin Chen, Jingrun Du, Tao Feng, Wei Gong, Siyuan Huang, Xiao Lin, Jiaheng Liu, Jun Luo, Yongzhe Lyu, Liya Ma, Zenan Meng, Lin Qu, Wenbo Su, Jiaming Wang, Qinghe Wang, Shaofei Wang, Yanghai Wang, Zequn Wang, Ziming Wang, Hu Wei, Jiangtao Wu, Ruiqi Wu, Jiaxin Xie, Yuchi Xu, Ze Xu, Chengting Yu, Liangyu Yuan, Gang Zeng, Yawen Zeng, Xingyao Zhang, Zizheng Zhang, Bo Zheng, Jiancheng Zhu, Song-Chun Zhu

Xem PDF HTML (thử nghiệm)

Tóm tắt: Việc đánh giá các mô hình thế giới (world models) đòi hỏi phải thẩm định cả chất lượng của thế giới mà chúng tạo ra lẫn tính nhất quán và khả năng phản hồi trong quá trình khám phá, tương tác và sửa đổi. Chúng tôi giới thiệu HappyWorld-Bench, một bộ tiêu chuẩn đánh giá toàn diện nhằm kiểm tra xem các thế giới được tạo ra có duy trì được độ tin cậy khi các tác nhân (agents) tương tác với chúng hay không. Thiết kế của chúng tôi được xây dựng dựa trên khung năng lực phân cấp gồm sáu khả năng thế giới (W1-W6), từ xây dựng tạo sinh đến mô hình hóa thế giới thống nhất, được cụ thể hóa qua ba lộ trình đánh giá độc lập: mô hình thế giới video, mô hình thế giới không gian và mô hình thế giới hiện thân (embodied). HappyWorld-Bench bao gồm 1.138 câu lệnh video, 300 cảnh không gian và 254 trường hợp kiểm thử hiện thân. Trên cả ba lộ trình, chúng tôi xây dựng và vận hành HappyWorld-Arena để tổ chức các so sánh A/B giữa người với người và rút ra xếp hạng Elo cấp mô hình, bổ sung cho các chỉ số tự động mới được thiết kế nhằm nắm bắt tính đúng đắn về hành vi. Chúng tôi đánh giá 14 mô hình thế giới video, 9 hệ thống không gian và 8 ứng viên hiện thân theo khung thống nhất này. Kết quả cho thấy vẫn còn những khoảng cách về độ tin cậy trên cả ba lộ trình: các mô hình video thể hiện sự sụt giảm tính nhất quán trong quá trình triển khai mở rộng và truy cập lại, các mô hình không gian đạt độ chính xác vị trí cao nhất là 70,14% và thực thi chỉnh sửa là 73,33%, còn các mô hình hiện thân gặp khó khăn trong việc duy trì trạng thái qua các hành động nhiều bước và phản hồi chính xác với các điều kiện hành động cũng như quy tắc vật lý đã thay đổi. Những phát hiện này nhấn mạnh nhu cầu đánh giá các mô hình thế giới không chỉ dựa trên chất lượng hình ảnh mà còn dựa trên tính nhất quán của trạng thái và tính đúng đắn trong phản hồi của chúng đối với các hành động và can thiệp.

Chủ đề:Thị giác máy tính và Nhận dạng mẫu (cs.CV)
Trích dẫn là:arXiv:2609.24308 [cs.CV]
(hoặc arXiv:2609.24308v1 [cs.CV] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.24308 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Chengting Yu [xem email] [v1] Thứ Hai, 21 tháng 9 năm 2026 09:07:30 UTC (36.339 KB)

World ModelsBenchmarkAI ResearchMô phỏngĐánh giá AI

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

HappyWorld-Bench: Bộ tiêu chuẩn đánh giá toàn diện khả năng mô phỏng thế giới của AI | AIHOT.vn