Nghiên cứu
OSReward: Thiết lập chuẩn đánh giá mới cho các tác nhân AI điều khiển máy tính
(giờ Việt Nam)
Tóm tắt AI
OSReward là bộ tiêu chuẩn chất lượng cao giúp đánh giá khả năng của các mô hình ngôn ngữ thị giác (VLM) trong vai trò tác nhân điều khiển máy tính, bao gồm các biến thể chuyên sâu cho tình huống khó và chấm điểm đa chiều.
Bản dịch AI
Tác giả: Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, Xingdong Gong, Zehao Li, Kaiming Jin, Xinfeng Yuan, Zhoumianze Liu, Jingyang Gong, Zhangyue Yin, Jiahui Gao, Zhiyong Wu, Tianbao Xie, Jianbing Zhang, Ben Kao, Lingpeng Kong
Xem PDF HTML (thử nghiệm)
DOI do arXiv cấp thông qua DataCite
Lịch sử gửi bài
Từ: Qiushi Sun [xem email] [v1] Thứ Năm, 30 tháng 7, 2026 17:57:41 UTC (12.103 KB) [v2] Thứ Năm, 6 tháng 8, 2026 17:55:59 UTC (12.796 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (Nổi bậtBài nghiên cứu). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.