Hugging Face Daily Papers
92

Nghiên cứu

ActiveVision: Thử thách khả năng quan sát chủ động của các mô hình đa phương thức

(giờ Việt Nam)

Tóm tắt AI

ActiveVision là bộ tiêu chuẩn đánh giá mới buộc các mô hình MLLM phải quan sát liên tục thay vì chỉ nhìn một lần. Kết quả cho thấy ngay cả những mô hình tiên tiến nhất cũng gặp khó khăn lớn khi thực hiện các tác vụ đòi hỏi sự tập trung thị giác chủ động.

Bản dịch AI

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Jiarui Zhang [xem email] [v1] Thứ Sáu, 17 tháng 7 năm 2026 17:46:23 UTC (7,399 KB)

AIThị giác máy tínhMLLMNghiên cứu AIBenchmark
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.