Hugging Face Daily Papers
85

Nghiên cứu

Nhìn hay Biết? Phân tích khả năng xử lý bối cảnh thị giác trong các mô hình ngôn ngữ đa phương thức

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu chỉ ra rằng các mô hình ngôn ngữ đa phương thức (MLLM) thường ưu tiên kiến thức có sẵn hơn là bằng chứng thị giác khi chúng mâu thuẫn nhau. Tác giả giới thiệu bộ benchmark WhatIfVis để đo lường mức độ nhạy bén của mô hình đối với bối cảnh hình ảnh thực tế.

Bản dịch AI

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Jiaang Li [xem email] [v1] Thứ Ba, 28 tháng 7 năm 2026 22:52:34 UTC (12.222 KB)

MLLMThị giác máy tínhĐa phương thứcNghiên cứu AIBenchmark
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.