Tinh chọnNhìn hay Biết? Phân tích khả năng xử lý bối cảnh thị giác trong các mô hình ngôn ngữ đa phương thức
Nghiên cứu chỉ ra rằng các mô hình ngôn ngữ đa phương thức (MLLM) thường ưu tiên kiến thức có sẵn hơn là bằng chứng thị giác khi chúng mâu thuẫn nhau. Tác giả giới thiệu bộ benchmark WhatIfVis để đo lường mức độ nhạy bén của mô hình đối với bối cảnh hình ảnh thực tế.