Nghiên cứu
Tri-PvP: Vạch trần thiên kiến đa phương thức trong các mô hình ngôn ngữ lớn Omni-modal
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu giới thiệu Tri-PvP, bộ benchmark gồm 8.000 mẫu nhằm phân tích sự xung đột giữa tín hiệu tri giác và mệnh đề trong các mô hình đa phương thức, qua đó phát hiện thiên kiến thị giác mạnh mẽ và sự bất đối xứng trong cách các mô hình xử lý dữ liệu.
Chính văn · Bản dịch AI
Tóm tắt: Các mô hình ngôn ngữ lớn đa phương thức (OLLMs) xử lý đồng thời hình ảnh, âm thanh và văn bản, tuy nhiên thiên kiến phương thức của chúng trong các tình huống xung đột đa phương thức vẫn chưa được nghiên cứu kỹ lưỡng. Các tiêu chuẩn đánh giá hiện tại thường gộp chung hai dạng bằng chứng riêng biệt trong cùng một phương thức: tín hiệu tri giác (ví dụ: ảnh chụp hoặc bản ghi âm một chú chó) và tín hiệu mệnh đề (ví dụ: khẳng định "đây là một chú chó"), khiến cho bất kỳ thiên kiến phương thức nào được đo lường cũng bị lẫn lộn với thiên kiến dạng bằng chứng, gây khó khăn cho việc xác định chính xác nguồn gốc. Để giải quyết vấn đề này, chúng tôi giới thiệu Tri-PvP, một tiêu chuẩn đánh giá xung đột tam phương thức gồm 8.000 mẫu kết hợp giữa hình ảnh, âm thanh và văn bản, trong đó hình ảnh và âm thanh đều có thể ở dạng tri giác hoặc mệnh đề. Khi đánh giá năm mô hình OLLMs, chúng tôi nhận thấy thiên kiến thị giác mạnh mẽ xuất hiện ở hầu hết các mô hình và điều kiện loại bằng chứng. Quan trọng hơn, chúng tôi phát hiện ra sự bất đối xứng có hệ thống trong thiên kiến dạng bằng chứng: các mô hình thể hiện thiên kiến mạnh hơn đối với tín hiệu tri giác trong hình ảnh, nhưng lại thiên về tín hiệu mệnh đề trong âm thanh. Các phân tích sâu hơn thông qua kỹ thuật thăm dò tuyến tính theo lớp (layer-wise linear probing) và giải mã đối lập (contrastive decoding) cho thấy thiên kiến phương thức có thể được giải mã tuyến tính ngay từ các lớp biểu diễn sớm và chỉ có thể được giảm thiểu một phần, đòi hỏi các chiến lược can thiệp sâu hơn thay vì chỉ dừng lại ở bề mặt.
| Bình luận: | EMNLP 2026 Findings |
| Chủ đề: | Tính toán và Ngôn ngữ (cs.CL); Trí tuệ nhân tạo (cs.AI); Thị giác máy tính và Nhận dạng mẫu (cs.CV); Âm thanh (cs.SD) |
| Trích dẫn là: | arXiv:2609.06011 [cs.CL] |
| (hoặc arXiv:2609.06011v1 [cs.CL] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.06011 DOI do arXiv cấp thông qua DataCite |
Lịch sử gửi bài
Từ: Yen-Ting Piao [xem email] [v1] Thứ Bảy, 5 tháng 9 năm 2026 10:33:58 UTC (3.182 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.