The Decoder: AI News
85

Nghiên cứu

Benchmark mới chỉ ra AI vẫn còn 'mù màu': Khả năng nhận diện hình ảnh thực tế rất hạn chế

(giờ Việt Nam)

Tóm tắt AI

Thử nghiệm PerceptionBench từ Moonshot AI cho thấy các mô hình AI hàng đầu đều chưa đạt 60% độ chính xác trong việc nhận diện hình ảnh, chứng minh lỗi suy luận thường bắt nguồn từ khâu đọc hình ảnh kém.

Bản dịch AI

New benchmark confirms AI models still perform poorly at visual perception

PerceptionBench của Moonshot AI kiểm tra khả năng "nhìn" thực tế của các mô hình AI đa phương thức, tách biệt khỏi khả năng suy luận logic. Không có mô hình tiên phong nào đạt độ chính xác 60%, và GPT-5.6 Sol đang dẫn đầu với cách biệt rất nhỏ. Nhiều lỗi được cho là do suy luận thực chất đã xảy ra ngay từ giai đoạn đọc hình ảnh.

Đội ngũ đứng sau trợ lý AI Kimi của Trung Quốc đã giới thiệu PerceptionBench, một bộ tiêu chuẩn đánh giá giúp tách biệt và kiểm tra khả năng nhận thức thị giác của các mô hình ngôn ngữ đa phương thức. Khác với các phương pháp kiểm tra tiêu chuẩn, PerceptionBench chia nhỏ thị giác thành mười kỹ năng cơ bản thay vì gộp chung nhận thức, kiến thức và suy luận vào một tác vụ duy nhất. Mọi câu hỏi đều có thể được trả lời chỉ bằng cách quan sát hình ảnh mà không cần đến suy luận hay kiến thức bên ngoài.

Các danh mục được xây dựng từ lỗi thực tế, không phải lý thuyết

Các tác giả giải thích phương pháp của họ bằng cách chỉ ra rằng mỗi bộ tiêu chuẩn hiện có chỉ nắm bắt được một phần nhỏ các lỗi nhận thức. 42 bộ tiêu chuẩn mã nguồn mở mà họ phân tích cho thấy rất ít sự trùng lặp trong hồ sơ lỗi, vì vậy mỗi bộ chỉ bao phủ một tập hợp con các điểm yếu về thị giác. Không có bài kiểm tra đơn lẻ hay nhóm bài kiểm tra nhỏ nào đủ để nắm bắt toàn diện khả năng nhận thức thị giác.

Thay vì xác định các danh mục ngay từ đầu, các tác giả đã xây dựng hệ thống phân loại từ các lỗi thực tế của mô hình và truy xuất từng lỗi về bước thất bại sớm nhất trong các bộ tiêu chuẩn hiện có. Kết quả là mười "lĩnh vực kỹ năng": Quan hệ thị giác (Visual Relation), Đếm (Counting), Thuộc tính (Attributes), Độ sâu & 3D (Depth & 3D), Định vị (Localization), So sánh (Comparison), Nhận diện chi tiết (Fine-grained Recognition), Tích hợp ngữ cảnh (Context Integration), OCR và Ảo giác (Hallucination).

Four case studies show how PerceptionBench breaks down multi-step tasks into individual perception questions, testing models on counting, spatial reasoning, and visual recognition.

Từ kho dữ liệu nội bộ gồm hơn 17.000 câu hỏi đã được xác minh, Moonshot AI đang công bố 3.000 tác vụ. 60% trong số đó bắt nguồn từ các lỗi mô hình đã được quy kết, trong khi 40% được tái cấu trúc bằng cách sử dụng hình ảnh tăng cường. Các tác vụ này thoạt nhìn có vẻ đơn giản: xác định vị trí một biểu tượng trên mặt đồng hồ, đếm số hoa bên trong một chiếc hộp màu đỏ, hoặc quyết định xem trong hai cốc đựng bút, cốc nào có sự kết hợp màu hồng xám và cốc nào có màu hồng trơn với thiết kế hoạt hình.

Không mô hình nào vượt qua mức 60%

Trong số 16 mô hình tiên phong được thử nghiệm, độ chính xác tổng thể cao nhất là 59,7%, thuộc về GPT-5.6 Sol. Kimi K3 theo sát với 58,5%, Claude Fable 5 đạt 57,2% và Gemini 3.1 Pro đạt 56,2%. GPT-5.5 đạt 55,8%. Các mô hình mã nguồn mở như Qwen3.5-397B-A17B (47,5%) và GLM-4.6V (32,5%) bị bỏ lại khá xa.

Bar chart showing overall accuracy of 16 multimodal models on PerceptionBench. GPT-5.6 Sol leads with 59.7 percent, followed by Kimi K3 at 58.5 and Claude Fable 5 at 57.2 percent. GLM-4.6V comes in la

Kết quả ở cấp độ danh mục mang tính chỉ dấu cao hơn so với bảng xếp hạng tổng thể. Các mô hình có điểm tổng hợp gần như tương đương lại cho thấy sự khác biệt rõ rệt trong từng danh mục riêng lẻ. Nhìn chung, "ảo giác" là kỹ năng yếu nhất trên diện rộng. GPT-5.6 Sol chỉ đạt 26,9% ở danh mục này mặc dù đứng đầu bảng tổng sắp, trong khi Gemini 3.5 Flash yếu hơn lại xếp trong nhóm dẫn đầu với 50,6%. Bài kiểm tra phụ này kiểm tra xem các mô hình có tự tạo ra các vật thể không tồn tại khi câu trả lời đúng đơn giản là "không" hay không.

Heatmap mapping 21 error types across 42 evaluated benchmarks. Color intensity indicates each error type's share per benchmark, with peak values of 0.99 for Depth & 3D on DA-2K, 0.93 for Visual Counti

Nhiều "lỗi suy luận" thực chất là lỗi nhận thức

Các tác giả lập luận rằng nhiều thất bại của mô hình đa phương thức thường bị quy cho là "lỗi suy luận" thực chất lại xảy ra ở cấp độ nhận thức. Khi một mô hình làm hỏng một tác vụ nhiều bước, bước đầu tiên là đọc hình ảnh một cách chính xác thường đã bị sai ngay từ đầu.

PerceptionBench chia các câu hỏi đó thành các câu hỏi phụ chỉ tập trung vào nhận thức, giúp xác định chính xác khả năng thị giác nào đang bị lỗi. Bộ dữ liệu và mã đánh giá hiện có sẵn trên GitHub tại MoonshotAI/PerceptionBench.

Một vấn đề nổi tiếng với rất ít tiến triển

Moonshot AI xây dựng mô hình mã nguồn mở Kimi K3, vốn đã thu hẹp khoảng cách với Claude Fable 5 và GPT-5.6 Sol xuống còn vài điểm trên các bộ tiêu chuẩn chung. K3 vẫn tụt hậu đáng kể trong các lĩnh vực chuyên biệt như an ninh mạng tấn công và toán học phức tạp. Về nhận thức thị giác, K3 hiện đã hoạt động ngang hàng với các đối thủ phương Tây.

Cùng nhóm nghiên cứu này đã phát hành WorldVQA, một bộ tiêu chuẩn tách biệt việc nhận diện vật thể khỏi suy luận. Mô hình tốt nhất ở đó, Gemini 3 Pro, không đạt nổi 50% khi chỉ dừng ở mức 47,4%, và tất cả các mô hình đều đánh giá quá cao mức độ tự tin của chính mình một cách có hệ thống.

Một nghiên cứu riêng biệt của các tổ chức Trung Quốc, với sự tham gia của Moonshot AI, đã sử dụng bộ tiêu chuẩn BabyVision để cho thấy các mô hình tiên phong thất bại ở các tác vụ thị giác cơ bản gắn liền với sự phát triển thời thơ ấu, chẳng hạn như vẽ theo đường kẻ hoặc đếm các khối hình bị ẩn. Gemini 3 Pro đạt 49,7% trong các tác vụ đó, trong khi con người đạt 94,1%. Các nhà nghiên cứu cho rằng khoảng cách này là do nút thắt cổ chai trong việc diễn đạt bằng lời, nơi thông tin thị giác bị chuyển đổi thành ngôn ngữ và mất đi độ trung thực.

Tin tức AI không cường điệu – Được tuyển chọn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo tiên phong "AI Radar" độc quyền sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền tham gia phần bình luận của chúng tôi.

Đăng ký ngay

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.