Hugging Face Daily Papers
Điểm AI 85/100

Nghiên cứu

VQS: Phương pháp tự tiến hóa cho mô hình thị giác-ngôn ngữ thông qua kiểm chứng bằng lập trình

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu giới thiệu VQS, một phương pháp giúp mô hình thị giác-ngôn ngữ tự học từ dữ liệu không nhãn bằng cách chuyển đổi hình ảnh thành cấu trúc dữ liệu có thể kiểm chứng, giúp giảm đáng kể sai sót so với các phương pháp bỏ phiếu truyền thống.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

Tóm tắt: Các mô hình ngôn ngữ-hình ảnh tự tiến hóa (self-evolving vision-language models) tự huấn luyện dựa trên các câu hỏi mà chúng tự tạo ra từ những hình ảnh không có nhãn. Vì các câu hỏi này không có đáp án chuẩn (gold answers), các phương pháp trước đây thường gán nhãn bằng cách bỏ phiếu đa số (majority vote) trên các đáp án được lấy mẫu hoặc thông qua một mô hình giám khảo (model judge). Trong một đánh giá của con người, chúng tôi nhận thấy 24% nhãn từ bỏ phiếu đa số và 18% nhãn từ mô hình giám khảo được tạo ra trong quá trình tự tiến hóa là sai. Để giải quyết vấn đề này, chúng tôi giới thiệu VQS (Verifiable QA Generation for Self-Evolving Models), phương pháp thay đổi cách mô hình đánh giá đáp án. Thay vì bỏ phiếu cho một đáp án, mô hình phân tích mỗi hình ảnh thành một bản ghi có cấu trúc, chẳng hạn như đồ thị cảnh (scene graph), bảng biểu (chart table) hoặc đồ thị sơ đồ (diagram graph). Sau đó, các chương trình cố định sẽ viết một câu hỏi từ bản ghi đó và tính toán đáp án. Mô hình vẫn đóng vai trò là trình kiểm tra hình ảnh, nhưng chỉ xác nhận các sự kiện riêng lẻ mà chương trình đọc được, mỗi lần một khẳng định ngắn. Các bước kiểm tra ở cấp độ khẳng định này sẽ chọn mục tiêu huấn luyện cho bộ phân tích, nhờ đó bộ phân tích cũng cải thiện mà không cần nhãn. Những người đánh giá là con người nhận thấy 94% đáp án của VQS là chính xác, so với 76% của phương pháp bỏ phiếu đa số. Trên mười tiêu chuẩn đánh giá (benchmarks), VQS cải thiện Qwen3-VL lên tới 3,18 điểm ở các quy mô 2B, 4B và 8B, đồng thời vượt trội hơn so với mô hình cơ sở tự tiến hóa mạnh nhất ở mỗi quy mô. Mức tăng trưởng tiếp tục tăng qua ba vòng huấn luyện, đạt 3,84 điểm ở quy mô 2B. Mã nguồn đã được phát hành tại đường dẫn https này

Bình luận:26 trang
Chủ đề:Thị giác máy tính và Nhận dạng mẫu (cs.CV); Trí tuệ nhân tạo (cs.AI); Tính toán và Ngôn ngữ (cs.CL); Học máy (cs.LG); Tính toán thần kinh và tiến hóa (cs.NE)
Trích dẫn là:arXiv:2609.33855 [cs.CV]
(hoặc arXiv:2609.33855v1 [cs.CV] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.33855 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Ahmed Heakl [xem email] [v1] CN, 27 Thg 9, 2026 19:13:38 UTC (23.201 KB)

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

VQS: Phương pháp tự tiến hóa cho mô hình thị giác-ngôn ngữ thông qua kiểm chứng bằng lập trình | AIHOT.vn