Apple Machine Learning Research
85

Tin ngành

Apple đề xuất phương pháp đánh giá chất lượng mô tả video qua trắc nghiệm

(giờ Việt Nam)

Tóm tắt AI

Apple giới thiệu chỉ số mới dựa trên độ trung thực thông tin để đánh giá mô tả video, khắc phục hạn chế của các phương pháp so khớp văn bản truyền thống vốn không phản ánh đúng tính đa dạng của nội dung.

Bản dịch AI

Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question Answering

Tác giả: Zizhen Wang, Bo Feng, Zhengfeng Lai†**, Shiyu Li, Yang Lu, Meng Cao, Ping Huang, Simon Wang

Đánh giá khả năng chú thích video (video captioning) vẫn là một thách thức quan trọng đối với các Mô hình Ngôn ngữ Lớn Thị giác (VLLMs). Các thước đo hiện nay chủ yếu dựa vào việc so khớp văn bản được tạo ra với các tham chiếu thực tế (ground-truth). Mô hình này gặp hạn chế do bản chất "một-nhiều" của việc mô tả video, trong đó các chú thích chất lượng cao thường bị đánh giá thấp do sai lệch về từ vựng hoặc sự thay đổi hợp lý trong trọng tâm hình ảnh. Hơn nữa, các đánh giá như vậy thường mang tính một chiều, không cung cấp được phân tích chi tiết về chất lượng chú thích. Để giải quyết vấn đề này, chúng tôi định nghĩa lại chất lượng chú thích thông qua độ trung thực của thông tin: Một chú thích phải tối đa hóa phạm vi bao phủ các thông tin hình ảnh nổi bật đồng thời đảm bảo tính xác thực nghiêm ngặt. Chúng tôi giới thiệu CapQuiz, một tiêu chuẩn đánh giá không cần tham chiếu (reference-free benchmark) mới, giúp đánh giá các chú thích dựa trên tính hữu ích của chúng trong việc trả lời các câu hỏi trắc nghiệm chi tiết, đã được con người xác thực, được rút ra từ video. CapQuiz sở hữu hệ thống phân loại phân cấp gồm 10 loại câu hỏi (trải dài trên các danh mục Mô tả và Suy luận) thuộc 24 lĩnh vực video đa dạng. Chúng tôi cũng xây dựng CapF1, một thước đo tổng hợp kết hợp giữa CapP (đo lường tính xác thực) và CapR (đo lường phạm vi bao phủ). Các thử nghiệm mở rộng cho thấy CapQuiz có sự tương quan tốt hơn đáng kể với đánh giá của con người so với các thước đo hiện có và cung cấp những hiểu biết có thể diễn giải được về hiệu suất của mô hình.

Các bài đọc và cập nhật liên quan.

Chú thích hình ảnh (image captioning) là một trong những tác vụ cơ bản nhất trong thị giác máy tính. Do tính chất mở, nó đã nhận được sự quan tâm đáng kể trong kỷ nguyên của các mô hình ngôn ngữ lớn đa phương thức (MLLMs). Để theo đuổi các chú thích ngày càng chi tiết và chính xác hơn, các nghiên cứu gần đây ngày càng chuyển hướng sang học tăng cường (reinforcement learning - RL). Tuy nhiên, các phương pháp chú thích dựa trên RL và các thước đo đánh giá hiện có thường nhấn mạnh vào một khái niệm hẹp về chất lượng chú thích, dẫn đến…

Đọc thêm

Những tiến bộ gần đây trong các mô hình đa phương thức làm nổi bật giá trị của các chú thích được viết lại trong việc cải thiện hiệu suất, tuy nhiên vẫn còn đó những thách thức chính. Đáng chú ý, vai trò của các chú thích tổng hợp và sự tương tác của chúng với các AltText gốc thu thập từ web trong quá trình tiền huấn luyện vẫn chưa rõ ràng. Ngoài ra, các mô hình nền tảng đa phương thức khác nhau có thể có những ưu tiên riêng biệt cho các định dạng chú thích cụ thể, trong khi các nỗ lực nghiên cứu về chú thích tối ưu cho từng mô hình nền tảng…

Đọc thêm

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.