Apple Machine Learning Research
85

Nghiên cứu

LVSum: Apple ra mắt bộ chuẩn đánh giá khả năng tóm tắt video dài cho mô hình đa phương thức

(giờ Việt Nam)

Tóm tắt AI

Apple giới thiệu LVSum, bộ chuẩn dữ liệu gồm 72 video dài với chú thích thời gian chi tiết, nhằm đánh giá khả năng tóm tắt và định vị thời gian của các mô hình AI đa phương thức hiện nay.

Bản dịch AI

LVSum: A Benchmark for Timestamp-Aware Long Video Summarization

Tác giả: Alkesh Patel*, Melis Ozyildirim*, Ying-Chang Cheng, Ganesh Nagarajan

Tóm tắt video dài đặt ra những thách thức đáng kể cho các mô hình ngôn ngữ lớn đa phương thức (MLLM), đặc biệt là trong việc duy trì độ trung thực về thời gian trong suốt thời lượng kéo dài và tạo ra các bản tóm tắt vừa có cơ sở về ngữ nghĩa vừa có cơ sở về thời gian. Chúng tôi giới thiệu LVSum, một bộ tiêu chuẩn đánh giá được con người chú giải để đánh giá việc tóm tắt video dạng dài với sự căn chỉnh thời gian chi tiết. LVSum bao gồm 72 video đa dạng trải dài trên 13 lĩnh vực với thời lượng trung bình là 16 phút, mỗi video được chú giải với tối đa 10 bản tóm tắt do con người tạo ra có chứa các tham chiếu thời gian. Chúng tôi thực hiện đánh giá toàn diện các MLLM độc quyền và mã nguồn mở hàng đầu bằng cách sử dụng các chỉ số dựa trên LLM mới được giới thiệu về mức độ liên quan của nội dung và tính nhất quán của phương thức, bên cạnh các chỉ số tự động tiêu chuẩn. Các thí nghiệm của chúng tôi tiết lộ ba phát hiện chính: (1) bản ghi (transcripts) đóng góp đáng kể vào chất lượng tóm tắt hơn là chỉ dựa vào các khung hình trực quan, (2) vẫn tồn tại khoảng cách hiệu suất đáng kể giữa các bản tóm tắt do mô hình tạo ra và do con người viết, và (3) các MLLM hiện tại bộc lộ những điểm yếu mang tính hệ thống trong việc xác định cơ sở thời gian, tuân thủ hướng dẫn và tính nhất quán đa phương thức.

Các bài đọc và cập nhật liên quan.

Các mô hình ngôn ngữ lớn đa phương thức (MLLM) gần đây đã cho thấy hiệu suất mạnh mẽ trong việc hiểu hình ảnh, tuy nhiên chúng thường thiếu nhận thức về thời gian, đặc biệt là trong các bối cảnh góc nhìn thứ nhất (egocentric) nơi việc suy luận phụ thuộc vào trình tự và sự phát triển đúng đắn của các sự kiện. Sự thiếu hụt này một phần bắt nguồn từ các mục tiêu đào tạo không khen thưởng rõ ràng cho việc suy luận thời gian mà thay vào đó lại dựa vào các lối tắt không gian ở cấp độ khung hình. Để giải quyết hạn chế này, chúng tôi đề xuất…

Đọc thêm

Các mô hình ngôn ngữ lớn đa phương thức (MLLM) đã đạt được những tiến bộ ấn tượng trong suy luận ngôn ngữ-hình ảnh, tuy nhiên khả năng hiểu các câu chuyện diễn ra theo thời gian trong video của chúng vẫn chưa được khám phá đầy đủ. Việc hiểu câu chuyện thực sự đòi hỏi phải xác định được ai đang làm gì, khi nào và ở đâu, đồng thời duy trì các biểu diễn thực thể nhất quán trong các bối cảnh hình ảnh và thời gian năng động. Chúng tôi giới thiệu NarrativeTrack, bộ tiêu chuẩn đầu tiên đánh giá câu chuyện…

Đọc thêm

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.