Hugging Face Daily Papers
92

Nghiên cứu

Audio-Visual Flamingo: Mô hình ngôn ngữ lớn đột phá cho video dài và phức tạp

(giờ Việt Nam)

Tóm tắt AI

AV-Flamingo là mô hình ngôn ngữ đa phương thức mã nguồn mở, được thiết kế để hiểu và suy luận chuyên sâu trên các video dài với khả năng xử lý âm thanh, hình ảnh và chuỗi sự kiện phức tạp.

Bản dịch AI

Tác giả: Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon Kim, Sungwon Kim, S Sakshi, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Sreyan Ghosh [xem email] [v1] Thứ Sáu, ngày 17 tháng 7 năm 2026 16:41:15 UTC (8.913 KB)

AI đa phương thứcMô hình ngôn ngữ lớnXử lý videoMã nguồn mởDeep Learning
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.