Nghiên cứu
Mage-VL: Mô hình đa phương thức nền tảng tối ưu cho xử lý video trực tuyến
(giờ Việt Nam)
Tóm tắt AI
Mage-VL giải quyết bài toán xử lý video thời gian thực bằng cách sử dụng bộ mã hóa Mage-ViT, giúp giảm 75% lượng token hình ảnh mà vẫn giữ nguyên ngữ cảnh không gian-thời gian, vượt trội hơn nhiều mô hình hiện nay.
Bản dịch AI
Tác giả: Senqiao Yang, Kaichen Zhang, Zhaoyang Jia, Jinghao Guo, Yifei Shen, Xinjie Zhang, Xiaoyi Zhang, Haoqing Wang, Xiao Li, Peng Zhang, Xiang An, Yin Xie, Zhening Liu, Xun Guo, Jiahao Li, Shicheng Zheng, Jinglu Wang, Zongyu Guo, Wenxuan Xie, Zihan Zheng, Yuxuan Luo, Bin Li, Yan Lu
Xem PDF HTML (thử nghiệm)
DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)
Lịch sử gửi bài
Từ: Senqiao Yang [xem email] [v1] Thứ Hai, 27 tháng 7 năm 2026 17:59:53 UTC (2.571 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.