Nghiên cứu
δ-Vision: Tối ưu hóa mô hình đa phương thức bằng cách tái cấu trúc trạng thái thị giác qua MLP
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu giới thiệu δ-Vision, sử dụng các bộ chuyển đổi MLP nhẹ để tái tạo trạng thái thị giác thay vì xử lý lặp lại các token hình ảnh, giúp tăng hiệu suất mà vẫn bảo toàn dữ liệu thị giác cho mô hình đa phương thức.
Chính văn · Bản dịch AI
Tóm tắt: Các chuỗi token hình ảnh dài thường chiếm một phần đáng kể chi phí tính toán trong các mô hình ngôn ngữ lớn đa phương thức (MLLMs). Các phương pháp hiện có giảm chi phí này bằng cách cắt tỉa các token hình ảnh dư thừa, nhưng lại loại bỏ vĩnh viễn các bằng chứng hình ảnh có thể trở nên hữu ích trong các lớp tiếp theo. Thay vào đó, chúng tôi đặt câu hỏi liệu có thể bảo toàn tất cả các token hình ảnh trong khi vẫn giảm chi phí phát triển lặp đi lặp lại các biểu diễn thông qua Transformer hay không. Để trả lời câu hỏi này, chúng tôi thực hiện các can thiệp hạng thấp (low-rank) vào luồng thông tin từ hình ảnh sang văn bản. Chúng tôi nhận thấy rằng, sau khi chặn sự chú ý từ hình ảnh sang văn bản, việc khôi phục chỉ một vài hướng sẽ lấy lại được hầu hết độ chính xác đã mất, cho thấy ảnh hưởng hình ảnh liên quan tập trung trong một không gian con có chiều thấp. Chúng tôi quan sát thấy khả năng dự đoán mạnh mẽ trong các trạng thái hình ảnh theo từng lớp: các MLP nhẹ có thể xấp xỉ chúng với độ tương đồng cosine cao và sai số tái tạo thấp. Dựa trên những phát hiện này, chúng tôi đề xuất $\delta$-Vision, thay thế quá trình phát triển Transformer lặp lại của các token hình ảnh bằng các bộ điều hợp hạng thấp (low-rank adapters) nhẹ, giúp xây dựng bộ nhớ hình ảnh theo từng lớp trong khi vẫn bảo toàn tất cả các token hình ảnh để truy xuất văn bản. Trên các tiêu chuẩn đánh giá hình ảnh và video, $\delta$-Vision đạt độ chính xác cao hơn so với các phương pháp cơ sở cắt tỉa token hình ảnh ở mức tính toán tương đương hoặc thấp hơn, đồng thời mang lại hiệu suất suy luận cạnh tranh mà không cần loại bỏ các token hình ảnh.
| Bình luận: | 21 trang, 5 hình ảnh |
| Chủ đề: | Thị giác máy tính và Nhận dạng mẫu (cs.CV); Trí tuệ nhân tạo (cs.AI) |
| Trích dẫn là: | arXiv:2609.34972 [cs.CV] |
| (hoặc arXiv:2609.34972v1 [cs.CV] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.34972 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Jingdi Lei [xem email] [v1] Thứ Hai, 28 tháng 9 năm 2026 11:52:45 UTC (399 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.