Nghiên cứu
Liệu có thể loại bỏ bộ mã hóa hình ảnh trong các mô hình đa phương thức?
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu phân tích quy luật mở rộng của các mô hình đa phương thức không dùng bộ mã hóa (encoder-free), chỉ ra rằng dù kém hiệu quả ở quy mô nhỏ, chúng có tiềm năng bắt kịp các mô hình truyền thống khi đạt ngưỡng 10^22 FLOPs.
Chính văn · Bản dịch AI
Tóm tắt: Hầu hết các mô hình ngôn ngữ lớn đa phương thức (MLLM) hiện đại đều được xây dựng dựa trên một bộ mã hóa hình ảnh (visual encoder) đã được huấn luyện trước, cung cấp các tiền đề hình ảnh mạnh mẽ. Ngược lại, các MLLM không dùng bộ mã hóa (encoder-free) học các biểu diễn hình ảnh trực tiếp từ các pixel thô, mang lại một kiến trúc đơn giản và thống nhất, nhưng hành vi mở rộng (scaling behavior) của chúng vẫn chưa được đặc tả một cách hệ thống. Để lấp đầy khoảng trống này, chúng tôi so sánh các quy luật mở rộng cho MLLM không dùng bộ mã hóa và MLLM dùng bộ mã hóa, đồng thời báo cáo ba phát hiện chính: (1) Việc loại bỏ bộ mã hóa hình ảnh làm thay đổi sự phân bổ tối ưu tính toán cho mục tiêu đa phương thức hướng tới các mô hình lớn hơn, trong khi vẫn giữ nguyên mục tiêu văn bản. (2) Hai kiến trúc này cho thấy các đường biên tổn thất-tính toán (loss-compute frontiers) gần như trùng lặp trên mục tiêu văn bản, nhưng lại phân kỳ trên mục tiêu đa phương thức: các mô hình không dùng bộ mã hóa hoạt động kém hơn ở quy mô nhỏ nhưng được dự đoán sẽ bắt kịp ở mức khoảng $10^{22}$ FLOPs, nằm trong phạm vi ngân sách huấn luyện trước thực tế. (3) Nếu không có bộ mã hóa hình ảnh, mô hình ngôn ngữ sẽ học cách đảm nhận vai trò đó thông qua sự thích nghi đặc thù với thị giác: các tương tác hai chiều giữa các token hình ảnh trở nên ngày càng có lợi khi tính toán huấn luyện tăng lên, quá trình xử lý hình ảnh chuyển dịch về các lớp sớm hơn, và việc định tuyến chuyên gia (expert routing) cho các token hình ảnh trở nên tập trung hơn. Nhìn chung, kết quả của chúng tôi chỉ ra rằng lợi thế của tiền đề hình ảnh do bộ mã hóa huấn luyện trước cung cấp sẽ giảm dần theo quy mô, định vị các kiến trúc không dùng bộ mã hóa như một hướng đi đầy hứa hẹn cho việc huấn luyện trước đa phương thức.
| Chủ đề: | Thị giác máy tính và Nhận dạng mẫu (cs.CV) |
| Trích dẫn là: | arXiv:2609.35457 [cs.CV] |
| (hoặc arXiv:2609.35457v1 [cs.CV] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.35457 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Lin Chen [xem email] [v1] Thứ Hai, 28 tháng 9 năm 2026 15:48:41 UTC (1,342 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.