Hugging Face Daily Papers
Điểm AI 85/100

Nghiên cứu

LT-OPD: Tối ưu hóa nén token hình ảnh cực hạn cho MLLM thông qua tự chưng cất on-policy

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu giới thiệu LT-OPD, khung huấn luyện giúp các mô hình MLLM duy trì hiệu suất khi nén token hình ảnh xuống mức cực thấp bằng cách sử dụng cơ chế tự chưng cất on-policy từ phiên bản đầy đủ.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

Tóm tắt: Giảm token hình ảnh là một phương pháp hiệu quả để tăng tốc các mô hình ngôn ngữ lớn đa phương thức (MLLM), nhưng hiệu suất lại suy giảm nhanh chóng khi ngân sách token ở mức cực thấp. Các nghiên cứu hiện tại đã khám phá cả việc lựa chọn token hình ảnh và thích nghi dựa trên huấn luyện đối với các đầu vào hình ảnh đã giảm. Chúng tôi tiến thêm một bước bằng cách đặt câu hỏi làm thế nào một MLLM bị nén mạnh có thể học hỏi từ các trạng thái do chính nó tạo ra. Thiết lập này tự nhiên dẫn đến việc tự chưng cất on-policy (on-policy self-distillation): một mô hình bị nén mạnh được giám sát dựa trên các trạng thái do chính nó tạo ra, trong khi phiên bản đầy đủ token của nó đóng vai trò là giáo viên giàu thông tin. Dựa trên hiểu biết này, chúng tôi đề xuất LT-OPD, một khung huấn luyện dành cho việc giảm token hình ảnh cực hạn. Mô hình học viên đưa ra các phản hồi chỉ với một phần nhỏ token hình ảnh, và một bản sao đầy đủ token của cùng MLLM đó (được đóng băng) sẽ cung cấp sự giám sát phân phối dọc theo các quỹ đạo do học viên tạo ra. Để ổn định quá trình học on-policy khi bằng chứng hình ảnh bị hạn chế nghiêm trọng, chúng tôi giới thiệu thêm một chương trình giảng dạy theo cấp độ ngân sách (budget-level curriculum), giúp giảm dần ngân sách token trong quá trình huấn luyện. Trên chín tiêu chuẩn đánh giá đối với Qwen3.5-4B, LT-OPD nâng hiệu suất duy trì trung bình ở mức giữ lại 5% token hình ảnh từ 68.6% lên 82.3%, vượt trội hơn so với các phương pháp cơ sở không cần huấn luyện, dựa trên huấn luyện và học tăng cường ở cùng mức ngân sách. Những cải thiện này chuyển đổi nhất quán sang Qwen3.5-9B, GLM-4.6V-9B và LLaVA-OV-1.5-4B. LT-OPD cũng giảm mức sử dụng KV-cache đi 85.2% và giảm FLOPs tiền nạp (prefill) đi 85.4% mà không gây thêm chi phí suy luận, chứng minh rằng việc học on-policy có thể khôi phục đáng kể các khả năng bị mất do giảm token hình ảnh cực hạn.

Bình luận:Mã nguồn tại URL này
Chủ đề:Thị giác máy tính và Nhận dạng mẫu (cs.CV); Tính toán và Ngôn ngữ (cs.CL); Học máy (cs.LG)
Trích dẫn là:arXiv:2609.32353 [cs.CV]
(hoặc arXiv:2609.32353v1 [cs.CV] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.32353 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Junxian Li [xem email] [v1] Thứ Bảy, 26 tháng 9 năm 2026 08:16:07 UTC (2,817 KB)

MLLMNén tokenThị giác máy tínhTự chưng cấtTối ưu hóa mô hình

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

LT-OPD: Tối ưu hóa nén token hình ảnh cực hạn cho MLLM thông qua tự chưng cất on-policy | AIHOT.vn