HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Điểm AI 45/100

Nghiên cứu

ColNanoVDR: Khung chưng cất truy vấn không cần tài liệu cho truy xuất tài liệu hình ảnh đa vector

(giờ Việt Nam)

Tóm tắt AI

ColNanoVDR là khung làm việc tiên phong sử dụng chưng cất truy vấn không cần tài liệu cho truy xuất tài liệu hình ảnh (VDR), giúp đồng bộ hóa token giữa mô hình học sinh và giáo viên thông qua tối ưu hóa vận chuyển dựa trên entropy mà không cần dữ liệu trang.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

Tóm tắt: Các bộ truy xuất đa vector (multi-vector retrievers) được xây dựng trên các mô hình thị giác-ngôn ngữ đang dẫn đầu trong lĩnh vực truy xuất tài liệu hình ảnh (VDR), nhưng chúng phải chạy một bộ mã hóa truy vấn (query encoder) với hàng tỷ tham số cho mỗi lần tìm kiếm. Việc chưng cất (distilling) bộ mã hóa này thành một mô hình học viên (student) nhỏ hơn để truy vấn chỉ mục hiện có của mô hình giáo viên (teacher) sẽ loại bỏ được điểm nghẽn này. Tuy nhiên, công thức tiêu chuẩn lại khớp với điểm số MaxSim của giáo viên, do đó yêu cầu phải mã hóa và lưu vào bộ nhớ đệm mọi trang huấn luyện, vốn có thể lên tới hàng terabyte token trang. NanoVDR tránh hoàn toàn việc sử dụng trang bằng cách chỉ huấn luyện trên các embedding truy vấn của giáo viên, nhưng chỉ áp dụng cho các bộ truy xuất đơn vector. Chúng tôi giới thiệu ColNanoVDR, theo hiểu biết của chúng tôi là khung làm việc đầu tiên mang phương pháp chưng cất không cần tài liệu này đến với VDR đa vector. Mục tiêu của nó, OTW (Optimal Transport with Learned Weights - Vận chuyển tối ưu với trọng số học được), căn chỉnh các token truy vấn của học viên với giáo viên thông qua vận chuyển tối ưu entropy, với trọng số học được cho mỗi token của học viên, và không cần sự tương ứng giữa hai cách token hóa. Chúng tôi chứng minh rằng chi phí căn chỉnh thu được giới hạn sự khác biệt điểm số MaxSim trên mọi trang. Được chưng cất từ năm mô hình giáo viên hiện đại nhất, các mô hình học viên chỉ dùng văn bản với 149 triệu tham số giữ lại khoảng 95% chỉ số NDCG@5 của giáo viên trên ViDoRe v1-v3 trong khi mã hóa truy vấn nhanh hơn tới 26 lần. Với cùng điều kiện huấn luyện, OTW khớp với phương pháp chưng cất điểm số trong khi không cần mã hóa bất kỳ trang nào và đọc ít hơn 12,6 lần dữ liệu giáo viên đã lưu trong bộ nhớ đệm.

Ghi chú:20 trang, 5 hình ảnh, 11 bảng. Mã nguồn: this https URL; Các mô hình: this https URL
Chủ đề:Truy xuất thông tin (cs.IR); Tính toán và Ngôn ngữ (cs.CL); Thị giác máy tính và Nhận dạng mẫu (cs.CV)
Trích dẫn là:arXiv:2609.34899 [cs.IR]
(hoặc arXiv:2609.34899v1 [cs.IR] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.34899 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Zhuchenyang Liu [xem email] [v1] Thứ Hai, 28 tháng 9 năm 2026 11:05:45 UTC (688 KB)

Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

ColNanoVDR: Khung chưng cất truy vấn không cần tài liệu cho truy xuất tài liệu hình ảnh đa vector | AIHOT.vn