Hugging Face Daily Papers
Điểm AI 85/100

Nghiên cứu

RenderRank: Tối ưu hóa xếp hạng văn bản bằng token hình ảnh nén

(giờ Việt Nam)

Tóm tắt AI

RenderRank là phương pháp reranker mới chuyển đổi văn bản tài liệu thành token hình ảnh để giảm độ dài đầu vào, giúp tiết kiệm tài nguyên tính toán mà vẫn đạt hiệu suất vượt trội so với các mô hình dựa trên văn bản truyền thống trên 11 bộ dữ liệu BEIR.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

Tóm tắt: Việc hiển thị văn bản tài liệu dưới dạng hình ảnh cho phép các mô hình ngôn ngữ - thị giác mã hóa tài liệu thành các token hình ảnh, giúp giảm độ dài chuỗi đầu vào so với đầu vào dạng văn bản. Việc giảm độ dài đầu vào này đặc biệt hữu ích cho tác vụ xếp hạng lại (reranking), nơi mỗi truy vấn liên quan đến việc chấm điểm nhiều tài liệu ứng viên và việc tiết kiệm token được áp dụng cho mỗi lần đánh giá ứng viên. Chúng tôi giới thiệu RenderRank, một bộ xếp hạng lại học cách chấm điểm mức độ liên quan phụ thuộc vào truy vấn từ các biểu diễn tài liệu hình ảnh nén thay vì các chuỗi token văn bản được sử dụng bởi các bộ xếp hạng lại dựa trên văn bản truyền thống. Quá trình huấn luyện trước tiên căn chỉnh điểm số mức độ liên quan từ đầu vào hình ảnh với điểm số của một mô hình giáo viên dựa trên văn bản, sau đó tinh chỉnh điểm số tương đối của các tài liệu tích cực và tiêu cực cho cùng một truy vấn. Trên 11 tập dữ liệu từ BEIR, RenderRank sử dụng ít hơn 16,5-35,5% token đầu vào trong khi đạt mức NDCG@10 trung bình là 55,96, vượt trội hơn tất cả các mô hình cơ sở dựa trên văn bản được đánh giá dưới 4 tỷ tham số và một số mô hình lớn hơn. Trên bốn tập dữ liệu tài liệu dài, mô hình đạt mức NDCG@10 trung bình là 88,27 với số lượng token đầu vào trung bình chỉ bằng khoảng một nửa so với các bộ xếp hạng lại dựa trên văn bản được đánh giá. Trong thiết lập này, RenderRank mang lại thông lượng trung bình cao gấp 1,70 lần so với các mô hình cơ sở được đánh giá. Những kết quả này chứng minh rằng các biểu diễn hình ảnh nén có thể hỗ trợ chấm điểm mức độ liên quan của tài liệu một cách chính xác, cung cấp một giải pháp thay thế cho các biểu diễn token văn bản trong tác vụ xếp hạng lại.

Chủ đề:Truy xuất thông tin (cs.IR)
Trích dẫn là:arXiv:2609.35069 [cs.IR]
(hoặc arXiv:2609.35069v1 [cs.IR] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.35069 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Seongtae Hong [xem email] [v1] Thứ Hai, 28 tháng 9 năm 2026 12:57:13 UTC (511 KB)

RerankingVision-LanguageTối ưu hóaNén dữ liệuTìm kiếm thông tin

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

RenderRank: Tối ưu hóa xếp hạng văn bản bằng token hình ảnh nén | AIHOT.vn