Hugging Face Daily Papers
Điểm AI 85/100

Nghiên cứu

AdaTutoRank: Tối ưu hóa học tập thích ứng để xếp hạng lại tài liệu trong RAG và nghiên cứu chuyên sâu

(giờ Việt Nam)

Tóm tắt AI

AdaTutoRank giải quyết vấn đề phân bổ tín dụng trong việc xếp hạng tập hợp tài liệu, giúp cải thiện độ chính xác và tính bổ trợ cho các hệ thống RAG và nghiên cứu chuyên sâu bằng cách thay thế phương pháp chấm điểm tổng quát bằng cơ chế hướng dẫn thích ứng.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

Tóm tắt: Các bộ sắp xếp lại tài liệu (rerankers) quyết định bằng chứng nào sẽ được đưa đến mô hình hạ nguồn trong RAG và nghiên cứu chuyên sâu. Tuy nhiên, các bộ reranker phổ biến hiện nay lựa chọn dựa trên sự khớp về mức độ liên quan, trong khi các tài liệu liên quan riêng lẻ hiếm khi tạo thành một tập hợp hoàn chỉnh, bổ sung và không trùng lặp theo yêu cầu của các nhu cầu thông tin phức tạp. Các nghiên cứu trước đây đánh giá một tập hợp dựa trên điểm số tiêu chí tổng hợp, chuyển mục tiêu từ xếp hạng tài liệu sang soạn thảo tập hợp. Tuy nhiên, điểm số đó là một giá trị vô hướng duy nhất được áp dụng cho mọi tài liệu trong tập hợp, dẫn đến sự giám sát thưa thớt: một tài liệu trùng lặp sẽ được khen thưởng cùng với các tài liệu khác bất cứ khi nào tập hợp đạt điểm cao, và một tài liệu mang tính quyết định sẽ bị phạt cùng với các tài liệu khác bất cứ khi nào tập hợp đạt điểm thấp; việc phân bổ tín dụng khiến các thành phần đóng góp không thể phân biệt được với các thành phần "ăn theo". Chưng cất chính sách (on-policy distillation) có thể làm dày đặc sự giám sát này, nhưng các phương pháp hiện tại cung cấp cùng một hướng dẫn cố định cho mọi lần triển khai (rollout), điều này quá cứng nhắc đối với các lần triển khai mạnh và quá trừu tượng đối với các lần triển khai yếu. Do đó, chúng tôi đề xuất AdaTutoRank, một bộ reranker theo tập hợp được huấn luyện bằng Tối ưu hóa Gia sư Thích ứng (Adaptive Tutoring Optimization - ATO) theo hệ thống phân cấp ba cấp gồm chín chiều tiêu chí, cung cấp nhãn bạc cho giai đoạn khởi động lạnh (cold start), phần thưởng cho học tăng cường và gợi ý cho việc chưng cất. ATO rút ra ba dạng gợi ý với độ cụ thể tăng dần từ chính ảnh chụp nhanh (snapshot) đã đóng băng của chính sách: chỉ các tiêu chí, tập hợp anh em được chọn bởi bộ tự lựa chọn (self-selector) theo các tiêu chí, và sự phản hồi của bộ tự phản ánh (self-reflector) đối chiếu lần triển khai với tập hợp anh em đó; mỗi lần triển khai nhận được dạng gợi ý phù hợp với chất lượng của nó. Việc chấm điểm lại lần triển khai đó dưới sự điều phối của giáo viên đã đóng băng (được điều kiện hóa bởi gợi ý) và ảnh chụp nhanh không có gợi ý sẽ chưng cất hiệu ứng của gợi ý thành một lợi thế ở cấp độ token, bổ sung cho lợi thế kết quả tương đối của nhóm. Trên mười tiêu chuẩn đánh giá bao gồm RAG, nghiên cứu chuyên sâu và đánh giá theo tập hợp, AdaTutoRank đạt hiệu suất tổng thể tốt nhất trong khi giảm bớt số lượng yêu cầu truy xuất.

Bình luận:Trang dự án: this https URL
Chủ đề:Tính toán và Ngôn ngữ (cs.CL)
Trích dẫn là:arXiv:2609.32472 [cs.CL]
(hoặc arXiv:2609.32472v1 [cs.CL] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.32472 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Kailin Jiang [xem email] [v1] Thứ Bảy, 26 tháng 9 năm 2026 11:05:34 UTC (11,983 KB)

RAGRerankingNghiên cứu AITối ưu hóaTruy xuất thông tin

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

AdaTutoRank: Tối ưu hóa học tập thích ứng để xếp hạng lại tài liệu trong RAG và nghiên cứu chuyên sâu | AIHOT.vn