Nghiên cứu
Giải mã và khắc phục sự lệch pha giữa huấn luyện và suy luận trong RLVR cho LLM
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu chỉ ra sự khác biệt xác suất giữa engine huấn luyện và suy luận trong RLVR, đồng thời đề xuất phương pháp Calibrated Importance Sampling (CIS) để hiệu chỉnh, giúp tối ưu hóa quá trình cập nhật chính sách cho LLM.
Chính văn · Bản dịch AI
Tóm tắt: Chúng tôi nghiên cứu sự không khớp giữa huấn luyện và suy luận trong học tăng cường với phần thưởng có thể kiểm chứng (RLVR) cho các mô hình ngôn ngữ lớn, nơi các rollout được lấy mẫu bởi một công cụ suy luận trong khi gradient được tính toán bởi một công cụ huấn luyện, và hai công cụ này gán các xác suất khác nhau cho cùng một token. Để giải quyết sự khác biệt này trong việc cập nhật chính sách, chúng tôi giới thiệu lấy mẫu quan trọng hiệu chỉnh (CIS). CIS được thúc đẩy bởi đặc điểm dịch chuyển logit được hỗ trợ thực nghiệm, thể hiện sự không khớp dưới dạng một độ dịch chuyển cộng $\varepsilon_t$ trong log-odds, được xác định bởi nhiễu loạn trên mỗi logit trước hàm softmax, với phân phối gần như bất biến với độ tin cậy của token. Đặc điểm này thúc đẩy việc cắt bớt dựa trên độ tin cậy: các độ dịch chuyển dương lớn được cắt bớt tại một ngưỡng hằng số duy nhất, ánh xạ ngược lại giới hạn tỷ lệ quan trọng, vốn sẽ thắt chặt hơn khi độ tin cậy của token tăng lên. Về mặt lý thuyết, chúng tôi chỉ ra rằng CIS thay thế mô-men bậc hai không giới hạn vốn chi phối sai số của lấy mẫu quan trọng chính xác bằng một số hạng bị chặn bởi một hằng số, với cái giá là độ chệch được kiểm soát bởi phần dư thừa bị cắt bớt. Trong đánh giá trên ba mô hình mixture-of-experts và năm tiêu chuẩn suy luận toán học, CIS đạt mức trung bình cao nhất trên cả năm tiêu chuẩn cho tất cả ba mô hình trong số các phương pháp cơ sở được đánh giá. Các phân tích chẩn đoán cho thấy CIS đặt ít độ chệch cắt bớt hơn lên các token có độ tin cậy thấp so với lấy mẫu quan trọng bị cắt bớt, trong khi việc cắt xén hướng lên các trọng số quan trọng nhỏ làm giảm độ chính xác trên tập dữ liệu kiểm chứng.
| Bình luận: | 32 trang. Mã nguồn: this https URL |
| Chủ đề: | Học máy (cs.LG); Trí tuệ nhân tạo (cs.AI) |
| Trích dẫn là: | arXiv:2609.32444 [cs.LG] |
| (hoặc arXiv:2609.32444v1 [cs.LG] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.32444 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Kaixiang Zhao [xem email] [v1] Thứ Bảy, 26 tháng 9 năm 2026 10:21:24 UTC (1.345 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.