Nghiên cứu
Góc nhìn RL về OPD: Chưng cất chính sách bình phương tối thiểu cho suy luận LLM hiệu quả
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu giới thiệu khung LSPD, áp dụng kỹ thuật khám phá lạc quan và tái sử dụng dữ liệu off-policy từ RL vào chưng cất chính sách, giúp tối ưu hóa hiệu suất suy luận của LLM.
Chính văn · Bản dịch AI
Tóm tắt: Chúng tôi nghiên cứu chưng cất on-policy (OPD) dưới góc độ học tăng cường, thiết lập mối liên hệ giữa mục tiêu reverse-KL trong OPD và tối ưu hóa chính sách được điều tiết bởi KL. Dựa trên mối liên hệ này, chúng tôi giới thiệu Least-Square Policy Distillation (LSPD), một khung làm việc lấy cảm hứng từ RL, mang khả năng khám phá lạc quan và tái sử dụng dữ liệu off-policy từ RL dựa trên giá trị vào quá trình chưng cất chính sách. LSPD duy trì sự đa dạng của chính sách thông qua việc khám phá, đồng thời cải thiện hiệu suất rollout bằng cách học lặp đi lặp lại từ các quỹ đạo đã thu thập trước đó. Phân tích lý thuyết của chúng tôi kết nối LSPD với học tập dựa trên giá trị lạc quan và cho thấy công thức lý tưởng hóa của nó đạt được giới hạn regret $\tilde{\mathcal O}(\log K)$ sắc nét trong quá trình khám phá trực tuyến. Về mặt thực nghiệm, LSPD liên tục vượt trội hơn các phương pháp chưng cất cơ sở hiện có trên sáu tiêu chuẩn đánh giá suy luận toán học và các thiết lập giáo viên-học sinh đa dạng, với mức tăng trung bình là +1,59 điểm ở Avg@16. Đáng chú ý, thông qua các đánh giá Pass@k lên đến k=64, chúng tôi nhận thấy LSPD bảo toàn sự đa dạng chính sách tốt hơn bằng cách đạt được hiệu suất mạnh mẽ hơn khi k tăng lên. Biến thể hoàn toàn off-policy của nó đạt được hiệu suất tương đương với OPD thông thường chỉ bằng cách sử dụng 25% các lô rollout đầu tiên. Tổng hợp lại, những kết quả này cung cấp một góc nhìn RL về OPD, mang lại cả cách giải thích có nguyên tắc và lộ trình thực tế hướng tới việc chưng cất mô hình ngôn ngữ hiệu quả hơn và tối ưu hóa rollout.
| Bình luận: | 29 trang, 3 hình, 5 bảng, mã nguồn có sẵn tại URL này |
| Chủ đề: | Học máy (cs.LG) |
| Trích dẫn là: | arXiv:2609.35505 [cs.LG] |
| (hoặc arXiv:2609.35505v1 [cs.LG] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.35505 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Weitong Zhang [xem email] [v1] Thứ Hai, 28 tháng 9 năm 2026 16:05:41 UTC (330 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.