Hugging Face Daily Papers
Điểm AI 85/100

Nghiên cứu

Vượt qua giới hạn thời gian: Phương pháp chưng cất chính sách AlignOPSD cho các tác nhân AI dài hạn

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu giới thiệu AlignOPSD, một kỹ thuật mới giúp giải quyết sự lệch pha giữa quyết định của tác nhân và phản hồi giám sát trong học tăng cường, giúp tối ưu hóa hiệu quả học tập cho các tác vụ phức tạp.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

Tóm tắt: Học tăng cường với phần thưởng có thể kiểm chứng (RLVR) thường dựa vào các phần thưởng kết quả thưa thớt, cung cấp sự giám sát thô cho các tác nhân có tầm nhìn dài hạn. Tự chưng cất trên chính sách (OPSD) bổ sung tín hiệu này bằng phản hồi đặc quyền dày đặc. Tuy nhiên, chúng tôi xác định hiện tượng \emph{Lệch quyết định--dấu thời gian}: hướng dẫn đặc quyền có thể bị lệch so với quyết định chức năng của học viên vì quyết định tương ứng có thể xảy ra ở một dấu thời gian khác, trong khi bản thân quyết định của học viên có thể kéo dài qua nhiều dấu thời gian thay vì gắn liền với một dấu thời gian duy nhất. Do đó, sự giám sát cục bộ theo dấu thời gian có thể làm sai lệch cả ngữ cảnh và phạm vi thời gian của việc phân bổ tín dụng. Để giải quyết sự sai lệch này, chúng tôi giới thiệu \textsc{AlignOPSD}, tuân theo nguyên tắc căn chỉnh sự giám sát trước khi phân bổ tín dụng. Việc Hiệu chỉnh giám sát căn chỉnh theo quyết định sẽ chấm điểm lại cùng một phản hồi do học viên lấy mẫu trong các ngữ cảnh khớp về chức năng trên các lượt triển khai tương đồng để hiệu chuẩn bằng chứng từ giáo viên cục bộ. Sau đó, Phân bổ tín dụng phân cấp Semi-Markov rút ra các khoảng thời gian quyết định có độ dài thay đổi từ các thay đổi tương ứng và sử dụng bằng chứng đã hiệu chỉnh để phân bổ tín dụng dựa trên kết quả trên các khoảng thời gian và các lượt cấu thành của chúng. Chúng tôi đánh giá \textsc{AlignOPSD} với Qwen2.5-3B và Qwen2.5-7B trên ALFWorld, WebShop và Search-QA so với các phương pháp cơ sở tiêu biểu. \textsc{AlignOPSD} vượt trội hơn cả GRPO và StepOPSD trên tất cả tám so sánh giữa mô hình nền và chỉ số tổng hợp, cải thiện 5,5--8,7% so với GRPO và xếp hạng nhất trong sáu trường hợp. Các phân tích bổ sung xem xét hai giai đoạn căn chỉnh và độ nhạy siêu tham số giữa các tác vụ. Mã nguồn của chúng tôi có sẵn tại địa chỉ URL này

Bình luận:27 trang, 10 hình ảnh
Chủ đề:Học máy (cs.LG); Trí tuệ nhân tạo (cs.AI)
Trích dẫn là:arXiv:2609.33391 [cs.LG]
(hoặc arXiv:2609.33391v1 [cs.LG] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.33391 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử nộp bài

Từ: Mingju Chen [xem email] [v1] CN, 27 Thg 9, 2026 09:13:27 UTC (1.410 KB)

Học tăng cườngReinforcement LearningAI AgentsNghiên cứu AIAlignOPSD

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Vượt qua giới hạn thời gian: Phương pháp chưng cất chính sách AlignOPSD cho các tác nhân AI dài hạn | AIHOT.vn