Hugging Face Daily Papers
Điểm AI 85/100

Nghiên cứu

PACT: Từ phân bổ tín dụng đến căn chỉnh Critic trong học tăng cường cho LLM

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu thiết lập các điều kiện toán học để định nghĩa tín dụng ở cấp độ token, từ đó giải thích cơ chế của các thuật toán hiện tại và đề xuất quy trình huấn luyện actor-critic tối ưu hơn cho LLM.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

Tóm tắt: Học tăng cường (Reinforcement learning) đã trở thành thành phần cốt lõi trong quá trình hậu huấn luyện các mô hình ngôn ngữ lớn (LLM), tuy nhiên việc phân bổ tín hiệu thưởng ở cấp độ token (token-level credit) vẫn thiếu một định nghĩa toán học được chấp nhận rộng rãi, khiến mối quan hệ của nó với các tín hiệu huấn luyện thông thường trở nên mơ hồ. Chúng tôi xây dựng ba điều kiện chính quy, bao gồm Tính đầy đủ (Completeness), Tính nhất quán tiền tố (Prefix Consistency) và Tính trung lập (Neutrality), đồng thời chứng minh rằng chúng xác định duy nhất tín hiệu thưởng ở cấp độ token. Đặc điểm này cung cấp một cơ sở thống nhất để giải thích các hiện tượng trong các thuật toán hiện có và định hướng phát triển quy trình huấn luyện actor-critic cải tiến. Dưới góc nhìn này, một giáo viên lý tưởng trong On-Policy Distillation (OPD) đóng vai trò như một critic ngầm định, tạo ra gradient chính sách kỳ vọng tỷ lệ thuận với gradient được tạo ra bởi tín hiệu thưởng cấp độ token. Các tín hiệu từ Response-level REINFORCE Leave-One-Out (RLOO) khớp với đóng góp gradient chính sách kỳ vọng của tín hiệu thưởng cấp độ token mặc dù có độ chi tiết thô hơn. Chúng tôi thiết lập thêm tính thưa thớt tín hiệu thưởng xấp xỉ dưới các phần thưởng kết quả bị chặn và chỉ ra cách các sai số critic trung gian trong Generalized Advantage Estimation (GAE) có thể trở nên tương đương với tín hiệu thưởng cơ bản. Những điều này thúc đẩy sự ra đời của Policy Aligned Critic Training (PACT), áp dụng thứ tự cập nhật Actor-then-Critic để thực hiện hiệu chỉnh lấy mẫu quan trọng (importance sampling) cho việc huấn luyện critic và căn chỉnh critic tốt hơn với chính sách đã cập nhật. Trong suy luận toán học tác tử (agentic mathematical reasoning), PACT đạt độ chính xác trung bình 72,87% trên bốn tiêu chuẩn đánh giá, vượt trội hơn GRPO và PPO lần lượt là 8,80 và 13,16 điểm phần trăm. Trên SWE-bench Verified, PACT đạt tỷ lệ vượt qua 67,4%, vượt trội hơn PPO, GRPO và SAO lần lượt là 2,4, 2,0 và 3,8 điểm phần trăm.

Chủ đề:Học máy (cs.LG); Trí tuệ nhân tạo (cs.AI)
Trích dẫn là:arXiv:2609.26355 [cs.LG]
(hoặc arXiv:2609.26355v1 [cs.LG] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.26355 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Jiayan Fu [xem email] [v1] Thứ Ba, 22 tháng 9 năm 2026 12:58:28 UTC (654 KB)

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

PACT: Từ phân bổ tín dụng đến căn chỉnh Critic trong học tăng cường cho LLM | AIHOT.vn