Nghiên cứu
SLCA-GRPO: Giải quyết vấn đề phân bổ tín dụng sai lệch trong học tăng cường cho tác nhân gọi công cụ
(giờ Việt Nam)
Tóm tắt AI
SLCA-GRPO giới thiệu cơ chế phân bổ tín dụng theo phân đoạn (SLCA) giúp tách biệt việc đánh giá ưu thế giữa các phần văn bản và lệnh gọi công cụ, khắc phục lỗi nhiễu gradient trong quá trình huấn luyện tác nhân AI.
Chính văn · Bản dịch AI
Tóm tắt: Các tác nhân gọi công cụ (tool-calling agents) tạo ra các đầu ra không đồng nhất, xen kẽ giữa việc gọi công cụ có cấu trúc và các bản tóm tắt ngôn ngữ tự nhiên dành cho người dùng. Sự không đồng nhất trong đầu ra này tạo ra một chế độ lỗi cấu trúc trong Học tăng cường (RL) on-policy tiêu chuẩn: các thuật toán như GRPO phát tán một cách thiếu chọn lọc giá trị ưu tiên (advantage) vô hướng ở cấp độ quỹ đạo cho tất cả các token. Hệ quả là, nhiễu gradient từ quá trình tạo bản tóm tắt rò rỉ sang các token quyết định công cụ, gây ra sự phân bổ tín dụng sai lệch giữa các phân đoạn và quá trình tối ưu hóa thiếu ổn định. Trong nghiên cứu này, chúng tôi đề xuất SLCA-GRPO, một khung làm việc kết hợp Phân bổ tín dụng khóa phân đoạn (Segment-Locked Credit Assignment - SLCA). Để cho phép khám phá có khả năng mở rộng mà không cần các API thực đắt đỏ và đảm bảo quá trình huấn luyện ổn định, trước tiên chúng tôi xây dựng Trình mô phỏng LLM hướng lược đồ (Schema-Guided LLM Simulator - SGLS) làm cơ sở hạ tầng huấn luyện nền tảng. Dựa trên đó, SLCA tách biệt việc ước tính giá trị ưu tiên ở cấp độ phân đoạn cấu trúc trong một nhóm rollout duy nhất mà không yêu cầu thêm các rollout từ các trạng thái trung gian. Được hỗ trợ bởi Phần thưởng phân cấp (Hierarchical Rewards - HierR), SLCA định tuyến các ưu tiên thực thi đến các token công cụ và ưu tiên tùy chọn đến các token tóm tắt, loại bỏ sự nhiễm chéo ưu tiên (kênh phân bổ tín dụng sai lệch giữa các phân đoạn chính) trong mỗi lần cập nhật chính sách. Trên nền tảng 7B, SLCA-GRPO tăng tốc độ hội tụ và vượt trội hơn so với GRPO, ToolPO và RLTR tiêu chuẩn với mức tăng +2,53 pp trong đánh giá trong miền (in-domain), +1,36 pp trên Berkeley Function-Calling Leaderboard (BFCL) và +9,15 pp trên $\tau^2$-Bench với cùng ngân sách huấn luyện, đạt độ chính xác cao hơn trong khi giảm thiểu sự dư thừa công cụ và chi phí.
| Bình luận: | 41 trang, 13 hình ảnh. Mã nguồn: this https URL; Tập dữ liệu: this https URL |
| Chủ đề: | Trí tuệ nhân tạo (cs.AI); Học máy (cs.LG) |
| Trích dẫn là: | arXiv:2609.29050 [cs.AI] |
| (hoặc arXiv:2609.29050v1 [cs.AI] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.29050 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Yan Zhan [xem email] [v1] Thứ Năm, 24 tháng 9 năm 2026 05:31:54 UTC (8.040 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.