# SLCA-GRPO: Giải quyết vấn đề phân bổ tín dụng sai lệch trong học tăng cường cho tác nhân gọi công cụ

- Nguồn: Hugging Face Daily Papers
- Thời gian phát hành: 2026-09-28 07:00 (giờ Việt Nam)
- Điểm AI: 85/100
- Link AIHOT.vn: https://aihot.vn/items/4c72ff0456e37350
- Link gốc: https://arxiv.org/abs/2609.29050

## Tóm tắt AI

SLCA-GRPO giới thiệu cơ chế phân bổ tín dụng theo phân đoạn (SLCA) giúp tách biệt việc đánh giá ưu thế giữa các phần văn bản và lệnh gọi công cụ, khắc phục lỗi nhiễu gradient trong quá trình huấn luyện tác nhân AI.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.29050) [HTML (thử nghiệm)](https://arxiv.org/html/2609.29050v1)

> Tóm tắt: Các tác nhân gọi công cụ (tool-calling agents) tạo ra các đầu ra không đồng nhất, xen kẽ giữa việc gọi công cụ có cấu trúc và các bản tóm tắt ngôn ngữ tự nhiên dành cho người dùng. Sự không đồng nhất trong đầu ra này tạo ra một chế độ lỗi cấu trúc trong Học tăng cường (RL) on-policy tiêu chuẩn: các thuật toán như GRPO phát tán một cách thiếu chọn lọc giá trị ưu tiên (advantage) vô hướng ở cấp độ quỹ đạo cho tất cả các token. Hệ quả là, nhiễu gradient từ quá trình tạo bản tóm tắt rò rỉ sang các token quyết định công cụ, gây ra sự phân bổ tín dụng sai lệch giữa các phân đoạn và quá trình tối ưu hóa thiếu ổn định. Trong nghiên cứu này, chúng tôi đề xuất SLCA-GRPO, một khung làm việc kết hợp Phân bổ tín dụng khóa phân đoạn (Segment-Locked Credit Assignment - SLCA). Để cho phép khám phá có khả năng mở rộng mà không cần các API thực đắt đỏ và đảm bảo quá trình huấn luyện ổn định, trước tiên chúng tôi xây dựng Trình mô phỏng LLM hướng lược đồ (Schema-Guided LLM Simulator - SGLS) làm cơ sở hạ tầng huấn luyện nền tảng. Dựa trên đó, SLCA tách biệt việc ước tính giá trị ưu tiên ở cấp độ phân đoạn cấu trúc trong một nhóm rollout duy nhất mà không yêu cầu thêm các rollout từ các trạng thái trung gian. Được hỗ trợ bởi Phần thưởng phân cấp (Hierarchical Rewards - HierR), SLCA định tuyến các ưu tiên thực thi đến các token công cụ và ưu tiên tùy chọn đến các token tóm tắt, loại bỏ sự nhiễm chéo ưu tiên (kênh phân bổ tín dụng sai lệch giữa các phân đoạn chính) trong mỗi lần cập nhật chính sách. Trên nền tảng 7B, SLCA-GRPO tăng tốc độ hội tụ và vượt trội hơn so với GRPO, ToolPO và RLTR tiêu chuẩn với mức tăng +2,53 pp trong đánh giá trong miền (in-domain), +1,36 pp trên Berkeley Function-Calling Leaderboard (BFCL) và +9,15 pp trên $\tau^2$-Bench với cùng ngân sách huấn luyện, đạt độ chính xác cao hơn trong khi giảm thiểu sự dư thừa công cụ và chi phí.

| Bình luận: | 41 trang, 13 hình ảnh. Mã nguồn: this https URL; Tập dữ liệu: this https URL |
| --- | --- |
| Chủ đề: | Trí tuệ nhân tạo (cs.AI); Học máy (cs.LG) |
| Trích dẫn là: | arXiv:2609.29050 [cs.AI] |
|  | (hoặc arXiv:2609.29050v1 [cs.AI] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.29050 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Yan Zhan [xem email](https://arxiv.org/show-email/f4f78e12/2609.29050)] [v1] Thứ Năm, 24 tháng 9 năm 2026 05:31:54 UTC (8.040 KB)
