# EAPO: Phương pháp tối ưu hóa chính sách dựa trên entropy để cải thiện khả năng suy luận của LLM

- Nguồn: Hugging Face Daily Papers
- Thời gian phát hành: 2026-09-29 07:00 (giờ Việt Nam)
- Điểm AI: 85/100
- Link AIHOT.vn: https://aihot.vn/items/1c92cd8859016faf
- Link gốc: https://arxiv.org/abs/2609.33781

## Tóm tắt AI

Nghiên cứu giới thiệu EAPO, phương pháp phân bổ tín dụng dựa trên entropy giúp LLM học hỏi hiệu quả hơn từ thành công và thất bại bằng cách xử lý bất đối xứng các trạng thái không chắc chắn.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.33781) [HTML (thử nghiệm)](https://arxiv.org/html/2609.33781v1)

> Tóm tắt: Học tăng cường với phần thưởng có thể kiểm chứng (RLVR) giúp tăng cường khả năng suy luận trong các mô hình ngôn ngữ lớn (LLM) thông qua phản hồi ở cấp độ kết quả, tuy nhiên các phương pháp gần đây để phân bổ tín dụng chi tiết hơn thường yêu cầu các mô hình phụ trợ, lấy mẫu bổ sung hoặc thông tin đặc quyền. Mặc dù entropy chính sách cung cấp một tín hiệu sẵn có, việc ưu tiên các vị trí không chắc chắn trong cả quá trình củng cố và phạt sẽ tập trung các hình phạt vào những nơi mà các phản hồi thất bại vẫn còn cơ hội phục hồi, điều này có thể triệt tiêu các cơ hội khám phá. Để giải quyết vấn đề này, chúng tôi giới thiệu Entropic Advantage Policy Optimization (EAPO), một phương pháp phân bổ tín dụng dựa trên entropy, xử lý thành công và thất bại một cách bất đối xứng. Cụ thể, dựa trên quan sát rằng thành công trong điều kiện không chắc chắn khó lặp lại hơn trong khi các thất bại tự tin có xu hướng tái diễn, EAPO kết hợp entropy chính sách đã chuẩn hóa với dấu của lợi thế phản hồi để củng cố những thành công bất ngờ và sửa chữa những thất bại lặp đi lặp lại. Phương pháp này gán sự củng cố mạnh hơn cho các quyết định có entropy cao trong các phản hồi thành công và các hình phạt mạnh hơn cho các quyết định có entropy thấp trong các phản hồi thất bại, đồng thời giảm nhẹ hình phạt tại các vị trí không chắc chắn để bảo toàn cơ hội phục hồi. Bằng cách phân phối lại lợi thế phản hồi trên các token, EAPO rút ra tín dụng ở cấp độ token trực tiếp từ các tín hiệu rollout hiện có mà không cần giám sát bổ sung. Chúng tôi xác thực EAPO trên một loạt các tác vụ suy luận trên cả các backbone cơ sở và backbone suy luận, chứng minh rằng nó đạt được hiệu suất tổng thể tốt nhất. Chúng tôi cũng chỉ ra rằng EAPO thúc đẩy việc khám phá hiệu quả hơn, mở rộng phạm vi giải quyết vấn đề và tạo ra các câu trả lời ứng viên đa dạng hơn.

| Bình luận: | Trang dự án: liên kết này |
| --- | --- |
| Chủ đề: | Học máy (cs.LG); Trí tuệ nhân tạo (cs.AI); Tính toán và Ngôn ngữ (cs.CL) |
| Trích dẫn là: | arXiv:2609.33781 [cs.LG] |
|  | (hoặc arXiv:2609.33781v1 [cs.LG] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.33781 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Woongyeong Yeo [xem email](https://arxiv.org/show-email/05de0236/2609.33781)] [v1] CN, 27 Thg 9, 2026 17:23:21 UTC (252 KB)
