# Agent-Editing World Model: Tái định nghĩa mô hình thế giới cho các tác nhân LLM

- Nguồn: Hugging Face Daily Papers
- Thời gian phát hành: 2026-09-25 07:00 (giờ Việt Nam)
- Điểm AI: 85/100
- Link AIHOT.vn: https://aihot.vn/items/acb28ed6bdfcc23d
- Link gốc: https://arxiv.org/abs/2609.28416

## Tóm tắt AI

Nghiên cứu giới thiệu AEWM, mô hình tập trung vào việc chỉnh sửa suy luận và hành động thay vì mô phỏng phản hồi công cụ, giúp các tác nhân LLM tránh sai lầm từ các kế hoạch lỗi thời và cải thiện hiệu suất thực hiện tác vụ.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.28416) [HTML (thử nghiệm)](https://arxiv.org/html/2609.28416v1)

> Tóm tắt: Những tiến bộ gần đây trong các mô hình ngôn ngữ lớn (LLM) đã cho phép các tác nhân (agents) giải quyết các nhiệm vụ dài hạn trong nhiều môi trường đa dạng. Để cải thiện hơn nữa hiệu suất của tác nhân, các mô hình thế giới ngôn ngữ hiện có thường dự đoán các quan sát môi trường, tuy nhiên việc tái tạo các phản hồi công cụ có độ nhiễu cao và phụ thuộc vào quá trình thực thi mang lại giá trị hạn chế khi đã có phản hồi thực tế. Trong khi đó, các tác nhân thường gặp phải tình trạng \emph{nhiễm bẩn trạng thái nhiệm vụ} (task-state contamination), nơi các giả định không được hỗ trợ và các kế hoạch lỗi thời vẫn tồn tại trong lịch sử, làm sai lệch các quyết định tiếp theo. Chúng tôi đề xuất \textbf{Agent-Editing World Model (AEWM)}, mô hình hóa cách lập luận và hành động định hình tiến trình nhiệm vụ trong tương lai thay vì mô phỏng các phản hồi công cụ. AEWM kết hợp \textbf{Action Judge} để phân biệt các quyết định \textsc{Critical} (Quan trọng), \textsc{Exploratory} (Thăm dò) và \textsc{Noisy} (Nhiễu) với \textbf{State Revision} để chỉnh sửa các chuỗi lập luận-hành động nhiễu từ cùng một lịch sử quan sát. \textbf{EditAct} tích hợp các khả năng này với quá trình thực thi thực tế, trực tiếp thay đổi trạng thái cơ bản của các quyết định tiếp theo thay vì chỉ đưa ra các đánh giá. Chúng tôi huấn luyện AEWM trên các lĩnh vực Tìm kiếm, Terminal và Kỹ thuật phần mềm thông qua quá trình huấn luyện trung gian và tinh chỉnh có giám sát. AEWM đạt 70,5% macro-F1 trên tiêu chuẩn đánh giá Action Judge của chúng tôi, vượt qua mô hình cơ sở tiên tiến nhất 10,6 điểm. Trên sáu tiêu chuẩn đánh giá và ba cấu trúc tác nhân, EditAct cải thiện điểm số trung bình từ 3,2--6,7 điểm so với mô hình cơ sở mạnh nhất. Hơn nữa, việc tinh chỉnh lấy mẫu loại bỏ trên các quỹ đạo EditAct đã được xác minh, gọi là \textbf{AEWM-RFT}, cải thiện hơn 2,2--2,6 điểm so với Self-RFT trên ba lĩnh vực mà không cần sự hướng dẫn trực tuyến của AEWM.

| Chủ đề: | Tính toán và Ngôn ngữ (cs.CL); Trí tuệ nhân tạo (cs.AI); Học máy (cs.LG) |
| --- | --- |
| Trích dẫn là: | arXiv:2609.28416 [cs.CL] |
|  | (hoặc arXiv:2609.28416v1 [cs.CL] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.28416 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Shuang Sun [xem email](https://arxiv.org/show-email/ee0d52cf/2609.28416)] [v1] Thứ Tư, 23 tháng 9 năm 2026 17:18:26 UTC (2.129 KB)
