# AdaGuard: Mô hình kiểm soát thích ứng cho phép tùy chỉnh chính sách người dùng

- Nguồn: HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
- Thời gian phát hành: 2026-09-28 07:00 (giờ Việt Nam)
- Điểm AI: 45/100
- Link AIHOT.vn: https://aihot.vn/items/0cdddde9b51a992c
- Nguồn dữ liệu AI HOT: https://aihot.news/items/skjffhg8kn5gpkj49e1dm7ntg
- Link gốc: https://arxiv.org/abs/2609.34241

## Tóm tắt AI

Nhóm nghiên cứu giới thiệu dòng mô hình AdaGuard (0.6B, 4B, 8B) giúp đánh giá lộ trình hoạt động của các AI agent dựa trên các chính sách tùy chỉnh ngay trong quá trình suy luận.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.34241) [HTML (thử nghiệm)](https://arxiv.org/html/2609.34241v1)

> Tóm tắt: Các mô hình bảo vệ (guard models) hỗ trợ việc triển khai an toàn các tác nhân mô hình ngôn ngữ, nhưng các phân loại rủi ro cố định lại hạn chế khả năng đáp ứng các yêu cầu thay đổi tùy theo ứng dụng và tác vụ. Theo các chính sách do người dùng định nghĩa, việc phát hiện vi phạm đòi hỏi phải diễn giải cả các quy tắc áp dụng lẫn hành vi của tác nhân, vì các hành động giống hệt nhau có thể nhận được những đánh giá khác nhau dưới các chính sách khác nhau. Để hỗ trợ việc học khả năng này, chúng tôi giới thiệu AdaptiveSafety, một tập dữ liệu gồm 10.939 ví dụ huấn luyện và 1.000 ví dụ kiểm thử bao gồm các chính sách với 1--100 quy tắc. Tập dữ liệu kết hợp các quỹ đạo từ nhiều nguồn với các phản thực tế (counterfactuals) về chính sách và hành vi, ghép nối mỗi ví dụ với một lời giải thích và tập hợp đầy đủ các quy tắc bị vi phạm. Những phản thực tế này làm lộ rõ các thay đổi làm thay đổi mức độ tuân thủ, trong khi các tăng cường cấu trúc cung cấp sự giám sát để đảm bảo tính nhất quán khi sắp xếp lại quy tắc và ánh xạ lại định danh. Dựa trên sự giám sát này, chúng tôi đề xuất SafePO, một thuật toán học tăng cường để tinh chỉnh việc xác định vi phạm trong khi cân bằng giữa lập luận giải thích và phán quyết cuối cùng. SafePO sử dụng các phần thưởng có cấu trúc để đánh giá độ chính xác của dự đoán, duy trì các ưu thế tương đối theo nhóm ở cấp độ phản hồi, và sử dụng một mô hình giá trị được huấn luyện riêng biệt để điều chỉnh trọng số token trong các vùng giải thích và phán quyết. Việc chuẩn hóa riêng biệt kiểm soát đóng góp tương đối của chúng trong quá trình huấn luyện bất chấp sự khác biệt về độ dài. Thông qua khởi tạo có giám sát theo sau bởi SafePO, chúng tôi phát triển AdaGuard, một họ các mô hình bảo vệ 0,6B, 4B và 8B giúp đánh giá các quỹ đạo tác nhân theo các chính sách được cung cấp tại thời điểm suy luận. Mô hình 4B của chúng tôi đạt độ chính xác nhị phân 89,30% trên AdaptiveSafety và 71,82% trên DynaBench. Kho lưu trữ dự án có sẵn tại [đường dẫn https này](https://github.com/Yunhao-Feng/AdaGuard)

| Chủ đề: | Trí tuệ nhân tạo (cs.AI) |
| --- | --- |
| Trích dẫn là: | arXiv:2609.34241 [cs.AI] |
|  | (hoặc arXiv:2609.34241v1 [cs.AI] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.34241 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Yunhao Feng [xem email](https://arxiv.org/show-email/20f87b81/2609.34241)] [v1] Thứ Hai, 28 tháng 9 năm 2026 03:48:12 UTC (484 KB)
