Nghiên cứu
TraceDance: Hệ thống tự động xây dựng bộ benchmark hành vi AI từ dữ liệu thực tế
(giờ Việt Nam)
Tóm tắt AI
TraceDance giúp nhà phát triển tạo ra các bộ benchmark tùy chỉnh để kiểm soát những hành vi không mong muốn của AI dựa trên dữ liệu triển khai thực tế, thay vì chỉ dựa vào các bộ kiểm thử cố định.
Chính văn · Bản dịch AI
Tác giả: Dehai Min, Daoan Zhang, Yiming Zeng, Huayi Zhang, Ziyi Chen, Yan Zhang, Qinbo Bai, Mengyuan Chao, Jing Ning, Qiyue Hua, Huiyi Chen, Hanrong Zhang, Henry Peng Zou, Jie Yang, Wei Xu, Philip S. Yu
Tóm tắt: Một tác nhân (agent) có thể hoàn thành nhiệm vụ nhưng lại bộc lộ những hành vi không mong muốn trong quá trình thực thi. Các nhà phát triển cần những bài kiểm thử cho các hành vi cụ thể gặp phải trong quá trình triển khai, thay vì chỉ dựa vào các bộ tiêu chuẩn đánh giá cố định. Chúng tôi giới thiệu TraceDance, một hệ thống tác nhân xây dựng các bộ tiêu chuẩn đánh giá mục tiêu từ các dấu vết triển khai (deployment traces) cho các hành vi không mong muốn do người dùng chỉ định. Để xây dựng hiệu quả, Anchor-and-Confirm kết hợp truy xuất có thể lập trình với xác nhận ở cấp độ ứng viên bởi một Flash large language model (LLM), trong khi Anchor Synthesis Loop tạo và sửa đổi các đặc tả cho các hành vi tùy chỉnh. Các bộ tiêu chuẩn đánh giá sử dụng phương pháp tiếp nối tại điểm quyết định (decision-point continuation) để đánh giá lượt phản hồi tiếp theo của LLM tại một điểm quyết định đã ghi lại với một thang điểm đánh giá hành vi cụ thể, mà không cần câu trả lời tham chiếu hay phát lại môi trường. Các thử nghiệm trong lĩnh vực lập trình và sử dụng công cụ tổng quát dựa trên 252.557 phiên làm việc và tạo ra 107 bộ tiêu chuẩn đánh giá với 4.125 trường hợp, đáp ứng 95,3% yêu cầu xây dựng mục tiêu. Cả hai người chú giải con người đều xác nhận hành vi được yêu cầu trong 84% các trường hợp được lấy mẫu, và sự đồng thuận của hệ thống chấm điểm tự động với các đánh giá đạt/không đạt của con người tương đương với sự đồng thuận giữa các người chú giải. Chín LLM tiên phong chỉ đạt tỷ lệ vượt qua trung bình là 26,7%, cho thấy chúng vẫn gặp khó khăn trong việc phản hồi phù hợp tại các điểm quyết định được đánh giá. Phân tích trên các bộ tiêu chuẩn đánh giá hành vi cụ thể còn tiết lộ những điểm yếu trong cách các LLM hiện nay vận hành như các tác nhân. Bằng cách biến các vấn đề triển khai thành các bộ tiêu chuẩn đánh giá mục tiêu, TraceDance có thể đóng vai trò là thành phần then chốt của vòng lặp tự cải thiện đệ quy (recursive self-improvement - RSI).
| Bình luận: | 34 trang, 7 hình ảnh. Trang web dự án: this https URL |
| Chủ đề: | Trí tuệ nhân tạo (cs.AI); Tính toán và Ngôn ngữ (cs.CL) |
| Trích dẫn là: | arXiv:2609.33295 [cs.AI] |
| (hoặc arXiv:2609.33295v1 [cs.AI] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.33295 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Dehai Min [xem email] [v1] Chủ nhật, 27 tháng 9 năm 2026 06:58:39 UTC (723 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.