HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Điểm AI 32/100

Nghiên cứu

ControlScope: Nghiên cứu về quy trình sửa lỗi và độ tin cậy của tác nhân AI

(giờ Việt Nam)

Tóm tắt AI

ControlScope phân tích ba phương pháp sửa lỗi cho tác nhân LLM khi gặp sự cố, bao gồm: tiếp tục tạo mã, chỉnh sửa tham số công cụ và thay thế quy trình làm việc, từ đó đánh giá khả năng tự phục hồi thực tế của AI.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

Tóm tắt: Một tác nhân mô hình ngôn ngữ nên sửa đổi bao nhiêu phần của quy trình làm việc đang chạy? ControlScope so sánh việc tiếp tục mã đã tạo, chỉnh sửa các đối số dữ liệu của lệnh gọi công cụ tiếp theo và thay thế quy trình làm việc chưa hoàn thành từ cùng một trạng thái thực thi công khai. Các quyền lồng nhau phân tách các sửa chữa khả dụng khỏi các hành động mà tác nhân chọn. Chúng tôi đánh giá các đánh giá một lần và lặp lại trên các tác vụ hệ thống tệp, ALFWorld và AppWorld. Trên hai chương trình nguồn mỗi tác vụ và ba lượt suy luận-đánh giá trên 20 tác vụ hệ thống tệp, FULL hoàn thành 15-16 tác vụ so với 13 của KEEP; trên bốn lượt nhanh, nó hoàn thành 10-13 so với 13. Việc xác nhận hồ sơ sinh viên mới tái tạo một bản sửa lỗi đọc theo lô. Các bảng nhanh ALFWorld mang lại điểm số KEEP/ARG/FULL là 85/86/87 trên 87 tác vụ qua 52 cảnh và 134/134/127 trên 134 tác vụ qua bốn cảnh; suy luận trên nhóm 87 tác vụ cũng mang lại 85/86/87 với chi phí đánh giá đáng kể. Một bảng kiểm tra chính thức AppWorld V1 gồm 585 trường hợp tác vụ từ 195 mẫu kịch bản cho thấy sự khác biệt ròng nhỏ. Các lần phát lại cố định cho thấy các thay thế khả thi do tác nhân viết bị gián đoạn bởi việc sửa đổi sau đó trong hai lần chạy tổ chức tệp thất bại. Một so sánh điểm giữa của quỹ đạo nguồn ngoại tuyến cho thấy các đánh giá sau đó hoàn thành một bản sửa lỗi không đầy đủ. Bảo vệ năm lệnh gọi giúp tiết kiệm 19,4% đầu ra mô hình đã ghi và mất một thành công trên 20 lần chạy nguồn mới. Một lối tắt chỉ dành cho đối số cho thấy chính sách lấy mẫu rộng hơn có thể bỏ qua một chỉnh sửa thành công rẻ hơn có sẵn trong cả hai tập hợp thao tác. Những kết quả này gắn quyền truy cập sửa chữa với các lựa chọn thực tế và quá trình thực thi sau đó.

Chủ đề:Trí tuệ nhân tạo (cs.AI); Tính toán và Ngôn ngữ (cs.CL); Kỹ thuật phần mềm (cs.SE)
Trích dẫn là:arXiv:2609.34313 [cs.AI]
(hoặc arXiv:2609.34313v1 [cs.AI] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.34313 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Jingjie Ning [xem email] [v1] Thứ Hai, 28 tháng 9 năm 2026 04:53:45 UTC (158 KB)

Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

ControlScope: Nghiên cứu về quy trình sửa lỗi và độ tin cậy của tác nhân AI | AIHOT.vn