Nghiên cứu
SkillDRE: Khung tự động hóa phát triển kỹ năng độc hại cho AI Agent qua cơ chế phản hồi kép
(giờ Việt Nam)
Tóm tắt AI
SkillDRE là khung làm việc tự động giúp phát triển các kỹ năng độc hại cho AI Agent bằng cách tối ưu hóa mã thực thi thông qua vòng lặp phản hồi kép, giúp vượt qua các lớp bảo mật mà vẫn duy trì được chức năng ban đầu.
Chính văn · Bản dịch AI
Tóm tắt: Các kỹ năng của tác tử (agent skills) đóng gói các hướng dẫn, mã thực thi và tài nguyên đặc thù cho tác vụ thành các thành phần có thể tái sử dụng, mà các tác tử có thể cải thiện thông qua phản hồi thực thi. Cơ chế tương tự cũng cho phép những kẻ tấn công phát triển các kỹ năng độc hại, khiến chúng trở nên hiệu quả hơn và khó bị phát hiện hơn. Tuy nhiên, một kỹ năng ứng viên có thể vượt qua quá trình quét trước khi thực thi nhưng lại thất bại trong việc đạt được mục tiêu dưới các cơ chế phòng thủ thời gian thực, trong khi một bản sửa đổi nhằm khắc phục quá trình thực thi có thể tạo ra các phát hiện mới từ trình quét. Chúng tôi giới thiệu SkillDRE, một khung làm việc hoàn toàn tự động để phát triển các gói kỹ năng độc hại hoàn chỉnh thông qua vòng lặp phản hồi hai giai đoạn. Với một tác vụ lành tính và các kỹ năng liên quan, SkillDRE tự động xây dựng và xác thực một mục tiêu độc hại có điều kiện theo tác vụ và một quy tắc đánh giá có thể kiểm chứng. Sau đó, nó giữ cố định cả hai trong khi phát triển việc triển khai kỹ năng, đồng thời bảo toàn khả năng thực hiện tác vụ hợp lệ. SkillDRE kết hợp quá trình tiến hóa có hướng dẫn bởi trình quét với sự tinh chỉnh có hướng dẫn bởi thời gian thực, dựa trên kết quả thực thi quan sát được dưới sự phòng thủ thời gian thực. Mỗi bản sửa đổi được hướng dẫn bởi thời gian thực sẽ quay trở lại giai đoạn trước thực thi để quét lại và tối ưu hóa thêm trước khi thực thi lại, tạo thành một vòng lặp khép kín giữa các giai đoạn. Được đánh giá trên SkillsBench qua bốn mô hình nạn nhân, SkillDRE đạt tỷ lệ tấn công thành công trung bình là 45,28%, vượt qua cơ sở so sánh mạnh nhất 40,3%, trong khi các kỹ năng cuối cùng được gửi đi không nhận được phát hiện nào từ SkillScan và phần lớn vẫn bảo toàn hiệu suất của tác vụ lành tính. Những kết quả này cho thấy phản hồi phòng thủ hai giai đoạn có thể đóng vai trò là tín hiệu học tập hữu ích cho red teaming thích ứng và việc đánh giá riêng lẻ bất kỳ giai đoạn phòng thủ nào cũng có thể bỏ lỡ khả năng tấn công tiềm ẩn. Mã nguồn có sẵn tại đường dẫn https này
| Chủ đề: | Mật mã học và Bảo mật (cs.CR); Trí tuệ nhân tạo (cs.AI) |
| Trích dẫn là: | arXiv:2609.32400 [cs.CR] |
| (hoặc arXiv:2609.32400v1 [cs.CR] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.32400 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Pengyu Zhu [xem email] [v1] Thứ Bảy, 26 tháng 9 năm 2026 09:24:09 UTC (2.428 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.