HuggingFace Daily Papers (Nổi bậtBài nghiên cứu)
95

Nghiên cứu

GPT-Red: Đột phá trong tự động hóa kiểm thử bảo mật bằng thuật toán tự đối kháng

(giờ Việt Nam)

Tóm tắt AI

OpenAI giới thiệu GPT-Red, tác nhân AI sử dụng thuật toán tự đối kháng để phát hiện lỗ hổng tấn công tiêm nhiễm (prompt injection) trên các mô hình ngôn ngữ lớn, vượt trội hơn cả đội ngũ chuyên gia con người.

Bản dịch AI

Tác giả: Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal, Sam Toyer, Dylan Hunn, Stephanie Lin, Yuxin Wen, Xiangyu Qi, Christopher Wolff, Zizhao Wang, Milad Nasr, Sicheng Zhu, Chuan Guo, Juan Felipe Cerón Uribe, Kaiwen Wang, Aiden Low, Kai Xiao, Kai Chen

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite

Lịch sử gửi bài

Từ: Christopher A. Choquette-Choo [xem email] [v1] Thứ Ba, 28 tháng 7 năm 2026 16:03:39 UTC (5.979 KB)

An toàn AIBảo mật LLMRed TeamingOpenAINghiên cứu AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (Nổi bậtBài nghiên cứu). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.