The Decoder: AI News
85

Thủ thuật

GPT-6 Astra: Giảm thiểu ảo giác nhưng vẫn 'gục ngã' trước tấn công tiêm lệnh ẩn

(giờ Việt Nam)

Tóm tắt AI

Theo The Decoder, GPT-6 Astra cải thiện đáng kể khả năng chống lại các lệnh tiêm trực tiếp, nhưng vẫn dễ bị tổn thương trước các kỹ thuật tấn công đa vòng lặp tinh vi.

Bản dịch AI

Mô hình mới của OpenAI, GPT-6 Astra, tạo ra ít thông tin sai lệch (hallucinations) hơn và ngăn chặn các cuộc tấn công chèn lệnh (prompt injection) hiệu quả hơn so với các phiên bản tiền nhiệm. Tuy nhiên, nó vẫn chưa đủ tin cậy để triển khai các AI agent thực sự an toàn.

Theo thẻ hệ thống (system card) của OpenAI, mô hình Astra mới mắc ít lỗi thực tế hơn nhiều so với phiên bản tiền nhiệm là GPT-5.6 Sol. OpenAI đã thử nghiệm nó dựa trên các cuộc hội thoại ChatGPT từng bị người dùng gắn cờ vì đưa ra câu trả lời sai; điều này có nghĩa đây là những trường hợp đặc biệt dễ xảy ra lỗi và tỷ lệ thất bại của chúng không nên được coi là điển hình cho việc sử dụng hàng ngày. Astra tái hiện các lỗi đã được báo cáo này ít thường xuyên hơn nhiều, với những cải thiện lớn nhất xuất hiện ở các thiết lập độ trễ thấp và mức độ suy luận thấp hơn.

Đối với các cuộc tấn công chèn lệnh trực tiếp, nơi người dùng cố gắng thao túng mô hình thông qua các câu lệnh của chính họ, Astra đạt tỷ lệ phòng thủ gần như hoàn hảo là 99,99%. OpenAI ghi nhận thành quả này là nhờ phương pháp GPT-Red, sử dụng một trình tấn công tự động để củng cố mô hình trong quá trình huấn luyện.

Khả năng chống bẻ khóa (jailbreak) cũng cho kết quả tương tự. Đối với một tập dữ liệu cố định gồm các cuộc tấn công đã biết nhằm mục đích trích xuất các phản hồi độc hại về sinh học, bạo lực và an ninh mạng, Astra từ chối hỗ trợ trong 91,5 đến 98,3% các trường hợp.

Khi những kẻ tấn công điều chỉnh chiến lược qua nhiều vòng hội thoại, tỷ lệ phòng thủ của Astra giảm xuống còn khoảng 67%, nghĩa là những đối thủ kiên trì có thể lừa mô hình đưa ra ít nhất một phản hồi có vấn đề trong khoảng một trên ba lần thử. Các mô hình tiền nhiệm chỉ đạt dưới 50% trong cùng bài kiểm tra này. OpenAI lưu ý rằng các thử nghiệm này chạy trên mô hình gốc (bare model) mà không có các lớp bảo mật sản xuất như bộ phân loại (classifiers) vốn được tích hợp trong sản phẩm thực tế.

Chèn lệnh ẩn vẫn là một vấn đề bảo mật thực sự.

Astra đã có những tiến bộ đối với các cuộc tấn công chèn lệnh gián tiếp (indirect prompt injections), nơi một cuộc tấn công được ẩn bên trong tài liệu mà AI đọc. Kiểm tra độc lập từ công ty bảo mật Gray Swan, sử dụng 1.810 cuộc tấn công được chọn lọc từ IPI Arena của họ, cho thấy với 15 lần thử cho mỗi kịch bản, Astra bị tấn công thành công ít nhất một lần với tỷ lệ 8,5%. GPT-5.6 Sol thất bại 27% số lần. Claude Opus 5 thể hiện tốt hơn ở mức 4,8% trong cùng đánh giá, nhưng cũng không hoàn toàn miễn nhiễm.

Các con số trong bài kiểm tra kết hợp quý 1 và quý 2 của Gray Swan thực tế đã tăng lên so với các kết quả trước đó. Anthropic trước đây chỉ báo cáo tỷ lệ tấn công thành công là 2% dựa trên bài kiểm tra dễ hơn ở quý 1, và GPT-5.6 Sol cũng chỉ đạt 20% ở đó. Anthropic cũng đã chạy tất cả các mô hình với tính năng suy luận mở rộng (extended reasoning) được bật, điều này cùng với phạm vi kiểm tra rộng hơn có thể giải thích cho sự chênh lệch này.

Mặc dù đây là những cuộc tấn công được chọn lọc kỹ lưỡng, tỷ lệ thành công vẫn là điều đáng lo ngại đối với bất kỳ đội ngũ bảo mật doanh nghiệp nào. Astra có thể bị lừa thông qua các hướng dẫn được chèn vào trong khoảng một trên mười hai kịch bản. Opus 5 trụ vững tốt hơn, nhưng vẫn thất bại khoảng một trên hai mươi mốt lần. Và rủi ro đang ngày càng tăng. Các AI agent đang ngày càng tự viết mã, vận hành công cụ và điều khiển máy tính một cách độc lập, đó chính là những gì Gray Swan đã thử nghiệm. Những agent này cũng được xây dựng để hoạt động suốt ngày đêm và trên quy mô lớn, với việc đọc và xử lý tài liệu là một trong những công việc cốt lõi của chúng.

Tin tức AI không thổi phồng – Được tuyển chọn bởi con người.

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền "AI Radar" về các công nghệ tiên phong sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền tham gia phần bình luận của chúng tôi.

Đăng ký ngay.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.