Nghiên cứu
Nghiên cứu: Watermark SynthID-Text có thể khiến AI dễ bị 'bẻ khóa' và trả lời nội dung độc hại
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu mới chỉ ra rằng việc chèn watermark SynthID-Text vào mô hình ngôn ngữ gây ra hiện tượng 'trôi dạt lấy mẫu', làm suy yếu khả năng từ chối các yêu cầu độc hại, đặc biệt khi kết hợp với tấn công tiêm nhiễm câu lệnh (prompt injection).
Bài viết được AI dịch và tổng hợp tự động từ Ars Technica: AI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.