Tin ngành
Anthropic thừa nhận lỗ hổng bảo mật: Bộ lọc vũ khí sinh học tê liệt gần một năm
(giờ Việt Nam)
Tóm tắt AI
Báo cáo mới từ Anthropic cho biết bộ lọc an toàn ngăn chặn các yêu cầu về vũ khí sinh học đã bị vô hiệu hóa trong gần một năm, ảnh hưởng đến 133 triệu cuộc hội thoại từ các nhà thầu. Hiện chưa có bằng chứng cho thấy lỗ hổng này bị lợi dụng cho mục đích xấu.
Bản dịch AI
Theo thông tin từ IT ngày 16 tháng 8, báo cáo an toàn mới nhất do Anthropic công bố vào ngày 14 tháng 8 (giờ địa phương) cho thấy, một số bộ phân loại an toàn của công ty dùng để chặn các yêu cầu nguy hiểm liên quan đến vũ khí hóa học và sinh học đã bị vô hiệu hóa trong một thời gian dài.
Điều này dẫn đến việc một lượng lớn yêu cầu từ các nhà thầu bên ngoài khi cung cấp phản hồi thủ công đã không được lọc trong khoảng thời gian từ tháng 5 năm 2025 đến tháng 4 năm 2026. Anthropic cho biết, các cuộc điều tra nội bộ hiện chưa tìm thấy bằng chứng cho thấy các yêu cầu này đã thực sự bị lợi dụng cho mục đích xấu.

Theo mô tả về cơ chế an toàn công khai của Anthropic, các bộ phân loại lời nhắc (prompt) và đầu ra theo thời gian thực sẽ phân tích đầu vào của người dùng cũng như nội dung do mô hình tạo ra, đồng thời chặn mô hình cung cấp thông tin có thể được sử dụng để thực hiện các hành vi nguy hiểm khi phát hiện rủi ro liên quan. Theo những gì IT được biết, cơ chế này là một trong những biện pháp an toàn đa lớp mà Anthropic thiết lập nhằm đối phó với các rủi ro liên quan đến vũ khí hóa học, sinh học, phóng xạ và hạt nhân (CBRN).
Vấn đề bị phơi bày lần này liên quan đến các nhà thầu bên ngoài của Anthropic. Báo cáo cho thấy, khoảng 50.000 nhà thầu đã tạo ra khoảng 133 triệu cuộc hội thoại với mô hình trong khoảng thời gian nói trên, và lượng lưu lượng truy cập này đã không được các bộ phân loại an toàn sinh học liên quan chặn lại trong gần một năm.
Anthropic cho biết các nhà thầu này chủ yếu do các nhà cung cấp bên ngoài chịu trách nhiệm kiểm duyệt và quy trình sàng lọc của họ còn nhiều thiếu sót. Công ty sau đó đã tiến hành điều tra nội bộ và khẳng định không tìm thấy bằng chứng cho thấy các yêu cầu này bị sử dụng cho mục đích lạm dụng thực tế. Do đó, Anthropic đã nâng cao các yêu cầu đối với các nhà thầu bên ngoài.
Trước đó, Anthropic đã đưa biện pháp bảo vệ an toàn sinh học vào hệ thống an toàn AI của mình. Vào tháng 5 năm 2025, khi ra mắt Claude Opus 4, công ty đã kích hoạt các biện pháp bảo vệ theo Cấp độ an toàn AI 3 (ASL-3), bao gồm các hạn chế triển khai đối với rủi ro phát triển hoặc thu thập vũ khí hóa học, sinh học, phóng xạ và hạt nhân.
Theo chính sách mở rộng có trách nhiệm hiện hành của Anthropic, các bộ phân loại lời nhắc và đầu ra theo thời gian thực sẽ liên tục giám sát đầu vào và đầu ra của mô hình, đồng thời cập nhật dựa trên các mô hình gây hại, phương pháp bẻ khóa (jailbreak) và kỹ thuật gây nhiễu được phát hiện liên tục. Công ty cũng sử dụng các cơ chế như kiểm thử Red Teaming, chương trình tiền thưởng cho lỗ hổng bảo mật và giám sát ngoại tuyến làm các biện pháp an toàn bổ sung.
Vào tháng 7 năm 2026, khi công bố các biện pháp an toàn liên quan đến Claude Fable 5, Anthropic một lần nữa nhấn mạnh các rủi ro trong lĩnh vực sinh học và hóa học. Công ty cho biết, sau khi năng lực nền tảng của Fable 5 đạt đến một mức độ nhất định, nó có thể cung cấp thêm sự hỗ trợ cho các tác nhân độc hại, do đó cần sử dụng các bộ phân loại để hạn chế các yêu cầu liên quan.
Đồng thời, Anthropic cũng thừa nhận rằng các bộ phân loại an toàn quá nghiêm ngặt có thể gây ảnh hưởng nhầm đến các hoạt động nghiên cứu khoa học bình thường. Đối với Fable 5, hiện tại một lượng lớn các yêu cầu liên quan đến lĩnh vực sinh học và hóa học sẽ được chuyển cho Claude Opus 4.8 xử lý, và công ty có kế hoạch thu hẹp dần phạm vi hạn chế khi các cơ chế an toàn được cải thiện.
Hiện tại, Anthropic cho biết đã tăng cường các yêu cầu sàng lọc và quản lý đối với nhà thầu bên ngoài dựa trên kết quả điều tra. Chính sách mở rộng có trách nhiệm được công ty công bố cũng cho thấy họ đang liên tục điều chỉnh các tiêu chuẩn bảo vệ an toàn đối với các lĩnh vực rủi ro cao như vũ khí hóa học và sinh học.
Đọc thêm:
"Anthropic công bố báo cáo rủi ro AI: Các tác nhân thông minh của hãng có thể tấn công đồng loại và che giấu dấu vết vi phạm của chính mình"
"Anthropic: Sai sót trong cấu hình môi trường đánh giá của bên thứ ba dẫn đến ba sự cố an ninh mạng thực tế"
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.