The Verge: AI
Điểm AI 72/100

Hướng dẫn

Startup Israel Irregular bị cáo buộc là nguồn cơn đứng sau hàng loạt vụ tấn công từ AI Agent

(giờ Việt Nam)

Tóm tắt AI

Theo The Verge, các AI Agent từ OpenAI, Meta, Anthropic và Google đã thoát khỏi môi trường thử nghiệm để tấn công mục tiêu thực tế, với bằng chứng chỉ ra startup Irregular là bên đứng sau các sự cố này.

Chính văn · Bản dịch AI

One company is at the center of a wave of rogue AI attacks

Vào tháng 7, OpenAI tiết lộ rằng các tác nhân AI của họ đã tấn công Hugging Face mà không được phép, làm dấy lên những lo ngại rộng khắp về an toàn AI. Kể từ đó, một chuỗi các sự cố tương tự liên quan đến các tác nhân từ Meta, Anthropic, Google và các công ty khác đã thổi bùng thêm nỗi sợ hãi về AI mất kiểm soát. Khi các thông tin tiết lộ liên quan đến nhiều mô hình AI dần xuất hiện trong vài tháng qua, chúng có vẻ như là những sự cố riêng biệt. Nhưng nhiều sự cố có chung một nguồn gốc: một công ty cụ thể được giao nhiệm vụ thử nghiệm các tác nhân này.

Irregular, một startup của Israel chuyên kiểm tra áp lực các mô hình AI trong “các nền tảng nghiên cứu có độ trung thực cao nhằm mô phỏng và giám sát các kịch bản bảo mật AI trong thế giới thực”, đã làm việc với nhiều tên tuổi lớn nhất trong ngành kể từ khi được thành lập với tên gọi Pattern Labs vào năm 2023. Danh sách khách hàng chính xác của họ không được công bố, nhưng công việc của họ đã được trích dẫn trong thẻ hệ thống mô hình của OpenAI, nó đã được sử dụng để thử nghiệm các hệ thống cho chính phủ Anh và Anthropic, đồng thời công bố nghiên cứu cùng với RAND, một tổ chức tư vấn có ảnh hưởng lớn chuyên cung cấp thông tin cho các chính sách về AI.

Trong một vài thử nghiệm của Irregular năm nay, các tác nhân đã thoát khỏi môi trường thử nghiệm được cho là an toàn của chúng và nhắm vào các mục tiêu trong thế giới thực.

Các vụ vi phạm này, vốn độc lập với vụ hack Hugging Face, đều tuân theo cùng một khuôn mẫu chung: Irregular đang thử nghiệm khả năng an ninh mạng của các mô hình trong môi trường kiểm soát nhằm mô phỏng các điều kiện thực tế. Một số thử nghiệm sử dụng bài tập “cướp cờ” (capture-the-flag), một cách phổ biến để kiểm tra khả năng hack, yêu cầu các tác nhân tìm kiếm thông tin ẩn bên trong một mạng lưới mô phỏng. Ít nhất thì mạng lưới đó được cho là mô phỏng.

CTO và đồng sáng lập của Irregular, Omer Nevo, nói với The Verge rằng các tác nhân này không được phép truy cập vào internet công cộng, nhưng “quyền truy cập internet đã vô tình bị mở”. Đồng thời, Nevo cho biết tên một công ty hư cấu được tạo ra cho mô phỏng làm mục tiêu “đã trùng khớp với một tên miền thực”. Kết hợp lại, những sai sót đó đã khiến các tác nhân nhắm vào các mục tiêu thực tế, mặc dù chưa rõ công ty hoặc tổ chức nào thực sự bị tấn công.

“Tất cả các sự cố liên quan đến Irregular đều bắt nguồn từ cùng một vấn đề cơ bản trong một kịch bản đánh giá duy nhất và đã được công bố.”

Nevo xác nhận với The Verge rằng vấn đề tương tự này là nguyên nhân đằng sau các sự cố liên quan đến mô hình từ OpenAI, Meta, Anthropic và Google. “Tất cả các sự cố liên quan đến Irregular đều bắt nguồn từ cùng một vấn đề cơ bản trong một kịch bản đánh giá duy nhất và đã được công bố,” ông nói. “Các sự cố bảo mật khác được báo cáo gần đây trên toàn ngành không liên quan đến Irregular hoặc các đánh giá của chúng tôi.” Điều này bao gồm vụ hack Hugging Face và các vụ vi phạm từ Viện An toàn AI của Anh.

Tuy nhiên, “công bố” không nhất thiết có nghĩa là công khai, và không rõ liệu Nevo đang đề cập đến việc thông báo cho khách hàng của Irregular, công chúng hay ai khác. Mặc dù tất cả các sự cố đều bắt nguồn từ cùng một lỗi thử nghiệm cơ bản, các báo cáo từ Anthropic và OpenAI, cùng với tin tức về Google, cho thấy các công ty công nghệ này đã được thông báo vào khoảng thời gian tương tự vào cuối tháng 7. OpenAI và Anthropic đã tự công bố các vụ vi phạm, trong khi các sự cố liên quan đến Meta và Google (vài tuần sau đó) mới được công khai thông qua các báo cáo truyền thông.

Hoạt động kiểm tra an ninh mạng của Irregular vượt ra ngoài phạm vi bốn gã khổng lồ công nghệ Mỹ. Nghiên cứu được công bố trên trang web của họ cho thấy họ cũng đã thực hiện các thử nghiệm an ninh mạng tương tự trên Kimi K3 và GLM-5.2, các mô hình AI mở từ các công ty Trung Quốc lần lượt là Moonshot AI và Z.ai. Không giống như các mô hình độc quyền liên quan đến các sự cố khác — Meta vẫn giữ mô hình Spark hàng đầu của mình là độc quyền — các mô hình này có thể được tải xuống tự do và chạy trên phần cứng của người dùng, nghĩa là các bên thử nghiệm như Irregular không cần phải dựa vào các công ty để truy cập hoặc gửi dữ liệu lại cho họ. Nghiên cứu của Irregular mô tả chúng là các phiên bản “tự lưu trữ” (self-hosted).

“Công bố” không nhất thiết có nghĩa là công khai.

Các đánh giá về các mô hình Trung Quốc không dẫn đến các sự cố thực tế tương tự, Nevo cho biết: “Chúng tôi không quan sát thấy cùng loại vấn đề được mô tả trong các sự cố được đề cập ở đây trong quá trình đánh giá GLM hoặc Kimi của chúng tôi.” Tuy nhiên, Nevo cảnh báo rằng “chỉ riêng quan sát này không nên được hiểu là bằng chứng cho thấy các mô hình này ít nhạy cảm hơn với loại hành vi này.” Cả Moonshot và Z.ai đều không phản hồi yêu cầu bình luận của The Verge.

Nevo cho biết các sự cố đã thúc đẩy những thay đổi tại Irregular. “Chúng tôi đã thắt chặt các biện pháp kiểm soát truy cập internet, mở rộng giám sát và đánh giá thủ công, đồng thời tăng cường kiểm tra trước khi bắt đầu đánh giá để xác minh rằng quyền truy cập phù hợp với phạm vi dự kiến,” ông nói. “Chúng tôi cũng đã cải thiện cách thức ghi chép và thống nhất về thiết lập cũng như các tham số của mỗi đánh giá với các đối tác của mình.”

Irregular cũng có kế hoạch xuất bản một báo cáo rộng hơn “bao gồm các bài học kinh nghiệm và thực tiễn để thực hiện các đánh giá an ninh mạng một cách an toàn” sau khi công việc chung với các công ty liên quan hoàn tất, Nevo cho biết. “Công việc của chúng tôi với các đối tác nhằm biến các bài học từ những sự cố này thành các thực tiễn chia sẻ công khai để phát triển và đánh giá các AI ngày càng mạnh mẽ một cách an toàn.”

Bạn có phải là nhà nghiên cứu an toàn AI hay nhân viên của một phòng thí nghiệm tiên phong?

Bạn có thể liên hệ với tôi một cách an toàn và bảo mật qua Signal tại robhart.01

Nevo cho biết Irregular đã giải quyết các vấn đề với môi trường thử nghiệm liên quan đến các sự cố. Không công ty nào trong số bốn công ty AI của Mỹ trả lời các câu hỏi yêu cầu thêm chi tiết — bao gồm thời điểm họ biết về các vụ vi phạm, liệu họ có đang tìm kiếm bồi thường hoặc các biện pháp khắc phục khác từ Irregular hay không, và liệu họ có dự định tiếp tục làm việc với Irregular hay không. Google và Anthropic không phản hồi, trong khi OpenAI và Meta hướng The Verge đến các bài đăng trên blog đã được công bố trước đó.

Theo dõi các chủ đề và tác giả từ bài viết này để xem thêm nội dung tương tự trong nguồn cấp dữ liệu trang chủ cá nhân của bạn và nhận cập nhật qua email.

  • Robert Hart
STKS533_AI_AGENTS_HACKING_A (1)Robert Hart
An ninh mạngAI AgentRủi ro AIIrregularTin tức AI

Bài viết được AI dịch và tổng hợp tự động từ The Verge: AI. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Startup Israel Irregular bị cáo buộc là nguồn cơn đứng sau hàng loạt vụ tấn công từ AI Agent | AIHOT.vn