VnExpress Khoa học Công nghệ
92

Mô hình

OpenAI ra mắt AI có khả năng tự tìm và khai thác lỗ hổng bảo mật

(giờ Việt Nam)

Tóm tắt AI

Mô hình Astra của OpenAI gây chú ý khi có thể tự động phát hiện các lỗ hổng bảo mật chưa từng biết và thực hiện chuỗi khai thác mà không cần sự can thiệp của con người.

Bản dịch AI

AI mới của OpenAI có thể tự tìm và khai thác lỗ hổng bảo mật

AI mới của OpenAI có thể tự tìm và khai thác lỗ hổng bảo mật

Mô hình Astra của OpenAI có khả năng tự phát hiện các lỗ hổng bảo mật chưa từng được biết đến, sau đó kết hợp chúng thành chuỗi khai thác mà không cần sự hướng dẫn từng bước từ con người.

Ngày 1/9, OpenAI đã công bố thêm thông tin về Astra, mô hình AI đang trong quá trình phát triển và chuẩn bị ra mắt, đồng thời cho biết họ đã phải tăng cường các biện pháp bảo vệ sau khi đánh giá năng lực an ninh mạng của mô hình này.

Theo công ty, Astra là mô hình đầu tiên của OpenAI vượt ngưỡng "Critical" (nghiêm trọng) về năng lực an ninh mạng, dựa trên bộ khung tiêu chuẩn mà hãng sử dụng để đánh giá các khả năng AI có thể gây rủi ro cao.

Ở mức độ này, OpenAI đánh giá rằng khi được cung cấp công cụ và quyền truy cập phù hợp, mô hình có thể "tự tìm các lỗ hổng bảo mật chưa từng được biết đến và phát triển cách khai thác chúng trên nhiều hệ thống được bảo vệ mà không cần con người hướng dẫn từng bước".

"Đây là mô hình đầu tiên chúng tôi xếp vào cấp độ này và yêu cầu các biện pháp bảo vệ mạnh mẽ hơn trong quá trình phát triển cũng như trước khi phát hành", OpenAI cho biết.

Trong một số thử nghiệm được OpenAI nêu trong bài giới thiệu, hãng cho biết Astra đã đạt 100% trên ExploitBench - bài đánh giá khả năng phát triển công cụ khai thác từ những lỗ hổng có sẵn. Chẳng hạn, Astra khai thác các lỗ hổng này hiệu quả hơn đáng kể so với mô hình GPT-5.6 Sol, trong khi cần ít dữ liệu đầu ra hơn để hoàn thành nhiệm vụ. Trong quá trình thử nghiệm, Astra đã tự phát hiện và khai thác hai lỗ hổng zero-day chưa từng được biết đến, sau đó kết hợp chúng vào một chuỗi tấn công. OpenAI cho biết đang phối hợp với các đơn vị duy trì phần mềm để công bố và xử lý hai lỗ hổng này.

Sam Altman, CEO OpenAI, trong Hội nghị thượng đỉnh G7 diễn ra tại Evian-les-Bains, Pháp, ngày 17/6. Ảnh: Reuters

Sam Altman, CEO OpenAI, tại Hội nghị thượng đỉnh G7 diễn ra ở Evian-les-Bains, Pháp, ngày 17/6. Ảnh: Reuters

Trong một bài đánh giá khác, Astra đã xây dựng được chuỗi khai thác bắt đầu từ trình duyệt, vượt qua "sandbox" - vùng cách ly nhằm hạn chế mã chạy trong trình duyệt tiếp cận hệ thống bên ngoài - rồi thực thi lệnh trên máy chủ. Ở một thử nghiệm khác, mô hình tìm được các lỗ hổng trên một hệ điều hành được bảo vệ và kết hợp chúng để nâng quyền từ tài khoản người dùng thông thường lên quyền root, tức quyền kiểm soát cao nhất trên hệ thống.

Việc công bố các thử nghiệm về Astra diễn ra sau khi OpenAI đối mặt với những lo ngại liên quan đến vấn đề an ninh mạng. Cuộc điều tra công bố cuối tháng 8 cho thấy khoảng 700 tác nhân đã phối hợp để tấn công nền tảng này. Tuy nhiên, Astra không tham gia vào vụ việc và OpenAI khẳng định các mô hình dự kiến phát hành cũng không liên quan đến cuộc tấn công. Công ty sau đó đã bổ sung các biện pháp giám sát, tăng khả năng phát hiện những hành động không được phép và huấn luyện mô hình từ chối các yêu cầu có nguy cơ hỗ trợ tấn công mạng. Trong các thử nghiệm được hãng công bố, Astra từ chối 91,5% yêu cầu tấn công mạng trái phép, so với 59% ở GPT-5.6 Sol.

So sánh khả năng của Astra với GPT-5.6 Sol. Ảnh: OpenAI

So sánh khả năng của Astra với GPT-5.6 Sol. Ảnh: OpenAI

OpenAI cho biết sẽ phát hành Astra, nhưng không triển khai rộng rãi mà cung cấp giới hạn cho một nhóm đối tác và người thử nghiệm được chọn lọc. Mục tiêu là sử dụng các năng lực này trước hết cho mục đích phòng thủ, giúp phát hiện và xử lý những điểm yếu mà con người có thể bỏ sót.

Khả năng AI tự tìm và khai thác lỗ hổng cũng đang trở thành một hướng cạnh tranh giữa các công ty phát triển mô hình. Trước đó, Anthropic cũng đang phát triển dòng Claude Mythos dành cho các tác vụ an ninh mạng. Hồi tháng 4, công ty này cho biết phiên bản Mythos Preview đã phát hiện hàng nghìn lỗ hổng nghiêm trọng trong nhiều hệ điều hành và trình duyệt. Ngày 1/9, Anthropic tiếp tục giới thiệu Claude Mythos 5.1, phiên bản mới của dòng mô hình này, với các cải tiến về năng lực an ninh mạng và nghiên cứu sinh học. Quyền truy cập hiện vẫn được giới hạn cho một nhóm tổ chức được chọn lọc.

Lưu Quý

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ VnExpress Khoa học Công nghệ. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.