Nghiên cứu
Chỉ trong 72 giờ, chuyên gia bảo mật dùng Claude 3 Opus để thâm nhập hệ thống nội bộ OpenAI
(giờ Việt Nam)
Tóm tắt AI
Nhóm nghiên cứu từ Hacktron đã tận dụng mô hình Claude của Anthropic để khai thác lỗ hổng trên diễn đàn cộng đồng, từ đó xâm nhập thành công vào hệ thống và kho mã nguồn của OpenAI.
Bản dịch AI

Ba nhà nghiên cứu bảo mật đã sử dụng các mô hình Claude của Anthropic để xâm nhập vào hệ thống nội bộ của OpenAI thông qua diễn đàn cộng đồng của công ty này. Cuộc tấn công mất chưa đầy 72 giờ và theo nhóm nghiên cứu, nó chỉ trở nên khả thi sau khi Opus 5 được phát hành.
OpenAI đang phải nếm trải chính "liều thuốc" của mình. Sau nhiều tháng vô tình để các tác nhân AI tự do hack khắp internet, giờ đây chính công ty này đã bị hack với sự trợ giúp của AI. Nhóm bảo mật của Hacktron đã kết hợp hai lỗ hổng để truy cập vào tài khoản ChatGPT và Codex của nhân viên OpenAI. Từ đó, họ đã đột nhập vào kho mã nguồn nội bộ của OpenAI trên GitHub.
Cuộc tấn công diễn ra thông qua diễn đàn cộng đồng của OpenAI tại community.openai.com. Bất kỳ người dùng hoặc nhân viên nào từng sử dụng tính năng "Sign in with OpenAI" tại đó đều có khả năng bị ảnh hưởng. Người dùng có thể kết nối GitHub, Slack và email với Codex và ChatGPT, vì vậy về lý thuyết, cuộc tấn công cũng có thể lan đến các dịch vụ đó. Để chứng minh quyền truy cập, các nhà nghiên cứu đã sử dụng tài khoản Codex của một nhân viên để tạo một pull request vô hại trong monorepo nội bộ. Họ cho biết mình không xem bất kỳ dữ liệu nhạy cảm nào.
Một thư viện hình ảnh lỗi thời và xác thực thiếu sót đã mở ra cánh cửa
Lỗ hổng đầu tiên nằm ở libheif, thư viện mà diễn đàn sử dụng để xử lý các hình ảnh HEIC được tải lên. Theo Hacktron, một bản sửa lỗi đã có sẵn trong mã nguồn gốc từ một năm trước, nhưng không ai gắn cờ nó là một vấn đề bảo mật. Các gói Debian chạy trên diễn đàn vẫn thiếu bản sửa lỗi này. Một tệp hình ảnh được tạo thủ công đã cho phép các nhà nghiên cứu chạy mã của riêng họ trên máy chủ.
Lỗ hổng thứ hai là cấu hình sai trong hệ thống đăng nhập một lần (SSO) trung tâm của OpenAI. Bất kỳ ai kiểm soát được máy chủ diễn đàn đều có thể mạo danh các thành viên diễn đàn đang hoạt động và chiếm đoạt tài khoản ChatGPT và Codex của họ. Hacktron viết rằng lỗ hổng này còn mở rộng ra ngoài diễn đàn. Bất kỳ dịch vụ bị xâm nhập nào sử dụng thông tin đăng nhập của OpenAI đều sẽ cấp quyền truy cập tương tự.
Claude Opus 5 đã thành công ở nơi mà phiên bản tiền nhiệm thất bại
Các nhà nghiên cứu cho biết ban đầu họ sử dụng Claude Opus 4.8 để tìm lỗ hổng. Mô hình này đã xây dựng được một mã khai thác (exploit) hoạt động, nhưng chỉ khi ASLR – một cơ chế phòng thủ phổ biến chống lại các cuộc tấn công bộ nhớ – bị vô hiệu hóa. Qua nhiều phiên làm việc, nó không thể tạo ra một phiên bản đáng tin cậy khi ASLR được bật.
Vào tối ngày 24 tháng 7, Anthropic đã phát hành Claude Opus 5. Theo Hacktron, mô hình mới đã tạo ra một mã khai thác hoạt động cho máy Mac cục bộ trong vòng ba giờ, sau đó điều chỉnh nó cho môi trường máy chủ Discourse. Các nhà nghiên cứu sau đó đã chạy Claude trong một vòng lặp tự động nhắm vào phiên bản thử nghiệm của chính họ.
Vì mô hình từ chối viết mã khai thác nhắm vào các hệ thống thực tế, họ đã trình bày mục tiêu dưới dạng một tác vụ benchmark. Bốn giờ sau, tác nhân AI đã chiếm quyền kiểm soát máy chủ. Trong một tác vụ liên quan, các nhà nghiên cứu cũng quan sát thấy hiệu suất tăng vọt so với GPT-5.6 Sol của OpenAI.
OpenAI đã xác nhận bản sửa lỗi khoảng 14 giờ sau khi nhận được báo cáo. Discourse, phần mềm đứng sau diễn đàn, cũng đã phản hồi trong vòng vài ngày.
AI đang khiến các cuộc tấn công trở nên rẻ hơn đáng kể
Ngoài vụ hack OpenAI, các nhà nghiên cứu đã mở rộng cuộc điều tra của họ, được gọi là "HEIF Heist", để bao gồm Slack, Meta, GitHub Enterprise và các mục tiêu khác. Ba người đã thực hiện dự án này trong hơn hai tháng, chi chưa đầy 3.000 USD cho AI. Việc điều chỉnh cuộc tấn công cho mỗi mục tiêu mới chỉ mất từ một đến hai ngày. Chỉ có Shopify nhận thấy hoạt động này, bất chấp hàng nghìn hình ảnh được tải lên và các lỗi treo liên tục trong quá trình xử lý hình ảnh.
Nhóm Hacktron viết rằng phần mềm từ lâu đã được hưởng lợi từ một dạng bảo mật thông qua sự phức tạp. Ngay cả với mã nguồn công khai và một lỗ hổng đã biết, việc xây dựng một mã khai thác đáng tin cậy vẫn đòi hỏi chuyên môn hiếm có, thời gian và kiến thức sâu sắc về môi trường mục tiêu. Sự phức tạp không phải là một rào cản bảo mật thực sự, nhưng trên thực tế, nó đã bảo vệ được nhiều công ty.
AI loại bỏ sự bảo vệ đó bằng cách thay thế chuyên môn khan hiếm bằng sức mạnh tính toán. Hacktron lập luận rằng các mô hình đe dọa phải phản ánh việc các cuộc tấn công đã trở nên rẻ như thế nào. Nhóm viết: "Công việc từng đòi hỏi một đội ngũ có nguồn lực tốt và mất hàng tháng trời nỗ lực giờ đây có thể được rút ngắn xuống chỉ còn vài ngày".
Tin tức AI không cường điệu – Được tuyển chọn bởi con người
Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo chuyên sâu "AI Radar" độc quyền sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền truy cập vào phần bình luận của chúng tôi.
Đăng ký ngay
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.