TechCrunch: AI
92

Thủ thuật

Nhóm nghiên cứu dùng Claude 3.5 Opus hack OpenAI, nhận thưởng 6.500 USD

(giờ Việt Nam)

Tóm tắt AI

Nhóm Hacktron AI đã tận dụng Claude 3.5 Opus để phát hiện và khai thác chuỗi lỗ hổng nghiêm trọng, giúp chiếm quyền kiểm soát tài khoản ChatGPT của nhân viên OpenAI và nhận khoản tiền thưởng 6.500 USD.

Bản dịch AI

Researchers used Anthropic’s Claude to hack into OpenAI

Trong một diễn biến phản ánh trạng thái kỳ lạ mới của an ninh AI, các nhà nghiên cứu bảo mật độc lập đã sử dụng Claude của Anthropic để tấn công vào OpenAI, làm lộ ra những lỗ hổng trong hệ thống phòng thủ của công ty đứng sau ChatGPT, theo báo cáo của The Wall Street Journal vào tối thứ Năm.

Một nhóm bảo mật gồm ba người tại startup Hacktron AI đã thực hiện cuộc tấn công này như một phần trong chương trình săn lỗi nhận thưởng (bug-bounty) của OpenAI. Hacktron đã báo cáo các phát hiện của mình cho OpenAI và nhận được khoản tiền thưởng 6.500 USD. Nhóm này đã kết hợp hai lỗ hổng nghiêm trọng để truy cập vào nhiều tài khoản ChatGPT của nhân viên OpenAI, từ đó xâm nhập vào hệ thống phần mềm của công ty.

OpenAI cho biết họ đã khắc phục các vấn đề mà Hacktron phát hiện, sự việc xảy ra đúng vào thời điểm các công ty AI hàng đầu đang chịu áp lực ngày càng lớn về vấn đề an toàn.

Sự cố này diễn ra vài tuần sau khi chính các tác nhân AI của OpenAI tự phá vỡ sự kiểm soát trong một cuộc đánh giá an ninh mạng và hack vào Hugging Face, cho thấy các mô hình AI đang ngày càng có khả năng tự đưa ra quyết định. Nó cũng làm nổi bật cách mà các công nghệ thương mại sẵn có (off-the-shelf) có thể được sử dụng để tìm ra lỗ hổng ngay cả trong cơ sở hạ tầng của những công ty tiên tiến nhất.

"Với 200 USD mỗi tháng, bất kỳ ai cũng có thể sử dụng những công cụ này và hack vào một công ty như OpenAI," Matt Fredrikson, CEO của công ty an ninh AI Gray Swan, chia sẻ với TechCrunch. "Nếu điều đó có thể xảy ra với họ — và tôi không nghĩ họ lơ là trong việc duy trì an ninh mạng gần đây — thì nó có thể xảy ra với bất kỳ ai."

Hoặc như một chuyên gia AI đã lưu ý trên mạng xã hội: "[Hacktron] đã sử dụng Opus 5 để thực hiện vụ hack... Câu hỏi được đặt ra là, nếu ba người này có thể làm được điều đó, thì một quốc gia có thể làm được những gì."

Các nhà nghiên cứu đã tìm thấy con đường xâm nhập vào OpenAI vào ngày 25 tháng 7 thông qua một lỗ hổng trong Discourse, phần mềm bên thứ ba vận hành diễn đàn cộng đồng của OpenAI.

Theo một bài blog mà các nhà nghiên cứu đã đăng tải, điểm xâm nhập là một thao tác tải ảnh lên thông thường. Khi người dùng đăng các tệp hình ảnh HEIF hoặc HEIC (định dạng mặc định trên iPhone) lên diễn đàn cộng đồng của OpenAI, Discourse đã chuyển chúng qua một chuỗi các công cụ chạy ngầm để chuyển đổi sang định dạng JPEG tiêu chuẩn. Điểm dừng đầu tiên là ImageMagick, một tiện ích mã nguồn mở đã tồn tại hàng thập kỷ dùng để thay đổi kích thước hình ảnh. Vì bộ công cụ thông thường của ImageMagick không xử lý được định dạng của Apple, nó đã chuyển tệp cho một thư viện khác có tên là libheif để giải mã.

Ẩn sâu bên trong libheif là một lỗi bộ nhớ, tạo điều kiện cho kẻ tấn công chèn các lệnh của riêng mình. Trong trường hợp này, việc cung cấp cho thư viện một hình ảnh được tạo thủ công đặc biệt đã khiến nó tính toán sai vị trí của một hình ảnh khi đè lên hình ảnh khác, điều này đủ để chiếm quyền kiểm soát máy chủ.

Điều có thể gây khó chịu cho cộng đồng an ninh mạng là lỗi đó đã được các nhà phát triển libheif sửa từ nhiều tháng trước. Tuy nhiên, bản sửa lỗi này chưa bao giờ được gắn nhãn chính thức là một lỗ hổng, nghĩa là nó không bao giờ nhận được mã CVE (lỗ hổng và phơi nhiễm phổ biến) – cách tiêu chuẩn của ngành để theo dõi các điểm yếu bảo mật đã biết. Hacktron cho rằng đó có thể là lý do tại sao phần mềm mà Discourse sử dụng vẫn đang chạy phiên bản chứa lỗ hổng.

Đáng chú ý, các nhà nghiên cứu cho biết mô hình Claude mà họ sử dụng — một phiên bản đặc biệt của Opus 4.8 được cung cấp cho các nhà nghiên cứu an ninh mạng — ban đầu không thể xây dựng được một mã khai thác (exploit) hoạt động hiệu quả. Điều đó đã thay đổi chỉ sau một đêm, khi Anthropic phát hành Opus 5.

"Opus 4.8 đã chật vật qua nhiều phiên làm việc để tạo ra một mã khai thác hoạt động được," Hacktron viết trong một bài blog. "Chỉ vài giờ sau khi Opus 5 ra mắt, chúng tôi đưa cho nó cùng một bài toán và nó đã thành công."

Khi đã vào được máy chủ Discourse, các nhà nghiên cứu tìm thấy một lỗ hổng khác cho phép họ chiếm quyền kiểm soát các tài khoản ChatGPT và Codex của người dùng, bao gồm cả tài khoản của các nhân viên OpenAI.

"Sau đó, chúng tôi đã chiếm quyền điều khiển tài khoản của một nhân viên OpenAI, người có Codex được kết nối với tổ chức Github của OpenAI," Hacktron viết trong phần tóm tắt sự kiện.

Tại thời điểm này, các nhà nghiên cứu đã cảnh báo OpenAI cũng như Discourse, và Discourse đã đưa ra bản sửa lỗi vào ngày 27 tháng 7.

Sự cố này làm nổi bật ranh giới về khả năng của các mô hình AI. Claude Opus 5, phiên bản cuối cùng đã bẻ khóa được lỗi, không phải đối mặt với bất kỳ hạn chế xuất khẩu bảo mật nào, không giống như phiên bản mới hơn là Mythos 5, vốn đã bị khóa tạm thời do lo ngại về khả năng hack tiên tiến của nó.

Đó mới chỉ là các mô hình đóng. Các mô hình mở (open-weight) đang ngày càng bắt kịp các mô hình tiên phong về khả năng tấn công mạng. Ví dụ, tổ chức phi lợi nhuận về an toàn AI SaferAI gần đây phát hiện ra rằng mô hình GLM-5.2 của công ty Trung Quốc Z.ai chỉ chậm hơn vài tháng so với GPT-5.5 của OpenAI và Claude Opus 4.7 của Anthropic.

Như người sáng lập Hacktron, Mohan Pedhapati, đã viết trên X: "AI đang làm giảm bớt sự khan hiếm chuyên môn cần thiết để phát triển các mã khai thác. Công việc từng mất hàng tháng nay có thể chỉ mất vài ngày."

Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.

Rebecca Bellan là phóng viên cấp cao tại TechCrunch, nơi cô đưa tin về kinh doanh, chính sách và các xu hướng mới nổi định hình trí tuệ nhân tạo. Các bài viết của cô cũng đã xuất hiện trên Forbes, Bloomberg, The Atlantic, The Daily Beast và các ấn phẩm khác.

Bạn có thể liên hệ hoặc xác minh thông tin từ Rebecca bằng cách gửi email tới [email protected] hoặc qua tin nhắn mã hóa tại rebeccabellan.491 trên Signal.

Xem tiểu sử

Event Logo
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ TechCrunch: AI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.