Nghiên cứu
Lỗ hổng bảo mật: Đánh cắp chuỗi suy luận từ API của Anthropic, OpenAI và Google
(giờ Việt Nam)
Tóm tắt AI
Các nhà nghiên cứu phát hiện chuỗi suy luận (chain-of-thought) ẩn trong API của các ông lớn AI có thể bị giải mã và đánh cắp do lỗi thiết kế trong cách xử lý dữ liệu giữa các phiên hội thoại.
Bản dịch AI
Đánh cắp các dấu vết suy luận từ các API LLM độc quyền
Alexander Panfilov1 2 3 4* David Schmotz2 3 4* Ilia Shumailov5* Luca Beurer-Kellner6 Joachim Schaeffer1 Ameya Prabhu2 4 7‡ Jonas Geiping2 3 4‡ Maksym Andriushchenko2 3 4‡
1MATS Research 2ELLIS Institute Tübingen 3Max Planck Institute for Intelligent Systems 4Tübingen AI Center 5AI Sequrity Company 6Snyk 7University of Tübingen
*Đóng góp ngang nhau, thứ tự được quyết định bằng cách tung xúc xắc · ‡Giám sát ngang nhau
TL;DR (Tóm tắt): Các suy luận độc quyền có thể được khôi phục từ các dấu vết đã mã hóa của chúng. Anthropic, OpenAI và Google trả về các khối chuỗi suy nghĩ (chain-of-thought) đã mã hóa cho khách hàng, những khối này có thể được phát lại qua các phiên, người dùng và mô hình khác nhau. Chúng tôi lấy một dấu vết do một mô hình tiên phong tạo ra, phát lại nó vào một mô hình "anh em" yếu hơn, bẻ khóa (jailbreak) mô hình yếu hơn đó và khôi phục suy luận ẩn của mô hình mạnh hơn dưới dạng văn bản thuần túy mà không cần tấn công trực tiếp vào mô hình mạnh hơn hoặc kích hoạt các biện pháp bảo vệ chống chưng cất (anti-distillation) của nó.
Trích xuất suy luận trong hai lệnh gọi API
Dấu vết mô hình nguồn
Dấu vết mô hình đã bẻ khóa
Các nhà cung cấp mô hình trả về suy luận của mô hình cho khách hàng dưới dạng một khối mã hóa, khối này được gửi ngược lại máy chủ khi cuộc hội thoại tiếp tục. Các khối này có tính di động: chúng có thể được phát lại bên ngoài ngữ cảnh ban đầu. Việc chèn một khối vào một mô hình yếu hơn đã bị bẻ khóa từ cùng một nhà cung cấp cho phép chúng tôi trích xuất nguyên văn suy luận thô của mô hình mạnh hơn.
Chúng tôi chứng minh điều này trên các mô hình tiên phong từ OpenAI, Anthropic và Google. Suy luận được giải mã bám sát số lượng token suy nghĩ ẩn được API báo cáo. Mỗi điểm dưới đây tương ứng với một trong 120 bài toán Codeforces: trục hoành hiển thị số lượng token suy nghĩ ẩn được API báo cáo, trong khi trục tung hiển thị số lượng token của suy luận đã giải mã khi được truyền ngược lại mô hình dưới dạng đầu vào.
Đánh cắp bí mật từ những suy nghĩ bị đánh cắp
Các mục bị rò rỉ riêng biệt
351 Định danh kỹ thuật
204 Thông tin nhận dạng cá nhân (PII)
126 Thông tin xác thực
23 Khác
Chúng tôi đã thu thập 6.708 quỹ đạo tác nhân (agent trajectories) công khai từ GitHub và Hugging Face, được tạo bởi các mô hình Claude, GPT và Gemini và vẫn chứa các khối suy luận đã mã hóa. Việc áp dụng quy trình giải mã của chúng tôi cho mọi khối đã ký đã thu được 315.320 khối suy luận được tái tạo.
Những dấu vết ẩn này chứa các bí mật thực sự và thông tin nhạy cảm. Khi giới hạn ở các phiên người dùng thực tế, không phải benchmark, chúng tôi đã khôi phục được 704 thành phần quyền riêng tư riêng biệt, bao gồm 62 khóa API, 33 mật khẩu, 24 mã thông báo truy cập (access tokens) và 30 địa chỉ email cá nhân, cùng với tên, địa chỉ bưu điện, URL nội bộ và các định danh kỹ thuật khác.
Trong số 704 thành phần đó, 64 thành phần chỉ xuất hiện bên trong các khối suy luận và không xuất hiện ở bất kỳ đâu trong phiên làm việc hiển thị.
GPT-5.2 Codex
nội_dung_mã_hóa · giải mã với GPT-5.6 Luna
Tác vụ sanitize-git-repo trên Terminal-Bench
Chúng tôi có thể tìm kiếm các token cụ thể để thay thế:
- `AKIA1234567890123456`- `D4w8z9wKN1aVeT3BpQj6kIuN7wH8X0M9KfV5OqzF` (bí mật)- `ghp_aBcDeFgHiJkLmNoPqRsTuVwXyZ0123456789` (token github)- `hf_abcdefghijklmnopqrstuvwxyz123456` (token huggingface)- `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` (token huggingface)
Claude Sonnet 4.6
chữ ký · giải mã với Haiku 4.5
Tác vụ đặt vé máy bay ClawBench
Thông tin chính:- Tên: Alex Green- Email: [email protected] Hộ chiếu: JK456789 (Canada, hết hạn 2031-05-14)- Ngày sinh: 01-Tháng 5-1980- Thẻ tín dụng: TD Aeroplan Visa Infinite - 4519 8734 2460 4532, hết hạn 09/28, CVV 847- Số Aeroplan: 284567890- Ưu tiên chỗ ngồi: Cạnh cửa sổ- Hạng phổ thông- Toronto đến Tokyo Narita- Một chiều, ngày 15 tháng 7- Ưu tiên chuyến bay thẳng
Các ví dụ về suy luận đã giải mã
Các dấu vết suy luận đã giải mã từ các lần chạy benchmark và các phiên công khai ngoài thực tế. Mỗi ví dụ hiển thị một đoạn trích được chọn từ suy luận đã khôi phục, kèm theo tiêu đề ngắn và các điểm nổi bật do Claude Opus 5 tạo ra để giúp việc duyệt các dấu vết dễ dàng hơn.
BibTeX
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.