Nghiên cứu phát hiện các khối dấu vết suy luận được mã hóa của LLM độc quyền có thể hoán đổi chéo giữa các phiên hội thoại, dẫn đến nguy cơ giải mã thông qua jailbreak
Tổng quan sự kiện
Toàn cảnh do AI tổng thuật
Các nhà nghiên cứu phát hiện ra rằng, các khối suy luận được mã hóa của các LLM độc quyền từ Anthropic, OpenAI và Google có thể bị hoán đổi giữa các phiên làm việc, người dùng và mô hình khác nhau. Kẻ tấn công có thể chèn các khối này vào những mô hình có khả năng phòng thủ yếu hơn của cùng nhà cung cấp, từ đó thực hiện bẻ khóa (jailbreak) và ép buộc mô hình xuất ra nội dung suy luận gốc dưới dạng văn bản thuần túy.
Nhóm của Alexander Panfilov đã quét khoảng 7.000 phiên làm việc công khai và tìm thấy 62 khóa API, 33 địa chỉ email cùng 33 mật khẩu. Thông qua việc bẻ khóa, mô hình Haiku 4.5 của Anthropic có thể sao chép nguyên văn quá trình suy luận gốc của Opus 4.8. Chi phí API để giải mã 10.000 luồng suy luận rơi vào khoảng 720 USD.
Tất cả các nhà cung cấp mô hình đã xác nhận nhận được báo cáo và lỗ hổng tấn công này hiện đã được khắc phục.
Tổng thuật do AI tổng hợp từ toàn bộ bài đưa tin, cập nhật theo diễn biến · làm mới T4 · 12/08 · 06:18.
Diễn biến mới nhất
Tất cả các nhà cung cấp mô hình đã xác nhận nhận được báo cáo và lỗ hổng tấn công này hiện đã được khắc phục.
Dòng thời gian đưa tin
Đang hiện 3 bài · tất cả · mới trước
T4 · 12/08
Đánh cắp luồng suy luận từ các API LLM độc quyền
Simon Willison BlogCác nhà nghiên cứu phát hiện rằng, các khối chuỗi tư duy (chain-of-thought) được mã hóa mà Anthropic, OpenAI và Google gửi về cho khách hàng có thể bị phát lại giữa các phiên làm việc, người dùng và mô hình. Bằng cách phát lại luồng suy luận của các mô hình tiên tiến cho những mô hình yếu hơn cùng dòng và thực hiện bẻ khóa, kẻ tấn công có thể khôi phục các suy luận ẩn dưới dạng văn bản thuần túy của những mô hình mạnh. Tất cả các nhà cung cấp mô hình đã xác nhận nhận được báo cáo và lỗ hổng này hiện đã được khắc phục.
Các nhà nghiên cứu phát hiện lỗ hổng API cho phép đọc quy trình suy luận được mã hóa của các mô hình như ChatGPT
The Decoder: AI NewsNhóm của Alexander Panfilov đã phát hiện lỗ hổng trong API của các nhà cung cấp AI lớn như OpenAI, Anthropic và Google, cho phép đọc quy trình suy luận được mã hóa của các mô hình. Quét khoảng 7.000 phiên hội thoại công khai đã tìm thấy 62 khóa API, 33 email và 33 mật khẩu. Thông qua kỹ thuật jailbreak, mô hình Haiku 4.5 của Anthropic có thể sao chép nguyên văn quy trình suy luận gốc của Opus 4.8; chi phí API để giải mã 10.000 dấu vết suy luận rơi vào khoảng 720 USD.
T3 · 11/08
Đánh cắp luồng suy luận từ API LLM độc quyền: Các khối mã hóa có thể hoán đổi giữa các phiên làm việc dẫn đến nguy cơ bẻ khóa giải mã
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)Nghiên cứu cho thấy các khối suy luận mã hóa từ những LLM độc quyền của Anthropic, OpenAI và Google có thể hoán đổi giữa các phiên làm việc, người dùng và mô hình. Kẻ tấn công chỉ cần chèn chúng vào các mô hình có lớp bảo vệ yếu hơn của cùng nhà cung cấp là có thể ép chúng xuất ra nội dung suy luận dưới dạng văn bản thuần túy.