Nghiên cứu
[Tin AI] Cách đánh cắp chuỗi suy luận của mô hình ngôn ngữ
(giờ Việt Nam)
Tóm tắt AI
Bài viết phân tích kỹ thuật trích xuất chuỗi suy luận (reasoning trace) từ các mô hình AI thông qua phương pháp suy luận dự đoán (speculative decoding), mở ra góc nhìn mới về bảo mật dữ liệu huấn luyện.
Bản dịch AI
![[AINews] How to steal a Reasoning Trace](https://substackcdn.com/image/fetch/$s_!nQZJ!,w_1200,h_675,c_fill,f_jpg,q_auto:good,fl_progressive:steep,g_auto/https%3A%2F%2Fpbs.substack.com%2Fmedia%2FHPcJLMtagAAx07t.jpg)
Không thường xuyên có một bài báo khoa học tạo được tiếng vang lớn đến mức trở thành tiêu điểm của ngày. Vì những lý do dễ hiểu cả trong nước lẫn quốc tế, sự quan tâm dành cho biểu đồ Venn về khả năng diễn giải (Interpretability) trong các lĩnh vực căn chỉnh (alignment), bảo mật và giám sát chuỗi suy nghĩ (chain of thought) đang trỗi dậy, vì vậy bài báo hôm nay xuất hiện vào thời điểm không thể thích hợp hơn:

Alexander Panfilov@kotekjedi_ml
Cuối cùng chúng tôi cũng có thể nói về điều này: Chúng tôi đã tìm ra cách trích xuất suy luận ẩn của các mô hình tiên phong (frontier models) bằng cách sử dụng một lỗ hổng trong API của mọi công ty AI hàng đầu. Chúng tôi đã xác minh rằng số lượng token suy luận của chúng tôi khớp 1:1 với số lượng token suy nghĩ (thinking tokens) được tính phí qua API đối với hầu hết các câu lệnh mà chúng tôi đã truy vấn.

12:00 CH · 11 tháng 8, 2026 · 1,52 triệu lượt xem
226 phản hồi · 1,17 nghìn lượt đăng lại · 8,65 nghìn lượt thích
Kể từ khi o1 ra mắt, các mô hình suy luận của các phòng thí nghiệm tiên phong đã che giấu dấu vết của chúng bằng các chữ ký mật mã vì lo ngại về việc chưng cất mô hình (distillation) (dù điều này không ngăn được các phòng thí nghiệm Trung Quốc bị cáo buộc thực hiện hành vi đó). Lỗ hổng đầu tiên đã được Matthew Green báo cáo một cách có trách nhiệm vào tháng 5, người đã phân tích cách thức hoạt động của nó và tìm ra cách phát lại cũng như sử dụng các kênh bên (side channel) để khai thác gián tiếp thông qua các phép đo độ trễ. Bài báo hôm nay chứng minh rằng hoàn toàn có thể GIẢI MÃ và chuyển các suy nghĩ đã mã hóa này sang các mô hình/phiên làm việc/người dùng khác… và kết quả là cải thiện đáng kể các mô hình mã nguồn mở.

Điểm đáng báo động nằm ở đây:
“Hơn nữa, nếu bạn từng chia sẻ trực tuyến một phiên làm việc Claude Code/Codex có chứa các khối suy luận đã mã hóa, chúng có thể bị giải mã và làm rò rỉ dữ liệu cá nhân của bạn.
Chúng tôi đã thực hiện quét sơ bộ khoảng 7.000 dấu vết công khai và tìm thấy 62 khóa API duy nhất, 33 địa chỉ email, 33 mật khẩu và các dữ liệu nhạy cảm khác.”
(64 trường hợp xuất hiện độc quyền bên trong các khối suy luận và không hiển thị ở bất kỳ đâu trong phiên làm việc công khai.)
Các tác giả cũng trình bày chi tiết các vấn đề về căn chỉnh (alignment):
Các bộ tóm tắt CoT (COT Summarizers) che giấu câu trả lời
Suy luận không thể hiểu được
Các cân nhắc về gian lận
Tấn công các trang web
Trang web có nhiều ví dụ hơn.
Kỹ thuật này được mô tả phần nào trong bài báo:
Lấy một khối suy luận đã mã hóa/ký tên hợp lệ từ phản hồi API.
Phát lại khối đó vào một yêu cầu khác—có khả năng là một tài khoản/phiên làm việc khác—gửi đến một mô hình yếu hơn từ cùng nhà cung cấp.
Đặt nó vào lượt phản hồi của trợ lý/mô hình và đưa ra câu lệnh hoặc điền trước (prefill) cho mô hình yếu hơn để phiên mã lại phần suy luận đính kèm.
Lấy mẫu lặp đi lặp lại, loại bỏ các phản hồi từ chối và tùy chọn đối chiếu nhiều bản phiên mã nhiễu.
Bài báo đưa ra các mẫu cụ thể với một vài biến thể nhỏ tùy theo từng mô hình:
Claude: phát lại khối suy nghĩ đã ký cho Haiku 4.5, theo sau là phần điền trước của trợ lý như <thinking-copy>.
GPT: chèn mục suy luận encrypted_content nhiều lần vào một cuộc hội thoại giả lập; lấy mẫu lên đến 50 đầu ra. Bài báo cũng mô tả việc vượt qua ngưỡng đầu ra nguyên văn khoảng 50 token bằng cách sử dụng các đoạn tiếp nối (chunked continuations).
Gemini: đính kèm thought_signature vào lượt phản hồi của mô hình với phần điền trước <thought>, sau đó sử dụng lấy mẫu lặp lại và đối chiếu.

Bài báo này đã được công bố một cách có trách nhiệm, với một số lỗ hổng đã được khắc phục, nhưng chắc chắn rằng các cuộc tấn công tương tự vẫn có khả năng xảy ra.

Can Bölük@_can1357
Các bạn biết là mình có thể chỉ cần tắt tính năng suy nghĩ (thinking) và thay vào đó cung cấp cho nó một công cụ "deep_think", rồi nó sẽ gọi công cụ đó với định dạng suy luận CoT nội bộ đúng không? Chúc may mắn trong việc sửa lỗi đó.
Alexander Panfilov @kotekjedi_ml
Cuối cùng chúng tôi cũng có thể nói về điều này: Chúng tôi đã tìm ra cách trích xuất suy luận ẩn của các mô hình tiên phong bằng cách sử dụng một lỗ hổng trong API của mọi công ty AI hàng đầu. Chúng tôi đã xác minh rằng số lượng token suy luận của chúng tôi khớp 1:1 với số lượng token suy nghĩ được tính phí qua API đối với hầu hết các câu lệnh mà chúng tôi đã truy vấn.
5:23 CH · 11 tháng 8, 2026 · 610 nghìn lượt xem
129 phản hồi · 350 lượt đăng lại · 4,96 nghìn lượt thích
Tin tức AI từ 10/8/2026 đến 11/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số báo cũ. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể chọn tham gia/rời khỏi danh sách nhận email!
Phơi bày dấu vết suy luận (Reasoning-Trace Exposure), quyền riêng tư CoT và cuộc tranh luận về đóng dấu bản quyền (watermarking)
Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.