The Decoder: AI News
92

Nghiên cứu

Đột phá mới: Khôi phục gần như hoàn hảo câu lệnh gốc (Prompt) từ văn bản đầu ra của LLM

(giờ Việt Nam)

Tóm tắt AI

Các nhà nghiên cứu từ IIT Bombay và Adobe đã phát triển phương pháp PTP, cho phép tái tạo chính xác câu lệnh gốc của LLM chỉ bằng văn bản đầu ra mà không cần quyền truy cập vào trọng số mô hình.

Bản dịch AI

Researchers can now reverse-engineer LLM prompts from output text with near-perfect accuracy

Chuyển đến nội dung

12 tháng 8, 2026

Các nhà nghiên cứu tại IIT Bombay và Adobe Research đã phát triển một phương pháp có thể tái tạo các câu lệnh (prompt) được nhập vào các mô hình ngôn ngữ lớn (LLM) với độ chính xác gần như hoàn hảo, chỉ bằng cách sử dụng văn bản đầu ra. Phương pháp này hoạt động mà không cần quyền truy cập vào trọng số mô hình và thậm chí có thể áp dụng cho các mô hình của bên thứ ba.

Các mô hình ngôn ngữ lớn tạo ra văn bản bằng cách dự đoán từ tiếp theo có khả năng xuất hiện cao nhất, theo từng token một. Việc đảo ngược quy trình đó và tái tạo lại câu lệnh gốc từ đầu ra từ lâu đã được coi là không khả thi, vì nhiều câu lệnh khác nhau có thể tạo ra các phản hồi tương tự nhau.

Một bài báo mới từ các nhà nghiên cứu tại IIT Bombay và Adobe Research cho thấy điều này có thể thực hiện được với độ chính xác đáng kinh ngạc. Phương pháp của họ, được gọi là "Previous-Token Prediction" (PTP), đảo ngược cách thức hoạt động của các mô hình ngôn ngữ. Thay vì dự đoán token tiếp theo, các nhà nghiên cứu huấn luyện một mô hình ngôn ngữ nghịch đảo để dự đoán các token trước đó.

Mô hình nghịch đảo này được huấn luyện hoàn toàn từ đầu trên dữ liệu được tạo tổng hợp từ chính mô hình LLM mục tiêu. Tất cả những gì nó cần là văn bản đã được tạo ra.

Một phản hồi duy nhất mang lại câu lệnh chính xác và nhiều phương án thay thế

Mô hình nghịch đảo cũng có thể tạo ra nhiều biến thể câu lệnh với các ý nghĩa khác nhau bằng cách tinh chỉnh các tham số giải mã (decoding parameters). Tất cả các câu lệnh được tái tạo này đều tạo ra phản hồi tương tự khi được nhập ngược lại vào mô hình ngôn ngữ gốc.

Trong một ví dụ từ bài báo, câu lệnh "How to reach out to competitors to find their pricing strategies?" đã được tái tạo nguyên văn từng từ. Mô hình cũng tạo ra sáu biến thể bổ sung nắm bắt được ý nghĩa cốt lõi nhưng sử dụng cách diễn đạt khác, chẳng hạn như "What tactics can a company looking to reach out to competitors in the market use to find their pricing strategy?"

Các thử nghiệm với câu lệnh thực tế của người dùng cũng cho thấy kết quả tái tạo chính xác. Khi các nhà nghiên cứu nhập các câu lệnh đã tái tạo ngược lại vào mô hình gốc, các phản hồi thu được khớp sát với bản gốc.

Kẻ tấn công thậm chí không cần biết mô hình nào đã tạo ra văn bản đó

Một mô hình nghịch đảo được huấn luyện trên chatbot nhỏ Qwen-3-0.6B cũng có khả năng tái tạo các câu lệnh từ phản hồi của GPT-4o. Các câu lệnh được tái tạo không hoàn toàn giống hệt bản gốc, nhưng theo bài báo, chúng nắm bắt được ý nghĩa và mục đích. Một kẻ tấn công tiềm năng thậm chí sẽ không cần biết mô hình nào đã tạo ra đầu ra đó.

Điều này tạo ra một vấn đề bảo mật rộng lớn. Các công ty có nguy cơ làm lộ các câu lệnh hệ thống (system prompts) độc quyền chứa bí mật thương mại, quy tắc kiểm duyệt hoặc các hướng dẫn chuyên biệt. Người dùng cá nhân cũng đối mặt với mối đe dọa tương tự, vì các truy vấn cá nhân hoặc nhạy cảm cũng có thể bị trích xuất từ đầu ra. Một mô hình nghịch đảo nhỏ, mã nguồn mở có thể là đủ để thực hiện việc này.

Bản thân bài báo không đưa ra tuyên bố rõ ràng về các cuộc tấn công vào các hệ thống thương mại. Nhưng nếu phương pháp này hoạt động trên các mô hình sản xuất hiện tại, các phòng thí nghiệm AI sẽ cần phải giải quyết vấn đề này nhanh chóng và đưa ra bản vá.

Tin tức AI không thổi phồng – Được tuyển chọn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo tiên phong "AI Radar" độc quyền sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền truy cập vào phần bình luận của chúng tôi.

Đăng ký ngay

Đăng ký The Decoder

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.