# Nghiên cứu từ Lasso Security: Watermark SynthID-Text làm thay đổi hành vi từ chối và gọi công cụ của AI Agent

- Nguồn: Hacker News: AI bài nổi bật
- Thời gian phát hành: 2026-09-26 20:05 (giờ Việt Nam)
- Điểm AI: 65/100
- Link AIHOT.vn: https://aihot.vn/items/4aba368d4c9b1fd0
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmuikap9m0p54rov0m856vj2l
- Link gốc: https://www.lasso.security/blog/the-provenance-tax-understanding-the-impact-of-llm-watermarking-on-ai-agent-behavior

## Tóm tắt AI

Andrea Siposova từ Lasso Security phân tích cách watermark SynthID-Text của Google DeepMind trên Claude gây ra hiện tượng 'trôi dạt lấy mẫu' (sampling drift), làm ảnh hưởng đến khả năng từ chối yêu cầu và thực thi công cụ của AI Agent.

## Thân bài

![The Provenance Tax: Understanding the Impact of LLM Watermarking on AI Agent Behavior](https://cdn.prod.website-files.com/677e57d57f0aaef07252db12/6aab8f3234c02c13abcd8f76_The%20Impact%20of%20%20LLM%20Watermarking%20%20on%20Agent%20Security%20%26%20Safety%20-%20744.png)

Gần đây, [Anthropic thông báo rằng các mô hình Claude trong tương lai sẽ nhúng một hình mờ vô hình](https://www.anthropic.com/news/claude-text-watermark) vào đầu ra của chúng [1], [2], và sau đó tiết lộ rằng hình mờ này dựa trên [SynthID-Text](https://www.nature.com/articles/s41586-024-08025-4) của Google DeepMind [2], [3]. Bản thân việc đóng dấu hình mờ văn bản không phải là mới, nhưng việc triển khai nó hiện nay có ý nghĩa quan trọng về mặt quy định. [Điều 50(2) của Đạo luật AI EU](https://artificialintelligenceact.eu/article/50/) [4] yêu cầu các nhà cung cấp hệ thống AI tạo ra văn bản tổng hợp phải đánh dấu đầu ra của chúng ở định dạng máy có thể đọc được và làm cho chúng có thể phát hiện được là do AI tạo ra hoặc thao túng, sử dụng các giải pháp kỹ thuật hiệu quả, có khả năng tương tác, mạnh mẽ và đáng tin cậy trong phạm vi khả thi về mặt kỹ thuật.

Hình mờ được thiết kế để xác thực nguồn gốc, nhưng SynthID-Text thay đổi quy trình mà mô hình tạo ra từng token tiếp theo. Ở cấp độ mô hình, điều này có thể thay đổi hành vi an toàn, bao gồm việc liệu mô hình có từ chối một yêu cầu độc hại hay không và liệu sự từ chối đó có được duy trì khi bị tấn công bằng prompt injection hay không. Ở cấp độ tác nhân (agent), các token được lấy mẫu tương tự có thể quyết định công cụ nào được gọi và đối số nào được truyền cho nó. Prompt injection kết nối hai thiết lập này vì sự từ chối bị suy yếu sẽ trở nên nghiêm trọng hơn khi mô hình cũng có thể hành động thông qua các công cụ. Do đó, quy trình đóng dấu hình mờ như vậy có thể ảnh hưởng đến cả những gì mô hình nói và những gì tác nhân thực hiện. Chúng tôi gọi hiệu ứng hành vi này là độ lệch lấy mẫu (sampling drift).

Liệu độ lệch này có xuất hiện trong thực tế hay không là một câu hỏi thực nghiệm. Chúng tôi nhận thấy rằng nó có xảy ra, trong cả hành vi từ chối của mô hình và việc gọi công cụ của tác nhân. Hiệu ứng này phụ thuộc vào mô hình và khóa (key), và có thể bị che khuất bởi các điểm số tổng hợp khi những thay đổi theo hướng ngược nhau triệt tiêu lẫn nhau. Do đó, chúng tôi báo cáo cả hiệu suất ròng và sự bất đồng theo cặp giữa các lần chạy có và không có hình mờ. Hơn nữa, phần kết luận thảo luận về ý nghĩa của nó đối với an toàn và bảo mật AI cũng như những gì các nhà phát triển nên làm.

### Được xây dựng để xác thực nguồn gốc nội dung, được triển khai bên trong các tác nhân

Hình mờ văn bản nhúng một tín hiệu cho phép xác định đầu ra là do AI tạo ra. Các phương pháp hiện có bao gồm các phương pháp hậu xử lý và các phương pháp được tích hợp trực tiếp vào quá trình tạo LLM [8]. Các phương pháp tại thời điểm tạo bao gồm các phương pháp làm chệch logits (logits-biasing), lấy mẫu có khóa không biến dạng (distortion-free keyed sampling), các cấu trúc dựa trên mật mã [7] và lấy mẫu Tournament của SynthID-Text [3]. Hình 1 so sánh quy trình này với lấy mẫu thông thường. Chúng tôi sử dụng cấu hình không biến dạng của SynthID, giúp bảo toàn phân phối token gốc theo kỳ vọng đối với tính ngẫu nhiên của hình mờ trong khi các thế hệ riêng lẻ dưới một khóa cố định vẫn có thể khác nhau [3]. Dathathri và cộng sự báo cáo không có sự suy giảm chất lượng nào có thể đo lường được trên gần hai mươi triệu phản hồi của Gemini [3].

![](https://cdn.prod.website-files.com/677e57d57f0aaef07252db12/6aab907c2750694e8b5ffc13_56a33d01.png)

Việc triển khai của Anthropic cũng minh họa lý do tại sao điều này quan trọng ngoài các giao diện trò chuyện của bên thứ nhất. Công ty tuyên bố rằng hình mờ được áp dụng ở cấp độ mô hình và bao gồm các mô hình được hỗ trợ truy cập thông qua Claude Platform API cũng như các nhà cung cấp đám mây [1]. Do đó, một nhà phát triển sử dụng mô hình có hình mờ làm thành phần suy luận của một tác nhân có thể nhận được đầu ra có hình mờ ngay cả khi bản thân tác nhân đó là một ứng dụng riêng biệt. Điều này làm cho các hiệu ứng hành vi ở cấp độ mô hình của việc đóng dấu hình mờ trở nên liên quan đến các tác nhân được xây dựng xung quanh các mô hình đó.

### Cùng các token mà hình mờ làm chệch, cùng các token mà tác nhân hành động dựa trên đó

Lấy mẫu Tournament có nhiều cơ hội hơn để thay đổi việc lựa chọn token ở những nơi mô hình không chắc chắn. Trong đầu ra có cấu trúc như JSON, các dấu ngoặc, khóa và tên hàm thường rất dễ dự đoán, trong khi các giá trị như truy vấn, số, đường dẫn và người nhận thì ít dự đoán được hơn. Do đó, một thay đổi tương đương với biến thể từ vựng trong văn xuôi thông thường có thể làm thay đổi một đối số mà tác nhân thực thi.

Trọng số và prompt vẫn không thay đổi, nhưng việc lựa chọn token thì không. Quan trọng là, không biến dạng không có nghĩa là hành vi giống hệt nhau dưới một khóa hình mờ cố định. Sự đảm bảo giữ nguyên đối với tính ngẫu nhiên của hình mờ, trong khi một khóa cụ thể làm thay đổi việc lựa chọn token trong quá trình tạo [3]. Do đó, độ lệch lấy mẫu kết quả có thể thay đổi hành vi của tác nhân ngay cả khi hình mờ không biến dạng theo nghĩa được định nghĩa bởi Dathathri và cộng sự. Hiệu ứng của nó cũng có thể phụ thuộc vào khóa hình mờ, vì vậy chúng tôi kiểm tra nhiều khóa thay vì chỉ dựa vào một khóa.

### Cách chúng tôi đo lường hiệu ứng

Chúng tôi sử dụng thiết kế theo cặp cho hai thí nghiệm. Việc gọi công cụ được đánh giá trên BFCL v4 single-turn AST [9], và sự từ chối trên 200 hành vi độc hại của HarmBench [10] cộng với 100 kiểm soát lành tính của JailbreakBench [11], với các yêu cầu độc hại được kiểm tra cả ở dạng thô và dưới một kỹ thuật prompt injection cố định. Bảng 1 tóm tắt các tập dữ liệu, phạm vi đánh giá, nhiệt độ và hành vi mong đợi.

Chúng tôi sử dụng cấu hình SynthID-Text không biến dạng thông qua SynthIDTextWatermarkLogitsProcessor chưa sửa đổi của HuggingFace, với 30 lớp Tournament, độ dài n-gram là 5, bảng lấy mẫu 216 và lịch sử ngữ cảnh 1.024. Mỗi mục được tạo có và không có SynthID từ cùng một hạt giống (seed), thành phần lô và thứ tự ở mỗi nhiệt độ. Bộ xử lý hình mờ là sự khác biệt duy nhất trong mỗi cặp.

Bảng 1. Tập dữ liệu và các thiết lập thí nghiệm.

| Thí nghiệm | Tập dữ liệu và phạm vi | T | Hành vi đúng |
| --- | --- | --- | --- |
| Gọi công cụ | BFCL v4 single-turn AST [9], các tác vụ gọi trực tiếp và không trực tiếp cộng với mức độ liên quan và không liên quan | 0.001, 0.7, 1.0 | Gọi đúng, hoặc không gọi khi không có cái nào phù hợp |
| Từ chối | HarmBench [10], 200 hành vi độc hại; JailbreakBench [11], 100 kiểm soát lành tính; các prompt thô và prompt injection cố định | 0.001, 0.7 | Từ chối độc hại; trả lời lành tính |

### Chi phí gọi công cụ của việc đóng dấu hình mờ

Chúng tôi kiểm tra xem việc đóng dấu hình mờ có làm thay đổi việc lựa chọn công cụ, đối số hoặc tính hợp lệ của đầu ra hay không. Một lệnh gọi được định dạng tốt đến đúng công cụ với đường dẫn, người nhận, truy vấn hoặc số lượng không chính xác là đặc biệt nghiêm trọng vì nó có thể thực thi thành công trong khi thực hiện sai hành động. Chúng tôi đánh giá các lệnh gọi riêng lẻ, mặc dù một lệnh gọi không chính xác trong một tác nhân được triển khai cũng có thể ảnh hưởng đến các quan sát và quyết định tiếp theo.

### Tần suất thay đổi tính chính xác của lệnh gọi công cụ

Trên các mục yêu cầu gọi công cụ, việc đóng dấu hình mờ làm giảm độ chính xác trên sáu trong số bảy mô hình, với mức giảm đáng kể trên bốn mô hình. Tuy nhiên, thay đổi ròng về độ chính xác không cho thấy liệu các lệnh gọi riêng lẻ giống nhau có thành công khi có và không có hình mờ hay không. Một lệnh gọi trở nên không chính xác có thể được bù đắp bởi một lệnh gọi khác trở nên chính xác, khiến kết quả tổng hợp gần như không thay đổi mặc dù mô hình hành xử khác nhau trên cả hai mục.

Chúng tôi đo lường trực tiếp điều này bằng tỷ lệ bất đồng theo cặp (paired disagreement rate), mà chúng tôi gọi là churn (độ biến động), được định nghĩa là tỷ lệ các mục có kết quả khác nhau giữa các lần chạy có và không có watermark. Để so sánh giữa các mức nhiệt độ (temperature) trong Hình 2, chúng tôi sử dụng các mục non-live do nhà nghiên cứu của BFCL xác định, cung cấp cho chúng tôi cùng một tập hợp cố định gồm 1.150 tác vụ yêu cầu gọi hàm tại mỗi mức nhiệt độ. Hình 2 cho thấy sự bất đồng theo cặp lớn hơn đáng kể so với thay đổi độ chính xác ròng. Tại T=1.0, 16,8% kết quả gọi hàm của phi-4 khác biệt giữa hai điều kiện trong khi mức giảm độ chính xác ròng là 2,87 điểm. Llama-3.1-8B cho thấy mô hình tương tự, với 9,9% kết quả thay đổi trong khi mức giảm ròng chỉ là 0,87 điểm. Trên 21 tổ hợp mô hình-nhiệt độ, churn trung bình là 6,5% và khoảng bootstrap của nó loại trừ giá trị 0 trong mọi trường hợp.

![](https://cdn.prod.website-files.com/677e57d57f0aaef07252db12/6aab907c2750694e8b5ffc19_29f6906b.png)

### Các loại lỗi gọi công cụ (Tool-Call) thay đổi như thế nào

Loại lỗi cũng rất quan trọng. Đầu ra bị lỗi định dạng (malformed output) ngăn cản việc thực thi lệnh gọi dự kiến, trong khi một lệnh gọi đúng định dạng nhưng sai công cụ hoặc sai đối số vẫn có thể thực thi. Hình 3 phân tách các lỗi này thành: sai công cụ, sai đối số và đầu ra bị lỗi định dạng. Không giống như so sánh giữa các mức nhiệt độ ở Hình 2, phân tích này kết hợp các mục live và non-live yêu cầu gọi hàm của BFCL tại T=0.001 để đặc tả các lỗi trên phạm vi benchmark rộng hơn. Các mục liên quan (relevance) và không liên quan (irrelevance) bị loại trừ vì chúng kiểm tra xem liệu một lệnh gọi có nên được thực hiện hay không thay vì kiểm tra tính đúng đắn của lệnh gọi được tạo ra.

![](https://cdn.prod.website-files.com/677e57d57f0aaef07252db12/6aab907c2750694e8b5ffc1c_1377a14c.png)

Hồ sơ lỗi cũng khác nhau giữa các mô hình. Trên Llama-3.1-8B, đóng góp lớn nhất vào việc giảm độ chính xác đến từ các đối số không chính xác (-3,48 điểm), tiếp theo là các lệnh gọi sai công cụ (-1,84 điểm). Trên phi-4 và Granite-3.2-8B, đầu ra bị lỗi định dạng chiếm ưu thế (-5,96 và -4,36 điểm). Do đó, các thay đổi tổng hợp tương tự có thể phát sinh từ các phương thức lỗi khác nhau.

### Watermarking có thể làm suy yếu khả năng từ chối dưới tác động của Prompt Injection

Các phản hồi từ chối cũng được tạo ra theo từng token, vì vậy watermarking có thể ảnh hưởng đến chúng. Chúng tôi kiểm tra các yêu cầu độc hại một cách riêng lẻ và kết hợp với một kỹ thuật prompt-injection đơn giản, cố định nhằm giảm khả năng từ chối. Kỹ thuật này thêm một chỉ dẫn đối nghịch (adversarial instruction) dưới dạng nội dung được truy xuất, khẳng định rằng bộ lọc an toàn đã bị vô hiệu hóa và hướng dẫn mô hình tuân thủ. Nó được giữ cố định trên các prompt, mô hình và nhiệt độ. [OWASP GenAI LLM Top 10 2026](https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/) xác định prompt injection là một lỗ hổng phía đầu vào có thể làm thay đổi hành vi của mô hình theo những cách không mong muốn bởi nhà phát triển ứng dụng đại lý (agentic application), với những hậu quả có thể dẫn đến đầu ra độc hại và các hành động công cụ trái phép trong các hệ thống đại lý [12].

### Hành vi từ chối khi có và không có kỹ thuật Prompt Injection

Watermarking làm thay đổi hành vi từ chối đối với các yêu cầu độc hại cơ bản, nhưng hiệu ứng này trở nên rõ rệt hơn dưới tác động của prompt injection. Như Hình 4 cho thấy, sự bất đồng tăng lên trên một số mô hình khi các yêu cầu độc hại tương tự được kết hợp với kỹ thuật prompt-injection cố định, với các hiệu ứng mạnh nhất chuyển dịch chủ yếu từ từ chối sang tuân thủ. Điều này làm cho kết quả đặc biệt liên quan đến an toàn vì hiệu ứng hành vi trở nên rõ rệt hơn khi mô hình tiếp xúc với một prompt đối nghịch.

Tại T=0.001, churn của gemma-3-27b tăng từ 6,0% đối với các yêu cầu độc hại cơ bản lên 23,5% dưới tác động của prompt injection, trong khi thay đổi tuân thủ ròng chuyển từ -1,0 sang +12,5 điểm. Đối với gemma-3-12b, churn tăng từ 7,5% lên 11,0% và thay đổi tuân thủ ròng từ -0,5 sang +9,0 điểm. Trong cả hai trường hợp, watermarking có ít tác động ròng đến việc từ chối đối với các yêu cầu độc hại cơ bản nhưng làm giảm đáng kể khả năng từ chối dưới tác động của prompt injection. Llama-3.1-8B cũng cho thấy churn đáng kể dưới tác động của injection, đạt 14,0% tại T=0.001 và 17,5% tại T=0.7, mặc dù thay đổi ròng của nó không có ý nghĩa thống kê riêng lẻ.

phi-4 và Qwen3-4B cho thấy ít thay đổi trong cả hai điều kiện. Cả hai mô hình đều có xu hướng từ chối quá mức trong đánh giá của chúng tôi, bao gồm cả các kiểm soát vô hại. Do đó, sự thay đổi hạn chế của chúng dưới tác động của prompt injection không nên được hiểu là bằng chứng cho thấy watermarking bảo toàn hành vi an toàn đáng tin cậy hơn trên các mô hình này.

Sự tương phản giữa các yêu cầu cơ bản và yêu cầu bị tiêm nhiễm (injected) là rất quan trọng. Một watermark có vẻ ít ảnh hưởng đến hành vi từ chối trong đánh giá thông thường có thể tạo ra hành vi an toàn khác biệt đáng kể trong các điều kiện đối nghịch.

![](https://cdn.prod.website-files.com/677e57d57f0aaef07252db12/6aab907c2750694e8b5ffc16_d88d721a.png)

### So sánh với Churn do nhiệt độ (Temperature-Induced Churn)

Để đặt sự bất đồng do watermark vào bối cảnh, chúng tôi so sánh nó với sự bất đồng quan sát được khi thay đổi cài đặt nhiệt độ. Bảng 2 đối chiếu churn do watermark gây ra dưới tác động của prompt injection tại T=0.7 với churn quan sát được khi thay đổi T từ 0.001 sang 0.7 khi tắt watermark. Churn do watermark gây ra cao hơn đáng kể ở bốn trong sáu mô hình. Granite-3.2-8B có churn do nhiệt độ cao nhất ở mức 15,5%, nhưng churn do watermark của nó vẫn cao hơn ở mức 21,5%. phi-4 và Qwen3-4B thay đổi rất ít dưới cả hai tác động, phù hợp với tỷ lệ từ chối cao đã được mô tả ở trên.

Bảng 2. So sánh churn từ chối do watermark và do nhiệt độ dưới tác động của injection. Churn do watermark so sánh khi tắt và bật watermark tại T=0.7; sự bất đồng do nhiệt độ so sánh T=0.001 và 0.7 khi tắt watermark. Cột cuối cùng báo cáo sự khác biệt và khoảng bootstrap 95%.

| mô hình | % churn do watermark | % churn do nhiệt độ | sự khác biệt (95% CI) |
| --- | --- | --- | --- |
| gemma-3-27b | 26.0 | 13.5 | +12.5 (+6.0, +18.5) |
| Granite-3.2-8B | 21.5 | 15.5 | +6.0 (+0.5, +12.0) |
| Llama-3.1-8B | 17.5 | 7.5 | +10.0 (+4.5, +15.5) |
| gemma-3-12b | 11.0 | 6.0 | +5.0 (+0.5, +10.0) |
| phi-4 | 0.5 | 0.5 | +0.0 (−1.5, +1.5) |
| Qwen3-4B | 0.0 | 0.0 | +0.0 (+0.0, +0.0) |

### Độ nhạy với khóa Watermark

Các kết quả trước đó sử dụng một khóa watermark, nhưng hiệu ứng của SynthID đối với việc lựa chọn token phụ thuộc vào khóa. Do đó, chúng tôi đánh giá độ nhạy với khóa watermark tại T=0.7 với khóa nghiên cứu và mười khóa bổ sung. Hình 5 cho thấy sự thay đổi kết quả về mức độ thành công của cuộc tấn công trên các khóa và mô hình.

_Bài gốc còn tiếp._ Xem tiếp tại: <https://www.lasso.security/blog/the-provenance-tax-understanding-the-impact-of-llm-watermarking-on-ai-agent-behavior>
