Anthropic: Newsroom (Web)
85

Tin ngành

Cơ chế đánh dấu văn bản (watermark) trên Claude hoạt động như thế nào?

(giờ Việt Nam)

Tóm tắt AI

Anthropic tích hợp công nghệ SynthID-Text của Google DeepMind vào Claude để gắn watermark ẩn, giúp nhận diện nội dung do AI tạo ra mà không làm ảnh hưởng đến chất lượng hay chi phí, nhằm tuân thủ Đạo luật AI của EU.

Bản dịch AI

How Claude's text watermarking works

Các mô hình Claude trong tương lai sẽ tạo ra văn bản có chứa watermark (hình mờ kỹ thuật số). Đây là một cách để xác định khả năng Claude đã tham gia vào việc viết văn bản đó, và chúng tôi, cùng với một số nhà cung cấp AI lớn khác, đang triển khai thay đổi này để tuân thủ Đạo luật AI của EU (EU AI Act).

Trong bài viết này, chúng tôi chia sẻ câu trả lời cho một số câu hỏi mà chúng tôi đã nhận được về cách thức hoạt động của phương pháp đóng watermark mà chúng tôi đã chọn, liệu nó có ảnh hưởng đến kết quả đầu ra của Claude hay không và lý do tại sao chúng tôi thực hiện thay đổi này. Tóm tắt như sau:

Watermarking là gì?

Các mô hình ngôn ngữ lớn như Claude hoạt động bằng cách tạo ra từng từ một. Mỗi khi mô hình quyết định từ tiếp theo, nó sẽ chọn từ một danh sách các ứng viên tiềm năng, cuối cùng chọn từ hợp lý hoặc có khả năng xảy ra cao nhất dựa trên văn bản trước đó. Hãy lấy câu “Thời tiết hôm nay lạnh và…”. Từ tiếp theo rất khó có khả năng là “ngọt”. Nhưng khả năng cao là “u ám” hoặc “xám”. Trong hầu hết các trường hợp, đối với người đọc, việc mô hình chọn từ nào trong hai từ sau không quan trọng lắm—ý nghĩa của câu về cơ bản vẫn giống nhau. Trong những trường hợp như thế này, sự lựa chọn được quyết định bởi một con số ngẫu nhiên.

Watermarking sử dụng các lựa chọn ít rủi ro như thế này—xảy ra nhiều lần trong một đoạn văn bản được tạo ra—để để lại một mô hình (pattern) trong các phản hồi của Claude. Mô hình đó không thể phát hiện được đối với người đọc, nhưng có thể phát hiện được đối với bất kỳ ai có khóa (key) để giải mã nó. Khi sử dụng watermarking, các lựa chọn vẫn được thực hiện ngẫu nhiên, nhưng nguồn gốc của sự ngẫu nhiên đó thì khác. Thay vì sử dụng trình tạo số ngẫu nhiên tùy ý để chọn từ tiếp theo, watermarking sử dụng khóa và một vài từ đứng trước để quyết định từ nào mô hình nên chọn. Nghĩa là, các từ mà Claude chọn vẫn là ngẫu nhiên, nhưng bây giờ, người ta có thể kiểm tra chuỗi từ và xem liệu nó có nhất quán với các lựa chọn mà Claude sẽ thực hiện nếu nó đang sử dụng khóa hay không. Nếu có, người ta có thể gán một xác suất cho thấy văn bản đó được tạo ra bởi Claude.

Quan trọng là, không phải mô hình bây giờ sẽ luôn thiên vị từ “u ám” hay “xám”. Cũng giống như văn bản không có watermark, “u ám” có thể được chọn trong câu này, “xám” trong câu tiếp theo, tùy thuộc vào các từ đứng trước đó. Và không phải phương pháp watermarking ép Claude chọn một từ mà nó vốn dĩ sẽ không cân nhắc (ví dụ: nó sẽ không khiến Claude chọn một từ như “nubilous”—một từ đồng nghĩa ít phổ biến với “u ám” hoặc “xám” mà Claude gần như chắc chắn sẽ không sử dụng trong điều kiện bình thường).

Watermarking có ảnh hưởng đến kết quả đầu ra của Claude không?

Watermarking không ảnh hưởng đến chất lượng đầu ra của Claude. Đối với người đọc, một phản hồi có watermark không thể phân biệt được với phản hồi không có watermark (theo cách này, watermark AI khác biệt đáng kể so với các watermark trên tiền giấy, các vật thể vật lý khác và một số tài liệu kỹ thuật số, vốn có thể nhìn thấy bằng mắt thường).

Trong các thử nghiệm nội bộ, chúng tôi không thấy tác động nào của watermarking đối với nội dung, mức độ sáng tạo hoặc khả năng đọc của văn bản do Claude tạo ra. Trong bài báo về SynthID-Text, nơi giới thiệu kỹ thuật mà chúng tôi sử dụng, Google DeepMind đã kiểm tra tác động này bằng cách cung cấp một mô hình có sử dụng watermarking cho một phần lưu lượng truy cập Gemini của họ và so sánh các đánh giá ngón tay cái hướng lên (like) và hướng xuống (dislike). Họ không tìm thấy sự khác biệt đáng kể nào về mặt thống kê so với mô hình không có watermark. Và trong một nghiên cứu có kiểm soát, những người đánh giá là con người khi so sánh các câu trả lời có và không có watermark đặt cạnh nhau đã không thấy sự khác biệt về chất lượng.

Một phép so sánh hữu ích là hãy tưởng tượng bạn đang chơi một trò chơi như Monopoly. Ở mỗi lượt, mỗi người chơi di chuyển một số ô ngẫu nhiên quanh bàn cờ dựa trên việc tung xúc xắc. Giả sử rằng, thay vì tung xúc xắc để có được sự ngẫu nhiên này, chúng ta quyết định sử dụng một cuốn sách chứa các chữ số của số pi. Chúng ta bắt đầu từ một chữ số được chọn ngẫu nhiên (ví dụ: chữ số thứ 1.012.845 sau dấu thập phân, tình cờ là số 6), và từ thời điểm đó trở đi, mỗi người chơi chỉ cần sử dụng chữ số tiếp theo trong chuỗi làm “lượt tung” của họ.

Xét về mọi mục đích, các nước đi vẫn là ngẫu nhiên: không có gì khác biệt đối với người chơi—hoặc đối với kết quả của trò chơi—cho dù sự ngẫu nhiên đến từ số pi hay từ các lần tung xúc xắc. Nhưng nếu chúng ta có thể thấy chuỗi tất cả các nước đi sau trò chơi (và chúng ta biết giá trị của số pi), chúng ta có thể tìm ra liệu đây có phải là một trò chơi có khả năng sử dụng số pi để xác định các nước đi của nó hay không. Trò chơi sử dụng số pi, theo một nghĩa nào đó, đã được “đóng watermark”.

Điều tương tự cũng xảy ra với văn bản do Claude tạo ra. Watermarking không làm thay đổi ý nghĩa hoặc trải nghiệm đối với người đọc, nhưng nếu bạn muốn kiểm tra sau đó xem văn bản có khả năng được tạo ra bởi Claude hay không, watermark cho phép bạn làm điều đó.

Bạn sử dụng phương pháp watermarking cụ thể nào?

Watermark văn bản của Claude là một phiên bản của phương pháp SynthID-Text được Google DeepMind công bố trên tạp chí Nature vào năm 2024. Nó thuộc về một nhóm các phương pháp bắt nguồn từ một đề xuất của Scott Aaronson vào năm 2022, tất cả đều chia sẻ cùng một nguyên tắc thiết kế mà chúng tôi đã mô tả ở trên—watermark chỉ thay đổi nguồn gốc của sự ngẫu nhiên được sử dụng để chọn giữa các từ.

Watermarking có những hạn chế về hiệu quả. Sử dụng khóa của chúng tôi, người ta chỉ có thể trả lời câu hỏi “Khả năng văn bản này được viết một phần bởi Claude là bao nhiêu?”. Nó không xác nhận liệu văn bản đó có phải do con người viết hay không, và nó không thể cho biết liệu văn bản đó có được viết bởi một AI khác hay không (ngay cả khi AI khác đó sử dụng watermarking, nó sẽ có một khóa khác; nó cũng có thể sử dụng một phương pháp watermarking hoàn toàn khác). Việc phát hiện watermark cũng không hoạt động tốt trên các mẫu nhỏ, nơi có ít lựa chọn từ ngữ hơn và do đó có ít thông tin để dựa vào. Khi độ dài của đoạn văn tăng lên, độ tin cậy về sự tham gia của Claude cũng tăng theo.

Watermarking thưa thớt hơn trên các đoạn văn mang tính thực tế, nơi có ít lựa chọn có thể thực hiện mà không làm giảm độ chính xác của văn bản. Ví dụ, hãy lấy câu “Tác phẩm nổi tiếng nhất của Isaac Newton có tên là Principia…”. Việc từ tiếp theo có phải là “Mathematica” hay không thực sự quan trọng (đó là câu trả lời đúng duy nhất), vì vậy watermark sẽ không có gì để tác động. Điều tương tự cũng đúng với việc hiệu đính. Nếu bạn đưa cho Claude một bài viết và yêu cầu nó chỉ chỉnh sửa ngữ pháp và dấu câu mà không làm gì khác, watermark chỉ có thể tồn tại trong một vài chỉnh sửa, vốn có thể quá ít để ghi nhận.

Còn những trường hợp Claude hiệu đính hoặc chỉnh sửa văn bản của con người thì sao?

Watermark chỉ áp dụng cho các từ mà Claude chọn. Khi Claude hiệu đính văn bản do con người viết, những gì nó trả lại thường chỉ được chỉnh sửa nhẹ; vì gần như tất cả các từ đều là của con người, nên có rất ít (nếu có) chỗ để watermark bám vào. Tùy thuộc vào độ dài của văn bản và mức độ Claude đã chỉnh sửa nhiều hay ít, những thay đổi đó có thể không đủ để làm cho sự tham gia của Claude trở nên dễ phát hiện. Claude càng viết nhiều, nó càng phải đưa ra nhiều quyết định, và càng có nhiều không gian cho watermark.

Còn về mã nguồn (code) thì sao?

Như chúng tôi đã lưu ý ở trên, watermarking AI tận dụng các quyết định mà ở đó lựa chọn từ nào cũng tốt như nhau. Ở những nơi yêu cầu kết quả chính xác—nơi không có sự lựa chọn, và một cái gì đó sẽ sai về mặt thực tế hoặc một đoạn mã sẽ bị lỗi nếu chọn một thuật ngữ khác—watermark sẽ không được áp dụng.

Ví dụ, một khi mô hình đã viết “2 + 2 =”, có một lựa chọn tốt nhất rất rõ ràng cho token tiếp theo (nếu mô hình đang hoàn thành phép tính, không có câu trả lời nào tốt như “4”; nếu nó đang nói về tác phẩm Nineteen Eighty-Four của George Orwell, không có câu trả lời nào tốt như “5”). “Cú hích” của watermark sẽ không được áp dụng ở đây. Vì lý do tương tự, mã nguồn—vốn trong rất nhiều trường hợp phải chính xác—thường có ít watermark hơn so với một số dạng văn bản khác.

Mặc dù vậy, trong các lĩnh vực có sự lựa chọn tùy ý giữa các từ hoặc thuật ngữ cụ thể trong mã nguồn, watermark có thể được sử dụng, chẳng hạn như các chú thích (comments) trong mã. Nhưng theo định nghĩa, nó sẽ có tác động không đáng kể đến mã nguồn thực tế được tạo ra.

Điều này có ý nghĩa gì đối với người dùng?

Điều này có làm chậm mô hình hoặc làm cho nó đắt đỏ hơn không?

Không. Watermarking có tác động không đáng kể đến tốc độ của các mô hình, và vì nó không tạo ra thêm token nào, nên chi phí để vận hành và sử dụng mô hình vẫn như cũ.

Watermark có thể bị truy ngược lại tôi hoặc tổ chức của tôi không?

Không. Watermarking áp dụng cho Claude và các kết quả đầu ra của nó. Nó không xác định bất cứ điều gì liên quan đến người dùng cá nhân. Không có gì trong watermark, hoặc khóa của nó, cho phép bất kỳ ai khôi phục bất kỳ thông tin nào về người dùng, tổ chức của họ hoặc các cuộc trò chuyện của họ với Claude.

Tại sao các bạn lại đóng watermark cho các kết quả đầu ra của Claude?

Chúng tôi đang triển khai watermarking để tuân thủ Đạo luật AI của EU. Anthropic, cùng với một số nhà cung cấp mô hình AI lớn khác và tổng cộng khoảng 190 bên ký kết, đã ký Bộ quy tắc thực hành của EU về tính minh bạch của nội dung do AI tạo ra vào tháng 7 năm 2026. Điều này yêu cầu các nhà cung cấp hệ thống AI phải sử dụng các phương pháp “đánh dấu” văn bản do AI tạo ra. Chúng tôi đang áp dụng watermarking trên toàn cầu khi ra mắt vì chúng tôi chưa có cách thức bền vững để giới hạn nó theo khu vực. Tuy nhiên, chúng tôi sẽ tiếp tục đánh giá các phương pháp khác nhau và sẽ chia sẻ thông tin cập nhật khi có.

Các câu hỏi khác

Làm thế nào để tôi kiểm tra xem một đoạn văn bản có phải do Claude viết hay không?

Chúng tôi sẽ sớm cung cấp API phát hiện watermark. Chúng tôi đang trong quá trình hoàn thiện các chi tiết về việc triển khai nó.

Còn hình ảnh và các tệp khác thì sao?

Khi Claude tạo ra một tệp thuộc loại được hỗ trợ (chẳng hạn như.png,.jpg hoặc.svg), nó sẽ đính kèm một thông tin xác thực nội dung (content credential) dưới dạng một ghi chú nhỏ, được ký mã hóa trong siêu dữ liệu (metadata) của tệp, cho biết rằng tệp đó được tạo hoặc xử lý bằng Claude. Đây là một tiêu chuẩn công nghiệp mở có tên là C2PA—tiêu chuẩn tương tự được các nhà sản xuất máy ảnh và phần mềm chỉnh sửa ảnh sử dụng để ghi lại nguồn gốc của hình ảnh. Bất kỳ công cụ nào hỗ trợ C2PA đều có thể đọc được nó; chúng tôi sẽ cung cấp công cụ riêng của mình để bạn có thể thả tệp vào và kiểm tra.

Nhãn siêu dữ liệu này rất khác với watermark. Không có gì trong tệp bị thay đổi—nó không được nhúng hoặc ẩn đi. Như với văn bản, thông tin xác thực chỉ cho biết Claude đã tham gia vào việc tạo ra tệp; nó không bao gồm bất kỳ thông tin nhận dạng nào.

Có ai đó có thể chỉ cần chỉnh sửa văn bản để vượt qua watermarking không?

Ở một mức độ nào đó, có. Chỉnh sửa nhẹ có lẽ sẽ không loại bỏ hoàn toàn watermark; nhưng viết lại hoàn toàn mà mọi từ đều được thay thế thì có thể. Trong trường hợp sau, tất nhiên, có thể tranh luận liệu văn bản đó còn có thể được mô tả là do AI tạo ra hay không.

Watermark thực sự chứng minh điều gì?

Watermark chỉ có thể xác định rằng Claude có khả năng đã tham gia vào nội dung đó tại một thời điểm nào đó. Nó không thể phân biệt giữa “Claude đã viết cái này” và “Claude đã chỉnh sửa nhiều cái này”.

ClaudeAnthropicWatermarkAI-SafetyQuy-dinh-AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Anthropic: Newsroom (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.