Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
85

Thủ thuật

Giải mã cơ chế hoạt động của công nghệ đóng dấu bản quyền (watermarking) cho văn bản AI

(giờ Việt Nam)

Tóm tắt AI

Bài viết phân tích sâu về cách thức kỹ thuật đóng dấu bản quyền hoạt động trên các mô hình ngôn ngữ lớn, giúp nhận diện nội dung do AI tạo ra một cách hiệu quả và bảo mật.

Bản dịch AI

How AI text watermarking works

← declaude

Một hình mờ (watermark) trong văn bản thuần túy nghe có vẻ bất khả thi. Văn bản không có pixel để ẩn dữ liệu, và không có siêu dữ liệu (metadata) nào tồn tại được sau thao tác sao chép-dán; mọi ký tự đều hiển thị ngay trước mắt bạn. Vậy dấu vết có thể nằm ở đâu?

Tuy nhiên, các dấu vết này là có thật. Google đã gắn hình mờ vào văn bản từ ứng dụng và trải nghiệm web Gemini kể từ năm 2024 (tại thời điểm viết bài, API của họ là một ngoại lệ đã được ghi nhận), và tính đến tháng 8 năm 2026, các mô hình Claude mới đã gắn dấu vết văn bản ở cấp độ mô hình, với các mô hình cũ hơn sẽ sớm được cập nhật. Chúng vô hình, tồn tại được sau khi sao chép và hoạt động hiệu quả vì chúng hoàn toàn không nằm trong các ký tự. Chúng nằm trong những lựa chọn giữa các từ ngữ.

1. Viết là một chuỗi các lựa chọn nhỏ

Ý tưởng cốt lõi trong bước này: một mô hình viết bằng cách tung những con xúc xắc có trọng số giữa một vài từ mà từ nào cũng đều phù hợp.

Khi mô hình đang viết dở câu, nó không biết "từ tiếp theo" là gì. Nó có một danh sách rút gọn, giống như tính năng tự động hoàn thành, với các mức độ ưu tiên. Đây là một khoảnh khắc thực tế, chỉ còn một từ nữa là kết thúc câu:

câu đang được viết

Kết quả của nghiên cứu khá là

Mỗi lần tung xúc xắc sẽ quét qua danh sách rút gọn, chọn một từ (xác suất khớp với các thanh) và đưa nó vào câu ở trên. Các dấu chấm thống kê nơi xúc xắc rơi xuống: hãy thử ×20 và quan sát đống điểm hình thành theo xác suất. Hãy chú ý điều không bao giờ thay đổi: mỗi lần rơi đều tạo ra một câu hoàn chỉnh.

Một trang văn bản chứa hàng trăm "ngã rẽ" nhỏ như vậy, mỗi từ một ngã rẽ, và tại nhiều vị trí, một vài lựa chọn đều tốt như nhau. Độ linh hoạt đó chính là nguyên liệu thô. Bất cứ ai có thể tác động vào cách xúc xắc rơi xuống đều có thể ẩn một mô hình (pattern) vào văn bản mà không làm thay đổi nội dung của nó.

2. Một khóa bí mật tác động vào các lựa chọn đó

Ý tưởng cốt lõi trong bước này: khóa bí mật sẽ tô màu cho danh sách rút gọn và đẩy nhẹ một màu nào đó. Văn bản vẫn đọc được một cách bình thường.

Đây là công thức kinh điển (Kirchenbauer và cộng sự, 2023; SynthID của Google đạt được kết quả tương tự bằng một lộ trình tinh tế hơn theo kiểu giải đấu). Tại mỗi ngã rẽ, các phép toán có khóa bí mật sẽ chia các từ ứng viên thành màu xanh và màu đỏ, một cách tô màu tùy ý mà chỉ người giữ khóa mới có thể tái tạo. Sau đó, xúc xắc được nghiêng nhẹ về phía màu xanh.

câu đang được viết

Kết quả của nghiên cứu khá là

Không áp dụng khóa: đây là các ưu tiên của chính mô hình. Các đường viền nét đứt sẽ hiển thị xác suất cũ khi khóa được bật.

Hai điều làm cho phương pháp này trở nên tinh vi. Cú đẩy rất nhẹ: một từ màu đỏ vẫn có thể thắng — chỉ là ít khả năng hơn một chút. Và việc tô màu không phải là thuộc tính cố định của từ: khóa tính toán nó từ một chuỗi ngắn các từ ngay trước đó, vì vậy cùng một ứng viên sẽ là màu xanh sau tiền tố này nhưng lại là màu đỏ sau tiền tố khác:

Bốn từ ứng viên giống nhau, được tô màu bởi khóa sau sáu tiền tố khác nhau. Khóa nhìn thấy các từ ngay trước nó; vị trí trong văn bản rộng hơn là vô hình đối với nó. Chỉ có xu hướng chung về phía màu xanh là tích lũy, và chỉ người giữ khóa mới biết từ nào là màu xanh ở đâu.

(Hai biến thể, cùng nguyên lý. SynthID của Google — phiên bản đang được triển khai thực tế — thay thế cú đẩy bằng một giải đấu bí mật nhỏ: một vài ứng viên được rút ra từ xác suất của chính mô hình, khóa chấm điểm chúng, và bảng đấu được sắp xếp sao cho, khi tính trung bình trên các lượt rút của khóa, xác suất của mọi từ vẫn giữ nguyên như ý định của mô hình. Phương pháp của Aaronson, được xây dựng tại OpenAI, thậm chí còn bỏ qua bước đó và tự suy ra các lượt tung xúc xắc từ khóa. Toán học khác nhau, nhưng cùng nguyên lý: dấu vết nằm trong các lựa chọn.)

3. Bất cứ ai giữ khóa đều có thể đếm

Ý tưởng cốt lõi trong bước này: với khóa, bạn có thể tô màu lại bất kỳ văn bản nào và đơn giản là đếm. Văn bản có dấu vết sẽ xuất hiện màu xanh quá thường xuyên để có thể coi là ngẫu nhiên.

Việc phát hiện không đọc văn bản hay đánh giá phong cách của nó. Bộ phát hiện sẽ chạy lại quá trình tô màu của người giữ khóa trên các từ và đếm xem có bao nhiêu từ màu xanh. Nếu không có dấu vết (hoặc không có đúng khóa), màu xanh sẽ thắng khoảng một nửa số lần. Giống như tung đồng xu. Đây là một đoạn văn trông bình thường; hãy thử cả hai khóa trên đó:

màu xanh: – trên 55

tung đồng xu

thanh đánh dấu (độ dài này)

Các ô được tô đầy và gạch chân là màu xanh, đường viền nét đứt là màu đỏ. Các từ đọc giống hệt nhau dù ở trường hợp nào; việc tô màu chỉ tồn tại trong các phép toán của người giữ khóa. Với sai khóa, sự phân chia là vô nghĩa, và kết quả đếm chỉ ở mức ngẫu nhiên.

(Độ nghiêng trong bản demo này được làm rõ để bạn có thể nhìn thấy; dấu vết thực tế sẽ nghiêng nhẹ hơn nhiều và cần nhiều văn bản hơn tương ứng. Trong mô hình 50/50 của bản demo này, một tài liệu 1.500 từ sẽ chỉ gắn cờ ở mức ~55% màu xanh: những độ nghiêng nhỏ chỉ trở nên thuyết phục thông qua độ dài, đó là lý do tại sao các văn bản ngắn thực sự rất khó để xác định.)

4. Việc chỉnh sửa ảnh hưởng thế nào đến dấu vết

Ý tưởng cốt lõi trong bước này: dấu vết tồn tại trong các chuỗi từ ngữ không bị thay đổi. Việc chỉnh sửa sẽ xóa nó chính xác tại nơi các chuỗi đó bị ngắt, và không ở đâu khác.

Cách tô màu của mỗi từ được suy ra từ một chuỗi ngắn các từ ngay trước nó (từ một đến một vài từ, tùy thuộc vào phương pháp). Vì vậy, một vị trí chỉ được tính là bằng chứng nếu một cửa sổ ngắn của văn bản gốc (từ đó cộng với các từ lân cận) vẫn còn nguyên vẹn.

Đây là cùng một đoạn văn từ bước 3, ở năm mức độ chỉnh sửa. Kéo thanh trượt và xem các chuỗi được đánh dấu thu nhỏ lại. Một phần được đánh dấu có nghĩa là chuỗi từ ngữ đó vẫn khớp hoàn toàn với bản gốc, vì vậy bộ phát hiện có thể đếm ở đó. Mọi thứ bị làm mờ là từ ngữ mới, nơi không còn gì ngoài nhiễu tung đồng xu để đếm.

sửa lỗi chính tả · các cửa sổ còn lại: –%

Kết luận đọc phần tỷ lệ còn lại được đo từ các phần đánh dấu ở trên, dự tính cho một tài liệu 1.500 từ. Hai điều cần lưu ý: một "bản chỉnh sửa nặng" còn lại bao nhiêu, và bạn phải kéo đến mức độ viết lại hoàn toàn bao xa trước khi bằng chứng thực sự biến mất.

Trên các triển khai thực tế (các phương pháp KGW và EXP của MarkLLM trên một mô hình mở, được xử lý bởi lộ trình viết lại toàn bộ của declaude): khoảng 0,5% các cửa sổ còn lại, và độ chính xác của bộ phát hiện giảm từ mức gần như chắc chắn xuống mức tung đồng xu. Các tài liệu được công bố đều đồng ý về hình thái này. Việc diễn giải lại nhẹ hoặc một lần làm loãng dấu vết thay vì xóa bỏ nó; trong các thí nghiệm của Kirchenbauer và cộng sự, bộ phát hiện vẫn phục hồi nếu có đủ văn bản, với ngay cả việc diễn giải lại của con người cũng trở nên có thể phát hiện được sau khoảng 800 token (khoảng 600 từ). Điều xóa bỏ dấu vết là việc tái cấu trúc không chia sẻ bất kỳ chuỗi từ ngữ nào với bản gốc.

Đó là lý do tại sao một công cụ viết lại dựa trên ý nghĩa (như lộ trình viết lại toàn bộ của declaude) mới thực sự xóa bỏ nhóm dấu vết này, và tại sao một lần chỉnh sửa nhẹ giữ lại hầu hết cách diễn đạt thì không.

Một giới hạn được nêu rõ: những con số đó đến từ các triển khai mở mà chúng ta có thể đo lường. Phương pháp thực tế của Anthropic không được tiết lộ, vì vậy chưa ai bên ngoài Anthropic có thể chạy thử nghiệm này đối với dấu vết của chính Claude.

5. Điều này có ý nghĩa gì trong thực tế

Ý tưởng cốt lõi trong bước này: việc phát hiện là riêng tư, mang tính xác suất, và liên quan đến quá trình xử lý, không phải quyền tác giả.

Được viết bởi James Padolsey tại NOPE như một phần bổ trợ cho declaude. Các hình ảnh tương tác là một mô hình giảng dạy với các tham số minh họa, không phải là phương pháp thực tế của bất kỳ nhà cung cấp nào.

AIWatermarkingBảo mậtLLMCông nghệ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.