Thủ thuật
Đánh dấu văn bản AI: Giải pháp miễn phí và hiệu quả đã xuất hiện
(giờ Việt Nam)
Tóm tắt AI
Scott Aaronson và Hendrik Kirchner đã tìm ra phương pháp tối ưu để đóng dấu bản quyền cho văn bản AI, giải quyết bài toán xác thực nội dung một cách miễn phí và chính xác.
Bản dịch AI

Scott Aaronson, trong thời gian làm việc tại OpenAI, đã giải quyết được phần lớn vấn đề tạo watermark cho văn bản AI cùng với Hendrik Kirchner.
Đây là cách giải pháp của ông hoạt động, hoặc bạn có thể xem phiên bản của Tenobrus.
Các đầu ra của AI không mang tính tất định. Công việc của AI là chọn xác suất cho mỗi token tiềm năng tiếp theo. Sau đó, token sẽ được chọn một cách ngẫu nhiên.
Theo mặc định, bạn sử dụng một nguồn giả ngẫu nhiên cho mỗi lựa chọn, vì tính ngẫu nhiên thực sự rất phiền phức.
Để áp dụng watermark, bạn sử dụng một nguồn giả ngẫu nhiên riêng tư khác nhưng tương tự, được bắt nguồn từ một khóa bí mật.
Sau đó, với đủ lượng văn bản, một điểm số sẽ được rút ra để đánh giá mức độ phù hợp của các lựa chọn với nguồn giả ngẫu nhiên đó so với một nguồn khác.
Bạn cung cấp một API cho phép bất kỳ ai cũng có thể kiểm tra watermark.
Nếu bạn muốn tìm hiểu sâu hơn, đây là bài báo đầy đủ. Phương pháp này có những đặc tính rất tốt:
Điều này không có tác động thực tế nào đến các đầu ra. Con người hoàn toàn không thể nhận ra sự khác biệt.
Chi phí biên để thực hiện việc này gần như bằng không.
Watermark có thể bị xóa bằng cách viết lại theo ngôn ngữ của riêng bạn, và nó xuất hiện tỷ lệ thuận với số lượng các lựa chọn chi tiết của AI mà bạn giữ lại.
Bộ Quy tắc Thực hành của Liên minh Châu Âu, được ký kết bởi các phòng thí nghiệm AI lớn ở phương Tây, yêu cầu các mô hình AI trong tương lai phải sử dụng các watermark như vậy.
Google đã triển khai điều này, bao gồm cả cho Gemini 3.7 Flash, và họ đã bắt đầu tung ra tính năng này từ năm 2024. Google đã thực hiện chính xác những gì Anthropic đang làm trong hơn hai năm qua, ngoại trừ việc họ có một bộ phát hiện công khai, và Google đã xác nhận trong một thử nghiệm (n = 20 triệu) rằng không có sự khác biệt nào trong phản hồi của người dùng.
Anthropic đã âm thầm thông báo cách đây một tuần rằng họ đang triển khai watermark để tuân thủ Bộ Quy tắc Thực hành của EU. Vì họ không muốn phải phân biệt các nguồn lưu lượng truy cập, chi phí biên bằng không và việc gắn watermark là hành động có lợi cho xã hội, nên điều này sẽ áp dụng cho tất cả mọi người. Sau đó, họ đã cung cấp một phần FAQ về cách thức hoạt động của nó.
Có khả năng là khi họ có khả năng phân biệt vì các lý do khác, họ cũng sẽ sử dụng nó ở đây, nếu chúng ta quyết định rằng việc gắn watermark phổ quát là điều tồi tệ. Tôi nghĩ đó là điều tốt.
Cách hiểu ban đầu của tôi là đây là một câu chuyện tích cực, thầm lặng về một điều tốt đẹp, cho thấy rằng nếu một thứ gì đó tốt hoạt động mà không có nhược điểm hay chi phí nào thì có lẽ chúng ta sẽ làm, vì vậy đây là toàn bộ nội dung đưa tin ban đầu của tôi:
Zvi Mowshowitz (AI #181): Anthropic sẽ gắn watermark cho các đầu ra của Claude trong tương lai, bao gồm cả văn bản, theo Bộ Quy tắc Thực hành của EU. Trái ngược với tấm biển neon khổng lồ ghi "ĐÂY LÀ VĂN BẢN CỦA CLAUDE" mà nhiều người trong chúng ta tự động nhìn thấy trên tất cả văn bản của Claude. OpenAI dự định sẽ làm theo, nhưng có vẻ như họ sẽ bỏ lỡ thời hạn.
Tôi đồng ý với Ryan Greenblatt rằng khó có khả năng watermark làm giảm chất lượng đáng kể, và một nhược điểm của watermark so với Pangram là Pangram làm tốt việc không gắn cờ các văn bản của con người đã qua chỉnh sửa nhẹ bởi AI.
Bạn có thể không thích cách Brussels đặt ra chính sách theo hướng này, nhưng việc gắn watermark kỹ thuật rõ ràng là điều tốt nên làm nếu chi phí thấp. Tôi nghĩ những ai phản ứng ngược lại đều có bản năng rất lệch lạc. Bất kỳ ai hỗ trợ việc xóa watermark một cách có hệ thống hoặc đề xuất nó như một chiến lược đều cần phải được xếp vào nhóm "cần tự hỏi bản thân, liệu chúng ta có phải là kẻ phản diện không."
Điều này khác với việc nghiên cứu cách xóa để đối phó hoặc phòng thủ, đó rõ ràng là điều bình thường. Bạn chỉ đang tự hỏi mình có phải là kẻ phản diện hay không nếu bạn thực sự xóa chúng trong thực tế.
Điều này ổn.
Hội chứng rối loạn Anthropic.
Mọi người không hiểu rằng các đầu ra của LLM vốn đã ngẫu nhiên.
Mọi người không tin rằng phương pháp này không tốn kém.
Mọi người nghi ngờ bất kỳ sự thay đổi nào về nguyên tắc.
Có lẽ một phần là do từ "watermark".
Rất nhiều người không muốn bị bắt quả tang.
Có những lúc bạn không muốn bị nhận diện.
Có một số lý do chính đáng để lo ngại.
Gian lận, gian lận, gian lận, gian lận, gian lận.
Cách viết ở giữa và tỷ lệ lỗi.
Hàng triệu cho quốc phòng nhưng không một xu cho cống nạp.
Không. Không hẳn vậy. Rất nhiều người đã phản ứng bằng cách trở nên "Big Mad" (cực kỳ tức giận).
Vậy nên chúng ta đang ở đây.
Toàn bộ tác động thực tế là: Sẽ có một API cho bạn biết liệu một đoạn văn bản nhất định có đến từ Claude hay không. Chỉ vậy thôi. Thế mà.
Shoshannah Tekofsky: Hầu hết các phản đối về watermark dường như hoàn toàn là bịa đặt. Tại sao điều này lại xảy ra?
Phần còn lại của bài viết này là về việc khám phá lý do tại sao mọi người lại "Big Mad" về điều này, phần lớn như một ví dụ thực tế về cách mọi người trở nên kích động vì những thứ gần như không có gì.
Kết luận của tôi là một loạt các yếu tố khác nhau đang hội tụ lại.
Đây là lý do chính. Đừng giả vờ là không phải vậy.
Bài viết được AI dịch và tổng hợp tự động từ Don't Worry About the Vase (Zvi). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.