Cloudflare Blog
85

Tin ngành

Cloudflare cho phép chủ website chặn AI thu thập dữ liệu mà vẫn giữ thứ hạng tìm kiếm

(giờ Việt Nam)

Tóm tắt AI

Cloudflare ra mắt tính năng mới giúp chủ sở hữu website chặn các bot huấn luyện AI, đồng thời thiết lập quy chuẩn hợp tác với Apple, Google và Microsoft để đảm bảo khả năng hiển thị trên công cụ tìm kiếm.

Bản dịch AI

Have it both ways: stay discoverable in search while disallowing AI training

Nếu không có các biện pháp kiểm soát phù hợp, các chủ sở hữu trang web từ lâu đã phải đối mặt với một sự đánh đổi khó khăn: cho phép nội dung của mình được sử dụng để huấn luyện AI, hoặc chấp nhận rủi ro mất khả năng hiển thị trên công cụ tìm kiếm. Sự đánh đổi đó tồn tại vì một số tổ chức lớn nhất trên Internet sử dụng các trình thu thập dữ liệu đa năng (mixed-use crawlers): một trình thu thập duy nhất phục vụ cả mục đích tìm kiếm và huấn luyện AI. Từ chối cái này đồng nghĩa với việc bạn từ chối cả cái kia.

Hôm nay, Cloudflare công bố cài đặt mới "Disallow AI Training" (Từ chối huấn luyện AI), cho phép bạn dễ dàng duy trì khả năng lập chỉ mục cho tìm kiếm trong khi vẫn từ chối việc trình thu thập đó sử dụng nội dung của bạn để huấn luyện. Apple, Google và Microsoft đã tôn trọng hoặc cam kết (trong một khung thời gian cụ thể) sẽ tôn trọng cài đặt này.

Các trình thu thập dữ liệu đa năng là phần khó khăn nhất của vấn đề huấn luyện. Tiếp theo là các bản tóm tắt AI (AI Summaries). Việc chọn "có" hoặc "không" cho toàn bộ trang web là quá thô sơ: lượng nội dung của bạn xuất hiện trong bản tóm tắt quan trọng không kém việc nó có xuất hiện hay không. Tùy chọn từ chối (opt-out) cho các bản tóm tắt AI đã là một trong những yêu cầu chúng tôi đặt ra cho các đơn vị vận hành trình thu thập dữ liệu đa năng. Đến đầu năm sau, mục tiêu của chúng tôi là cho phép bạn kiểm soát lượng nội dung được đưa vào — thiết lập một lần trên Cloudflare thay vì phải thực hiện riêng lẻ với từng đơn vị vận hành.

Tại sao việc yêu cầu thôi là chưa đủ

Hầu hết các chủ sở hữu trang web đều muốn được tìm thấy: bởi con người, các tác nhân (agents) và các bot (tốt). Tuy nhiên, một phần đáng kể của Internet mở được tài trợ bởi quảng cáo, đăng ký hoặc mối quan hệ trực tiếp với khách truy cập, và các mô hình đó chỉ tạo ra doanh thu khi có người thực sự ghé thăm.

Hầu như mọi chủ sở hữu trang web đều coi Tìm kiếm là có lợi: chưa đến 1% các trang web trên Cloudflare chọn chặn các bot Tìm kiếm. Tuy nhiên, huấn luyện lại là một câu chuyện khác: 17% các trang web chọn kích hoạt một cơ chế nào đó để chặn huấn luyện. Đây chính là lý do tại sao chúng tôi quyết định rằng các chủ sở hữu trang web cần những biện pháp kiểm soát chi tiết hơn, thay vì một giải pháp "Chặn AI" áp dụng cho tất cả.

Chỉ riêng chỉ thị trong robots.txt không thể giải quyết vấn đề này. Bất kỳ ai cũng có thể xuất bản một chỉ thị, nhưng nó không thể xác định ai đang thu thập dữ liệu, xác định lý do họ thu thập, hoặc ngăn chặn một trình thu thập phớt lờ nó.

Tuy nhiên, một mạng lưới có thể giải quyết vấn đề này: chúng tôi công bố tùy chọn ưu tiên, xác định ai đang thu thập dữ liệu, phân loại lý do họ thu thập và chặn những bên phớt lờ các quy định đó – sau đó báo cáo những gì mỗi đơn vị vận hành thực sự làm trên Radar.

Nhưng việc chặn chỉ loại bỏ một trình thu thập dữ liệu, chứ không thay đổi cách hành xử của chúng. Kết quả tốt hơn là các đơn vị vận hành không bắt bạn phải lựa chọn ngay từ đầu. Vì vậy, kể từ tháng 7, chúng tôi đã làm việc trực tiếp với họ. Phản hồi rất đáng khích lệ: hầu hết đều đồng ý rằng chủ sở hữu trang web nên có quyền kiểm soát và sự minh bạch về cách nội dung của họ được sử dụng, cũng như được đảm bảo rằng các lựa chọn của họ sẽ được tôn trọng. Để giúp các chủ sở hữu trang web hiểu rõ điều đó, chúng tôi đã tạo ra một danh hiệu: "Accountable" (Có trách nhiệm).

Danh hiệu "Accountable" công nhận cả các khả năng hiện có và những cam kết cụ thể để thực hiện chúng. Để đạt tiêu chuẩn, một đơn vị vận hành bot phải đáp ứng hoặc cam kết đáp ứng các yêu cầu sau:

Apple, Google và Microsoft đều chứng minh rằng họ đáp ứng các tiêu chuẩn để trở thành "Accountable". Mỗi công ty kết hợp các khả năng hiện có với các cam kết có thời hạn cho những tính năng vẫn đang trong quá trình phát triển. Chi tiết về trình thu thập dữ liệu của từng công ty này được chia sẻ bên dưới.

Các tùy chọn cài đặt bảo mật mới

Cloudflare phân loại bot theo hành vi, và một bot đơn lẻ có thể thể hiện nhiều hơn một hành vi. Ba hành vi có sẵn để kiểm soát bao gồm:

Trình thu thập dữ liệu đa năng là một trình thu thập duy nhất thực hiện cả Tìm kiếm và Huấn luyện. Nếu không có các biện pháp kiểm soát, sự kết hợp đó tạo ra sự đánh đổi đã mô tả ở trên: chủ sở hữu trang web không thể từ chối một mục đích sử dụng mà không từ chối mục đích còn lại.

Để tránh việc phải chặn các trình thu thập dữ liệu đa năng "Accountable" — những bên không ép buộc chủ sở hữu trang web phải đánh đổi — chúng tôi giới thiệu một cài đặt mới: Disallow AI Training. Disallow AI Training được đặt tên theo chỉ thị "Disallow:" mà nó xuất bản trong tệp robots.txt của bạn.

Cài đặt "Block" (Chặn) giờ đây mang ý nghĩa khác

Các tùy chọn "Block" và "Block on pages with ads" (Chặn trên các trang có quảng cáo) trước đây không áp dụng cho các trình thu thập dữ liệu đa năng vì việc chặn chúng có thể ảnh hưởng đến khả năng hiển thị trên tìm kiếm. Giờ đây, với cài đặt Disallow AI Training mới, "Block" và "Block on pages with ads" sẽ áp dụng cho tất cả các trình thu thập dữ liệu huấn luyện, bao gồm cả các trình thu thập đa năng.

Các biện pháp kiểm soát Huấn luyện, Tìm kiếm và Tác nhân (Agent) được áp dụng ở cấp độ tên miền. Với việc bổ sung Disallow AI Training, các cài đặt khả dụng bao gồm:

Disallow AI Training hoạt động bằng cách xuất bản một tùy chọn ưu tiên trong robots.txt. Một tùy chọn chỉ dành cho quảng cáo không thể được thể hiện theo cách đó: Cloudflare có thể phát hiện trang nào phục vụ quảng cáo, nhưng danh sách đó quá lớn và thay đổi quá thường xuyên để liệt kê trong robots.txt. Đó là lý do tại sao không có tùy chọn Disallow AI Training trên các trang có quảng cáo.

Các tác nhân (Agents) không tạo ra sự đánh đổi về khả năng hiển thị tìm kiếm giống như các trình thu thập dữ liệu đa năng, và Internet hiện chưa có một chỉ thị chuẩn mực nào để thể hiện các tùy chọn Disallow cho các tác nhân. Hiện tại, chúng tôi chưa đưa vào cài đặt Disallow cho các Agents. Khi các tiêu chuẩn như ai-prefs hoàn thiện hơn, chúng tôi sẽ xem xét lại phương pháp này.

Điều gì thay đổi vào ngày 15 tháng 9?

Chúng tôi thực hiện các thay đổi sau đối với Bot Management và AI Crawl Control:

Bạn cần làm gì?

Hầu như không cần làm gì cả. Các cài đặt hiện tại của bạn sẽ tự động được chuyển đổi.

Nếu bạn muốn loại bỏ hoàn toàn các trình thu thập dữ liệu đa năng, giờ đây bạn phải chọn điều đó. Hãy chọn Block. Nó sẽ ngăn Applebot, Bingbot và Googlebot truy cập vào trang web của bạn — bao gồm cả việc tìm kiếm.

Các tên miền hiện có chưa từng sử dụng các biện pháp kiểm soát Tìm kiếm/Huấn luyện/Tác nhân

Các chủ sở hữu trang web chưa từng cấu hình các biện pháp kiểm soát chi tiết hơn sẽ được chuyển sang các cài đặt mới dựa trên cài đặt "Block AI Bots" cũ của họ:

Các tên miền hiện có đã từng cấu hình các biện pháp kiểm soát Tìm kiếm/Huấn luyện/Tác nhân

Đối với các tên miền đã cấu hình các biện pháp kiểm soát chi tiết, chúng tôi sẽ bảo toàn hiệu quả thực tế từ các lựa chọn của họ theo các định nghĩa mới. Các lựa chọn Huấn luyện trước đây là "Block" hoặc "Block on pages with ads" sẽ được chuyển sang "Disallow AI Training".

Khuyến nghị cho các tên miền mới

Bắt đầu từ ngày 15 tháng 9, khách hàng đăng ký tên miền mới sẽ được cung cấp một trong hai cấu hình cài sẵn, tùy thuộc vào việc trang web có kiếm tiền từ quảng cáo hay không. Doanh thu quảng cáo phụ thuộc vào việc con người thực sự nhìn thấy trang đó. Huấn luyện thay thế lượt truy cập đó bằng một câu trả lời; các tác nhân tìm nạp trang mà không có ai ở đó để xem quảng cáo. Vì vậy, các cấu hình cài sẵn cho các trang web có quảng cáo sẽ hạn chế hơn. Bạn có thể thay đổi bất kỳ cài đặt nào trong số này trong quá trình đăng ký hoặc bất kỳ lúc nào sau đó.

Các cài đặt được khuyến nghị cho tên miền mới.

Điều này có ý nghĩa gì đối với các trình thu thập dữ liệu đa năng cụ thể?

Applebot, Bingbot và Googlebot đều là "Accountable". Apple, Google và Microsoft đều cam kết tuân thủ các nguyên tắc về lựa chọn của nhà xuất bản và sự minh bạch. Với Disallow AI Training, họ vẫn có thể tiếp tục thu thập dữ liệu trang web của bạn cho mục đích tìm kiếm. Việc chọn Block sẽ ngăn chặn họ hoàn toàn.

Chúng tôi cũng phân loại các trình thu thập dữ liệu liên quan từ Amazon, Anthropic, Meta và OpenAI là "Accountable". Các tổ chức này tách biệt trình thu thập dữ liệu Tìm kiếm và Huấn luyện của họ, vì vậy Cloudflare có thể chặn trình thu thập Huấn luyện mà không ảnh hưởng đến tìm kiếm.

Applebot

Applebot cho phép chủ sở hữu trang web từ chối huấn luyện bằng cách thêm quy tắc Disallow vào robots.txt cho "Applebot-Extended". Chủ sở hữu trang web hiện cũng có thể thể hiện tùy chọn cho các bản tóm tắt AI (AI Summaries) thông qua chỉ thị nosnippet trong HTML của trang. Nội dung cũng có thể được gắn nhãn là nội dung trả phí (paywalled) để loại trừ khỏi kết quả tạo nội dung. Applebot hiện chưa cung cấp công cụ kiểm tra ở cấp độ URL. Tuy nhiên, chúng tôi đã gặp gỡ đội ngũ của họ và họ đã chia sẻ chi tiết về giải pháp đang được phát triển cho năm tới. Apple cũng tuyên bố rằng việc từ chối huấn luyện không ảnh hưởng đến thứ hạng tìm kiếm.

Googlebot

Googlebot cho phép chủ sở hữu trang web từ chối huấn luyện bằng cách thêm quy tắc Disallow vào robots.txt cho "Google-Extended", và họ cung cấp một nút gạt trong cổng thông tin quản trị web để loại trừ nội dung của trang web khỏi kết quả tìm kiếm tạo nội dung. Googlebot cũng cung cấp cho chủ sở hữu trang web các số liệu và báo cáo liên quan đến kết quả tìm kiếm và kết quả tóm tắt AI. Google đã chia sẻ thông tin về các biện pháp kiểm soát hiện có và mới ra mắt, cũng như thông tin về những gì họ đang thực hiện, bao gồm các công cụ minh bạch ở cấp độ URL bổ sung cho chủ sở hữu trang web liên quan đến Google-Extended, dự kiến sẽ ra mắt trong những tuần tới. Google cũng tuyên bố rằng việc từ chối Google-Extended không ảnh hưởng đến thứ hạng tìm kiếm.

CloudflareAIBản quyềnSEODữ liệu
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Cloudflare Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.