Cloudflare Blog
85

Sản phẩm

Cloudflare ra mắt Bot Preference Sync: Quản lý quyền truy cập của AI bot dễ dàng hơn

(giờ Việt Nam)

Tóm tắt AI

Tính năng mới của Cloudflare tự động đồng bộ hóa tệp robots.txt với các chính sách AI bot, giúp bạn kiểm soát quyền truy cập nội dung mà không cần chỉnh sửa thủ công.

Bản dịch AI

Say it once: introducing Bot Preference Sync

Chúng tôi không ngừng xây dựng các giải pháp nhằm đáp ứng những mục tiêu khác nhau của khách hàng. Một số khách hàng muốn tối ưu hóa khả năng khám phá (discovery), trong khi những người khác lại muốn bảo vệ nội dung của mình bằng các chính sách bảo mật nghiêm ngặt nhất. Giữa những chính sách khác biệt này, có nhiều cách để giảm thiểu lưu lượng truy cập từ bot. Một số cơ chế chỉ đơn thuần nêu rõ tùy chọn của bạn, dựa trên giả định rằng các trình thu thập dữ liệu (crawler) sẽ hành xử thiện chí, trong khi các phương pháp khác thực sự khóa nội dung bằng cách chặn hoàn toàn thông qua giải pháp Bot Management.

Chúng tôi hiểu rằng việc duy trì nhiều lớp bảo vệ trên trang web là một công việc rườm rà. Ví dụ, có những trường hợp tệp robots.txt của bạn quy định rằng một crawler bị "Disallowed" (không được phép) truy cập trang web, nhưng các quy tắc thực thi của bạn lại không thực sự chặn crawler đó. Khi các tùy chọn bạn đặt ra và các quy tắc thực thi không đồng nhất, một số crawler sẽ coi đó là cơ sở để phớt lờ tùy chọn của bạn hoặc cố gắng vượt qua các quy tắc thực thi đó.

Vài năm trước, Cloudflare đã công bố một cách dễ dàng hơn để từ chối việc huấn luyện AI trên trang web của bạn bằng cách giải quyết hai trong số các lớp này: một giá trị được quản lý trong robots.txt thông báo cho danh sách cố định các crawler huấn luyện (Training crawlers) lớn không được huấn luyện trên nội dung của bạn, cùng với các khối chặn được thực thi tại biên (edge-enforced blocks) đối với các crawler huấn luyện. Vào ngày 1 tháng 7 năm 2026, chúng tôi đã ra mắt các tùy chọn dễ dàng hơn để quản lý các trường hợp sử dụng lưu lượng truy cập AI khác nhau. Bạn có thể quyết định những gì mình muốn đối với lưu lượng truy cập Tìm kiếm (Search), Tác nhân (Agent) và Huấn luyện (Training) trên trang web của mình.

Chúng tôi xin công bố Bot Preference Sync, tính năng khả dụng cho tất cả khách hàng từ gói Free đến Enterprise. Bot Preference Sync phản ánh những gì bạn đã thiết lập trong cấu hình bot AI bằng cách cập nhật các tùy chọn tương ứng vào tệp robots.txt của bạn, và tính năng này có thể được bật hoặc tắt bất cứ lúc nào. Không còn tệp tĩnh cho từng trường hợp sử dụng nữa: chúng tôi sẽ giúp bạn tùy chỉnh tệp robots.txt để phản ánh những gì bạn đã cấu hình cho các danh mục bot AI khác nhau.

Những câu hỏi mới mà Internet đang phải đối mặt

Trong nhiều năm, câu hỏi cấp bách nhất trong lĩnh vực này là: "Nội dung của tôi có đang bị sử dụng để huấn luyện các mô hình AI mà không có sự cho phép của tôi không?" Đây là một câu hỏi quan trọng và nó vẫn chưa hề mất đi tính thời sự. Bên cạnh đó, những câu hỏi mà chúng tôi ngày càng nghe nhiều hơn liên quan đến khả năng khám phá và mức độ tương tác. Làm thế nào để trang web của tôi xuất hiện khi ai đó hỏi trợ lý AI về điều mà trang web của tôi có thể trả lời? Bao nhiêu lưu lượng truy cập của tôi đến từ các crawler AI so với người dùng thật? Nội dung nào thực sự thúc đẩy lượt giới thiệu (referrals) và giá trị của nó là bao nhiêu?

Câu trả lời khác nhau tùy theo mô hình kinh doanh. Khả năng khám phá và tương tác là những vấn đề then chốt, được ưu tiên hàng đầu đối với bất kỳ doanh nghiệp nào đang cố gắng phát triển trên web hiện đại, nhưng các phễu (funnels) cho những vấn đề này lại khác nhau: một cửa hàng thương mại điện tử có thể muốn mọi thứ được thu thập và huấn luyện, để sản phẩm của họ hiển thị khi người mua hàng hỏi chatbot về "chiếc ghế sofa tốt nhất cho căn hộ nhỏ". Một nhà xuất bản kiếm tiền từ quảng cáo trên trang có thể muốn điều ngược lại: vẫn nằm trong chỉ mục tìm kiếm để thu hút độc giả đến trang, nhưng giữ cho các bài viết của mình không bị đưa vào huấn luyện mô hình và quan trọng nhất là có thể xác minh rằng nội dung của họ thực sự không bị sử dụng mà không có sự cho phép.

Không có câu trả lời duy nhất đúng, và đó chính là vấn đề. Các quyền kiểm soát của bạn phải phản ánh chiến lược của bạn, đó là lý do tại sao chúng tôi xây dựng các công cụ để mang lại cho bạn khả năng hiển thị và lựa chọn ở mọi lớp. Bot Preference Sync kết nối những điều này lại với nhau, để tùy chọn bạn đặt ra chính là tùy chọn bạn công bố.

Lời kêu gọi về sự Minh bạch (Transparency)

Vào ngày 1 tháng 7 năm 2026, chúng tôi đã lập luận rằng các crawler đa năng, hay "các bot kết hợp tìm kiếm, sử dụng tác nhân và huấn luyện đằng sau một user agent duy nhất", đã đặt chủ sở hữu trang web vào thế bất lợi vì chúng khiến việc tách biệt những gì bạn muốn và không muốn trở nên khó khăn. Điều đó vẫn đúng, và quan điểm của chúng tôi về sự Minh bạch đối với chủ sở hữu trang web vẫn không thay đổi.

Nhưng có nhiều cách để tiếp cận sự Minh bạch. Chúng tôi muốn khen thưởng những nhà vận hành rõ ràng về danh tính và cách họ sử dụng dữ liệu mà họ thu thập. Vì mục đích Xác minh (Verification) bot, chủ sở hữu của các bot thực hiện cả Tìm kiếm và Huấn luyện sẽ cần cung cấp thêm thông tin để không bị chặn khi tùy chọn "Disallow Training" (Từ chối huấn luyện) được thiết lập. Các yêu cầu đó bao gồm:

Các bot của những mô hình AI và nhà cung cấp dịch vụ hàng đầu đáp ứng các tiêu chí này sẽ được theo dõi công khai trong phần minh bạch bot AI trên Cloudflare Radar, bao gồm cả các ví dụ về việc thực hành tốt nhất được tôn trọng cũng như khi nào chúng không được thực hiện. Các crawler không cung cấp sự Minh bạch sẽ không nhận được sự ưu ái — chúng vẫn bị chặn khi bạn từ chối huấn luyện. Nói cách khác, đây là cách để biến sự Minh bạch thành "cái giá" để được truy cập.

Giới thiệu Bot Preference Sync

Bot Preference Sync là một tính năng mới giúp tệp robots.txt của bạn luôn phản ánh các tùy chọn bot AI mà bạn đã thiết lập cho Tìm kiếm, Tác nhân và Huấn luyện trên bảng điều khiển cấp vùng (zone-level) của Cloudflare. Nếu chủ sở hữu trang web đã có tệp robots.txt, nội dung được thêm bởi Bot Preference Sync sẽ được đặt lên trước nội dung hiện có, vì vậy mọi chỉ thị Disallow hiện tại vẫn được duy trì.

Thay vì chủ sở hữu trang web phải duy trì một tệp tĩnh riêng biệt, Cloudflare sẽ tạo hoặc cập nhật tệp robots.txt dựa trên cấu hình của bạn, nhờ đó những gì bạn thông báo với thế giới và những gì bạn thực thi tại biên luôn được đồng bộ.

Đối với Tìm kiếm và Tác nhân, ba tùy chọn mà chúng tôi đã công bố vào ngày 1 tháng 7 vẫn giữ nguyên: Cho phép (Allow), Chặn trên các trang có quảng cáo (Block on pages that serve ads), hoặc Chặn mọi nơi (Block everywhere). Đối với Huấn luyện, chúng tôi đang tinh chỉnh tùy chọn để ngăn nội dung của bạn bị sử dụng cho việc huấn luyện mô hình với tùy chọn Disallow:

Disallow: một tùy chọn "không huấn luyện" được ghi vào tệp robots.txt của bạn, để các crawler đa năng hợp tác — những bên thực hiện bước Minh bạch bổ sung — vẫn có thể truy cập nội dung của bạn để lập chỉ mục tìm kiếm, vì họ cho phép chủ sở hữu trang web xác minh trực tiếp cách dữ liệu của họ được sử dụng. Các crawler hợp tác sẽ tôn trọng các tùy chọn trong robots.txt và khả năng hiển thị Tìm kiếm của bạn đối với các crawler hợp tác này sẽ không bị ảnh hưởng.

Hãy lấy ví dụ dưới đây, trong đó một người đã cấu hình chính sách bot AI của họ là "Cho phép Tìm kiếm, Cho phép Tác nhân, Từ chối Huấn luyện" (Allow Search, Allow Agents, Disallow Training).

Vì trang web ví dụ này đã bật Bot Preference Sync, tệp robots.txt của họ sẽ thêm vào phần đầu những nội dung tương tự như sau (đã được rút gọn và ẩn danh để làm ví dụ):

Chúng tôi sẽ sử dụng các bot mà chúng tôi theo dõi trong BotBase để cập nhật định kỳ danh sách các bot được thêm vào robots.txt khi bạn chọn Chặn hoặc Từ chối một danh mục nhất định. Các bot đã được Xác minh (Verified) được phân loại là Tìm kiếm, Tác nhân và Huấn luyện có thể được xem bất cứ lúc nào trong danh mục bot công khai của chúng tôi.

Đối với tất cả khách hàng mới, Bot Preference Sync sẽ được bật theo mặc định để giúp việc quản lý các khối chặn và tùy chọn phản ánh cùng một chính sách trở nên dễ dàng hơn. Đối với các khách hàng hiện tại đang sử dụng tính năng robots.txt được quản lý cũ, chúng tôi sẽ nhắc bạn xem xét và xác nhận các tùy chọn của mình để chuyển sang Bot Preference Sync mới khi tính năng này ra mắt.

Một số khách hàng có thể muốn hoặc cần chủ động hơn trong việc nêu rõ các tùy chọn của họ, ví dụ như nếu họ có thỏa thuận đặc biệt với một công ty nhất định mà họ muốn cấp ngoại lệ. Vì Bot Preference Sync được thiết kế để giải quyết các quyết định chính sách theo danh mục thay vì từng trường hợp cụ thể, nó sẽ không đọc trực tiếp từ các quy tắc tùy chỉnh riêng lẻ với logic phức tạp hơn. Khách hàng có chính sách bảo mật được tinh chỉnh kỹ lưỡng luôn có tùy chọn tắt tính năng đồng bộ hóa các chính sách nhóm và tự tùy chỉnh tệp của mình để phù hợp với chính sách riêng.

Chúng tôi cũng đang thực hiện một thay đổi cho phép các nhà xuất bản hoặc các trang web hỗ trợ quảng cáo có tùy chọn mặc định khác với các chủ sở hữu trang web khác. Chúng tôi đã tạo một tùy chọn mặc định để giúp các trang web xuất bản dựa vào quảng cáo và mong đợi quảng cáo đó chỉ dành cho khách truy cập là con người. Tại thời điểm bắt đầu sử dụng, những khách hàng như vậy có thể chọn tùy chọn "Tôi kiếm tiền từ các trang có quảng cáo trên tên miền này", tùy chọn này sẽ đặt Huấn luyện thành Disallow theo mặc định. (Khách hàng có quyền thay đổi cài đặt này bất cứ lúc nào.) Bằng cách này, bạn vẫn giữ được khả năng tìm kiếm trong khi ngăn nội dung của mình bị đưa vào huấn luyện mô hình.

Đối với trường hợp không phải là nhà xuất bản, khách hàng mới sẽ không có bất kỳ khối chặn hoặc từ chối nào được thêm vào theo mặc định khi họ thêm tên miền: lựa chọn hoàn toàn thuộc về khách hàng. Bạn có thể chọn chặn Tìm kiếm, Tác nhân hoặc Huấn luyện bất cứ lúc nào, nhưng điểm khởi đầu sẽ không thêm bất kỳ khối chặn nào thay cho bạn.

Tiếp theo là gì?

Bot Preference Sync sẽ khả dụng cho tất cả khách hàng, trên mọi gói dịch vụ, trong tuần tới. Hãy theo dõi nhật ký thay đổi (changelog) của chúng tôi để biết tính khả dụng, và để mắt đến bảng điều khiển (cũng như hộp thư đến) của bạn để nhận thông báo xác nhận các tùy chọn!

Đây là một bước trong nỗ lực dài hạn. Chúng tôi sẽ tiếp tục làm việc với các nhà vận hành bot lớn để đảm bảo rằng chúng tôi không thỏa hiệp với những thách thức quen thuộc (như huấn luyện mà không có sự đồng ý) cũng như các câu hỏi mới nổi (như khả năng khám phá và tương tác). Nằm dưới tất cả những điều đó là nỗ lực của chúng tôi nhằm thúc đẩy sự Minh bạch và quyền kiểm soát lớn hơn cho các chủ sở hữu trang web.

CloudflareAI BotQuản trị webBảo mật AISEO
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Cloudflare Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.