Sản phẩm
Cloudflare ra mắt tính năng mới giúp kiểm soát lưu lượng truy cập của AI theo mục đích sử dụng
(giờ Việt Nam)
Tóm tắt AI
Cloudflare cung cấp cho chủ sở hữu website các tùy chọn mới để quản lý bot AI dựa trên ba mục đích cụ thể: lập chỉ mục tìm kiếm, tác vụ đại lý (agent) và huấn luyện mô hình.
Bản dịch AI
2026-07-01
10 phút đọc

Một năm trước, chúng tôi đã công bố Ngày Độc lập Nội dung (Content Independence Day) đầu tiên và cung cấp cho các chủ sở hữu trang web phương tiện để giành lại quyền kiểm soát nội dung của họ. Thỏa thuận giữa các trình thu thập dữ liệu (crawlers) và chủ sở hữu trang web đã tồn tại suốt 30 năm qua — chúng tôi thu thập dữ liệu của bạn, và bạn nhận được lượt truy cập giới thiệu (referrals) — đã không còn đúng nữa. AI đang lấy đi mọi thứ mà không trả lại bất cứ điều gì, tạo ra một mối đe dọa hiện hữu đối với các chủ sở hữu trang web. Vì vậy, chúng tôi đã ra mắt tùy chọn "Chặn AI Bots" chỉ với một cú nhấp chuột, cùng với một thị trường Trả phí theo lượt thu thập (Pay-Per-Crawl).
Rất nhiều thứ đã thay đổi trong một năm qua. Tháng 7 năm ngoái, các cuộc thảo luận xung quanh "AI bots" tập trung vào việc chặn đào tạo AI mà không được bồi thường, chỉ ra một thỏa thuận "được ăn cả, ngã về không" khi nội dung được sử dụng để đào tạo mô hình mà không mang lại giá trị nào cho chủ sở hữu trang web. Nhưng một mong muốn về sự tinh tế hơn đã xuất hiện: Các chủ sở hữu nội dung vẫn muốn có khả năng bảo vệ nội dung của họ, và họ xứng đáng được đền bù cho nội dung gốc mà họ đã dày công tạo ra, biên tập và chia sẻ. Chúng tôi cũng hiểu rằng việc khóa chặt nội dung không phải là giải pháp "một kích cỡ cho tất cả"; các chủ sở hữu trang web muốn có nhiều lựa chọn hơn thay vì phải dùng đến cách "chặn mọi tự động hóa, mọi lúc".
Nếu bạn điều hành một trang web nhỏ, vấn đề không chỉ là việc ai đó có thể đào tạo mô hình trên nội dung của bạn — mà là việc không ai có thể tìm thấy bạn ngay từ đầu. Vì vậy, bạn phải thực hiện một thỏa thuận kiểu "bán linh hồn cho quỷ dữ": hoặc xuất hiện trên tìm kiếm và để AI đào tạo trên dữ liệu của bạn, hoặc chấp nhận rủi ro mất khả năng hiển thị. Điều này tạo lợi thế không công bằng cho các nhà cung cấp tìm kiếm hiện tại nếu họ sử dụng cùng một loại bot cho cả tìm kiếm và đào tạo; và lợi thế không công bằng này thúc đẩy các đối thủ mới phải tìm cách lách luật khi họ cố gắng thu hẹp khoảng cách cạnh tranh.
Giờ đây, AI có thể là bất cứ thứ gì
Ngày nay, AI có thể hiện diện trong mọi thứ. Tìm kiếm của Google đã thay đổi từ việc được sắp xếp bởi AI sang trở thành một công cụ trả lời toàn diện, giải đáp câu hỏi của bạn trực tiếp trên trang kết quả. Và Google không phải là đơn vị duy nhất ở vị thế này — đây là hướng đi mà "tìm kiếm" đang chuyển mình.
Chúng ta có thể tranh luận về ranh giới của những gì được coi là "AI" ngày nay, chỉ để thấy rằng tiêu chuẩn đó sẽ thay đổi vào ngày mai. Vì vậy, thay vì định nghĩa một bot chủ yếu là "AI" hay không, cách tiếp cận phân loại cập nhật của chúng tôi sẽ đặt ra những câu hỏi sâu sắc hơn về hành vi của bot hoặc tác nhân (agent): Chúng đang làm gì trên trang web của tôi? Chúng đang lưu trữ những gì? Và chúng sẽ chia sẻ lại nội dung của tôi như thế nào?
Một hệ thống phân loại thực dụng
Để giải quyết những câu hỏi này, chúng ta cần một cái nhìn tinh tế hơn — một hệ thống phân loại thực dụng phù hợp với các trường hợp sử dụng AI mà khách hàng của chúng tôi quan tâm. Vì vậy, chúng tôi đang mở rộng cuộc thảo luận vượt ra ngoài việc đào tạo AI đơn thuần và tập trung vào ba trường hợp sử dụng AI mà chúng tôi muốn tất cả khách hàng có thể quản lý:
Tìm kiếm (Search): bất kỳ hành vi nào thu thập hoặc lập chỉ mục nội dung của bạn để sau đó có thể trả lời các câu hỏi về nội dung đó. Điểm mấu chốt là Tìm kiếm đang chủ động xây dựng cơ sở dữ liệu về trang web của bạn để phản hồi các truy vấn sau này. Chủ sở hữu trang web nên nhận được lưu lượng truy cập giới thiệu hoặc các hình thức đền bù công bằng khác từ việc này.
Tác nhân (Agent): hành vi tự động thay mặt một người thực hiện các thao tác, thường là trong thời gian thực, để hoàn thành công việc ngay lập tức. Điều này bao gồm các bot trò chuyện (ví dụ: ChatGPT-User) và các tác nhân sử dụng trình duyệt (ví dụ: Gemini hoặc Claude điều khiển Chrome). Điểm mấu chốt là nó truy cập vào ứng dụng web của bạn để hoàn thành một công việc, và thường có một con người đang chờ đợi ở đầu bên kia.
Đào tạo (Training): một trình thu thập dữ liệu lấy nội dung của bạn để đào tạo hoặc tinh chỉnh một mô hình. Điểm mấu chốt là dữ liệu của bạn được hấp thụ vĩnh viễn vào kiến trúc nền tảng của AI để cải thiện khả năng của nó.
Nhiều trình thu thập dữ liệu phổ biến trên web thuộc về một trong các phân loại trên; một số thuộc về nhiều loại. Chúng tôi phân loại rất nhiều hành vi khác ngoài ba loại trên — bao gồm xác minh quảng cáo, lấy nguồn cấp dữ liệu (feed fetching) và các giao dịch tác nhân (sẽ nói thêm về điều này bên dưới). Nhưng chúng tôi tin rằng việc quản lý quyền truy cập cho ba trường hợp sử dụng tập trung vào AI này nên đơn giản đối với tất cả chủ sở hữu trang web. Chúng tôi tin rằng các nhà vận hành bot nên tách biệt các trình thu thập dữ liệu của họ vì điều đó tạo ra sự minh bạch hơn cho chủ sở hữu trang web: cho phép họ hiểu rõ hơn lý do tại sao một trình thu thập dữ liệu cụ thể lại ghé thăm họ, cũng như quản lý tốt hơn quyền truy cập mà họ cấp cho trình thu thập đó. Nếu một công ty vận hành các hệ thống tự động hóa để xây dựng chỉ mục Tìm kiếm, đóng vai trò là Tác nhân và thu thập dữ liệu để Đào tạo mô hình của họ, thì chúng tôi đặc biệt khuyến khích công ty đó tách biệt các hệ thống tự động hóa thành ba trình thu thập dữ liệu riêng biệt.
Chúng tôi muốn một hệ thống phân loại có khả năng mở rộng và đại diện cho thế giới lưu lượng truy cập tự động khi nó phát triển. Việc theo dõi mục đích của bot không phải là điều mới mẻ, nhưng hệ thống phân loại mới của chúng tôi bao gồm một vài cập nhật phản ánh chính xác hơn trạng thái của lưu lượng truy cập bot hiện nay. Đáng chú ý nhất, chúng tôi muốn ghi nhận rằng các bot có nhiều mục đích nên được theo dõi với tất cả các mục đích đó, thay vì chỉ một.
Các tùy chọn mới để quản lý lưu lượng truy cập AI
Chúng tôi muốn cung cấp nhiều tùy chọn hơn để quản lý các loại lưu lượng truy cập AI khác nhau cho tất cả chủ sở hữu trang web trên mạng lưới Cloudflare.
Cài đặt sẵn "Chặn AI bots" mà chúng tôi đã công bố trước đây bao gồm các bot đơn mục đích thu thập dữ liệu để đào tạo mô hình, như hiển thị bên dưới:
Ảnh chụp màn hình cài đặt hiện tại để quản lý lưu lượng truy cập AI bot vào ngày 1 tháng 7 năm 2025.
Nhưng không phải việc sử dụng AI nào cũng giống nhau, và chúng tôi muốn khách hàng của mình có các quyền kiểm soát mà họ cần. Vì vậy, chúng tôi đang ra mắt khả năng quản lý lưu lượng truy cập AI dựa trên ba trường hợp sử dụng chính: trình thu thập Tìm kiếm, Tác nhân và Đào tạo. Với các tùy chọn mới này, khách hàng của chúng tôi có thể tinh chỉnh cách họ quản lý lưu lượng truy cập AI bot — bao gồm cả khách hàng ở gói Miễn phí (Free tier).
Ảnh chụp màn hình các tùy chọn mới để quản lý lưu lượng truy cập AI bot vào ngày 1 tháng 7 năm 2026.
Thiết lập các mặc định mới
Vào ngày 15 tháng 9 năm 2026, chúng tôi sẽ thiết lập các mặc định mới cho từng phân loại trong ba loại này. Đối với tất cả các tên miền mới tham gia Cloudflare, các danh mục Đào tạo và Tác nhân sẽ bị chặn theo mặc định trên các trang hiển thị quảng cáo, trong khi Tìm kiếm vẫn sẽ được cho phép theo mặc định.
Quảng cáo là tín hiệu cho thấy chủ sở hữu trang web muốn con người truy cập vào đó và xem nó — một thứ có thể kiếm tiền để duy trì doanh nghiệp. Vì vậy, trên các trang đó, chúng tôi coi sự chú ý của con người là mục tiêu cuối cùng và ngăn chặn các bot có thể cản trở sự chú ý này (tức là các bot Đào tạo và Tác nhân). Mặt khác, Tìm kiếm là hành vi dẫn dắt khách truy cập quay lại một cách tự nhiên nhất, và chúng tôi tin rằng việc cho phép điều này là vì lợi ích của hầu hết các chủ sở hữu trang web.
Một thay đổi khác sẽ áp dụng vào ngày 15 tháng 9 là các trình thu thập dữ liệu đa mục đích (đặc biệt là những trình kết hợp Tìm kiếm với Đào tạo) sẽ được cho phép/chặn theo tất cả các hành vi của chúng, phù hợp với lời kêu gọi của chúng tôi về sự minh bạch cho chủ sở hữu trang web. Vì các mặc định sẽ được thực thi bởi các quy tắc hạn chế nhất, các trình thu thập đa mục đích như Googlebot, Applebot và BingBot sẽ bị chặn bởi những khách hàng đã chọn chặn Đào tạo (thông qua các tùy chọn mới để quản lý lưu lượng truy cập AI hoặc thông qua dịch vụ Chặn AI bots cũ).
Tất nhiên, lựa chọn của khách hàng là tối quan trọng: nếu chủ sở hữu trang web muốn từ chối các cấu hình mặc định mới này, họ có thể dễ dàng đánh dấu điều này trong cài đặt Bảo mật bất kỳ lúc nào trước ngày 15 tháng 9, điều này sẽ xác nhận rằng họ không muốn thay đổi đối với các trình thu thập Đào tạo cũng thu thập dữ liệu cho mục đích Tìm kiếm. Chúng tôi cũng sẽ tiếp tục thông báo cho khách hàng về thay đổi sắp tới đối với các mặc định khi đến gần ngày 15 tháng 9 để đảm bảo rằng những khách hàng muốn chọn cài đặt khác với mặc định có cơ hội thực hiện điều đó.
BotBase: một tầng hiển thị mới cho khách hàng Doanh nghiệp (Enterprise)
Chúng tôi cũng rất vui mừng được ra mắt một bản cập nhật hiển thị quan trọng như một tính năng mới của Quản lý Bot Doanh nghiệp (Enterprise Bot Management). Khi danh mục các bot được theo dõi của Cloudflare phát triển, nhu cầu quản lý các bot này theo các nhóm hợp lý và hiểu chi tiết hơn về một bot cụ thể cũng tăng theo.
Giới thiệu BotBase. BotBase là cơ sở dữ liệu mới của chúng tôi để theo dõi tất cả các bot đã biết, bao gồm các bot và tác nhân đã được xác minh (Verified). Cơ sở dữ liệu này cung cấp một cái nhìn toàn diện, có thể tìm kiếm được về toàn bộ danh mục bot của chúng tôi, trực tiếp trên bảng điều khiển Cloudflare. Chúng tôi đang giải quyết vấn đề hiển thị trước, nhưng vào cuối năm nay, chúng tôi sẽ mở rộng BotBase để cung cấp một trung tâm điều khiển trực tiếp cho các nội dung tự động đã biết trên trang web của bạn.
Với chế độ xem mới này, khách hàng Quản lý Bot Doanh nghiệp có thể thấy toàn bộ danh mục tất cả các bot/tác nhân đã xác minh và vị trí của chúng trong hệ thống phân loại cập nhật này — một chế độ xem mà chúng tôi chưa từng hiển thị động trên bảng điều khiển Cloudflare trước đây. Những khách hàng muốn nhắm mục tiêu chính xác vào một bot cụ thể cũng có thể dễ dàng lọc tất cả lưu lượng truy cập từ bot này, cộng với việc sao chép ID phát hiện để sử dụng trong các quy tắc Bảo mật. Tất cả những điều này hiện đã hoạt động trong một trang chuyên dụng, có thể truy cập thông qua thẻ cấu hình Quản lý Bot.
Khi xây dựng BotBase, chúng tôi muốn tính đến tất cả các thông tin cho phép chúng tôi xây dựng những hiểu biết mạnh mẽ, có thể mở rộng từ bot này sang bot khác. Một trong những yếu tố đó là nền tảng cho hệ thống phân loại cập nhật của chúng tôi, dựa trên những gì một bot có thể làm trên trang web của bạn — hành vi của nó. Chúng tôi tách biệt các phân loại này như chia sẻ dưới đây, và mỗi bot được phân loại với một hoặc nhiều hành vi này.
Phân loại bot
Hành vi và mục đích sử dụng
Tìm kiếm (Search)
Thu thập dữ liệu để quét trang web của bạn nhằm giúp nó xuất hiện trong kết quả của công cụ tìm kiếm
Tác nhân (Agent)
Các tác nhân do người dùng điều hướng ghé thăm một trang thay mặt cho con người
Đào tạo (Training)
Thu thập dữ liệu để đào tạo hoặc tinh chỉnh các mô hình
Ý chính từ bài gốc
- Phân loại bot AI thành 3 nhóm: Tìm kiếm, Tác nhân và Đào tạo để quản lý linh hoạt.
- Từ 15/9/2026, các trang có quảng cáo sẽ chặn mặc định bot Đào tạo và Tác nhân.
- Khuyến khích các nhà vận hành bot tách biệt trình thu thập dữ liệu theo mục đích sử dụng.
- Ra mắt BotBase giúp khách hàng doanh nghiệp theo dõi và kiểm soát chi tiết các loại bot.
- Mọi khách hàng, kể cả gói miễn phí, đều có quyền truy cập vào các tùy chọn quản lý mới.
Bài viết được AI dịch và tổng hợp tự động từ The Cloudflare Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.