Cloudflare Blog
85

Sản phẩm

Cloudflare định nghĩa lại cách nhận diện hành vi của AI và bot trên Internet

(giờ Việt Nam)

Tóm tắt AI

Cloudflare chuyển đổi từ đánh giá rủi ro tĩnh sang đánh giá độ tin cậy liên tục để phân biệt hành vi của bot và con người. Người dùng có thể trải nghiệm công cụ Precursor Trace để kiểm tra xem cách di chuyển chuột của mình được hệ thống nhận diện như thế nào.

Bản dịch AI

Unveiling good and bad behaviors on the Agentic Internet

Internet không phải là một làn đường giao thông duy nhất. Trong một thời gian dài, quy tắc chung trong bảo mật web là bot thì xấu, còn con người thì tốt. Tất nhiên, chúng ta đã vượt xa sự khái quát hóa này. Con người có thể gian lận, và bot có thể hữu ích ở nhiều cấp độ khác nhau. Các chủ sở hữu trang web chủ động muốn một số lưu lượng truy cập tự động tương tác với trang web của họ để làm cho Internet hoạt động hiệu quả và dễ khám phá hơn.

Để làm mọi thứ phức tạp hơn, ranh giới giữa "con người" và "bot" đang ngày càng mờ nhạt. Hiện nay, chúng ta có một loại lưu lượng truy cập "lai", nơi một phiên làm việc duy nhất chuyển đổi từ con người sang tác nhân (agentic) và ngược lại. (Hãy nghĩ đến một người dùng đang duyệt cửa hàng, sau đó chuyển quy trình thanh toán cho một trợ lý mua sắm tự động.)

Vậy, các chủ sở hữu trang web quản lý sự phức tạp này như thế nào? Điều quan trọng ở đây là đánh giá hành vi. Hành vi này có mang tính lạm dụng không? Có độc hại không? Rủi ro ở đây là gì, và liệu tôi có thể tin tưởng khách truy cập này dựa trên hành động của họ không? Để giải quyết vấn đề này, cần phải vượt ra ngoài các kiểm tra tĩnh tại một thời điểm. Nó đòi hỏi phải phân tích các hành vi liên tục để đánh giá sự Tin cậy (Trust).

Trong bài viết này, chúng tôi sẽ chia sẻ cái nhìn sâu sắc về chiến lược của nhóm Web Integrity & Trust (bao gồm các không gian vấn đề về bot và gian lận) xung quanh việc phát hiện và phân tích các hành vi tốt và xấu, cung cấp các công cụ giúp chủ sở hữu trang web giải quyết những thách thức mới nổi trong kỷ nguyên Internet Tác nhân (Agentic Internet) đang thay đổi. Chúng tôi cũng sẽ chia sẻ những phát hiện về lưu lượng truy cập tác nhân kể từ khi ra mắt Precursor, và một mô phỏng nơi bạn có thể thấy các chuyển động con trỏ của chính mình sẽ được đánh giá là con người hay bot — cùng với một số cập nhật thú vị sắp ra mắt trong tương lai gần.

Xác định Rủi ro và Sự tin cậy

Hãy nói về sự khác biệt giữa Rủi ro (Risk) và Sự tin cậy (Trust), theo cách chúng tôi thảo luận trong các nhóm tại Cloudflare làm việc về phát hiện bot. Những khái niệm này thường được xem là hai cực đối lập trên một dải liên tục. Tại Cloudflare, chúng tôi coi chúng là những giá trị độc lập nhưng có mối quan hệ tương hỗ. Sự tin cậy là yếu tố thiết yếu để đưa ra các quyết định sáng suốt về việc xử lý lưu lượng truy cập của bạn.

Rủi ro là khả năng một thứ gì đó như yêu cầu hoặc hành động gây hại, và nó thường mang tính nhất thời. Tuy nhiên, sự tin cậy được xây dựng theo thời gian và dựa trên danh tiếng.

Chúng ta có thể minh họa điều này bằng một ví dụ thực tế: giả sử bạn đang xem tivi vào buổi tối ở nhà, thì đột nhiên, bạn nghe thấy tiếng chuông cửa reo liên hồi. Ngoài việc gây khó chịu, hành vi này còn rất lạ. Tiếng chuông cửa dồn dập vào đêm khuya là điều đáng báo động.

Bạn kiểm tra qua camera cửa và thấy người đang bấm chuông là người bạn thân nhất sống ngay cạnh nhà. Tất nhiên, bạn tin tưởng người bạn thân của mình, và chúng tôi cá rằng bạn sẽ để họ vào nhà.

Trong ví dụ này, sẽ không đủ nếu bạn nói: "Từ chối bất kỳ ai bấm chuông cửa nhà tôi vào ban đêm" hoặc "Từ chối bất kỳ ai bấm chuông cửa nhà tôi quá 10 lần". Một lần nữa, Sự tin cậy là yếu tố thiết yếu.

Quay lại với lưu lượng truy cập trên Internet, chiến lược khi chúng tôi xây dựng các sản phẩm trong không gian bot và gian lận tập trung vào việc xây dựng một hệ sinh thái hoàn chỉnh dựa trên Sự tin cậy. Mục tiêu của chúng tôi là cung cấp các động lực và nguyên tắc cơ bản để chủ sở hữu trang web sử dụng nhằm khuyến khích các hành vi giúp Internet an toàn hơn cho mọi người: bắt đầu từ việc chặn các hoạt động độc hại ở cấp độ thấp nhất, đến việc khuyến khích tham gia vào một Internet an toàn hơn ở cấp độ cao nhất.

Các hành vi tốt, bắt nguồn từ sự minh bạch

Bắt đầu từ cấp độ cao nhất: điều gì được coi là hành vi tốt? Chúng ta có thể rút ra những ví dụ rõ ràng từ các bot và tác nhân đã được xác minh (Verified) trong BotBase. Tháng trước, chúng tôi đã công bố một hệ thống phân loại thực dụng cập nhật cho các bot tốt mà chúng tôi theo dõi trong hệ thống của mình, đúc kết định nghĩa về "Đã xác minh" thành hai điều: 1) bạn tự khai báo một cách trung thực, và 2) bạn không lạm dụng sự tin tưởng mà bạn đã đạt được.

Sự minh bạch giữa chủ sở hữu trang web và nhà vận hành bot cho phép tạo ra mối quan hệ cộng sinh: chủ sở hữu trang web có thể ghi chú những hành vi và cách sử dụng dữ liệu nào họ muốn cho phép trên trang web của mình, và nhà vận hành bot có thể được cấp quyền truy cập dễ dàng hơn. Sự minh bạch cho phép tạo ra Sự tin cậy trong mối quan hệ; nếu bạn không có gì để che giấu, việc khai báo bạn là ai sẽ giảm bớt rào cản từ các trang web muốn cho phép hành vi của bạn.

BotBase không chỉ nhằm mục đích tuyên bố "ai là người tốt". Nó được dự định là một danh mục của tất cả các bot và tác nhân đã biết, đồng thời cung cấp các dữ kiện thực tế. So với Bots Directory trước đây của chúng tôi, vốn chỉ bao gồm các bot tốt đã biết, BotBase còn có khả năng theo dõi cả những bot và tác nhân không tốt. Tại sao? Bởi vì hệ thống của chúng tôi theo dõi và xác thực hành vi của các tác nhân tốt đã biết, nghĩa là chúng tôi có các công cụ để xác định khi nào các kỳ vọng này không được đáp ứng. Nếu bạn lạm dụng sự tin tưởng trên mạng lưới Cloudflare, bạn sẽ không dễ dàng được cho phép, vì vậy bạn sẽ bị hủy xác minh.

Các hành vi xấu: trắng trợn, lén lút và mọi thứ ở giữa

Vài tuần trước, chúng tôi đã công bố Precursor, một hệ thống phía máy khách (client-side) liên tục để phát hiện ngay cả lưu lượng truy cập bot phi nhân tính tinh vi, vốn có thể lẩn tránh khi chỉ đánh giá các tín hiệu mạng. Khi khách hàng bật Precursor, tính năng phát hiện bằng JavaScript sẽ được chèn qua CDN, vì vậy không cần phải ngồi trước máy tính để tìm cách chạy lại các phát hiện này. Hơn nữa, Precursor đánh giá hành vi người dùng liên tục trong suốt phiên làm việc, vì vậy không còn "tấm vé thông hành" miễn phí cho lưu lượng truy cập độc hại đã tìm cách vượt qua các kiểm tra phía máy khách và trình duyệt chỉ một lần.

Áp dụng khung Rủi ro và Sự tin cậy của chúng tôi vào các phát hiện phía máy khách này, chúng ta có thể chỉ ra rằng CAPTCHA hoặc các rào cản một lần dựa trên Rủi ro, nghĩa là chúng thiếu ngữ cảnh. Mặt khác, xác minh bằng các dấu hiệu hành vi dựa trên Sự tin cậy, vì nó có thể nắm bắt nhiều manh mối ngữ cảnh hơn từ toàn bộ phiên người dùng. Precursor là công cụ để chúng tôi phân tích hành vi này. Tóm lại, Precursor rất mạnh mẽ vì nó:

Bằng cách làm cho việc vượt qua các phát hiện này trở nên bất lợi về mặt kinh tế đối với các nhà phát triển bot, chúng tôi giành chiến thắng trong cuộc đối đầu này.

Bây giờ, chúng ta đã học được gì kể từ khi ra mắt? Chỉ nhìn vào khoảng thời gian 24 giờ tại thời điểm viết blog này, chúng ta có thể thấy 206 triệu sự kiện đánh giá của Precursor, trên 73.438 vùng (zone) trên mạng lưới Cloudflare.

Chúng ta có thể thấy các mô hình trong dữ liệu tiết lộ những điều mà chúng tôi đã nghi ngờ khi ra mắt tính năng phát hiện, nhưng giờ đây có thể xác thực trên hàng chục nghìn tên miền:

Đối với những ai tò mò muốn tìm hiểu thêm về cách Precursor thực sự hoạt động, chúng tôi đã chia sẻ một cái nhìn thoáng qua — cách các tín hiệu chúng tôi phân tích cho thấy "sai lầm là của con người" (to err is human) — trong bài đăng blog thông báo của chúng tôi. Hôm nay, chúng tôi tiến thêm một bước: cung cấp cho bất kỳ ai trên Internet một bản demo tương tác mô phỏng cách Precursor sẽ theo dõi các chuyển động con trỏ của bạn.

Precursor Trace hiện đã hoạt động, chia sẻ cách chúng tôi đánh giá các chuyển động con trỏ của bạn bằng cách sử dụng (một phần) cơ chế phát hiện của Precursor. Tại đây, bạn có thể thấy liệu mình đang tăng tốc hay tự điều chỉnh, nhịp điệu và kết cấu chuyển động con trỏ của bạn, và nhiều thứ khác — tất cả những điều mà bạn có lẽ chưa bao giờ nghĩ đến với tư cách là một con người thực sự đang tương tác với máy tính. Hãy thử ngay!

Adaptive Intelligence sắp ra mắt

Các công cụ phát hiện bot của Cloudflare có thể tạo ra các kết quả khác nhau khi đánh giá xem một yêu cầu nhất định có phải là tự động hay không. Đối với các yêu cầu được coi là tự động, đánh giá có thể là 1) chắc chắn tự động, dựa trên các phương pháp xác định hoặc dấu vân tay của bot đã được chứng minh, hoặc 2) có khả năng tự động, dựa trên điểm số dự đoán từ Bots ML của Cloudflare.

Trước đây, Bots ML được cập nhật theo phiên bản, nghĩa là chúng tôi công bố mỗi phiên bản mô hình mới như một lần ra mắt sản phẩm. Nhịp độ này không hiệu quả khi các bot thích nghi theo quy mô hàng giờ hoặc thậm chí hàng phút.

Adaptive Intelligence, một công cụ phát hiện hoàn toàn mới, khác biệt với bất kỳ thứ gì chúng tôi từng xây dựng trước đây trong không gian Bots ML. Bản thân mô hình này có tính thích nghi. Nó đã học hỏi từ tất cả những gì chúng tôi thấy trong quá khứ, nhưng quan trọng hơn, nó sẽ tiếp tục học hỏi và tự điều chỉnh dựa trên những gì nó thấy. Adaptive Intelligence sẽ tự nâng cấp dựa trên phạm vi rộng lớn các mô hình lưu lượng truy cập mà chúng tôi xác định, từ hành vi tốt đến xấu, và khách hàng sẽ không còn cần phải nâng cấp lên một phiên bản mô hình chính thức mới để có được các phát hiện bot dự đoán mới nhất.

Tất cả khách hàng sử dụng Bot Management sẽ có quyền truy cập vào Adaptive Intelligence trong tương lai gần — hãy theo dõi thông báo ra mắt sắp tới.

Vượt ra ngoài tính xác định để gây ảnh hưởng đến hành vi của bot

Cho đến nay, chúng tôi đã tập trung vào phía Cloudflare: chiến lược, phát hiện và phân loại. Tất cả những điều này cho phép Cloudflare trang bị cho các chủ sở hữu trang web những công cụ họ cần để thiết lập các chính sách lưu lượng truy cập mà họ muốn trên trang web của mình. Tập trung vào phía chủ sở hữu trang web, chúng tôi muốn nhân cơ hội này để thảo luận về một số biện pháp giảm thiểu nâng cao cho phép chính các chủ sở hữu trang web gây ảnh hưởng đến hành vi của bot.

Với các kỹ thuật giảm thiểu trắng trợn hơn, chúng tôi đối mặt với một vấn đề mà chúng tôi gọi vui là "Vấn đề Kháng sinh Bot". Việc luôn gửi cho bot một phản hồi xác định (như chặn 403) giúp các nhà phát triển bot độc hại dễ dàng thăm dò, quan sát và đảo ngược kỹ thuật các biện pháp phòng thủ của bạn.

Chúng tôi biết điều này, vì vậy chúng tôi đang thiết kế các biện pháp giảm thiểu được tạo ra đặc biệt để điều tiết bot — với các cách tiếp cận khác nhau cho bot độc hại so với bot lành tính. Chúng ta có thể chia chúng thành ba cách tiếp cận:

Cách tiếp cận 1: Tính khó đoán và Hành động ngẫu nhiên. Áp dụng các phản hồi ngẫu nhiên (giữa chặn, thử thách hoặc cho phép) đối với lưu lượng truy cập tự động bị nghi ngờ sẽ phá vỡ logic thử lại tự động và dấu vân tay của bot.

Cách tiếp cận 2: AI Labyrinth, một phản hồi phòng thủ bẫy các bot trái phép trong một mê cung vô tận các trang web do AI tạo ra. Bạn có thể lãng phí ngân sách tính toán và thu thập dữ liệu của các bot độc hại bằng cách sử dụng sự đánh lạc hướng. Chủ sở hữu trang web sẽ được cung cấp ba tùy chọn trong AI Labyrinth, tùy thuộc vào sở thích của họ:

Cách tiếp cận 3: Xếp hàng cho các Bot tốt. Không phải tất cả lưu lượng truy cập tác nhân đều xấu; việc xếp hàng quản lý lưu lượng cho lưu lượng truy cập tự động hợp pháp (như các tác nhân mua sắm do người dùng điều khiển) mà không từ chối hoàn toàn dịch vụ của chúng.

Các biện pháp giảm thiểu nâng cao, dành riêng cho bot này dự kiến sẽ được triển khai vào cuối năm nay và sẽ có sẵn để chủ sở hữu trang web chọn mức độ nghiêm ngặt mà họ muốn.

Chúng tôi cũng biết rằng một biện pháp phòng thủ tuyệt vời là biện pháp mang tính dự đoán — một biện pháp tự học hỏi và tự điều chỉnh mà không cần nhiều chuyên gia bảo mật phải họp để phản ứng thiết lập bản sửa lỗi cho các cuộc tấn công lén lút mới nhất. Điều này có thể giống như việc có một hệ thống các quy tắc "dùng một lần", trong đó tập hợp quy tắc có tính chất động. Đây là thiết kế có chủ đích: nếu các cuộc tấn công liên tục phát triển, thì các biện pháp phòng thủ cũng phải như vậy. Đó là lý do tại sao chúng tôi đang nỗ lực để giữ cho cả các phát hiện và biện pháp giảm thiểu luôn đi trước một bước.

Thiết lập hệ sinh thái Tin cậy phù hợp với bạn

Bất kỳ ai và tất cả mọi người đều có thể thực hiện các bước để xác định cách các tác nhân tự động tương tác với cơ sở hạ tầng của họ.

CloudflareBảo mật AIBotTrải nghiệm người dùng
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Cloudflare Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.