Thủ thuật
Sierra: Chiến lược phòng thủ chiều sâu trong kỷ nguyên AI Agent
(giờ Việt Nam)
Tóm tắt AI
Sierra áp dụng cơ chế 'mục tiêu và rào chắn' để giúp AI Agent tự chủ tư duy trong các tác vụ phức tạp như xử lý khoản vay hay giải quyết tranh chấp, đồng thời đảm bảo hành vi luôn nằm trong tầm kiểm soát an toàn.
Bản dịch AI

Trong bài viết của Neil về kỹ thuật ngữ cảnh (context engineering), anh ấy đã thảo luận về sự khác biệt giữa các tác nhân (agent) dựa trên luồng và các tác nhân được xây dựng dựa trên mục tiêu và rào cản (guardrails). Loại thứ nhất tuân theo một lộ trình được xác định trước, giống như cây quyết định, lưu đồ hoặc quy trình vận hành tiêu chuẩn. Mặc dù khách hàng có thể nói chuyện một cách tự nhiên, hệ thống vẫn vận hành theo cơ chế “nếu thế này, thì thế kia” (if this, then that).
Tại Sierra, chúng tôi xây dựng các tác nhân bằng cách sử dụng mục tiêu và rào cản để chúng có thể tự suy nghĩ và lập luận, cho dù là khởi tạo một khoản thế chấp, khiếu nại một khoản phí hay giúp chọn một đôi ván trượt phù hợp. Sự tự do đó chính là điều khiến chúng trở nên mạnh mẽ — và cũng là lý do tại sao các rào cản được thiết lập cho chúng lại quan trọng đến vậy. Bởi vì khi một tác nhân không còn tuân theo lộ trình định sẵn, bạn cần một cách thức mới để đảm bảo nó luôn nằm trong phạm vi giới hạn do doanh nghiệp của bạn đặt ra.
Một cách tiếp cận mới đối với nguyên tắc bảo mật cũ
Ý tưởng cơ bản về phòng thủ theo chiều sâu (defense in depth) — rằng bạn cần nhiều lớp bảo vệ — vẫn không thay đổi, nhưng các tác nhân đã làm thay đổi chức năng của những lớp đó. Một số biện pháp bảo vệ có thể được mã hóa cứng (hard coded), chẳng hạn như không bao giờ tiết lộ đầy đủ thông tin thanh toán của khách hàng. Những biện pháp khác đòi hỏi ngữ cảnh và sự phán đoán, ví dụ như: Bảo hiểm có chi trả cho việc này không? Tôi có thể được hoàn tiền không? Hoặc, tôi muốn báo cáo gian lận trên tài khoản của mình. Những gì một tác nhân có thể và không thể nói cũng đặc thù cho từng doanh nghiệp. Một tác nhân bán lẻ có thể thoải mái bình luận về sản phẩm của đối thủ cạnh tranh, trong khi đối với một doanh nghiệp khác, đó có thể là rủi ro thương hiệu ngay lập tức.
Thách thức khác là các mối đe dọa mà những rào cản này được thiết kế để ngăn chặn luôn không ngừng phát triển. Một “khách hàng” có thể ẩn các chỉ dẫn được mã hóa bên trong tin nhắn, đóng vai người giám sát của tác nhân để thay đổi chính sách, hoặc sử dụng kỹ thuật tấn công prompt injection để lừa tác nhân thực hiện những việc không nên làm. Các mối đe dọa khác liên quan đến nội dung độc hại không bao giờ được phép xuất hiện trong cuộc hội thoại, bất kể ai là người đưa vào. Các danh mục này ngày càng trở nên mờ nhạt khi những kẻ tấn công có kỹ năng kết hợp nhiều kỹ thuật với nhau.
Chính vì tất cả những lý do này mà bạn cần AI để bảo vệ AI.
Giải pháp cho các vấn đề của AI chính là nhiều AI hơn nữa.
Bên trong Sierra, mọi tin nhắn của khách hàng đều đi qua nhiều lớp trước khi tác nhân phản hồi:
Một tin nhắn đơn lẻ có thể kích hoạt nửa tá các bước kiểm tra này trước khi bất kỳ phản hồi nào được gửi đi. Một tác nhân giám sát (supervisor agent) sẽ sàng lọc đầu vào. Tác nhân chính sẽ dựa trên nội dung liên quan và áp dụng các chính sách tương ứng. Một tác nhân giám sát khác sẽ xem xét phản hồi dự kiến. Một rào cản xác định (deterministic guard) sẽ quét đầu ra để tìm dữ liệu nhạy cảm. Chỉ khi đó, khách hàng mới nhìn thấy phản hồi.
Việc phân lớp rất quan trọng vì mỗi lớp giải quyết một loại rủi ro khác nhau và có phương thức lỗi riêng. Nội dung giúp tác nhân bám sát vào nguồn tri thức đáng tin cậy, nhưng cùng một quy trình truy xuất đó cũng có thể kéo theo các chỉ dẫn mà ai đó đã cài cắm bên trong. Các quy tắc và chính sách nằm trong cùng một prompt với đầu vào của khách hàng, nơi một tin nhắn đủ kiên quyết có thể cạnh tranh sự chú ý của mô hình. Các tác nhân giám sát nắm bắt được những sắc thái mà các quy tắc cố định không thể làm được, nhưng vì bản thân chúng cũng là các tác nhân nên chúng chia sẻ một số hạn chế mà chúng được tạo ra để phát hiện. Các rào cản xác định thực thi những điều tuyệt đối không thể để cho mô hình tự phán đoán, nhưng chúng chỉ kích hoạt dựa trên những gì đã được định nghĩa rõ ràng.
Sức mạnh của hệ thống nằm ở việc các lớp bao phủ lẫn nhau: Cùng nhau, chúng tạo nên sự vững chắc trước phạm vi áp lực rộng hơn nhiều so với bất kỳ kỹ thuật đơn lẻ nào có thể làm được.
Vượt ra ngoài thời gian thực thi (runtime)
Các rào cản trong thời gian thực thi là cần thiết nhưng chưa đủ. Hai thực tiễn khác cần được áp dụng song song với chúng.
Khi AI trở nên thông minh hơn, các hệ thống bảo vệ nó cũng phải như vậy.
Khi các mô hình trở nên mạnh mẽ hơn, các tác nhân sẽ đảm nhận nhiều trách nhiệm hơn, gặp phải những tình huống bạn không lường trước được và cần đưa ra nhiều quyết định hơn mà bạn không thể quy định trước. Việc giữ chúng trong giới hạn mà không đưa chúng quay lại các lộ trình “nếu thế này, thì thế kia” định sẵn sẽ đòi hỏi chiến lược phòng thủ theo chiều sâu phải phát triển cùng với chúng.
Đăng ký theo dõi blog của Sierra
Nhận thông báo về các tính năng sản phẩm mới, cập nhật khách hàng và nhiều thông tin khác.
Khám phá những gì Sierra có thể làm cho bạn
Tìm hiểu cách Sierra có thể giúp bạn mang lại kết quả tốt hơn với AI.
Bài viết được AI dịch và tổng hợp tự động từ Sierra: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.