MarkTechPost
92

Thủ thuật

Hướng dẫn bảo mật toàn diện cho AI Agent, MCP Server và ứng dụng LLM trong môi trường thực tế

(giờ Việt Nam)

Tóm tắt AI

Bài viết giới thiệu khung bảo mật 'see-fix-protect' cùng danh sách kiểm tra 12 lỗi cấu hình phổ biến, giúp doanh nghiệp hệ thống hóa quy trình bảo vệ ứng dụng AI theo các tiêu chuẩn quốc tế như NIST và OWASP.

Bản dịch AI

How to Secure AI Agents, MCP Servers, and LLM Apps in Production

Các tác nhân (agents), tích hợp MCP và các ứng dụng vận hành bằng LLM đang thâm nhập vào các codebase nhanh hơn mức mà hầu hết các chương trình bảo mật có thể theo kịp. Hướng dẫn thực hành mới của Mend.io, ‘Securing AI agents, MCP servers & LLM apps: A practical framework’, nhắm đến việc lấp đầy khoảng trống đó. Tài liệu này được tổ chức xoay quanh ba bước: nhận diện những gì quan trọng, khắc phục những gì quan trọng nhanh hơn, bảo vệ AI trong môi trường production và cung cấp bảy công cụ (artifacts) có thể tái sử dụng.

Tại sao AppSec truyền thống không còn hiệu quả

AppSec được xây dựng dựa trên một giả định: các ứng dụng hoạt động theo đúng những gì mã nguồn của chúng quy định. AI tác nhân (Agentic AI) đã phá vỡ giả định này. Hành vi của tác nhân nảy sinh từ một mô hình, một system prompt, ngữ cảnh được truy xuất, dữ liệu đầu vào của người dùng và các công cụ mà nó có thể gọi. Hai lần triển khai giống hệt nhau vẫn có thể hành xử khác nhau.

Các phương thức lỗi cũng hoàn toàn mới. Prompt injection xâm nhập thông qua dữ liệu chứ không phải mã nguồn. Một tác nhân được cấp quyền quá mức có thể thực hiện các hành động gây hại mà không cần bất kỳ lỗ hổng nào bị khai thác. Một mô hình đã lỗi thời vẫn tiếp tục đưa ra các dự đoán sau khi người duy trì ngừng vá lỗi cho nó. Một mô tả công cụ bị nhiễm độc trên máy chủ MCP có thể điều hướng hành vi của tác nhân mà không cần chạm vào ứng dụng. Không có trường hợp nào trong số này xuất hiện trong nguồn cấp dữ liệu CVE. Nhiệm vụ đặt ra là hai mặt: shift left (bảo mật từ sớm) và protect right (bảo vệ tại runtime).

Artifact 1.1: bản đồ bề mặt tấn công năm lớp

Nhận diện: khám phá tác nhân và MCP

Các tác nhân hiếm khi được đưa vào thông qua quy trình mua sắm. Có ba danh mục cần truy quét: shadow agents (tác nhân ẩn), máy chủ MCP chưa đăng ký và các khung AI nhúng. Mỗi máy chủ MCP đều cần một chủ sở hữu, phạm vi truy cập và quy trình đánh giá.

Có năm phương pháp khám phá. Thứ nhất, quét các kho lưu trữ để tìm các dấu hiệu của tác nhân. Thứ hai, theo dõi lưu lượng mạng ra ngoài để tìm các lệnh gọi đến các điểm cuối API của mô hình. Thứ ba, kiểm tra tài khoản dịch vụ và khóa API. Thứ tư, đơn giản hóa việc khai báo thông qua đăng ký nhẹ. Cuối cùng, tự động hóa liên tục, vì việc khám phá tại một thời điểm nhất định sẽ nhanh chóng trở nên lỗi thời.

Artifact 2.1 mở rộng AI-BOM với chín trường thông tin cho mỗi tác nhân hoặc máy chủ MCP: định danh, sự phụ thuộc vào mô hình, mức độ tự chủ, quyền truy cập công cụ, phạm vi thông tin xác thực, phạm vi tiếp cận dữ liệu, các điểm cuối MCP, vị trí prompt, lần đánh giá cuối cùng.

Artifact 2.2 là danh sách kiểm tra 12 điểm về cấu hình sai: thông tin xác thực được giới hạn cho các tài nguyên cụ thể thay vì quyền truy cập rộng rãi ở cấp dịch vụ; không chia sẻ thông tin xác thực giữa các tác nhân; các công cụ có tác động lớn cần sự phê duyệt của con người; system prompt nằm trong hệ thống kiểm soát phiên bản, không thể chỉnh sửa trực tiếp trong môi trường production; máy chủ MCP xác thực khách hàng; các mô tả công cụ được đánh giá để tìm nội dung chứa nguy cơ injection trước khi áp dụng (tool poisoning); các phiên bản mô hình được ghim kèm theo giám sát vòng đời (EOL) và một chủ sở hữu.

Khắc phục: ưu tiên và phân loại

AI đã mở rộng bề mặt tìm kiếm lỗi, không chỉ là bề mặt tấn công. Quy trình xử lý là làm giàu dữ liệu → ưu tiên → phân loại. Các tín hiệu ưu tiên, theo thứ tự giá trị: khả năng tiếp cận, ngữ cảnh khai thác, ngữ cảnh kinh doanh, sự khuếch đại của tác nhân, khả năng khắc phục.

Artifact 3.1 vạch ra ranh giới tự động hóa:

Hai quy tắc chi phối việc này. Mọi trường hợp đóng tự động đều phải có bằng chứng; nếu hệ thống không thể chứng minh tại sao một thứ gì đó là dương tính giả, nó sẽ được chuyển cho con người. Tỷ lệ lỗi sẽ được lấy mẫu đánh giá, với các ngưỡng kích hoạt việc đào tạo lại.

Bảo vệ: bảo mật runtime

Bảo vệ runtime bao gồm các cơ chế guardrails, tăng cường prompt, thực thi chính sách và giám sát. Hoạt động như một vòng lặp với AI red teaming, các phát hiện từ red team sẽ cải thiện guardrails, trong khi nhật ký của guardrails sẽ hướng dẫn cho các đợt red teaming tiếp theo.

Guardrails được triển khai theo hai cách: thông qua Python SDK trong ứng dụng (hỗ trợ chế độ Online hoặc Offline biệt lập) hoặc dưới dạng API Server độc lập (Docker) không yêu cầu thay đổi mã nguồn hoặc phụ thuộc vào Python. Thiết lập tối thiểu khả thi bao gồm các guardrails đầu vào để chặn prompt injection, các yêu cầu vi phạm chính sách và jailbreak, cùng với các guardrails đầu ra để chặn thông tin xác thực, PII, mã nguồn độc quyền, nội dung không an toàn và các vi phạm chính sách.

Việc tăng cường system prompt tuân theo năm mô hình: giả định về việc tiết lộ, tách biệt hướng dẫn khỏi dữ liệu, hạn chế phạm vi ảnh hưởng, quản lý phiên bản/đánh giá và kiểm thử đối kháng. Việc thiết lập quyền hạn nghiêm ngặt hiệu quả hơn so với các hướng dẫn trong prompt—ngăn chặn quyền truy cập công cụ sẽ loại bỏ nhu cầu phải hướng dẫn để tránh các hành động nguy hiểm. Artifact 4.1 chứa bảy bước kiểm tra xác thực.

Lộ trình trưởng thành

Bốn giai đoạn: Mới nổi (Emerging), Đang phát triển (Developing), Kiểm soát (Controlling), Dẫn đầu (Leading). Lộ trình này phù hợp với NIST AI RMF, OWASP AIMA, ISO/IEC 42001 và Đạo luật AI của EU. Artifact 5.1 là bảng tự đánh giá gồm 15 câu hỏi: 0–5 Mới nổi, 6–10 Đang phát triển, 11–13 Kiểm soát, 14–15 Dẫn đầu.

Những điểm chính cần lưu ý

Cảm ơn đội ngũ Mend.io vì tư duy dẫn dắt và các tài nguyên cho bài viết này. Bài viết này được tài trợ bởi Mend.io.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.

Bảo mật AILLMAI AgentsMCPAn toàn thông tin
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.