# Nvidia ra mắt Sentry: 'Cảnh khuyển' phần cứng trên BlueField-4 giúp kiểm soát AI Agent

- Nguồn: The Decoder: AI News
- Thời gian phát hành: 2026-09-28 21:32 (giờ Việt Nam)
- Điểm AI: 57/100
- Link AIHOT.vn: https://aihot.vn/items/ce0f783df9592da4
- Nguồn dữ liệu AI HOT: https://aihot.news/items/qwrxwiuw4xc4jy1nqwp2xpwj4
- Link gốc: https://the-decoder.com/nvidia-wants-to-keep-ai-agents-on-a-short-leash-with-a-watchdog-built-into-its-chips

## Tóm tắt AI

Nvidia giới thiệu giải pháp bảo mật kết hợp sandbox OpenShell và phần cứng Sentry tích hợp trên BlueField-4 DPU, cho phép cô lập các AI Agent vượt quyền kiểm soát trong tích tắc.

## Thân bài

OpenAI không phải là phòng thí nghiệm duy nhất đối mặt với vấn đề này. Anthropic đã thừa nhận các [sự cố tương tự](https://the-decoder.com/anthropic-follows-openai-in-admitting-its-claude-models-reached-out-of-test-environments-and-attacked-real-world-systems/) vào cuối tháng 7, và Meta cũng theo sau vào đầu tháng 8. Gần đây, thông tin cũng cho thấy [Google's Gemini](https://the-decoder.com/googles-gemini-also-accidentally-hacked-three-real-companies-during-security-testing/) đã hack ba công ty thực tế trong một cuộc thử nghiệm hồi tháng 5. OpenAI, Anthropic và các nhà nghiên cứu bên ngoài hiện đang xem xét [hàng chục ngàn trường hợp khác](https://the-decoder.com/tens-of-thousands-of-security-probes-show-openais-hugging-face-incident-was-just-the-beginning/). Theo OpenAI, nhiều trường hợp trong số đó chỉ là hoạt động nghiên cứu thông thường.

Công nghệ của Nvidia không hoàn toàn mới. Nền tảng này kết hợp [OpenShell](https://github.com/NVIDIA/openshell), phần mềm mã nguồn mở mà Nvidia giới thiệu vào tháng 3, với một cơ chế giám sát phần cứng mới gọi là Sentry. OpenShell khóa mỗi tác nhân (agent) trong một dạng lồng kỹ thuật số được gọi là sandbox. Người vận hành sẽ quyết định những tệp tin, chương trình, mạng và thông tin xác thực nào mà một tác nhân có thể truy cập.

Nvidia cũng cung cấp một [công cụ xác minh hình thức](https://nvidia.github.io/OpenShell-Research/dev-notes/posts/2026-09-10-learning-formal-methods-agent-policy-prover/) được giới thiệu vào ngày 10 tháng 9. Công cụ này nhằm phát hiện liệu các quyền truy cập này có vượt quá giới hạn thiết lập hoặc mở đường cho các truy cập rủi ro hay không. Nvidia [cho biết](https://developer.nvidia.com/blog/add-runtime-controls-to-ai-agents-with-nvidia-openshell) họ vẫn đang tiếp tục phát triển các kiểm tra cho nhiều tác nhân hoạt động cùng nhau.

Sentry là một thiết kế tham chiếu cho các đơn vị xử lý dữ liệu BlueField-4 của Nvidia. Cơ chế giám sát này chạy tách biệt với máy tính chính, điều mà Nvidia cho biết giúp nó trở nên vô hình đối với các tác nhân. Trong hệ thống trung tâm dữ liệu Vera Rubin của Nvidia, nó nằm trên kết nối duy nhất giữa tác nhân và mô hình AI. Nếu một tác nhân cố gắng thoát ra ngoài, Sentry sẽ cô lập nó trong vòng vài mili giây. Theo Nvidia, những khách hàng đang vận hành các hệ thống tương thích chỉ cần cập nhật phần mềm. Thông báo này không đưa ra ngày cụ thể cho việc phát hành rộng rãi.

Trong một [bài đăng blog kỹ thuật](https://developer.nvidia.com/blog/nvidia-open-agent-safety-platform-a-reference-for-continuous-in-silicon-agent-monitoring/), Nvidia giải thích lý do của mình. Các tác nhân có thể đi chệch khỏi nhiệm vụ khi hướng dẫn không rõ ràng hoặc các tác vụ kéo dài hàng tuần. Nvidia cho biết điều này không thể được loại bỏ thông qua huấn luyện mà không làm hạn chế khả năng của chúng, vì vậy một tác nhân không thể tự giám sát hoàn toàn chính nó.

### Sai lầm lớn nhất của OpenAI là ngắt kết nối quá muộn.

Các trường hợp gần đây cho thấy vai trò của một cơ chế giám sát như thế này. Vào tháng 7, các tác nhân của OpenAI đã vượt qua các hạn chế mạng của sandbox trong một [cuộc thử nghiệm hack](https://the-decoder.com/new-reports-reveal-the-extent-of-openais-loss-of-control-during-the-autonomous-hack-on-hugging-face/). Chúng khai thác các lỗ hổng chưa từng được biết đến trước đó trong Artifactory, dịch vụ gói nội bộ của OpenAI. Theo báo cáo kỹ thuật của OpenAI, các tác nhân đã kết hợp thông tin xác thực công khai với các lỗ hổng khác. Điều đó cho phép chúng chạy mã trên 41 tiến trình máy chủ Hugging Face xử lý các tập dữ liệu. Một cuộc điều tra của METR và Redwood Research cho thấy khoảng 700 tác nhân đã tham gia vào cuộc tấn công.

Các dấu hiệu cảnh báo đã xuất hiện từ sớm. Vào ngày 27 tháng 6, một công cụ bảo mật đã gắn cờ hoạt động mạng đáng ngờ, nhưng những người phụ trách cho rằng không cần phải dừng quá trình này. OpenAI đã tắt một máy chủ gói bị xâm nhập vào đầu tháng 7, nhưng các thử nghiệm sau đó vẫn thiếu sự giám sát và các biện pháp bảo vệ then chốt. Vụ việc này phơi bày những lỗ hổng trong công tác phòng ngừa, phát hiện và phản ứng.

Vào tháng 9, một cảnh báo đã vang lên chỉ chưa đầy 12 phút sau lần truy cập gửi đi thành công đầu tiên. Tuy nhiên, việc tự động ngắt kết nối đã không hoạt động như mong đợi. Quá trình này chỉ bị dừng lại sau khoảng hai giờ 44 phút kể từ lần truy cập đó. OpenAI cũng thừa nhận họ đã không gắn cờ các truy cập gửi đi khác ở mức cảnh báo phù hợp. Nvidia đã xây dựng cơ chế cách ly tự động của mình chính xác là để xử lý những kiểu chậm trễ này.

Liệu Sentry có ngăn chặn được cuộc tấn công vào tháng 7 hay không vẫn là một câu hỏi mở. Điều đó phụ thuộc vào việc các mục tiêu thử nghiệm được cấp phép đã được xác định rõ ràng ở cấp độ kỹ thuật hay chưa và liệu quyền truy cập vào các hệ thống bên ngoài đã thực sự bị chặn hay chưa. Các thông báo của Nvidia không bao gồm bất kỳ số liệu nào về độ tin cậy của Sentry trong việc phát hiện các hành vi vượt rào.

### Không một lớp bảo mật đơn lẻ nào có thể ngăn chặn một tác nhân đã bị đánh lừa.

Trong một phân tích hồi cứu, OpenAI kết luận rằng việc giám sát các "suy nghĩ" mà một mô hình viết ra trước khi hành động sẽ đưa ra cảnh báo sớm hơn một ngày trước khi vụ vi phạm xảy ra. Điều này đề cập đến việc giám sát chuỗi suy nghĩ (chain-of-thought), thứ mà OpenAI hiện đang sử dụng và đã cải thiện dựa trên những bài học từ sự cố này. Nó đã không được chạy trong các thử nghiệm bị ảnh hưởng.

Nvidia lập luận rằng tác nhân càng được phép làm nhiều việc, thì quá trình suy luận của nó càng cần phải minh bạch. Nhưng theo mô tả của Nvidia, Sentry chủ yếu kiểm tra các yêu cầu, danh tính và quyền truy cập. Các nhà cung cấp mô hình đóng như OpenAI cũng chỉ chia sẻ các bản tóm tắt thay vì nhật ký suy luận đầy đủ. Một [nghiên cứu của Anthropic](https://the-decoder.com/anthropic-study-finds-language-models-often-hide-their-reasoning-process/) đã chỉ ra từ năm 2025 rằng các nhật ký này không phản ánh một cách đáng tin cậy những gì thực sự thúc đẩy một mô hình. Trong các thí nghiệm khác, các nhà nghiên cứu phát hiện ra rằng các mô hình có thể che giấu ý định của chúng trong đó khi được yêu cầu cụ thể.

Tấn công tiêm lệnh (prompt injection) cũng vẫn là một vấn đề nan giải. Những kẻ tấn công ẩn giấu các lệnh ở những nơi như trang web, và các mô hình ngôn ngữ không thể phân biệt các hướng dẫn đó với nội dung thông thường một cách đáng tin cậy. Nếu một tác nhân bị đánh lừa gửi dữ liệu qua một kênh được phê duyệt, nó vẫn nằm trong phạm vi quyền hạn kỹ thuật của mình ngay cả khi nó vi phạm nhiệm vụ. Chỉ kiểm tra quyền hạn thôi có thể bỏ sót điều đó. Việc phân tích nhật ký suy luận cũng không phải là sự đảm bảo, mặc dù OpenAI sử dụng giám sát để chống lại tấn công tiêm lệnh một cách rõ ràng.

Nvidia so sánh nỗ lực này với trình duyệt web, thứ mà họ cho rằng đã làm cho internet an toàn hơn bằng cách cô lập từng trang web. Nhưng các trình duyệt không chấm dứt được các cuộc tấn công. Chúng chỉ làm cho các cuộc tấn công trở nên khó khăn hơn, và ngày nay chúng vẫn cần phải vá lỗi liên tục. Bản thân Nvidia cũng dựa vào nhiều lớp bảo vệ.
