Tin ngành
NVIDIA tối ưu hóa điện toán bảo mật: Suy luận AI đạt hiệu suất 98% trên GPU Blackwell
(giờ Việt Nam)
Tóm tắt AI
NVIDIA chứng minh công nghệ điện toán bảo mật (Confidential Computing) trên GPU Blackwell cho phép suy luận AI đạt hiệu suất vượt trội, duy trì tới 98% lưu lượng token so với cấu hình thông thường mà vẫn đảm bảo tính bảo mật dữ liệu.
Bản dịch AI

Khi quá trình suy luận của các mô hình ngôn ngữ lớn (LLM) ngày càng xử lý nhiều thông tin nhạy cảm và ngữ cảnh mô hình độc quyền trong các môi trường cá nhân, doanh nghiệp và các lĩnh vực được quản lý chặt chẽ, dữ liệu cần phải được xử lý bên trong một môi trường đáng tin cậy. NVIDIA Confidential Computing (CC) cung cấp một lộ trình để chạy các khối lượng công việc này một cách an toàn bằng cách sử dụng các máy ảo bảo mật (CVM) có mã hóa bộ nhớ, GPU bảo mật và NVIDIA NVLink được mã hóa. Điều này cho phép chạy suy luận AI trong môi trường sản xuất trên phần cứng đáng tin cậy.
Các framework suy luận như NVIDIA TensorRT LLM mang lại hiệu suất suy luận AI tốt nhất trong phân khúc bằng cách kết hợp các tối ưu hóa ở cấp độ framework với điện toán tăng tốc của NVIDIA. Tuy nhiên, khi các framework này chạy trong môi trường hỗ trợ CC, việc thực thi bảo mật sẽ làm thay đổi các giả định đằng sau việc di chuyển bộ nhớ, thời gian, lập lịch và giao tiếp đa GPU. Những thay đổi này gây ra chi phí hiệu năng (performance overhead) nếu runtime không thích ứng kịp. Do đó, việc duy trì hiệu suất cao đòi hỏi framework suy luận và môi trường điện toán bảo mật phải được tối ưu hóa cùng nhau.
Đối với các kỹ sư nền tảng AI đang đánh giá suy luận bảo mật trên GPU NVIDIA Blackwell, bài viết này xem xét các điều chỉnh nhận biết CC (CC-aware) mà các framework suy luận AI như TensorRT LLM sử dụng để tính đến việc thực thi bảo mật trong khi vẫn giúp duy trì hiệu suất suy luận. Bài viết trình bày một phương pháp có kiểm soát mà các nhóm có thể áp dụng để định lượng chi phí CC trên khối lượng công việc của riêng họ.
Lựa chọn khối lượng công việc để làm rõ chi phí CC
Các đặc điểm của khối lượng công việc quyết định mức độ hiển thị của chi phí CC. Khối lượng yêu cầu cao có thể bù đắp các chi phí mã hóa cố định bằng cách chồng lấp các khoảng thời gian chờ với các công việc khác, khiến cho các tác động trực tiếp trở nên khó quan sát hơn.
Để làm rõ những tác động này, hãy chọn một khối lượng công việc có ngữ cảnh đầu vào dài, quá trình tạo đầu ra mở rộng và độ đồng thời thấp. Ngữ cảnh dài gây áp lực lên việc di chuyển dữ liệu trong quá trình prefill, quá trình tạo mở rộng khuếch đại chi phí CC nhỏ trên mỗi token trong quá trình decode, và độ đồng thời thấp hạn chế cơ hội ẩn đi các chi phí đó giữa các yêu cầu đồng thời.
Nhóm kỹ thuật hiệu năng của NVIDIA đã sử dụng các đặc điểm này cho khối lượng công việc được đánh giá tại đây.
Đo lường chi phí CC bằng cách so sánh có kiểm soát giữa chế độ CC-on và CC-off
Để cô lập tác động hiệu năng của CC, hãy chạy cùng một khối lượng công việc trong hai điều kiện: tắt điện toán bảo mật (CC off) và bật điện toán bảo mật (CC on), đồng thời giữ nguyên mô hình, phần cứng, phiên bản framework, độ dài chuỗi, tính song song và độ đồng thời để trạng thái CC là biến số duy nhất thay đổi.
Tại mỗi mức độ đồng thời:
Các nhóm hiệu năng có thể sử dụng các phép đo này để định lượng xem bao nhiêu phần trăm hiệu năng cơ sở (CC-off) được duy trì khi bật CC cho khối lượng công việc mục tiêu. Nhóm kỹ thuật hiệu năng của NVIDIA đã áp dụng phép so sánh này bằng cách sử dụng cấu hình phần cứng và phần mềm được tóm tắt trong Bảng 2.
Kết quả hiệu năng
Như được hiển thị trong Hình 1 và 2, ở mức độ đồng thời từ 1–16, chế độ CC-on duy trì được 96,1–98,2% thông lượng token đầu ra so với CC-off, trong khi TPOT trung bình vẫn nằm trong khoảng 1,2% đến 4,3% so với mức cơ sở.


Xác định và giảm thiểu chi phí CC
Kiến trúc điện toán bảo mật NVIDIA Blackwell giới thiệu các lộ trình bảo mật được thực thi bằng phần cứng để bảo vệ dữ liệu và khối lượng công việc đang được sử dụng. Để có cái nhìn tổng quan chi tiết về kiến trúc, hãy xem "Hardware-Rooted AI Security That Won’t Slow You Down".
Đối với người dùng TensorRT LLM và các nhà phát triển framework, các chi tiết sau đây cho thấy cách các lộ trình bảo mật này thay đổi các giả định runtime thông thường và cách TensorRT LLM thích ứng để giảm thiểu chi phí hiệu năng phát sinh.
Điều chỉnh việc di chuyển dữ liệu từ host sang device
Trong B200 CC, các quá trình truyền dữ liệu từ host sang device đi qua một bounce buffer được mã hóa bằng phần mềm vì GPU không thể truy cập trực tiếp vào bộ nhớ CVM được bảo vệ. Điều này làm thay đổi hành vi mà các framework suy luận mong đợi: bộ nhớ pinned không còn mang lại lợi thế truyền tải không đồng bộ như thường lệ, và một số bản sao có thể chặn luồng gọi (calling thread).
Ổn định thời gian của kernel autotuner
Kernel autotuner thường sử dụng các sự kiện CUDA để so sánh các chiến thuật ứng viên. Trong cấu hình CC được thử nghiệm, các dấu thời gian của sự kiện CUDA tạo ra tín hiệu thời gian không ổn định, điều này có thể khiến autotuner chọn một chiến thuật chậm hơn.
Lựa chọn giao tiếp đa GPU nhận biết CC
NVLS (NVLink SHARP) multicast không khả dụng trong các cấu hình B200 CC. Nếu không có NVLS, NCCL_SYMMETRIC không thể mang lại lợi ích multicast như dự định mà vẫn có thể phát sinh chi phí đăng ký bộ nhớ và đồng bộ hóa giữa các rank trước khi sử dụng lộ trình tập thể không phải multicast.
Bắt đầu với NVIDIA Confidential Computing
NVIDIA Confidential Computing mở rộng khả năng bảo vệ bằng phần cứng trên các máy ảo bảo mật, GPU NVIDIA Blackwell và NVLink được mã hóa, bảo vệ các mô hình độc quyền, ngữ cảnh doanh nghiệp và các câu lệnh (prompt) nhạy cảm trong khi chúng được xử lý.
Điện toán bảo mật không loại bỏ nhu cầu về kỹ thuật hiệu năng—nó làm cho việc nhận biết framework trở nên quan trọng hơn nữa. Với các điều chỉnh nhận biết CC của TensorRT LLM đối với việc di chuyển dữ liệu bảo mật, autotuning và giao tiếp đa GPU, suy luận DeepSeek-R1 bảo mật đã duy trì hơn 96% thông lượng token đầu ra so với CC-off trong khi giữ chi phí độ trễ trên mỗi token dưới 5% trên tám GPU NVIDIA B200.
Khi các tổ chức chuyển suy luận riêng tư vào môi trường sản xuất, cấu hình bảo mật và tối ưu hóa suy luận nên được tiếp cận như một vấn đề triển khai duy nhất. Hãy bật điện toán bảo mật, xác thực môi trường và đo kiểm (benchmark) CC-on và CC-off bằng chính khối lượng công việc mà bạn dự định phục vụ. Đối với các kỹ sư nền tảng AI và người dùng TensorRT LLM đang chuyển suy luận riêng tư vào sản xuất, cấu hình bảo mật và tối ưu hóa suy luận nên được coi là một nỗ lực kỹ thuật toàn diện (full-stack).
Để bắt đầu lập kế hoạch triển khai suy luận bảo mật, hãy sử dụng tài liệu NVIDIA Trusted Computing và khám phá các tính năng cũng như ghi chú phát hành mới nhất của TensorRT LLM. Để cập nhật những phát triển mới nhất, hãy theo dõi tin tức về NVIDIA Confidential Compute.
Lời cảm ơn
Tôi xin cảm ơn Dan Hansen, Sheel Pethe, Samuel Mendoza-Jonas, Moein Ghaniyoun, Vidhya Krishnan, Avinash Ahuja, Laikh Tewari, Laura Martinez và Matheen Raza vì những đóng góp kỹ thuật, hướng dẫn chuyên môn, phân tích và đánh giá sâu sắc trong suốt quá trình thực hiện công việc này.
Bài viết được AI dịch và tổng hợp tự động từ NVIDIA Technical Blog: Agentic AI / Generative AI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.