NVIDIA chứng minh công nghệ điện toán bảo mật (Confidential Computing) trên GPU Blackwell cho phép suy luận AI đạt hiệu suất vượt trội, duy trì tới 98% lưu lượng token so với cấu hình thông thường mà vẫn đảm bảo tính bảo mật dữ liệu.
NVIDIA Dynamo-Triton 26.07 tích hợp TensorRT cho phép suy luận đa GPU trên một endpoint duy nhất, giúp đơn giản hóa quy trình triển khai và tối ưu hiệu suất cho các mô hình lớn.
Sử dụng TensorRT Edge-LLM, Jetson AGX Thor chạy mô hình Qwen3.6-27B với tốc độ 52,33 tokens/s, hoàn thành bài kiểm tra MLPerf Edge Agentic nhanh gấp 6,4 lần so với phương pháp truyền thống.
NVIDIA giới thiệu TensorRT Model Connect (TRTMC), công cụ mã nguồn mở cho phép chuyển đổi trực tiếp các checkpoint từ Hugging Face sang định dạng TensorRT để suy luận trên C++ mà không cần qua bước trung gian ONNX.