Tin ngành
NVIDIA TensorRT Edge-LLM giúp Jetson AGX Thor đạt hiệu suất nhanh gấp 6,4 lần trong bài kiểm tra MLPerf
(giờ Việt Nam)
Tóm tắt AI
Sử dụng TensorRT Edge-LLM, Jetson AGX Thor chạy mô hình Qwen3.6-27B với tốc độ 52,33 tokens/s, hoàn thành bài kiểm tra MLPerf Edge Agentic nhanh gấp 6,4 lần so với phương pháp truyền thống.
Bản dịch AI

Các AI agent đang chuyển dịch từ các trung tâm dữ liệu đám mây sang phương tiện di chuyển, robot và các thiết bị biên (edge devices) khác. Không giống như chatbot chỉ trả lời một câu lệnh đơn lẻ, một agent hoạt động thông qua một chuỗi các bước. Nó lựa chọn công cụ, đánh giá kết quả và tiếp tục suy luận trong một cuộc hội thoại ngày càng dài.
Quy trình làm việc này đặt ra những yêu cầu mới đối với suy luận tại biên (edge inference). Mô hình phải tạo token nhanh chóng, xử lý hiệu quả lịch sử hội thoại dài được chia sẻ và tạo ra các lệnh gọi công cụ hợp lệ trong giới hạn về năng lượng và bộ nhớ.
Trong bài kiểm tra MLPerf Inference v6.1 Edge Agentic, NVIDIA TensorRT Edge-LLM đã chạy Qwen3.6-27B trên một bộ NVIDIA Jetson AGX Thor Developer Kit duy nhất. Hệ thống đạt tốc độ 52,33 token mỗi giây và hoàn thành toàn bộ 1.007 lượt của khối lượng công việc hiệu năng trong 24 phút 36 giây, nhanh gấp 6,4 lần so với kết quả tham chiếu llama.cpp là 2 giờ 37 phút. Kết quả này sử dụng kỹ thuật lượng tử hóa NVFP4, dự đoán đa token dựa trên cây (tree-based MTP) và tái sử dụng bộ nhớ đệm KV (KV cache).
Cách MLPerf đo lường hiệu năng AI agentic từ đầu đến cuối
MLPerf Edge Agentic đo lường một điểm cuối mô hình tương thích với OpenAI qua hai giai đoạn: hiệu năng và độ chính xác.
Giai đoạn hiệu năng phát lại các quỹ đạo agent kỹ thuật phần mềm đã được ghi lại. Mô hình nhận yêu cầu từ người dùng, tạo lệnh gọi công cụ, quan sát kết quả công cụ và tiếp tục cùng một cuộc hội thoại. Khối lượng công việc bao gồm 20 cuộc hội thoại và 1.007 lượt tạo. Độ dài đầu vào tăng dần qua các lượt và đạt khoảng 23,5K token, khiến việc xử lý ngữ cảnh dài trở thành một phần quan trọng của phép đo. Độ chính xác nội dòng dựa trên Intersection of Union (IoU) cũng được đo lường để đảm bảo giai đoạn hiệu năng đang vận hành agent một cách chính xác.
Giai đoạn độ chính xác sử dụng các câu lệnh từ Berkeley Function Calling Leaderboard (BFCL) v4 với chế độ chỉ một lượt và tắt suy luận để cân bằng giữa độ chính xác và thời gian đánh giá trên các thiết bị biên. Nó đánh giá xem mô hình có chọn đúng hàm, tạo đối số hợp lệ và tránh gọi công cụ khi không cần thiết hay không.

Kết quả kiểm tra MLPerf Edge Agentic trên Jetson AGX Thor
Bản đệ trình TensorRT Edge-LLM đã sử dụng Qwen3.6-27B ở chế độ SingleStream trên một Jetson AGX Thor Developer Kit với 128 GB bộ nhớ thống nhất ở chế độ năng lượng MAXN.
Bảng 1. Tóm tắt kết quả đệ trình NVIDIA Edge Agentic tại MLPerf v6.1
Ví dụ MLCommons Edge Agentic cũng công bố một lượt chạy tham chiếu llama.cpp trên Jetson AGX Thor, sử dụng Qwen3.6-27B với lượng tử hóa Q4_K_M và hoàn thành trong 2 giờ 37 phút. Bản đệ trình TensorRT Edge-LLM hoàn thành khối lượng công việc trong 24 phút 36 giây, tức là nhanh gấp 6,4 lần.

Sử dụng lượng tử hóa NVFP4 để tăng tốc suy luận Qwen3.6-27B
Giải mã LLM theo lô nhỏ (low-batch) trên các nền tảng biên được biết là bị giới hạn nặng nề bởi băng thông DRAM. Việc giảm kích thước của cả trọng số và kích hoạt sẽ làm giảm dấu chân bộ nhớ của các nhân (kernels), từ đó thúc đẩy hiệu năng giải mã.
Mô hình Qwen3.6-27B được đệ trình sử dụng NVFP4 cho trọng số và kích hoạt, bao gồm cả phần đầu mô hình ngôn ngữ (language-model head), và FP8 cho bộ nhớ đệm KV. NVFP4 là định dạng dấu phẩy động 4-bit được hỗ trợ bởi GPU NVIDIA Blackwell trong Jetson AGX Thor. TensorRT Edge-LLM sử dụng các nhân được tối ưu hóa để tăng tốc mô hình đã lượng tử hóa trong khi vẫn duy trì độ chính xác theo yêu cầu của MLPerf.
Cách biểu diễn mô hình nhỏ hơn cũng giúp dành nhiều hơn trong số 128 GB bộ nhớ thống nhất cho ngữ cảnh dài, trạng thái giải mã suy đoán (speculative decoding) và các khối lượng công việc ứng dụng. Các nhà phát triển có thể bắt đầu từ một checkpoint Qwen3.6-27B NVFP4 đã được hiệu chuẩn và công bố. Nhóm triển khai có thể sử dụng checkpoint đã lượng tử hóa hoặc thực hiện lượng tử hóa sau huấn luyện một lần trên bất kỳ hệ thống phát triển nào trước khi triển khai mô hình.
Tái sử dụng bộ nhớ đệm KV qua các lượt của agent
Mỗi yêu cầu mới trong một quỹ đạo agent chứa phần lớn cuộc hội thoại trước đó cộng với phản hồi mới của mô hình hoặc kết quả công cụ. Nếu không tái sử dụng, mô hình phải nạp trước (prefill) lại lịch sử được chia sẻ trong mỗi lượt. Chi phí sẽ tăng lên khi cuộc hội thoại kéo dài.
TensorRT Edge-LLM xác định các tiền tố câu lệnh có thể tái sử dụng và khôi phục các trang KV chú ý (attention KV pages) đã lưu trong bộ nhớ đệm của chúng. Qwen3.6 sử dụng kiến trúc mô hình lai, vì vậy thời gian chạy (runtime) cũng khôi phục trạng thái tái phát (recurrent state) và trạng thái trang KV một phần cần thiết để tiếp tục thực thi một cách chính xác. Sau đó, nó chỉ nạp trước phần hậu tố mới của cuộc hội thoại.
Việc tái sử dụng bộ nhớ đệm KV và trạng thái tái phát giúp giảm tính toán ngữ cảnh dài lặp đi lặp lại trong suốt quỹ đạo agent. Tối ưu hóa này bổ sung cho MTP dựa trên cây: tái sử dụng bộ nhớ đệm giúp giảm chi phí trước khi quá trình tạo bắt đầu, trong khi MTP giúp giảm số lượng bước của mô hình mục tiêu trong quá trình tạo.
Trên khối lượng công việc này, khoảng 96% token câu lệnh được phục vụ bằng bộ nhớ đệm nóng (hot cache). Thời gian chạy chỉ nạp trước khoảng 0,5 triệu trong tổng số 13,6 triệu token câu lệnh qua các lượt.
Sử dụng dự đoán đa token dựa trên cây để tăng tốc suy luận LLM
Giải mã tự hồi quy tiêu chuẩn tạo ra một token cho mỗi lần gọi mô hình. Dự đoán đa token (Multi-token prediction - MTP) sử dụng một mô hình nháp (draft model) để dự đoán trước một vài token, sau đó mô hình mục tiêu sẽ xác minh chúng cùng nhau. Các mô hình gần đây thường có trọng số MTP chính thức được huấn luyện và cung cấp kèm theo mô hình chính.
Ngoài MTP tuyến tính truyền thống, TensorRT Edge-LLM triển khai MTP dựa trên cây. Thay vì chỉ giữ lại một phần tiếp nối được dự đoán, thời gian chạy tổ chức các ứng viên có xác suất cao thành một cây. Mô hình mục tiêu xác minh các ứng viên trong một lần truyền xuôi (forward pass) và thời gian chạy chấp nhận đường dẫn khớp. Nếu nhiều ứng viên được chấp nhận, hệ thống sẽ đẩy nhanh quá trình tạo thêm vài token.
Bạn có thể điều chỉnh các tham số nháp khi khởi chạy máy chủ. Cấu hình máy chủ MLPerf sử dụng 8 bước nháp, 2 ứng viên hàng đầu tại mỗi độ sâu nháp và một cây xác minh 16 nút. Xác minh dựa trên cây rất hữu ích cho việc gọi hàm vì tên công cụ, cú pháp JSON và cấu trúc đối số phổ biến thường có thể dự đoán được, trong khi nhiều nhánh có thể bảo toàn các lựa chọn thay thế khả thi cho các giá trị đối số riêng lẻ. So với MTP tuyến tính với 3 bước nháp, MTP dựa trên cây có thể đạt thêm khoảng 40% hiệu năng giải mã cho khối lượng công việc này.
Cách chạy bài kiểm tra MLPerf Edge Agentic
Bản triển khai được sử dụng cho bản đệ trình này có sẵn trên nhánh release/0.9.1-mlpinf của TensorRT Edge-LLM. Nhánh này bao gồm các cài đặt xuất mô hình, lệnh xây dựng engine TensorRT, cấu hình máy chủ và cấu hình máy khách MLPerf.
1. Sao chép (clone) TensorRT Edge-LLM và khởi tạo các mô-đun con của nó.
2. Tải xuống checkpoint NVFP4 đã được hiệu chuẩn.
3. Làm theo hướng dẫn trong mlperf/README.md để xây dựng TensorRT Edge-LLM, xuất checkpoint với giao diện tree-MTP và xây dựng các engine TensorRT cơ sở và nháp.
4. Khởi chạy máy chủ TensorRT Edge-LLM tương thích với OpenAI.
5. Sao chép bộ công cụ điểm cuối MLCommons, cài đặt các phụ thuộc BFCL của nó, cập nhật đường dẫn mô hình và tokenizer trong mlperf/config.yaml, sau đó chạy bài kiểm tra.
Cấu hình được cung cấp chạy các giai đoạn hiệu năng và độ chính xác với nhiệt độ (temperature) bằng 0, hạt giống (seed) 42, tắt suy luận và độ đồng thời (concurrency) là 1. Sử dụng tùy chọn --accuracy-only để chỉ chạy giai đoạn độ chính xác BFCL. Để biết thêm thông tin về tập dữ liệu và cấu hình máy khách, hãy xem ví dụ MLCommons Edge Agentic.
Để xem kết quả đầy đủ của MLPerf Inference v6.1 trên tất cả các bản đệ trình, hãy xem thông báo của MLCommons. Để biết hiệu năng Vera Rubin ở quy mô máy chủ, hãy xem bài viết "NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debut".
Lời cảm ơn: Công trình này đại diện cho sự đóng góp từ các nhóm TensorRT Edge-LLM, ModelOpt, Jetson và MLPerf tại NVIDIA, đặc biệt là Zihao Kong, Xiang Guo, Yoco Xiao, Qikai Li và Ashwin Nanjappa. Cảm ơn cộng đồng MLCommons vì đã phát triển bài kiểm tra Edge Agentic và bộ công cụ điểm cuối.
Bài viết được AI dịch và tổng hợp tự động từ NVIDIA Technical Blog: Agentic AI / Generative AI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.