NVIDIA Blog
92

Sản phẩm

NVIDIA Vera Rubin NVL72 thiết lập chuẩn mực mới: Hiệu suất xử lý AI Agent tăng gấp 30 lần

(giờ Việt Nam)

Tóm tắt AI

Dữ liệu từ NVIDIA cho thấy Vera Rubin NVL72 giúp tăng lưu lượng xử lý trên mỗi megawatt lên gấp 30 lần và giảm chi phí trên mỗi triệu token xuống 35 lần so với thế hệ GB300 NVL72.

Bản dịch AI

Up to 30x More Work Per Watt: NVIDIA Vera Rubin NVL72 Sets a New Efficiency Standard for AI Agents

Theo dữ liệu từ OpenRouter, các khối lượng công việc (workload) của agentic AI tiêu thụ lượng token gấp 15 lần so với một yêu cầu trò chuyện (chat request) thông thường. Tại sao lại như vậy?

Hãy xem xét những gì xảy ra khi một AI agent nghiên cứu về một công ty để đưa ra quyết định đầu tư. Agent này truy vấn các cơ sở dữ liệu tài chính, tìm kiếm tin tức và hồ sơ, gọi một sub-agent để chạy các so sánh đối chiếu và mô hình định giá, sau đó tổng hợp mọi thứ thành một bản khuyến nghị. Các agent và sub-agent liên tục suy luận cho đến khi hoàn thành nhiệm vụ, dẫn đến nhu cầu về token tăng cao. Với mỗi bước, các token tích lũy trở thành đầu vào cho bước tiếp theo, khiến việc xử lý ngữ cảnh dài (long-context) trở thành yếu tố then chốt đối với hiệu suất của agentic AI.

Mô hình tương tự cũng diễn ra trên mọi trường hợp sử dụng agentic, từ phát triển phần mềm, dịch vụ khách hàng cho đến nghiên cứu chuyên sâu.

Khi agentic AI được đưa vào vận hành thực tế trên khắp các ngành công nghiệp, cơ sở hạ tầng chạy các hệ thống này cần phải đáp ứng nhu cầu về token đó một cách hiệu quả.

Dữ liệu hiệu suất mới được đo lường cho thấy các hệ thống NVIDIA Vera Rubin NVL72 mang lại thông lượng trên mỗi megawatt cao gấp 30 lần so với NVIDIA GB300 NVL72 đối với các khối lượng công việc agentic. NVIDIA đã đo lường dữ liệu thông lượng suy luận này bằng cách sử dụng khối lượng công việc SemiAnalysis AgentX, bao gồm các phiên lập trình agentic thực tế đã được ghi lại, với sự bảo toàn về mức tăng trưởng ngữ cảnh thực tế, các lệnh gọi công cụ (tool calls) và việc tạo sub-agent. Đối với các nhà máy AI bị hạn chế về điện năng, điều đó chuyển đổi trực tiếp thành khả năng thực hiện khối lượng công việc agentic gấp 30 lần với cùng một mức tiêu thụ năng lượng.

Những kết quả ban đầu cho Vera Rubin NVL72 này chứng minh tốc độ đổi mới vượt bậc của NVIDIA. Với các tối ưu hóa phần mềm liên tục, hiệu suất trên cả Vera Rubin NVL72 và GB300 NVL72 sẽ tiếp tục được cải thiện.

Vera Rubin NVL72: Thông lượng trên mỗi Megawatt cao gấp 30 lần và chi phí token thấp hơn 35 lần.

Các khối lượng công việc agentic có đặc điểm khác biệt cơ bản so với trò chuyện hoặc tóm tắt tài liệu, nơi các chuỗi đầu vào và đầu ra thường dao động từ 1K đến 8K token. Trong các phiên agentic, ngữ cảnh tích lũy qua từng bước và có thể đạt tới hàng trăm nghìn token đầu vào, với sự biến thiên lớn về độ dài đầu vào và đầu ra giữa các yêu cầu. Việc đo lường hiệu suất phải phát triển để nắm bắt toàn bộ quy trình làm việc của agent thay vì chỉ một yêu cầu suy luận đơn lẻ.

Các kết quả dưới đây phản ánh hiệu suất được đo lường trên các quỹ đạo lập trình agentic trong thế giới thực.

Trong SemiAnalysis AgentX, nền tảng NVIDIA Blackwell mang lại hiệu suất hàng đầu trên nhiều mô hình agentic bao gồm Kimi K3, MiniMax M3, GLM5.3, Qwen3.5 và DeepSeek V4 Pro.

Ví dụ, GB300 NVL72 mang lại thông lượng trên mỗi megawatt cao gấp 15 lần so với kiến trúc NVIDIA Hopper trên mô hình DeepSeek V4 Pro, cung cấp cho khách hàng một nền tảng hiệu suất cao để chạy các khối lượng công việc agentic. Bước tiến này phản ánh lợi thế của miền GPU quy mô lớn (scale-up GPU domain) và phần mềm được đồng thiết kế (codesigned) trong việc mang lại hiệu quả suy luận vượt trội đáng kể.

Vera Rubin mở rộng lợi thế đó, nâng cao hiệu suất trên toàn bộ đường cong Pareto, để mang lại thông lượng trên mỗi megawatt cao gấp 30 lần so với GB300 NVL72 trên mô hình DeepSeek V4 Pro. Những kết quả ban đầu này, được đo lường bằng khối lượng công việc SemiAnalysis AgentX và hiện đang chờ SemiAnalysis xem xét, vẫn chưa phản ánh hiệu suất của Vera CPU đối với việc gọi công cụ.

Các công nghệ NVIDIA DSX MaxLPS quản lý điện năng trên các cấp độ GPU, rack và khối lượng công việc để cung cấp thêm tới 40% số lượng GPU trong cùng một ngân sách megawatt, đẩy thông lượng trên mỗi megawatt lên cao hơn nữa ở quy mô nhà máy AI.

Thông lượng trên mỗi megawatt cũng tác động trực tiếp đến chi phí của mỗi token được tạo ra. Với chi phí trên mỗi triệu token thấp hơn tới 35 lần so với GB300 NVL72, Vera Rubin NVL72 có thể chạy các agent liên tục, trên quy mô lớn, trên toàn bộ phạm vi khối lượng công việc của khách hàng.

Đối với các nhà máy AI bị hạn chế về điện năng, thông lượng trên mỗi megawatt quyết định doanh thu của nhà máy AI và chi phí trên mỗi triệu token quyết định biên lợi nhuận trên doanh thu đó.

Đồng thiết kế cực hạn (Extreme Codesign) cho quy mô Agentic.

Tối ưu hóa suy luận hiện đại bao gồm một loạt các kỹ thuật đặc biệt quan trọng đối với agentic AI. NVIDIA Vera Rubin NVL72 cho phép thực hiện tất cả những điều này và hơn thế nữa thông qua việc đồng thiết kế cực hạn trên mọi lớp của nền tảng để mang lại hiệu suất tăng gấp nhiều lần.

Các Tensor Core thế hệ thứ năm được tăng cường và Transformer Engine thế hệ thứ ba của GPU NVIDIA Rubin giúp tăng tốc cả giai đoạn prefill và decode của quá trình suy luận. Định lượng NVFP4 nén trọng số mô hình xuống độ chính xác 4-bit, giảm dung lượng bộ nhớ và tăng thông lượng mà không làm giảm chất lượng đầu ra.

Miền scale-up NVL72, một kiến trúc mang tính định hình trên Vera Rubin và Grace Blackwell, cho phép giao tiếp liên GPU với băng thông cao và độ trễ thấp, vốn rất cần thiết cho các kỹ thuật như song song hóa chuyên gia quy mô lớn (large-scale expert parallelism) và bộ nhớ đệm KV phân tán (distributed KV-caching). Được xây dựng có mục đích để cung cấp năng lượng cho miền scale-up này, công nghệ kết nối NVIDIA NVLink và các NVLink Switch, hiện đã ở thế hệ thứ sáu, mang lại tốc độ gói tin cao gấp 10 lần và độ trễ thấp hơn 3 lần so với các giải pháp thay thế Ethernet thương mại.

Trải dài từ các nhân CUDA được tối ưu hóa, các runtime suy luận như NVIDIA TensorRT LLM và các framework phục vụ như NVIDIA Dynamo, ngăn xếp phần mềm của NVIDIA được đồng thiết kế với phần cứng để cho phép tối ưu hóa suy luận.

Mặc dù các kết quả trên phản ánh hiệu suất hiện tại của Vera Rubin NVL72, nhưng toàn bộ nền tảng là một kiến trúc bảy chip bao gồm cả NVIDIA Vera CPU, Groq 3 LPU, NVLink 6 Switch, BlueField-4 DPU, Spectrum-6 SPX và ConnectX-9 SuperNIC, tất cả đều được xây dựng có mục đích cho các nhà máy AI triển khai các agent ở quy mô lớn.

Đồng thiết kế cực hạn cũng mở rộng sang sự hợp tác kỹ thuật giữa NVIDIA và các đối tác của mình. Vera Rubin đang được sản xuất hàng loạt và đang mở rộng quy mô trên toàn hệ sinh thái.

Tìm hiểu thêm về nền tảng NVIDIA Vera Rubin.

NVIDIAVera RubinAI AgentPhần cứng AIHiệu suất
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ NVIDIA Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.