NVIDIA Blog
92

Mô hình

NVIDIA Vera Rubin NVL72 ra mắt ấn tượng tại MLPerf v6.1: Hiệu năng vượt trội gấp 3.7 lần

(giờ Việt Nam)

Tóm tắt AI

Hệ thống Vera Rubin NVL72 lần đầu xuất hiện tại MLPerf Inference v6.1, đạt tốc độ xử lý nhanh gấp 3.7 lần so với GB300 NVL72 trên mô hình Qwen3-VL và 2.5 lần trên DeepSeek-R1.

Bản dịch AI

NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debut

Hiệu suất hệ thống, khả năng mở rộng cơ sở hạ tầng hiệu quả và tối ưu hóa phần mềm liên tục là những đòn bẩy then chốt quyết định tính kinh tế của suy luận AI (AI inference). Hiệu suất hệ thống cao hơn đồng nghĩa với việc tạo ra nhiều token hơn, dẫn đến doanh thu cao hơn. Khả năng mở rộng hiệu quả có nghĩa là thông lượng tăng tỷ lệ thuận khi bổ sung phần cứng, đòi hỏi ít tài nguyên hơn để phục vụ người dùng ở quy mô lớn. Tối ưu hóa liên tục đồng nghĩa với việc tạo ra nhiều giá trị hơn từ các khoản đầu tư vào cơ sở hạ tầng.

Nền tảng cho cả ba yếu tố trên là tính linh hoạt của nền tảng (platform fungibility): cùng một cơ sở hạ tầng có thể chạy bất kỳ mô hình nào, bất kỳ khối lượng công việc nào, từ huấn luyện đến suy luận, từ hệ thống gợi ý đến lập luận, từ ngôn ngữ đến video, giúp duy trì mức độ sử dụng cao.

Nền tảng NVIDIA được xây dựng có mục đích để tối ưu hóa trên tất cả các khía cạnh này, như được nêu bật bởi kết quả MLPerf Inference v6.1 được công bố hôm nay:

Đối với các tổ chức đang đưa ra quyết định về cơ sở hạ tầng AI, hiệu suất, hiệu quả mở rộng và tốc độ phần mềm là những cân nhắc quan trọng quyết định tính kinh tế của suy luận trong dài hạn.

NVIDIA đã gửi kết quả thử nghiệm sớm của Vera Rubin NVL72 trên hai trong số các tiêu chuẩn đánh giá khắt khe nhất trong bộ MLPerf Inference v6.1: DeepSeek-R1 và Qwen3-VL.

Vera Rubin NVL72 mang lại thông lượng cao hơn tới 3,7 lần so với GB300 NVL72 trên Qwen3-VL trong các kịch bản ngoại tuyến (offline), máy chủ (server) và tương tác (interactive), sử dụng vLLM với khung suy luận mã nguồn mở NVIDIA Dynamo. Trên DeepSeek-R1, sử dụng thư viện NVIDIA TensorRT-LLM, thông lượng cao hơn tới 2,5 lần so với GB300 NVL72. Những kết quả ban đầu này cho thấy tốc độ đổi mới nhanh chóng của NVIDIA và cách hiệu suất sẽ cải thiện nhờ các tối ưu hóa phần mềm liên tục.

Hiệu suất này đồng nghĩa với việc mỗi rack Vera Rubin NVL72 cung cấp số lượng token nhiều hơn đáng kể, phục vụ nhiều người dùng hơn và tạo ra nhiều doanh thu hơn so với một rack GB300 NVL72, đồng thời giảm chi phí trên mỗi token.

Các kết quả này phản ánh sự đồng thiết kế (codesign) toàn diện giữa phần cứng và phần mềm. Tensor Cores và Transformer Engine nâng cao của Vera Rubin tăng tốc cả giai đoạn tiền nạp (prefill) và giải mã (decode) của quá trình suy luận, trong khi độ chính xác NVFP4 giúp giảm dung lượng bộ nhớ trên các trọng số mô hình, cơ chế attention và KV cache — từ đó tăng thông lượng với mức suy giảm chất lượng đầu ra tối thiểu.

Các bài nộp của Vera Rubin đã sử dụng triệt để phương pháp phục vụ phân tách (disaggregated serving), tách biệt giai đoạn tiền nạp và giải mã cùng với kỹ thuật song song chuyên gia quy mô lớn (large-scale expert parallelism) để đạt hiệu suất tối đa trên các lớp hỗn hợp chuyên gia (mixture-of-experts) vốn cung cấp sức mạnh cho các mô hình như DeepSeek-R1 và Qwen3-VL.

Miền mở rộng quy mô NVL72 — được hỗ trợ bởi NVIDIA NVLink thế hệ thứ sáu và NVLink Switch để mang lại tốc độ gói tin cao hơn 10 lần và độ trễ thấp hơn 3 lần so với Ethernet thông thường — cung cấp nền tảng kết nối giúp các kỹ thuật này trở nên hiệu quả ở quy mô rack.

Sự đồng thiết kế này mở rộng đến hệ sinh thái đối tác của NVIDIA: Nebius cũng đã gửi kết quả thử nghiệm sớm của Vera Rubin NVL72 và chứng minh hiệu suất tuyệt vời.

Các tác nhân AI (AI agents), vốn có khả năng lập luận, lập kế hoạch và hành động qua nhiều bước, đang định hình lại cách đo lường hiệu suất suy luận. Trong các tiêu chuẩn đánh giá được thiết kế để nắm bắt sự thay đổi này, chẳng hạn như SemiAnalysis AgentX, Vera Rubin NVL72 đã mang lại hiệu suất tốt hơn 30 lần so với GB300 NVL72 trong thử nghiệm sớm. Ngoài ra, tiêu chuẩn đánh giá MLPerf Endpoints sắp tới sẽ mang lại phép đo tiêu chuẩn hóa cho các khối lượng công việc suy luận tác nhân (agentic inference), vượt xa những gì các tiêu chuẩn thông lượng truyền thống có thể nắm bắt.

NVIDIA GB300 NVL72 mở rộng quy mô với hiệu suất hàng đầu

Hiệu quả mở rộng (scaling efficiency) — mức độ hiệu quả mà việc bổ sung GPU chuyển đổi thành mức tăng thông lượng — là thước đo chính về năng suất cơ sở hạ tầng AI. NVIDIA đạt được điều này nhờ các kết nối mở rộng quy mô băng thông cao, độ trễ thấp trong mỗi rack, mạng băng thông cao giữa các rack và khả năng điều phối yêu cầu hiệu quả giữa các nút.

Bài nộp DeepSeek-R1 (DSR1) của NVIDIA đã mở rộng từ một rack GB300 NVL72 duy nhất (72 GPU) lên bốn rack (288 GPU), đạt hiệu quả mở rộng 99% trong kịch bản ngoại tuyến. Thông lượng tăng gần như tỷ lệ thuận với phần cứng được bổ sung.

Hiệu quả mở rộng là yếu tố then chốt vì việc có nhiều GPU hơn không tự động đồng nghĩa với việc thông lượng tăng tỷ lệ thuận. Nếu việc tăng gần gấp đôi số lượng GPU chỉ mang lại mức cải thiện thông lượng ở con số đơn vị phần trăm, thì chi phí cơ sở hạ tầng sẽ vượt xa lợi nhuận hiệu suất. Kiến trúc, kết nối và phần mềm đều phải cùng nhau mở rộng.

GB300 NVL72 cũng chứng minh hiệu quả ở quy mô rack trên tiêu chuẩn đánh giá chuyển đổi văn bản thành video WAN 2.2, đạt 0,65 video 720p mỗi giây với thời gian 5,7 giây mỗi video — thông lượng cao hơn 9 lần và độ trễ thấp hơn 7,5 lần so với một nút đơn lẻ.

Tối ưu hóa phần mềm thúc đẩy những cải tiến liên tục

Nền tảng NVIDIA trải qua quá trình phát triển phần mềm liên tục, mang lại những cải tiến về hiệu suất và tính năng.

Trong phiên bản v6.1, hiệu suất của GB300 NVL72 trên Qwen3-VL đã cải thiện tới 1,6 lần so với kết quả v6.0. Những cải tiến này đạt được nhờ độ chính xác KV cache thấp hơn, hợp nhất nhân (kernel fusion) bổ sung, các nhân (kernel) tốt hơn và phục vụ phân tách với vLLM và NVIDIA Dynamo.

Tối ưu hóa phần mềm vẫn tiếp tục sau thời hạn nộp bài v6.1. Các kết quả sau khi nộp, chưa được MLCommons xác minh, trên GPT-OSS-120B và DLRMv3 cho thấy những cải thiện hiệu suất hơn nữa.

Suy luận AI ở mọi quy mô

Ngoài các kết quả của nền tảng NVIDIA Grace Blackwell và Vera Rubin NVL72, NVIDIA đã gửi kết quả của Jetson AGX Thor sử dụng NVIDIA TensorRT Edge-LLM trên tiêu chuẩn đánh giá Edge-Agentic mới được giới thiệu với Qwen3.6-27B.

Hệ sinh thái đối tác của NVIDIA đã tham gia rộng rãi, với 19 đối tác — trong đó có 8 đối tác sử dụng hệ thống Blackwell NVL72 đa nút — chứng minh hiệu suất tuyệt vời. Danh sách này bao gồm ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro và Wiwynn.

Từ các thiết bị biên nhỏ gọn đến các nhà máy AI lớn nhất, NVIDIA tiếp tục nâng cao hiệu suất trên toàn bộ hệ thống công nghệ với lộ trình kiến trúc nền tảng hàng năm, phần mềm cải tiến liên tục và một hệ sinh thái được xây dựng để cung cấp các giải pháp đó ở quy mô lớn.

Tìm hiểu thêm về nền tảng NVIDIA Vera Rubin.

NVIDIAVera RubinMLPerfPhần cứng AIHiệu năng
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ NVIDIA Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.