NVIDIA Blog
92

Sản phẩm

NVIDIA ra mắt NVLink Fusion: Đưa chip tùy chỉnh vào hệ sinh thái AI đẳng cấp thế giới

(giờ Việt Nam)

Tóm tắt AI

NVIDIA giới thiệu NVLink Fusion, cho phép tích hợp các chip tùy chỉnh (XPU) vào mạng lưới NVLink, giúp giảm độ trễ gấp 3 lần và tăng tốc độ truyền dữ liệu gấp 10 lần so với giải pháp Ethernet truyền thống.

Bản dịch AI

How XPUs Meet a World-Class AI Factory

Để tạo ra trí tuệ nhân tạo ở quy mô lớn, các nhà máy AI phải vận hành liên tục và hiệu quả kinh tế của chúng được xác định bởi đầu ra thực tế: số token mỗi giây, số token mỗi watt, chi phí trên mỗi token, hiệu suất sử dụng và thời gian hoạt động.

Điều đó đòi hỏi cơ sở hạ tầng AI phải được thiết kế và xây dựng như một nhà máy hoàn chỉnh, thay vì chỉ là tập hợp các bộ tăng tốc riêng lẻ.

Các đơn vị cung cấp dịch vụ đám mây quy mô lớn (hyperscalers) và các công ty AI-native đang xây dựng XPU tùy chỉnh không chỉ cần cân nhắc thiết kế XPU, mà còn phải chú trọng thiết kế và phát triển toàn bộ nền tảng AI, bao gồm mạng lưới scale-up và scale-out, kiến trúc rack-scale, phần mềm vận hành nhà máy và một hệ sinh thái nhà cung cấp vững mạnh.

Ở quy mô nhà máy AI, lộ trình này rất phức tạp và tốn kém, đồng thời là rào cản cơ bản khiến việc đưa XPU ra thị trường trở nên chậm chạp.

Phá vỡ rào cản này đồng nghĩa với việc kết hợp các XPU tùy chỉnh với cơ sở hạ tầng đã được kiểm chứng và hoàn thiện — cho phép các nhà phát triển tập trung đổi mới vào những phần quan trọng nhất, đồng thời tận dụng công nghệ đã thiết lập sẵn cho các phần còn lại.

NVLink Fusion đáp ứng nhu cầu đó bằng cách kết nối các XPU với cơ sở hạ tầng AI hàng đầu thế giới của NVIDIA để tăng hiệu suất, đẩy nhanh thời gian đưa sản phẩm ra thị trường và giảm thiểu rủi ro cho các nhà máy AI bán tùy chỉnh (semi-custom).

Mở khóa hiệu suất XPU với khả năng Scale-Up tốc độ cao

Đối với các khối lượng công việc hiện đại như chạy các mô hình hàng nghìn tỷ tham số, kiến trúc mixture-of-experts và AI tác nhân (agentic AI), nếu cấu trúc scale-up không theo kịp, hiệu suất sử dụng sẽ giảm và chi phí trên mỗi token sẽ tăng lên.

Một giải pháp mạng scale-up phải vượt trội trên ba phương diện:

Ví dụ, NVLink Fusion đưa các XPU vào miền scale-up NVLink của NVIDIA. NVLink thế hệ thứ sáu cung cấp mạng lưới băng thông cao, độ trễ thấp hàng đầu trên miền 72-XPU. Độ trễ đầu cuối cho các truyền tải XPU-to-XPU thấp hơn 3 lần so với các giải pháp thay thế dựa trên Ethernet thương mại, và tốc độ gói tin cao hơn 10 lần.

Để đạt hiệu suất đầu cuối tối ưu, các hệ thống NVIDIA GB300 NVL72 giúp mang lại thông lượng cao hơn đáng kể và khả năng tương tác tốt hơn so với các cấu hình không sử dụng NVL72, và các cấu hình trong lộ trình NVLink tương lai bao gồm các miền lên tới 1.152 bộ tăng tốc và công nghệ quang học tích hợp (co-packaged optics).

A Pareto chart comparing GB300 NVL72 with B300 inference throughput performance in tokens per second per GPU on DeepSeek-V4-Pro at ISL=1K and OSL=1K sampled at various interactivity points in tokens p

NVLink Fusion cũng bao gồm NVIDIA NVLink-C2C để kết nối XPU với CPU NVIDIA Vera hoặc các CPU khác trong hệ sinh thái, mang lại hiệu suất năng lượng cao gấp 6 lần so với giao diện PCIe — giúp loại bỏ rào cản giữa khả năng điều khiển và tính toán cho các hệ thống AI tác nhân.

Một nền tảng và hệ sinh thái đã được kiểm chứng cho việc phát triển và triển khai

Các đội ngũ phát triển XPU tùy chỉnh thường đánh giá thấp nỗ lực và sự phức tạp trong việc chuyển đổi từ đổi mới XPU sang triển khai tại trung tâm dữ liệu. Điều này bao gồm:

Nền tảng lý tưởng cung cấp tất cả những điều này, cho phép các đội ngũ tập trung vào đổi mới có mục tiêu trong khi sử dụng các giải pháp đã được kiểm chứng cho phần còn lại.

NVLink Fusion được hỗ trợ bởi một hệ sinh thái được thiết kế để phát triển, tích hợp và triển khai nhanh chóng, bao gồm các đối tác về thiết kế ASIC, CPU, IP và kết nối quang học.

"NVLink Fusion mang đến cho khách hàng khả năng lựa chọn kiến trúc CPU, mức hiệu suất và các tính năng phần mềm đáp ứng tốt nhất nhu cầu của họ đối với các khối lượng công việc mà họ quan tâm," Tim Wilson, phó chủ tịch kiêm tổng giám đốc bộ phận kỹ thuật silicon trung tâm dữ liệu tại Intel cho biết.

Những người áp dụng NVLink Fusion cũng có thể sử dụng kiến trúc rack-scale NVIDIA MGX và cùng chuỗi cung ứng được sử dụng cho các hệ thống dựa trên MGX như NVIDIA Vera Rubin NVL72. Các đối tác sản xuất quản lý việc thiết kế và tích hợp, trong khi các nhà cung cấp MGX cung cấp các khối xây dựng cho rack, hệ thống làm mát, nguồn điện và các thiết kế 800 VDC mới nổi.

"Với Vera Rubin [NVL72], chúng tôi đang hướng tới việc tự động hóa gần như 100% quá trình xây dựng hệ thống trên dây chuyền sản xuất," Jack Luoh, giám đốc sản phẩm và giải pháp tại QCT và Quanta Computer cho biết. "Hầu hết các khoản đầu tư đó có thể được tận dụng nếu XPU sử dụng NVLink Fusion."

Quản lý rủi ro với tiêu chuẩn hóa cơ sở hạ tầng

Việc lập kế hoạch nhà máy AI không chờ đợi silicon. Việc mua sắm điện năng, thiết kế cơ sở, làm mát, bố trí rack và kiến trúc mạng bắt đầu từ rất lâu trước khi có được sự kết hợp bộ tăng tốc cuối cùng. Một trung tâm dữ liệu bị khóa chặt vào một loại chip có thể trở thành rủi ro về tiến độ.

Các khối lượng công việc khác nhau có thể ưu tiên các bộ tăng tốc khác nhau, bao gồm XPU, GPU, CPU và LPU. Các hệ thống GPU có thể hoạt động song song với các hệ thống bán tùy chỉnh cho việc huấn luyện, hậu huấn luyện, suy luận, truy xuất và phục vụ.

NVLink Fusion giải quyết những thách thức này thông qua một kiến trúc thống nhất. Các hệ thống dựa trên XPU và GPU như Vera Rubin NVL72 có thể chia sẻ không gian rack, mạng lưới, làm mát, phân phối điện và hệ thống quản lý. Các nhà vận hành có thể tiến hành xây dựng trong khi vẫn trì hoãn việc quyết định sự kết hợp silicon chính xác, sau đó tái phân bổ năng lực khi nhu cầu công việc, nguồn cung silicon và ưu tiên kinh doanh thay đổi.

"Giá trị của chương trình NVLink Fusion là... [khách hàng] có thể triển khai giải pháp cấp rack của họ với GPU NVIDIA, và sau đó họ có thể tách biệt quá trình phát triển XPU của riêng mình và thực hiện theo một nhịp độ khác," Vince Hu, phó chủ tịch cấp cao tập đoàn kiêm tổng giám đốc nhóm kinh doanh trung tâm dữ liệu và điện toán tại MediaTek cho biết.

"NVLink Fusion cho phép các hyperscalers hoặc các nhà thiết kế ASIC tùy chỉnh tích hợp CPU hoặc XPU tùy chỉnh của riêng họ và kết nối công nghệ NVIDIA với quy trình của bên thứ ba để tạo ra một kiến trúc rack-scale thống nhất," Lie-Szu Juang, chủ tịch kiêm giám đốc chiến lược tại GUC cho biết.

Được thiết kế, xác thực và vận hành như một nhà máy

Việc xây dựng nhà máy rất tốn kém và những sai lầm có thể đòi hỏi phải làm lại rất đắt đỏ. Cơ sở hạ tầng phải được xác thực trước khi bắt đầu xây dựng. NVLink Fusion phù hợp với kiến trúc tham chiếu NVIDIA DSX cho các nhà máy AI: đồng thiết kế tòa nhà, điện năng, làm mát, tính toán và mạng lưới. NVIDIA Omniverse DSX AI Factory Blueprint cung cấp một bản sao kỹ thuật số (digital twin) và thiết kế tham chiếu mở cho các nhà máy AI quy mô gigawatt, cho phép các đối tác mô hình hóa cơ sở và công nghệ cùng nhau trước khi triển khai.

Ở cấp độ rack, khả năng bảo trì là một phần của hiệu suất. Các khay tính toán tham chiếu có tính năng làm mát bằng chất lỏng 100% không quạt, không cáp hoặc ống dẫn, và cho phép tháo rời các khay trong khi phần còn lại của rack vẫn hoạt động. Các khay NVLink Switch cũng được làm mát bằng chất lỏng và hỗ trợ hoạt động liên tục trong quá trình bảo trì.

"Với NVLink Fusion, chúng tôi có thể sử dụng thiết kế rack NVL72 đã được kiểm chứng để rút ngắn thời gian đưa sản phẩm ra thị trường, và chúng tôi có thể tiếp cận nhiều nhà cung cấp để giúp chúng tôi mang lại nhiều giá trị hơn cho khách hàng của mình," CC Lee, quản lý phát triển phần cứng cấp cao tại Annapurna Labs, một công ty của Amazon cho biết.

Phần mềm hoàn thiện nhà máy. NVIDIA NCCL cho các khối lượng công việc phân tán, NVIDIA Dynamo và NIXL cho việc phân tách (disaggregation), và NVIDIA Mission Control cho quản lý cụm, đo từ xa và gỡ lỗi giúp các nhà vận hành chạy cơ sở hạ tầng AI hỗn hợp như một hệ thống phối hợp.

Với NVLink Fusion, các XPU giờ đây có thể đáp ứng một nền tảng AI đẳng cấp thế giới, cho phép các hyperscalers và các công ty AI-native xây dựng các nhà máy AI bán tùy chỉnh, thống nhất, kết hợp thế mạnh của nhiều nhà xây dựng thành một cơ sở hạ tầng mà không một công ty nào có thể tự mình xây dựng.

Tìm hiểu thêm về NVLink Fusion.

NVIDIANVLinkPhần cứng AIXPUHạ tầng AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ NVIDIA Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.