NVIDIA Blog
92

Tin ngành

NVIDIA tối ưu hóa hiệu suất trung tâm dữ liệu: Biến điện năng thành sức mạnh xử lý token

(giờ Việt Nam)

Tóm tắt AI

Tại AI Infra Summit, NVIDIA công bố công nghệ DSX MaxLPS giúp cụm máy chủ HGX B200 tăng 24% lưu lượng token và cải thiện 23% hiệu suất trên mỗi watt điện, cho phép chạy nhiều node hơn với cùng mức ngân sách năng lượng.

Bản dịch AI

From Megawatts to Tokens: How NVIDIA Maximizes AI Factory Production

Vào một buổi tối tháng Tám oi ả ở Thung lũng Silicon, khi mặt trời lặn và nhu cầu sử dụng điều hòa tăng vọt, Silicon Valley Power đã gửi tín hiệu đến một nhà máy AI để điều chỉnh mức tiêu thụ điện năng.

Varun Sivaram đã theo dõi qua Zoom cùng khoảng bốn mươi người khác — bao gồm đội ngũ của ông tại Emerald AI trong phòng họp ở San Francisco, các kỹ sư tại trung tâm dữ liệu và đại diện từ chính công ty điện lực. Không ai phải chạm tay vào bất cứ thứ gì.

Nền tảng Conductor của Emerald AI — một nền tảng điều phối lưới điện từ đối tác của NVIDIA là Emerald AI, và là ví dụ sớm nhất về loại hình linh hoạt mà NVIDIA DSX Flex được xây dựng để cung cấp — nhận các tín hiệu về tình trạng lưới điện và điều chỉnh khối lượng công việc tính toán linh hoạt của trung tâm dữ liệu. Những công việc có thể chờ đợi sẽ được làm chậm lại hoặc lên lịch lại, trong khi các dịch vụ ưu tiên cao hơn vẫn tiếp tục hoạt động.

Mục tiêu là giảm nhu cầu điện năng khi lưới điện bị hạn chế mà không làm gián đoạn các khối lượng công việc AI quan trọng — chính xác là những gì Silicon Valley Power cần.

Khi mức giảm hiển thị trên màn hình, tất cả mọi người đều reo hò.

“Chúng tôi đã theo dõi trong sự nín thở,” Sivaram nói. “Đây là lần đầu tiên chúng tôi triển khai trên hàng ngàn GPU NVIDIA.” Giám đốc sản phẩm của ông, Mansi Shah, đã rất xúc động. “Cảm giác này giống như một vụ phóng tên lửa của SpaceX vậy,” cô nói.

Kể từ đó, Silicon Valley Power đã gửi hơn 200 tín hiệu nhu cầu đến nhà máy AI đó. Lần nào cũng thành công.

Đây chính là sự linh hoạt của lưới điện trong thực tế sản xuất. Và nó chỉ ra một điều lớn lao hơn nhiều so với một cơ sở đơn lẻ ở Santa Clara: một con đường để khai mở nguồn năng lượng mà các nhà máy AI của Mỹ cần, mà không phải chờ đợi cả thập kỷ để xây dựng các đường dây truyền tải mới.

Tại hội nghị AI Infra Summit vào thứ Ba, Ian Buck, Phó chủ tịch phụ trách mảng hyperscale và điện toán hiệu năng cao của NVIDIA, đã lấy hiệu suất của nhà máy AI làm trọng tâm trong bài phát biểu chính về cơ sở hạ tầng của mình.

Kết quả từ đợt xác thực đầu tiên của nhà cung cấp đám mây Lambda trong môi trường triển khai, được công bố cùng ngày, đã đưa ra những con số cụ thể: một ngân sách điện năng cố định có thể hỗ trợ lưu lượng token cao hơn 24% khi được quản lý một cách thông minh.

“Với bằng chứng khái niệm của mình, chúng tôi tin rằng mình đã vượt qua giới hạn của ngân sách điện năng cố định,” Dave Ward, Chủ tịch dịch vụ đám mây tại Lambda cho biết. “NVIDIA DSX MaxLPS mở đường cho việc thu hồi công suất bị lãng phí và chuyển đổi nó thành mức sử dụng thực tế, với mật độ tính toán cao hơn đáng kể trên cùng một diện tích.”

Vào buổi tối tháng Tám đó, khi SVP gọi đến, Conductor đã thực thi dựa trên một hệ thống phân cấp khối lượng công việc được xác định trước: các tác vụ ưu tiên thấp nhất được nhường chỗ, các tác vụ suy luận (inference) ưu tiên cao vẫn tiếp tục chạy, và điện năng giảm từ bốn megawatt xuống còn ba. Hoàn toàn tự động. Không cần sự can thiệp của người vận hành.

Trong nền kinh tế nhà máy AI, điện năng là yếu tố hạn chế. Công việc trên mỗi gigawatt là thước đo. Các nhà vận hành trung tâm dữ liệu rất tỉ mỉ về hiệu suất — mỗi watt được sử dụng là một watt mang lại hiệu quả tính toán, và ngành công nghiệp này đã đạt được những bước tiến đáng kể ở mọi tầng của hệ thống, từ thiết kế cơ sở vật chất đến chuyển đổi điện năng ở cấp độ rack.

DSX mở rộng kỷ luật đó vào chính khối lượng công việc AI. Việc cung cấp tài nguyên rack thông minh hơn giúp đưa điện năng đến nơi mà khối lượng công việc thực sự cần. Trí tuệ vận hành — lập lịch chặt chẽ hơn, khởi động lại nhanh hơn, kiểm tra checkpoint tinh gọn hơn — giúp các GPU luôn hoạt động thay vì phải chờ đợi. Mục tiêu vẫn là điều mà các nhà vận hành luôn theo đuổi: làm được nhiều việc hơn từ nguồn điện hiện có.

“Một nhà máy một gigawatt sẽ không bao giờ trở thành một nhà máy hai gigawatt,” nhà sáng lập kiêm CEO của NVIDIA, Jensen Huang, từng nói.

Câu trả lời mà các kỹ sư tìm ra khi hệ thống chạm đến giới hạn vật lý luôn giống nhau: ngừng tối ưu hóa từng phần và bắt đầu thiết kế toàn bộ hệ thống.

Được giới thiệu tại GTC Taipei vào tháng 5, NVIDIA DSX chính là câu trả lời đó cho nhà máy AI — và các đợt triển khai sớm đang chứng minh điều này.

Nền tảng toàn diện bao gồm mạng, làm mát, hiệu quả sử dụng nước và thiết kế cơ sở vật chất; các phần dưới đây tập trung vào một số kết quả đạt được cho đến nay trong quản lý điện năng và tham gia vào lưới điện.

Nhiều tính toán hơn, cùng một ngân sách: DSX MaxLPS

Kết quả của Lambda, được công bố tại AI Infra Summit, là sự xác thực đầu tiên của DSX MaxLPS trên các máy chủ GPU NVIDIA HGX B200.

DSX MaxLPS giám sát mức tiêu thụ điện năng của GPU và cấp độ rack, đồng thời phân bổ lại khoảng dự phòng giữa các node dựa trên loại khối lượng công việc, thu hồi công suất mà việc cung cấp tài nguyên tĩnh thường bỏ phí. Quá trình huấn luyện và suy luận tiêu thụ điện năng khác nhau; MaxLPS tối ưu hóa việc phân bổ trong các nhà máy AI chạy cả hai tác vụ này.

Lambda, một nhà cung cấp đám mây GPU phục vụ hơn 10.000 khách hàng từ các startup AI đến các đơn vị hyperscaler, đã chạy phần mềm trên một cụm 5 rack, 19 node.

Kết quả họ tìm thấy: bằng cách chạy 19 node trong cùng ngân sách điện năng với 16 node ở công suất tối đa, Lambda đã đạt được lưu lượng token trên toàn cụm cao hơn 24% — từ khoảng 4 triệu token mỗi giây lên 5 triệu. Hiệu suất trên mỗi watt cải thiện 23%.

Dựa trên dự báo của NVIDIA, DSX MaxLPS có thể cho phép tăng tới 40% công suất GPU cho các nhà máy AI Vera Rubin NVL72 thế hệ tiếp theo trong cùng một ngân sách megawatt tại các môi trường triển khai phù hợp.

Phản hồi nhu cầu tự động, đã được chứng minh trong thực tế sản xuất

Câu chuyện ở Santa Clara không phải là một bản cài đặt DSX Flex — đó là một điều gì đó sớm hơn và quan trọng hơn: bằng chứng cho thấy khái niệm này hoạt động ở quy mô thương mại. Nhà máy AI Eos của NVIDIA đang chạy Emerald AI Conductor như một bên tham gia vào Chương trình Kết nối Tải linh hoạt (Flexible Load Interconnect Program) của Silicon Valley Power, chương trình tiện ích lưới điện thương mại đầu tiên được thiết kế để coi các nhà máy AI là các nguồn tài nguyên có thể điều phối.

Khi Silicon Valley Power gửi tín hiệu, Conductor phản hồi trong vòng chưa đầy một phút. Nhà máy sẵn sàng linh hoạt sẽ được phép vận hành ở quy mô lớn hơn.

Đó là mô hình mà DSX Flex được xây dựng để khái quát hóa — với việc Emerald AI Conductor tích hợp vào DSX Flex khi nền tảng này hoàn thiện. Việc triển khai thương mại DSX Flex chuyên dụng đầu tiên sẽ là cơ sở tại Manassas, Virginia: một nhà máy AI Vera Rubin 96 megawatt tại Trung tâm Nghiên cứu Nhà máy AI của NVIDIA, dựa trên năm cuộc trình diễn trước đó trên hai châu lục.

Tầng kiến trúc điện năng tiếp theo: Kiến trúc điện 800V DC

Những lợi ích bên trong nhà máy AI ngày nay là có thật và có thể triển khai ngay bây giờ. Tầng tiếp theo là cách cung cấp điện cho các rack điện toán tăng tốc có mật độ cao hơn.

Khi các nhà máy AI mở rộng quy mô, các đường dẫn điện áp thấp truyền thống làm tăng độ phức tạp trong chuyển đổi và các hạn chế về phân phối.

Kiến trúc 800 VDC của NVIDIA được thiết kế để giảm độ phức tạp trong chuyển đổi, cải thiện hiệu suất cung cấp điện và hỗ trợ các rack điện toán tăng tốc có mật độ cao hơn.

NVIDIA DSX đang tích hợp 800V DC vào các thiết kế tham chiếu của mình.

Toàn bộ nhà máy, không phải từng bộ phận

Không một thành phần đơn lẻ nào có thể tự tối ưu hóa một nhà máy AI. Một GPU nhanh hơn vẫn phải chờ đợi mạng. Điện năng có thể bị lãng phí do cung cấp tài nguyên kém. Chi phí làm mát vẫn tiêu tốn điện năng của GPU; các rack GB200 NVL72 chạy làm mát bằng chất lỏng trực tiếp mang theo khoảng 120 kW nhiệt lượng cần phải được giải tỏa trước khi điện năng đó đến được bộ phận tính toán.

Con đường đáng tin cậy duy nhất để có nhiều token hơn trên mỗi megawatt là tối ưu hóa toàn bộ nhà máy — DSX Sim trước khi lắp đặt rack đầu tiên, DSX OS và DSX Exchange khi nó đang vận hành, DSX Reference Designs để các nhà xây dựng bắt đầu từ một kiến trúc đã được xác thực thay vì bắt đầu từ con số không. (Xem thanh bên để biết tổng quan về bộ công cụ DSX đầy đủ.)

Tiêu chuẩn cơ sở hạ tầng Gigawatt

Tất cả đều quy về một câu hỏi: nhà máy tạo ra bao nhiêu công việc hữu ích trên mỗi megawatt tiêu thụ?

NVIDIAHạ tầng AITrung tâm dữ liệuHiệu suất năng lượngHGX B200
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ NVIDIA Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.