Tin ngành
NVIDIA Groq 3 LPX: Tối ưu hóa hiệu năng và năng lượng cho kiến trúc Vera Rubin nhờ thực thi xác định
(giờ Việt Nam)
Tóm tắt AI
NVIDIA Groq 3 LPX sử dụng mô hình thực thi xác định để tối ưu hóa lịch trình vận hành trên 256 chip LPU, kết hợp công nghệ PEP và CPS giúp giảm lãng phí điện năng, từ đó tăng cường hiệu suất suy luận cho kiến trúc Vera Rubin.
Bản dịch AI

Điện năng là một ràng buộc mang tính quyết định đối với các nhà máy AI. Vì khối lượng công việc AI đòi hỏi một nền tảng tính toán toàn diện để phục vụ, mỗi thành phần của nền tảng đó phải tối đa hóa đầu ra trong giới hạn ngân sách điện năng của nhà máy. Điều này biến hiệu suất trên mỗi watt—thay vì thông lượng thô chưa chuẩn hóa—trở thành thước đo cuối cùng cho giá trị của một nền tảng AI.
Nền tảng NVIDIA Vera Rubin được thiết kế để cho phép AI tiết kiệm điện năng ở quy mô lớn. Cốt lõi của nó là NVIDIA Vera Rubin NVL72, mang lại hiệu suất trên mỗi watt mạnh mẽ trên phạm vi rộng nhất các nhu cầu tính toán AI—từ các lô lớn được tối ưu hóa thông lượng đến các lô nhỏ của các tầng có tính tương tác cao, cho cả mô hình mở và đóng.
Những đổi mới trong quản lý điện năng ở cấp độ nhà máy và rack thúc đẩy hiệu suất của Vera Rubin dựa trên chỉ số quan trọng này. Ở cấp độ nhà máy, phần mềm NVIDIA DSX MaxLPS chuyển đổi điện năng giữa các rack khi nhu cầu khối lượng công việc thay đổi, cho phép người vận hành thu hồi điện năng bị lãng phí và cung cấp thêm tới 40% GPU trong cùng một hạn mức điện năng của cơ sở, đồng thời mang lại thông lượng token cao hơn 35%.
Bên trong mỗi Vera Rubin NVL72, các tụ điện cấp rack, cùng với phần mềm Intelligent Power Smoothing (Làm mịn điện năng thông minh) theo trạng thái sạc, hấp thụ các xung điện đột ngột của khối lượng công việc đào tạo và suy luận, giúp nhà máy có thể được lập kế hoạch dựa trên nhu cầu bền vững thay vì các đỉnh điểm tồi tệ nhất. Điều này đồng nghĩa với việc có nhiều năng lực tính toán hơn trên mỗi megawatt.
Các tầng tương tác cao nhất đặt ra những thách thức độc đáo. Đối với các tầng này, nền tảng bổ sung NVIDIA Groq 3 LPX như một bộ tăng tốc có độ trễ thấp. Bài viết này giải thích những đổi mới bên trong các rack LPX riêng lẻ giúp nó trở thành một thành phần tiết kiệm điện năng cho nền tảng Vera Rubin, bao gồm cả mô hình thực thi tất định (deterministic execution model) của nó.
Các công nghệ tiết kiệm điện năng trong rack NVIDIA Groq 3 LPX là gì?
Mô hình thực thi tất định của Groq 3 LPX cho phép trình biên dịch LPU tạo ra một lịch trình chính xác về thời điểm mỗi phần dữ liệu sẽ di chuyển đến đơn vị tính toán cụ thể nào và chính xác khi nào hoạt động đó sẽ thực thi, xuống đến từng chu kỳ xung nhịp. Nó mở rộng đến tất cả 256 chip LPU trong rack, cho phép tương tác cực nhanh ở ngữ cảnh dài và các kỹ thuật quản lý điện năng tận dụng tính tất định này.
Sau khi trình biên dịch LPU đã tạo ra lịch trình thực thi khối lượng công việc, nó có thể dự đoán mức tiêu thụ dòng điện cho mỗi chu kỳ trong lịch trình đó. Điều này lần lượt cho phép hai công nghệ bổ sung:
Cùng với nhau, PEP và CPS giúp giảm "biên độ điện áp an toàn" (voltage guardband) hoặc "biên độ an toàn điện" vốn phải được cung cấp liên tục cho bất kỳ tập hợp chip nào, mặc dù không trực tiếp cấp nguồn cho khối lượng công việc AI. Việc giảm biên độ điện áp này có nghĩa là một tỷ lệ lớn hơn trong nguồn điện khan hiếm có thể được dành cho khối lượng công việc.

Những thách thức liên quan đến việc cung cấp điện cho khối lượng công việc AI chính xác khi cần là gì?
Để chạy các khối lượng công việc AI, các chip thực hiện một loạt các lệnh từ việc định hình lại dữ liệu đơn giản đến các phép nhân ma trận phức tạp, tiêu tốn nhiều điện năng. Hầu như tất cả các chip đều bao gồm các tính năng phần cứng cho phép chuyển đổi động giữa vô số hoạt động này trong khi khối lượng công việc đang chạy, khi tài nguyên trở nên khả dụng. Sự linh hoạt này có nghĩa là một hoạt động tính toán chuyên sâu có thể được lên lịch để thực thi bất cứ lúc nào. Hệ thống cung cấp dòng điện cho các chip phải được thiết kế để xử lý điều này.
Các phép nhân ma trận và phép nhân vectơ cung cấp năng lượng cho khối lượng công việc AI liên quan đến lượng chuyển mạch bóng bán dẫn cao trong một khoảng thời gian ngắn, làm tăng nhu cầu dòng điện của chip ở quy mô nano giây. Chip rút dòng điện bổ sung đó từ nguồn khả dụng gần nhất: các tụ điện nằm cạnh chip được gọi là tụ điện khử nhiễu (decoupling capacitors hay decaps). Việc xả các tụ này làm giảm điện áp của chip.
Bo mạch của chip có một bộ điều chỉnh điện áp—một mạch chuyên dụng có nhiệm vụ giữ điện áp cung cấp cho chip ở mức mục tiêu đã thiết lập—nhưng nó không thể phản ứng tức thời do độ tự cảm, vốn chống lại bất kỳ sự gia tăng nhanh chóng nào của dòng điện mà nó cung cấp. Tuy nhiên, dòng điện mà bộ điều chỉnh điện áp cung cấp cuối cùng cũng bắt kịp nhu cầu của chip, cho phép điện áp phục hồi.
Những sụt giảm điện áp tạm thời này, cuối cùng được thúc đẩy bởi những thay đổi đột ngột trong nhu cầu dòng điện từ khối lượng công việc AI, được gọi là hiện tượng sụt áp (voltage droops). Độ lớn của chúng phụ thuộc vào mức độ thay đổi của dòng điện và di/dt, tốc độ thay đổi của dòng điện. Nếu các yếu tố khác bằng nhau, di/dt lớn hơn sẽ gây ra sụt áp lớn hơn; ngược lại, cùng một sự thay đổi tuyệt đối về dòng điện trong một khoảng thời gian dài hơn sẽ dẫn đến di/dt thấp hơn và do đó ít sụt áp hơn. Những sụt áp này thường không phải là vấn đề. Tuy nhiên, tất cả các chip đều có điện áp tối thiểu (Vmin) mà dưới mức đó chip sẽ ngừng hoạt động bình thường, gây ra kết quả không chính xác.
Để giảm khả năng xảy ra kịch bản tồi tệ nhất này, các chip được vận hành với một biên độ điện áp an toàn, cung cấp đủ biên độ điện áp cung cấp để chip vẫn nhận được điện áp tối thiểu cần thiết trong các điều kiện quá độ và tồi tệ nhất. Hầu hết thời gian, năng lượng cần thiết để cung cấp biên độ này thực tế là dư thừa. Hơn nữa, công suất tỷ lệ thuận với bình phương điện áp, vì vậy điện áp cao hơn 10% liên tục cung cấp thêm 21% công suất.
Lịch trình chính xác đến từng chu kỳ của NVIDIA Groq 3 LPX làm cho nhu cầu dòng điện trở nên có thể dự đoán được như thế nào?
Mô hình thực thi tất định của Groq 3 LPX cho phép tạo ra lịch trình về cách khối lượng công việc AI sẽ chạy, bao gồm cả các hoạt động và di chuyển dữ liệu, trước khi bắt đầu khối lượng công việc. Các bộ tăng tốc LPU riêng lẻ có một số lượng tương đối nhỏ các phần tử phần cứng riêng biệt, mỗi phần tử cho phép thực thi nhanh chóng và có thể dự đoán được các hoạt động phổ biến nhất:
Các bộ tăng tốc riêng lẻ cũng có phần cứng giúp giữ cho các đơn vị tính toán này đồng bộ đến từng chu kỳ xung nhịp. Đối với bộ nhớ, mỗi chip có các ngân hàng SRAM trên chip không phân cấp. Ở cấp độ hệ thống LPX, các LPU được kết nối trực tiếp với nhau thay vì thông qua một trung gian, giúp thời gian truyền dữ liệu trở nên dễ dự đoán hơn.
Tính tất định gắn kết các phần tử phần cứng khác nhau này lại với nhau: các phép tính riêng lẻ, đọc bộ nhớ và giao tiếp giữa các chip yêu cầu cùng một số chu kỳ xung nhịp từ lần chạy này sang lần chạy khác. Trình biên dịch có thể khai thác điều này để lập kế hoạch lịch trình về thời điểm dữ liệu cần di chuyển giữa các phần tử tính toán này, đến đúng nơi cần đến, vào đúng thời điểm cần thiết. Lịch trình tính toán và di chuyển dữ liệu này cũng cho phép trình biên dịch giải quyết các xung đột tài nguyên phổ biến, chẳng hạn như hai phần tử phần cứng ghi vào cùng một ngân hàng bộ nhớ, từ trước.

Lịch trình chính xác đến từng chu kỳ này cũng cho phép tạo ra nhu cầu dòng điện của khối lượng công việc theo thời gian. Trình biên dịch có thể ước tính hệ thống sẽ tiêu thụ bao nhiêu dòng điện, ở cấp độ chu kỳ xung nhịp.

Mô hình thực thi cho phép kiểm soát điện áp và xung nhịp chủ động như thế nào?
Lịch trình chính xác đến từng chu kỳ và đường cong nhu cầu dòng điện kết quả cho phép Groq 3 LPX giảm sụt áp và vận hành với biên độ điện áp an toàn nhỏ hơn. Vì trình biên dịch biết khi nào nhu cầu dòng điện sẽ tăng và giảm, xuống đến từng chu kỳ xung nhịp, nó có thể chuẩn bị hệ thống cung cấp điện từ trước và định hình những thay đổi đột ngột nhất trong nhu cầu thông qua các công nghệ bổ sung PEP và CPS.
Cùng với nhau, PEP và CPS cung cấp cho trình biên dịch các công cụ để lên lịch các tín hiệu điện và thậm chí cả độ dài chu kỳ xung nhịp theo những cách dẫn đến ít sụt áp hơn. Thử nghiệm nội bộ trên các hệ thống Groq 3 LPX đã chỉ ra rằng phương pháp này dẫn đến giảm sụt áp hơn 60%. Ước tính rằng những điều này sẽ dẫn đến mức giảm tỷ lệ phần trăm một con số cao trong điện áp cơ sở mà hệ thống điện phải cung cấp liên tục cho các khối lượng công việc AI. Điều này sẽ góp phần làm giảm tỷ lệ phần trăm công suất cao hơn nữa vì công suất tỷ lệ thuận với bình phương điện áp—tất cả mà không ảnh hưởng đến khối lượng công việc.

Mang lại hiệu suất trên mỗi watt cao hơn—ở mức tương tác cao
Việc thực thi tất định của Groq 3 LPX có thể giảm năng lượng cần thiết để chạy cùng một khối lượng công việc xuống một tỷ lệ phần trăm thấp hai con số so với một hệ thống không tất định có thông số kỹ thuật tương tự. Trong một nhà máy AI bị giới hạn về điện năng, việc giảm chi phí đó giúp dành nhiều hơn ngân sách điện năng cố định để tạo ra các token.
Groq 3 LPX mang các điều khiển điện năng được kích hoạt bởi tính tất định này đến nền tảng NVIDIA Vera Rubin vào nửa cuối năm 2026. Chúng bổ sung cho NVIDIA DSX MaxLPS ở cấp độ nhà máy và Intelligent Power Smoothing bên trong rack Vera Rubin NVL72. Mỗi thành phần hoạt động ở một cấp độ khác nhau của nền tảng, nhưng tất cả đều phục vụ cùng một mục tiêu: đạt được nhiều suy luận AI hữu ích hơn từ mỗi megawatt.
Ở cấp độ nền tảng, việc kết hợp Groq 3 LPX với Vera Rubin NVL72 cho phép thông lượng trên mỗi megawatt cao hơn tới 35 lần so với NVIDIA GB200 NVL72 thế hệ trước đối với các mô hình có tham số 2T+ ở ngữ cảnh dài và tính tương tác cao. Đối với các nhà máy AI, điều đó có nghĩa là phục vụ nhiều token hơn đáng kể trong cùng một ngân sách điện năng tại điểm vận hành đòi hỏi khắt khe đó.
Lời cảm ơn
Công trình này có thể thực hiện được nhờ chuyên môn và những đóng góp kỹ thuật của Ashraf Essea, Kibibi Moseley, Graham Steele, Suhas Somnath, Sarah McKenney, Farshad Ghodsian và Eduardo Alvarez.
Bài viết được AI dịch và tổng hợp tự động từ NVIDIA Technical Blog: Agentic AI / Generative AI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.