Sản phẩm
NVIDIA nâng cấp Vera Rubin cho hệ thống AI Agent, Groq 3 LPX chính thức đi vào sản xuất
(giờ Việt Nam)
Tóm tắt AI
NVIDIA mở rộng khả năng tạo token tốc độ cao trên nền tảng Vera Rubin NVL72 để tối ưu cho các hệ thống AI Agent. Đồng thời, hệ thống Groq 3 LPX đã được đưa vào sản xuất hàng loạt, tập trung vào sự phối hợp toàn diện giữa hạ tầng thay vì chỉ dựa vào sức mạnh đơn lẻ của chip.
Bản dịch AI

Kỷ nguyên tiếp theo của suy luận AI sẽ không được định nghĩa bởi một con chip, mạng lưới hay hệ thống đột phá đơn lẻ nào. Nó sẽ được định nghĩa bởi cách mọi lớp trong "nhà máy AI" (AI factory) phối hợp với nhau. Đó là lý do tại sao NVIDIA đang mở rộng Vera Rubin NVL72 với khả năng tạo token tốc độ cao dành cho các hệ thống tác nhân (agentic systems).
Được công bố hôm nay, hệ thống quy mô rack NVIDIA Vera Rubin, NVIDIA Groq 3 LPX, đã đi vào sản xuất hàng loạt. Trong một bài kiểm tra hiệu năng của Artificial Analysis chạy trên Gemma 4 31B, một mô hình tác nhân mã nguồn mở, hệ thống này đã đạt tốc độ 3.400 token đầu ra mỗi giây cho các trường hợp sử dụng ngữ cảnh dài 100.000 token vốn rất quan trọng đối với các hệ thống tác nhân, nhanh gấp 4 lần so với nền tảng thay thế gần nhất.
Các đối tác trong ngành trên toàn thế giới đang áp dụng các giải pháp nền tảng Vera Rubin. SpaceXAI thông báo rằng CPU NVIDIA Vera sẽ cung cấp sức mạnh cho thế hệ AI tác nhân tiếp theo của họ. CoreWeave đã triển khai vào sản xuất Spectrum-X Multiplane, kết nối các rack NVIDIA Vera Rubin bằng cách sử dụng nhiều switch song song để cung cấp mạng lưới AI băng thông cao, phẳng và không mất dữ liệu. Nebius là đám mây AI đầu tiên áp dụng NVIDIA Groq 3 LPX.
Khi AI chuyển dịch từ huấn luyện sang suy luận và tác nhân, suy luận đã trở thành một biên giới mới. Các hệ thống AI tác nhân đang tạo ra nhiều token hơn, xử lý các cửa sổ ngữ cảnh lớn hơn đáng kể và ngày càng cộng tác nhiều hơn với các hệ thống AI khác để giải quyết các vấn đề phức tạp.
Những khối lượng công việc này đòi hỏi một lớp cơ sở hạ tầng mới được tối ưu hóa không chỉ cho hiệu suất mà còn cho lưu lượng, khả năng phản hồi và tính kinh tế ở quy mô chưa từng có.
Tại hội nghị Hot Chips tuần này ở Palo Alto, California, NVIDIA đang trình diễn cách thức đồng thiết kế cực hạn (extreme codesign) đang định hình lại nhà máy AI từ đầu đến cuối. Bằng cách kiến trúc hóa tính toán, mạng lưới và tăng tốc suy luận như một hệ thống thống nhất, NVIDIA đang giúp khách hàng xây dựng cơ sở hạ tầng được thiết kế riêng cho các nhu cầu mới nổi về suy luận ngữ cảnh dài và hệ thống đa tác nhân.
Đồng thiết kế cực hạn tối ưu hóa hiệu suất
Đồng thiết kế cực hạn là nguyên tắc chỉ đạo đằng sau các nền tảng của NVIDIA. Vera Rubin được thiết kế để tăng tốc suy luận khi các tác nhân suy luận trên các chuỗi ngày càng dài.
NVIDIA Spectrum-X Ethernet di chuyển các luồng dữ liệu khổng lồ đó một cách hiệu quả qua các nhà máy AI, và NVIDIA Groq 3 LPX được xây dựng để tạo token ở tốc độ cực nhanh. Cùng với nhau, chúng cho thấy cách NVIDIA đang tối ưu hóa mọi giai đoạn của quy trình AI, từ ngữ cảnh và giao tiếp đến tạo dữ liệu, như một phần của kiến trúc nhà máy AI tích hợp duy nhất.
NVIDIA Groq 3 LPX mang đến một kiến trúc suy luận độ trễ thấp mới được thiết kế để hoạt động cùng với Vera Rubin NVL72, nền tảng nhà máy AI linh hoạt nhất, giúp các doanh nghiệp và nhà cung cấp đám mây mang lại độ trễ thấp, lưu lượng cực cao và tính kinh tế có thể mở rộng cần thiết cho các ứng dụng tác nhân.
Hiệu suất đột phá không đến từ việc tối ưu hóa các thành phần riêng lẻ một cách cô lập, mà từ việc đồng thiết kế mọi lớp của ngăn xếp công nghệ. Từ mạng lưới và xử lý ngữ cảnh đến suy luận quy mô lớn, nền tảng full-stack của NVIDIA biến các nhà máy AI thành những cỗ máy thông minh tích hợp, được xây dựng để biến khối lượng token ngày càng tăng thành doanh thu.
Thứ Ba, ngày 24 tháng 8, 8:00 sáng giờ PT 🔗
Các đối tác của NVIDIA áp dụng Vera Rubin để có chi phí token thấp nhất
Nebius, một đám mây AI hàng đầu, là đơn vị đầu tiên áp dụng NVIDIA Groq 3 LPX, mang đến cho các nhà phát triển quyền truy cập vào tốc độ tạo token hàng đầu cho các ứng dụng AI tác nhân có khả năng phản hồi cao.
Việc bổ sung NVIDIA Groq 3 LPX vào NVIDIA Vera Rubin NVL72 trong Nebius Token Factory sẽ thúc đẩy hiệu suất suy luận để các nhà phát triển có thể xây dựng các tác nhân tương tác cao, hệ thống lập trình và các trải nghiệm AI thời gian thực khác ở quy mô lớn.
Kết nối các rack NVIDIA Vera Rubin, CoreWeave đang triển khai Spectrum-X Multiplane vào sản xuất, mở ra những tiến bộ cho cơ sở hạ tầng đám mây AI của mình.
Thứ Ba, ngày 24 tháng 8, 8:00 sáng giờ PT 🔗
SpaceXAI áp dụng CPU NVIDIA Vera cho AI tác nhân
SpaceXAI có kế hoạch xây dựng và mở rộng kiến trúc AI tương lai của mình xung quanh NVIDIA Vera Rubin, từ các trung tâm dữ liệu trên Trái đất đến các vệ tinh quỹ đạo. Công ty có kế hoạch triển khai CPU NVIDIA Vera để tăng tốc các công việc đòi hỏi nhiều CPU đằng sau AI tác nhân, bao gồm điều phối, sử dụng công cụ, thực thi mã, xử lý dữ liệu và mô phỏng.

Quan hệ đối tác với SpaceXAI mở rộng nền tảng AI full-stack của NVIDIA đến SpaceXAI, kết hợp CPU Vera, điện toán tăng tốc, mạng lưới và phần mềm của NVIDIA để thúc đẩy AI ở quy mô chưa từng có.
Được thiết kế cho kỷ nguyên tác nhân, Vera Rubin cung cấp hiệu suất trên mỗi nhân hàng đầu, băng thông bộ nhớ vượt trội và hiệu suất ổn định dưới tải, giúp các tác nhân hoàn thành nhiệm vụ nhanh hơn và giữ cho cơ sở hạ tầng GPU giá trị được tận dụng tối đa.
Thứ Ba, ngày 24 tháng 8, 8:00 sáng giờ PT 🔗
NVIDIA Groq 3 LPX: Bộ tăng tốc suy luận AI tương tác
Được đồng thiết kế với nền tảng Vera Rubin NVL72, NVIDIA Groq 3 LPX đang giúp các nhà máy AI cung cấp token với độ trễ thấp nhất cho các khối lượng công việc tác nhân.
AI tác nhân đang tạo ra một thách thức hiệu suất mới: độ trễ giải mã (decode latency). Khi các tác nhân AI suy luận, sử dụng công cụ và tương tác với các hệ thống khác, chúng tạo ra các phản hồi từng token một, khiến ngay cả những độ trễ nhỏ nhất cũng nhân lên qua các chuỗi công việc phức tạp. Để giữ cho các tác nhân hoạt động ở tốc độ mà người dùng mong đợi, NVIDIA Groq 3 LPX mở rộng nền tảng Vera Rubin NVL72 với khả năng tăng tốc chuyên biệt cho việc tạo token.
GPU NVIDIA Rubin xử lý việc xử lý ngữ cảnh quy mô lớn trong khi LPX tăng tốc các khối lượng công việc giải mã nhạy cảm với độ trễ. Kết quả là việc tạo token nhanh hơn, dễ dự đoán hơn, giúp các nhà máy AI mang lại khả năng suy luận phản hồi, tương tác tác nhân mượt mà hơn và hiệu quả cơ sở hạ tầng cao hơn.

Cùng với nhau, GPU Rubin và LPU được thiết kế để loại bỏ sự đánh đổi truyền thống giữa tốc độ và lưu lượng, giúp các nhà cung cấp AI mang lại khả năng suy luận quy mô lớn, phản hồi nhanh cho thế hệ ứng dụng AI tác nhân tiếp theo.
Xây dựng "Nhà máy Token" (Token Factory)
Khi ngành công nghiệp chuyển dịch từ huấn luyện mô hình sang phục vụ trí tuệ ở quy mô lớn, cơ sở hạ tầng phải tiến hóa thành cái mà NVIDIA mô tả là "nhà máy token" có khả năng cung cấp đồng thời hiệu suất, lưu lượng, tính toàn vẹn của trí tuệ và hiệu quả kinh tế. Các hệ thống AI tác nhân ngày càng giao tiếp với các hệ thống AI khác, truy cập nhiều nguồn dữ liệu và duy trì lượng ngữ cảnh lớn, tạo ra nhu cầu chưa từng có về suy luận nhanh.
NVIDIA Groq 3 LPX được thiết kế chính xác cho những khối lượng công việc này. Là một phần mở rộng của Vera Rubin NVL72, nó cho phép khả năng phản hồi cực nhanh ngay cả trên các cửa sổ ngữ cảnh khổng lồ, đồng thời giúp các nhà cung cấp dịch vụ tối đa hóa lưu lượng và hiệu suất sử dụng cơ sở hạ tầng.
Đồng thiết kế cực hạn cho suy luận
Không giống như các bộ tăng tốc độc lập, NVIDIA Groq 3 LPX kết hợp thế mạnh của GPU và LPU thông qua đồng thiết kế cực hạn. GPU Rubin và LPU cùng nhau tính toán mọi lớp của một mô hình AI, cho phép các cấp độ hiệu suất suy luận mới cho các khối lượng công việc tác nhân.
Ở quy mô lớn, các đội ngũ LPU hoạt động như một bộ xử lý khổng lồ được tối ưu hóa cho suy luận tất định. Một triển khai NVIDIA Groq 3 LPX quy mô rack có thể bao gồm 256 bộ tăng tốc LP30 được kết nối thông qua các liên kết chip-to-chip trực tiếp, tạo ra một cỗ máy suy luận hiệu quả cao được xây dựng cho các nhà máy AI hiện đại.
Được thiết kế cho kỷ nguyên AI tác nhân
Khi các mô hình suy luận phát triển và các quy trình làm việc tác nhân tạo ra ngày càng nhiều token, cơ sở hạ tầng cần thiết để phục vụ chúng phải tiến hóa. NVIDIA Groq 3 LPX mở rộng nền tảng Vera Rubin NVL72 với kiến trúc suy luận được thiết kế riêng để tối đa hóa khả năng phản hồi, lưu lượng và hiệu quả, giúp cung cấp sức mạnh cho thế hệ nhà máy AI tiếp theo.
Và đây mới chỉ là sự khởi đầu, nhiều tối ưu hóa hơn, nhiều mô hình hơn, hiệu suất cao hơn khi kết hợp với Vera Rubin NVL72 — những cấp độ lưu lượng và tính tương tác mới đang đến gần. Hãy đón chờ.
Thứ Ba, ngày 24 tháng 8, 8:00 sáng giờ PT 🔗
Bài viết được AI dịch và tổng hợp tự động từ NVIDIA Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.