Sản phẩm
Nvidia tuyên bố Groq 3 LPX nhanh gấp 4 lần Cerebras, nhưng gây tranh cãi về cách so sánh
(giờ Việt Nam)
Tóm tắt AI
Nvidia vừa công bố chip Groq 3 LPX đạt tốc độ 3.400 token/giây trên mô hình Gemma 4, vượt xa con số 882 token/giây của Cerebras. Tuy nhiên, giới chuyên môn cho rằng cách Nvidia chọn lọc dữ liệu so sánh chưa thực sự khách quan.
Bản dịch AI

Nvidia đã đưa bộ tăng tốc suy luận chuyên dụng của mình, Groq 3 LPX, vào sản xuất hàng loạt. Một bài kiểm tra hiệu năng độc lập cho thấy các con số dẫn đầu về tốc độ tạo token, nhưng các chuyên gia cảnh báo rằng sự so sánh này đang nghiêng về phía có lợi cho Nvidia.
Tại hội nghị Hot Chips 2026, Nvidia thông báo rằng Groq 3 LPX đã chính thức được đưa vào sản xuất hàng loạt. Con chip này, được Nvidia gọi là "bộ tăng tốc suy luận AI tương tác", mở rộng nền tảng Vera Rubin và được xây dựng để mang lại khả năng tạo token siêu nhanh cho các hệ thống AI tác tử (agentic AI). Nvidia cho biết sản phẩm sẽ đi vào hoạt động cuối năm nay.
Vào cuối tháng 12, công ty đã chi khoảng 20 tỷ USD để mua lại giấy phép Groq và chiêu mộ nhà sáng lập Jonathan Ross cùng chủ tịch Sunny Madra. Groq chuyên chế tạo các bộ vi xử lý được tinh chỉnh cho việc suy luận thay vì huấn luyện AI.
Tốc độ rất quan trọng đối với các ứng dụng tác tử, vì các tác tử tiêu tốn một lượng lớn token qua hàng trăm đến hàng nghìn bước suy luận. Hệ thống tạo token càng nhanh thì càng có nhiều bước suy luận và lệnh gọi công cụ được thực hiện trong cùng một khoảng thời gian. Nhờ đó, trong thời gian chờ đợi mà người dùng cảm thấy chấp nhận được, một tác tử có thể lặp lại quy trình thường xuyên hơn, kiểm tra tệp, viết và kiểm thử mã nguồn, cũng như xác minh kết quả. Nvidia cho biết điều này giúp rút ngắn các tác vụ lập trình xuống còn "vài phút thay vì vài giờ".
Một bài kiểm tra hiệu năng từ Artificial Analysis nhằm mục đích cho thấy tốc độ vận hành của Groq 3 LPX: Trên mô hình mở Gemma 4 31B với cửa sổ ngữ cảnh 100.000 token, hệ thống rack LPX đạt 3.400 token mỗi giây, đo lường qua 50 yêu cầu liên tiếp. Hiệu suất duy trì ổn định ở độ dài đầu vào từ 10.000 đến 100.000 token. Đây là con số cao nhất từng được ghi nhận cho mô hình này. Nvidia cho biết điều đó giúp bộ tăng tốc này nhanh gấp bốn lần so với lựa chọn tốt thứ hai là chip Cerebras, vốn đạt 882 token mỗi giây.
Tại sao kỷ lục này lại khác biệt trong thực tế
Groq dựa trên kiến trúc luồng dữ liệu chú trọng vào SRAM. Theo The Register, điểm hạn chế là mỗi LPU chỉ có 500 MB bộ nhớ, ít hơn 576 lần so với GPU Rubin với 288 GB. Vì vậy, các mô hình được chia nhỏ trên nhiều bộ tăng tốc thông qua Ethernet, với một rack chứa tối đa 256 LPU. Trong thiết lập hỗn hợp này, các GPU xử lý giai đoạn tiền nạp (prefill) nặng về tính toán, còn các LPU xử lý giai đoạn giải mã (decode) nặng về băng thông.
The Register chỉ ra rằng trong thiết lập này, Gemma 4 31B là kịch bản tối ưu nhất: một mô hình dày đặc (dense model) vừa vặn hoàn toàn trong một rack. Cách kiến trúc này mở rộng với các mô hình hỗn hợp chuyên gia (mixture-of-experts) lớn hơn vẫn còn là một câu hỏi bỏ ngỏ. Chẳng hạn, DeepSeek V3 sẽ cần tới 1.342 bộ tăng tốc, tương đương hơn năm rack. Sự so sánh với Cerebras cũng bỏ qua số lượng chip. Cerebras chỉ cần một hoặc hai bộ tăng tốc cho mô hình, trong khi Nvidia cần ít nhất 64. Ngoài ra, sự so sánh này hoàn toàn không tính đến thế hệ CS-4 mới nhất của Cerebras.
Nebius dự định trở thành nhà cung cấp đám mây đầu tiên cung cấp con chip này thông qua Token Factory của họ, và chính Groq cũng nằm trong số những người dùng đầu tiên.
Tin tức AI không thổi phồng – Được biên soạn bởi con người
Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo chuyên sâu "AI Radar" độc quyền sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.
Đăng ký ngay
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.