IT Home
92

Sản phẩm

NVIDIA đưa hệ thống Groq 3 LPX vào sản xuất hàng loạt, ra mắt cuối năm nay

(giờ Việt Nam)

Tóm tắt AI

NVIDIA chính thức thương mại hóa công nghệ Groq với hệ thống LPX chứa 256 chip, đạt tốc độ xử lý ấn tượng 3.400 token/giây. Hệ thống này sẽ được triển khai trên nền tảng đám mây Nebius vào cuối năm nay.

Bản dịch AI

Theo tin từ IT ngày 25 tháng 8, Nvidia thông báo vào thứ Hai theo giờ địa phương rằng các rack Groq 3 LPX đã bước vào giai đoạn sản xuất hàng loạt, đánh dấu việc thương mại hóa chính thức công nghệ thu được từ thương vụ mua lại lớn nhất trong lịch sử công ty.

Dion Harris, Giám đốc cấp cao của Nvidia, chia sẻ với các phóng viên rằng các rack Groq sẽ được triển khai cùng với bộ vi xử lý trung tâm Vera và bộ xử lý đồ họa Rubin trên nền tảng của nhà cung cấp dịch vụ đám mây mới Nebius, dự kiến sẽ đi vào hoạt động vào cuối năm nay.

Nvidia đang đẩy nhanh quá trình sản xuất chip Groq và cung cấp sản phẩm này cho khách hàng, làm nổi bật tầm quan trọng ngày càng tăng của suy luận độ trễ thấp (low-latency inference). Suy luận độ trễ thấp là yếu tố then chốt để các tác nhân AI (AI agents) có thể phản hồi nhanh chóng, tránh việc người dùng phải chờ đợi lâu, đặc biệt là trong các tình huống lập trình. Nvidia cho biết các công ty điện toán đám mây có thể tính phí cao hơn cho loại Token này.

Harris cho biết: "Đối với những đơn vị cung cấp dịch vụ Token, điều này cho phép họ cung cấp các cấp độ dịch vụ cao cấp cho những người dùng và khách hàng thực sự yêu cầu các thỏa thuận dịch vụ có độ nhạy cao về độ trễ."

Tháng 12 năm ngoái, Nvidia đã mua lại các tài sản liên quan đến công ty khởi nghiệp chip Groq với giá 20 tỷ USD (IT lưu ý: tỷ giá hiện tại tương đương khoảng 134,774 tỷ Nhân dân tệ), đây là thương vụ mua lại lớn nhất từ trước đến nay của công ty.

Kiến trúc của Groq tích hợp 500MB SRAM tốc độ cao ngay trên đế chip (die) để giảm thiểu các nút thắt cổ chai liên quan đến bộ nhớ. Chip Groq được sản xuất bởi Samsung, trong khi GPU của Nvidia được sản xuất bởi TSMC.

Nvidia đóng gói 256 chip Groq 3 riêng biệt vào các rack LPX của mình. Nvidia cho biết, theo một bài kiểm tra điểm chuẩn từ Artificial Analysis, rack Groq 3 LPX của họ có thể đạt tốc độ xử lý 3.400 Token mỗi giây.

Đây là một lĩnh vực cạnh tranh khốc liệt. Đầu năm nay, AMD thông báo sẽ tích hợp hệ thống cấp rack của mình với chip của Cerebras. Cerebras gần đây đã lên sàn chứng khoán và tập trung vào suy luận độ trễ thấp. Chế độ "Ultrafast" mới được OpenAI công bố hiện cam kết đạt 750 Token mỗi giây và được hỗ trợ bởi Cerebras.

Các loại chip độ trễ thấp sẽ không thay thế GPU, vốn vẫn là trụ cột trong lĩnh vực chip AI. GPU có thể thực hiện cả việc huấn luyện lẫn suy luận, đồng thời có đủ sự linh hoạt để thích ứng với các công nghệ và mô hình mới. Các loại chip độ trễ thấp như Groq chủ yếu tập trung vào một giai đoạn trong quá trình phục vụ mô hình, đó là giai đoạn "giải mã" (decode).

Harris cho biết: "Đây không phải là thay thế GPU, mà là sử dụng bộ vi xử lý có giá cả và khả năng xử lý phù hợp cho từng phần khác nhau của khối lượng công việc."

Hiện tại, Nvidia đang dần tăng sản lượng xuất xưởng cho hệ thống Vera Rubin, vốn đã bắt đầu được sản xuất từ đầu năm nay. Khi công bố Vera Rubin và Groq 3 LPX vào tháng 3, CEO Jensen Huang của Nvidia dự đoán rằng đến năm 2027, tổng doanh thu tích lũy của thế hệ chip Blackwell hiện tại và hệ thống Vera Rubin hoàn toàn mới sẽ đạt 1 nghìn tỷ USD (tỷ giá hiện tại tương đương khoảng 6,74 nghìn tỷ Nhân dân tệ).

Jensen Huang khi đó cho biết ông dự định dành một phần tư không gian trong các trung tâm dữ liệu dùng cho ứng dụng lập trình cho chip Groq. Huang nói: "Phần còn lại trong trung tâm dữ liệu của tôi sẽ hoàn toàn sử dụng Vera Rubin."

Nvidia dự kiến sẽ công bố báo cáo tài chính vào thứ Tư theo giờ địa phương.

NVIDIAGroqPhần cứng AISuy luận AICông nghệ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.