Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
92

Sản phẩm

Cerebras ra mắt CS-4: Tốc độ suy luận AI nhanh gấp 30 lần GPU

(giờ Việt Nam)

Tóm tắt AI

Cerebras trình làng hệ thống CS-4 sử dụng chip WSE-3 Turbo, mang lại hiệu suất suy luận vượt trội gấp 30 lần so với GPU truyền thống và khả năng xử lý các mô hình 10 nghìn tỷ tham số với tốc độ hơn 1000 token/giây.

Bản dịch AI

Product - System - Cerebras

AI nhanh nhất nay còn nhanh hơn nữa.

Giới thiệu Cerebras CS-4 hoàn toàn mới, một giải pháp quy mô rack mang tính cách mạng, mang lại tốc độ suy luận nhanh hơn tới 30 lần so với GPU, tối ưu hóa chi phí và cung cấp lộ trình đơn giản để triển khai công suất ở quy mô hyperscale. Đây chính là kiến trúc dành cho AI tiên phong.

Ba chip WSE-3 Turbo trên mỗi hệ thống

Mỗi wafer mang lại tốc độ nhanh gấp 2 lần so với thế hệ trước

Hiệu suất cao hơn trên mỗi wafer

Hệ thống điện, làm mát và I/O hoàn toàn mới giúp giải phóng hiệu suất vượt trội hơn nữa trên mỗi wafer

Nền tảng quy mô rack Nexus

Cho phép triển khai nhanh chóng trong các trung tâm dữ liệu hyperscale

Nhanh hơn tới 30 lần so với GPU

Được vận hành bởi WSE-Turbo, CS-4 mang lại tốc độ suy luận nhanh hơn tới 30 lần so với các hệ thống GPU, thiết lập kỷ lục mới về tốc độ suy luận nhanh nhất hiện có trong môi trường sản xuất.

Thông lượng siêu nhanh cao hơn

Giải pháp CS-4 thay đổi đường biên Pareto của suy luận, mang lại thông lượng trên mỗi watt cao hơn tới 10 lần so với CS-3, đồng thời tạo token nhanh hơn tới 30 lần so với các hệ thống GPU thương mại. Kết quả là một hệ thống được thiết kế để mang lại cả thông lượng lẫn tính tương tác.

Kiến trúc sẵn sàng cho các mô hình tiên phong

Bằng cách giảm độ trễ kết nối giữa các wafer xuống còn 2 micro giây, CS-4 cung cấp hơn 1.000 token mỗi giây trên các mô hình vượt quá 10 nghìn tỷ tham số, duy trì hiệu suất giải mã tương tác ở quy mô chưa từng có.

ĐƯỢC XÂY DỰNG CHO QUY MÔ HYPERSCALE

CS-4 là phiên bản đầu tiên của Kiến trúc Nền tảng Cerebras Nexus mới. Nó được xây dựng dựa trên khái niệm mô-đun với ba yếu tố nền tảng: Tính toán (Compute), Nguồn điện (Power) và I/O – mỗi yếu tố đều có những đổi mới đáng kể nhằm đơn giản hóa việc sản xuất, triển khai, bảo trì và nâng cấp.

Thiết kế "Compute Backpack" dạng mô-đun

Cerebras đã tái định nghĩa máy chủ một cách căn bản. Mỗi Wafer-Scale Backpack là một cụm lắp ráp khép kín, tích hợp wafer, bộ chuyển đổi nguồn, hệ thống làm mát bằng chất lỏng trực tiếp, I/O tốc độ cao và các thiết bị điện tử điều khiển vào một gói 3D nhỏ gọn với số lượng linh kiện ít hơn 50%. Thiết kế này giúp đơn giản hóa quá trình sản xuất và rút ngắn thời gian triển khai từ vài ngày xuống còn vài giờ.

Cung cấp điện mật độ cao

Với khoảng cách truyền điện chỉ 0,5 mm tính từ bộ xử lý - gần hơn khoảng 100 lần so với khoảng cách 50 mm trên các bo mạch GPU thông thường - CS-4 gần như loại bỏ hoàn toàn tổn thất điện năng ở cấp độ bo mạch. Điều này cho phép cung cấp năng lượng gấp đôi cho WSE-3T, giúp đạt tần số hoạt động cao hơn và tạo token nhanh hơn.

Giao diện I/O wafer thế hệ mới

CS-4 giới thiệu một hệ thống con I/O có thể lập trình mới, giúp tăng gấp đôi băng thông I/O và giảm độ trễ, mang lại lợi ích cho cả các giải pháp tập trung và phân tán. Wafer I/O Module cũng cho phép các wafer được liên kết trong cùng một rack hoặc giữa các rack mà không cần switch, giúp độ trễ giữa các wafer thấp tới hai micro giây, yếu tố then chốt cho tính tương tác của các mô hình có hàng chục nghìn tỷ tham số.

Triển khai hạ tầng trước, tính toán sau

CS-4 tách biệt lớp nguồn điện, làm mát và mạng ổn định khỏi hệ thống tính toán wafer-scale dạng mô-đun. Cerebras PowerRack có thể được lắp đặt và kiểm định cơ sở trước khi các thiết bị tính toán đến nơi. Sau đó, các "compute backpack" chỉ cần trượt vào vị trí và kết nối với nguồn điện, hệ thống làm mát và dữ liệu—giúp giảm thời gian triển khai từ vài ngày xuống vài giờ, đồng thời đơn giản hóa việc bảo trì và nâng cấp trong tương lai ở quy mô hyperscale.

CS-4 qua các con số

Những lô hàng CS-4 đầu tiên sẽ bắt đầu trong quý này. Mang AI nhanh nhất đến trung tâm dữ liệu của bạn.

Câu hỏi thường gặp (FAQ)

CerebrasPhần cứng AIChip AISuy luận AITrung tâm dữ liệu
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.