Sản phẩm
Cerebras ra mắt chip WSE-3 Turbo và hệ thống CS-4: Tốc độ tăng gấp đôi, dung lượng token gấp 10 lần
(giờ Việt Nam)
Tóm tắt AI
Cerebras trình làng chip WSE-3 Turbo và hệ thống CS-4 mới, đạt tốc độ suy luận 4465 token/giây, nhanh gấp 30 lần so với giải pháp GPU truyền thống.
Bản dịch AI
Theo tin từ IT ngày 19 tháng 8, nhà sản xuất bộ tăng tốc suy luận AI cấp độ wafer Cerebras đã công bố ra mắt thế hệ chip mới WSE-3 Turbo và hệ thống CS-4 dựa trên con chip này vào ngày 18 theo giờ địa phương. So với thế hệ CS-3 trước đó, CS-4 mang lại dung lượng token gấp 10 lần và tốc độ nhanh gấp 2 lần.

Tương tự như WSE-3 trước đây, WSE-3 Turbo tích hợp 900.000 nhân và 44GB bộ nhớ đệm SRAM trên chip, nhưng hiệu suất tính toán AI thưa (sparse) FP16, băng thông bộ nhớ, băng thông kết nối trên chip và băng thông I/O đều được tăng gấp đôi. Trong khi đó, hệ thống CS-4 có thể tích hợp 3 chip WSE-3 Turbo, giúp nâng cao hơn nữa mật độ tính toán.
Cerebras cho biết, CS-4 đạt tốc độ phân phối token là 4465 Token/s trên mô hình OpenAI GPT-OSS, gấp 30 lần so với các giải pháp GPU, đồng thời cải thiện 93% so với CS-3. Đối với các mô hình có tham số siêu lớn, kết nối liên wafer với độ trễ thấp 2μs của CS-4 có thể đạt tốc độ xuất token hơn 1000 Token/s ở quy mô 10T.

CS-4 hỗ trợ nguyên bản việc phân tách tải suy luận, có thể đóng vai trò là đơn vị giải mã (decoding unit) kết hợp với phần cứng tiền nạp (prefill) không đồng nhất, nhằm phát huy lợi thế khác biệt về kiến trúc của cả hai bên.
Phần cứng tính toán này dựa trên nền tảng dạng rack Nexus hoàn toàn mới của Cerebras. Ba khía cạnh chính là tính toán, nguồn điện và kết nối hiện đã được thiết kế lại thành các hệ thống độc lập, giúp giảm 50% tổng số linh kiện và tăng đáng kể tỷ lệ tự động hóa trong sản xuất. CS-4 gần như loại bỏ hoàn toàn tổn thất điện năng ở cấp độ bo mạch, cung cấp nguồn điện gấp đôi cho WSE-3 Turbo.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.