Sản phẩm
Cerebras ra mắt CS-4: Bộ tăng tốc AI nhanh nhất thế giới hiện nay
(giờ Việt Nam)
Tóm tắt AI
Cerebras chính thức trình làng CS-4, thế hệ chip tăng tốc AI mới nhất với hiệu năng vượt trội, hứa hẹn thiết lập tiêu chuẩn mới về tốc độ xử lý cho các mô hình AI quy mô lớn.
Bản dịch AI

Hôm nay, chúng tôi giới thiệu thế hệ thứ tư của Hệ thống Cerebras: CS-4. Đây là bộ tăng tốc AI nhanh nhất trong ngành và là nền tảng mới cho AI tiên phong. Được xây dựng từ ba bộ vi xử lý Wafer Scale Engine 3 Turbo mới, CS-4 kết hợp bộ vi xử lý mạnh mẽ hơn với một hệ thống và tủ rack được thiết kế lại hoàn toàn. Nó mang lại tốc độ suy luận nhanh hơn tới 30 lần so với các hệ thống GPU, hiệu quả kinh tế tốt hơn và lộ trình đơn giản để triển khai công suất ở quy mô hyperscale.
CS-4 được thiết kế dựa trên một ý tưởng đơn giản: bước nhảy vọt tiếp theo trong cơ sở hạ tầng AI không thể đến từ việc cải thiện riêng lẻ một thành phần. Khả năng tính toán, điện năng, làm mát và I/O phải cùng nhau tiến bộ. Kết quả là một hệ thống được xây dựng để tạo ra các token nhanh chóng cho những trải nghiệm tương tác cao, đồng thời cung cấp tổng công suất token mà các nhà vận hành quy mô lớn cần.
Sự kết hợp đó đóng vai trò quan trọng trên toàn cảnh AI:
CS-4 hiện thực hóa những ưu tiên đó trong một nền tảng quy mô tủ rack.

Được thiết kế cho tốc độ ở quy mô lớn
CS-4 đạt hiệu suất tốt hơn tới 30 lần thông qua sự đổi mới phối hợp trên toàn bộ hệ thống. Khả năng giao tiếp giữa các wafer nhanh hơn, cung cấp điện năng mật độ cao và nền tảng quy mô tủ rack mô-đun Nexus hoạt động như một kiến trúc thống nhất.

Nhanh hơn tới 30 lần so với GPU
CS-4 thiết lập kỷ lục mới về tốc độ suy luận nhanh nhất hiện có trong sản xuất. Trên các mô hình được hiển thị bên dưới, CS-4 cung cấp các token với tốc độ mà các hệ thống GPU không thể sánh kịp, đạt tốc độ suy luận nhanh hơn tới 30 lần.
Đang tải trình phát...
Tốc độ đó mở rộng trên toàn bộ phổ AI: từ các mô hình nhỏ, hiệu quả đến các mô hình lớn nhất thế giới, chứng minh rằng khả năng mô hình lớn hơn không còn phải đánh đổi bằng tốc độ.

Suy luận trên CS-4 nhanh hơn tới 30 lần trên tập hợp mô hình được hiển thị. Nguồn: Artificial Analysis và đo lường nội bộ (tháng 8 năm 2026).
1.000 token mỗi giây cho các mô hình 10T và hơn thế nữa
Việc phục vụ các mô hình khổng lồ trên nhiều bộ tăng tốc đòi hỏi phải di chuyển thông tin giữa các bộ vi xử lý đó đủ nhanh để duy trì trải nghiệm tương tác. CS-4 giảm độ trễ kết nối giữa các wafer xuống mức thấp nhất là 2 micro giây. Với khả năng giao tiếp độ trễ thấp này, CS-4 có thể cung cấp hơn 1.000 token mỗi giây trên các mô hình vượt quá 10 nghìn tỷ tham số.

Giao tiếp giữa các wafer với độ trễ thấp giúp duy trì hiệu suất giải mã tương tác khi kích thước mô hình tăng lên. Nguồn: ngoại suy từ đo lường nội bộ (tháng 8 năm 2026).
Thông lượng siêu nhanh cao hơn
Cơ sở hạ tầng AI thường buộc các nhà vận hành phải lựa chọn giữa hai kết quả có giá trị: tính tương tác cao cho mỗi người dùng hoặc tổng thông lượng cao. CS-4 thay đổi giới hạn đó. Giải pháp CS-4 tạo ra các token nhanh hơn tới 30 lần so với các hệ thống GPU sản xuất, đồng thời mang lại thông lượng trên mỗi watt cao hơn tới 10 lần so với CS-3.
Vì các token nhanh có giá trị hơn các token chậm, CS-4 cung cấp cả token có giá trị cao hơn và tổng số token nhiều hơn trong một ngân sách điện năng nhất định—giúp các trung tâm dữ liệu có lợi nhuận cao hơn đáng kể. Người dùng có được trải nghiệm phản hồi nhanh hơn, trong khi các nhà vận hành có được năng lực để phục vụ nhiều công việc hơn.
Giải pháp CS-4 mang lại khả năng suy luận siêu nhanh ở những nơi mà từng mili giây đều quan trọng và đầu ra tổng hợp cao ở những nơi mà từng watt đều quan trọng.
CS-4 mở rộng giới hạn suy luận siêu nhanh với công suất token lớn hơn tới 10 lần và hiệu suất nhanh hơn tới 2 lần so với CS-3. Nguồn: đo lường và dự báo nội bộ (tháng 8 năm 2026).
Hỗ trợ gốc cho suy luận phân tách (disaggregated inference)
CS-4 được thiết kế để hoạt động như một phần của giải pháp cơ sở hạ tầng AI không đồng nhất thông qua việc hỗ trợ gốc cho suy luận phân tách – một phương pháp gán hai giai đoạn chính của suy luận cho các nền tảng tính toán bổ trợ.
Đầu tiên, một công cụ prefill chuyên dụng sẽ xử lý lời nhắc (prompt) đầu vào và chuẩn bị trạng thái mô hình. Trạng thái đó sau đó được chuyển đến CS-4, nơi hệ thống thực hiện giải mã với độ trễ cực thấp và tạo phản hồi.
Đối với các nhà vận hành, kiến trúc này kết hợp hiệu suất giải mã hàng đầu của Cerebras với sự linh hoạt khi kết hợp CS-4 với các nền tảng prefill bổ trợ, bao gồm AMD Helios và AWS Trainium. Các nhà cung cấp có thể sử dụng cơ sở hạ tầng GPU hoặc ASIC để prefill hiệu quả trong khi sử dụng CS-4 để giải mã siêu nhanh, tạo ra một hệ thống suy luận không đồng nhất được thiết kế để cung cấp các dịch vụ tốc độ cao, khác biệt.
Suy luận phân tách kết hợp prefill hiệu quả trên GPU hoặc ASIC với giải mã siêu nhanh trên Cerebras.
Nền tảng quy mô tủ rack Nexus: thiết kế tủ rack mô-đun để cho phép triển khai nhanh hơn
CS-4 là hệ thống đầu tiên được xây dựng trên Kiến trúc Nền tảng Cerebras Nexus. Nexus tư duy lại về tủ rack dựa trên ba yếu tố nền tảng: tính toán, điện năng và I/O – mang lại sự đổi mới đáng kể cho từng yếu tố.
Tính mô-đun thay đổi cách một hệ thống AI quy mô tủ rack di chuyển từ nhà máy đến trung tâm dữ liệu. Với số lượng linh kiện ít hơn 50% và các cụm lắp ráp khép kín cho tính toán, điện năng và I/O, CS-4 hỗ trợ sản xuất nhanh hơn và triển khai cấp tốc. Thay vì coi tủ rack là một tập hợp các bộ phận được kết nối chặt chẽ, Nexus biến nó thành một nền tảng của các mô-đun chuyên dụng.
Cách tiếp cận nền tảng đó cũng tạo ra lộ trình nâng cấp rõ ràng hơn, cho phép sự đổi mới trong một phần của hệ thống đến được với khách hàng mà không cần chờ đợi mọi bộ phận khác phải được thiết kế lại. Nexus không chỉ được xây dựng cho CS-4 mà còn cho tương lai của sự tiến bộ ở cấp độ hệ thống với nhịp độ nhanh hơn.
Thiết kế "ba lô" tính toán có thể cắm rút (pluggable)
Tại trung tâm của Nexus là một hệ thống con tính toán được tái hình dung về cơ bản. CS-4 sử dụng một Wafer-Scale Backpack gắn phía sau, kết nối theo chiều dọc với mảng nguồn.
Mỗi Wafer-Scale Backpack là một cụm lắp ráp khép kín tích hợp chuyển đổi điện năng, làm mát bằng chất lỏng trực tiếp, I/O tốc độ cao và thiết bị điện tử điều khiển thành một gói ba chiều nhỏ gọn, được xây dựng trực tiếp xung quanh wafer.
Bằng cách tách biệt khả năng tính toán khỏi bộ nguồn, Wafer-Scale Backpack giúp đơn giản hóa quá trình sản xuất và giảm thời gian triển khai từ vài ngày xuống còn vài giờ. So với hệ thống thế hệ trước, Wafer-Scale Backpack có ít linh kiện hơn 50% và sử dụng sản xuất tự động nhiều hơn 60%.
Cung cấp điện năng mật độ cao
Kiến trúc Nền tảng Nexus thúc đẩy những cải tiến đáng kể về cung cấp điện năng. Bằng cách di chuyển bộ chuyển đổi điện năng đến gần bộ vi xử lý hơn 100 lần so với các bo mạch GPU thông thường, CS-4 gần như loại bỏ tổn thất điện năng ở cấp độ bo mạch. Điều này cho phép cung cấp gấp đôi lượng điện năng cho WSE-3 Turbo, cho phép tần số hoạt động cao hơn và tạo token nhanh hơn.
Bài viết được AI dịch và tổng hợp tự động từ Cerebras: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.