Sản phẩm
Cerebras ra mắt CS-4: Siêu máy tính AI nhanh nhất thế giới cho quy mô hyperscale
(giờ Việt Nam)
Tóm tắt AI
Cerebras vừa giới thiệu CS-4, thế hệ chip AI mới nhất với hiệu năng vượt trội, được thiết kế chuyên biệt để giải quyết các bài toán huấn luyện mô hình AI khổng lồ ở quy mô hạ tầng siêu lớn.
Bản dịch AI

Hôm nay, chúng tôi giới thiệu thế hệ thứ tư của bộ tăng tốc AI quy mô wafer: CS-4. Đây là bộ tăng tốc AI nhanh nhất trong ngành và là nền tảng mới cho AI tiên phong. Được xây dựng từ ba bộ vi xử lý Wafer Scale Engine 3 Turbo mới, CS-4 kết hợp bộ vi xử lý mạnh mẽ hơn với một hệ thống và tủ rack được thiết kế lại hoàn toàn. Nó mang lại tốc độ suy luận nhanh hơn tới 30 lần so với các hệ thống GPU, hiệu quả kinh tế tốt hơn và lộ trình đơn giản để triển khai công suất quy mô lớn (hyperscale).
CS-4 được thiết kế dựa trên một ý tưởng đơn giản: bước nhảy vọt tiếp theo trong cơ sở hạ tầng AI không thể đến từ việc cải tiến riêng lẻ một thành phần. Khả năng tính toán, nguồn điện, làm mát và I/O phải cùng nhau tiến bộ. Kết quả là một hệ thống được xây dựng để tạo ra các token nhanh cho những trải nghiệm có tính tương tác cao, đồng thời cung cấp tổng công suất token mà các nhà vận hành quy mô lớn cần.
Sự kết hợp đó đóng vai trò quan trọng trên toàn cảnh AI:
CS-4 hiện thực hóa những ưu tiên đó trong một nền tảng quy mô tủ rack.
Được thiết kế cho tốc độ ở quy mô lớn
CS-4 đạt hiệu suất tốt hơn tới 30 lần thông qua sự đổi mới phối hợp trên toàn bộ hệ thống. Khả năng giao tiếp giữa các wafer nhanh hơn, cung cấp điện mật độ cao và nền tảng quy mô tủ rack Nexus dạng mô-đun hoạt động như một kiến trúc thống nhất.

Nhanh hơn tới 30 lần so với GPU
CS-4 thiết lập kỷ lục mới về tốc độ suy luận nhanh nhất hiện có trong sản xuất. Trên các mô hình được hiển thị bên dưới, CS-4 cung cấp các token với tốc độ mà các hệ thống GPU không thể sánh kịp, đạt tốc độ suy luận nhanh hơn tới 30 lần.
Đang tải trình phát...
Tốc độ đó mở rộng trên toàn bộ phổ AI: từ các mô hình nhỏ, hiệu quả đến các mô hình lớn nhất thế giới, chứng minh rằng khả năng mô hình lớn hơn không còn phải đánh đổi bằng tốc độ.

Suy luận trên CS-4 nhanh hơn tới 30 lần trên tập hợp mô hình được hiển thị. Nguồn: Phân tích nhân tạo và đo kiểm nội bộ (tháng 8 năm 2026).
1.000 token mỗi giây cho các mô hình 10T và hơn thế nữa
Việc phục vụ các mô hình khổng lồ trên nhiều bộ tăng tốc đòi hỏi phải di chuyển thông tin giữa các bộ vi xử lý đó đủ nhanh để duy trì trải nghiệm tương tác. CS-4 giảm độ trễ kết nối giữa các wafer xuống mức thấp nhất là 2 micro giây. Với khả năng giao tiếp độ trễ thấp này, CS-4 có thể cung cấp hơn 1.000 token mỗi giây trên các mô hình vượt quá 10 nghìn tỷ tham số.

Giao tiếp giữa các wafer với độ trễ thấp giúp duy trì hiệu suất giải mã tương tác khi kích thước mô hình tăng lên. Nguồn: ngoại suy từ đo kiểm nội bộ (tháng 8 năm 2026).
Thông lượng siêu nhanh cao hơn cho các trung tâm dữ liệu có lợi nhuận tốt hơn
Cơ sở hạ tầng AI thường buộc các nhà vận hành phải lựa chọn giữa hai kết quả có giá trị: tính tương tác cao cho mỗi người dùng hoặc tổng thông lượng cao trên toàn trung tâm dữ liệu. CS-4 thay đổi giới hạn đó. Giải pháp CS-4 tạo ra các token nhanh hơn tới 30 lần so với các hệ thống GPU sản xuất, đồng thời cung cấp thông lượng trên mỗi watt cao hơn tới 10 lần so với CS-3.
Điều đó có nghĩa là một trung tâm dữ liệu có thể tạo ra cả nhiều token nhanh, giá trị cao và nhiều token tổng thể hơn trong cùng một ngân sách điện năng. Người dùng có được trải nghiệm phản hồi nhanh hơn, trong khi các nhà vận hành có được năng lực để phục vụ nhiều công việc hơn. Đối với các neocloud và nhà cung cấp quy mô lớn (hyperscaler), những lợi ích đó kết hợp lại để cải thiện đáng kể doanh thu trên mỗi megawatt.
Suy luận nhanh hơn cũng tạo ra nhiều lợi thế hơn là chỉ về hiệu suất – nó tạo ra một phân khúc doanh thu mới. Hầu hết các dịch vụ suy luận cạnh tranh về giá trên mỗi token. Nhưng đối với các khối lượng công việc tương tác và tác nhân (agentic), các token chậm không thể thay thế cho các token nhanh. Các tác nhân lập trình, tác nhân nghiên cứu và các hệ thống suy luận khác thực hiện nhiều bước tuần tự, với độ trễ tích lũy ở mỗi bước. Đối với các khối lượng công việc này, khách hàng ngày càng quan tâm đến thời gian hoàn thành tác vụ, thay vì chỉ đơn giản là chi phí tạo ra một triệu token.
Giải pháp CS-4 được thiết kế cho cả khả năng phản hồi và quy mô. Nó mang lại khả năng suy luận siêu nhanh ở những nơi mà từng mili giây đều quan trọng và sản lượng tổng hợp cao ở những nơi mà từng watt đều quan trọng. Điều này mang đến cho các nhà cung cấp một dịch vụ cao cấp, khác biệt để kiếm tiền từ nhu cầu AI.

CS-4 mở rộng giới hạn suy luận siêu nhanh với công suất token lớn hơn tới 10 lần và hiệu suất nhanh hơn tới 2 lần so với CS-3. Nguồn: đo kiểm nội bộ và dự báo (tháng 8 năm 2026).
Hỗ trợ gốc cho suy luận phân tách (disaggregated inference)
CS-4 được thiết kế để hoạt động như một phần của giải pháp cơ sở hạ tầng AI không đồng nhất thông qua việc hỗ trợ gốc cho suy luận phân tách – một phương pháp gán hai giai đoạn chính của suy luận cho các nền tảng tính toán bổ trợ.
Đầu tiên, một công cụ prefill được xây dựng chuyên biệt sẽ xử lý prompt đầu vào và chuẩn bị trạng thái mô hình. Trạng thái đó sau đó được chuyển đến CS-4, nơi hệ thống thực hiện giải mã độ trễ cực thấp và tạo ra phản hồi.
Đối với các nhà vận hành, kiến trúc này kết hợp hiệu suất giải mã Cerebras hàng đầu trong ngành với sự linh hoạt khi kết hợp CS-4 với các nền tảng prefill bổ trợ, bao gồm AMD Helios và AWS Trainium. Các nhà cung cấp có thể sử dụng cơ sở hạ tầng GPU hoặc ASIC để prefill hiệu quả trong khi sử dụng CS-4 để giải mã siêu nhanh, tạo ra một hệ thống suy luận không đồng nhất được thiết kế để cung cấp các dịch vụ tốc độ cao, khác biệt.
Suy luận phân tách kết hợp việc prefill hiệu quả trên GPU hoặc ASIC với giải mã siêu nhanh trên Cerebras.
Nền tảng quy mô tủ rack Nexus: thiết kế tủ rack mô-đun để cho phép triển khai nhanh hơn
CS-4 là hệ thống đầu tiên được xây dựng trên Kiến trúc Nền tảng Cerebras Nexus mới. Nexus suy nghĩ lại về tủ rack dựa trên ba yếu tố nền tảng: tính toán, nguồn điện và I/O – mang lại sự đổi mới đáng kể cho từng yếu tố.
Tính mô-đun thay đổi cách một hệ thống AI quy mô tủ rack di chuyển từ nhà máy đến trung tâm dữ liệu. Với ít hơn 50% linh kiện và các cụm lắp ráp khép kín cho tính toán, nguồn điện và I/O, CS-4 hỗ trợ sản xuất nhanh hơn và triển khai cấp tốc. Thay vì coi tủ rack là một tập hợp các bộ phận được kết nối chặt chẽ, Nexus biến nó thành một nền tảng của các mô-đun được xây dựng cho mục đích cụ thể.
Cách tiếp cận nền tảng đó cũng tạo ra lộ trình rõ ràng hơn cho việc nâng cấp, cho phép sự đổi mới ở một phần của hệ thống đến được với khách hàng mà không cần chờ đợi mọi bộ phận khác phải được thiết kế lại. Nexus được xây dựng không chỉ cho CS-4, mà còn cho tương lai của sự tiến bộ ở cấp độ hệ thống với nhịp độ nhanh hơn.
Thiết kế "ba lô" tính toán có thể cắm rút (pluggable compute backpack)
Ở trung tâm của Nexus là một hệ thống con tính toán được tái hình dung về cơ bản. CS-4 sử dụng một Wafer-Scale Backpack gắn phía sau, kết nối theo chiều dọc với mảng nguồn điện.
Mỗi Wafer-Scale Backpack là một cụm lắp ráp khép kín, tích hợp chuyển đổi nguồn, làm mát bằng chất lỏng trực tiếp, I/O tốc độ cao và thiết bị điện tử điều khiển vào một gói ba chiều nhỏ gọn, được xây dựng trực tiếp xung quanh wafer.
Bằng cách tách biệt khả năng tính toán khỏi bộ nguồn, Wafer-Scale Backpack giúp đơn giản hóa quá trình sản xuất và giảm thời gian triển khai từ vài ngày xuống còn vài giờ. So với hệ thống thế hệ trước, Wafer-Scale Backpack có ít hơn 50% linh kiện và sử dụng sản xuất tự động nhiều hơn 60%.
Cung cấp điện mật độ cao
Bài viết được AI dịch và tổng hợp tự động từ Cerebras: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.