Tin ngành
Inspur ra mắt siêu máy chủ SD200 Ultra: Chạy mô hình 2.8 nghìn tỷ tham số với tốc độ phản hồi cực nhanh
(giờ Việt Nam)
Tóm tắt AI
Tại sự kiện AICC2026, Inspur giới thiệu siêu máy chủ AI SD200 Ultra, cho phép vận hành mô hình Kimi K3 với 2.8 nghìn tỷ tham số. Thiết bị đạt độ trễ Token chỉ 5.85ms, nhanh gấp 5 lần mức trung bình của ngành.
Bản dịch AI
Theo tin từ IT ngày 22 tháng 9, tại Hội nghị Tính toán Trí tuệ Nhân tạo 2026 (AICC2026) diễn ra ngày hôm qua, Inspur Information đã công bố ra mắt máy chủ AI siêu nút YuanNao SD200 Ultra và cụm tính toán đa nguyên YuanNao HC2000.

Theo giới thiệu chính thức, YuanNao SD200 Ultra được xây dựng dựa trên chip AI nội địa, một máy đơn lẻ có thể vận hành mô hình lớn Kimi K3 với 2,8 nghìn tỷ tham số.
Inspur cho biết, độ trễ tạo Token của SD200 Ultra lần đầu tiên giảm xuống dưới 5,85 mili giây, tương đương với tốc độ 170 Tokens/s cho mỗi người dùng, đạt gấp 5 lần mức trung bình của ngành. Mẫu máy này hỗ trợ vận hành đơn lẻ các mô hình tiên tiến với quy mô 10 nghìn tỷ tham số.
Lưu ý của IT: Độ trễ tạo Token là thời gian trung bình cần thiết để mô hình lớn xuất ra mỗi token, đây là một trong những chỉ số cốt lõi để đo lường tốc độ phản hồi suy luận.

SD200 Ultra sử dụng kiến trúc 3D Hyper Mesh, kết nối chặt chẽ 128 lõi chip AI nội địa, cung cấp 8TB bộ nhớ đồ họa (VRAM) định địa chỉ thống nhất và 64TB bộ nhớ (RAM). Hệ thống áp dụng giao tiếp ngữ nghĩa bộ nhớ gốc, với độ trễ truyền thông thấp tới 0,69 micro giây.
Thông qua việc định địa chỉ thống nhất toàn cục, ánh xạ thiết bị ảo, dịch địa chỉ và định tuyến liên miền, siêu nút này hiện thực hóa việc truy cập định địa chỉ thống nhất GPU xuyên miền máy chủ, xây dựng miền kết nối ngữ nghĩa bộ nhớ có độ trễ thấp ở mức hàng trăm nano giây.

Inspur cho biết, nhờ công nghệ bộ nhớ đối xứng, SD200 Ultra lần đầu tiên hiện thực hóa việc kết nối trực tiếp VRAM GPU trên siêu nút dựa trên chip AI nội địa, cho phép GPU truy cập trực tiếp vào VRAM của GPU từ xa. Thời gian truyền thông AllReduce giảm 3,5 lần.
Đối với suy luận Kimi K3, SD200 Ultra sử dụng Kimi K3 để xây dựng các tác nhân (agent) siêu toán tử, hiện thực hóa các siêu toán tử tích hợp tính toán và xử lý luồng cấp Tile, hợp nhất các toán tử cơ bản trong KDA, Gated MLA và MoE. Số lượng toán tử giảm 10 lần, hiệu suất suy luận tăng hơn 3 lần.

Cùng ngày, Inspur cũng ra mắt cụm tính toán đa nguyên YuanNao HC2000. Cụm này sử dụng kiến trúc tốc độ cao DirectCom 2.0, dựa trên tủ máy chủ AI làm mát bằng chất lỏng mật độ cao, kết hợp với ngăn xếp phần mềm suy luận MCIS, có thể khớp động với tải trọng tính toán. Theo công bố chính thức, với cùng mức đầu tư, năng suất Token tăng 10 lần.
Inspur chia tính toán AI trong kỷ nguyên Agent thành hai hướng: Capability AI Compute (Tính toán AI năng lực), hỗ trợ đột phá giới hạn trí tuệ; và Capacity AI Compute (Tính toán AI dung lượng), hiện thực hóa việc cung cấp trí tuệ đầy đủ.
Inspur cho biết, quy mô tham số của các mô hình tiên tiến đã tăng từ 671 tỷ của DeepSeek R1 lên 2,8 nghìn tỷ của Kimi K3 và đang hướng tới mức 10 nghìn tỷ; ngữ cảnh mở rộng từ 128K lên hơn 1M; Agent chuyển dịch từ đơn lẻ sang hàng trăm, hàng nghìn tác nhân phối hợp.
Trọng số mô hình, KV Cache (bộ nhớ đệm khóa-giá trị, dùng để lưu trữ khóa và giá trị trong cơ chế chú ý, giúp giảm tính toán lặp lại) và quy mô tác vụ đồng thời tăng trưởng đồng bộ, đặt ra yêu cầu cao hơn về dung lượng VRAM, kết nối tốc độ cao và hiệu suất mở rộng song song.
Các tác vụ Agent phức tạp bao gồm một lượng lớn vòng lặp "suy luận — gọi công cụ — phản hồi — lập kế hoạch lại", mỗi vòng lặp đều tích lũy độ trễ. Inspur Information cho rằng, độ trễ không còn chỉ là chỉ số trải nghiệm mà có thể ảnh hưởng đến việc tác vụ có hoàn thành kịp thời hay không.
Các tác vụ Agent phức tạp cần vận hành liên tục trong nhiều giờ, thậm chí nhiều ngày, trong thời gian đó trải qua vô số lần gọi mô hình, gọi công cụ và tương tác dữ liệu. Bất kỳ lỗi tính toán, truyền thông hoặc phần mềm nào cũng có thể làm gián đoạn tác vụ.

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.