QbitAI
85

Tin ngành

Cuộc đua sức mạnh tính toán AI: Inspur Information phá vỡ giới hạn và giải tỏa nỗi lo thiếu hụt năng lực

(giờ Việt Nam)

Tóm tắt AI

Thay vì chỉ tập trung vào việc tăng số lượng chip, Inspur Information đưa ra giải pháp tối ưu hóa hiệu suất để giải quyết bài toán thiếu hụt sức mạnh tính toán AI.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-09-22 10:22:06 Nguồn: QbitAI

Để bù đắp khoảng cách về năng lực tính toán, không thể chỉ dựa vào việc "chồng chất" phần cứng

Trong nhiều năm qua, cuộc đua về năng lực tính toán AI (AI) chỉ gói gọn trong một từ: "Chồng chất".

Chồng chất card đồ họa, chồng chất tủ rack, chồng chất máy phát điện... dường như chỉ cần có đủ card tính toán và cụm máy chủ đủ lớn là có thể đứng trên đỉnh chuỗi thức ăn.

Thế nhưng, câu hỏi liệu năng lực tính toán có "đủ dùng" hay không đã không còn có thể giải quyết đơn thuần bằng việc thêm card, mà nó bắt đầu phân hóa thành nhiều tầng lớp khác nhau.

Vấn đề đầu tiên liên quan đến giới hạn thông minh, tức là năng lực tính toán của bạn có thể hỗ trợ mức độ thông minh mạnh mẽ đến đâu.

Quy mô tham số, độ dài ngữ cảnh và độ sâu suy luận của các mô hình tiên tiến đang đồng loạt tăng lên, các Agent có thể chạy liên tục trong vài giờ, thậm chí vài ngày.

Việc mô hình có chứa vừa trong một máy hay không, chạy có nhanh không, và chạy trong thời gian dài có ổn định hay không, đều cần phải được xem xét lại.

Vấn đề thứ hai là quy mô thông minh, một câu hỏi đánh thẳng vào trọng tâm: Bạn có thể sản xuất bao nhiêu trí tuệ với chi phí thấp đến mức nào?

Nhu cầu về Token đang bùng nổ, nhưng tải trọng suy luận lại rất đa dạng. Đặc tính tính toán của Prefill và Decode là khác nhau, việc chỉ sử dụng một loại năng lực tính toán duy nhất đã không còn đáp ứng được những khác biệt này.

Giới hạn thông minh và quy mô thông minh là hai vấn đề độc lập nhưng lại có mối liên hệ mật thiết; nếu chỉ giải quyết một trong hai, bạn sẽ không thể phá vỡ hoàn toàn các nút thắt về năng lực tính toán.

Tại hội nghị AICC (Artificial Intelligence Computing Conference) 2026 vừa diễn ra, IDC đã công bố "Báo cáo đánh giá sự phát triển năng lực tính toán AI tại Trung Quốc năm 2026", phân tích tách biệt hai hướng đi này.

Khoảng cách năng lực tính toán "chia làm hai"

Sau sự bùng nổ của các Agent, nhu cầu của AI đối với năng lực tính toán đang trải qua một sự thay đổi về chất.

Trước đây, khi sử dụng các mô hình lớn, việc gọi năng lực tính toán giống như "xung nhịp": người dùng đặt một câu hỏi, hệ thống trả về một câu trả lời, chỉ gọi năng lực tính toán một lần.

Nhưng sau khi các Agent tiếp quản nhiệm vụ, tình hình đã thay đổi. Một ý định của con người có thể kích hoạt hàng chục, hàng trăm lần suy luận liên tục; sau khi nhiều Agent tạo thành một mạng lưới cộng tác, thời gian vận hành liên tục của hệ thống có thể kéo dài thêm vài giờ, thậm chí vài ngày.

Những yêu cầu tính toán ngắn hạn vốn xảy ra rời rạc nay bắt đầu trở thành tải trọng tính toán liên tục, tạo thêm áp lực mới lên cơ sở hạ tầng.

Áp lực dòng chảy dài hạn này có thể được phân tách thành ba yếu tố ảnh hưởng.

Ba yếu tố này chồng chất lên nhau theo dạng phép nhân, đẩy đường cong tăng trưởng nhu cầu năng lực tính toán lên mức cao chưa từng có.

Dữ liệu của IDC cho thấy, từ năm nay đến năm 2030, tốc độ tăng trưởng kép của lượng tiêu thụ Token toàn cầu sẽ đạt 4822,6%, lượng Token mà các Agent tiêu thụ đang tăng vọt.

Tuy nhiên, tốc độ tăng trưởng nguồn cung năng lực tính toán lại đang tụt hậu so với sự thay đổi của nhu cầu.

Báo cáo của IDC cho thấy, tỷ lệ đáp ứng nhu cầu năng lực tính toán AI toàn cầu đã giảm từ 79% vào năm 2024, dự kiến sẽ giảm xuống còn 71% vào năm 2027. Ngay cả khi áp lực chuỗi cung ứng bán dẫn thượng nguồn giảm bớt sau đó, đến năm 2030 cũng chỉ có thể phục hồi về mức khoảng 77%.

Sự biến động về phần trăm trông có vẻ không lớn, nhưng cơ sở nhu cầu đang mở rộng nhanh chóng. Đến năm 2030, giá trị tuyệt đối của khoảng cách năng lực tính toán sẽ đạt 380,9 tỷ USD, tăng gần gấp mười lần so với năm 2024.

Trước đây, cách để bù đắp khoảng cách này chủ yếu dựa vào "sức mạnh tạo nên kỳ tích", tức là mở rộng quy mô cụm máy chủ và chồng chất thêm năng lực tính toán.

Nhưng trong kỷ nguyên Agent, các loại tải trọng suy luận rất đa dạng, yêu cầu đối với cơ sở hạ tầng tính toán cũng không giống nhau.

Giai đoạn Prefill là các tác vụ có tính song song cao và mật độ tính toán cao; giai đoạn Decode cần xử lý tuần tự từng Token và tiêu tốn nhiều băng thông bộ nhớ hơn; Attention cần truy cập thường xuyên vào KV Cache đang tăng trưởng; MoE bao gồm tính toán thưa và lập lịch định tuyến quy mô lớn; các mô hình đa phương thức còn có các mô-đun Encoder độc lập...

Những tải trọng này có đặc tính tính toán riêng biệt và thay đổi linh hoạt theo độ dài ngữ cảnh, độ dài đầu ra và quy mô đồng thời.

Trong các tác vụ Agent, ngữ cảnh của vòng đối thoại đầu tiên có thể chỉ có một hoặc hai chục nghìn Token, nhưng sau hàng trăm vòng đối thoại, nó sẽ mở rộng lên ba, bốn trăm nghìn. Nút thắt của hệ thống liên tục chuyển dịch giữa tính toán, bộ nhớ đồ họa (VRAM), băng thông và truyền thông.

Vì vậy, việc chỉ đơn thuần "chồng chất" phần cứng không những không mang lại sự tăng trưởng công suất tuyến tính, mà còn gây ra sự mất cân bằng trong phân bổ tài nguyên, khiến một phần năng lực tính toán bị nhàn rỗi trong thời gian dài, trong khi phần khác lại liên tục quá tải.

Trên thực tế, khoảng cách này bao gồm các vấn đề ở hai hướng.

Một là giới hạn năng lực.

Quy mô tham số, độ dài ngữ cảnh và độ sâu suy luận của các mô hình tiên tiến đang đồng loạt tăng lên; việc máy có chứa vừa không, chạy có nhanh không, và chạy trong thời gian dài có ổn định không, là ba vấn đề cùng lúc đè nặng lên hệ thống.

Hướng còn lại liên quan đến năng lực sản xuất.

Nhu cầu Token đang bùng nổ, nhưng các loại tải trọng lại khác nhau, các giai đoạn suy luận khác nhau cần năng lực tính toán với đặc tính khác nhau. Cách tiếp cận "một chiêu dùng cho tất cả" đã không còn hiệu quả.

Lưu Quân (Liu Jun), Giám đốc chiến lược AI của Inspur Information, đã tóm tắt hai hướng này là Capability (Năng lực) và Capacity (Công suất).

Capability AI Compute là năng lực tính toán thông minh dựa trên khả năng, hỗ trợ các mô hình tiên tiến giải quyết những vấn đề mà trước đây không thể thực hiện được.

InspurHạ tầng AISức mạnh tính toánChip AICông nghệ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.