Tin ngành
WAIC 2026: Lộ diện nền tảng tính toán quy mô lớn đầu tiên kết hợp siêu máy tính và trí tuệ nhân tạo
(giờ Việt Nam)
Tóm tắt AI
Một con chip đột phá với kiến trúc khác biệt, đánh dấu bước tiến mới trong việc hợp nhất hạ tầng siêu máy tính và năng lực tính toán AI.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
22-07-2026 13:47:42 Nguồn: QbitAI
Một con chip "đi con đường không giống ai"
Yun Zhong, đưa tin từ Aofeisi, QbitAI | Tài khoản chính thức QbitAI
Những ngày này, toàn mạng xã hội bị WAIC "chiếm sóng". Từ trí tuệ nhân tạo hiện thân (Embodied AI) đến năng lực tính toán nội địa, sự kiện AI thường niên này đã thu hút mọi ánh nhìn của giới công nghệ.
WAIC năm nay có thể coi là sân khấu trình diễn của các doanh nghiệp chip và năng lực tính toán nội địa, với 108 mẫu chip và hơn 200 sản phẩm tính toán thông minh cùng hội tụ tại Thượng Hải. Ngoài sự góp mặt đông đảo, chúng tôi còn nhận thấy một thay đổi rõ rệt:
Trước đây, các bên thường so kè "chip của tôi có sức mạnh tính toán bao nhiêu", hiệu năng đơn card khủng đến mức nào; nhưng năm nay, điều được nhắc đến nhiều nhất là "đổi mới hệ thống" và "phối hợp hiệu quả". Nói cách khác, thời đại so kè đơn card đã khép lại, cuộc cạnh tranh về hiệu năng của hệ thống tính toán quy mô lớn sắp bắt đầu.
Giữa bầu trời đầy sao của các loại chip tính toán, chúng tôi đã phát hiện ra một "ngôi sao" (con chip) mới "đi con đường không giống ai".
Tại khu triển lãm của Công ty TNHH Mạch tích hợp Taichu (Hàng Châu) ("Taichu Yuanqi") ở Trương Giang, Phố Đông, người xem vây kín cả trong lẫn ngoài. Bỏ qua vị trí đắc địa trên lối đi chính, điều thu hút hơn cả là một cụm siêu nút (super-node) quy mô lớn, được gọi là hệ thống tính toán "siêu trí tuệ tích hợp", bên cạnh là con chip tự nghiên cứu vừa được công bố với nhãn dán: kiến trúc dị thể đa nhân (heterogeneous many-core), thiết kế chế độ kép.

So kè kiến trúc trước, bàn về đơn card sau
"Ngành công nghiệp năng lực tính toán đã chuyển từ giai đoạn so kè hiệu năng đơn card sang cạnh tranh cấp hệ thống," CEO Dương Tấn Triết của Taichu Yuanqi chia sẻ.
Đây không phải là lời nói xã giao. Khi tham số mô hình vượt ngưỡng nghìn tỷ, yêu cầu của Agent và AI4S đối với sự phối hợp CPU-GPU ngày càng cao, lợi ích biên của việc chỉ đơn thuần chồng chất năng lực tính toán đang giảm dần. Giảm chi phí trên mỗi đơn vị năng lực tính toán mới là bài toán cốt lõi thực sự hiện nay.
Nhận định này hoàn toàn phù hợp với hướng tiến hóa của toàn ngành. Tại WAIC năm nay, Huawei đã trưng bày siêu nút Atlas 950 SuperPoD, Moore Threads ra mắt siêu nút dòng "" (Xijing) S, và Alibaba Pingtouge cũng mang đến siêu nút Zhenwu M890×Panjiu AL128.
Guosheng Securities trong báo cáo nghiên cứu gần đây đã chỉ rõ: Các siêu nút nội địa đang bước vào năm đầu tiên của quá trình sản xuất hàng loạt, mô hình cạnh tranh năng lực tính toán đang chuyển dịch toàn diện từ hiệu năng đỉnh đơn điểm sang so kè hiệu suất toàn ngăn xếp cấp hệ thống.

Câu trả lời kỹ thuật mà Taichu Yuanqi đưa ra là kiến trúc tính toán tích hợp dị thể HCU. Tư duy cốt lõi là đặt CPU và các nhân tính toán AI trên cùng một bus tốc độ cao, hỗ trợ tỷ lệ tái cấu hình M:N — CPU chịu trách nhiệm điều phối Agent và tiền xử lý dữ liệu, mảng tính toán XPA tập trung vào tính toán suy luận mô hình lớn, kết hợp với bộ nhớ phân cấp dùng chung để thực hiện điều phối động dữ liệu nóng/lạnh.
Dịch một cách dễ hiểu: Một con chip chứa hai loại "bộ não", một loại quản lý điều phối, một loại quản lý tính toán cường độ cao, cả hai còn có thể điều chỉnh tỷ lệ theo nhu cầu. Ưu điểm của thiết kế này là khi đối mặt với các tải công việc khác nhau, không cần phải "dùng đại bác bắn chim sẻ" cũng không cần "xe nhỏ kéo tải lớn", việc phân bổ năng lực tính toán có thể được khớp nối linh hoạt.
Tại sao kiến trúc dị thể đa nhân lại trở thành lựa chọn bắt buộc?
Điều này phải bắt đầu từ sự thay đổi nhu cầu năng lực tính toán trong kỷ nguyên Agentic AI.
Các cụm huấn luyện và suy luận AI truyền thống thường sử dụng cấu hình cố định "một CPU đi kèm 4 đến 8 GPU", CPU đóng vai trò là máy chủ lưu trữ năng lực tính toán, chỉ chịu trách nhiệm gửi tác vụ, điều phối dữ liệu và quản lý tài nguyên GPU.
Bước vào kỷ nguyên Agentic AI, các tác nhân (agent) cần tự hoàn thành toàn bộ quy trình khép kín từ phân tách tác vụ, sắp xếp luồng công việc, gọi công cụ bên ngoài đến quản lý bộ nhớ dài hạn. Tỷ trọng năng lực tính toán và tải công việc của CPU trong các tác vụ lập kế hoạch, ra quyết định và tính toán tương tác chung đã tăng lên đáng kể về mặt cấu trúc.
CEO Lisa Su của AMD tiết lộ trong cuộc họp báo cáo tài chính quý 1 năm 2026 rằng, số lượng CPU và GPU trong một nút tính toán đơn lẻ đang dần tiến tới tỷ lệ 1:1 từ mô hình một-nhiều trước đây, thậm chí trong tương lai có thể xuất hiện trường hợp số lượng CPU nhiều hơn GPU.
Nhận định của Alibaba Cloud cũng tương tự: Mô hình hỗn hợp "điều phối có trạng thái + thực thi không trạng thái" của Agent đặt ra yêu cầu cao hơn đối với việc kiểm soát tài nguyên tinh vi, trọng tâm tối ưu hóa hệ thống tính toán đang chuyển dịch toàn diện từ hiệu năng đỉnh đơn card sang sự phối hợp hiệu quả giữa CPU và GPU.
Kiến trúc HCU của Taichu Yuanqi về bản chất là phản ứng trước xu hướng này ở cấp độ chip. Việc đặt CPU và nhân AI trên cùng một bus tốc độ cao giúp giảm tổn thất I/O và tăng hiệu quả phối hợp so với kiến trúc tách rời "CPU + card tăng tốc độc lập" truyền thống.
Một con chip làm hai công việc
Dựa trên kiến trúc HCU, Taichu Yuanqi đã ra mắt chip AI tự nghiên cứu thế hệ mới T2 Ultra. Điểm đáng chú ý nhất chính là thiết kế chế độ kép của nó.
T2 Ultra có hai chế độ làm việc: Ở chế độ tính toán tự chủ, chip có thể độc lập đảm nhận toàn bộ tác vụ tính toán; ở chế độ tăng tốc, nó phối hợp làm việc cùng máy chủ.
Điều này có nghĩa là cùng một con chip, nó vừa có thể được triển khai như một nút tính toán độc lập tại các kịch bản biên hoặc quy mô nhỏ, vừa có thể cắm vào các cụm lớn như một "động cơ tính toán" dưới dạng card tăng tốc.
Xét chi tiết thông số hiệu năng của T2 Ultra, năng lực tính toán HPC (FP64) đạt 38 TFLOPS, có thể đáp ứng nhu cầu tính toán khoa học; năng lực tính toán FP4 lên tới 4800 TFLOPS (tính toán thưa), năng lực tính toán FP16 đạt 1200 TFLOPS (tính toán thưa) để đối phó với các kịch bản huấn luyện và suy luận AI khác nhau, hỗ trợ nguyên bản từ FP64 đến FP4, đạt độ bao phủ toàn diện về độ chính xác.
Đối với khách hàng, giá trị thực tế của sự linh hoạt này nằm ở chỗ: không cần mua sắm phần cứng khác nhau cho các kịch bản khác nhau, một hệ thống chip có thể bao phủ nhiều nhu cầu triển khai, giúp giảm thiểu chi phí mua sắm và vận hành.
Trong bối cảnh chip AI nội địa thường đối mặt với tình trạng "khó sản xuất hàng loạt, khó triển khai thực tế hơn", việc làm cho khách hàng có thể sử dụng được và đủ khả năng chi trả quan trọng hơn nhiều so với các thông số trên giấy.
Không chỉ chạy mô hình lớn
Nếu T2 Ultra là "trái tim", thì hệ thống tính toán tích hợp siêu trí tuệ Yuanqi HyperIntelliX chính là toàn bộ "cơ thể", được định vị là nền tảng tính toán tích hợp siêu máy tính + tính toán thông minh nội địa dành cho AI và AI4S.

Đáng chú ý là HyperIntelliX không chỉ chạy mô hình lớn mà còn có thể phát huy giá trị trong lĩnh vực AI4S. Đối với lĩnh vực AI4S, Taichu Yuanqi đồng thời công bố các kết quả triển khai liên quan:
Hệ thống trực quan hóa dự báo thời tiết toàn cầu, trình mô phỏng lượng tử cổ điển TecoQSim, sàng lọc thuốc ảo quy mô lớn — bao phủ ba hướng: khí tượng, tính toán lượng tử và y sinh.
Hầu hết các chip AI nội địa hiện nay vẫn đang dừng lại ở giai đoạn "chạy thông suốt suy luận mô hình lớn", các nền tảng có thể đồng thời hỗ trợ cả hai nhiệm vụ AI và AI4S không nhiều.

Định vị này có bối cảnh ngành của nó. Nhu cầu năng lực tính toán của AI4S (AI for Science) khác với suy luận AI thuần túy: tính toán khoa học thường đòi hỏi tính đồng thời cao, lưu lượng lớn, tác vụ kéo dài và có yêu cầu khắt khe về khả năng tính toán độ chính xác kép.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.