KrASIA
85

Tin ngành

Huawei tích hợp công nghệ quang học NPO vào siêu máy tính AI Atlas 960E

(giờ Việt Nam)

Tóm tắt AI

Hệ thống Atlas 960E sử dụng công nghệ quang học gần gói (NPO) và kiến trúc UnifiedBus của Huawei để tối ưu hóa điện năng và băng thông khi truyền tải dữ liệu giữa các bộ tăng tốc AI.

Bản dịch AI

Huawei brings near-packaged optics to AI with Atlas 960E superpod

Huawei vừa ra mắt Atlas 960E superpod, một hệ thống tính toán trí tuệ nhân tạo được thiết kế để kết nối tới 4.096 bộ xử lý thần kinh (NPU) thông qua công nghệ quang học gần gói (near-packaged optics - NPO). Hệ thống này nhắm đến một hạn chế ngày càng lớn đối với hiệu năng AI: việc truyền tải dữ liệu giữa các con chip mà không tiêu tốn quá nhiều điện năng.

Được công bố tại sự kiện Huawei Connect 2026 ở Thượng Hải vào ngày 17 tháng 9, Atlas 960E kết hợp công nghệ kết nối UnifiedBus của Huawei với động cơ nút kết nối quang học mật độ cao, hay còn gọi là Hi-ONE. Huawei cho biết một hệ thống đơn lẻ có thể đạt hiệu suất tám exaflops ở độ chính xác FP8 và chứa tới một petabyte bộ nhớ băng thông cao.

Huawei định nghĩa superpod là một nhóm các nút tính toán được liên kết bằng các kết nối tốc độ cao và địa chỉ bộ nhớ thống nhất trên các máy vật lý, cho phép chúng vận hành như một máy tính logic duy nhất.

Huawei cho biết Hi-ONE cung cấp công suất truyền tải 7,2 terabit mỗi giây. Công ty mô tả đây là động cơ NPO đầu tiên trong ngành sẵn sàng cho sản xuất hàng loạt và là sản phẩm đầu tiên có tích hợp nguồn sáng. Theo Huawei, Atlas 960E sử dụng 5.500 động cơ thay cho 48.000 mô-đun quang học 800G truyền thống, giúp giảm mức tiêu thụ điện năng hơn 550 kilowatt. Huawei cũng tuyên bố thời gian hoạt động không lỗi tăng gấp đôi và độ sẵn sàng của hệ thống đạt 99,8%.

Huawei cũng đã đề xuất một thỏa thuận triển khai NPO lên Diễn đàn Kết nối mạng Quang học (OIF), một cơ quan tiêu chuẩn ngành, nhằm thiết lập một hệ sinh thái có khả năng tương tác xoay quanh công nghệ này. Đề xuất hiện vẫn chưa trở thành tiêu chuẩn của OIF.

Việc bổ sung thêm bộ xử lý không nhất thiết mang lại sự gia tăng tương ứng về sức mạnh tính toán hữu dụng. Khi các cụm AI phát triển, các bộ tăng tốc của chúng phải trao đổi nhiều dữ liệu hơn, và thời gian chờ đợi các quá trình truyền tải đó có thể làm giảm đi lợi ích từ việc bổ sung thêm chip.

Huawei cho biết truyền thông có thể chiếm hơn 40% thời gian huấn luyện trong các cụm máy chủ truyền thống. UnifiedBus được thiết kế để giảm bớt chi phí vận hành đó bằng cách thay thế nhiều giao thức kết nối bằng một giao thức chung và giảm nhu cầu chuyển đổi giữa chúng.

Mạng lưới mở rộng quy mô (scale-up networking) kết nối chặt chẽ các bộ xử lý trong một miền tính toán để chúng có thể hoạt động như các phần của một cỗ máy lớn hơn. Mạng lưới mở rộng theo chiều ngang (scale-out networking) liên kết các máy chủ hoặc hệ thống riêng biệt thành một cụm lớn hơn. Cả hai đều đối mặt với các nút thắt cổ chai về truyền thông, nhưng yêu cầu của chúng lại khác nhau.

Các kết nối bằng đồng cung cấp độ trễ thấp và tiêu thụ điện năng thấp ở khoảng cách ngắn. Ở tốc độ dữ liệu cao hơn và khoảng cách xa hơn, việc suy hao tín hiệu điện trở nên khó kiểm soát hơn. Các liên kết quang học mở rộng phạm vi đó, mặc dù các bộ thu phát cắm rút truyền thống làm tăng mức tiêu thụ điện năng và các điểm lỗi tiềm ẩn.

NPO đặt các động cơ quang học gần hơn với các chip chuyển mạch, rút ngắn đường dẫn điện trước khi tín hiệu được chuyển đổi thành ánh sáng. Trong thiết kế của Huawei, các liên kết quang học hỗ trợ kết nối giữa các tủ rack, trong khi UnifiedBus cung cấp kiến trúc kết nối chung cho hệ thống tính toán.

Trong Atlas 960E, Huawei áp dụng NPO bên trong một hệ thống 4.096 NPU được kết nối chặt chẽ. Bản thân mạng quang học không phải là điều mới mẻ đối với các superpod của Huawei, nhưng NPO thay đổi mức độ tích hợp chặt chẽ giữa các thành phần quang học với phần cứng chuyển mạch.

Nvidia và Broadcom đã chọn cách tiếp cận khác với công nghệ quang học đồng đóng gói (co-packaged optics - CPO), đưa các động cơ quang học đặt cạnh silicon chuyển mạch trong cùng một gói. Công nghệ Spectrum-X Ethernet Photonics của Nvidia đã đi vào sản xuất, trong khi Broadcom đã thương mại hóa các bộ chuyển mạch CPO. Các thiết kế này rút ngắn phần kết nối điện trước khi dữ liệu được chuyển đổi thành tín hiệu quang, giải quyết nhiều hạn chế về băng thông và điện năng mà Huawei đang nhắm tới.

NPO chưa tích hợp động cơ quang học vào gói chip mà thay vào đó đặt các thành phần này ở gần trên bảng mạch in. Sự tích hợp chặt chẽ hơn của CPO giúp giảm suy hao tín hiệu và cho phép mật độ băng thông cao, trong khi Huawei lập luận rằng NPO có thể dễ sản xuất và bảo trì hơn nhờ sử dụng các chuỗi cung ứng hiện có.

Huawei chia sẻ với Nikkei Asia rằng các thành phần NPO của họ có thể cắm rút được, cho phép thay thế độc lập một thành phần bị lỗi. Hi-ONE kết hợp nguồn laser, quang tử silicon và các chip khác. Khả năng bảo trì khác nhau giữa các thiết kế CPO: Nvidia sử dụng các mô-đun laser bên ngoài có thể thay thế tại hiện trường, và thiết kế Quantum-X Photonics của họ bao gồm các cụm phụ quang học dạng ổ cắm.

"NPO là lựa chọn thực tế hơn so với CPO," Man Jiangwei, một giám đốc tại phòng thí nghiệm quang điện tử tiên tiến HiSilicon của Huawei, nói với Nikkei Asia. Huawei cũng coi sự phân mảnh giữa các triển khai NPO là lý do để theo đuổi một thông số kỹ thuật chung.

Tiger Ninomiya, một quan chức của OIF tham gia vào các giao diện tiết kiệm năng lượng và khả năng tương tác đồng đóng gói, nói với Nikkei Asia rằng NPO có thể đóng vai trò là một bước tiến hóa hướng tới CPO, đồng thời giải quyết các mối lo ngại hiện tại về sản xuất, khả năng tương tác và hệ sinh thái.

Atlas 960E nằm trong kiến trúc tính toán Peerium rộng lớn hơn của Huawei. Peerium sử dụng UnifiedBus để kết nối CPU, NPU, bộ nhớ, ổ cứng thể rắn, card giao diện mạng và bộ chuyển mạch thông qua một giao thức chung. Nó kết hợp kết nối ngang hàng (peer-to-peer) và địa chỉ bộ nhớ thống nhất với một phương pháp tính toán song song mà Huawei gọi là Nested Bulk Synchronous Parallel (Nested BSP).

Huawei cho biết một siêu cụm Atlas 950 dựa trên Peerium với 256.000 card tăng tốc đang được triển khai. Mục tiêu cuối cùng của công ty là làm cho tới một triệu bộ xử lý hoạt động như một máy tính logic duy nhất.

Huawei bắt đầu phát triển UnifiedBus vào năm 2019 và cung cấp superpod Atlas 900 A3 dựa trên UnifiedBus 1.0 đầu tiên vào tháng 3 năm 2025. Công ty cho biết vào năm 2025 rằng việc thiếu khả năng tiếp cận các nút quy trình bán dẫn tiên tiến đã góp phần vào quyết định theo đuổi việc tăng hiệu năng bằng cách kết hợp nhiều tài nguyên tính toán hơn.

Huawei cũng đã nâng cấp superpod TaiShan 950, được cho là hỗ trợ tới 4.096 nút tính toán đa năng và một vùng nhớ thống nhất lên tới 256 terabyte. Họ đã giới thiệu OceanStor M900, một hệ thống lưu trữ cung cấp bộ nhớ đệm key-value (KV) quy mô petabyte cho suy luận AI. Bộ nhớ đệm KV lưu trữ các tính toán trung gian để mô hình có thể tái sử dụng chúng khi tạo các token tiếp theo.

Theo Huawei, kiến trúc mạng Clos hai tầng, bốn mặt phẳng của họ có thể kết nối tới 512.000 NPU trên các superpod. Một cấu trúc liên kết đa đường (multi-rail), cung cấp nhiều đường dẫn mạng, có thể mở rộng thiết kế đó lên một triệu NPU, công ty cho biết thêm.

Huawei cũng đã cập nhật lộ trình bộ xử lý Ascend, lên lịch cho Ascend 960DT vào quý 1 năm 2027 và Ascend 960PR vào quý 3, tiếp theo là Ascend 970 và Ascend 980 lần lượt vào năm 2028 và 2029.

HuaweiAtlas 960EPhần cứng AINPOTrung tâm dữ liệu
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ KrASIA. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.