QbitAI
85

Tin ngành

AI SSD: Bước ngoặt mới trong kiến trúc lưu trữ cho suy luận mô hình ngôn ngữ lớn

(giờ Việt Nam)

Tóm tắt AI

Sự kết hợp tối ưu giữa sức mạnh tính toán, mạng lưới, bộ nhớ và lưu trữ đang tạo ra một tiêu chuẩn mới để xử lý dữ liệu theo từng Token hiệu quả hơn.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

07-08-2026 10:56:46 Nguồn: QbitAI

Sức mạnh tính toán (Compute), mạng, bộ nhớ và lưu trữ bắt đầu phối hợp xoay quanh từng Token.

Yun Zhong, đưa tin từ Aofeisi.

QbitAI | Kênh chính thức QbitAI.

Trong hai năm qua, cuộc cạnh tranh về hạ tầng AI chủ yếu xoay quanh số lượng GPU, sức mạnh tính toán của chip, băng thông HBM và mạng tốc độ cao.

Tuy nhiên, khi các mô hình lớn (Large Models) bước vào giai đoạn ngữ cảnh dài (long context), suy luận phức tạp và đa tác nhân (multi-agent), các yếu tố quyết định một hệ thống có thể tạo ra bao nhiêu Token hiệu quả đang trở nên phức tạp hơn.

GPU vẫn là nền tảng tính toán, nhưng hiệu suất sử dụng thực tế của nó ngày càng phụ thuộc vào việc liệu trọng số mô hình (model weights), KV Cache và các chuyên gia MoE có thể đến đúng nút tính toán vào đúng thời điểm hay không.

Do đó, hạ tầng AI đang chuyển từ giai đoạn "chồng chất tài nguyên tính toán" sang giai đoạn mới là "phối hợp các luồng dữ liệu giữa tính toán, mạng, bộ nhớ và lưu trữ".

Mooncake của Moonshot AI và CMX do NVIDIA ra mắt là hai tín hiệu đại diện cho sự thay đổi này.

Moonshot AI xuất phát từ kiến trúc phần mềm suy luận quy mô lớn, tổ chức các CPU, DRAM, SSD và NIC phân tán trong cụm thành tài nguyên KV Cache có thể điều phối được;

NVIDIA tiến thêm một bước bằng cách thiết lập tầng ngữ cảnh Flash cấp Pod chuyên dụng trong hạ tầng Vera Rubin.

Dù quy mô và cách triển khai khác nhau, cả hai đều cùng hướng tới một xu hướng:

Trạng thái suy luận (Inference state) đang trở thành tài nguyên cấp một trong hạ tầng AI, và lưu trữ cũng bắt đầu tham gia vào luồng chính thời gian thực của quá trình tạo Token.

Mooncake: Biến KV Cache thành tài nguyên hạ tầng độc lập.

Ý nghĩa công nghiệp quan trọng nhất của Mooncake không chỉ là xây dựng một hệ thống dịch vụ suy luận mới cho Kimi, mà còn thay đổi cách hạ tầng mô hình lớn tổ chức "dữ liệu".

Các nút suy luận truyền thống thường coi GPU, CPU, DRAM và SSD cục bộ là tài nguyên cố định bên trong một máy chủ; KV Cache chủ yếu tồn tại theo yêu cầu và thực thể GPU; một khi bộ nhớ đệm bị loại bỏ hoặc yêu cầu bị di chuyển, các tính toán Prefill đã hoàn thành có thể mất giá trị tái sử dụng.

Ngữ cảnh càng dài, sự lãng phí tính toán lặp lại và tài nguyên GPU đắt đỏ càng trở nên rõ rệt.

Mooncake, được Moonshot AI và Đại học Thanh Hoa công bố tại USENIX FAST ’25, áp dụng kiến trúc tách biệt lấy KV Cache làm trung tâm, triển khai Prefill và Decode trong các nhóm tài nguyên khác nhau, đồng thời tổ chức các CPU, DRAM, SSD và NIC chưa được tận dụng hết trong cụm GPU thành một nhóm KV Cache phân tán.

Conductor ở trung tâm không còn chỉ phân phối yêu cầu dựa trên tải GPU, mà kết hợp với sự phân bổ KV Cache, tỷ lệ trúng bộ nhớ đệm, tải của nút cũng như các mục tiêu dịch vụ như TTFT, TBT để quyết định việc tái sử dụng bộ nhớ đệm, thực thi Prefill và lập lịch Decode [1].

Luồng yêu cầu của Mooncake minh họa rõ hơn sự thay đổi này: Prefix KV Cache có thể tái sử dụng được gửi đến thực thể Prefill phù hợp trước, KV Cache mới được tạo ra liên tục theo các lớp tính toán của mô hình, sau đó chồng lấp với tính toán Prefill và được truyền không đồng bộ đến nút Decode mục tiêu; chỉ khi bộ nhớ đệm đã sẵn sàng, yêu cầu mới bước vào giai đoạn xử lý theo lô liên tục (continuous batching).

Mooncake Store chịu trách nhiệm quản lý việc đặt, sao chép, loại bỏ và vòng đời của các khối KV, trong khi Transfer Engine kết nối các tầng tính toán và lưu trữ khác nhau thông qua RDMA, tổng hợp băng thông đa NIC và lựa chọn đường dẫn nhận thức cấu trúc liên kết [1][2].

Hệ thống suy luận nhờ đó chuyển từ "cung cấp dữ liệu cho GPU" sang "điều phối toàn bộ luồng dữ liệu xoay quanh vòng đời của Tensor".

△ Kiến trúc suy luận tách biệt lấy KV Cache làm trung tâm của Mooncake: Các nhóm tài nguyên Prefill và Decode phối hợp làm việc thông qua Mooncake Store, công cụ truyền tải RDMA và bộ lập lịch toàn cục.

Bài báo về Mooncake tóm tắt tư duy này là "dùng nhiều lưu trữ hơn để đổi lấy ít tính toán hơn".

Theo dữ liệu được công bố trong bài báo, dưới các quỹ đạo yêu cầu thực tế và các ràng buộc TBT khác nhau, Mooncake đã cải thiện khả năng chịu tải yêu cầu hiệu quả từ 59% đến 498% so với các hệ thống cơ sở được so sánh; tại thời điểm công bố bài báo, hệ thống sản xuất của nó đã chạy trên hàng nghìn nút, xử lý hơn 100 tỷ Token mỗi ngày [1].

Cần nhấn mạnh rằng những dữ liệu này phản ánh lợi ích kiến trúc đầu cuối sau khi phối hợp bộ nhớ đệm, lập lịch, mạng và tính toán, chứ không phải lợi ích của một ổ SSD đơn lẻ.

Điều đáng chú ý hơn đối với ngành công nghiệp SSD AI là tài liệu chính thức hiện tại của Mooncake đã đưa DRAM và SSD/NVMe vào bộ nhớ đệm đa cấp một cách rõ ràng, đồng thời cung cấp lộ trình giảm tải từ bộ nhớ sang SSD cục bộ, tức là các đối tượng bị loại bỏ khỏi bộ nhớ có thể đi vào SSD ở chế độ nền, và khi bộ nhớ không trúng (cache miss), dữ liệu sẽ được đọc ngược lại từ SSD; sau khi dữ liệu đi qua bộ đệm tiền đăng ký, nó sẽ được Transfer Engine gửi đến DRAM hoặc VRAM mục tiêu [2][3].

Hệ thống tầng trên giải quyết vấn đề "khi nào di chuyển, di chuyển đến đâu", còn phía thiết bị vẫn phải giải quyết các vấn đề về độ trễ đuôi (tail latency), vận chuyển song song, tải liên tục, độ bền và sự phối hợp với vòng đời suy luận.

Do đó, SSD không còn chỉ là nguồn tệp tin trước khi khởi động mô hình, mà trở thành tầng dữ liệu suy luận bị ràng buộc chung bởi TTFT, thông lượng và SLO dịch vụ.

CMX: NVIDIA thêm tầng G3.5 giữa HBM và lưu trữ chia sẻ.

Kỷ nguyên Agent (tác nhân) tiếp tục thay đổi đối tượng tối ưu hóa của hạ tầng AI.

Một yêu cầu phức tạp không còn chỉ là một lần chuyển tiếp mô hình (model forward), mà có thể mở rộng thành chuỗi dài bao gồm gọi mô hình, thực thi công cụ, truy xuất bộ nhớ, truy cập dữ liệu và suy luận nhiều vòng.

KV Cache cũng chuyển từ trạng thái tạm thời bên trong GPU thành dữ liệu hạ tầng cần được di chuyển, chia sẻ và tái sử dụng giữa các nút.

Việc GPU có thể liên tục nhận được ngữ cảnh chính xác hay không bắt đầu trở nên quan trọng ngang bằng với tốc độ tính toán của chính GPU đó.

Khi ngữ cảnh của tác nhân mở rộng sang đối thoại nhiều vòng, gọi công cụ và trạng thái xuyên tác vụ, dung lượng của G1 đến G3 nhanh chóng bị hạn chế, trong khi độ trễ truy cập và chi phí dịch vụ dữ liệu chung của G4 lại không phù hợp để thường xuyên đi vào luồng Decode [4].

Nền tảng lưu trữ ngữ cảnh NVIDIA CMX (Context Memory Storage Platform) do đó đã thêm một tầng được gọi là "G3.5" giữa hai tầng này: bộ nhớ ngữ cảnh cấp Pod được tối ưu hóa cho KV Cache, sử dụng Flash làm phương tiện và kết nối qua Ethernet.

Nó chủ yếu mang ngữ cảnh suy luận ngắn hạn, phái sinh, có thể tính toán lại nhưng nhạy cảm với độ trễ, thay vì thay thế lưu trữ bền vững G4 dùng cho kiến thức dài hạn, nhật ký và hồ sơ nghiệp vụ [4].

AI SSDHạ tầng AILLMPhần cứngSuy luận AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.