# Xiaomi công bố kiến trúc HySparse2 cho MiMo-V3: Tối ưu hiệu suất suy luận cho Agent dài hạn

- Nguồn: IT Home
- Thời gian phát hành: 2026-09-24 15:28 (giờ Việt Nam)
- Điểm AI: 49/100
- Link AIHOT.vn: https://aihot.vn/items/7e77b2cc295af46c
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmuf9rxjt06cnrocs35twhqm2
- Link gốc: https://www.ithome.com/1/006/839.htm

## Tóm tắt AI

Xiaomi giới thiệu kiến trúc HySparse2 trên nền tảng MiMo-V3, sử dụng cơ chế chia sẻ KV hai cấp và chọn lọc token thưa để tăng tốc độ xử lý cho các tác vụ Agent đòi hỏi ngữ cảnh dài.

## Thân bài

[IT](https://www.ithome.com/) ngày 24 tháng 9 đưa tin, Xiaomi MiMo hôm nay đã công bố HySparse2, kiến trúc cốt lõi dành cho MiMo-V3, hướng tới thế hệ Agent có ngữ cảnh dài tiếp theo. Kiến trúc mới này nhằm mục đích giúp mô hình xử lý các trang web, tài liệu, mã nguồn và nhật ký gọi công cụ với chi phí thấp hơn, đồng thời truy xuất thông tin quan trọng chính xác hơn từ lịch sử tác vụ ngày càng tăng.

IT đính kèm giới thiệu chi tiết từ phía chính thức như sau:

HySparse2 hướng tới AGENT đa vòng dài hạn, với tính toán Prefill ít hơn, KV Cache nhỏ hơn và truy xuất ngữ cảnh dài chính xác hơn.

Kể từ dòng Xiaomi MiMo-V2, chúng tôi liên tục khám phá việc nâng cao đồng thời năng lực mô hình và hiệu suất tính toán. Kiến trúc chú ý hỗn hợp Hybrid SWA được sử dụng trong dòng MiMo-V2 kết hợp Full Attention (Chú ý toàn phần) với Sliding Window Attention (Chú ý cửa sổ trượt), giúp việc huấn luyện và suy luận trở nên hiệu quả hơn trong khi vẫn duy trì hiệu quả của mô hình.

Trong nửa năm qua, chúng tôi đã liên tục thúc đẩy việc khám phá và thử nghiệm công nghệ học tăng cường (RL), áp dụng kinh nghiệm huấn luyện tích lũy vào dòng MiMo-V2.6 vừa ra mắt gần đây, thúc đẩy năng lực mô hình tăng lên đáng kể. Trong khi tiếp tục phát triển dòng V2, nghiên cứu về kiến trúc thế hệ mới cho MiMo-V3 cũng luôn được tiến hành. HySparse được công bố trước đó chính là bước đi đầu tiên trên lộ trình khám phá này.

Hôm nay, chúng tôi công bố kiến trúc cốt lõi của MiMo-V3 là HySparse2. Trên nền tảng của HySparse, nó đã nâng cấp thêm cơ chế chia sẻ KV và lựa chọn thưa (sparse selection), giúp mô hình xử lý ngữ cảnh dài hiệu quả và chính xác hơn.

### 01. Kiến trúc chú ý nào là cần thiết cho các tác vụ đa vòng dài hạn của Agent?

Một lần gọi công cụ ngắn gọn có thể mang về cả một trang web, một tài liệu hoặc nhật ký thực thi dài. Mỗi khi Agent tiến thêm một bước, nó đều phải xử lý đầu vào mới; khi tác vụ tiến triển, nó còn phải tìm đúng thông tin cần thiết cho bước tiếp theo từ lịch sử ngày càng tăng.

Mô hình sẽ lưu trữ biểu diễn của nội dung đã đọc trong KV Cache để phục vụ cho việc tạo nội dung sau đó. Quá trình đọc nội dung mới và thiết lập các bộ nhớ đệm này được gọi là Prefill. Trong các tác vụ Agent đa vòng, mỗi khi công cụ trả về thông tin mới, cần phải xử lý lại đầu vào mới. Do đó, kiến trúc mới cần đáp ứng đồng thời ba yêu cầu.

- Đọc hiệu quả: Giảm tính toán cần thiết để xử lý đầu vào dài, giúp mô hình nhanh chóng chuyển sang vòng tạo nội dung tiếp theo.
- Tiết kiệm bộ nhớ video (VRAM): Giảm mức chiếm dụng của KV Cache, giúp lịch sử ngày càng tăng dễ dàng được lưu giữ hơn.
- Truy xuất chính xác: Tìm ra bằng chứng liên quan từ lịch sử dài, tích hợp thông tin giữa các vòng một cách chính xác.

Thế hệ HySparse đầu tiên đã thực hiện một bước tiến. Nó sử dụng một số ít lớp Full Attention để cung cấp kết quả lựa chọn của KV Cache và các vị trí quan trọng, cho phép các lớp Sparse Attention tiếp theo tái sử dụng trực tiếp, từ đó giảm chi phí tính toán chú ý và bộ nhớ đệm. Tuy nhiên, trong kiến trúc HySparse, Prefill vẫn cần thực thi tất cả các lớp; đối với việc truy xuất thông tin đa vòng, khoảng cách xa, việc lựa chọn theo khối (block-level) vẫn còn dư địa để cải thiện độ chính xác. HySparse2 xoay quanh những vấn đề này, giới thiệu chia sẻ KV hai cấp, lựa chọn thưa cấp token và phương thức truy cập thông tin cục bộ thống nhất.

### 02. Chia sẻ KV hai cấp, giúp KV Cache sẵn sàng sớm hơn

Học hỏi thiết kế của YOCO, HySparse2 chia mô hình thành hai phần trước và sau. Phần trước là Self-Decoder, sử dụng cấu trúc hỗn hợp giữa Full Attention và SWA; phần sau là Cross-Decoder, sử dụng cấu trúc hỗn hợp giữa Full Attention và Sparse Attention.

Trên cơ sở này, việc chia sẻ KV được chia thành hai cấp độ: KV Bridging và KV Reuse.

![图片](https://img.ithome.com/newsuploadfiles/2026/9/5a1f2283-7c46-4ea0-a267-e4075e1eb55a.png?x-bce-process=image/format,f_auto)

KV Bridging: Xây dựng KV trước thông qua hai phần trước và sau.

Mỗi lớp Full Attention ở phần sau đều tạo ra KV Cache của riêng mình từ trạng thái ẩn đầu vào của lớp Full Attention tương ứng ở phần trước. Mỗi lớp mục tiêu giữ lại các phép chiếu K/V độc lập, do đó ngay cả khi sử dụng cùng một trạng thái ẩn nguồn, vẫn có thể xây dựng các KV khác nhau.

Như vậy, KV của lớp Full Attention ở phần sau không cần phải đợi đầu vào đi qua chúng từng lớp một mới có được. Thông tin cần thiết để tạo ra các bộ nhớ đệm này đã có sẵn ở phần trước.

KV Reuse: Tái sử dụng KV và kết quả lựa chọn trong cùng một Hybrid Block.

Mỗi Hybrid Block bao gồm một lớp Full Attention và các lớp Sparse Attention theo sau. Khi Full Attention hoàn thành tính toán của chính nó, nó cũng chọn ra các vị trí quan trọng dựa trên điểm số chú ý; các lớp thưa tiếp theo sẽ trực tiếp tái sử dụng KV Cache và chỉ mục lựa chọn của nó.

Điều này bảo lưu thiết kế cốt lõi của HySparse: một số ít lớp chú ý toàn phần cung cấp thông tin toàn cục và kết quả lựa chọn, nhiều lớp chú ý thưa sử dụng hiệu quả các thông tin này mà không cần huấn luyện thêm một bộ chọn độc lập.

### 03. Lựa chọn chi tiết hơn ở khoảng cách xa, luôn nhìn thấy thông tin gần

Từ "chọn một khối" đến "chọn một token"

Thế hệ HySparse đầu tiên sử dụng lựa chọn thưa cấp khối. Trong ngữ cảnh dài, để chọn một token quan trọng, mô hình thường đưa cả một khối nội dung xung quanh nó vào tính toán. Các manh mối mà Agent cần có thể nằm rải rác trong các vòng đối thoại, kết quả công cụ và đoạn mã khác nhau. HySparse2 chuyển sang lựa chọn cấp token, cho phép phân bổ ngân sách chú ý tương đương một cách tinh tế hơn vào các vị trí này. Với cùng ngân sách token toàn cục, lựa chọn cấp Token đã đạt được sự cải thiện trên RULER-v2, truy xuất đa vòng MRCR-v2 và suy luận đồ thị GraphWalks, xác nhận giá trị của việc lựa chọn chi tiết hơn đối với các loại tác vụ này.

Bảo lưu cửa sổ cục bộ, hợp nhất nhánh độc lập

Ngoài truy xuất toàn cục, mô hình vẫn cần nhìn thấy ổn định ngữ cảnh gần nhất. HySparse2 sẽ bắt buộc chọn 128 token gần nhất, sau đó chọn 1.024 token toàn cục từ bên ngoài cửa sổ. Hai phần cùng đọc KV Cache dùng chung do lớp Full Attention cung cấp.

Do đó, lớp thưa không còn cần nhánh SWA riêng biệt và KV Cache cục bộ. Việc truy cập thông tin cục bộ vốn do nhánh độc lập đảm nhận trong HySparse đã được hợp nhất vào cùng một tính toán chú ý thưa trong HySparse2.

Điều này cũng giải phóng một sự phụ thuộc quan trọng: bộ nhớ đệm của nhánh SWA độc lập vốn đến từ trạng thái ẩn của chính lớp đó, việc xây dựng nó đòi hỏi phải tiếp tục thực hiện tính toán của Cross-Decoder ở phần sau. Sau khi hợp nhất, cả thông tin cục bộ và toàn cục đều có thể sử dụng KV đã được chuẩn bị sẵn trong giai đoạn Self-Decoder.

Thông tin cục bộ vẫn quan trọng. Các thí nghiệm cắt bỏ (ablation study) của HySparse2 cho thấy việc bắt buộc cửa sổ cục bộ duy trì khả năng cạnh tranh trên nhiều tác vụ văn bản dài, một số chỉ số cũng tồn tại sự đánh đổi; thiết kế này đồng thời tiết kiệm được các tham số phép chiếu và chi phí KV Cache của nhánh SWA độc lập, tạo điều kiện cho việc thoát sớm (early exit) của Prefill.

### 04. Prefill kết thúc sớm một nửa, giảm áp lực triển khai suy luận

Việc chia sẻ KV hai cấp và hợp nhất cửa sổ cục bộ giúp toàn bộ KV Cache cần thiết cho phần sau của mô hình có thể được xây dựng từ trạng thái ẩn của phần trước. Sau khi hoàn thành tính toán của Self-Decoder và phép chiếu KV Bridging, việc xây dựng KV Cache đầu vào có thể kết thúc.

Trong mô hình 49 lớp, Prefill chỉ cần thực thi 25 lớp Self-Decoder đầu tiên và phép chiếu KV cầu nối, trong đó chỉ có một lớp Full Attention. Khi triển khai tách biệt Prefill–Decode, nút Prefill cũng chỉ cần triển khai mạng Self-Decoder phần này, trọng số mô hình cần lưu trữ giảm gần một nửa.

Điều này giúp việc tối ưu hóa mở rộng từ giảm tính toán chú ý sang rút ngắn đường dẫn tính toán của đầu vào dài qua mô hình. Giai đoạn tạo nội dung vẫn giữ lại mạng đầy đủ, tiếp tục sử dụng khả năng truy xuất và mô hình hóa toàn cục của phần sau.

### 05. Chi phí thấp hơn, tốc độ nhanh hơn, hiệu suất văn bản dài tốt hơn

![图片](https://img.ithome.com/newsuploadfiles/2026/9/3b2847d8-2397-4b31-a427-3b9a54761ab5.png?x-bce-process=image/format,f_auto)

Chúng tôi đã so sánh Hybrid SWA, HySparse và HySparse2 trên mô hình MoE 80B-A3B, sử dụng cùng dữ liệu và quy trình huấn luyện. Cả ba đều sử dụng thiết kế MoE giống nhau, thiết kế chú ý khác nhau, HySparse2 còn sử dụng cấu hình MQA gọn nhẹ hơn.

Với một triệu token, tính toán và bộ nhớ đệm giảm đồng thời

Trong phân tích chi phí với một triệu token, so với Hybrid SWA, lượng tính toán Prefill của HySparse2 giảm xuống còn 1/5, KV Cache giảm từ 12GB xuống 2,7 GB. So với HySparse thế hệ đầu, lượng tính toán Prefill của HySparse2 giảm xuống còn 1/3, KV Cache giảm từ 6,7 GB xuống 2,7 GB.

Truy xuất văn bản dài và mô hình hóa ngữ cảnh đa vòng được cải thiện đồng bộ

Sau khi tiền huấn luyện, HySparse2 duy trì năng lực tổng quát tương đương, hiệu suất ngữ cảnh dài tốt hơn. Sau khi huấn luyện tinh chỉnh nhẹ tương tự, trong phạm vi đánh giá tối đa 256k, HySparse2 đạt điểm MRCR-v2, RULER-v2 cao hơn và AgentPPL, LongPPL thấp hơn trên tất cả các độ dài đã kiểm tra. Hai chỉ số đầu khảo sát khả năng truy xuất và hỏi đáp trong ngữ cảnh dài; hai chỉ số sau đo lường khả năng dự đoán của mô hình đối với quỹ đạo Agent đa vòng và các token phụ thuộc vào thông tin khoảng cách xa. So với HySparse thế hệ đầu, điểm trung bình của MRCR-v2 và RULER-v2 trên các độ dài báo cáo lần lượt tăng 11,30 và 19,81 điểm phần trăm.

_Bài gốc còn tiếp._ Xem tiếp tại: <https://www.ithome.com/1/006/839.htm>
