# MALA: Kỹ thuật MassAlloc Attention giúp tối ưu hóa tính toán cho cơ chế Attention

- Nguồn: Hugging Face Daily Papers
- Thời gian phát hành: 2026-09-29 07:00 (giờ Việt Nam)
- Điểm AI: 85/100
- Link AIHOT.vn: https://aihot.vn/items/52a56edfbaec039d
- Link gốc: https://arxiv.org/abs/2609.32712

## Tóm tắt AI

MALA là một cơ chế Attention mới giúp phân bổ tài nguyên tính toán dựa trên mức độ đóng góp thực tế của các điểm dữ liệu, giúp giảm thiểu các phép tính dư thừa mà vẫn duy trì độ chính xác cao.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.32712) [HTML (thử nghiệm)](https://arxiv.org/html/2609.32712v1)

> Tóm tắt: FullAttn thường gán khối lượng chuẩn hóa không đáng kể cho phần lớn không gian điểm nhân quả (causal score space), tuy nhiên các nhân dày đặc (dense kernels) vẫn thực thi toàn bộ đường dẫn hậu điểm (post-score path) sau khi tạo mỗi ô QK. Chúng tôi giới thiệu MALA, một nguyên hàm attention hợp nhất giúp bảo toàn quyền truy cập điểm cho mọi tương tác nhân quả hợp lệ và sử dụng đóng góp chuẩn hóa để phân bổ tính toán hậu điểm. Quá trình lan truyền tiến (forward) sử dụng bộ chuẩn hóa online-softmax đang phát triển của nó, trong khi quá trình lan truyền ngược (backward) tái sử dụng bộ chuẩn hóa đã hoàn thiện để suy ra phần hỗ trợ được giữ lại lồng nhau chỉ bằng cách sử dụng trạng thái attention tiêu chuẩn. Một ngưỡng dung sai chung điều phối quá trình huấn luyện và suy luận, cho phép giữ lại công việc một cách thích ứng. MALA giảm thiểu tính toán hậu điểm có đóng góp thấp. Một nghiên cứu về khối lượng công việc tương đương ở 8K đã cô lập lợi ích của việc phân bổ thích ứng theo phân phối: dưới tổng khối lượng công việc hậu điểm khớp chính xác, MALA tiệm cận với oracle khối lượng tham chiếu trên mỗi instance, với khối lượng bị bỏ qua trung bình là 0,0188% so với 0,0182%. Trên các độ dài ngữ cảnh từ 1K đến 32K token, cùng một ngưỡng dung sai duy trì sai số đầu ra và gradient thấp so với tham chiếu. Trong một so sánh truy hồi liên kết (associative-recall) có kiểm soát rộng hơn, MALA bám sát FullAttn khi ngữ cảnh tăng lên, đạt độ chính xác 89,67% ở 8K so với 89,97% của FullAttn. Trong một benchmark toán tử attention ở 128K token với song song hóa tensor, MALA giảm độ trễ lan truyền tiến và ngược trong quá trình huấn luyện lần lượt là 2,2x và 3,0x, và độ trễ giải mã trong quá trình suy luận là 1,6x so với FullAttn. Trong quá trình huấn luyện theo quy luật mở rộng (scaling-law) từ 0,6B đến 14B tham số, MALA bám sát FullAttn về độ bối rối (perplexity) trong khi giảm tổng số FLOPs huấn luyện. Các mô hình 14B và 32B thu được từ quá trình huấn luyện tiếp tục riêng biệt đạt được điểm số về kiến thức, suy luận và truy xuất ngữ cảnh dài tương đương với FullAttn. Những kết quả này chỉ ra rằng việc phân bổ tính toán hậu điểm theo các đóng góp attention chuẩn hóa có thể giữ lại các khả năng đã được đánh giá của FullAttn trong khi vẫn giảm thiểu tính toán attention.

| Chủ đề: | Trí tuệ nhân tạo (cs.AI); Tính toán và Ngôn ngữ (cs.CL) |
| --- | --- |
| Trích dẫn là: | arXiv:2609.32712 [cs.AI] |
|  | (hoặc arXiv:2609.32712v1 [cs.AI] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.32712 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Jingze Shi [xem email](https://arxiv.org/show-email/c320b59d/2609.32712)] [v1] Thứ Bảy, 26 tháng 9 năm 2026 15:24:45 UTC (261 KB)
