Nghiên cứu
CoWindow Attention: Tối ưu hóa cơ chế chú ý bằng cách phân bổ lịch sử nhân quả
(giờ Việt Nam)
Tóm tắt AI
CoWA là kiến trúc chú ý mới giúp giảm dư thừa tính toán bằng cách phân chia lịch sử nhân quả giữa các đầu KV thay vì để mọi đầu truy cập toàn bộ, giúp duy trì hiệu suất gần như tương đương với FullAttn nhưng tiết kiệm tài nguyên hơn.
Chính văn · Bản dịch AI
Tóm tắt: FullAttn liên tục hiển thị toàn bộ lịch sử nhân quả cho mọi đầu chú ý (attention head), tạo ra lượng tính toán dư thừa và lưu lượng bộ nhớ đáng kể ngay cả với các nhân dày (dense kernels) tối ưu hóa IO. Chúng tôi giới thiệu CoWA, một kiến trúc chú ý có cấu trúc giúp phân bổ quyền truy cập vào lịch sử nhân quả trên các đầu KV. Tất cả các đầu đều chia sẻ các cửa sổ gần đường chéo và tiền tố (prefix-sink), trong khi các cửa sổ tầm xa bổ sung sẽ phân chia phần lịch sử còn lại. Sự kết hợp của chúng cung cấp phạm vi bao phủ nhân quả đầy đủ mặc dù mỗi đầu chỉ chú ý thưa thớt đến các token ở xa. Mô hình chú ý được xác định theo vị trí này không yêu cầu bộ định tuyến hoặc bộ lập chỉ mục đã học, được sử dụng nhất quán trong quá trình huấn luyện và suy luận, đồng thời tương thích với tính song song tensor của đầu KV. Một thử nghiệm cắt bỏ (ablation) khớp cửa sổ ở mức 8K đã cô lập hiệu quả của việc phân bổ tầm xa bổ sung: CoWA với phạm vi bao phủ tập thể 100% đạt độ chính xác 89,73%, so với 89,97% của FullAttn, trong khi các cửa sổ tầm xa trùng lặp hoạt động kém hơn đáng kể. Trong một so sánh truy hồi liên kết có kiểm soát rộng hơn với ngân sách token tương đương, CoWA bám sát FullAttn khi ngữ cảnh tăng lên, trong khi các mô hình thưa thớt khác mất đi một phần đáng kể các liên kết. Trong một điểm chuẩn toán tử chú ý ở mức 128K token với tính song song tensor, CoWA giảm độ trễ lan truyền xuôi và ngược trong quá trình huấn luyện lần lượt là 7,4 lần và 8,6 lần, và giảm độ trễ giải mã trong quá trình suy luận 3,0 lần so với FullAttn. Bộ nhớ toán tử đỉnh trên mỗi rank của nó tương đương với FullAttn trong quá trình huấn luyện và thấp hơn 7,6 lần trong quá trình giải mã. Thông qua quá trình huấn luyện theo quy luật mở rộng từ 0,6 tỷ đến 14 tỷ tham số, CoWA bám sát FullAttn về độ bối rối (perplexity) trong khi giảm tổng số FLOPs huấn luyện. Các mô hình 14B và 32B thu được từ quá trình huấn luyện tiếp tục riêng biệt đạt được điểm số về kiến thức, suy luận và truy xuất ngữ cảnh dài tương đương với FullAttn. Những kết quả này cho thấy phạm vi bao phủ nhân quả đầy đủ có thể là một đặc tính tập thể của tập hợp các đầu thay vì là một đặc tính trùng lặp của mọi đầu.
| Chủ đề: | Trí tuệ nhân tạo (cs.AI) |
| Trích dẫn là: | arXiv:2609.32704 [cs.AI] |
| (hoặc arXiv:2609.32704v1 [cs.AI] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.32704 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Jingze Shi [xem email] [v1] Thứ Bảy, 26 tháng 9 năm 2026 15:09:07 UTC (503 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.