Hugging Face Daily Papers
Điểm AI 85/100

Nghiên cứu

PISA: Cơ chế Block Sparse Attention với độ phức tạp Log-Linear cho ngữ cảnh dài

(giờ Việt Nam)

Tóm tắt AI

PISA giới thiệu chiến lược chọn lọc Top-K theo hình tháp để tối ưu hóa cơ chế chú ý, giúp giảm độ phức tạp tính toán xuống mức log-linear thay vì bậc hai, giải quyết nút thắt trong việc xử lý ngữ cảnh dài cho mô hình ngôn ngữ.

Chính văn · Bản dịch AI

Xem PDF

Tóm tắt: Việc mở rộng các mô hình ngôn ngữ cho ngữ cảnh dài bị hạn chế bởi chi phí bậc hai của cơ chế self-attention. Block sparse attention cung cấp một giải pháp thay thế hiệu quả, nhưng việc lựa chọn các khối được giữ lại vẫn là một điểm nghẽn. Phương pháp chọn khối truyền thống yêu cầu chấm điểm tất cả các cặp truy vấn-khối, do đó vẫn giữ độ phức tạp bậc hai theo độ dài chuỗi. Để giải quyết vấn đề này, chúng tôi đề xuất PISA, một cơ chế block-sparse attention sử dụng chiến lược chọn Top-$K$ theo hình tháp. Ý tưởng chính là dần dần thu hẹp các ứng viên qua các cấp độ khác nhau, giúp việc tìm kiếm các khóa liên quan nhất trở nên hiệu quả hơn. Cụ thể, chúng tôi xây dựng một hệ thống phân cấp khóa từ thô đến tinh và thực hiện lựa chọn từ cấp độ thô nhất. Tại mỗi cấp độ, phương pháp chấm điểm LogSumExp được áp dụng cho một tập hợp ứng viên giới hạn để chọn ra các ứng viên cho cấp độ tinh hơn tiếp theo, tiếp tục cho đến khi đạt đến cấp độ tinh nhất. Thông qua việc gộp (pooling), chúng tôi xây dựng $O(\log N)$ cấp độ khóa, mang lại độ phức tạp tổng thể là $O(N\log N)$, trong đó $N$ là độ dài chuỗi. Chúng tôi phát triển các Triton kernel tối ưu cho phần cứng cho cả quá trình huấn luyện và suy luận, kết hợp định tuyến phân cấp và chấm điểm LogSumExp mà không cần tạo ra ma trận điểm truy vấn-khóa. Chúng tôi đánh giá thêm phương pháp của mình trên các tác vụ mô hình hóa ngôn ngữ. So với baseline, phương pháp của chúng tôi đạt hiệu suất tương đương trên các benchmark như suy luận thông thường (commonsense reasoning) trong khi mang lại kết quả tốt hơn trên các tác vụ truy xuất.

Chủ đề:Học máy (cs.LG)
Trích dẫn là:arXiv:2609.31093 [cs.LG]
(hoặc arXiv:2609.31093v1 [cs.LG] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.31093 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Bohao Tang [xem email] [v1] Thứ Sáu, 25 tháng 9 năm 2026 10:28:58 UTC (408 KB)

TransformerAttentionTối ưu hóaNgữ cảnh dàiNghiên cứu AI

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

PISA: Cơ chế Block Sparse Attention với độ phức tạp Log-Linear cho ngữ cảnh dài | AIHOT.vn