Nghiên cứu
DepthBench: Đánh giá thực chất khả năng tính toán của các mô hình Transformer sâu
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu giới thiệu DepthBench, một bộ tiêu chuẩn giúp phân tích liệu việc tăng độ sâu kiến trúc có thực sự cải thiện năng lực tính toán hay chỉ là do các yếu tố nhiễu, thông qua việc kiểm soát tỷ lệ chiều rộng và độ sâu của mô hình.
Chính văn · Bản dịch AI
Tóm tắt: Độ sâu là một cách tự nhiên để tăng năng lực tính toán trong các mô hình Transformer, tuy nhiên đóng góp của các lớp sâu hơn có thể giảm dần khi độ sâu tăng lên. Các phương pháp gần đây cải thiện quá trình chuẩn hóa (ví dụ: LayerNorm Scaling) hoặc các kết nối dư (ví dụ: mHC, AttnRes) để cho phép luồng thông tin và khả năng tận dụng độ sâu tốt hơn. Tuy nhiên, vẫn chưa rõ liệu chúng có thực sự chuyển đổi độ sâu kiến trúc tăng thêm thành độ sâu tính toán hiệu quả hay không, và liệu những cải thiện được báo cáo có xuất phát từ việc tiếp cận thông tin tốt hơn theo chiều sâu, hay do các yếu tố gây nhiễu chưa được tính đến. Trong bài báo này, chúng tôi giới thiệu **DepthBench**, một bộ tiêu chuẩn kiểm soát để nghiên cứu độ sâu tính toán trên nhiều kiến trúc khác nhau. Chúng tôi thay đổi một cách hệ thống tỷ lệ chiều rộng--độ sâu ($d_{\text{model}}/n_{\text{layer}}$) từ các hình thái nông--rộng sang sâu--hẹp, trong khi vẫn giữ nguyên kích thước mô hình và quy trình tiền huấn luyện. Trên 10 kiến trúc tiêu biểu, chúng tôi nhận thấy lợi ích của việc phân bổ nhiều năng lực hơn cho độ sâu phụ thuộc rất lớn vào kiến trúc. Các biến thể Pre-LN tiêu chuẩn và hầu hết các biến thể dựa trên chuẩn hóa và tỷ lệ của nó mang lại rất ít lợi ích và thậm chí có thể làm giảm hiệu suất khi các mô hình trở nên sâu và hẹp hơn, trong khi HC và Full AttnRes cải thiện một cách nhất quán ngay cả ở các hình thái cực kỳ sâu. Những cải thiện này vượt ra ngoài tổn thất tiền huấn luyện và chuyển đổi nhất quán thành hiệu suất chuyên biệt theo miền và tính toán hiệu quả. Các phân tích ở cấp độ lớp có kiểm soát cho thấy thêm rằng những cải thiện của HC và Full AttnRes gắn liền với việc tận dụng hiệu quả hơn các lớp bổ sung, làm sáng tỏ các cơ chế riêng biệt của độ sâu tính toán trên các kiến trúc. Nhìn chung, kết quả của chúng tôi xác định thiết kế kết nối dư là yếu tố quyết định then chốt liệu độ sâu có thể đóng vai trò là trục mở rộng có ý nghĩa hay không bằng cách cho phép độ sâu kiến trúc bổ sung chuyển đổi thành tính toán hiệu quả.
| Chủ đề: | Thị giác máy tính và Nhận dạng mẫu (cs.CV); Trí tuệ nhân tạo (cs.AI); Học máy (cs.LG) |
| Trích dẫn là: | arXiv:2609.32534 [cs.CV] |
| (hoặc arXiv:2609.32534v1 [cs.CV] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.32534 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Keyu Wang [xem email] [v1] Thứ Bảy, 26 tháng 9 năm 2026 12:15:42 UTC (12.815 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.