# Six Layers Less: Kỹ thuật cắt tỉa Encoder cho Whisper giúp tối ưu hiệu năng mà không cần nhãn

- Nguồn: HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
- Thời gian phát hành: 2026-09-23 07:00 (giờ Việt Nam)
- Điểm AI: 36/100
- Link AIHOT.vn: https://aihot.vn/items/0ee9267ab17b5044
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmufbne990520roagttqthty2
- Link gốc: https://arxiv.org/abs/2609.27980

## Tóm tắt AI

Nghiên cứu giới thiệu phương pháp loại bỏ 6 lớp ít quan trọng nhất trong bộ mã hóa Whisper, giúp giảm 18,5% kích thước mô hình mà không cần thay đổi cấu trúc suy luận. Hiệu suất được khôi phục ấn tượng thông qua kỹ thuật chưng cất từ dữ liệu âm thanh không nhãn.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.27980) [HTML (thử nghiệm)](https://arxiv.org/html/2609.27980v1)

> Tóm tắt: Việc cắt tỉa (pruning) các mô hình ASR dựa trên transformer lớn đã được huấn luyện trước như Whisper của OpenAI đã trở nên rất phổ biến, vì việc cắt tỉa bộ giải mã (decoder) giúp tăng tốc độ phiên mã end-to-end đáng kể. Ví dụ, biến thể {\tt whisper-large-v3-turbo} đã giảm bộ giải mã từ 32 xuống còn 4 lớp, trong khi Distill-Whisper cũng giảm bộ giải mã xuống chỉ còn 2 lớp. Mặc dù một số nghiên cứu đã tập trung vào việc giảm kích thước bộ mã hóa (encoder), nhưng chưa có phương pháp nào được áp dụng rộng rãi. Điều này có thể là do nhu cầu về các triển khai suy luận tùy chỉnh để tận dụng mô hình đã nén. Chúng tôi trình bày một phương pháp xếp hạng các lớp bộ mã hóa dựa trên sự thay đổi của Tỷ lệ lỗi từ (WER) khi loại bỏ từng lớp một (leave-one-layer-out). Sáu lớp gây ra ít thay đổi nhất sẽ bị loại bỏ, tương ứng với $18.5\%$ số lớp của bộ mã hóa. Mô hình sau khi cắt tỉa không yêu cầu mã suy luận tùy chỉnh vì nó đơn giản là một bộ mã hóa nông hơn với ít lớp hơn. Chúng tôi tiếp tục thực hiện chưng cất (distill) bằng cách sử dụng dữ liệu giọng nói đơn ngữ không dán nhãn để khôi phục hiệu suất bị suy giảm do việc cắt tỉa lớp zero-shot. WER trung bình trên bốn ngôn ngữ tăng lên $20.1\%$ sau khi chưng cất, so với $21.9\%$ ở trạng thái zero-shot, từ mức cơ sở là $18.2\%$. Chúng tôi công khai toàn bộ mã nguồn ([URL này](https://github.com/rasgaard/whisper-encoder-layer-prune)) và mô hình đã cắt tỉa ([URL này](https://huggingface.co/rasgaard/whisper-large-v3-turbo-encoder-pruned)).

| Bình luận: | 4 trang, 5 hình, hội thảo Tổng quát hóa từ Tài nguyên Hạn chế trong Thế giới Mở tại Hội nghị Quốc tế chung về Trí tuệ Nhân tạo |
| --- | --- |
| Chủ đề: | Tính toán và Ngôn ngữ (cs.CL); Học máy (cs.LG) |
| Các lớp MSC: | 68T10 |
| Trích dẫn là: | arXiv:2609.27980 [cs.CL] |
|  | (hoặc arXiv:2609.27980v1 [cs.CL] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.27980 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Rasmus Aagaard [xem email](https://arxiv.org/show-email/2813117b/2609.27980)] [v1] Thứ Tư, 23 tháng 9 năm 2026 12:05:22 UTC (713 KB)
