Nghiên cứu giới thiệu phương pháp loại bỏ 6 lớp ít quan trọng nhất trong bộ mã hóa Whisper, giúp giảm 18,5% kích thước mô hình mà không cần thay đổi cấu trúc suy luận. Hiệu suất được khôi phục ấn tượng thông qua kỹ thuật chưng cất từ dữ liệu âm thanh không nhãn.
Debias-SparseGPT là kỹ thuật cắt tỉa hậu huấn luyện giúp giảm định kiến xã hội trong các mô hình ngôn ngữ lớn mà vẫn duy trì độ chính xác và hiệu suất, ngay cả ở cấu trúc nén 2:4 khắt khe.
Apple giới thiệu IDEA Prune, một quy trình kết hợp việc huấn luyện mô hình lớn trước khi cắt tỉa để tối ưu hóa hiệu quả sử dụng token, giúp đạt hiệu suất cao hơn so với việc huấn luyện mô hình kích thước mục tiêu ngay từ đầu.