Nghiên cứu
IDEA Prune: Apple tối ưu hóa hiệu suất mô hình ngôn ngữ bằng quy trình 'Mở rộng rồi Cắt tỉa'
(giờ Việt Nam)
Tóm tắt AI
Apple giới thiệu IDEA Prune, một quy trình kết hợp việc huấn luyện mô hình lớn trước khi cắt tỉa để tối ưu hóa hiệu quả sử dụng token, giúp đạt hiệu suất cao hơn so với việc huấn luyện mô hình kích thước mục tiêu ngay từ đầu.
Bản dịch AI

Tác giả: Yixiao Li†**, Xianzhi Du, Ajay Jaiswal‡**, Tao Lei, Tuo Zhao†, Chong Wang, Jianyu Wang
Những tiến bộ gần đây trong các mô hình ngôn ngữ lớn (large language models) đã làm tăng nhu cầu về các mô hình hiệu quả và có khả năng triển khai trong phạm vi ngân sách suy luận hạn chế. Các quy trình cắt tỉa có cấu trúc (structured pruning pipelines) đã cho thấy tiềm năng về hiệu quả sử dụng token so với việc huấn luyện các mô hình có kích thước mục tiêu từ đầu. Trong bài báo này, chúng tôi đề xuất kết hợp việc tiền huấn luyện mô hình mở rộng (enlarged model pretraining) — vốn thường bị bỏ qua trong các nghiên cứu trước đây — vào quá trình cắt tỉa. Chúng tôi nghiên cứu quy trình "mở rộng và cắt tỉa" (enlarge-and-prune) như một hệ thống tích hợp để giải quyết hai câu hỏi quan trọng: liệu có đáng để tiền huấn luyện một mô hình mở rộng ngay cả khi mô hình đó không bao giờ được triển khai hay không, và làm thế nào để tối ưu hóa toàn bộ quy trình nhằm đạt được các mô hình sau cắt tỉa tốt hơn. Chúng tôi đề xuất một quy trình "mở rộng và cắt tỉa" tích hợp, kết hợp việc huấn luyện mô hình mở rộng, cắt tỉa và phục hồi dưới một lịch trình tốc độ học (learning rate) cosine annealing duy nhất. Phương pháp này được bổ sung thêm bằng một kỹ thuật cắt tỉa có cấu trúc lặp lại (iterative structured pruning) mới để loại bỏ tham số dần dần. Phương pháp được đề xuất giúp giảm thiểu sự mất mát kiến thức do tốc độ học tăng lên trong các quy trình "mở rộng và cắt tỉa" thông thường, đồng thời cho phép phân bổ lại hiệu quả dung lượng mô hình giữa các neuron còn lại, tạo điều kiện cho việc nén mượt mà và nâng cao hiệu suất. Chúng tôi đã thực hiện các thử nghiệm toàn diện trên việc nén các mô hình 2.8B xuống 1.3B với tối đa 2T token trong quá trình tiền huấn luyện. Kết quả cho thấy phương pháp tích hợp này không chỉ cung cấp những hiểu biết sâu sắc về hiệu quả sử dụng token của việc tiền huấn luyện mô hình mở rộng mà còn đạt được hiệu suất vượt trội cho các mô hình sau cắt tỉa.
Các bài đọc và cập nhật liên quan.
Các mạng thần kinh hiện đại đang phát triển không chỉ về kích thước và độ phức tạp mà còn cả thời gian suy luận. Một trong những kỹ thuật nén hiệu quả nhất — cắt tỉa kênh (channel pruning) — giải quyết xu hướng này bằng cách loại bỏ các kênh khỏi trọng số tích chập (convolutional weights) để giảm tiêu thụ tài nguyên. Tuy nhiên, việc loại bỏ các kênh không hề đơn giản đối với các phân đoạn đa nhánh của mô hình, điều này có thể dẫn đến việc sao chép bộ nhớ bổ sung tại thời điểm suy luận. Những bản sao này làm tăng độ trễ — rất nhiều…
Đọc thêm
Cắt tỉa DNN (DNN pruning) là một cách phổ biến để giảm kích thước mô hình, cải thiện độ trễ suy luận và giảm thiểu mức tiêu thụ điện năng trên các bộ tăng tốc DNN. Tuy nhiên, các phương pháp hiện có có thể quá phức tạp, tốn kém hoặc không hiệu quả khi áp dụng cho nhiều tác vụ thị giác/ngôn ngữ, các kiến trúc DNN khác nhau và để tuân thủ các ràng buộc cắt tỉa có cấu trúc. Trong bài báo này, chúng tôi đề xuất một lược đồ cắt tỉa trong quá trình huấn luyện (train-time pruning) hiệu quả nhưng vẫn tối ưu, Parameter-free Differentiable…
Đọc thêm
Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.