Nghiên cứu
Tái tham số hóa Softmax: Giải pháp tối ưu hóa lượng tử hóa lớp đầu ra cho mô hình ngôn ngữ
(giờ Việt Nam)
Tóm tắt AI
Phương pháp này giúp giảm chi phí suy luận cho các lớp đầu ra có từ vựng lớn bằng cách tái tham số hóa Softmax trước khi lượng tử hóa, giúp bảo toàn phân phối xác suất mà không làm thay đổi bộ giải mã.
Chính văn · Bản dịch AI
Tóm tắt: Từ vựng lớn khiến các đầu ra (output heads) trở thành chi phí suy luận đáng kể trong các mô hình ngôn ngữ nhỏ. Chúng tôi đề xuất phương pháp tái tham số hóa softmax (softmax reparameterization), một phương pháp hậu huấn luyện giúp chọn ra một đầu ra tương đương về mặt chức năng trước khi thực hiện lượng tử hóa. Phương pháp này trừ đi một bội số vô hướng của giá trị trung bình hàng từ vựng khỏi mỗi hàng đầu ra và chọn hệ số thông qua KL kiểm chứng riêng biệt cho RTN, MSE trọng số kích hoạt và GPTQ Hessian đầy đủ. Quá trình tìm kiếm một chiều này bao gồm đầu ra gốc và phương pháp căn giữa trung bình cố định, bảo toàn phân phối softmax độ chính xác đầy đủ và giữ nguyên bộ giải mã (decoder) đã huấn luyện; một hiệu chỉnh hạng nhất xử lý các đường dẫn logit phi tuyến tính như soft-capping. Trên bảy đầu ra, các mức tăng W4 tập trung ở những nơi lượng tử hóa cơ sở làm sai lệch đáng kể các dự đoán: trên Phi-4-mini, chỉ số AW-MSE KL giảm từ 0,936 xuống 0,256. Các mức tăng này vẫn duy trì hiệu quả với hiệu chuẩn GPTQ mạnh hơn và bổ sung cho việc mở rộng quy mô theo kênh (per-channel scaling) chính xác và lượng tử hóa affine. Trên bốn đầu ra và ba bộ lượng tử hóa W4, các hệ số được chọn từ WikiText cố định cũng chuyển đổi sang C4 và OpenWebMath, vượt trội hơn so với phương pháp căn giữa trung bình trong tất cả 18 so sánh mà hệ số cố định khác 1 và tương đương trong sáu trường hợp còn lại. Tại W2, được sử dụng như một bài kiểm tra áp lực nén, các lợi ích mở rộng trên gần như toàn bộ ma trận mô hình-bộ lượng tử hóa. Phân tích phần dư khớp cho thấy độ trung thực được cải thiện có thể đi kèm với sai số tái tạo logit lớn hơn trong khi vẫn giảm chi phí trọng số Fisher của phần dư. Đối với các đầu ra tương thích với dịch chuyển, việc tái tham số hóa không thêm thao tác suy luận nào và bảo toàn quá trình thực thi W4 đã đóng gói: với bộ giải mã giữ ở định dạng BF16, việc lượng tử hóa đầu ra Phi giúp giảm độ trễ tạo văn bản theo lô đơn (batch-one) xuống 10,8% so với mức cơ sở đầu ra BF16.
| Bình luận: | 33 trang, bao gồm phụ lục |
| Chủ đề: | Học máy (cs.LG); Trí tuệ nhân tạo (cs.AI) |
| Trích dẫn là: | arXiv:2609.31291 [cs.LG] |
| (hoặc arXiv:2609.31291v1 [cs.LG] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.31291 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Asim Kadav [xem email] [v1] Thứ Sáu, 25 tháng 9 năm 2026 14:01:25 UTC (76 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.