Hugging Face: Blog
88

Tin ngành

Multiverse: Ứng dụng vật lý lượng tử để tối ưu hóa việc cắt tỉa mô hình LLM

(giờ Việt Nam)

Tóm tắt AI

Multiverse giới thiệu phương pháp cắt tỉa khối LLM bằng cách chuyển đổi thành bài toán tối ưu hóa Ising, giúp chọn cấu hình nén tối ưu mà không cần chạy benchmark. Kết quả trên Llama-3.3-70B cho thấy hiệu suất vượt trội, tăng 23% điểm MMLU so với các phương pháp truyền thống.

Bản dịch AI

Pruning LLMs Like a Physicist: Block Removal as an Ising Optimization Problem

Một trong những cách rẻ nhất để tăng tốc mô hình ngôn ngữ lớn (LLM) cũng là cách thô sơ nhất: xóa bỏ toàn bộ các khối transformer (transformer blocks). Vì mô hình thực sự trở nên ngắn hơn, việc loại bỏ khối (còn gọi là cắt tỉa theo chiều sâu - depth pruning) mang lại tốc độ suy luận nhanh hơn một cách có thể dự đoán được bên cạnh việc tiết kiệm bộ nhớ, đồng thời nó có thể kết hợp hiệu quả với kỹ thuật lượng tử hóa (quantization), nén hạng thấp (low-rank compression) và các kỹ thuật khác. Phần khó khăn nằm ở việc quyết định nên cắt khối nào. Nếu xóa nhầm khối, mô hình sẽ bị hỏng; và hiệu quả của việc xóa bất kỳ khối nào đều phụ thuộc vào những khối khác mà bạn xóa cùng với nó, vì vậy các lựa chọn này có sự tương tác lẫn nhau. Điều đó biến nó thành một bài toán tổ hợp chứ không phải bài toán xếp hạng, và các bài toán tổ hợp với các biến nhị phân tương tác chính là những gì mà vật lý của hệ spin được xây dựng để mô tả.

Bài báo mới nhất của chúng tôi, "Nén LLM bằng cách loại bỏ khối với tối ưu hóa nhị phân có ràng buộc" (LLM Compression by Block Removal with Constrained Binary Optimization), đã áp dụng sự tương ứng đó một cách trực diện. Chúng tôi chuyển đổi việc lựa chọn khối thành một bài toán tối ưu hóa nhị phân có ràng buộc (CBO), ánh xạ trực tiếp lên một hệ Ising glass, một hệ spin hỗn loạn với các tương tác tất cả-với-tất cả và một số lượng cố định các spin "hướng lên". Năng lượng của hệ spin này hóa ra lại là một đại diện mạnh mẽ và ít tốn kém cho hiệu suất thực tế của mô hình sau khi cắt tỉa trên các bộ benchmark, điều đó có nghĩa là chúng tôi có thể xếp hạng một số lượng lớn các cấu hình ứng viên mà không cần phải chạy benchmark cho bất kỳ cấu hình nào, sau đó chuyển các trường hợp khó cho các bộ giải cổ điển và lấy cảm hứng từ lượng tử mà chúng tôi vẫn sử dụng tại Multiverse. Lợi ích trong chế độ nén sâu là rất lớn: ở mức nén 50% của Llama-3.3-70B-Instruct, chúng tôi đạt được gần 23 điểm phần trăm trên MMLU so với phương pháp loại bỏ khối cạnh tranh tốt nhất.

Tại sao việc chọn khối lại là một bài toán nhiều vật thể (many-body problem)

Hầu hết các phương pháp loại bỏ khối hiện nay đều chấm điểm từng khối một cách riêng lẻ, sau đó xóa những khối có vẻ ít quan trọng nhất bằng cách sử dụng các heuristic về độ lớn, độ nhạy hoặc "ảnh hưởng của khối". Theo thuật ngữ vật lý, đây là các phương pháp trường trung bình (mean-field methods): chúng coi mỗi khối như thể đóng góp của nó độc lập với các khối khác, giống như cách lý thuyết trường trung bình thay thế các hàng xóm của một spin bằng một trường trung bình duy nhất. Một lối tắt liên quan là chỉ xóa một chuỗi các khối liên tiếp, điều này giữ cho bài toán ở quy mô nhỏ nhưng lại loại bỏ phần lớn không gian tìm kiếm.

Vấn đề là các khối không độc lập, cũng giống như các spin trong một nam châm thực tế vậy. Việc xóa khối 20 có gây hại cho mô hình hay không phụ thuộc vào việc bạn có xóa khối 19 hay khối 24 hay không, đó là một sự tương tác, hay sự ghép nối, giữa hai quyết định. Khi các mô hình trở nên sâu hơn và không đồng nhất hơn, việc bỏ qua các sự ghép nối đó sẽ làm giảm chất lượng, đặc biệt là khi bạn muốn xóa nhiều khối cùng một lúc. Điều bạn thực sự muốn là tìm kiếm trên các tổ hợp khối trong khi vẫn tính đến cách chúng tương tác, nhưng số lượng tổ hợp tăng theo cấp số nhân, vì vậy phương pháp vét cạn (brute force) dường như là vô vọng. Đây chính xác là chế độ mà các không gian cấu hình lớn theo cấp số nhân với các ghép nối từng cặp, nơi các công cụ của vật lý thống kê phát huy tác dụng.

Ý tưởng: biến việc lựa chọn khối thành một bài toán tối thiểu hóa năng lượng

Chúng tôi gắn một biến nhị phân vào mỗi khối transformer: 0 nghĩa là giữ lại, 1 nghĩa là xóa bỏ, giống như một spin có thể hướng xuống hoặc hướng lên. Sau đó, chúng tôi thực hiện khai triển Taylor bậc hai của hàm mất mát (loss) của mô hình đối với các biến đó, tạo ra một ma trận Hessian (xấp xỉ). Đường chéo của ma trận Hessian đó cho biết mức độ quan trọng của từng khối; các phần tử ngoài đường chéo chính là các ghép nối từng cặp giữa các khối, chính là vật lý nhiều vật thể mà các phương pháp trường trung bình đã bỏ qua.

Việc tái cấu trúc đó biến câu hỏi "tôi nên xóa khối nào?" thành một bài toán tối ưu hóa rõ ràng: tìm tập hợp M khối mà việc xóa chúng sẽ tối thiểu hóa năng lượng xᵀH⁰x, với ràng buộc là xóa chính xác M trong số N khối. Về mặt toán học, đây là một bài toán tối ưu hóa nhị phân có ràng buộc; về mặt vật lý, nó là một hệ Ising glass, một hệ spin ghép nối tất cả-với-tất cả với từ hóa được bảo toàn (số lượng khối bị xóa cố định đóng vai trò là tổng spin cố định). Đặc tính chính mà chúng tôi thiết lập là năng lượng này là một đại diện mạnh mẽ cho chất lượng đầu ra: các trạng thái năng lượng thấp của hệ spin tương ứng với các mô hình đã cắt tỉa có hiệu suất cao. Việc tối thiểu hóa năng lượng và tối đa hóa điểm benchmark trở thành cùng một quá trình tìm kiếm.

Sketch of the method: block removal is cast as a constrained binary optimization / Ising problem whose low-energy states correspond to high-performing pruned models.

Việc lựa chọn khối trở thành một bài toán tối ưu hóa nhị phân có ràng buộc, tương đương với việc tìm các trạng thái năng lượng thấp của một hệ Ising glass; mỗi giải pháp cho biết cần xóa M trong số N khối nào. Bên phải: biến ghép nối α mà chúng tôi chèn vào đường dẫn dư (residual path) của mỗi khối để xây dựng ma trận Hessian. Nguồn: Hình 1 của bài báo.

Lý do phương pháp này thực tế là vì chi phí. Ma trận Hessian, tức là toàn bộ tập hợp các ghép nối, chỉ được tính toán một lần duy nhất từ các lượt truyền xuôi và truyền ngược trên một tập dữ liệu hiệu chuẩn nhỏ. Sau đó, việc đánh giá bất kỳ cấu hình ứng viên nào chỉ là một phép tính năng lượng rẻ tiền, không cần phải chạy mô hình thực tế, chứ chưa nói đến việc chạy benchmark. Và vì các ghép nối không phụ thuộc vào mục tiêu nén, cùng một ma trận Hessian có thể được tái sử dụng để giải cho nhiều giá trị M khác nhau.

Giải quyết bài toán: chính xác khi có thể, lượng tử hoặc lấy cảm hứng từ lượng tử khi không thể

Đối với hầu hết các mô hình, không gian cấu hình rất lớn nhưng vẫn có thể kiểm tra được. Vì việc tính toán một mức năng lượng rất rẻ, chúng tôi sử dụng phương pháp vét cạn trên một GPU đơn lẻ, kiểm tra tới hàng chục tỷ cấu hình spin. Vài triệu cấu hình chỉ mất vài giây; trường hợp khó nhất ở đây, xóa 8 trong số 80 khối của Llama-3.3-70B (khoảng 29 tỷ cấu hình), mất khoảng hai ngày.

Ngoài phạm vi đó, phương pháp chính xác sẽ thất bại, và đây là lúc việc chuyển đổi bài toán thành hệ Ising glass phát huy tác dụng lần thứ hai. Ở dạng QUBO tương đương (ràng buộc được hấp thụ vào một số hạng phạt), cùng một tác vụ đó có thể được chuyển cho các bộ giải cổ điển, lượng tử và lấy cảm hứng từ lượng tử được tối ưu hóa cao cho lớp Hamiltonian này, bao gồm các công cụ như ủ lượng tử (quantum annealing), QAOA, tìm kiếm tabu và các thuật toán nhánh và cận (branch-and-bound) chuyên dụng. Chúng tôi nhận thấy rằng một bộ giải tabu mã nguồn mở có thể đạt được các trạng thái năng lượng thấp nhất một cách đáng tin cậy chỉ trong vài giây, ngay cả với những trường hợp khó nhất mà chúng tôi có thể xác minh bằng phương pháp vét cạn. Vì vậy, phương pháp này có thể mở rộng cho các mô hình mà việc liệt kê các cấu hình là không khả thi, bằng cách sử dụng các bộ giải nằm trong lĩnh vực chuyên môn của Multiverse.

Có một điểm tinh tế nhưng quan trọng ở đây, và nó đi ngược lại với xu hướng tối ưu hóa thông thường. Thông thường, một bộ giải CBO hoặc bộ giải ủ (annealing) được đánh giá dựa trên việc nó có tìm thấy trạng thái cơ bản (ground state) thực sự hay không. Chúng tôi thực sự không cần trạng thái cơ bản. Điều chúng tôi cần là một cách nhanh chóng để tạo ra một vài trạng thái năng lượng thấp tốt, và đó là một tiêu chuẩn dễ dàng hơn nhiều, đó là lý do tại sao các bộ giải nhẹ lại hoạt động hiệu quả với chúng tôi và tại sao chúng tôi có thể đủ khả năng chạy nhiều bộ giải cùng lúc.

Tại sao toàn bộ phổ năng lượng thấp lại quan trọng

Năng lượng là một đại diện mạnh mẽ cho chất lượng, nhưng không phải là đại diện hoàn hảo, vì vậy trạng thái năng lượng thấp nhất duy nhất không phải lúc nào cũng là mô hình tốt nhất. Hóa ra đây lại là một tính năng chứ không phải lỗi: một khi Hamiltonian đã được thiết lập, việc đọc ra trạng thái cơ bản và các trạng thái kích thích năng lượng thấp về cơ bản là miễn phí, mang lại một phổ các ứng viên cắt tỉa chất lượng cao để thử nghiệm thay vì chỉ một câu trả lời duy nhất. Việc khám phá các trạng thái kích thích, chứ không chỉ trạng thái cơ bản, bản thân nó là một lĩnh vực nghiên cứu vật lý tích cực, và nó ánh xạ gọn gàng vào những gì các chuyên gia thực sự cần ở đây.

Một ví dụ cụ thể: đối với Llama-3.1-8B-Instruct khi xóa 16/32 khối, hầu hết các trạng thái hàng đầu đều cắt các khối về phía cuối mô hình, như các nghiên cứu trước đây dự đoán. Nhưng trạng thái kích thích thứ 17 là trạng thái đầu tiên đề xuất xóa một khối gần đầu mô hình, và sau khi tái huấn luyện nhẹ, cấu hình đó vượt trội hơn trạng thái cơ bản trên một số bộ benchmark. Điều đó bác bỏ trực tiếp giả định phổ biến rằng cách cắt tỉa tốt nhất là một khối liên tiếp các khối ở giữa hoặc cuối, và nó cho thấy lý do tại sao việc tôn trọng cấu trúc nhiều vật thể đầy đủ của bài toán lại mang lại hiệu quả.

Block-removal map and benchmark scores for the ground state versus the 17th excited state of Llama-3.1-8B-Instruct at 16/32 blocks removed.

Bên trái: các khối mà mỗi trạng thái trong số 20 trạng thái năng lượng thấp nhất loại bỏ (màu đỏ = đã xóa). Bên phải: trạng thái kích thích thứ 17, loại bỏ một khối ở phần đầu, vượt qua trạng thái cơ bản trên một số bộ benchmark sau khi tái huấn luyện. Mô hình tốt nhất là một trạng thái kích thích, không phải trạng thái cơ bản. Nguồn: Hình 2 của bài báo.

Kết quả

Trên các mô hình Llama-3.1-8B-Instruct, Qwen3-14B và Llama-3.3-70B-Instruct, phương pháp của chúng tôi (CBO) ngang bằng hoặc tốt hơn các phương pháp loại bỏ khối tiên tiến nhất, và khoảng cách ngày càng lớn khi việc nén trở nên quyết liệt hơn.

Chiến thắng rõ ràng nhất là việc nén sâu Llama-3.3-70B-Instruct, được đánh giá mà không cần tái huấn luyện. Với tối đa 24 trong số 80 khối bị xóa, CBO ngang bằng với phương pháp ảnh hưởng khối. Nhưng ở mức 32/80 và 40/80, nó vượt lên dẫn trước một cách quyết định, với lợi thế MMLU gần 23 điểm ở mức nén sâu nhất, nơi nó đánh bại phương pháp cơ sở trên mọi bộ benchmark mà chúng tôi đã thử nghiệm. Đối với Qwen3-14B ở mức xóa 12/40, CBO dẫn trước MMLU khoảng 10 điểm. Ở mức nén nhẹ hơn, các phương pháp này tương đương nhau, điều này đã được dự đoán trước: các ghép nối quan trọng nhất khi bạn cắt sâu.

Ở mức 40/80 (50% độ sâu), CBO giữ MMLU gần 77 trong khi phương pháp cơ sở mạnh nhất giảm xuống mức 50. Nguồn: Bảng 2 của bài báo.

Nó có khả năng tổng quát hóa ngoài các transformer dày đặc (dense transformers)

Việc loại bỏ khối trở nên khó khăn hơn nhiều trên các kiến trúc không đồng nhất hiện đại, nơi các loại khối khác nhau được xen kẽ, và công thức Ising không quan tâm đến điều đó: một sự ghép nối vẫn là một sự ghép nối bất kể loại khối nào nằm ở mỗi vị trí. Để kiểm tra áp lực đó, chúng tôi đã áp dụng phương pháp này cho NVIDIA-Nemotron-3-Nano-30B-A3B-FP8, một mô hình lai xen kẽ các lớp Mamba2, attention và mixture-of-experts (MoE) theo một mô hình không đồng nhất, mà không cần bất kỳ sự tái huấn luyện nào.

Không có gì trong công thức của chúng tôi giả định một ngăn xếp đồng nhất, vì vậy nó chuyển đổi trực tiếp. Khi xóa 2–3 lớp MoE hoặc 2 lớp attention, CBO tìm thấy các cấu hình đánh bại phương pháp ảnh hưởng khối trên AIME25 và GPQA. Các kết quả cũng xác nhận rằng sự dư thừa trong các mô hình lai này là có thật nhưng được phân bổ không đều: một số lớp chuyên gia (expert layers) dễ bị loại bỏ hơn nhiều so với những lớp khác, và khả năng tìm kiếm không gian cấu hình ghép nối của phương pháp này chính là thứ xác định các vị trí cắt tốt. Ngay cả ở đây, mô hình từ các mô hình dày đặc vẫn giữ nguyên, cấu hình tốt nhất thường là một trạng thái kích thích thay vì trạng thái cơ bản.

Tại sao điều này phù hợp với Multiverse Computing

Việc tái cấu trúc một bài toán học máy phức tạp thành một Hamiltonian Ising, sau đó giải nó bằng các bộ máy tối ưu hóa cổ điển và lấy cảm hứng từ lượng tử được xây dựng cho vật lý, hoàn toàn nằm trong chuyên môn của Multiverse, đó cũng chính là bản năng xuyên suốt ngăn xếp nén của chúng tôi. Và việc loại bỏ khối có thể kết hợp với phần còn lại của ngăn xếp đó, như lượng tử hóa, nén hạng thấp/SVD, cắt tỉa chiều rộng và phục hồi dựa trên chưng cất tri thức (knowledge-distillation-based healing), vì vậy nó khớp vào một quy trình lớn hơn thay vì cạnh tranh với nó.

Bạn muốn biết chi tiết kỹ thuật đầy đủ, bao gồm dẫn xuất khai triển Taylor, ánh xạ QUBO, các bộ benchmark của bộ giải, các thử nghiệm cắt bỏ (ablations) trên tập dữ liệu hiệu chuẩn và các bảng kết quả đầy đủ? Hãy đọc toàn bộ bài báo trên Hugging Face, hoặc liên hệ với nhóm của chúng tôi để thảo luận về việc áp dụng phương pháp này cho các mô hình của riêng bạn. Mã nguồn đã được công khai tại github.com/CompactifAI/Block_removal_through_constrained_binary_optimization.

LLMTối ưu hóaNén mô hìnhVật lý tính toánAI Research
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face: Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.