# Chạy mô hình 700 tỷ tham số GLM trên laptop không cần GPU? Colibrì gây sốt khi biến SSD thành VRAM

- Nguồn: QbitAI
- Thời gian phát hành: 2026-09-26 16:01 (giờ Việt Nam)
- Điểm AI: 92/100
- Nhãn AIHOT: Tinh chọn
- Link AIHOT.vn: https://aihot.vn/items/b5f570bd2afbc6e8
- Link gốc: https://www.qbitai.com/2026/09/497624.html

## Lý do tinh chọn

Công nghệ đột phá giúp hạ thấp rào cản phần cứng cho AI, giải quyết bài toán VRAM vốn là rào cản lớn nhất cho người dùng cá nhân khi chạy mô hình lớn.

## Tóm tắt AI

Dự án mã nguồn mở Colibrì đang làm mưa làm gió trên GitHub nhờ khả năng chạy các mô hình ngôn ngữ khổng lồ trên phần cứng phổ thông bằng cách tận dụng SSD làm bộ nhớ đồ họa.

## Thân bài

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

26-09-2026 17:01:00 Nguồn: [QbitAI](https://www.qbitai.com/)

Colibrì, "chú chim ruồi" mã nguồn mở đang làm mưa làm gió trên GitHub, là gì?

> Wen Le, đưa tin từ AoFeiSi, QbitAI | Official Account QbitAI

Chạy GLM-5.2 744B trên laptop 25GB RAM, thách thức Kimi K3 2.8T với 32GB RAM—

Thậm chí không cần đến GPU.

Colibrì, "chú chim ruồi" mã nguồn mở cho các mô hình lớn đang hot nhất trên GitHub hiện nay, là một framework suy luận phân tầng được viết thuần bằng C, không phụ thuộc vào engine, đã thu hút tới 32k Star.

![](https://i.qbitai.com/wp-content/uploads/2026/09/feb20a0a3ae0290b4bccda23e2e16585.jpeg)

Ban đầu, nó được tạo ra nhắm đến GLM-5.2.

Trong điều kiện bình thường, quy mô 744 tỷ tham số đã khiến các máy tính phổ thông phải "chào thua", nhưng cách tiếp cận của Colibrì có thể nói là vô cùng đơn giản và trực diện:

Nếu RAM không chứa nổi, thì đừng cố nhồi nhét tất cả vào đó.

Những phần chưa dùng đến của mô hình sẽ được để trực tiếp trên SSD; khi quá trình suy luận thực sự cần đến chuyên gia nào, nó sẽ được "lôi" ra từ ổ cứng ngay tại thời điểm đó.

Nhờ vậy, trọng số của GLM-5.2 sau khi xử lý int4 (khoảng 372GB) có thể chạy trên các máy tính có RAM tối thiểu 16GB, khuyến nghị khoảng 24GB, và GPU thậm chí không phải là thứ bắt buộc.

Máy tính phát triển mà tác giả dùng để xác thực ban đầu cũng chỉ có CPU 12 nhân và 25GB RAM.

![](https://i.qbitai.com/wp-content/uploads/2026/09/112673a4c634f76559dd3fc8a5188b15.jpeg)

Hiện tại, Colibrì đã không còn dừng lại ở mức 744B.

Nó đã hỗ trợ 9 dòng mô hình, từ GLM-5.2/5.3, DeepSeek V4 Flash, Qwen, cho đến Inkling 975B và Kimi K3 với 2,8 nghìn tỷ tham số.

Mặc dù Kimi K3 cần khoảng 1,6TB dung lượng ổ cứng, nhưng yêu cầu RAM chỉ bắt đầu từ 32GB.

### Với mô hình 744B, chỉ cần 9,9GB trong RAM

Để Colibrì làm được điều này, trước hết phải cảm ơn kiến trúc MoE đang ngày càng phổ biến trong hai năm qua.

Lấy GLM-5.2 làm ví dụ. Mặc dù toàn bộ mô hình có tới 744 tỷ tham số, nhưng MoE không tính toán toàn bộ 744 tỷ tham số đó mỗi khi tạo ra một token.

Nó sẽ thông qua Router để phán đoán: token này nên được giao cho những "chuyên gia" nào xử lý? Sau đó chỉ kích hoạt một phần nhỏ trong số đó.

GLM-5.2 có tổng cộng 744 tỷ tham số, nhưng số tham số thực tế được kích hoạt cho mỗi token chỉ khoảng 40 tỷ, điều này tạo ra một không gian thao tác rất lớn:

Vì đại đa số các chuyên gia không cần dùng đến ngay lúc này, tại sao cứ phải giữ chúng trong bộ nhớ tốc độ cao đắt đỏ?

![](https://i.qbitai.com/wp-content/uploads/2026/09/6f7dc7fa5f8dd36e0174a93b67c6b4a9.jpeg)

Vì vậy, Colibrì đã chia mô hình thành hai phần: phần thường trú và phần gọi tạm thời.

Các phần Dense như Attention, Embedding và các chuyên gia dùng chung (vốn cần thiết trong mỗi lần suy luận), chiếm khoảng 17 tỷ tham số, sau khi nén int4 chỉ chiếm khoảng 9,9GB, được giữ thường trú trong RAM.

Phần chiếm nhiều dung lượng thực sự là các chuyên gia định tuyến (routing experts) khổng lồ phía sau.

GLM-5.2 có 19.456 chuyên gia định tuyến, sau khi nén int4 vẫn chiếm khoảng 370GB.

Với trọng số lớn như vậy, RAM của máy tính thông thường rõ ràng không thể chứa nổi.

Colibrì quyết định đặt tất cả chúng vào NVMe SSD.

Sau khi mô hình bắt đầu tạo token, Router sẽ chọn ra các chuyên gia thực sự cần tham gia tính toán; Colibrì sau đó kiểm tra xem chúng đã có trong bộ nhớ tốc độ cao chưa, phần nào chưa có mới được đọc tạm thời từ SSD.

Tính toán xong lớp này, mới tiếp tục xử lý lớp tiếp theo.

Tư duy chạy mô hình lớn trước đây thường là tìm cách nạp toàn bộ mô hình vào VRAM/RAM rồi mới bắt đầu tính toán.

Colibrì thì ngược lại: cần gì thì mới nạp cái đó.

Tác giả JustVugg ví cách tiếp cận này như một dạng JIT (Just-In-Time) dành cho trọng số mô hình.

JIT truyền thống không biên dịch toàn bộ chương trình từ trước, mà quan sát xem đoạn mã nào thực sự đang chạy rồi mới xử lý các đường dẫn nóng (hot paths).

Tư duy của Colibrì cũng tương tự.

Không coi 744 tỷ tham số là một khối thống nhất phải luôn nằm trong RAM, mà biến nó thành một tập hợp dữ liệu có thể được điều phối linh hoạt giữa SSD, RAM và VRAM dựa trên kết quả của Router.

_Bài gốc còn tiếp._ Xem tiếp tại: <https://www.qbitai.com/2026/09/497624.html>
