Thủ thuật
AirLLM: Chạy mô hình 70B chỉ với GPU 4GB VRAM
(giờ Việt Nam)
Tóm tắt AI
Dự án mã nguồn mở AirLLM cho phép chạy suy luận các mô hình ngôn ngữ lớn 70B trên GPU có VRAM cực thấp (4GB), giúp tối ưu hóa chi phí phần cứng đáng kể.
Bản dịch AI
Khởi động nhanh | Cấu hình | MacOS | Notebook ví dụ | Câu hỏi thường gặp
AirLLM giảm đáng kể mức sử dụng bộ nhớ khi suy luận, cho phép các mô hình ngôn ngữ lớn 70B chạy trên một card GPU 4GB duy nhất — mà không cần lượng tử hóa (quantization), chưng cất (distillation) hay cắt tỉa (pruning). Bạn thậm chí có thể chạy Llama 3.1 405B trên 8GB, DeepSeek-V3 (671B) trên ~12GB và Kimi K3 (2.8T) — mô hình mã nguồn mở lớn nhất từng được phát hành — trên dưới 4GB, vì các mô hình MoE thưa (sparse MoE) truyền phát từng chuyên gia một thay vì toàn bộ lớp.
Đề xuất AI Agent:
Trình tạo Sprite game bằng AI tốt nhất
Trình chỉnh sửa biểu cảm khuôn mặt bằng AI tốt nhất
Bloome — xây dựng & chạy các đội ngũ AI agent trên đám mây, không cần thiết lập
Cập nhật
[2026/07] Hỗ trợ Kimi K3 (2.8T): mô hình mã nguồn mở lớn nhất chạy trên một card duy nhất với 3.72GB VRAM, được đo lường toàn diện trên một chiếc RTX 6000 Ada. Việc truyền phát theo từng chuyên gia chỉ tải các chuyên gia mà token thực sự điều hướng tới. K3 đi kèm với ba yêu cầu riêng: pip install compressed-tensors flash-attn (mã mô hình của nó bắt buộc sử dụng flash attention bất kể bạn yêu cầu gì), bản dựng torch cho CUDA 12, vì chưa có wheel flash-attn dựng sẵn cho CUDA 13, và transformers 4.56.x, vì mã từ xa của nó không tải được trên bản 5.x.
[2026/06] v3.0: Hỗ trợ mô hình FP8 + các mô hình mới nhất. Chạy DeepSeek-V3 (671B) trên ~12GB và Qwen3-235B trên ~3GB, cùng với Qwen3, Llama 3.x/4, DeepSeek V2/V3, Phi-4, Gemma và nhiều mô hình khác — tất cả thông qua một AutoModel duy nhất.
[2024/08/20] v2.11.0: Hỗ trợ Qwen2.5
[2024/08/18] v2.10.1 Hỗ trợ suy luận trên CPU. Hỗ trợ các mô hình không phân mảnh (non-sharded). Cảm ơn @NavodPeiris vì công việc tuyệt vời này!
[2024/07/30] Hỗ trợ Llama3.1 405B (notebook ví dụ). Hỗ trợ lượng tử hóa 8bit/4bit.
[2024/04/20] AirLLM đã hỗ trợ Llama3 nguyên bản. Chạy Llama3 70B trên một GPU 4GB duy nhất.
[2023/12/25] v2.8.2: Hỗ trợ MacOS chạy các mô hình ngôn ngữ lớn 70B.
[2023/12/20] v2.7: Hỗ trợ AirLLMMixtral.
[2023/12/20] v2.6: Thêm AutoModel, tự động phát hiện loại mô hình, không cần cung cấp lớp mô hình để khởi tạo.
[2023/12/18] v2.5: thêm tính năng prefetching để chồng lấp việc tải mô hình và tính toán. Cải thiện tốc độ 10%.
[2023/12/03] đã thêm hỗ trợ cho ChatGLM, QWen, Baichuan, Mistral, InternLM!
[2023/12/02] đã thêm hỗ trợ cho safetensors. Hiện hỗ trợ tất cả 10 mô hình hàng đầu trong bảng xếp hạng open llm.
[2023/12/01] airllm 2.0. Hỗ trợ nén: tăng tốc độ chạy gấp 3 lần!
[2023/11/20] Phiên bản đầu tiên của airllm!
Lịch sử sao (Star History)
Mục lục
Khởi động nhanh
1. Cài đặt gói
Trước tiên, hãy cài đặt gói airllm qua pip.
2. Suy luận
Sau đó, khởi tạo AirLLMLlama2, truyền vào ID kho lưu trữ huggingface của mô hình đang sử dụng hoặc đường dẫn cục bộ, và quá trình suy luận có thể được thực hiện tương tự như một mô hình transformer thông thường.
(Bạn cũng có thể chỉ định đường dẫn để lưu mô hình đã phân tách theo lớp thông qua layer_shards_saving_path khi khởi tạo AirLLMLlama2.
Lưu ý: Trong quá trình suy luận, mô hình gốc trước tiên sẽ được phân tách và lưu theo từng lớp. Vui lòng đảm bảo có đủ dung lượng đĩa trong thư mục cache của huggingface.
Nén mô hình - Tăng tốc độ suy luận gấp 3 lần!
Chúng tôi vừa thêm tính năng nén mô hình dựa trên kỹ thuật nén mô hình theo khối (block-wise quantization). Điều này có thể tăng tốc độ suy luận thêm tới 3 lần, với mức giảm độ chính xác gần như không đáng kể! (xem thêm đánh giá hiệu suất và lý do tại sao chúng tôi sử dụng lượng tử hóa theo khối trong bài báo này)
Cách kích hoạt tăng tốc nén mô hình:
Sự khác biệt giữa nén mô hình và lượng tử hóa là gì?
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.