An 8 GB gaming laptop can run a 35B model at 39.3 tokens a second, faster than Codex in production, …
DịchEngine FreeToken mới từ UC Berkeley và UT Austin tối ưu hóa bộ nhớ GPU, cho phép laptop 8GB chạy mô hình 35B với tốc độ 39.3 tokens/giây, vượt xa hiệu suất thông thường.
Nhóm nghiên cứu từ UC Berkeley và UT Austin giới thiệu FreeToken, công cụ suy luận tối ưu cho phép chạy các mô hình khổng lồ như GLM-5.2 753B trên phần cứng cá nhân với tốc độ tương tác cao.
Nhóm nghiên cứu từ Berkeley và MIT vừa ra mắt FreeToken, hệ thống suy luận tối ưu cho phép chạy các mô hình MoE khổng lồ trên phần cứng tiêu dùng với tốc độ cực nhanh, xóa bỏ rào cản về hạ tầng máy chủ.
Vì sao đáng đọc: Đây là bước tiến lớn trong việc dân chủ hóa AI, cho phép người dùng cá nhân chạy các mô hình khủng mà không cần cụm máy chủ đắt đỏ. Công nghệ thực tế, có mã nguồn mở và ứng dụng cao.
UC Berkeley open-sourced FreeToken. Wild results: A single RTX PRO 6000 runs the 753B GLM-5.2 at 14…
DịchFreeToken từ UC Berkeley cho phép chạy các mô hình lớn như GLM-5.2 hay Qwen3.6 trên GPU phổ thông với tốc độ nhanh gấp 2-4 lần so với Ollama mà không cần nén mô hình quá mức.