MarkTechPost
92

Sản phẩm

FreeToken: Đột phá chạy mô hình MoE 753B trên một GPU duy nhất

(giờ Việt Nam)

Tóm tắt AI

Nhóm nghiên cứu từ UC Berkeley và UT Austin giới thiệu FreeToken, công cụ suy luận tối ưu cho phép chạy các mô hình khổng lồ như GLM-5.2 753B trên phần cứng cá nhân với tốc độ tương tác cao.

Bản dịch AI

Meet FreeToken: An Edge-Native MoE Serving Engine that Runs 753B GLM-5.2 on a Single Workstation GPU

Các mô hình mã nguồn mở tiên phong (frontier open-weight models) đang được phát hành nhanh hơn so với các giả định về phần cứng hỗ trợ chúng. Kimi-K3, GLM-5.2 và DeepSeek-V4-Flash đang dần thu hẹp khoảng cách về năng lực với các hệ thống độc quyền, nhưng việc phát hành tham số chỉ quyết định ai có thể sở hữu mô hình — chứ không phải ai có đủ khả năng chi trả để vận hành nó. Việc phục vụ các mô hình này vẫn đòi hỏi các cụm GPU cấp trung tâm dữ liệu, và khi các khối lượng công việc dạng tác nhân (agentic workloads) đẩy nhu cầu suy luận lên cao, chi phí đó đè nặng nhất lên các nhà phát triển cá nhân và các nhóm nhỏ. Trong khi đó, hơn một trăm triệu máy tính cá nhân đã được trang bị GPU rời. Một nhóm nghiên cứu từ UC Berkeley và UT Austin đã đề xuất FreeToken. Nhóm nghiên cứu lập luận rằng mảnh ghép còn thiếu không phải là phần cứng mà là một hệ thống phục vụ: nó coi máy tính cá nhân là một nền tảng suy luận thống nhất, linh hoạt thay vì chỉ là một GPU nhỏ, đồng thời liên tục ánh xạ tính toán và trạng thái mô hình lên bất kỳ GPU, CPU, bộ nhớ và băng thông kết nối nào mà máy thực sự có. Kết quả là một mô hình 35B chạy ở tốc độ tương tác trên GPU laptop 8 GB, 284B trên máy tính để bàn chơi game và 753B GLM-5.2 trên một card đồ họa máy trạm đơn lẻ.

Nó có thể triển khai được không?

Có, FreeToken là mã nguồn mở Apache-2.0 trên GitHub, được xuất bản trên PyPI dưới dạng freetoken v0.1.2 (uv pip install "freetoken[accel]"), và được phát hành dưới dạng ứng dụng máy tính để bàn một cú nhấp chuột cho Windows và Linux tại flashml.ai. CLI nhắm mục tiêu vào Linux x86_64 với GPU NVIDIA trên driver r580+ (CUDA 13). ft serve cung cấp các điểm cuối tương thích với OpenAI và Anthropic trên cổng 1919, và ft launch claude kết nối Claude Code, Codex, OpenCode hoặc OpenClaw với thiết bị của riêng bạn.

Đối tượng phù hợp: các nhà phát triển độc lập, các công ty khởi nghiệp và các nhóm kỹ thuật SMB có hóa đơn token cho tác nhân đã vượt quá chi phí của một GPU mà họ sở hữu; các doanh nghiệp nên coi đây là một giải pháp cho các khối lượng công việc bị cô lập (air-gapped) hoặc cần tuân thủ quy định, không phải là sự thay thế cho trung tâm dữ liệu. Các ngành phù hợp nhất: y tế và pháp lý (dữ liệu không bao giờ rời khỏi máy), quốc phòng, tài chính và R&D chuyên sâu về sở hữu trí tuệ. Các ứng dụng điển hình: tác nhân lập trình cục bộ, đánh giá mã nguồn riêng tư, phân tích hợp đồng ngoại tuyến, tạo dữ liệu tổng hợp, đánh giá hàng loạt.

Khoảng cách mà nó nhắm tới

Mixture-of-Experts (MoE) giúp việc suy luận mô hình tiên phong cục bộ trở nên khả thi về mặt toán học. DeepSeek-V4-Flash kích hoạt 6 trong số 256 chuyên gia được định tuyến trong mỗi lớp trong số 43 lớp, vì vậy chỉ có 13B trong tổng số 284B tham số tham gia vào bất kỳ token đơn lẻ nào. Tuy nhiên, tính thưa thớt không làm giảm nhóm chuyên gia — ở định dạng FP4, toàn bộ tập hợp này nặng khoảng 140 GB, vì vậy các chuyên gia không hoạt động sẽ nằm trong bộ nhớ máy chủ và đi vào luồng thực thi khi có yêu cầu.

Nhóm nghiên cứu đã cô lập ba chế độ lỗi trong các công cụ hiện có (llama.cpp, KTransformers, Ollama, MoE-Infinity):

Ba cơ chế

Kết quả

Trên RTX 5090, FreeToken duy trì 77–83 tok/s trên Qwen3.6-35B-A3B (BF16) và 22–25 tok/s trên DeepSeek-V4-Flash (MXFP4) — gấp 1,5–2,3 lần so với mức cơ sở mạnh nhất, với tốc độ giải mã duy trì trong phạm vi 12% so với tốc độ đơn lượt trên ba khối lượng công việc tác nhân. TTFT (thời gian cho token đầu tiên) trong trường hợp xấu nhất vẫn dưới 44 giây trong mọi ô; llama.cpp đạt 232 giây, Ollama 179 giây và KTransformers 946 giây ở một số điểm trong ma trận, vượt quá thời điểm mà các ứng dụng khách tác nhân bị hết thời gian chờ (timeout).

Ở cùng dung lượng bộ nhớ đệm (37% của nhóm Qwen3.6), thuật toán LRU toàn cục bỏ lỡ 16% các lượt đọc chuyên gia trong thời gian giải mã so với 41% của KTransformers và 62% của llama.cpp. Trên laptop RTX 4060 8 GB, bản dựng NVFP4 phục vụ mô hình 35B ở tốc độ 39,3 tok/s — cao hơn tốc độ giải mã trung bình 33 tok/s được đo cho Codex trong các dấu vết sản xuất. Trên một card RTX PRO 6000 duy nhất, GLM-5.2 (753B, 40B hoạt động) chạy ở tốc độ 14,9 tok/s so với 7,3 của llama.cpp.

Kiểm tra dữ liệu

Kiểm chứng thực tế · Điểm LẠM PHÁT FlashML FreeToken 59/100

3Đã xác minh

9Tự báo cáo

4Gây hiểu lầm

0Mâu thuẫn

0Không tìm thấy

Công thức tính điểm: 8 × gây hiểu lầm + 15 × mâu thuẫn + 3 × tự báo cáo, tối đa 100. Điểm số này bị ảnh hưởng bởi cột tự báo cáo, không phải do sự không trung thực — mã nguồn mới được công khai sáu ngày trước cuộc kiểm toán này, vì vậy chưa có sự kiểm chứng độc lập nào tồn tại.

Bảng tuyên bố · 16 tuyên bố

Giải thích các cờ (Flags)

Trò chơi mẫu số — so sánh với Codex trộn lẫn hai số liệu. FreeToken báo cáo thông lượng giải mã và TTFT riêng biệt, vì vậy 39,3 tok/s của nó là tốc độ giải mã thuần túy. 33,9 tok/s của TraceLab là tốc độ chuẩn hóa gộp TTFT mỗi bước vào quá trình giải mã; cùng bài báo đó đưa ra tốc độ giải mã thuần túy trung bình của Codex là 57,1 tok/s. So sánh tương đương, 39,3 không vượt qua Codex — nó chỉ bằng khoảng hai phần ba.

Trò chơi mẫu số — “92% tốc độ của RTX 4090” so sánh 4-bit với 16-bit. Con số 39,3 tok/s trên laptop là bản dựng NVFP4; con số 42,9 tok/s trên RTX 4090 là BF16. Điều này được tiết lộ trong chú thích Hình 5, nhưng văn bản lại nêu tỷ lệ mà không có lưu ý về độ chính xác.

Trò chơi mẫu số — “GPU đơn lẻ” bỏ qua yêu cầu về máy chủ. Tầng GLM-5.2 753B nằm sau 512 GiB DDR5 trên Xeon Platinum 8559C; cấu hình “máy tính để bàn chơi game” 284B mang theo 192 GB. Một GPU là chính xác. Nhưng một cỗ máy với giá tiêu dùng thì không phải là những gì các cấu hình đó mô tả.

Sai lệch thiết lập — các mức cơ sở bị giới hạn ở 6 luồng CPU. Được tiết lộ và có thể bảo vệ: bài báo giới hạn các máy chủ dual-socket thuê để mô phỏng các máy chủ biên và xác thực trên hai máy biên thực tế ở số luồng tối đa. Nhưng KTransformers được xây dựng xung quanh việc thực thi chuyên gia trên CPU đa nhân tối ưu hóa AMX, vì vậy hãy đọc cột của nó là “KTransformers trên máy chủ cấp biên”, không phải là giới hạn tối đa của nó.

Đối trọng — các phép tính toán học rõ ràng. Mọi tỷ lệ trong phần tóm tắt và kết quả đều tính toán lại chính xác: 1,81 / 1,87 / 2,10 / 2,25 lần cho Qwen3.6, 1,92 / 1,84 / 1,52 / 1,65 lần cho DeepSeek-V4-Flash, 2,04 lần cho GLM-5.2. Không làm tròn thổi phồng, không có khoảng cách không giải thích được giữa các con số và văn bản.

Những điểm chính cần lưu ý

Kiểm chứng thực tế bởi Marktechpost · xác minh ngày 23 tháng 8 năm 2026

Những điểm chính cần lưu ý

Hãy xem BÀI BÁO, KHO LƯU TRỮ GITHUB và DỰ ÁN. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ của chúng tôi và Đăng ký Bản tin của chúng tôi. Khoan đã! bạn có dùng telegram không? bây giờ bạn cũng có thể tham gia với chúng tôi trên telegram.

Cần hợp tác với chúng tôi để quảng bá Kho lưu trữ GitHub HOẶC Trang Hugging Face HOẶC Bản phát hành sản phẩm HOẶC Hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.