Tin ngành
Chạy mô hình Kimi K3 (2.8T) trên MacBook Pro: Tốc độ 1 token/giây nhờ streaming từ 4 ổ SSD
(giờ Việt Nam)
Tóm tắt AI
Dự án ARGODRIVE Deltafin đã tối ưu hóa việc chạy mô hình Kimi K3 (2.8T) nguyên bản trên MacBook Pro M5 Max, đạt tốc độ 1 token/giây bằng cách truyền tải dữ liệu trực tiếp từ 4 ổ SSD, nhanh gấp 3.5 lần so với các phương pháp trước đây.
Bản dịch AI
TL;DR — Kimi K3 (MoE 2,8 nghìn tỷ tham số, 1,45 TB trọng số chuyên gia) chạy trên một chiếc MacBook Pro M5 Max với 128 GB RAM, các chuyên gia được truyền dữ liệu từ bốn ổ SSD.
Điểm chuẩn ARGODRIVE Deltafin — M5 Max, 128 GB, các chuyên gia được truyền dữ liệu từ bốn ổ SSD.
Được đo đạc vào ngày 08/09/2026 với cấu hình ghi lại của bản fork này (k3-public-bench/env.sh); mỗi con số là một lần chạy "nguội" (cold run) với đúng câu lệnh (prompt) đó, và nhật ký cho mỗi lần chạy nằm trong k3-public-bench/results/.
Thang đo số lượng ổ đĩa với cùng các câu lệnh: một ổ đĩa ≈52% tốc độ của bốn ổ đĩa, hai ổ phản chiếu (mirror) đầy đủ ≈73%, ba ổ ≈90% (results/SCALING.md). Tại sao prefill lại chậm và cách khắc phục: results/PREFILL.md. Các định nghĩa, phạm vi định danh và tuyên bố về độ chính xác: k3-public-bench/README.md.
Chạy Kimi K3 đầy đủ, 2,8 nghìn tỷ tham số, chưa từng bị cắt tỉa, trên phần cứng tiêu dùng, với tốc độ "nhanh" nhất có thể.
Deltafin là một tệp nhị phân gốc duy nhất chạy toàn bộ Kimi K3. Không cắt tỉa. Không bỏ qua bất cứ thứ gì. K3 quyết định từng token.
Tất cả 16 chuyên gia, từng token một. Không đường tắt, không "gần đúng". Đó chính xác là những gì Moonshot đã phát hành.
Quy tắc chất lượng rất đơn giản: Bản thân K3 quyết định từng token, không ai khác. Các mô hình dự thảo nhỏ được phép đoán trước (đó là nơi tạo ra phần lớn tốc độ), nhưng K3 kiểm tra mọi dự đoán và không có gì đến được tay bạn mà không có sự phê duyệt chính thức từ nó.
Điểm chuẩn upstream trên máy tính xách tay M1 Max (gavamedia/deltafin, không thay đổi — không phải số liệu của bản fork này).
Điểm chuẩn M1 lịch sử của upstream:
Tuyên bố sứ mệnh
Chất lượng K3 thuần túy, nguyên bản, nhanh nhất có thể. Tốc độ không bao giờ được đánh đổi bằng việc giảm chất lượng mô hình. Deltafin giữ lại tất cả 16 chuyên gia được định tuyến và toàn bộ mục tiêu K3 làm thẩm quyền duy nhất cho từng token.
Mục tiêu của chúng tôi là vắt kiệt từng chút hiệu suất cuối cùng khi chạy một mô hình khổng lồ như K3, với mọi tùy chọn đều được cân nhắc... ngoại trừ việc giảm chất lượng.
Nhưng tại sao?!?
Deltafin không phải là một bài chào hàng sản phẩm. Đó là một thử nghiệm để xem phần cứng tiêu dùng có thể bị đẩy đi xa đến mức nào và chúng ta có thể học được gì khi cố gắng thực hiện một điều đầy thách thức như vậy.
Kimi K3 nhắm đến cơ sở hạ tầng ở quy mô 16 node và khoảng 4,8 TB VRAM tổng hợp. Điều đó có nghĩa là toàn bộ 2,8 nghìn tỷ tham số và cửa sổ ngữ cảnh 1 triệu token, với ngân hàng chuyên gia không bao giờ bị cắt tỉa. Trên bất kỳ thiết lập gia đình nào, đây là một giới hạn cực đoan. Mỗi 1% cải thiện đều rất khó khăn mới đạt được. Nhưng mỗi thành quả đều có thể dạy cho chúng ta một điều gì đó.
Nghiên cứu và khám phá chính là mục đích. Đó là sứ mệnh của chúng tôi. Không phải mọi thứ đều phải là "sản phẩm khả thi tối thiểu" (MVP) để gây ấn tượng với các nhà đầu tư mạo hiểm. Nếu Deltafin giúp các mô hình tiên phong có thể sử dụng được trên một thiết lập gia đình trị giá 15.000 USD, thay vì cơ sở hạ tầng 2.000.000 USD như Kimi khuyến nghị, chúng tôi tin rằng đó là một bước tiến đáng giá trong hành trình AI tự lưu trữ của mình. Thêm vào đó, mọi thứ học được trên đường đi thậm chí có thể mang lại lợi ích cho các dự án khác theo những cách không ngờ tới.
“Chúng tôi chọn chạy toàn bộ mô hình 2,8 nghìn tỷ tham số tại chỗ, và làm những việc khác, không phải vì chúng dễ dàng, mà vì chúng khó khăn.” — John F. Kennedy (có lẽ vậy).
Các dự án khác dường như chạy K3 đầy đủ, bằng cách nào đó nhanh hơn. Nhưng hãy nhìn kỹ hơn: họ đã mã hóa lại ngân hàng chuyên gia của K3 xuống còn ~3 bit. Kỹ thuật thông minh hướng tới một mục tiêu khác: K3 nhỏ nhất có thể vừa vặn và "gần đúng". Những trọng số đó không còn là những gì Moonshot đã phát hành, và không ai, kể cả họ, đã đo lường cái giá của những sự thỏa hiệp đó.
Deltafin là thử nghiệm còn lại: mọi byte chuyên gia đều chính xác như những gì Moonshot đã phát hành, được làm cho nhanh nhất theo quy luật vật lý.
1. Cài đặt mới
Deltafin cài đặt hầu hết mọi thứ nó cần. Xem phần Yêu cầu nếu bạn thiếu bất kỳ thứ gì.
Hoặc, nếu bạn không có đủ dung lượng đĩa:
setup --stream cài đặt mô hình thường trú và chỉ tìm nạp các chuyên gia chính xác theo yêu cầu, ban đầu chạy chậm hơn nhiều khi các tuyến đường chưa có bộ nhớ đệm cục bộ. Khi bạn xây dựng bộ nhớ đệm theo thời gian, đây có thể là cách để tiết kiệm không gian, chỉ lưu trữ các phần của mô hình mà bạn sử dụng, chạy hoàn toàn từ bộ nhớ đệm trên đĩa.
DSpark mặc định (và Qwen tùy chọn)
Thiết lập thông thường bao gồm Inferact's Kimi-K3-DSpark. Nó chiếm 6,635 GiB trên đĩa và khoảng 4,49 GiB khi được nạp vào lúc chạy. Deltafin tránh việc tạo ra bản sao dư thừa của embedding K3 trong DSpark. Các yêu cầu trò chuyện và máy chủ sử dụng DSpark tự động khi có lợi; bất kỳ lỗi nào, không đủ khoảng trống hoặc kinh tế trực tiếp kém sẽ chỉ đơn giản để K3 đầy đủ tự chạy.
Qwen là một tiện ích bổ sung riêng biệt để tiếp tục văn bản thô nhanh hơn:
Qwen chỉ tăng tốc hoàn thành văn bản thô: các mô hình nhỏ đoán những gì sẽ xảy ra tiếp theo, K3 kiểm tra dự đoán đó và bạn nhận được kết quả đầu ra giống hệt trong thời gian ngắn hơn. Điều đó giúp ích cho việc tự động hoàn thành mã và lưu lượng truy cập /v1/completions khác, cộng với deltafin run --prompt... — một lần hoàn thành 17 token đã đo được chạy nhanh hơn 2,7 lần với cùng ID đầu ra.
Điều này thêm 4,337 GiB trên đĩa, và vì Qwen sẽ không cải thiện tốc độ trò chuyện, chúng tôi biến nó thành một tiện ích bổ sung tùy chọn. Bạn có thể thêm nó vào bản cài đặt mới với deltafin setup --full --include-qwen, hoặc thêm sau đó bằng lệnh trên.
2. Nâng cấp
Từ thư mục Deltafin:
upgrade lấy những gì bạn cần và xây dựng lại tệp nhị phân. Các mô hình, trọng số đã chuyển đổi và bộ nhớ đệm được giữ nguyên. Nó không bao giờ chạy lại setup hoặc tải xuống lại K3.
LƯU Ý: Nâng cấp từ phiên bản python cũ của chúng tôi? Hãy kiểm tra nó trước:
Chỉ tiếp tục khi git status --short trống. Nếu nó liệt kê các tệp, hãy tự bảo lưu hoặc commit công việc đó, thay vì để quy trình nâng cấp tự đoán. Dữ liệu mô hình hiện có vẫn nằm trong cùng các thư mục gốc của kho lưu trữ.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.