Sản phẩm
Đột phá: Chạy mô hình Gemma 2 26B trên mọi dòng Mac M-series chỉ với 2GB RAM
(giờ Việt Nam)
Tóm tắt AI
Một công cụ mã nguồn mở mới cho phép vận hành mô hình ngôn ngữ lớn Gemma 2 26B trên các máy Mac dùng chip Apple Silicon với mức tiêu thụ RAM cực thấp, chỉ 2GB. Dự án này giúp hạ thấp đáng kể rào cản phần cứng khi chạy AI cục bộ.
Bản dịch AI
TurboFieldfare
Suy luận Gemma 4 26B-A4B trong khoảng 2 GB RAM. Một runtime Swift + Metal tùy chỉnh dành cho mọi máy Mac chạy Apple Silicon, kể cả các dòng 8 GB.
Bắt đầu nhanh · Máy chủ cục bộ · Điểm chuẩn (Benchmarks) · Đóng góp kết quả · Cách thức hoạt động · Thử nghiệm · Tài liệu tham khảo
Bộ nhớ trở nên đắt đỏ. Vì vậy, tôi đã cấp cho một mô hình 26 tỷ tham số một ngân sách khoảng 2 GB.
TurboFieldfare chạy mô hình Gemma 4 26B-A4B đã được tinh chỉnh hướng dẫn mà không cần tải toàn bộ 14,3 GB của mô hình vào bộ nhớ. Nó giữ phần lõi 1,35 GB dùng chung và bộ nhớ đệm FP16 KV trong RAM, sau đó chỉ truyền trực tiếp các chuyên gia (experts) cần thiết cho mỗi token từ SSD. Đây là cách giúp mô hình có thể chạy trên các máy Mac với 8 GB RAM.
Runtime, trình cài đặt truyền phát, CLI và ứng dụng Mac gốc đều được viết bằng Swift và Metal. TurboFieldfare là sản phẩm dành riêng cho mô hình thay vì là một trình bao bọc (wrapper) xung quanh MLX hoặc llama.cpp. Hồ sơ thử nghiệm được biên soạn tóm tắt 103 kết quả đo lường trên các kernel, bộ nhớ đệm, I/O, prefill và decode.
Thử nghiệm
Trong lần chạy đầu tiên, Swift Package Manager sẽ tải xuống và xây dựng các gói Swift cần thiết cho bộ tách từ (tokenizer). Bản build phát hành hoàn chỉnh bao gồm ứng dụng Mac giao diện người dùng và tệp thực thi decode-service đi kèm.
Khi ứng dụng mở ra, hãy chọn Download và để TurboFieldfare tự tải xuống và đóng gói lại mô hình đã được ghim (khoảng 15 GB). Sau khi sẵn sàng, hãy chọn Load Model, nhập câu lệnh (prompt) của bạn và nhấn Generate.
Sơ lược
Kết quả đo lường là một điểm tham chiếu, không phải giới hạn hiệu năng tối đa. Độ dài câu lệnh, độ dài văn bản tạo ra, trạng thái bộ nhớ đệm trang (page-cache) và phần cứng đều ảnh hưởng đến thông lượng. Để giúp đo lường trên một máy Mac Apple Silicon khác, hãy làm theo hướng dẫn đo điểm chuẩn của cộng đồng.
Sử dụng TurboFieldfare
TurboFieldfare cung cấp một ứng dụng Mac gốc, giao diện dòng lệnh (CLI) và một máy chủ thử nghiệm tương thích với OpenAI. Chúng sử dụng cùng một thư mục mô hình.gturbo, nhưng chỉ nên chạy một sản phẩm sở hữu mô hình tại một thời điểm.
Gói Swift cung cấp sáu sản phẩm:
Yêu cầu
Gói này chỉ dành cho kiến trúc arm64. Các phiên bản macOS và Metal cũ hơn không được hỗ trợ.
Nhập câu lệnh cho mô hình
Ứng dụng Mac coi những gì bạn nhập là một hướng dẫn và tự động xử lý định dạng trò chuyện của Gemma. Chỉ cần mô tả tác vụ và bao gồm bất kỳ ngữ cảnh nào mà mô hình cần.
Quá trình tạo văn bản mặc định ở nhiệt độ (temperature) 0.2, Top-K 64 và Top-P 0.95. Đặt nhiệt độ bằng 0 để có kết quả đầu ra theo thuật toán tham lam (greedy) mang tính quyết định. Mô hình vẫn có thể lặp lại chính nó hoặc đưa ra câu trả lời không chính xác, vì vậy hãy kiểm tra các kết quả quan trọng.
TurboFieldfare chỉ hỗ trợ văn bản. Ứng dụng và CLI hỗ trợ tin nhắn của người dùng và mô hình cùng với hướng dẫn hệ thống tùy chọn; chúng không hiển thị hoặc thực thi các công cụ (tools). Máy chủ loopback chấp nhận các khai báo công cụ hàm và trả về các lệnh gọi công cụ do mô hình tạo ra để máy khách ủy quyền và thực thi. Hình ảnh, âm thanh và video không được hỗ trợ.
Ứng dụng Mac
Sao chép kho lưu trữ (clone repository), sau đó chạy ứng dụng từ thư mục gốc:
Xây dựng gói hoàn chỉnh để cả ứng dụng và dịch vụ decode đi kèm đều khả dụng. Khi khởi chạy từ bản checkout này, ứng dụng sẽ lưu trữ mô hình trong scratch/gemma4.gturbo.
Cài đặt mô hình
Trong lần khởi chạy đầu tiên, ứng dụng kiểm tra dung lượng lưu trữ khả dụng và hiển thị kích thước tải xuống và cài đặt. Chọn Download để bắt đầu.
Trình cài đặt không bao giờ tạo ra toàn bộ checkpoint nguồn. Nó truyền phát các dải byte cần thiết từ bản sửa đổi Hugging Face đã ghim và đóng gói lại trực tiếp vào bố cục.gturbo ngay khi chúng đến. Điều này tránh việc tạo checkpoint đầy đủ thứ hai trên ổ đĩa và giữ cho bộ nhớ tạm (scratch memory) ở mức giới hạn.
Lần cài đặt đầu tiên truyền khoảng 15 GB thông qua các yêu cầu dải byte giới hạn từ Hugging Face. Tốc độ mạng và thời gian phản hồi của Hugging Face thay đổi, vì vậy quá trình này có thể mất một chút thời gian. Bản cài đặt.gturbo hoàn chỉnh chiếm khoảng 14,3 GB và chỉ được chấp nhận sau khi manifest và mã băm tệp của nó đã được xác thực. Quá trình cài đặt không tải mô hình vào bộ nhớ.
Tải và tạo văn bản
Sau khi cài đặt:
Thanh trạng thái hiển thị tiến trình tạo, tốc độ giải mã và mức sử dụng bộ nhớ. Sử dụng ngăn bên phải để định cấu hình lấy mẫu, độ dài ngữ cảnh, các khe cắm bộ nhớ đệm chuyên gia và các tùy chọn runtime. Xem phần Runtime controls để biết chi tiết và các cài đặt mặc định.
Giao diện dòng lệnh (CLI)
CLI sử dụng bản cài đặt.gturbo hiện có. Nếu bạn đã cài đặt mô hình thông qua ứng dụng Mac, nó đã có sẵn tại scratch/gemma4.gturbo. Nếu không, hãy cài đặt nó từ dòng lệnh:
Tiếp tục quá trình tải xuống bị hủy hoặc gián đoạn:
Xóa trạng thái tải xuống đã lưu:
Runtime chỉ chấp nhận thư mục.gturbo đã hoàn tất với tệp manifest.json cuối cùng.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.