IT Home
92

Mô hình

Maple-Preview-20B: Mô hình AI chạy cục bộ nhanh nhất trên iPhone, đạt tốc độ 127 tokens/giây

(giờ Việt Nam)

Tóm tắt AI

DeepGrove ra mắt Maple-Preview, mô hình AI 20 tỷ tham số với kiến trúc MoE tối ưu, cho phép chạy mượt mà trên iPhone với tốc độ ấn tượng 127 tokens/giây và mức tiêu thụ RAM cực thấp.

Bản dịch AI

Theo tin từ IT ngày 6 tháng 8, phòng thí nghiệm nghiên cứu AI độc lập DeepGrove (Mỹ) hôm qua (5 tháng 8) đã đăng tải bài viết công bố mô hình AI gọn nhẹ mang tên Maple-Preview. Khi chạy trên iPhone (bài gốc không nêu rõ model cụ thể), mô hình này đạt tốc độ 127 tokens/s, gấp khoảng 13 lần so với Bonsai 27B (9.6 tokens/s).

IT đính kèm video so sánh liên quan như sau:

Về quy mô mô hình, Maple-Preview có tổng số tham số là 20,2 tỷ, sử dụng kiến trúc Mixture of Experts (MoE) với số tham số kích hoạt là 1,49 tỷ.

DeepGrove cho biết, hiện nay ngành công nghiệp AI chủ yếu dựa vào kỹ thuật lượng tử hóa (quantization) cho các thiết bị đầu cuối cục bộ, nhưng phương pháp này tồn tại những vấn đề căn bản, gây ảnh hưởng nghiêm trọng đến hiệu suất và hiệu quả của mô hình.

Công ty DeepGrove đề xuất giải pháp "trọng số tam phân" (ternary-weight), giới hạn và lượng tử hóa các trọng số thành ba giá trị ({-1, 0, 1}), giúp giảm đáng kể mức sử dụng bộ nhớ và nhu cầu băng thông tính toán. Mô hình này bao gồm 24 lớp, 256 chuyên gia (8 chuyên gia hoạt động) và sử dụng cơ chế chú ý hỗn hợp 3:1 SWA-512:GA.

On-device decode speed versus benchmark performance for Maple-Preview with its dense and Flash heads and comparison models.

Về khả năng trình diễn, Maple-Preview đã hoàn thành bài toán IMO 2024 P1 trên MacBook Pro (M5 Pro) với kết quả 7/7, tốc độ chạy đạt 281,5 tokens/s.

Trong các kịch bản ngữ cảnh dài, Maple-Preview cũng nhấn mạnh khả năng kiểm soát bộ nhớ. Biểu đồ liên quan đặt context length (độ dài ngữ cảnh) và mức tiêu thụ bộ nhớ bổ sung cần thiết để duy trì ngữ cảnh trên cùng một hệ tọa độ. Kết quả cho thấy, ngay cả khi xử lý 131.000 tokens, mức tiêu thụ bộ nhớ của Maple-Preview vẫn chỉ ở mức 7,69GB.

Projected resident model-weight and context-state memory at 131,072 tokens for Maple and comparison models.Incremental context-memory growth above a 640-token baseline through 131,072 tokens for Maple and comparison architectures.Grouped benchmark scores for Maple-Preview and four comparison models across LCBv6, AIME 2026, HMMT 2026, GPQA-D, and the average, using a consistent model order with Maple first.

DeepGrove cho biết Maple-Preview hiện vẫn đang trong preview stage (giai đoạn xem trước) và sẽ tiếp tục được cải tiến trong thời gian tới. Công ty cũng hy vọng sẽ xây dựng một hệ thống cho phép các mô hình AI tự động điều chỉnh dựa trên nội dung hội thoại và tối ưu hóa cho từng người dùng cụ thể.

AI trên thiết bịiPhoneMaple-PreviewDeepGroveTối ưu hóa AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.