Thủ thuật
Artificial Analysis hợp tác cùng Liquid AI ra mắt chuẩn đo hiệu năng AI cho smartphone, công bố kết quả trên iPhone 17 Pro
(giờ Việt Nam)
Tóm tắt AI
Artificial Analysis và Liquid AI vừa giới thiệu bộ công cụ đo hiệu năng AI chuyên dụng cho di động, thử nghiệm trên các mô hình 4-bit dưới 8GB chạy trực tiếp trên iPhone 17 Pro.
Bản dịch AI
Theo tin từ IT ngày 26 tháng 8, Artificial Analysis đã đăng tải bài viết vào ngày 24 tháng 8, thông báo hợp tác cùng Liquid AI để ra mắt bộ tiêu chuẩn đánh giá (benchmark) AI dành cho thiết bị di động, tập trung vào hiệu năng của các mô hình AI trên iPhone 17 Pro của Apple.
Trong đó, Artificial Analysis chịu trách nhiệm về hệ thống kiểm tra mức độ thông minh, còn Liquid AI phụ trách hệ thống kiểm tra hiệu năng suy luận. Hai bên đã lựa chọn 5 bài kiểm tra tiêu chuẩn:
BFCL (Berkeley Function Calling Leaderboard)
IFBench (Kiểm tra khả năng tuân thủ chỉ dẫn)
AA-Omniscience (Kiểm tra kiến thức và nhận thức)
GPQA Diamond (Kiểm tra hỏi đáp độ khó cao)
MATH-500 (Kiểm tra giải toán).
Các mô hình được thử nghiệm là những mô hình đã được lượng tử hóa 4-bit với dung lượng không vượt quá 8GB, ví dụ như Gemma 4 E2B và LFM2-2.6B-Exp.
Khi giới hạn độ dài ngữ cảnh ở mức 16K tokens, các mô hình đạt điểm trung bình cao nhất là Nanbeige4.2-3B và LFM2.5-2.6B. Khi giới hạn thời gian phản hồi tối đa là 1 phút, LFM2.5-8B-A1B xếp hạng nhất, theo sau là LFM2-2.6B-Exp, Gemma 4 E4B (Non-reasoning) và Granite 4.1 8B.
Nanbeige4.2-3B được ra mắt bởi Phòng thí nghiệm Nanbeige thuộc BOSS Zhipin, chỉ chứa 3 tỷ tham số không bao gồm embedding (tổng tham số khoảng 4 tỷ). Mô hình này sử dụng kiến trúc Looped Transformer, giúp tăng độ sâu tính toán hiệu dụng và dung lượng của mô hình bằng cách tái sử dụng các lớp Transformer (lặp lại hai lần) mà không làm tăng số lượng tham số.





IT đính kèm các ảnh chụp màn hình liên quan dưới đây:

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.