MarkTechPost
85

Sản phẩm

Liquid AI ra mắt Pipette: Bộ công cụ chuẩn hóa đánh giá toàn diện AI trên thiết bị di động

(giờ Việt Nam)

Tóm tắt AI

Liquid AI hợp tác cùng Artificial Analysis phát hành mã nguồn mở Pipette, nền tảng đánh giá hiệu năng AI trên thiết bị dựa trên sự kết hợp đồng bộ giữa mô hình, kỹ thuật lượng tử hóa, môi trường chạy và phần cứng.

Bản dịch AI

Liquid AI Open-Sources Pipette: A Reproducible Benchmarking Suite That Measures On-Device Models, Quantization, Runtime and Hardware Together

Các model card thường báo cáo chất lượng trong điều kiện máy chủ với độ chính xác đầy đủ (full-precision). Những con số đó hiếm khi dự đoán được cách một mô hình hoạt động trên điện thoại. Tuần này, Liquid AI đã phát hành Pipette. Đây là một nền tảng mã nguồn mở dùng để đánh giá các mô hình nền tảng (foundation models) trên thiết bị biên (edge devices), được xây dựng với sự hợp tác của Artificial Analysis trong vai trò đơn vị xác thực phương pháp luận độc lập. Pipette coi hành vi trên thiết bị là một đặc tính của hệ thống được triển khai, thay vì chỉ xét riêng mô hình. Đơn vị đo lường của nó là một cấu hình đầy đủ: mô hình + quantization + runtime + thiết bị. Bộ dữ liệu ra mắt bao gồm năm chỉ số hiệu năng trên thiết bị, trải rộng trên hơn 1.000 cấu hình (mô hình × quantization × runtime × thiết bị × ngữ cảnh), bao gồm hơn 30 mô hình, các bản dựng llama.cpp cho macOS, iOS, Windows và Android, cùng độ dài ngữ cảnh từ 256 đến 8.192 token. Các kết quả xác thực ban đầu đến từ MacBook Pro với chip M5 Max, iPhone 17 Pro và Galaxy S26 Ultra. Tuyên bố thực tiễn này có thể kiểm chứng được: hai mô hình 350M ở cùng mức quantization trên cùng một điện thoại cho thấy tốc độ xử lý (decode throughput) lần lượt là 78,4% và 33,8% ở mức 4.096 token.

Nó có thể triển khai được không?

Có, Pipette được phát hành dưới dạng cơ sở hạ tầng Apache 2.0 (pipette-mgmt, pipette-clients, pipette-scores), bao gồm một bộ dữ liệu kết quả công khai, một bảng điều khiển (dashboard) trực tuyến, cùng các ứng dụng benchmark gốc cho iOS và Android. Không có danh sách chờ. Việc công bố các kết quả do cộng đồng gửi đến hiện vẫn đang trong giai đoạn thử nghiệm (beta).

Những gì Liquid AI đã phát hành

Liquid AI đã phát hành Pipette với sự hợp tác của Artificial Analysis, một đơn vị xác thực độc lập đã xem xét và kiểm chứng phương pháp luận. Tiền đề của dự án này rất cụ thể và hữu ích: hành vi trên thiết bị là một đặc tính của hệ thống được triển khai, không phải của riêng mô hình đó.

Bộ dữ liệu ra mắt bao gồm năm chỉ số hiệu năng trên thiết bị trên hơn 1.000 cấu hình (mô hình × quantization × runtime × thiết bị × ngữ cảnh). Nó bao gồm hơn 30 mô hình, nhiều định dạng quantization, các bản dựng llama.cpp cho macOS, iOS, Windows và Android, cùng độ dài ngữ cảnh từ 256 đến 8.192 token. Các kết quả công bố ban đầu đến từ MacBook Pro với chip M5 Max, iPhone 17 Pro và Galaxy S26 Ultra, với kết quả cho AMD Ryzen AI Max+ 395 và Radeon 8060S được liệt kê là sắp ra mắt.

Trong Pipette, đơn vị đo lường là một cấu hình triển khai: mô hình + quantization + runtime + thiết bị. Một bài benchmark sau đó sẽ xác định chỉ số và hình thái token (token shape), tạo ra kết quả về độ trễ, thông lượng hoặc bộ nhớ. Chất lượng được theo dõi riêng biệt trên IFBench, GPQA Diamond và MATH-500. Các điểm số chất lượng đó hiện được lấy từ các lần chạy đánh giá llama.cpp trên hệ thống tham chiếu NVIDIA H100 80GB, sau đó được đối chiếu với các lần chạy trên thiết bị có cùng mô hình và quantization — một con số chất lượng hiển thị bên cạnh thông lượng điện thoại không phải được tạo ra trên chính điện thoại đó.

Tại sao ngữ cảnh triển khai lại thay đổi câu trả lời

Bốn so sánh được công bố cho thấy một cấu hình có thể thay đổi quyết định nhiều đến mức nào:

Cách thức đo lường được thực hiện

Các lần chạy hiệu năng tuân theo một phương pháp luận đã được công bố: hình thái token cố định, giải mã tham lam (greedy decoding), loại bỏ giai đoạn khởi động (warm-up), năm lần đo lặp lại và kiểm soát độ sẵn sàng (readiness gating). Trước mỗi lần đo lặp lại, một bước kiểm tra dành riêng cho nền tảng sẽ xác minh các điều kiện về nhiệt độ và tải; các lần chạy không đạt sẽ không được công bố. Các đánh giá sử dụng một giao thức riêng biệt với phương pháp chấm điểm xác định, không biết về mô hình (model-blind), và pipette-scores không bao giờ nhìn thấy nguồn gốc tạo ra dữ liệu. Mỗi bài nộp đều ghi lại phiên bản benchmark, hình thái token, artifact của mô hình, quantization, phiên bản runtime và cài đặt, cùng phần cứng thiết bị và hệ điều hành.

Công cụ giải thích tương tác

Những điểm chính cần lưu ý

Hãy xem qua các Chi tiết Kỹ thuật và Bảng xếp hạng. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter, đừng quên tham gia cộng đồng ML SubReddit với hơn 150 nghìn thành viên của chúng tôi và đăng ký Bản tin (Newsletter). Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy (machine learning) và học sâu (deep learning) vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với độc giả.

Liquid AIPipetteAI trên thiết bịĐánh giá hiệu năngAI di động
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.