Hugging Face Blog
85

Mô hình

Triển khai tác vụ AI cục bộ mọi nơi với mô hình LFM2.5-2.6B từ Liquid AI

(giờ Việt Nam)

Tóm tắt AI

Liquid AI ra mắt LFM2.5-2.6B, mô hình ngôn ngữ tối ưu hóa cho hiệu suất cao, cho phép chạy các tác nhân AI cục bộ mượt mà trên nhiều thiết bị khác nhau.

Bản dịch AI

Deploy local agents everywhere with LFM2.5-2.6B

Quay lại danh sách bài viết

LFM2.5-2.6B được xây dựng để vận hành các tác nhân (agent) mạnh mẽ hoàn toàn trên thiết bị. Nó hỗ trợ gọi công cụ (tool calling) và các quy trình làm việc đa bước, trong khi vẫn giữ được kích thước nhỏ và tốc độ đủ nhanh cho các phần cứng phổ thông, từ máy tính xách tay đến điện thoại. Điều này cho phép các nhà phát triển triển khai tác nhân ở mọi nơi, giữ dữ liệu riêng tư trên thiết bị và mở rộng quy mô sử dụng mà không tốn chi phí suy luận trên đám mây.

lfm2_5_2_6b_evaluations

Cách chúng tôi xây dựng một mô hình tác nhân đáng tin cậy cho thiết bị biên (edge devices)

LFM2.5-2.6B được huấn luyện trước trên khoảng 34 nghìn tỷ token, với giai đoạn huấn luyện trung gian giúp mở rộng cửa sổ ngữ cảnh lên 128K. Sau đó, quá trình hậu huấn luyện (post-training) sẽ chuyển đổi mô hình cơ sở thành một tác nhân thông qua bốn giai đoạn:

LFM2.5-2.6B-Training-Recipe

Đường ống Agentic RL tách biệt việc tối ưu hóa mô hình, suy luận và thực thi môi trường thành các thành phần riêng biệt. Training Engine (Công cụ huấn luyện) tối ưu hóa mô hình, trong khi Rollout Engine (Công cụ triển khai) tạo ra các hành động bằng cách sử dụng chính sách mới nhất. Khung RL điều phối vòng lặp huấn luyện bằng cách khởi chạy các lượt triển khai, thu thập quỹ đạo và phần thưởng, đồng thời cập nhật mô hình.

Các hành động được thực thi trong một Sandbox Service, nơi Blackbox Harness lưu trữ tác nhân (ví dụ: OpenClaw hoặc Hermes Agent) và điều phối các tương tác với môi trường tác vụ. Harness Proxy cho phép chúng ta xử lý các harness tác nhân như những hộp đen mà không cần sửa đổi, đồng thời nắm bắt một cách minh bạch các quỹ đạo ở cấp độ token cần thiết để tái tạo và xác thực các mẫu huấn luyện RL.

LFM2.5-2.6B-Agentic-RL

Kết quả đánh giá (Benchmark)

Chúng tôi đã đánh giá LFM2.5-2.6B so với các mô hình có kích thước lớn hơn gấp khoảng 4 lần trên các tác vụ STEM, tuân thủ hướng dẫn, sử dụng công cụ và các tác vụ tác nhân. Đây là mô hình nhỏ nhất trong nhóm nhưng lại có khả năng cạnh tranh và thường vượt trội hơn các mô hình còn lại.

Đối với ứng dụng của bạn, thế mạnh nằm ở khả năng tuân thủ hướng dẫn và sử dụng công cụ. LFM2.5-2.6B đứng đầu mọi bài kiểm tra về tuân thủ hướng dẫn tại đây, và mọi bài kiểm tra về sử dụng công cụ ngoại trừ BFCLv4, nơi chỉ có Qwen 9.7B vượt lên dẫn trước một chút. Trên các tác vụ tác nhân, nó đánh bại cả hai mô hình Gemma và ngang bằng với các mô hình Qwen. Nó cũng dẫn đầu về kiến thức và bám sát về toán học. Lập trình là lĩnh vực duy nhất mà các mô hình lớn hơn giữ ưu thế rõ rệt, vì vậy hãy chọn mô hình lớn hơn cho tác vụ đó.

Tốc độ suy luận trên CPU và GPU

LFM2.5-2.6B hỗ trợ ngay từ ngày đầu trên toàn bộ hệ sinh thái suy luận, bao gồm llama.cpp, MLX, vLLM, SGLang và ONNX.

Suy luận trên CPU. Nhờ kiến trúc LFM2 hiệu quả, LFM2.5-2.6B là mô hình nhanh nhất mà chúng tôi đã thử nghiệm, với tốc độ giải mã đạt 220 token/giây trên M5 Max và 113 token/giây trên Ryzen AI Max+ 395. Với tốc độ 30 token/giây, nó cho phép bạn chạy các tác nhân mạnh mẽ ngay cả trên điện thoại.

lfm2_5_2_6b_cpu_inference

Suy luận trên GPU. LFM2.5-2.6B là mô hình nhanh nhất trong cùng phân khúc kích thước, đạt gần 15 nghìn token đầu ra mỗi giây ở mức độ đồng thời cao, tương đương khoảng 1,3 tỷ token mỗi ngày trên một chiếc H100 duy nhất.

lfm2_5_2_6b_gpu_inference

Cách sử dụng LFM2.5-2.6B

Hãy chọn LFM2.5-2.6B khi bạn cần các tác nhân trên thiết bị cho khối lượng công việc lớn.

Cài đặt phiên bản mới nhất của transformers (tương thích với transformers>=5.0.0):

Sau đó tải và chạy mô hình:

Bản demo LFM2.5-2.6B

Hãy xem bản demo trên trình duyệt này của LFM2.5-2.6B khi vận hành một tác nhân nghiên cứu. Tác nhân này giúp bạn nghiên cứu các câu hỏi cụ thể và tạo ra bản tóm tắt.

Bắt đầu

Cả LFM2.5-2.6B và LFM2.5-2.6B-Base đều đã có sẵn trên Hugging Face từ hôm nay.

Với LFM2.5, chúng tôi đang hiện thực hóa tầm nhìn về AI có thể chạy ở bất cứ đâu. Các mô hình này là:

Chúng tôi rất nóng lòng được thấy những gì bạn sẽ xây dựng.

Trích dẫn

Vui lòng trích dẫn bài viết này như sau:

Hoặc sử dụng trích dẫn BibTeX:

LiquidAIMô hình nhỏAI cục bộEdge AILFM2.5
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.