Tin ngành
LFM2.5-Encoders: Đột phá suy luận ngữ cảnh dài siêu tốc trên CPU
(giờ Việt Nam)
Tóm tắt AI
Liquid AI giới thiệu dòng mô hình LFM2.5-Encoders, tối ưu hóa khả năng xử lý ngữ cảnh dài với tốc độ vượt trội ngay cả trên phần cứng CPU thông thường.
Bản dịch AI

Quay lại các bài viết
Hôm nay, chúng tôi phát hành hai mô hình encoder mới trên Hugging Face: LFM2.5-Encoder-230M và LFM2.5-Encoder-350M. Chúng đạt chất lượng tương đương với các mô hình lớn hơn nhưng vẫn duy trì tốc độ nhanh khi đầu vào dài hơn. Điều này có nghĩa là bạn có thể chạy các tác vụ quy mô tài liệu trên phần cứng hiện có, ngay cả trên CPU.
Đây là những gì bạn nhận được:
Với các mô hình này, bạn có thể xây dựng bộ định tuyến ý định (intent routers), bộ kiểm tra chính sách (policy linters), bộ phát hiện PII và bộ phân loại văn bản chạy với chi phí thấp, liên tục cả ngày. Xem các bản demo trực tiếp bên dưới.
Tại sao chúng tôi xây dựng một encoder đa mục đích
Tháng trước, chúng tôi đã phát hành LFM2.5-Retrievers, được xây dựng cho tìm kiếm đa ngôn ngữ. LFM2.5-Encoders thuộc cùng một dòng nhưng phục vụ mục đích rộng hơn. Chúng được huấn luyện trước với mục tiêu ngôn ngữ bị che (masked-language objective), vì vậy bạn có thể tinh chỉnh (fine-tune) chúng cho các tác vụ phân loại, tác vụ cấp token và tìm kiếm. Tìm kiếm chỉ là một trong những ứng dụng mà encoder hỗ trợ. Đó là lý do tại sao chúng tôi xây dựng một mô hình đa mục đích thay vì tái sử dụng các bộ truy xuất (retrievers).
Encoder cung cấp sức mạnh cho nhiều ứng dụng NLP hiện đại trong thực tế: bộ phân loại, bộ định tuyến ý định, bộ lọc an toàn. Các tác vụ này chạy cả ngày, thường trên CPU, với đầu vào ngày càng dài. BERT đã thiết lập nên lớp mô hình này, và gần đây ModernBERT đã đẩy độ chính xác, tốc độ và ngữ cảnh của nó đi xa hơn. LFM2.5-Encoders thực hiện bước tiếp theo trên kiến trúc LFM2, nơi chi phí tăng chậm khi đầu vào tăng.
Cách các encoder được xây dựng
Chúng tôi khởi tạo các encoder từ các backbone decoder LFM2 tương ứng: LFM2.5-230M và LFM2.5-350M. Sau đó, chúng tôi chuyển đổi mỗi causal decoder thành một bidirectional encoder với một vài thay đổi:

Chúng tôi huấn luyện cả hai mô hình theo hai giai đoạn:
Kết quả đánh giá (Benchmark)
Chúng tôi tinh chỉnh toàn diện từng mô hình trên mọi tác vụ và báo cáo điểm số thu được. Trong bảng này, đó là 14 mô hình trên 17 tác vụ được lấy từ GLUE, SuperGLUE và phân loại đa ngôn ngữ.
Chúng tôi báo cáo giá trị trung bình trên năm hạt giống (seeds) được giữ lại, vì vậy các con số ổn định qua từng lần chạy. Khung làm việc đầy đủ và kết quả thô đều được mở nguồn.

LFM2.5-Encoder-350M xếp thứ tư trong số 14 mô hình. Ba mô hình đứng trước nó đều lớn hơn, bao gồm một mô hình 3.5B lớn gấp gần 10 lần. LFM2.5-Encoder-230M vượt qua ModernBERT-base và mọi mô hình EuroBERT, trong khi kích thước nhỏ hơn hầu hết chúng. Cả hai cũng đạt điểm số cao hơn nhiều so với LFM2.5-Retrievers của chính chúng tôi ở đây.
Tốc độ suy luận trên CPU và GPU
Các encoder của chúng tôi kế thừa khả năng suy luận nhanh của backbone LFM2. Vì cả encoder của chúng tôi và ModernBERT đều hỗ trợ ngữ cảnh 8.192 token, chúng tôi đo tốc độ trên toàn bộ phạm vi này.

Các encoder của chúng tôi cho thấy lợi thế lớn nhất trên CPU. Tại đây, LFM2.5-Encoder-230M nhanh nhất ở mọi độ dài chuỗi (thậm chí nhanh hơn cả ModernBERT-base nhỏ hơn đối với các đầu vào ngắn). Với độ dài đầu vào tăng dần, thông lượng giảm mạnh đối với ModernBERT, trong khi LFM2.5-Encoders của chúng tôi tăng lên mức trung bình trước khi giảm dần. Ở mức 8.192 token, ModernBERT-base mất hơn một phút rưỡi cho mỗi lần truyền xuôi (forward pass) so với khoảng 28 giây của LFM2.5-Encoder-230M. Con số này nhanh hơn khoảng 3,7 lần. Đối với các nhà phát triển, điều đó có nghĩa là bạn có thể quét hoặc phân loại toàn bộ hợp đồng, bản ghi chép hoặc chuỗi hỗ trợ dài trong vòng chưa đầy 30 giây trên CPU máy tính xách tay.

Trên GPU, một mô hình tương tự cũng diễn ra với biên độ nhỏ hơn: ModernBERT-base dẫn đầu dưới ~1K token trên Apple GPU. Các encoder của chúng tôi chiếm ưu thế từ khoảng 2K token trở lên. Điều này cho thấy đối với đầu vào dài, LFM2.5-Encoders là lựa chọn nhanh hơn, và nếu bạn đang chạy trên CPU, sự khác biệt là rất đáng kể.
Demo LFM2.5-Encoder
Chúng tôi đã xây dựng các bản demo bên dưới từ các mô hình LFM2.5-Encoders đã được tinh chỉnh. Mỗi bản demo chạy trong một Hugging Face space chỉ dùng CPU:
Cách sử dụng và tinh chỉnh LFM2.5-Encoders
Hãy chọn LFM2.5-Encoder khi bạn có một tác vụ hiểu văn bản khối lượng lớn, chẳng hạn như phân loại, định tuyến, trích xuất hoặc chấm điểm, chạy liên tục và cần duy trì chi phí thấp và tốc độ nhanh. Đối với những tác vụ như vậy, một encoder đã tinh chỉnh sẽ nhỏ hơn, nhanh hơn và rẻ hơn nhiều so với một LLM tạo sinh, đồng thời nó phù hợp với các CPU bạn đang có.
Giữa hai kích thước encoder:
Bạn có thể bắt đầu chỉ với vài dòng code. Tải mô hình với thư viện transformers. Sau đó chạy trực tiếp để dự đoán token bị che, hoặc gắn thêm head của riêng bạn và tinh chỉnh cho tác vụ của mình.
Tải và chạy mô hình
Cài đặt phiên bản mới nhất của transformers:
Chạy dự đoán token bị che:
Đối với các tác vụ hạ nguồn (downstream tasks), hãy tải phần thân encoder và gắn head của riêng bạn (phân loại, phân loại token, hồi quy, truy xuất):
Nếu GPU của bạn hỗ trợ, hãy sử dụng Flash Attention 2 để đạt hiệu quả cao nhất:
Tinh chỉnh cho tác vụ của bạn
Một base encoder cung cấp cho bạn các biểu diễn đa mục đích, không phải đầu ra tác vụ. Vì vậy, bạn cần tinh chỉnh nó cho từng tác vụ. Hướng dẫn tinh chỉnh của chúng tôi sẽ đi qua các bước tinh chỉnh trên tài liệu pháp lý dài với ngữ cảnh 8k.
Bắt đầu với LFM2.5-Encoders
Cả hai encoder đều mở trọng số và có sẵn trên Hugging Face ngay hôm nay:
Chúng tôi rất nóng lòng chờ xem bạn sẽ xây dựng những gì.
Trích dẫn
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.