MarkTechPost
85

Mô hình

Liquid AI ra mắt bộ mã hóa LFM2.5: Hiệu suất vượt trội trên CPU với ngữ cảnh 8K

(giờ Việt Nam)

Tóm tắt AI

Liquid AI vừa giới thiệu hai mô hình mã hóa LFM2.5 (230M và 350M) hỗ trợ ngữ cảnh 8.192 token. Phiên bản 350M vượt qua ModernBERT về độ chính xác, trong khi bản 230M tối ưu tốc độ xử lý cực nhanh trên CPU.

Bản dịch AI

Liquid AI Releases LFM2.5-Encoder-230M and LFM2.5-Encoder-350M: Bidirectional Encoders That Stay Fast at 8K Context on CPU

Liquid AI vừa phát hành hai bộ mã hóa hai chiều (bidirectional encoders) có trọng số mở là LFM2.5-Encoder-230M và LFM2.5-Encoder-350M. Cả hai đều là các mô hình ngôn ngữ che (masked language models) được xây dựng trên nền tảng lai LFM2 và đều hỗ trợ ngữ cảnh 8.192 token.

Các bộ mã hóa đóng vai trò nền tảng cho các bộ phân loại, bộ định tuyến ý định, bộ lọc an toàn và bộ phát hiện PII. Những tác vụ này chạy liên tục, thường không cần GPU và ngày càng xử lý các đầu vào dài hơn. BERT đã thiết lập nên lớp mô hình này. ModernBERT đã nâng cao độ chính xác, tốc độ và ngữ cảnh của nó. Lập luận của Liquid AI là kiến trúc LFM2 tiếp nối lộ trình đó, vì chi phí của nó tăng chậm hơn khi đầu vào dài hơn.

Cách một bộ giải mã (decoder) trở thành bộ mã hóa (encoder)

Các bộ mã hóa này không được huấn luyện từ đầu. Chúng được khởi tạo từ các bộ giải mã nền tảng LFM2.5-230M và LFM2.5-350M, sau đó được chuyển đổi với ba thay đổi:

Quá trình huấn luyện diễn ra trong hai giai đoạn:

Về mặt kiến trúc, phần nền tảng đan xen các khối tích chập ngắn có cổng (gated short-convolution blocks) với cơ chế chú ý truy vấn nhóm (grouped-query attention), cùng thiết kế được mô tả trong báo cáo kỹ thuật của LFM2. Cả hai checkpoint đều sử dụng kích thước ẩn (hidden size) là 1024, từ vựng 65.536 token và hỗ trợ 15 ngôn ngữ. Giấy phép sử dụng là LFM Open License v1.0.

Phần nhúng bên dưới phân tích chi tiết quá trình chuyển đổi, bảng xếp hạng đầy đủ, điểm số theo từng tác vụ và các số liệu về độ trễ trên CPU.

Kết quả đánh giá (benchmark)

Liquid AI đã đánh giá 14 mô hình trên 17 tác vụ được lấy từ GLUE, SuperGLUE và phân loại đa ngôn ngữ. Mỗi mô hình đều được tinh chỉnh (fine-tuned) hoàn toàn cho từng tác vụ và điểm số được báo cáo là kết quả của mô hình đã tinh chỉnh đó.

LFM2.5-Encoder-350M đạt điểm trung bình 81,02 (±1,00) trên 17 tác vụ, xếp thứ tư. Ba mô hình đứng trên nó đều có kích thước lớn hơn. Đó là XLM-R XL với 3,5 tỷ tham số (83,06), ModernBERT-large với 395 triệu tham số (81,68) và XLM-R large với 560 triệu tham số (81,34). Mô hình đứng đầu có kích thước lớn gấp gần 10 lần.

LFM2.5-Encoder-230M đạt 79,29 (±1,02), xếp thứ sáu. Nó vượt qua ModernBERT-base với 78,19 và mọi mô hình EuroBERT trong bảng, bao gồm EuroBERT-610M (75,87) và EuroBERT-2.1B (72,19). Cả hai bộ mã hóa mới cũng đạt điểm cao hơn các mô hình truy xuất cùng dòng của Liquid AI là LFM2.5-ColBERT-350M (76,18) và LFM2.5-Embedding-350M (75,68). Khoảng cách này chính là lý do được nêu ra khiến Liquid AI xây dựng một bộ mã hóa đa năng thay vì tái sử dụng các mô hình truy xuất.

Phương pháp luận là phần thú vị hơn và nó được mã nguồn mở theo giấy phép Apache-2.0. Mỗi mô hình được tải với trọng số chính fp32 và tự động chuyển đổi bf16, vì vậy bảng so sánh các mô hình thay vì các định dạng số. Mọi mô hình đều sử dụng cùng một công thức AdamW, lấy từ thẻ mô hình EuroBERT. Tỷ lệ học (learning rate) được chọn cho từng mô hình và tác vụ trên 10 mức tỷ lệ và 3 hạt giống (seeds). Điểm số sau đó được báo cáo là giá trị trung bình trên 5 hạt giống mới chưa từng được sử dụng trong quá trình lựa chọn. Phiên bản transformers được cố định ở 4.56.2 để đảm bảo sự thay đổi phụ thuộc không trở thành biến số không kiểm soát được.

Các trường hợp sử dụng và môi trường triển khai

Bản phát hành nêu tên ba thiết lập. Đầu tiên là các thiết bị biên (edge) và thiết bị nhúng. Máy tính trên xe hơi hoặc bộ điều khiển công nghiệp không có GPU dự phòng và không thể chịu được độ trễ khi gửi dữ liệu lên đám mây. Tiếp theo là các hệ thống được quản lý và tại chỗ (on-premise) trong lĩnh vực tài chính, y tế và pháp lý, nơi các tài liệu thường dài, nhạy cảm và không thể rời khỏi cơ sở hạ tầng nội bộ. Cuối cùng là các đường ống xử lý khối lượng lớn nhạy cảm về chi phí, nơi một bộ mã hóa nhỏ đóng vai trò là bước lọc đầu tiên giá rẻ trước khi chuyển sang mô hình lớn hơn.

Liquid AI cũng đưa ra một con số hữu ích về cửa sổ ngữ cảnh: 8.192 token tương đương khoảng 13 đến 15 trang văn bản. Một lần chuyển tiếp (forward pass) có thể bao quát toàn bộ một hợp đồng hoặc một hồ sơ bệnh nhân hoàn chỉnh.

Để cho thấy một bộ mã hóa đã tinh chỉnh trông như thế nào, nhóm nghiên cứu đã cung cấp năm bản demo. Mỗi bản chạy trong Hugging Face Space chỉ sử dụng CPU. Chúng bao gồm định tuyến prompt zero-shot, kiểm tra chính sách zero-shot và kiểm tra chính tả. Một bộ phát hiện PII xử lý 40 loại thông tin trên 16 ngôn ngữ. Một bản demo khuếch tán che (masked-diffusion) bổ sung chạy bộ mã hóa như một chatbot tạo văn bản bằng cách lặp lại quá trình bỏ che (unmasking).

Cách vận hành

Cả hai bộ mã hóa đều được tải thông qua thư viện transformers. Phần thân mô hình được hiển thị dưới dạng Lfm2BidirectionalModel và việc tải masked-LM sử dụng Lfm2BidirectionalForMaskedLM. Cả hai đều được kết nối thông qua auto_map, vì vậy cần thiết lập trust_remote_code=True trong mỗi lệnh gọi tải mô hình.

Một bộ mã hóa cơ sở tạo ra các biểu diễn đa năng chứ không phải đầu ra cho tác vụ cụ thể, vì vậy việc tinh chỉnh là bắt buộc. Hướng dẫn tinh chỉnh của Liquid AI đi sâu vào các tài liệu pháp lý dài với cấu hình ngữ cảnh 8k. Hướng dẫn chọn mô hình rất đơn giản: chọn 350M khi độ chính xác là ưu tiên hàng đầu, chọn 230M cho phần cứng hạn chế hơn hoặc yêu cầu thông lượng cao hơn.

Những điểm chính cần lưu ý

Hãy xem bài đăng trên blog của Liquid AI, bài viết trên Hugging Face và các thẻ mô hình cho LFM2.5-Encoder-230M và LFM2.5-Encoder-350M.

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, đảm bảo cả tính kỹ thuật lẫn sự dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với người xem.

Liquid AIMô hình ngôn ngữTối ưu CPUNLPMô hình mã hóa
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.