Mô hình
Fastino ra mắt GLiNER2.5-Decide: Mô hình ra quyết định 340M mã nguồn mở chạy mượt trên CPU
(giờ Việt Nam)
Tóm tắt AI
Fastino Labs giới thiệu GLiNER2.5-Decide, mô hình 340M tham số hỗ trợ xử lý văn bản và schema, cung cấp kết quả có cấu trúc kèm độ tin cậy. Với giấy phép Apache 2.0, mô hình tối ưu để chạy trên CPU hoặc môi trường biệt lập.
Chính văn · Bản dịch AI

Fastino Labs vừa phát hành GLiNER2.5-Decide, một mô hình quyết định mã nguồn mở với 340 triệu tham số. Mô hình này nhận đầu vào là văn bản và một lược đồ các câu hỏi có kiểu dữ liệu, sau đó trả về các câu trả lời có cấu trúc. Mỗi câu trả lời đi kèm với phân phối xác suất, điểm tin cậy và siêu dữ liệu về tính khả thi của ràng buộc. Nó nhắm đến các quyết định thường xuyên trong quy trình làm việc của tác nhân (agent): định tuyến, phân loại, chọn công cụ và thiết lập hàng rào bảo vệ (guardrails).
Có thể triển khai được không? Có, các trọng số được phát hành theo giấy phép Apache 2.0 và cài đặt thông qua lệnh pip install gliner2. Chúng chạy trên CPU, GPU hoặc trong các môi trường biệt lập (air-gapped). Đội ngũ Fastino cũng cung cấp dịch vụ suy luận và tinh chỉnh (fine-tuning) thông qua GLiNER API.
GLiNER2.5-Decide thực sự làm được gì
GLiNER2.5-Decide là một bộ phân loại không tạo sinh. Nó sử dụng bộ mã hóa DeBERTa-v3-large và được tinh chỉnh từ gliner2-large-v1. Nó không tạo ra các token mới và không cần mẫu prompt.
Các tập nhãn được truyền vào tại thời điểm gọi. Mỗi câu hỏi trong lược đồ sẽ khai báo các câu trả lời được phép. Nó cũng khai báo liệu nó mong đợi một câu trả lời, nhiều câu trả lời hay một giá trị có thứ tự. Các lược đồ có thể chứa hướng dẫn, ví dụ, mô tả nhãn và các quy tắc liên kết câu trả lời giữa các câu hỏi.
Quy trình gồm 2 giai đoạn. Bộ mã hóa đọc văn bản và lược đồ cùng lúc, sau đó chấm điểm cho mọi câu trả lời được phép. Một bộ giải mã có ràng buộc (constrained decoder) sau đó sẽ tìm kiếm sự kết hợp tối ưu nhất mà các quy tắc đã khai báo cho phép.
Fastino làm rõ phạm vi của mô hình. Mô hình không suy luận, giải thích hay trả lời các câu hỏi mở. Đây là một chuyên gia dành cho các quyết định vận hành.
Tại sao giải mã kết hợp (Joint Decoding) lại quan trọng
Đội ngũ Fastino minh họa giá trị này bằng một ví dụ về hàng rào bảo vệ. Khi giải mã độc lập, mô hình gắn cờ tấn công prompt injection ở mức 0.82. Nó cũng gắn nhãn cùng prompt đó là an toàn ở mức 0.52. Cuộc tấn công đã được phát hiện, nhưng 2 kết quả đầu ra lại mâu thuẫn nhau.
Giải mã kết hợp áp dụng quy tắc rằng bất kỳ tác hại nào được phát hiện đều yêu cầu một phán quyết không an toàn. Sau đó, mô hình trả về safety=unsafe và harm_type=prompt_injection cùng lúc. Mã nguồn phía sau có thể sử dụng các điểm số đó để chặn, định tuyến hoặc leo thang xử lý.
Các lược đồ có thể thể hiện các hàm ý, loại trừ, giới hạn số lượng và giới hạn thứ tự. Cùng một bộ mã hóa cũng có thể trích xuất các thực thể, quan hệ và bản ghi có cấu trúc với các offset ở cấp độ ký tự trong 1 lần truyền (forward pass). Các câu trả lời phân loại không trả về các đoạn văn bản gốc (evidence spans).
Kết quả đánh giá trên các quyết định nhanh
Đội ngũ Fastino đã đánh giá mô hình trên Fast Decisions, một bộ dữ liệu kiểm thử nội bộ. Nó chứa 5.100 ví dụ kiểm thử trên 17 tập dữ liệu. Các tác vụ bao gồm vận hành khách hàng, định tuyến lĩnh vực (ngân hàng, y tế, du lịch, phúc lợi) và hiểu nội dung tổng quát. Chỉ số đo lường là độ chính xác khớp hoàn toàn (exact-match accuracy): một dự đoán chỉ được tính nếu tập nhãn của nó khớp hoàn toàn với tham chiếu.
| Mô hình | Loại | Trung bình |
|---|---|---|
| GLiNER2.5-Decide | Bộ mã hóa 340M | 60.1% |
| JevK5 | Bộ giải mã Qwen3.5 4B | 57.5% |
| SemIf | Bộ giải mã Qwen3.5-4B | 56.4% |
| GLiFormer large-v1 | Bộ mã hóa đơn truyền | 49.0% |
| Laya | Bộ mã hóa ModernBERT 421M | 46.6% |
GLiNER2.5-Decide dẫn đầu 9 trên 17 tập dữ liệu. Định tuyến ý định là thế mạnh nhất của nó. Nó đạt 75,3% về ý định hỗ trợ và 64,3% về ý định ngân hàng. Những con số này cao hơn 18,6 và 8,6 điểm so với các mô hình tốt nhất tiếp theo.
Độ trễ: Thực tế trên CPU
Đội ngũ Fastino đã đo điểm chuẩn checkpoint từ đầu đến cuối ở batch 1 với lược đồ 2 đầu ra, 15 nhãn. Tại 64 token, độ trễ p50 là:
- 167,3 ms trên Intel Xeon Platinum 8581C 48-vCPU
- 43,6 ms trên NVIDIA T4
- 43,4 ms trên NVIDIA L4
- 38,3 ms trên NVIDIA V100
- 47,3 ms trên NVIDIA A100
Các yêu cầu ngắn bị chi phối bởi tiền xử lý cố định và chi phí khởi chạy kernel. Điều đó giữ cho các GPU chênh lệch nhau trong vòng 9 ms. Tại 1.024 token, A100 vượt lên với 52,6 ms, so với 75,6 ms trên V100 và 131,4 ms trên L4.
Sử dụng trong mã nguồn
Lệnh gọi đa đầu ra này được điều chỉnh từ thẻ mô hình (model card):
from gliner2 import AutoExtractor
model = AutoExtractor.from_pretrained("fastino/GLiNER2.5-Decide")
model.classify_text(
"Please confirm the new retention rule is applied before Friday's audit.",
{
"intent": ["fyi", "request", "approval", "complaint"],
"urgency": ["low", "normal", "high", "critical"],
"route": ["support", "billing", "legal", "security"],
},
)Các đầu ra đơn nhãn trả về một chuỗi. Các đầu ra đa nhãn trả về mọi nhãn vượt ngưỡng cls_threshold. Các nhãn có thể mang mô tả, và các thang đo thứ tự được truyền dưới dạng chuỗi thông thường như “0” đến “10”.
Các trường hợp sử dụng và dòng mô hình
Fastino nhắm đến định tuyến mô hình, gọi công cụ, sử dụng trình duyệt và máy tính, hàng rào bảo vệ, cắt tỉa ngữ cảnh, LLM-as-a-judge và mô phỏng. Việc tinh chỉnh hoạt động cục bộ, toàn phần hoặc với LoRA, thông qua GLiNER2 trainer. Một tệp SKILL.md cung cấp quy trình làm việc được lưu trữ cho các tác nhân lập trình.
Fastino cũng đã xuất bản GLiNER2.5-Decide-1B, được xây dựng trên bộ mã hóa Ettin 1B. Nó đạt 59,6% trên cùng bộ dữ liệu, thấp hơn một chút so với mô hình 340M. Đối với đầu vào đa ngôn ngữ, Fastino giới thiệu GLiNER2.5-multi-Decide, một mô hình 287M đạt 56,7%. Kiến trúc cơ bản được mô tả trong bài báo GLiNER2.
Những điểm chính cần nhớ
- Bộ mã hóa 340M mã nguồn mở, Apache 2.0, chạy trên CPU hoặc môi trường biệt lập.
- Trả về câu trả lời, xác suất, độ tin cậy và siêu dữ liệu khả thi.
- Giải mã kết hợp thực thi các quy tắc trên các câu trả lời liên quan.
- Trung bình 60,1% trên bộ 17 tập dữ liệu nội bộ của Fastino, dẫn đầu 9 tập.
- 167,3 ms p50 trên CPU, 38,3 ms trên V100 cho các đầu vào ngắn.
Xem Chi tiết kỹ thuật và Thẻ mô hình. Mọi tín dụng thuộc về các nhà nghiên cứu của dự án này. Ngoài ra, hãy theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML và đăng ký bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, bản phát hành sản phẩm hoặc hội thảo trực tuyến của bạn? Kết nối với chúng tôi
Sana Hassan
Sana Hassan, thực tập sinh tư vấn tại Marktechpost và là sinh viên bằng kép tại IIT Madras, đam mê việc ứng dụng công nghệ và AI để giải quyết các thách thức thực tế. Với sự quan tâm sâu sắc đến việc giải quyết các vấn đề thực tiễn, anh mang đến một góc nhìn mới mẻ về sự giao thoa giữa AI và các giải pháp đời sống.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.