Mô hình
Ant Group ra mắt Ling-3.0-tiny-singprobe: Công cụ giám sát an toàn AI siêu nhẹ
(giờ Việt Nam)
Tóm tắt AI
Ant Group vừa phát hành SingProbe trên Hugging Face, một mô hình giám sát an toàn chỉ với 3,22 triệu tham số. Công cụ này giúp phát hiện rủi ro về ý định, nội dung độc hại và ảo tưởng của AI theo thời gian thực với chi phí vận hành cực thấp.
Bản dịch AI
Ling3-SingProbe
Tiếng Anh | Tiếng Trung
Mô tả mô hình
SingProbe là một cơ chế bảo vệ (guardrail) dạng streaming nội tại được xây dựng trên nền tảng inclusionAI/Ling-3.0-tiny. Thay vì chạy một mô hình an toàn riêng biệt, bộ dò (probe) gọn nhẹ này tái sử dụng các trạng thái ẩn (hidden states) của mô hình cơ sở trong quá trình tạo văn bản để chấm điểm ý định truy vấn, mức độ không an toàn của phản hồi và rủi ro ảo tưởng (hallucination) trên từng token. Nó chỉ làm tăng thêm chưa đầy 0,5% thời gian giải mã (decode-time overhead).
Xem báo cáo kỹ thuật để biết phương pháp luận và kết quả đầy đủ; chi tiết triển khai có sẵn tại inclusionAI/SingProbe.
Đánh giá
Chỉ số càng cao càng tốt cho mọi tiêu chí. Kết quả là giá trị trung bình trên các bộ benchmark được chỉ định dưới đây.
Bắt đầu nhanh
SingProbe được hỗ trợ thông qua nhánh tích hợp SGLang hoặc nhánh tích hợp vLLM. Hãy tải bộ dò bằng ID Hugging Face của nó khi khởi chạy máy chủ:
Các bản tích hợp này trả về một từ điển điểm số cho mỗi token được tạo (label_0–label_9). Hiện tại, chúng chỉ hỗ trợ các mô hình cơ sở Ling-3.0 (BailingMoeV3ForCausalLM). Hãy sử dụng đúng cặp mô hình cơ sở/bộ dò: inclusionAI/Ling-3.0-tiny với checkpoint này.
Trích dẫn
Bài viết được AI dịch và tổng hợp tự động từ Ant Group inclusionAI: HuggingFace mô hình mới. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.