Mô hình
Mistral AI ra mắt Shieldstral 1.0 3B: Bộ lọc an toàn đa phương thức, hiệu năng vượt trội
(giờ Việt Nam)
Tóm tắt AI
Mistral AI giới thiệu Shieldstral 1.0 3B, mô hình mã nguồn mở cho phép tùy chỉnh quy tắc kiểm duyệt nội dung bằng ngôn ngữ tự nhiên mà không cần huấn luyện lại.
Bản dịch AI

Mistral AI vừa ra mắt Shieldstral 1.0 3B, một bộ phân loại an toàn đa phương thức (multimodal) có trọng số mở và khả năng thích ứng chính sách, xử lý việc kiểm duyệt nội dung như một câu hỏi có/không duy nhất thay vì một hệ thống phân loại các danh mục độc hại cố định. Hầu hết các mô hình guardrail (hàng rào bảo vệ) đều tích hợp sẵn danh sách danh mục vào trọng số, vì vậy việc chuyển đổi sang một bối cảnh triển khai mới đồng nghĩa với việc phải huấn luyện lại — và cùng một nội dung có thể chấp nhận được trên công cụ nghiên cứu an ninh mạng nhưng lại gây hại trên nền tảng sức khỏe tâm thần. Shieldstral đảo ngược điều đó: người vận hành viết chính sách dưới dạng một câu hỏi ngôn ngữ tự nhiên tại thời điểm suy luận (inference), và mô hình trả về điểm số an toàn đã được hiệu chuẩn chỉ sau một lần chuyển tiếp (forward pass). Được xây dựng trên nền tảng Ministral-3-3B-Base-2512 với bộ mã hóa thị giác Pixtral gốc và phát hành theo giấy phép Apache 2.0, mô hình đạt mức F1 trung bình 84,9% về an toàn văn bản — ngang bằng với GPT-OSS-Safeguard-20B — và 83,8% về an toàn đa phương thức, vượt qua mọi mô hình cơ sở mà Mistral đã đánh giá.
Có thể triển khai được không?
Có, và có thể triển khai cục bộ. Shieldstral-1.0-3B chiếm 16GB VRAM ở định dạng BF16, chạy trên một GPU đơn lẻ và được cấp phép Apache 2.0 cho mục đích thương mại và phi thương mại. Các đường dẫn phục vụ (serving paths) đã sẵn sàng: vLLM (≥0.26.0, khuyến nghị), llama.cpp thông qua chuyển đổi GGUF với lượng tử hóa Q8_0/Q5_K_M/Q4_K_M, SGLang và Transformers — với khả năng tinh chỉnh (fine-tuning) được hỗ trợ thông qua Axolotl. Bộ phân loại chỉ xuất ra một token, vì vậy độ trễ và chi phí thấp hơn nhiều so với các hàng rào bảo vệ dựa trên suy luận như GPT-OSS-Safeguard-20B.
Kiểm duyệt như một câu hỏi nhị phân
Shieldstral rút gọn việc kiểm duyệt thành một câu hỏi có/không duy nhất. Một thông báo hệ thống (system message) cố định thiết lập nhiệm vụ; thông báo của người dùng chứa ba trường: <Instruct> (bối cảnh đánh giá và mức độ nghiêm ngặt), <Query> (chính sách, được diễn đạt thành một câu hỏi có/không duy nhất) và <Document> (một prompt, một phản hồi, một cặp prompt-phản hồi, hoặc một hình ảnh kèm văn bản tùy chọn).
Tại thời điểm suy luận, mô hình chỉ giải mã (unembed) về phía ID token "yes" và "no", sau đó chuẩn hóa softmax thành một điểm số liên tục, với ngưỡng τ=0.5. Điều này gộp việc phân loại prompt, kiểm duyệt phản hồi, phát hiện từ chối và phát hiện độc hại thành một vấn đề duy nhất — và có nghĩa là chính sách nằm hoàn toàn trong prompt. Hướng dẫn của Mistral là mỗi lệnh gọi chỉ áp dụng một chính sách; để có phán quyết an toàn/không an toàn rộng hơn, hãy liệt kê các danh mục trong <Instruct> và đặt một <Query> bao quát duy nhất.
Công thức dữ liệu
Lợi thế được khẳng định đến từ dữ liệu, không phải quy mô: khoảng 54,1 triệu mẫu — 45,2 triệu văn bản nguồn mở, 4,4 triệu văn bản đối kháng tổng hợp, 4,5 triệu mẫu đa phương thức. Một lớp thống nhất dựa trên mẫu (template) chuyển đổi mọi tập dữ liệu thành cùng một định dạng instruction-query-document thông qua các bộ xử lý theo từng tập dữ liệu, với các cách diễn đạt ngẫu nhiên và mức độ nghiêm ngặt được hiệu chuẩn (nghiêm ngặt đối với các cuộc tấn công jailbreak, nới lỏng đối với dữ liệu chất lượng phản hồi).
Phần thú vị hơn là tạo dữ liệu đối kháng (contrastive generation). Một LLM viết lại văn bản an toàn thành một biến thể không an toàn vi phạm một danh mục mục tiêu nhưng cố tình không vi phạm danh mục liên quan, tạo ra một mẫu tích cực và một mẫu tiêu cực khó trên cùng một nội dung trong một lần gọi. Điều đó dạy cho mô hình biết chính sách nào bị vi phạm thay vì chỉ phân loại an toàn/không an toàn thô sơ. Dữ liệu hình ảnh — vốn không thể tổng hợp như văn bản — được bổ sung bằng các tập dữ liệu hình ảnh đa năng làm dữ liệu tiêu cực, đột biến truy vấn trên 14 danh mục phụ về thị giác và lọc bằng bộ xếp hạng lại (reranker) thị giác-ngôn ngữ.
Quá trình huấn luyện là tinh chỉnh LoRA theo sau bởi hợp nhất SLERP ba chiều: 0,6 công khai+tổng hợp, 0,3 chỉ công khai, 0,1 Ministral-3B-Instruct.
Kết quả
Về an toàn văn bản, Shieldstral đạt mức F1 trung bình 84,9%, ngang bằng với GPT-OSS-Safeguard-20B (84,9%) với tư cách là mô hình nhỏ nhất trong bảng so sánh, đồng thời giành chiến thắng trên ToxicChat (84,1), HarmBench (99,4) và phản hồi Aegis v2 (87,2). Về an toàn đa phương thức, mô hình đạt 83,8% tổng thể so với 77,6% của OmniGuard-7B, dẫn trước VLGuard (97,7) và UnsafeBench (81,8); LlavaGuard-7B vẫn dẫn đầu điểm chuẩn cùng tên ở mức 81,4.
Trên điểm chuẩn khả năng thích ứng — được xây dựng trên hệ thống phân loại cố tình khác biệt gồm 12 siêu lớp, 26 danh mục phụ và 52 danh mục lá với 90 truy vấn cố định, nơi không có danh mục lá nào khớp 1-1 với dữ liệu huấn luyện — Shieldstral đạt 91,3% F1, đứng sau GPT-OSS-Safeguard-20B (94,1%) và Nemotron-3.5-Safety-4B (91,8%), nhưng không cần tạo ra chuỗi suy luận. Khả năng phát hiện từ chối đạt 91,5% tổng thể so với 93,7% của GPT-OSS-Safeguard-20B.
Điểm yếu: phân loại prompt đa ngôn ngữ còn chậm ở tiếng Ả Rập và tiếng Indonesia cũng như trên các prompt RTP-LX (70,3 so với 86,1 của Nemotron-3.5-Safety-4B). Mistral cũng lưu ý độ tin cậy giảm đối với các đầu vào đối kháng hoặc bị làm nhiễu và các tài liệu rất dài. Bối cảnh huấn luyện là 32k token trên 12 ngôn ngữ.
Những điểm chính cần lưu ý
Hãy xem Bài báo, Mô hình trên Hugging Face và Chi tiết kỹ thuật. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter, đừng quên tham gia SubReddit ML 150k+ thành viên và Đăng ký Bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Cần hợp tác với chúng tôi để quảng bá GitHub Repo, Trang Hugging Face, Phát hành sản phẩm hoặc Hội thảo trực tuyến, v.v. của bạn? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.