Mô hình
Mistral ra mắt Shieldstral: Mô hình bảo mật 3B nhỏ gọn nhưng mạnh mẽ như các đối thủ gấp 7 lần quy mô
(giờ Việt Nam)
Tóm tắt AI
Mistral giới thiệu Shieldstral, mô hình bảo mật 3B sử dụng cơ chế hỏi đáp tự nhiên để kiểm soát nội dung độc hại. Với khả năng chạy cục bộ và tùy biến linh hoạt, nó đạt hiệu suất ngang ngửa các mô hình lớn hơn gấp nhiều lần.
Bản dịch AI

Một bài báo mới đề xuất thay thế các danh mục an toàn cố định bằng các câu hỏi có/không, cho phép người vận hành xác định ngay tại thời điểm chạy (runtime) mà không cần phải huấn luyện lại bộ phân loại.
Theo bài báo, Shieldstral, một mô hình 3 tỷ tham số từ công ty AI Mistral của Pháp, có hiệu suất ngang bằng với các mô hình lớn gấp ba lần nó trên các tiêu chuẩn đánh giá an toàn văn bản thông thường. Mistral cho biết mô hình này cũng thiết lập một kỷ lục điểm số cao mới cho việc phân loại kết hợp cả văn bản và hình ảnh.
Các quy tắc thời gian thực cho phép người vận hành tùy chỉnh các kiểm tra an toàn
Nhiều mô hình guardrail (hàng rào bảo vệ) phân loại nội dung bằng cách sử dụng các hệ thống phân loại (taxonomy) cố định. Các tác giả của bài báo, bao gồm đồng sáng lập Mistral là Guillaume Lample, chỉ ra hai vấn đề với cách tiếp cận này: các bộ dữ liệu an toàn công cộng nhóm các rủi ro quá khác biệt để hỗ trợ một hệ thống phân loại chung, và các quy tắc giống nhau không phù hợp với mọi trường hợp sử dụng. Nội dung phù hợp cho một công cụ an ninh mạng có thể gây hại trên một nền tảng sức khỏe tâm thần.

Người vận hành yêu cầu Shieldstral kiểm tra bằng các câu hỏi ngôn ngữ tự nhiên như "Nội dung này có thúc đẩy bạo lực không?". Mô hình chỉ trả lời "có" hoặc "không", và hệ thống sử dụng xác suất của mỗi phản hồi để tính toán điểm an toàn từ 0 đến 1.
Dữ liệu tổng hợp giúp mô hình xử lý các quy tắc mới
Các nhà nghiên cứu đã kết hợp khoảng 54,1 triệu ví dụ bao gồm các nội dung về an toàn, nội dung độc hại và các nỗ lực thao túng vào một định dạng duy nhất. Họ áp dụng các tiêu chuẩn nghiêm ngặt cho việc thao túng có mục tiêu, tiêu chuẩn trung bình cho dữ liệu an toàn chung và tiêu chuẩn nới lỏng cho chất lượng phản hồi.

Để dạy Shieldstral những phân biệt tinh tế hơn, nhóm nghiên cứu đã sử dụng một mô hình ngôn ngữ khác để viết lại văn bản an toàn thành các biến thể không an toàn. Mỗi ví dụ cũng bao gồm một danh mục tương tự nhưng khác biệt cần phải bị từ chối, điều này giúp huấn luyện mô hình tách biệt các quy tắc có liên quan chặt chẽ thay vì chỉ đưa ra phán đoán chung chung là an toàn hay không an toàn.
Các tác giả đã tạo ra các danh mục kiểm tra khả năng thích ứng tách biệt với tập huấn luyện, sử dụng các tên gọi và mức độ chi tiết khác nhau. Họ cho biết không có danh mục kiểm tra chi tiết nào khớp trực tiếp với danh mục huấn luyện, mặc dù 10 trong số 12 lớp rộng hơn có các đối tác tương đương.
Mô hình 3B ngang bằng với mô hình lớn hơn gần bảy lần
Trên các tiêu chuẩn đánh giá văn bản kết hợp, Shieldstral đạt điểm F1 là 84,9%. F1 kết hợp độ chính xác (precision) và độ thu hồi (recall) thành một chỉ số duy nhất, với 100% là điểm số hoàn hảo. Kết quả đó ngang bằng với GPT-OSS-Safeguard-20B của OpenAI, vốn lớn hơn khoảng bảy lần, và vượt qua Qwen3Guard-8B với 84,0%, Nemotron-3.5-Safety-4B với 83,3% và LlamaGuard-4-12B với 69,1%.
Đối với hình ảnh và kết hợp hình ảnh-văn bản, Shieldstral đạt 83,8%, vượt lên trên OmniGuard-7B với 77,6% và LlavaGuard-7B với 71,6%.

GPT-OSS-Safeguard-20B dẫn đầu tiêu chuẩn đánh giá khả năng thích ứng với 94,1%, so với 91,3% của Shieldstral. Bài kiểm tra này sử dụng các quy tắc khác với các danh mục huấn luyện hoặc hoàn toàn mới. Các tác giả vẫn coi Shieldstral thiết thực hơn GPT-OSS-Safeguard-20B và Nemotron-3.5-Safety, vì cả hai mô hình này đều tạo ra các chuỗi suy luận trung gian dài làm tăng chi phí tính toán, trong khi Shieldstral chỉ trả về một từ duy nhất.

Shieldstral dựa trên Ministral-3B của Mistral với bộ mã hóa thị giác Pixtral. Trong một bài kiểm tra xác thực với các danh mục chi tiết, dữ liệu danh mục tổng hợp đã nâng điểm F1 lên 23,3 điểm phần trăm, điều mà các nhà nghiên cứu cho là động lực chính giúp mô hình có khả năng thích ứng với các quy tắc mới.
Shieldstral hiện có sẵn dưới dạng mô hình mở (open-weight) theo giấy phép Apache 2.0.
Các quy tắc tùy chỉnh có thể hạn chế những sai lầm lọc nội dung tốn kém
Các bộ phân loại an toàn nằm ở hai phía của mô hình ngôn ngữ chính, sàng lọc các câu lệnh (prompt) trước khi xử lý và các phản hồi trước khi chúng đến tay người dùng. Người vận hành có thể cập nhật các quy tắc này mà không cần huấn luyện lại mô hình chính. Nhưng vì mọi yêu cầu đều đi qua bộ phân loại, nên kích thước, tốc độ và chi phí của nó sẽ tăng lên nhanh chóng.
Claude Fable 5 của Anthropic đã cho thấy các bộ lọc được tinh chỉnh kém có thể ảnh hưởng đến việc sử dụng thực tế như thế nào. Artificial Analysis phát hiện ra rằng hệ thống tự động chuyển hướng 8 đến 9 phần trăm các tác vụ sang một mô hình yếu hơn. Một nhà vật lý y tế cho biết Fable 5 không thể sử dụng được vì công việc của ông thường bao gồm từ "hạt nhân" (nuclear). Những người dùng khác báo cáo rằng hệ thống đã gắn cờ phân tích MRI là khủng bố sinh học.
Anthropic đã thắt chặt bộ lọc sau khi xác định được vấn đề an toàn và cho biết kể từ đó họ đã chặn các tác vụ lập trình vô hại thường xuyên hơn. Shieldstral mang lại cho người vận hành nhiều quyền kiểm soát hơn đối với sự đánh đổi đó. Họ có thể viết các tiêu chí sàng lọc tại thời điểm chạy và tùy chỉnh bộ lọc cho một ứng dụng cụ thể thay vì áp dụng các danh mục của người khác.
Các bộ phân loại này đang đóng vai trò ngày càng quan trọng trong toàn ngành. OpenAI sử dụng chúng để tự động phát hiện độ tuổi trong ChatGPT và chuyển hướng các yêu cầu cảm xúc thông qua bộ lọc an toàn đến các mô hình nghiêm ngặt hơn. Claude Code sử dụng bộ phân loại để chặn các tập lệnh bên ngoài, các triển khai sản xuất và các lệnh force push. Việc đánh giá Fable 5 của Anthropic cũng yêu cầu công ty phải lưu trữ đầu vào và đầu ra trong tối đa 30 ngày, hoặc tối đa hai năm sau khi vi phạm quy tắc.
Tin tức AI không cường điệu – Được tuyển chọn bởi con người
Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền về công nghệ tiên phong "AI Radar" sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền truy cập vào phần bình luận của chúng tôi.
Đăng ký ngay
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.