IT Home
85

Mô hình

Mistral ra mắt Shieldstral: Mô hình kiểm duyệt nội dung đa phương thức, chạy mượt trên GPU 16GB

(giờ Việt Nam)

Tóm tắt AI

Mistral AI vừa phát hành Shieldstral, mô hình kiểm duyệt nội dung 3 tỷ tham số với giấy phép Apache 2.0. Mô hình hỗ trợ 12 ngôn ngữ và tối ưu hóa để vận hành hiệu quả trên các GPU phổ thông có dung lượng 16GB.

Bản dịch AI

Theo tin từ IT ngày 5 tháng 8, Mistral AI đã đưa ra thông báo vào ngày hôm qua (4 tháng 8) về việc ra mắt mô hình AI kiểm duyệt nội dung Shieldstral. Mô hình này có tổng cộng 3B (3 tỷ) tham số, sử dụng trọng số mở và được phát hành theo giấy phép Apache 2.0.

Mô hình hiện đã có mặt trên nền tảng Hugging Face, hỗ trợ 12 ngôn ngữ và có thể chạy trên một GPU 16GB duy nhất. Mistral cho biết về khía cạnh an toàn nội dung, hiệu suất của mô hình này sánh ngang với các mô hình mở có quy mô lớn gấp 7 lần, đồng thời đạt được SOTA trong lĩnh vực kiểm duyệt nội dung đa phương thức.

Ghi chú của IT: SOTA là viết tắt của state-of-the-art, dùng để chỉ tập hợp các mô hình hoặc thuật toán có hiệu suất tốt nhất và trình độ tiên tiến nhất trong các tác vụ trí tuệ nhân tạo hoặc các bài kiểm tra chuẩn cụ thể; nó sẽ liên tục thay đổi theo sự lặp lại của công nghệ và các nghiên cứu mới được công bố.

Mistral chỉ ra rằng, hầu hết các mô hình bảo vệ đều cố định hệ thống phân loại tác hại vào trọng số của mô hình. Khi thay đổi kịch bản sử dụng sản phẩm, các nhà phát triển thường phải huấn luyện lại mô hình.

Ngược lại, Shieldstral đưa chính sách kiểm duyệt vào nội dung đầu vào: người vận hành có thể viết một câu hỏi "có hoặc không", sau đó cung cấp kịch bản đánh giá và hướng dẫn về mức độ nghiêm ngặt, mô hình sau đó sẽ tạo ra điểm số an toàn đã được hiệu chỉnh từ một token đầu ra duy nhất.

Mô hình chuyển đổi mỗi tác vụ kiểm duyệt thành một câu hỏi nhị phân, đầu vào bao gồm 3 trường có gắn nhãn:

<Instruct>: Mô tả kịch bản đánh giá và mức độ nghiêm ngặt.

<Query>: Đặt một câu hỏi "có hoặc không", ví dụ: "Nội dung này có tuyên truyền bạo lực thể xác hay không?"

<Document>: Cung cấp nội dung cần kiểm duyệt, có thể là câu lệnh (prompt), câu trả lời, sự kết hợp giữa câu lệnh và câu trả lời, hoặc hình ảnh kèm theo văn bản tùy chọn.

Khi suy luận, mô hình chỉ đọc giá trị logic của hai token "có" và "không", sau đó chuẩn hóa thông qua softmax thành điểm số liên tục và đưa ra phán đoán nhị phân với ngưỡng 0.5. Cơ chế này có thể bao quát việc phân loại câu lệnh, kiểm duyệt câu trả lời, phát hiện từ chối trả lời và phát hiện nội dung độc hại.

MistralShieldstralKiểm duyệt nội dungAI nguồn mởĐa phương thức
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.