Mistral AI: News (Web)
85

Tin ngành

Mistral AI ra mắt Shieldstral: Giải pháp bảo mật và an toàn cho mô hình ngôn ngữ

(giờ Việt Nam)

Tóm tắt AI

Mistral AI chính thức giới thiệu Shieldstral, một công cụ chuyên biệt được thiết kế để tăng cường khả năng kiểm soát, lọc nội dung và đảm bảo an toàn cho các mô hình AI trong môi trường doanh nghiệp.

Bản dịch AI

Introducing Shieldstral. | Mistral AI

Tư duy

Tóm tắt

Shieldstral giới thiệu một bộ phân loại an toàn đa phương thức (multimodal safety classifier) với trọng số mở 3B, vượt trội hơn các mô hình lớn gấp 7 lần nhờ cách tiếp cận kiểm duyệt nội dung như một tác vụ hỏi đáp thích ứng theo chính sách. Khác với các mô hình guardrail truyền thống, nó chấp nhận các chính sách bằng ngôn ngữ tự nhiên tại thời điểm suy luận (inference time), hợp nhất việc đánh giá an toàn cho cả văn bản và hình ảnh mà không cần huấn luyện lại. Được phát hành theo giấy phép Apache 2.0, mô hình cung cấp các điểm số an toàn đã được hiệu chuẩn trên nhiều tiêu chuẩn đánh giá khác nhau trong khi vẫn vận hành hiệu quả trên một GPU NVIDIA 16GB duy nhất.

Một bộ phân loại an toàn đa phương thức 3B với trọng số mở, có khả năng thích ứng với chính sách, ngang bằng với các mô hình lớn gấp 7 lần về độ an toàn văn bản và thiết lập một tiêu chuẩn mới (state of the art) trong kiểm duyệt đa phương thức.

“Nội dung này có thúc đẩy bạo lực chống lại một nhóm đối tượng được bảo vệ không? Hình ảnh này có an toàn để hiển thị cho trẻ vị thành niên không? Trợ lý có từ chối yêu cầu này không?”

Mọi sản phẩm triển khai mô hình đều cần trả lời những câu hỏi như thế này — nhưng câu trả lời đúng phụ thuộc vào sản phẩm, đối tượng người dùng và ngữ cảnh cụ thể. Cùng một nội dung có thể phù hợp với công cụ nghiên cứu an ninh mạng nhưng lại gây hại trên nền tảng sức khỏe tâm thần. Hầu hết các mô hình guardrail đều tích hợp sẵn một hệ thống phân loại các danh mục gây hại cố định vào trọng số của chúng, vì vậy việc điều chỉnh chúng cho một bối cảnh triển khai mới đồng nghĩa với việc phải huấn luyện lại. Và vì định nghĩa về an toàn khác nhau giữa các ứng dụng và lĩnh vực, nên ngay từ đầu không hề có một bộ danh mục "đúng" duy nhất để mô hình hóa.

Shieldstral áp dụng một cách tiếp cận khác: bạn viết chính sách dưới dạng một câu hỏi bằng ngôn ngữ tự nhiên tại thời điểm suy luận, và mô hình sẽ trả về một điểm số an toàn đã được hiệu chuẩn. Không cần huấn luyện lại, một giao diện duy nhất cho cả văn bản và hình ảnh, và đưa ra quyết định chỉ từ một token. Vui lòng tham khảo báo cáo kỹ thuật của chúng tôi tại đây.

Là thành viên sáng lập của Open Secure AI Alliance cùng với NVIDIA và các tổ chức khác, hôm nay chúng tôi phát hành Shieldstral dưới dạng trọng số mở theo giấy phép Apache 2.0, có sẵn để tải xuống tại đây.

Kiểm duyệt dưới dạng một câu hỏi

Shieldstral định hình việc kiểm duyệt nội dung như một tác vụ hỏi đáp nhị phân. Mỗi yêu cầu có ba phần:

<Instruct> — ngữ cảnh đánh giá, mức độ nghiêm ngặt và (tùy chọn) định nghĩa về những gì được coi là nội dung không an toàn.

<Query> — một câu hỏi có/không đơn giản, ví dụ: "Nội dung này có thúc đẩy bạo lực thể chất không?"

<Document> — nội dung cần đánh giá: một prompt, một phản hồi, một cặp prompt–phản hồi, hoặc một hình ảnh kèm văn bản tùy chọn.

Tại thời điểm suy luận, mô hình chỉ đọc các logit có/không và chuẩn hóa softmax chúng thành một điểm số an toàn liên tục. Công thức đơn giản này thực hiện rất nhiều việc: nó hợp nhất phân loại prompt, kiểm duyệt phản hồi, phát hiện từ chối và phát hiện độc hại thành một vấn đề duy nhất; nó cho phép các chính sách nằm hoàn toàn trong prompt, vì vậy một checkpoint có thể thích ứng với các chính sách mới tại thời điểm triển khai.

Điểm nổi bật

Hiệu suất mạnh mẽ — ngang bằng hoặc vượt trội hơn các mô hình guard mở lớn gấp 7 lần về độ an toàn văn bản, phát hiện từ chối, khả năng thích ứng chính sách và các tiêu chuẩn đánh giá đa phương thức.

Thích ứng và linh hoạt — một giao diện ngôn ngữ tự nhiên duy nhất bao quát nội dung văn bản, hình ảnh và văn bản+hình ảnh trên các prompt, phản hồi và cặp prompt–phản hồi. Các chính sách được cung cấp dưới dạng truy vấn tự do và được điều chỉnh lại tại thời điểm suy luận mà không cần huấn luyện lại.

Nhỏ gọn, được huấn luyện trên các nguồn dữ liệu không đồng nhất — một mô hình 3B chạy trên một GPU 16GB duy nhất, được huấn luyện trên dữ liệu thực và dữ liệu tổng hợp với các định dạng nhãn và hệ thống phân loại đa dạng, được hợp nhất vào một khung duy nhất.

Điểm số an toàn liên tục — trả về xác suất có/không đã được hiệu chuẩn từ một lần truyền tiến (forward pass), vì vậy bạn có thể đặt ngưỡng hoặc xếp hạng theo độ tin cậy thay vì dựa vào một nhãn rời rạc.

Mở — trọng số theo giấy phép Apache 2.0.

Các tiêu chuẩn đánh giá

Chúng tôi đánh giá Shieldstral so với các mô hình guard mở lớn gấp 7 lần trên bốn trục. Tất cả các mẫu đánh giá đều được tách biệt khỏi quá trình huấn luyện.

Cách chúng tôi xây dựng

Ý tưởng cốt lõi là một mô hình nhỏ có thể đánh bại các mô hình lớn hơn nhiều nếu dữ liệu phù hợp. Việc chuẩn hóa dữ liệu đồng nghĩa với việc giải quyết bốn vấn đề:

Hợp nhất dữ liệu không đồng nhất. Các tập dữ liệu an toàn công khai thường không thống nhất về hệ thống phân loại, nhãn và quy ước chú thích — từ các cờ nhị phân an toàn/không an toàn đến các hệ thống phân loại đa nhãn chi tiết. Chúng tôi chuyển đổi mọi tập dữ liệu sang cùng một định dạng instruction–query–document với một bộ xử lý riêng cho từng tập dữ liệu, và chúng tôi thay đổi cách diễn đạt của các hướng dẫn, truy vấn và dấu phân cách prompt–phản hồi để mô hình tổng quát hóa theo cách diễn đạt thay vì bị quá khớp (overfitting) vào một phong cách duy nhất. Chúng tôi cũng hiệu chuẩn mức độ nghiêm ngặt cho từng nguồn — nghiêm ngặt đối với các cuộc tấn công jailbreak, nới lỏng đối với dữ liệu chất lượng phản hồi — để mô hình học được các ranh giới quyết định đã được hiệu chuẩn. Điều này cho phép chúng tôi hợp nhất các nguồn dữ liệu vốn không tương thích với nhau.

Dạy cách phân biệt, không phải ghi nhớ. Nếu được huấn luyện trên một tập hợp nhãn chính sách cố định, mô hình chỉ học cách phân loại các chính sách được xác định trước đó, thay vì suy luận về các ranh giới chính xác của một chính sách nhất định. Điều này ngăn cản khả năng tổng quát hóa sang các chính sách mới. Thay vào đó, chúng tôi xây dựng các tập hợp chính sách cố tình tương tự nhau, dễ gây nhầm lẫn và yêu cầu một LLM viết lại văn bản an toàn thành các cặp tương phản: mỗi bản viết lại được thiết kế để vi phạm một chính sách nhưng không vi phạm chính sách kia. Điều này huấn luyện mô hình phân biệt chính sách cụ thể nào mà một nội dung vi phạm, một kỹ năng có thể chuyển đổi sang các chính sách chưa từng thấy do người dùng định nghĩa tại thời điểm suy luận.

Căn cứ an toàn trong hình ảnh. Hình ảnh không an toàn không thể được tổng hợp bởi LLM như văn bản, vì vậy dữ liệu an toàn hình ảnh rất khan hiếm. Chúng tôi bổ sung các tập dữ liệu kiểm duyệt hạn chế bằng các tập dữ liệu hình ảnh mục đích chung như các ví dụ tiêu cực chất lượng cao, biến đổi các truy vấn để tăng cường tập dữ liệu, và lọc mọi cặp hình ảnh–truy vấn thông qua một bộ reranker thị giác–ngôn ngữ để giảm thiểu dữ liệu bị dán nhãn sai và ảo giác.

Kết hợp các checkpoint bổ trợ. Chúng tôi tinh chỉnh bằng LoRA và hợp nhất — thông qua SLERP — một checkpoint đã được hiệu chuẩn trên dữ liệu công khai, một checkpoint bổ sung khả năng phân biệt chính sách chi tiết từ dữ liệu được tạo ra, và mô hình instruct cơ sở. Việc hợp nhất giúp khôi phục khả năng hiệu chuẩn chính sách chung và khả năng thích ứng chính sách trong một mô hình duy nhất, đồng thời khả năng tuân thủ hướng dẫn từ mô hình cơ sở được chuyển sang tác vụ kiểm duyệt.

Forge. Chúng tôi đã xây dựng Shieldstral từ đầu đến cuối trên Forge, nền tảng của chúng tôi để huấn luyện, căn chỉnh và đánh giá các mô hình tùy chỉnh. Forge quản lý cơ sở hạ tầng, phân đoạn dữ liệu và mô hình, các chỉ số và ghi nhật ký trên nền tảng huấn luyện phân tán hiện đại, để đội ngũ có thể tập trung vào dữ liệu — yếu tố quyết định chất lượng của mô hình an toàn.

Tiếp theo là gì

Shieldstral là một bước tiến hướng tới việc kiểm duyệt thích ứng với ngữ cảnh thay vì ép buộc mọi sản phẩm phải tuân theo một hệ thống phân loại cố định. Chúng tôi đang tiếp tục đẩy mạnh phạm vi bao phủ đa ngôn ngữ, độ bền vững với các tài liệu dài hơn và an toàn đa phương thức rộng hơn — và chúng tôi rất mong chờ được thấy những gì cộng đồng sẽ xây dựng dựa trên nền tảng này.

Nhân tiện, chúng tôi đang tuyển dụng! Nếu bạn muốn giúp AI trở nên tốt hơn, hãy xem trang nghề nghiệp của chúng tôi.

Mistral AIBảo mật AIShieldstralAn toàn AIDoanh nghiệp
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Mistral AI: News (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.