Mô hình
NVIDIA ra mắt Nemotron 3.5 Content Safety: Giải pháp bảo mật đa phương thức cho doanh nghiệp
(giờ Việt Nam)
Tóm tắt AI
NVIDIA giới thiệu Nemotron 3.5 Content Safety, mô hình chuyên dụng giúp doanh nghiệp kiểm soát nội dung an toàn và tùy chỉnh cho các ứng dụng AI đa phương thức trên quy mô toàn cầu.
Bản dịch AI
Quay lại các bài viết
Hai năm qua đã chứng kiến sự phát triển của hệ thống an toàn nội dung (content safety stack) của NVIDIA, từ một bộ phân loại văn bản tiếng Anh chuyên biệt thành một dòng các mô hình chuyên dụng—mỗi mô hình đều mở rộng phạm vi bao phủ sang các phương thức (modalities), ngôn ngữ và chế độ suy luận mới. Nemotron 3 Content Safety, được phát hành vào tháng 3 năm 2026, lần đầu tiên kết hợp các khả năng đa phương thức (multimodal) và đa ngôn ngữ (multilingual) trong một mô hình duy nhất với 4 tỷ tham số. Hôm nay, chúng tôi ra mắt Nemotron 3.5 Content Safety, hoàn thiện lộ trình đó: một mô hình duy nhất hợp nhất đầu vào đa phương thức, phạm vi đa ngôn ngữ, thực thi chính sách doanh nghiệp tùy chỉnh và khả năng suy luận có thể kiểm chứng vào một lệnh gọi suy luận (inference call) duy nhất.
Bài viết này đề cập đến những thay đổi trong phiên bản 3.5, các quyết định thiết kế đằng sau mỗi khả năng mới và cách tích hợp mô hình vào các quy trình an toàn trong môi trường thực tế (production pipelines).
Có gì mới trong Nemotron 3.5 Content Safety
1. Đánh giá đa phương thức hợp nhất
Nemotron 3 đã giới thiệu khả năng hiểu hình ảnh; Nemotron 3.5 làm sâu sắc thêm sự tích hợp đa phương thức này. Mô hình nhận một câu lệnh (prompt) từ người dùng, một hình ảnh tùy chọn và một phản hồi tùy chọn từ trợ lý dưới dạng một cửa sổ ngữ cảnh duy nhất, sau đó đưa ra phán quyết an toàn nhất quán trên dữ liệu đầu vào kết hợp. Việc đánh giá cả ba yếu tố cùng lúc—thay vì chấm điểm độc lập từng phần—giúp giải quyết một lỗ hổng đã biết trong các kịch bản an toàn đa phương thức: các vi phạm chính sách chỉ xuất hiện từ sự tương tác giữa văn bản và hình ảnh, hoặc giữa yêu cầu và phản hồi, giờ đây sẽ được phát hiện trong một lần xử lý duy nhất.
2. Phạm vi ngôn ngữ toàn cầu
Nemotron 3.5 duy trì phạm vi đào tạo rõ ràng cho 12 ngôn ngữ của các phiên bản tiền nhiệm—tiếng Anh, Pháp, Tây Ban Nha, Đức, Trung Quốc, Nhật Bản, Hàn Quốc, Ả Rập, Hindi, Nga, Bồ Đào Nha và Ý—đồng thời kế thừa khả năng tổng quát hóa zero-shot mạnh mẽ trên khoảng 140 ngôn ngữ từ mô hình cơ sở Gemma 3. Điều này có nghĩa là việc triển khai tại các thị trường có dữ liệu đào tạo hạn chế (ví dụ: các ngôn ngữ Đông Nam Á, ngôn ngữ Scandinavia, các ngôn ngữ châu Phi ít tài nguyên) sẽ được hưởng lợi từ khả năng chuyển đổi đa ngôn ngữ của mô hình cơ sở mà không cần tinh chỉnh (fine-tuning) riêng biệt.
3. Thực thi chính sách tùy chỉnh
Đây là bổ sung kiến trúc quan trọng nhất trong phiên bản 3.5 so với Nemotron 3. Các triển khai thực tế hiếm khi hoạt động dưới một hệ thống phân loại an toàn (safety taxonomy) chung duy nhất. Một nền tảng chăm sóc sức khỏe có hồ sơ rủi ro khác với chatbot dịch vụ tài chính, IDE công cụ lập trình hay ứng dụng giáo dục trẻ em. Nemotron 3.5 chấp nhận một đặc tả chính sách tùy chỉnh đi kèm với đầu vào. Mô hình sẽ suy luận dựa trên chính sách đó khi đưa ra phán quyết thay vì hoàn toàn phụ thuộc vào hệ thống phân loại có sẵn. Điều này mở rộng công việc được giới thiệu lần đầu trong Nemotron Content Safety Reasoning 4B sang môi trường đa phương thức và đa ngôn ngữ đầy đủ.
4. Các bước suy luận (Chế độ THINK)
Mọi phán quyết an toàn trong Nemotron 3.5 đều có thể đi kèm với một dấu vết suy luận (reasoning trace) có thể kiểm chứng thông qua chế độ "think" tùy chọn. Khi được kích hoạt, mô hình sẽ xuất ra các bước suy luận từng bước trước khi đưa ra nhãn cuối cùng là an toàn/không an toàn và tùy chọn các danh mục bị vi phạm.
Khi độ trễ là yếu tố hạn chế chính, chế độ THINK có thể bị vô hiệu hóa để quay lại phán quyết nhị phân có độ trễ thấp tương tự như trên Nemotron 3.
5. Tập dữ liệu an toàn
Cùng với Nemotron 3.5, chúng tôi phát hành tập dữ liệu an toàn của mình. Đây là một cột mốc quan trọng vì hầu hết các mô hình an toàn mã nguồn mở (OSS) thường không cung cấp các tập dữ liệu đào tạo hoặc đánh giá. Vấn đề này càng nghiêm trọng hơn trong không gian đa phương thức, nơi các tài nguyên như hình ảnh hoặc video thường có các điều khoản cấp phép hạn chế. Tập dữ liệu Nemotron 3.5 Content Safety là tập dữ liệu đa phương thức, đa ngôn ngữ và bao gồm các dấu vết suy luận an toàn đã được sử dụng để đào tạo mô hình. Các dấu vết suy luận này được tạo ra theo quy trình 2 bước để đảm bảo tính súc tích, tương tự như mô hình Nemotron Content Safety Reasoning 4B.
Kiến trúc mô hình
Nemotron 3.5 Content Safety được xây dựng trên Google Gemma 3 4B IT (4 tỷ tham số), cung cấp cửa sổ ngữ cảnh 128K, khả năng suy luận ngôn ngữ-hình ảnh mạnh mẽ và phạm vi đa ngôn ngữ rộng lớn. NVIDIA tinh chỉnh mô hình cơ sở này bằng một bộ chuyển đổi LoRA, giúp thiết lập hành vi phân loại an toàn mục tiêu trong khi vẫn giữ cho mô hình đủ gọn nhẹ để triển khai thời gian thực trên các GPU có VRAM từ 8GB trở lên.
Giao diện suy luận hỗ trợ ba chế độ đầu ra:
Chế độ 1 — Phán quyết nhị phân độ trễ thấp:
Chế độ 2 — Phán quyết nhị phân kèm danh mục:
Chế độ 3 — Chế độ THINK (suy luận + phán quyết):
Hệ thống phân loại an toàn tuân theo khung Aegis 2.0: 13 danh mục cốt lõi phù hợp với hệ thống phân loại an toàn của MLCommons, cộng với 10 danh mục phụ chi tiết. Sự đồng bộ này cho phép so sánh trực tiếp với các hệ thống bảo vệ (guard systems) mở và đóng khác đã được kiểm chuẩn trên các tập dữ liệu theo phân loại Aegis.
Suy luận
Suy luận là một "bộ tăng áp" cho việc phân loại an toàn nội dung vì nó cung cấp ngữ cảnh, khả năng tùy chỉnh và tính giải trình cần thiết cho các hệ thống AI thực tế, đặc biệt là trong môi trường doanh nghiệp và các môi trường được quản lý chặt chẽ.
Cho phép thực thi chính sách tùy chỉnh và theo ngữ cảnh
Suy luận cho phép mô hình an toàn nội dung diễn giải và thực thi linh hoạt các chính sách tùy chỉnh, đặc thù theo lĩnh vực được định nghĩa bằng ngôn ngữ tự nhiên tại thời điểm suy luận. Điều này là cần thiết vì các triển khai thực tế hiếm khi hoạt động dưới một hệ thống phân loại an toàn chung duy nhất. Một chatbot dịch vụ tài chính có hồ sơ rủi ro khác với một ứng dụng giáo dục trẻ em vốn có thể có mức độ chấp nhận thấp hơn đối với ngôn từ thô tục. Khả năng này hỗ trợ:
Cung cấp sự biện minh có thể kiểm chứng và được ghi lại
Các dấu vết suy luận hiển thị logic từng bước của mô hình trước khi đưa ra phán quyết cuối cùng là an toàn hay không an toàn. Sự biện minh được ghi lại này phục vụ một số mục đích:
Độ trễ
Mặc dù suy luận có thể làm tăng độ trễ, mô hình Nemotron giải quyết vấn đề này bằng cách cô đọng các chuỗi suy luận thành các bản tóm tắt súc tích để giới hạn số lượng token đầu ra và tăng hiệu quả. Điều này được thực hiện thông qua quy trình 2 bước tương tự như mô hình tiền nhiệm Nemotron-Content-Safety-Reasoning-4B. Trong bước đầu tiên, chúng tôi sử dụng các mô hình lớn hơn, mạnh mẽ hơn như Qwen 397B để tạo ra các dấu vết suy luận theo chuỗi tư duy (chain-of-thought) dựa trên các câu lệnh, hình ảnh và phản hồi được cung cấp. Chúng tôi cũng cung cấp các nhãn đúng (ground-truth labels) của các mẫu để tránh bất kỳ sự phân loại sai nào có thể lọt vào các dấu vết suy luận. Ở bước 2, chúng tôi làm cho các dấu vết suy luận này súc tích hơn bằng cách sử dụng một mô hình lớn khác như Qwen 80B. Chúng tôi hướng dẫn cụ thể mô hình này diễn đạt lại các dấu vết gốc (từ bước 1) sao cho không quá 3 câu. Dựa trên các thử nghiệm của chúng tôi, hầu hết các dấu vết suy luận được tạo ra đều dưới 3 câu.
Việc tối ưu hóa các dấu vết suy luận hiệu quả cho phép thực thi chính sách tùy chỉnh với độ trễ thấp. Hơn nữa, các dấu vết suy luận cung cấp một tín hiệu đào tạo có giá trị có thể được sử dụng để đào tạo các mô hình kiểm duyệt chuyên biệt. Các nhà phát triển có thể chọn vận hành chế độ kép: vô hiệu hóa suy luận để đạt độ trễ tối thiểu trong các tác vụ chung hoặc kích hoạt nó cho các chính sách phức tạp.
Dữ liệu đào tạo
Tập dữ liệu thúc đẩy Nemotron 3.5 là sự phát triển của các hỗn hợp đa phương thức, đa ngôn ngữ được sử dụng cho Nemotron 3, với các bổ sung nhắm vào khả năng suy luận và chính sách tùy chỉnh. Chúng tôi đã sử dụng các nguồn dữ liệu sau:
Kiểm chuẩn (Benchmarking)
Nemotron 3.5 Content Safety đã được đánh giá trên các tiêu chuẩn an toàn đa ngôn ngữ, đa phương thức và chính sách tùy chỉnh, bao gồm VLGuard, MM-SafetyBench, PolyGuard, RTP-LX, Aya Redteaming, XSafety, MultiJail, Aegis, Dynaguardrail và CoSA. Những đánh giá này phản ánh thách thức cốt lõi trong sản xuất đối với an toàn doanh nghiệp: áp dụng các rào chắn (guardrails) nhất quán trên các ngôn ngữ toàn cầu, đầu vào văn bản và hình ảnh, cũng như các chính sách đặc thù theo lĩnh vực mà không làm tăng đáng kể độ trễ.
Nemotron 3 đã thiết lập một nền tảng vững chắc với độ chính xác trung bình 84% trong các bài kiểm tra nội dung độc hại đa phương thức và độ trễ chỉ bằng khoảng một nửa so với LlamaGuard-4-12B. Nemotron 3.5 duy trì hiệu suất 4B nhỏ gọn đó trong khi bổ sung hỗ trợ chính sách tùy chỉnh và các dấu vết suy luận.
Trên các tiêu chuẩn an toàn đa ngôn ngữ và đa phương thức, Nemotron 3.5 mang lại độ chính xác phân loại nội dung độc hại mạnh mẽ trong khi vẫn duy trì cấu trúc nhỏ gọn. Điều này rất quan trọng vì nhiều mô hình an toàn vẫn ưu tiên tiếng Anh, chỉ xử lý văn bản hoặc quá tốn kém để chạy lặp đi lặp lại trong các quy trình sản xuất. Nemotron 3.5 được thiết kế để kết hợp phạm vi đa ngôn ngữ, phân loại đa phương thức, hỗ trợ chính sách tùy chỉnh và triển khai độ trễ thấp trong một mô hình duy nhất.

Hình 1. Nemotron 3.5 Content Safety mang lại độ chính xác phân loại nội dung độc hại mạnh mẽ trên các tiêu chuẩn an toàn đa ngôn ngữ và đa phương thức, đạt trung bình khoảng 85% trên tập hợp các tiêu chuẩn được đánh giá.
Kết quả ở cấp độ ngôn ngữ làm nổi bật lý do tại sao an toàn đa ngôn ngữ lại quan trọng đối với AI doanh nghiệp toàn cầu. Trên Multilingual Aegis, Nemotron 3.5 đạt độ chính xác phân loại nội dung độc hại trung bình 96,5% trên 12 ngôn ngữ. Trên RTP-LX, con số này là 88,8%, với mức trung bình kết hợp của Aegis và RTP-LX là 92,7%. Sự nhất quán này giúp các nhóm áp dụng cùng một tư thế an toàn trên các quy trình làm việc hướng tới khách hàng, nhân viên và đối tác thay vì chỉ dựa vào kiểm duyệt tiếng Anh hoặc các mô hình an toàn khu vực riêng biệt.
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face: Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.