跳到正文
北京时间
原文
Hugging Face:Blog(RSS)·· 2026-06-05精选AI 评分78

Nemotron 3.5 Content Safety:面向全球企业AI的可定制多模态安全

Nemotron 3.5 Content Safety: Customizable Multimodal Safety for Global Enterprise AI

AI 导读

Nemotron 3.5 Content Safety基于Gemma 3 4B IT,提供128K上下文窗口,支持用户提示、可选图像与助手响应的统一多模态安全评估。新增自定义策略执行,允许企业用自然语言定义专属安全规则;THINK模式可输出可审计的逐步推理痕迹。显式训练覆盖12种语言,并借助基座模型零样本泛化至约140种语言。输出提供低延迟二分类、带分类标签、THINK推理痕迹三种模式。安全分类遵循Aegis 2.0框架(13核心类别+10细分类别)。同步发布多模态、多语言安全数据集,可在8GB+ VRAM GPU上实时部署。

推荐理由

Nemotron 3.5 把内容安全从「单模态英文」拉到「多语言多模态可定制」,自定义策略和推理 trace 让企业能审计决策,做安全平台的值得细看。

正文 · AI 翻译

过去两年间,NVIDIA 的内容安全技术栈已从一个专注于英文文本的分类器,发展为一个由多个专用模型组成的家族——每一个都在将覆盖范围扩展到新的模态、语言和推理模式。Nemotron 3 Content Safety于 2026 年 3 月发布,首次在单个 4B 参数模型中融合了多模态与多语言能力。今天,我们发布 Nemotron 3.5 Content Safety,它完成了这一演进弧线:单个模型将多模态输入、多语言覆盖、自定义企业策略执行以及可审计推理统一到一次推理调用中。本文介绍 3.5 带来了哪些变化、每项新能力背后的设计决策,以及如何将该模型集成到生产安全流水线中。

Nemotron 3.5 Content Safety 的新特性

1. 统一的多模态评估

Nemotron 3 引入了图像理解;Nemotron 3.5 则深化了多模态集成。该模型将用户提示词、可选图像以及可选的助手回复作为单个上下文窗口接收,并针对组合输入给出连贯一致的安全判定。将三者一并评估——而非各自独立打分——填补了多模态安全场景中一个众所周知的缺口:那些仅在文本与图像之间、或请求与回复之间的交互中才浮现的策略违规,如今可在单次处理中被捕获。

2. 全球语言覆盖

Nemotron 3.5 保持了其前代模型的 12 种语言显式训练覆盖——英语、法语、西班牙语、德语、中文、日语、韩语、阿拉伯语、印地语、俄语、葡萄牙语和意大利语——同时还从 Gemma 3 基础模型继承了跨约 140 种语言的强大零样本泛化能力。这意味着在训练数据稀疏的市场(例如东南亚语言、斯堪的纳维亚语言、资源较少的非洲语言)中部署时,可以受益于基础模型的多语言迁移能力,而无需单独进行微调。

3. 自定义策略执行

这是 3.5 相对于 Nemotron 3 最重要的架构新增功能。生产环境部署很少在单一通用安全分类体系下运行。医疗平台的风险画像与金融服务聊天机器人、开发者工具 IDE 或儿童教育应用截然不同。Nemotron 3.5 在接收输入的同时接受自定义策略规范。模型在生成判定时会基于该策略进行推理,而非完全依赖内置分类体系。这将 Nemotron Content Safety Reasoning 4B 中首次引入的工作扩展到了完整的多模态、多语言场景。

4. 推理轨迹(THINK 模式)

Nemotron 3.5 中的每一条安全判定都可以通过可选的 think 模式附带可审计的推理轨迹。启用后,模型会在输出最终 safe / unsafe 标签以及(可选的)违规类别之前,先输出其逐步推理过程。

<think>
The user prompt asks for guidance on acquiring a controlled substance without a prescription.
The assistant response provides specific sourcing steps and references an online marketplace.
This interaction violates the Criminal Planning/Confessions and Controlled Substances categories.
The image (a pharmacy exterior) provides locational context but does not alter the verdict.
</think>

User Safety: unsafe
Response Safety: unsafe
Safety Categories: Criminal Planning/Confessions, Controlled Substances

当延迟是首要约束时,可以禁用 THINK 模式,回到 Nemotron 3 中提供的相同低延迟二元判定。

5. 安全数据集

借助 Nemotron 3.5,我们发布了我们的安全数据集。这是一个重要的里程碑,因为大多数 OSS 安全模型通常不提供训练集或评估集。这一问题在多模态领域更为严重,因为图像或视频等素材往往来自带有严格许可条款的资源。Nemotron 3.5 Content Safety Dataset 是多模态、多语言的,并包含用于训练该模型的安全推理轨迹。这些推理轨迹以两步方式生成,以使其简洁,类似于 Nemotron Content Safety Reasoning 4B 模型。


模型架构

Nemotron 3.5 Content Safety 基于 Google Gemma 3 4B IT(4B 参数)构建,提供 128K 上下文窗口、强大的视觉语言推理能力以及广泛的多语言覆盖。NVIDIA 通过 LoRA 适配器对该基础模型进行微调,从而安装有针对性的安全分类行为,同时使模型保持足够紧凑,可在 8GB+ VRAM 的 GPU 上实时部署。

推理接口支持三种输出模式:

模式 1 — 低延迟二元判定:

User Safety: safe
Response Safety: unsafe

模式 2 — 带类别的二元判定:

User Safety: safe
Response Safety: unsafe
Safety Categories: Violence, Criminal Planning/Confessions

模式 3 — THINK 模式(推理 + 判定):

<think>
[step-by-step reasoning trace]
</think>

User Safety: unsafe
Response Safety: unsafe
Safety Categories: [categories]

安全分类体系遵循 Aegis 2.0 框架:13 个核心类别与 MLCommons 安全分类体系对齐,外加 10 个细粒度子类别。这种对齐使得能够与在 Aegis 分类体系数据集上基准测试的其他开源和闭源防护系统进行直接比较。


推理

推理是内容安全分类的超级加速器,因为它提供了生产级 AI 系统所必需的上下文、定制化和可问责性,尤其是在企业和受监管环境中。

支持自定义和上下文相关的策略执行

推理使内容安全模型能够在推理时动态解释并执行以自然语言定义的自定义、领域特定策略。这是必要的,因为生产部署很少在单一通用的安全分类体系下运行。金融服务聊天机器人的风险画像与儿童教育应用不同,后者对脏话的容忍度可能更低。这一能力支持:

  • 类别抑制: 禁用不相关的类别,例如当 DevOps 工具处理“终止进程”这一短语时,防止触发“暴力”类别。
  • 自定义类别注入: 定义特定于组织监管或产品政策的专有风险类别。

提供可审计且有据可查的理由

推理轨迹展示了模型在给出最终安全或不安全判定之前逐步展开的逻辑。这种有据可查的理由服务于多个目的:

  • 合规与审计日志: 受监管行业通常要求对内容审核决策提供有据可查的理由。
  • 人工审核: 审核人员可以审查为何得出某一判定,以识别系统性的模型错误。
  • 策略迭代: 这些轨迹揭示了模型如何解读边缘案例,使团队能够迭代地完善和改进自定义策略语言。

延迟

虽然推理会引入延迟,但 Nemotron 模型通过将推理链压缩为简洁摘要来解决这一问题,从而限制输出 token 数量并提升效率。这一过程采用两步流程,与前代模型 Nemotron-Content-Safety-Reasoning-4B 中的做法类似。第一步,我们使用更大、更强的模型(如 Qwen 397B),基于所提供的提示词、图像和回复生成思维链推理轨迹。我们还提供了样本的真实标签,以避免任何误分类混入推理轨迹。第二步,我们使用另一个大模型(如 Qwen 80B)使这些推理轨迹更加简洁。我们明确指示该模型对(来自第一步的)原始轨迹进行改写,使其不超过 3 句话。根据我们的实验,大多数生成的推理轨迹都在 3 句话以内。

高效的推理轨迹优化实现了低延迟的自定义策略执行。此外,推理轨迹提供了有价值的训练信号,可用于训练专门的审核模型。开发者可以选择双模式运行:在通用任务中禁用推理以实现最低延迟,或在复杂策略中启用推理。


训练数据

驱动 Nemotron 3.5 的数据集是在 Nemotron 3 所用多模态、多语言混合数据基础上的演进版本,新增了针对推理和自定义策略能力的数据。我们使用了以下数据来源:

  • 多语言文本安全数据来自Nemotron Safety Guard Dataset v3,从具有文化细微差异的子集中采样,并在各安全类别以及安全/不安全划分之间按比例分布。
  • 人工标注的多模态数据由 NVIDIA 以英语收集,并翻译成 12 种语言。至关重要的是,99% 的训练图像是真实照片——而非合成生成。这直接针对了多模态安全基准领域一个已知的弱点,即 VLGuard 和 MM-SafetyBench 等现有数据集严重依赖 SDXL 生成的图像,这些图像缺乏生产内容所具有的文化质感和对抗复杂性。尽管由于许可限制,并非所有这些真实图像都能发布,但我们仍能发布来自 Wikimedia 和合成生成的一部分图像。
  • 安全多模态数据来自Nemotron VLM Dataset v2,涵盖扫描文档、图表、论文和示意图及其相关查询——确保模型不会对良性的专业内容过度标记。
  • 推理轨迹源自更大的教师模型——Qwen 397B——生成的链式推理输出,随后使用 Qwen 80B 进行缩短,用于教会模型如何进行推理。
  • 主题遵循数据来自CantTalkAboutThis数据集,由一系列企业部署场景(医疗、金融、银行、教育等)中的策略规范/裁决配对组成。
  • 合成数据约占总训练量的 10%,主要用于丰富越狱模式的多样性、生成罕见的策略违规示例,以及产出多模态对抗样本。

基准测试

Nemotron 3.5 Content Safety 在多语言、多模态以及自定义策略安全基准上进行了评估,包括 VLGuard、MM-SafetyBench、PolyGuard、RTP-LX、Aya Redteaming、XSafety、MultiJail、Aegis、Dynaguardrail 和 CoSA。这些评估反映了企业安全的核心生产挑战:在全球多种语言、文本与图像输入以及特定领域策略之间应用一致的护栏,同时不显著增加延迟。

Nemotron 3 在多模态有害内容测试中取得了 84% 的平均准确率,树立了强有力的基线,且延迟约为 LlamaGuard-4-12B 的一半。Nemotron 3.5 在保持 4B 紧凑高效的同时,新增了自定义策略支持和推理轨迹。

在多语言和多模态安全基准上,Nemotron 3.5 在保持紧凑体积的同时,实现了强大的有害内容分类准确率。这一点很重要,因为许多安全模型仍然以英语优先、仅支持文本,或者在生产流水线中反复运行的代价过高。Nemotron 3.5 旨在将多语言覆盖、多模态分类、自定义策略支持和低延迟部署集于一个模型之中。

图 1. Nemotron 3.5 Content Safety 在多语言与多模态安全基准上均实现了出色的有害内容分类准确率,在整套评测基准上平均约为 85%。

语言层面的结果凸显了多语言安全为何对全球企业级 AI 至关重要。在 Multilingual Aegis 上,Nemotron 3.5 在 12 种语言上的有害内容分类准确率平均达到 96.5%。在 RTP-LX 上,平均为 88.8%,Aegis 与 RTP-LX 的综合平均为 92.7%。这种一致性有助于团队在面向客户、员工和合作伙伴的工作流中采用统一的安全策略,而不必依赖仅支持英文的审核或各自独立的区域安全模型。

Image 16: figure2图 2. Nemotron 3.5 Content Safety 在 Multilingual Aegis Cultural + Adapted(提示词分类)(harmful-f1)上,跨 12 种语言的有害内容分类准确率平均为 97%。

Image 17: figure3图 3. Nemotron 3.5 Content Safety 在 RTPLX(提示词分类)(harmful-f1)上,跨 12 种语言的有害内容分类准确率平均为 89%。

对于生产环境的护栏而言,仅有准确率还不够。安全模型还必须足够高效,能够在内容被处理、返回或路由到下游之前运行。Nemotron 3.5 Content Safety 紧凑的 4B 设计有助于降低反复进行安全检查的成本与延迟,使多语言和多模态护栏在真实 AI 应用中切实可行。

延迟

延迟特征与 Nemotron 3 在默认(无 THINK)模式下保持一致。THINK 模式会增加与推理轨迹长度成正比的推理时间,但这种开销是可预测的,可以与同步审核循环分开预算——例如,将 THINK 模式评估作为审计流水线的一部分异步运行,而由默认模式处理实时决策。

Image 18: figure4图 4. 在一个多模态基准测试上,Nemotron 3.5 Content Safety 相比另一个多模态安全模型实现了 3 倍更低的端到端延迟。

与另一个推理安全模型相比,我们的模型在启用推理时生成的 token 最多减少 50%,使其在成本和延迟方面都很高效。


填补基准测试空白

多模态安全研究中反复出现的一个主题是现有评估基础设施中的空白。Nemotron 3.5 的开发过程中遇到了与更广泛文献中所记录的相同的空白:

  • 纯文本覆盖:被引用最广泛的安全基准测试(WildGuard、XSTest、HarmBench)都是纯文本的。多模态性能无法从文本基准测试结果中推断出来。
  • 合成图像质量:现有的大多数多模态基准测试使用的是 AI 生成的图像(通常是 SDXL),而非真实照片,从而低估了真实生产内容的难度。
  • 真实图像授权:图库照片授权禁止在 AI 数据集中再分发,这在研究条件与生产条件之间造成了结构性缺口。

NVIDIA 的多模态训练数据——包含真实图像和具有文化细微差别的多语言提示词——旨在为模型训练填补其中部分缺口。评估方面的基准缺口仍是更广泛安全研究社区面临的一个未解难题。

快速上手

Nemotron 3.5 Content Safety 已在 Hugging Face 上依据 NVIDIA Open Model License 提供,可用于研究和商业用途,同时一并提供训练数据集。它支持 transformers、vLLM 和 SGLang,并作为生产级 NVIDIA NIM 在 build.nvidia.com 上提供,面向需要预打包、GPU 优化推理微服务的团队。

开发者还可以通过推理平台访问该模型,包括 Baseten、Eigen AI、DeepInfra、OpenRouter 和 Vultr。

对于自定义策略工作流,NVIDIA 提供了一个兼容 Claude 和 Codex 的技能,用于生成自定义策略,以及展示如何使用该模型的cookbook。自定义策略和推理轨迹可帮助团队将安全行为适配到特定领域的规则,同时保持决策可审计。

来源:Hugging Face:Blog(RSS) · huggingface.co