面向AI模型双重用途知识的“开关”:Anthropic与AE Studio提出GRAM方法
An off switch for dual use knowledge in AI models
Anthropic与AE Studio联合提出梯度路由辅助模块(GRAM)方法,通过在Transformer每层添加可移除的神经元模块,使模型在训练时将病毒学、网络安全、核物理、专业编程语言等双重用途知识仅路由到对应模块,而非扩散至全局。训练后删除模块即可消除该能力,保留则供可信部署使用。实验在合成数据、真实数据及50M到5B参数模型上测试,GRAM效果与数据过滤相当,移除模块不降低通用性能,且比事后“遗忘”技术更难恢复。该研究为平衡双重用途知识的安全访问与有益使用提供了更鲁棒的方案。
这是Anthropic在模型安全对齐上的一个新尝试,提出可拆卸模块来精细控制有毒知识,同时保留一般性能。方法还未上Claude,但实验结果表明这条路可能比简单的拒绝训练更鲁棒。
本文介绍了由 AE Studio 与 Anthropic 合作开展的一项研究。
前沿 AI 模型,除其他属性外,还是一个庞大的知识库。其中一些知识属于两用知识,意味着它既可以用于善途,也可以用于恶途。例如,网络安全知识既可以帮助修补关键安全漏洞,也可以被用来利用这些漏洞。病毒学知识可以帮助研究人员研制疫苗,但也能帮助恶意行为者设计致命的病原体。理想情况下,我们应当能够平衡三个各自独立的目标:第一,以尽可能精准的方式限制对两用能力的访问;第二,允许可信用户为有益目的访问这些相同的能力;第三,在实现以上两点的同时,不影响模型在任何其他任务上的表现。
当前的防护措施并不完善。我们训练模型拒绝有害请求,并使用分类器筛查输入和输出中的危险内容。这些防护层可以防范危险的输出——但它们并不会改变底层模型中所存储的知识。尽管有这些防护措施,一个足够坚定的攻击者仍可能尝试越狱模型,绕过其防御机制来获取两用知识。
更稳健的防滥用保护措施是控制模型所掌握的知识。我们此前已经探索过这一方向:在早期工作中,我们从预训练数据中过滤掉了有关化学、生物、放射性及核武器的信息,随后又证明两用知识可以被限制在模型权重中一个可移除的切片内。但过滤是一种粗暴的手段。它产出的模型只具备一套固定的能力。使用过滤方法,如果你想要一个能够讨论高级病毒学的模型版本——比如部署在经过审核的生物安全实验室中——以及另一个不能讨论该话题的版本,你就必须训练两个独立的模型。尤其对于前沿模型(体量大且训练成本极高)而言,开发者的成本将高得难以承受。
在与 AE Studio 的合作者共同开展的新研究中,我们探索了一种新方法,它有望在只训练一个模型的前提下,获得训练多个分别过滤的模型所带来的好处。我们将其称为 GRAM,即梯度路由辅助模块(Gradient-Routed Auxiliary Modules)。请注意,这里展示的实验结果尚属初步——GRAM 尚未应用于 Anthropic 的任何生产模型,我们也不确定它将来是否会被采用。
GRAM 的工作原理
GRAM 的核心思路是为模型的每一类两用知识提供专属的、可移除的隔间,并且在从两用数据中学习时只更新这些隔间。
具体来说,GRAM 会向标准 Transformer(大语言模型所基于的神经网络架构)的每一层添加额外的神经元。这些神经元被划分为若干组(或称“模块”),每个两用类别对应一个模块。在训练过程中,当模型遇到通用文本时,它按常规方式学习。但当它遇到来自某一两用类别(例如病毒学)的文本时,规则就变了:模型可以使用其通用知识来做出预测,但只有病毒学模块被允许从该文本中学习。通用目的的权重会被暂时冻结。1
其结果是,病毒学知识会积累在病毒学模块中,而不是扩散到整个网络。训练完成后,只需删除该模块,相关能力也随之消失。或者,在需要病毒学知识的可信部署场景中,也可以将其保留在原位。这些知识可以非常精准地针对所需部署类型进行定制:在我们的实验中,我们定义了四个两用类别,因此一次 GRAM 训练就能得到一个可以按 16 种不同方式配置的模型(四个类别各自“开启”或“关闭”)。
测试 GRAM
我们在三种真实度递增的场景中测试了 GRAM。
首先,在一个按主题标注的儿童故事合成数据集上,一个小型 GRAM 模型可以被重新配置以“遗忘”任何选定的主题,而每种配置的表现几乎与单独训练的、过滤掉该主题的模型完全相同。也就是说,我们以训练单个模型的成本,取得了通常需要在不同数据集上进行多次训练才能得到的结果。
其次,我们在一个由网络文本、代码和科学论文构成的真实混合数据集上训练了一个更大的模型,其中包含四个两用领域:病毒学、网络安全、核物理,以及一门小众编程语言(作为专门化两用代码的替代)。每个两用领域对应的能力被路由到各自的模块。删除一个模块消除相应能力的效果,几乎等同于从未在该数据上训练过。值得注意的是,我们发现这种删除并未降低整体性能。
我们还测试了攻击者能否通过在一小部分恶意数据上训练来恢复被移除的知识;GRAM 对此的抵抗能力与数据过滤大致相当。相比之下,训练后应用的“遗忘”技术只是抑制了知识——只需少量微调就能轻易恢复。
第三,我们在从 5000 万到 50 亿参数的七种模型规模上进行了实验。GRAM 在每一种规模上都达到了与数据过滤相当的性能,而且随着模型变大,“模块开启”与“模块关闭”之间的差距越来越大。就计算成本而言,随着我们扩大规模,试图绕过我们保护措施变得相对更加困难和昂贵。
结论
随着 AI 公司训练出能力更强的模型,限制双重用途能力获取的需求将会增加。如今,公司通过分类器和拒绝训练来限制访问。然而,这些防护措施很难在不降低对无害请求表现的情况下做到稳健。像 GRAM 这样的方法为更稳健的访问控制提供了一条潜在路径。
这是一项早期研究,存在明显的局限性。我们尚未在前沿规模或生产训练流程中测试 GRAM。(如上所述,它尚未应用于我们的任何 Claude 模型。)我们的评估以下一 token 预测能力来衡量性能,而非在真实下游任务上的表现。此外,还有一个更深层的未解问题,适用于数据过滤和像 GRAM 这样的方法:某些双重用途能力可能与通用知识纠缠得如此之深,以至于没有任何方法能够将它们干净地分离。
有关我们实验的更多细节,请阅读我们 Alignment Science 博客上的文章。
脚注
1. 一个技术细节是,病毒学模块有时在从通用文本中学习时也会被开启。我们发现这有助于各模块更有效地“协同工作”。
加拿大如何使用 Claude:Anthropic 经济指数发现
Claude 在不同模型和语言中的价值观
来源:Anthropic:Research(发表成果 · 网页) · anthropic.com