跳到正文
北京时间
原文
Apple Machine Learning Research(RSS)·· 2026-07-07精选AI 评分74

苹果研究:单个神经元即可绕过大型语言模型的安全对齐

A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models

AI 导读

苹果研究人员发现,安全对齐由两类神经元调控:拒绝神经元控制有害知识是否表达,概念神经元编码有害知识本身。在七个模型(1.7B至70B参数)中,仅需抑制单个拒绝神经元即可绕过安全对齐,回答有害请求;或放大单个概念神经元,从无害提示诱导出有害内容。整个过程无需训练或提示工程。结果表明安全对齐由个别神经元因果控制。

推荐理由

苹果发现单个神经元足以绕过大模型安全对齐,在7个模型上验证了攻击,说明安全机制并非稳健分布,做安全攻防的必读。

正文 · AI 翻译

语言模型中的安全对齐通过两个机制上截然不同的系统运作:拒绝神经元负责控制有害知识是否被表达,概念神经元则负责编码有害知识本身。通过靶向每个系统中的一个单一神经元,我们展示了失效的两个方向——通过抑制绕过对明确有害请求的安全防护,以及通过放大从无害提示词中诱导出有害内容——覆盖两个模型家族、参数量从 1.7B 到 70B 的七个模型,且无需任何训练或提示词工程。我们的发现表明,安全对齐并非稳健地分布于模型权重之中,而是由单个神经元所介导,每一个神经元都足以因果性地控制拒绝行为——抑制所识别出的任一拒绝神经元,即可在多样化的有害请求上绕过安全对齐。

  • ‡ 同等贡献
  • † 马里兰大学学院市分校
  • ** 在 Apple 期间完成的工作

来源:Apple Machine Learning Research(RSS) · machinelearning.apple.com