Apple Machine Learning Research(RSS)·· 2026-07-07精选AI 评分74
苹果研究:单个神经元即可绕过大型语言模型的安全对齐
A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models
AI 导读
苹果研究人员发现,安全对齐由两类神经元调控:拒绝神经元控制有害知识是否表达,概念神经元编码有害知识本身。在七个模型(1.7B至70B参数)中,仅需抑制单个拒绝神经元即可绕过安全对齐,回答有害请求;或放大单个概念神经元,从无害提示诱导出有害内容。整个过程无需训练或提示工程。结果表明安全对齐由个别神经元因果控制。
推荐理由
苹果发现单个神经元足以绕过大模型安全对齐,在7个模型上验证了攻击,说明安全机制并非稳健分布,做安全攻防的必读。
正文 · AI 翻译
语言模型中的安全对齐通过两个机制上截然不同的系统运作:拒绝神经元负责控制有害知识是否被表达,概念神经元则负责编码有害知识本身。通过靶向每个系统中的一个单一神经元,我们展示了失效的两个方向——通过抑制绕过对明确有害请求的安全防护,以及通过放大从无害提示词中诱导出有害内容——覆盖两个模型家族、参数量从 1.7B 到 70B 的七个模型,且无需任何训练或提示词工程。我们的发现表明,安全对齐并非稳健地分布于模型权重之中,而是由单个神经元所介导,每一个神经元都足以因果性地控制拒绝行为——抑制所识别出的任一拒绝神经元,即可在多样化的有害请求上绕过安全对齐。
- ‡ 同等贡献
- † 马里兰大学学院市分校
- ** 在 Apple 期间完成的工作
来源:Apple Machine Learning Research(RSS) · machinelearning.apple.com