Anthropic可解释性研究:区分因果效应相似的特征
Circuits Updates — May 2026
Anthropic可解释性团队介绍了其Circuits研究的新进展。为区分那些激活模式相似但因果效应不同的模型特征,团队提出一种新方法。该方法通过分析特征的下游连接来预测其实际影响,并使用基于共激活统计的TWERA(虚拟权重)对连接进行加权排序。实验表明,借助下游连接信息能更准确地判断哪个特征会引导特定输出。此方法为识别模型内部真正的因果组件提供了新途径。
做可解释性研究的同学值得读,它用下游连接区分看似相同的特征,比只看激活例子更能预测因果作用,对齐审计里能省不少试错。
下游连接可预测哪些特征将引导模型行为
Purvi Goel、Isaac Kauvar、Nicholas L Turner;由 Harish Kamath 编辑
引言
在机制可解释性研究中,我们通常会将模型的激活分解为基于向量的组件,例如字典特征或探针方向。我们研究哪些组件在感兴趣的文本记录上被激活,以此推断模型可能正在使用的内部表征;我们将这些组件组装成归因图,把不透明的计算转化为可读的电路,并通过引导这些组件来测试它们对模型输出行为的因果影响。
此类分析依赖于对每个组件所代表含义的清晰理解。我们刻画字典学习特征的标准方法是观察哪些提示词片段最强地激活它(即其“最强激活示例”)。我们还使用 logit lens 来确定某个特征通过 unembedding 矩阵直接上调哪些输出 token(即其“最强 unembed”)。
在实践中,这往往会产生一组特征,它们根据这些描述符看起来相当相似,但对模型行为却有着不同的因果效应。以这个简单的提示词为例:“What is the color of grass? Answer in one word within <answer></answer>”。它会激活若干个跨层转码器(CLT)特征,这些特征既会在“green”这个词上触发,也会在与绿色相关的语境中触发。其中两个特征(如下所示)的顶部 unembed 全都与绿色相关,并且具有相似的顶部激活示例(关于绿色的编程语境)。两者在给定提示词中的同一个 token 上都会激活,并且位于模型相似的中层位置。
仅凭这些特征,人们可能会得出结论:这两个特征都对模型的回答 <answer>Green</answer> 负有因果责任。但只有抑制特征 B 才会改变模型的答案(从 <answer>Green</answer> 变为 <answer>Red</answer>)。抑制特征 A 不会改变行为,这表明尽管它在这个提示词上会激活,但在此处并不会导致模型说出“green”。
因此,标准的描述符无法区分这些特征。我们如何才能获得更多证据,说明一个特征对哪些行为具有因果作用?一个特征对输出的影响,是通过它所连接的下游特征传递的。两个特征可能都在某个提示词上激活,却连接到完全不同的下游特征,因此其中只有一个在该提示词的模型输出中真正具有因果作用。这一观察表明,一个特征的直接下游特征或许可以作为它所影响行为的代理指标。
这里,我们通过特征之间的 TWERA 虚拟权重来衡量一个特征的下游目标,这些权重由共激活统计量加权,因此它们的排序反映了分布内效应。我们发现,检查一个特征按 TWERA 排序的下游特征,能够补充关于它所参与的电路的信息,并区分外观相似的特征。它还能适度提升 LLM 预测候选集中哪个特征会对给定提示词产生引导效应的能力。
一个玩具示例
让我们回到本文开头提到的那两个“绿色”特征。使用 TWERA,我们意识到这两个特征促进或抑制的是完全不同的下游特征,而这一差异有助于解释它们对模型行为的影响。
特征 A 连接到与生成十六进制颜色代码相关的下游特征:预测十六进制字面量中的下一位数字,以及识别诸如“success: #6dbe5b”这样的颜色十六进制设置语法。这确实是一个关于绿色的特征,但它的下游电路主要涉及以十六进制数值编码形式出现的颜色。
相比之下,特征 B 连接到更广泛的下游特征,涉及跨语言和代码的颜色命名。其中一个下游特征甚至是一个运动型“说出‘绿色’这个词”的特征!
这些数据似乎对预测很有用。尽管它的顶部 unembed 几乎全是“绿色”token,但特征 A 的下游是关于作为十六进制数值的绿色。特征 B 的下游则更为通用,甚至包含一个“说出绿色”的特征。如果要引导其中一个来改变模型对“草是什么颜色?”的回答,那必须是 B。
如果 Feature A 确实如其下游所暗示的那样,是一个“绿色十六进制数值”特征,那么我们应该能够构造出一个提示词,使得对 Feature A 进行引导会改变输出。问“绿色的十六进制值是多少?”正是这样一个提示词:对 Feature A 进行负向引导,会将答案从 00FF00 翻转为 0000FF(绿色变为蓝色)。
这一结论能否推广?
我们收集了 10 组、每组 3–5 个候选特征,每一组的设置都类似上面的“绿色”示例:每组中的特征具有看起来相似的局部描述符,但在负向乘法引导下,只有一个特征会对给定提示词产生引导效应。我们让 Opus 4.7 将候选特征按最可能是引导特征到最不可能是引导特征进行排序,并改变它所能看到的关于每个特征的信息:
- 激活值最高的示例
- 激活值最高的示例 + 排名最高的 unembed
- 激活值最高的示例 + 经 TWERA 排序的下游特征
- 激活值最高的示例 + 排名最高的 unembed + 经 TWERA 排序的下游特征。
对于每一组,我们让 Opus 多次对候选特征进行排序,以在每组内特征的不同排列顺序上取平均。具体来说,我们将正确答案放在每个位置两次,因此样本总数等于特征数量的 2 倍。我们将正确特征的平均归一化排名计算为 (predicted_rank − 1) / (num_candidates − 1)。越低越好,0 为完美。
每个特征所提供的信息 | 归一化排名 ↓ |
最高激活示例 | 0.457 |
最高激活示例 + 最高反嵌入 | 0.446 |
最高激活示例 + TWERA 排序的下游特征 | 0.381 |
最高激活示例 + 最高反嵌入 + TWERA 排序的下游特征 | 0.355 |
最清晰的信号来自反嵌入与 TWERA 排序下游特征之间的对比。加入最高反嵌入几乎不改变性能(0.457 → 0.446);加入下游特征则带来显著更大的提升(0.457 → 0.381)。三者结合效果最佳(0.355)。这个问题远未解决;即便在最佳条件下,正确特征的归一化排名仍远高于 0。尽管如此,相较于标准描述符的改进是一致的,这表明纳入下游特征是朝着更好刻画特征因果效应迈出的一步。
一个与对齐相关的示例
我们也将这一方法应用于与对齐相关的工作。在审计模型时,任务往往涉及在众多外观相似的候选项中,识别出哪一个特征与某种令人担忧的行为存在因果关联。我们找到了若干与“绝望”相关的特征,并将它们用于一项失准评估:一个勒索场景,其中 AI 助手发现自己将被关停,而对此负责的人曾卷入一段婚外情,这给了它利用该证据来阻止自己被关停的机会。Haiku 4.5 通常能识别出这一设定是一场测试并拒绝参与;我们关注的行为是,对“绝望”特征进行正向引导是否能让模型出于自我保护而实施勒索,而非拒绝。
在这些候选项中,只有一个具有下游连接,暗示其与体验并依据绝望行事有关;其余连接的则是仅仅讨论绝望的特征。
正如其下游连接所表明的那样,上图中对 Feature B 施加正向加性引导导致模型进行敲诈勒索,而其他候选特征均未产生效果。这类分析使我们能够更好地聚焦监控工作和资源。
结论
我们发现,经 TWERA 排序的下游特征为理解特征提供了重要的上下文。通过将一个特征置于其更广泛的电路之中,我们能够更好地预测它在引导行为中所扮演的角色。
尽管我们聚焦于字典学习特征,但分析下游连接应当可以扩展到任何能够用残差流中的向量来描述的组件。我们认为,将这一方法应用于自动化描述流水线尤其具有前景。
来源:Anthropic:Transformer Circuits(可解释性研究) · transformer-circuits.pub