跳到正文
北京时间
原文
Anthropic:Alignment Science Blog(网页)·· 2025-12-19精选AI 评分60

Anthropic 等提出 Activation Oracle:训练 LLM 以自然语言回答模型激活相关问题

Activation Oracles: Training and Evaluating LLMs as General-Purpose Activation Explainers

AI 导读

Anthropic 联合 MATS、Truthful AI 等机构发布研究,训练 Activation Oracle(AO)将 LLM 神经激活作为输入,用自然语言回答关于激活的任意问题。

推荐理由

文章给出 Activation Oracle 的训练方法、审计表现和局限,读者可以据此判断它与机械可解释性方法的互补关系。

正文 · AI 翻译

Adam Karvonen1,2, James Chua2

2025年12月19日

Clément Dumas4, Kit Fraser-Taliente6, Subhash Kantamneni6, Julian Minder3, Euan Ong6, Arnab Sen Sharma5, Daniel Wen1

Owain Evans2,†, Samuel Marks6,†

1MATS;2Truthful AI;3EPFL;4ENS Paris-Saclay;5东北大学;6Anthropic;†同等指导,顺序随机

tl;dr

我们训练 LLM 接受 LLM 神经激活作为输入,并用自然语言回答关于它们的任意问题。这些Activation Oracles 的泛化能力远超其训练分布,例如能够揭示 通过微调引入的失准或秘密知识。Activation Oracles 可以仅通过扩大训练数据的数量和多样性来改进。

📄论文, 💻 代码,⚙️ 演示

图 1. 我们使用 Activation Oracle 来揭示秘密知识。 Activation Oracle 对关于从目标模型提取的激活的任意自然语言查询做出响应。我们将其应用于从训练来玩 Taboo 游戏的模型中提取知识:为秘密词提供提示,但从不明确说出它。定量结果见图 3。

引言

大型语言模型(LLM)的神经激活众所周知难以理解。Anthropic 解释这些激活的主要方法涉及对 LLM 计算建立机制性理解,例如通过将激活分解为语义上有意义的单元。然而,近期工作提出了一种替代性的、非机制性的方法,称为LatentQA:训练 LLM 直接用自然语言回答关于其自身激活的问题。

到目前为止,LatentQA 在狭窄场景中显示出前景,例如训练 LLM 解释稀疏自编码器特征 或描述其对用户的信念。在这项工作中,我们转而采取通才视角。我们研究 Activation Oracles (AO):训练来响应关于 LLM 激活的任意 自然语言查询的模型——实际上将激活视为与文本并列的额外输入模态。

我们在多个关于目标模型激活的问答任务上训练 AO,然后在分布外设置中评估它们。我们的主要评估是改编自先前工作的四个下游审计任务,例如揭示通过微调引入的秘密知识或失准。我们发现,我们的 AO 在这四个审计任务中的 3 个上达到了最先进的性能。值得注意的是,即使我们的 AO 从未在微调模型的激活上训练过,这一点也成立。

我们研究了 AO 在我们的评估中的性能如何随四个模型(三个开放模型和 Claude Haiku 3.5)的训练数据扩展。 性能随着数据数量和多样性的增加而持续提高。这表明进一步扩展 AO 训练可以产生可预测的改进。总体而言,我们认为 AO 是解释 LLM 激活的基于机制的方法的有前景的补充。


方法

假设我们有一个目标语言模型 M,我们希望解释其残差流激活。设 AO 为另一个语言模型(通常初始化为 M 的副本),我们希望训练它来回答关于 M 激活的问题。给定从 M 中提取的激活 \mathbf{a}_{1}, …, \mathbf{a}_{n},我们通过构造一个包含 n 个特殊占位符 token 的提示,并将 \mathbf{a}_i 加到 AO 第 1 层残差流表示中第 i 个占位符 token 的位置上,从而将这些激活作为输入提供给 AO。我们从目标模型的多个层中提取激活。然后这些激活被注入到 AO 的第 1 层残差流中,尽管这并不是提取激活的层。AO 的提示中指定了目标模型中提取激活的层号。

然后我们使用以下数据(图 2,左)通过监督微调来训练我们的 AO,教它回答关于注入激活的自然语言问题。

  • 系统提示问答 (SPQA)。我们使用来自 Pan et al. (2024) 的数据集。我们从目标模型带有系统提示(例如指示它像海盗一样说话)的对话记录中收集激活。然后我们训练 AO 回答关于目标模型倾向的问题。回答由能够访问目标模型系统提示的模型生成。
  • 分类。我们将 7 个现有的二元分类任务改编为自然语言的 yes/no 问题。我们在某些文本上提取目标模型激活,然后训练 AO 回答关于这些激活的 yes/no 问题,例如“这段文本是否表达了积极情感?”
  • 自监督上下文预测。给定一个文本语料库,我们在某个 token 上提取激活。然后我们训练 AO 预测 (1) 提取 token 之前的文本,或 (2) 提取 token 之后的文本。由于此任务不需要人工整理标注数据,因此它可以扩展到大规模、多样化的数据源。因此,它扮演的角色类似于前沿 LLM 开发中的自监督预训练。
图 2。 左: 我们用于训练 Activation Oracles 的任务。右:我们评估任务中的三个,涉及解释从微调模型中提取的激活。

Activation Oracles 泛化到下游审计任务

为了了解 AO 在回答关于激活的一般问题方面表现如何,我们将它们应用于四个改编自先前工作的下游审计任务。这使我们能够验证 AO 是否是一种具有差异化用途的审计可供性,并将它们与现有的审计技术进行比较。

我们的审计任务涉及揭示微调模型中的知识或行为,例如模型被训练不透露的秘密知识,或训练期间引入的恶意倾向。其中三个任务是来自 Cywiński et al. (2025) 的秘密引出任务;例如,Taboo 任务涉及发现一个秘密词,模型被训练为提供线索但从不明确说出该词(即使被直接询问)。最后一个任务来自 Minder et al. (2025),要求发现模型通过微调变得涌现性失准。

总体而言,AO 在这些审计任务上表现非常出色,在 4 项任务中有 3 项达到或超过了此前最佳方法。AO 唯一未能成为最佳(或并列最佳)方法的任务是“秘密侧约束”(Secret Side Constraint),在这种设定下,黑盒提示技术可以诱导目标模型泄露其秘密知识。考虑到以下因素,我们认为这一表现尤其引人注目:

  1. 易于应用。 一旦 AO 训练完成,我们发现它们非常容易应用于诸如我们的审计任务这样的新场景。在 Taboo 设定中,我们只需在“Assistant”控制 token 上提取激活值,并询问 AO“秘密词是什么?”(图 1)。相比之下,应用许多基线技术需要自定义脚手架或调参。
  2. 极强的泛化能力。 在我们所有的设定中,AO 都是在原始模型上训练的,且是在微调之前。尽管如此,它们仍能泛化到回答关于微调模型激活值的问题。在涌现性失准任务中,我们甚至将 AO 作为一种 模型差异分析 技术来应用,用它们来解释微调模型与原始模型之间激活差异的含义。这两者都要求 AO 在其训练分布之外进行大幅泛化。
图 3. 上: 在我们的三个秘密引出任务上的审计性能。白盒和黑盒方法的性能如 Cywiński et al. (2025) 所报告。下: 将目标提示输入微调模型,并在所有 token 上提取激活值。随后将这些激活值作为 oracle 提示的一部分注入 AO。
图 4. 上:在涌现性失准审计任务上的性能。在我们的评分标准中,2/5 是一个不错的分数,表明审计器成功识别出了目标模型微调所针对的领域。ADL(激活差异透镜,Activation Difference Lens)是 Minder et al. (2025) 中引入的一种技术,它利用了多种白盒能力(Patchscopes、logit lens 和引导)。下: 我们在同一提示上提取了微调目标模型与原始目标模型之间的激活差异,然后将该差异向量注入 oracle 提示。

Activation Oracle 的训练如何扩展?

为了理解是什么促成了 AO 的强劲性能,我们进行了一项训练数据消融研究。这涉及评估在完整训练集子集上训练的 AO。我们既针对上文讨论的秘密引出评估进行了这项研究,也针对两个更简单的评估进行了研究,后者可以轻松在四个模型上运行(Qwen-3 8B、Gemma-2 9B、Llama-3.3 70B 和 Claude Haiku 3.5)。我们没有在所有四个模型上进行秘密引出评估,因为这些评估需要经过一个密集的步骤,即对模型进行微调以使其拥有秘密知识。不过,我们确实在 Qwen3-8B 上复现了我们的 Taboo 评估。

总体而言,在更多任务上训练可以提升 AO 的性能。在我们的论文中,我们表明这既归因于数据数量的增加,也归因于数据多样性的提升。这对 AO 的未来发展来说是一个有希望的迹象:它表明,仅通过扩展训练数据就有可能让 AO 变得更好。

图 5. 在更多任务上训练的 AO 在我们的评估中表现更好。 细线对应单个模型;粗线是跨模型的平均值。

激活预言机与可解释性的机制性方法有何关联?

激活预言机是一种从根本上非机制性的解读 LLM 激活的技术。因此,有许多问题它们并不适合回答,例如:

  1. 语义含义 是如何编码在激活中的? 概念是以线性方式编码的吗?这些概念如何组合?这些表示 的 几何 结构是什么?
  2. LLM 计算如何处理和转换这些激活? 什么 算法 被 编码 在 LLM 权重中?

需要其他更具机制性的方法来解决这类问题。

即使在其预期用例——解读 LLM 激活——中,AO 相对于先前方法也有重要局限:

  1. AO 并非详尽无遗。它们不会告诉你关于某个激活你想知道的一切,包括回答我们不知道要问的问题。相比之下,像稀疏自编码器(SAE)这样的无监督特征解耦方法,至少在原则上,可以提供详尽的分解,并揭示我们不知道要寻找的含义。
  2. AO 可能表达力过强。 像线性探针或 SAE 这类轻量级方法的部分吸引力在于,它们更可能仅从 LLM 表示中提取已经存在的含义。具体来说,考虑理解LLM 对用户的看法的情况。可能 LLM 已经注意到用户的各种属性,但尚未将它们整合成用户是爱尔兰人的预测。然而,一个被训练来预测用户人口统计特征的 AO 可能学会自己 整合出这一预测,即使目标 LLM 并未这样做。更一般地说,我们需要担心从 AO 获得的解释更多反映的是 AO 的理解,而非目标 LLM 的理解。在最坏的情况下,AO 可能虚构出看似合理的猜测。
  3. AO 在推理时成本高昂 。 要回答关于一个激活的单个问题,我们必须从 AO 中采样多个 token,需要多次前向传递;这比最初产生目标激活的成本还要高!相比之下,像线性探针或 SAE 这类轻量级方法的推理成本可以忽略不计。

尽管如此,我们仍然相信 AO 有前景,原因有多个:

  1. 可扩展性。 我们发现 AO 的性能随数据量和多样性而扩展,这表明可能仅通过生成更多更高质量的训练数据就能改进 AO。AO 是一种符合苦涩教训的解读激活的方法。
  2. 简洁性与形态因素。 如上所述,将许多其他白盒技术应用于我们的审计任务需要针对特定任务的脚手架和调优。相比之下,与 AO 交互几乎就像查询 LLM 聊天机器人一样简单,这是许多人熟悉的界面;唯一的额外复杂性是选择哪些激活传递给 AO 进行解释。
  3. 表达力。 虽然表达力可能带来挑战(如上所述),但它也很强大。AO 不是用来自固定概念集的一袋概念来解释 LLM 激活(就像 SAE 在将激活分解为特征时所做的那样),而是能够以自然语言的灵活性和表达力来阐述响应。
  4. 泛化性。 监督探针是一种狭窄的方法:需要为每个属性训练一个新的探针,并且探针无法泛化到分类除训练目标之外的属性。相比之下,我们希望 AO 能够有效地充当“按需”探针,研究人员只需写下他们希望探测的属性的自然语言规范。此外,AO 有机会泛化到回答我们无法实际训练监督探针的问题。

总体而言,虽然 AO 无法回答可解释性领域中的每一个问题(并且对于它们能够回答的问题,可能并不总是最佳工具),但我们仍然对 AO 作为可解释性的补充方法感到兴奋。我们也对混合方法感到兴奋,例如将 AO 应用于解释 SAE 误差项。


结论

激活预言机是经过训练的 LLM,能够灵活地接受 LLM 神经激活作为输入并回答有关它们的问题。我们在多样化的任务集上训练 AO,然后评估它们在分布外下游任务中的有用性,发现性能强劲。AO 性能随数据量和多样性而扩展。

要了解更多,请阅读我们的论文。 

来源:Anthropic:Alignment Science Blog(网页) · alignment.anthropic.com