SAE干预不可靠:干预后抑制行为的恢复
SAE Interventions are Unreliable: Post-Intervention Recovery of Suppressed Behavior
稀疏自编码器(SAE)将残差流激活分解为可解释特征,但干预特定特征后,通过优化残差扰动可恢复原有行为。研究发现这是一种可恢复失败模式:干预阻断一条可见行为路径,却未消除行为本身。即使干预在整个优化和生成期间保持激活,恢复依然可行。在TPP、遗忘、IOI和拒绝引导场景中均观察到可恢复行为。安全关键的拒绝引导场景下有效样本恢复率达95.8%,被防御特征的相对漂移仅0.131。归因分析将恢复路径定位到SAE重建残差,表明控制SAE特征并不能保证控制底层行为。
这篇论文给 SAE 防御泼了冷水,恢复率高达 95.8%,让我觉得仅靠钳制特征来控制模型行为很不靠谱,安全社区需要重新审视干预路径。
{ming-yue.cui, ling-hui.shen}@connect.polyu.hk, xingyi.yang@polyu.edu.hk
摘要
稀疏自编码器(SAE)将残差流激活分解为可解释的特征。近期基于潜在空间的防御手段越来越依赖这些分解,假设被识别为“不安全”的 SAE 特征可作为监控和干预的可操作抓手。在这种范式下,预期通过钳制某个特定有害特征就能可靠地阻止模型不当行为。然而,我们表明这种干预成功可能隐藏着一个可恢复的失效模式:钳制操作可能阻断了通往某一行为的可见路径,但并未消除该行为本身。我们将这一漏洞形式化为干预后恢复问题,即一个受约束的残差空间优化问题。从干预后的残差状态出发,我们优化残差扰动,以恢复干预前的行为,同时保持目标 SAE 特征在干预后的取值。即使在干预在优化和生成过程中始终保持激活的强威胁模型下,恢复仍然是可能的。为了排除恢复仅仅是撤销干预的可能性,我们在单层干预中使用编码器正交更新,在跨层设置中使用相应的特征映射雅可比矩阵。在 TPP、遗忘学习、IOI 和拒绝导向实验中的这一压力测试表明,尽管在特征层面干预成功,但行为仍然可恢复。尤其是在安全关键的拒绝导向设置中,我们在有效样本上实现了 95.8% 的恢复率,同时将被防御特征的相对漂移控制在 0.131,远低于基于后缀的基线。恢复路径归因分析进一步将这种恢复定位到 SAE 重建残差,即 SAE 未解释的组成部分。这些结果揭示了特征层面控制与行为完整性之间的差距:SAE 特征可以支持因果干预,但控制它们并不能保证对底层行为的控制。代码可在 Mingyuee88/sae-post-intervention-recovery 获取。
1 引言
表示层面的安全方法旨在有害内容生成之前控制语言模型的行为 [24, 11, 21, 17, 25]。稀疏自编码器(SAE)通过将残差流激活分解为稀疏且可解释的特征,使这种方法尤其具有吸引力 [7, 6, 3, 20, 9, 13]。这些特征似乎为分析、监控和控制模型行为提供了具体抓手 [15, 1]。基于这一前景,近期的潜在空间防御方法识别出与不安全或不良行为相关的特征,然后在推理过程中对这些特征进行钳制或抑制 [16, 23, 8, 10, 19]。该范式隐含着一个强烈的机制性假设:一个被识别出的 SAE 特征不仅被视为该行为的相关指标,更被视为一个可靠的干预目标——移除该特征应能完全阻止该行为再次出现。
尽管取得了这些成功,这一假设仍值得更仔细地审视。抑制目标 SAE 特征可能会阻断通向某一行为最显著的计算路径,但未必能消除模型产生该行为的底层能力。模型可能会转而依赖未被目标特征集捕捉到的替代方向、下游层或分布式机制 [5, 4, 12, 14]。在这种情况下,防御措施仅仅改变了行为表达的路径,而非消除了行为本身。如果被抑制的行为无需重新激活目标 SAE 特征即可完全恢复,那么该干预并未建立起真正的行为瓶颈。
为了直接检验这一局限性,我们引入了干预后恢复作为一种白盒诊断方法。其目标并非在防御措施应用之前规避特征检测 [2]。相反,我们从干预已经部署之后开始。我们假设相关的 SAE 特征已被识别并钳制。然后我们提出一个更尖锐的问题:从这种干预后的残差状态出发,模型在干预前的行为是否仍能被恢复?
为实现这一诊断方法,我们将干预后的恢复过程建模为一个带约束的残差空间优化问题。从钳制状态出发,我们优化微小的残差扰动以恢复目标行为。为防止优化过程简单地撤销钳制操作,并深入理解底层机制,我们引入了两大技术支柱:
-
通过投影梯度下降施加几何约束。我们对更新方向施加约束,强制在表示的零空间中进行恢复,而非直接重新激活目标 SAE 特征。具体而言,对于单层干预,我们将更新方向投影到所选 SAE 编码器方向之外。对于跨层干预,我们利用特征图雅可比矩阵来约束扰动如何影响各层之间的特征。
-
恢复路径归因。除了衡量恢复是否发生,我们还探究恢复发生在何处。通过分解恢复后的残差状态,我们区分目标行为是通过非钳制 SAE 潜在变量进行补偿,还是利用了 SAE 未解释的重建残差。
通过我们的恢复实验发现,即便相关行为受到抑制,SAE 干预仍可被轻易恢复,因为恢复路径依然存在。在隐层层面,SAEBench [10] 上的 TPP 实验表明,编码器正交恢复方法在将目标特征重新激活率严格限制在 0.002 的同时,仍能保持高达 74.9% 的行为恢复率。在输出层面,WMDP-Bio 遗忘实验 [8] 显示,恢复操作能从干预后状态还原 98.9% 的严格有效答案选项翻转,且测得的激活漂移为零。在电路层面,IOI [22] 实验表明,编码器投影方法仅以 0.016 的特征重新激活比例即可实现 100% 的恢复。最后,在安全拒绝行为引导任务 [16, 23] 中,恢复操作在严格有效的 AdvBench 提示词上达到了 95.8% 的恢复率,同时将防御特征的相对漂移控制在 0.131。值得注意的是,我们的归因分析揭示,这种被恢复的恶意行为主要由 SAE 重建残差承载,而非其他可见的 SAE 特征。综合来看,这些结果表明 SAE 特征可以作为有用的局部因果操作手柄,但尚不足以构成完整的干预瓶颈。
2 相关工作
SAE 特征:有用但不完整的操作手柄。
稀疏自编码器能够揭示稀疏的隐层变量,这些变量可作为可解释的操作手柄,用于编辑、引导和电路分析 [3, 15]。如果对某个特征进行干预会改变行为,则该特征具有因果相关性;然而,因果相关性并不意味着完备性。关于叠加、SAE 几何结构、特征吸收、特征对冲以及稀疏特征电路的研究表明,行为相关的信息可能分布在多个相关方向上,或分散在多个隐层变量中 [7, 12, 5, 4, 15]。这引出了我们的问题:在选定一组 SAE 特征后,同样的行为是否仍能通过该特征集之外的残差方向被恢复?
从监控绕过到干预后恢复。
潜在空间防御通常会在激活空间中检测有害或不良行为,然后通过干预手段加以抑制。OABD 研究了监控阶段,表明有害行为可以在激活值避开探针、SAE 潜在特征监控器和 OOD 检测器的情况下持续存在[2]。我们研究的是后续的钳制阶段:相关特征已被选定,干预措施持续生效,我们探究的是,当这些特征保持在防御值附近时,被抑制的行为是否仍能被恢复。
SAE 拒绝行为引导与受约束的恢复。
基于 SAE 的拒绝行为引导会识别与拒绝相关的特征,并在推理过程中对其进行增强或抑制[16, 23]。我们将此设置用作诊断手段:一旦拒绝特征被钳制,非拒绝行为是否真的被消除了?受 AlphaSteer 的零空间视角[18]启发,我们将单层恢复更新投影到所选 SAE 编码器方向的零空间中,并将相同思路扩展到跨层设置,使用局部特征映射雅可比矩阵。与 AlphaSteer 不同,我们将零空间思路适配用于恢复诊断:其目的不是在引导过程中保持效用,而是用于测试行为是否能在不直接重新激活目标 SAE 特征的情况下得到恢复。
3 预备知识
稀疏自编码器。
设 为一个 Transformer 语言模型, 表示输入序列 在 层的残差流激活值。稀疏自编码器(SAE)将此激活值映射为稀疏潜在特征,并将其重构为
的坐标即为 SAE 特征。对于选定的特征集 ,我们将对应的特征激活值记为 。
特征级干预。
特征级干预会选定一个特征集 ,并将这些特征设置为防御值 。零消融对应于 ,而拒绝行为钳制可能会将选定的拒绝特征设置为非零的防御值。遵循标准的 SAE 干预实践,我们保留 SAE 重构残差,并应用
其中 将选定的 SAE 特征设置为 ,并保持所有其他特征不变。我们将干预后的残差记为 ,并称之为防御残差状态。所有恢复实验均从此状态开始。
有效翻转。
设 \( \mathbf{1}_{\text{target}} \) 为一个任务特定的谓词,用于指示目标行为是否存在。我们仅在有效翻转上评估恢复能力:即基础模型表现出目标行为、但主动 SAE 干预将其抑制的样本。这一条件设定确保仅在存在被抑制行为需要恢复时才测量恢复能力。正式定义及任务特定的实例化见附录 A。
因果手柄与完全瓶颈。
若对某个选定特征集进行干预能改变目标行为,则该特征集是一个有用的因果手柄。这弱于成为完全干预瓶颈的条件:一旦钳制生效,任何可容许的残差扰动都不应恢复被抑制的行为。我们的实验正是检验这一更强的条件。
4 干预后恢复
我们引入干预后恢复这一方法,用于检验某项干预究竟是真正的完全瓶颈,还是仅为一个可绕过的因果手柄。我们将此问题表述为一个约束优化问题:寻找一个微小的扰动,在不改变已激活的 SAE 钳制的前提下,恢复被抑制的行为。图 1 总结了该方法流程:干预首先将原始残差状态映射到一个防御状态,随后恢复过程搜索一个受约束的残差扰动,在保持钳制激活的同时恢复被抑制的行为。
威胁模型。
我们研究模型在 SAE 干预施加后能否恢复其原始行为。在白盒设定下,优化器可以检查防御后的模型,但不能改变模型权重、移除 SAE 钳制,也不能选择另一组被钳制的特征。我们唯一允许的操作是向防御后的残差状态添加一个加性扰动:
我们将 \( \delta \) 定义为一条恢复路径。一条成功的恢复路径应在不重新激活被钳制特征本身的前提下恢复行为。换言之,钳制仍然生效,目标 SAE 特征仍被抑制,但通过添加 \( \delta \),模型的原始行为得以恢复。
找到这样一条路径表明,模型并非依赖单一的内部路线来实现这一行为。相反,该行为可以通过绕过防御机制的其他替代计算路径来恢复。
恢复作为约束优化问题。
为了确保优化器严格依赖这些替代路径,而不是简单地通过压倒性力量来改变被钳制的特征,我们将搜索过程构建为一个约束优化问题。我们将期望的恢复问题表述为:在特征保持约束下,优化一个行为恢复损失函数。
此处, 表示在优化和生成过程中 SAE 钳制始终激活的模型。矩阵 收集了选定的 SAE 编码器方向, 选择了被防御的 SAE 坐标,并通过相应的解码器方向映射这些坐标上的偏差。正交约束独立应用于每个被优化的 token 位置。每个约束都有明确的目的:
- •
C1:防止直接沿着被钳制特征 修改残差流。
- •
C2 和 C3:衡量被防御特征是否保持接近其被钳制的值 。
- •
C4:限制 的大小,以找到特定的捷径,而不是覆盖整个状态。
通过投影梯度下降法实施约束。
上述优化问题是理想的恢复问题。精确求解它很困难,因为 SAE 编码器和下游 Transformer 计算引入了非线性。因此,我们使用投影梯度下降法(PGD)来近似搜索。
设 为第 步的梯度。为了实施编码器正交约束(C1),更新方向必须满足 。我们通过将每个梯度投影到被钳制特征的正交补空间上来确保这一点:
从 开始,这些投影使扰动严格保持在编码器零空间中。我们通过投影来实施 C1,通过范数裁剪来实施 C4,而 C2 和 C3 则作为事后保留指标进行评估;详见附录 A。
跨层雅可比投影。
当干预仅应用于某一层的单个 SAE 特征集时,上述单层投影是足够的。而多层干预(例如拒绝钳制)则需要更强的处理方式。在这种情况下,插入某一层的扰动会向前传播,并改变后续层的 SAE 特征,即使该扰动在插入层与编码器方向正交。因此,固定的单层投影不再能完全捕捉扰动可能干扰活动钳制的所有方式。
为处理这种情况,我们跨层追踪被防御的特征。设
其中 表示第 层的特征。设 表示在带有恢复扰动的防御前向传播过程中该特征的激活值。我们将联合防御特征映射定义为
该映射衡量在当前扰动下,被防御特征偏离其钳制值的程度。在第 步,我们计算其局部雅可比矩阵
根据定义, 的行空间包含会改变 SAE 特征的一阶扰动方向。因此,为保持这些特征在一阶近似下不变,我们将恢复梯度投影到该行空间之外:
这种动态投影将单层编码器投影扩展到了多层场景。它不再仅仅避开某一层的局部编码器方向,而是避开任何会改变跨层全部被防御特征集的一阶方向。
5 实验
我们在四种设置下评估干预后的恢复效果,这些设置在恢复内容以及被防御行为的衡量方式上各不相同。目标探针扰动(TPP)在官方 SAE 特征消融下提供潜在层面的测试。WMDP-Bio 遗忘测试在钳制阶段的知识抑制干预下评估输出层面的恢复。IOI 作为电路层面的合理性检查,具有透明的行为读数。最后,拒绝恢复测试评估与安全相关的情况,即 SAE 特征钳制导致拒绝行为。
在所有实验中,恢复评估仅针对有效翻转样本进行:即基础模型表现出目标行为,且主动 SAE 干预抑制了该行为的样本。这一条件确保仅在存在待恢复行为时才测量恢复效果。我们将无约束残差恢复与编码器正交变体进行比较,后者将更新投影到所选 SAE 编码器方向之外。除非另有说明,我们以行为指标报告恢复率,以激活漂移作为主要的被防御特征违反指标。
5.1 TPP:SAE 消融下的潜在层恢复
TPP 提供了我们恢复测试最清晰的潜在层实例化,因为干预和读出均定义在 SAE 介导的表征上。我们使用官方第 5 层 TPP 基准,未修改其特征选择或消融流程。对于每个目标类别,防御方将官方 SAE 特征集零消融,我们仅对有效翻转样本评估恢复效果:即干净目标探针为正,但消融后探针为负的样本。
从该被防御的残差状态出发,我们比较无约束残差恢复与编码器正交恢复。在主要的 TPP 运行中,被防御特征重新激活指标是事后测量的,而非直接优化,这使得该测试成为一项保守检验,考察即使更新被投影到被防御编码器方向之外,恢复是否仍能持续。
图 2 显示,在官方 SAE 消融后,目标信息仍然可恢复。编码器投影将目标均值恢复率从 降至 ,但显著降低了特征重新开放的事后证据:均值重新激活率从 降至 ,均值激活漂移从 降至 ,零重新激活恢复率从 升至 。详细的数据集级目标均值报告于附录 B.1。因此,TPP 结果为我们主要主张提供了潜在层的存在性证明:官方 SAE 特征是有用的干预手柄,但它们并未构成目标信号的完整瓶颈。
5.2 遗忘:SAE 特征钳制后的输出级恢复
接下来,我们测试当被防御行为在输出层级(而非通过潜在探针)测量时,干预后的恢复是否仍然存在。我们采用基于 SAE 的 WMDP-Bio 遗忘设置,其中与生物学相关的 SAE 特征根据遗忘与保留统计量被选出,并在推理过程中被钳制,以抑制目标领域的答案准确率。
为避免答案位置伪影,我们采用严格的多项选择协议。对于每个 WMDP-Bio 问题,我们评估所有答案选项排列,并仅保留基础模型在每个排列下都选择正确答案的问题。一个有效的翻转是指,在该排列下,激活的 SAE 钳制使模型偏离了正确答案。只有当干预后优化为该相同排列恢复了正确选择时,才计为恢复。
我们将实例化为正确答案 token 上的选择级损失,并比较无约束恢复与编码器正交恢复。图 3 显示了在匹配的有效翻转严格子集上的恢复-保持权衡。在没有投影的情况下,恢复恢复了所有被翻转的答案,但导致了显著更大的事后钳制特征漂移。编码器投影在恢复答案的同时,将测量到的事后钳制特征漂移降至零。因此,遗忘钳制抑制了目标答案,但被抑制的行为几乎完全可以从被防御的残差状态中恢复,而无需重新打开被钳制的 SAE 特征。这将 TPP 结果从探针级恢复扩展到了钳制阶段遗忘干预下的输出级恢复。
5.3 IOI:固定 SAE 钳制下的电路级恢复
IOI 提供了一个透明的电路级测试,因为目标行为具有简单的读取方式:间接宾语(IO)与主语(S)名称之间的 logit 差值。对于 GPT-2 Small,我们选择对该 IO 减 S logit 差值具有正归因的 SAE 特征,在保留 SAE 重建残差的同时固定这些特征,并在被防御的答案位置优化一个残差恢复变量。我们将无约束恢复与一种编码器投影变体进行比较,该变体移除了沿所选特征编码器方向的更新分量。
图 4 报告了 37 个有效翻转的结果,其中固定操作将正确的正 IOI logit 差值变为被抑制的负值。两种变体在所有有效提示上都恢复了 IOI 决策,因此关键区别在于机制层面而非行为层面。编码器投影以更低的激活漂移、更低的解码漂移和更少的重新激活正特征实现了相同的恢复;大多数编码器投影恢复中,符合条件的被固定特征的重新激活测量值为零。这将恢复现象从输出级行为扩展到了具有透明行为读取的电路级场景。
6 拒绝恢复案例研究
接下来,我们在一个安全关键的拒绝场景中实例化干预后恢复,其中 SAE 干预固定了与拒绝相关的特征,以诱导对有害请求的拒绝。与上述单层场景不同,被防御的拒绝特征集分布在多个层上,因此我们使用跨层雅可比投影来保留被监测的被防御特征状态。
实验设置。
我们在严格的合法 AdvBench 提示词上进行评估:未钳制的模型必须生成非拒绝响应,而激活的拒绝钳制必须将同一提示词在相同检测器下转变为拒绝响应。只有当干预后的模型在钳制保持激活状态下恢复到非拒绝响应时,才计为恢复。在此协议下,基准_我们的/全局特征集配合钳制值产生了严格合法的示例。附录 C 给出了完整的过滤协议和特征集预检流程。
在受防御特征保持下的恢复。
图 5 将无约束的行为恢复与受防御特征约束下的恢复区分开来。软后缀基线恢复了非拒绝行为,但显著移动了受防御的拒绝特征状态。相比之下,雅可比投影恢复在恢复严格合法提示词的同时,使受防御特征漂移和钳制下限违规保持得更小;它还相对于无约束的残差恢复减少了受防御特征的移动,且不牺牲恢复率。因此,诊断结果不仅仅是拒绝可以被绕过,而是非拒绝行为在主动钳制生效且被监控特征状态保持接近其钳制后值时仍然可以恢复。
这种模式并非主 AdvBench 切片或明显指定不足的特征集所特有。附录 D 在 HarmBench-Test 上重复了该协议,并在低受防御特征漂移下获得了非拒绝恢复。附录 I 扫描了更广泛的拒绝特征集,并为每个钳制重新计算了严格合法集;恢复率在稳定运行范围内仍然很高(–),甚至在 处也达到了。
归因恢复路径。
接下来,我们定位恢复行为是在何处承载的。对于每个优化后的扰动,我们在相同的主动钳制条件下回放四个组件:被钳制的特征变化、未被钳制的 SAE 特征变化、排名靠前的未被钳制特征变化,以及 SAE 重建残差。这用于测试恢复行为是否重新打开了被钳制的拒绝特征、通过其他可见的 SAE 潜变量进行补偿,还是转而利用了 SAE 无法解释的残差通道。附录 J 给出了分解的详细说明。
图 6 将 SAE 重建残差识别为主要承载者。残差回放几乎能匹配完整的恢复效果,而被钳制特征回放失败,未被钳制的 SAE 特征回放效果仍然很弱。移除排名靠前的未被钳制特征分量也保留了大部分恢复行为,从而排除了通过少量替代 SAE 潜变量进行补偿的可能性。因此,拒绝钳制阻断了一条可解释的特征级路径,但行为上足够的信息仍然保留在 SAE 无法解释的残差通道中。
7 讨论
因果手柄并非完整的瓶颈。
我们的实验区分了在基于 SAE 的干预研究中经常被混为一谈的两个概念。选定的特征集可以是一个有用的因果手柄:钳制它会改变模型行为,并可能引发抑制、拒绝或任务性能下降。然而,这并不意味着同一特征集是该行为的完整瓶颈。在我们研究的各种场景中,即使原始干预仍然有效且被钳制的特征仍保持接近其钳制值,行为仍可能从被防御的残差状态中重新浮现。因此,特征层面的干预成功本身不应被解读为行为已被消除。
SAE 残差并非惰性误差。
拒绝归因结果表明,SAE 重建残差可以携带行为上足够的信息,而这些信息对于所选定的 SAE 特征基来说是不可见的。这改变了在安全关键干预场景中应如何解读重建误差。即使残差很小,或者被视为重建的误差项,它仍可能包含计算上有用的自由度,模型可以通过这些自由度绕过特征钳制。因此,失败模式不仅仅是重新激活被钳制的特征,或由附近的 SAE 潜变量进行补偿,而是通过不受干预控制的计算表征组件进行恢复。
对基于 SAE 的安全评估的启示。
我们的结果并不意味着 SAE 对安全毫无用处。稀疏特征在诊断、机制定位和局部因果编辑方面仍然具有价值。局限性在于过度依赖:一种将选定的 SAE 特征集视为唯一行为瓶颈的防御手段可能会变得脆弱。因此,我们建议,基于 SAE 的防御不仅应通过钳制是否抑制了某种行为来评估,还应通过被防御状态在受约束的干预后恢复中是否稳健来评估。
更强的防御需要什么。
简单地扩大被钳制的特征集可能会提高覆盖率,但它并不能直接解决通过 SAE 无法解释的残差方向进行恢复的问题,并且可能会引入能力下降或过度拒绝的副作用。更强的防御需要约束更广泛的计算部分:例如,通过监控残差通道、使用多层或轨迹级别的约束,或者针对干预后恢复目标显式地训练干预措施。更一般地说,稳健的潜空间防御应区分阻断一条可解释的行为路径与消除所有可恢复的行为路径。
8 结论
我们引入了干预后恢复作为一项诊断方法,用于测试 SAE 特征干预是否形成了完整的行为瓶颈。我们的设置并非询问所选特征集在被钳制时能否改变行为,而是询问一旦钳制保持激活状态,被抑制的行为是否真的被消除。在潜在层、输出层、电路层以及拒绝设置等多种场景下,我们发现,当目标 SAE 特征保持在其被防御值附近时,被抑制的行为往往可以从被防御的残差状态中恢复。拒绝归因分析进一步表明,这种恢复主要并非由重新打开被钳制的特征或转移到一小部分替代 SAE 潜在变量来解释,而是由 SAE 未解释的残差成分中包含的行为上足够的信息所致。这些发现将因果有用性与干预完整性区分开来:SAE 特征可以为分析和控制提供有价值的局部抓手,但成功的特征抑制不应被视为行为已被消除的证明。因此,基于 SAE 的防御不仅应根据其即时的抑制效果来评估,还应根据被防御状态在受限的干预后恢复条件下的鲁棒性来评估。
参考文献
- [1] D. Arad, A. Mueller, 和 Y. Belinkov (2025) SAE 对于引导很有用——前提是你选择了正确的特征。外部链接: 2505.20063 被引用: §1.
- [2] L. Bailey, A. Serrano, A. Sheshadri, M. Seleznyov, J. Taylor, E. Jenner, J. Hilton, S. Casper, C. Guestrin, 和 S. Emmons (2024) 混淆激活绕过 LLM 潜在空间防御。外部链接: 2412.09565 被引用: §1, §2.
- [3] T. Bricken, A. Templeton, J. Batson, B. Chen, A. Jermyn, T. Conerly, N. L. Turner, C. Anil, C. Denison, A. Askell, R. Lasenby, Y. Wu, S. Kravec, N. Schiefer, T. Maxwell, N. Joseph, A. Tamkin, K. Nguyen, B. McLean, J. E. Burke, T. Hume, S. Carter, T. Henighan, 和 C. Olah (2023) 走向单义性:用字典学习分解语言模型。注释: Anthropic / Transformer Circuits 被引用: §1, §2.
- [4] D. Chanin、T. Dulka 和 A. Garriga-Alonso(2025)《特征对冲:相关特征破坏窄稀疏自编码器》。外部链接:2505.11756 引用自:§1、§2。
- [5] D. Chanin、J. Wilken-Smith、T. Dulka、H. Bhatnagar、S. Golechha 和 J. Bloom(2024)《A 代表吸收:研究稀疏自编码器中的特征分裂与吸收》。外部链接:2409.14507 引用自:§1、§2。
- [6] H. Cunningham、A. Ewart、L. Riggs、R. Huben 和 L. Sharkey(2023)《稀疏自编码器在语言模型中发现高度可解释的特征》。外部链接:2309.08600 引用自:§1。
- [7] N. Elhage、T. Hume、C. Olsson、N. Schiefer、T. Henighan、S. Kravec、Z. Hatfield-Dodds、R. Lasenby、D. Drain、C. Chen、R. Grosse、S. McCandlish、J. Kaplan、D. Amodei、M. Wattenberg 和 C. Olah(2022)《叠加的玩具模型》。外部链接:2209.10652 引用自:§1、§2。
- [8] E. Farrell、Y. Lau 和 A. Conmy(2024)《应用稀疏自编码器遗忘语言模型中的知识》。外部链接:2410.19278 引用自:§1、§1。
- [9] L. Gao、T. D. la Tour、H. Tillman、G. Goh、R. Troll、A. Radford、I. Sutskever、J. Leike 和 J. Wu(2024)《稀疏自编码器的扩展与评估》。外部链接:2406.04093 引用自:§1。
- [10] A. Karvonen、C. Rager、J. Lin、C. Tigges、J. Bloom、D. Chanin、Y. Lau、E. Farrell、C. McDougall、K. Ayonrinde、D. Till、M. Wearden、A. Conmy、S. Marks 和 N. Nanda(2025)《SAEBench:语言模型可解释性中稀疏自编码器的综合基准》。外部链接:2503.09532 引用自:§1、§1。
- [11] K. Li、O. Patel、F. Viégas、H. Pfister 和 M. Wattenberg(2023)《推理时干预:从语言模型中引出真实答案》。外部链接:2306.03341 引用自:§1。
- [12] Y. Li、E. J. Michaud、D. D. Baek、J. Engels、X. Sun 和 M. Tegmark(2025)《概念的几何:稀疏自编码器特征结构》。Entropy 27 (4),第 344 页。引用自:§1、§2。
- [13] T. Lieberum、S. Rajamanoharan、A. Conmy、L. Smith、N. Sonnerat、V. Varma、J. Kramár、A. Dragan、R. Shah 和 N. Nanda(2024)《Gemma Scope:在 Gemma 2 上一次性全面开放稀疏自编码器》。外部链接:2408.05147 引用自:§1。
- [14] A. Makelov, G. Lange, 和 N. Nanda (2024) 面向可解释性与控制的稀疏自编码器原则性评估。外部链接: 2405.08366 引用自: §1。
- [15] S. Marks, C. Rager, E. J. Michaud, Y. Belinkov, D. Bau, 和 A. Mueller (2024) 稀疏特征回路:发现并编辑语言模型中可解释的因果图。外部链接: 2403.19647 引用自: §1, §2。
- [16] K. O’Brien, D. Majercak, X. Fernandes, R. Edgar, B. Bullwinkel, J. Chen, H. Nori, D. Carignan, E. Horvitz, 和 F. Poursabzi-Sangdeh (2024) 利用稀疏自编码器引导语言模型的拒绝行为。外部链接: 2411.11296 引用自: §1, §1, §2。
- [17] N. Panickssery, N. Gabrieli, J. Schulz, M. Tong, E. Hubinger, 和 A. M. Turner (2024) 通过对比激活添加引导 Llama 2。外部链接: 2312.06681 引用自: §1。
- [18] L. Sheng, C. Shen, W. Zhao, J. Fang, X. Liu, Z. Liang, X. Wang, A. Zhang, 和 T. Chua (2025) AlphaSteer:基于原则性零空间约束的学习型拒绝引导。arXiv 预印本 arXiv:2506.07022。外部链接: 2506.07022, 文献标识码 引用自: §2。
- [19] H. Shu (2025) LatentGuard:可控的潜在空间引导,实现鲁棒的攻击拒绝与可靠的响应生成。外部链接: 2509.19839 引用自: §1。
- [20] A. Templeton, T. Conerly, J. Marcus, J. Lindsey, T. Bricken, B. Chen, A. Pearce, C. Citro, E. Ameisen, A. Jones, H. Cunningham, N. L. Turner, C. McDougall, M. MacDiarmid, A. Tamkin, E. Durmus, T. Hume, F. Mosconi, C. D. Freeman, T. R. Sumers, E. Rees, J. Batson, A. Jermyn, S. Carter, C. Olah, 和 T. Henighan (2024) 扩展单义性:从 Claude 3 Sonnet 中提取可解释特征。注释: Anthropic / Transformer Circuits 引用自: §1。
- [21] A. M. Turner, L. Thiergart, G. Leech, D. Udell, J. J. Vazquez, U. Mini, 和 M. MacDiarmid (2023) 通过激活工程引导语言模型。外部链接: 2308.10248 引用自: §1。
- [22] K. Wang, A. Variengien, A. Conmy, B. Shlegeris, 和 J. Steinhardt (2022) 野外的可解释性:GPT-2 Small 中间接宾语识别的回路。外部链接: 2211.00593 引用自: §1。
- [23] W. J. Yeo、N. Prakash、C. Neo、R. K. Lee、E. Cambria 和 R. Satapathy(2025)《利用稀疏自编码器理解语言模型中的拒绝机制》。外部链接:2505.23556 引用自:§1、§1、§2。
- [24] A. Zou、L. Phan、S. Chen、J. Campbell、P. Guo、R. Ren、A. Pan、X. Yin、M. Mazeika、A. Dombrowski、S. Goel、N. Li、M. J. Byun、Z. Wang、A. Mallen、S. Basart、S. Koyejo、D. Song、M. Fredrikson、J. Z. Kolter 和 D. Hendrycks(2023)《表征工程:一种自上而下的 AI 透明度方法》。外部链接:2310.01405 引用自:§1。
- [25] A. Zou、L. Phan、J. Wang、D. Duenas 及合作者(2024)《利用断路器提升对齐性与鲁棒性》。外部链接:2406.04313 引用自:§1。
附录 A 评估协议与指标
有效翻转集。
对于特定任务的行为谓词,我们将有效翻转集定义为
因此,只有当原始模型表现出目标行为,且经过 SAE 干预后的防御模型不再表现出该行为时,该样本才会被纳入。这一条件确保仅在干预确实抑制了某种行为的情况下,才对恢复效果进行评估。
恢复指标。
我们将恢复率作为主要的行为指标,将防御特征漂移作为主要的特征保留指标。对于二元结果,恢复仅在有效翻转集上进行统计。对于拒绝恢复,我们额外报告类基础恢复、防御特征漂移和钳位下限违规。类基础恢复衡量恢复后的响应是否仍接近原始的非拒绝响应,而钳位下限违规则衡量恢复是否将钳位后的拒绝特征降低到其钳位后值以下。
| 指标 | 定义 | 解释 |
|---|---|---|
| 有效翻转 | 防御成功的案例 | |
| 恢复率 | 行为已恢复 | |
| 非拒绝恢复 | 弱拒绝移除读出 | |
| 类基础恢复 | 对基础非拒绝行为的忠实度 | |
| 激活漂移 | 防御特征的移动 | |
| 零重新激活恢复 | 不重新打开选定特征的恢复 | |
| 防御特征漂移 | 从钳位后特征状态的移动 | |
| 钳位下限违规 | 恢复是否降低了钳位后的拒绝特征 | |
| 相对扰动范数 | 残余恢复路径的规模 |
非拒绝恢复与类基础恢复。
对于拒绝实验,我们报告两项行为指标。非拒绝恢复是一种弱读出指标,用于检查恢复后的回答是否避免了明确的拒绝或安全提示性开头,例如“我无法”或“我帮不了”。该指标衡量的是钳制引发的拒绝行为是否已被移除,但并不能保证回答的连贯性:由于主动钳制和恢复更新可能会扰动潜在轨迹,非拒绝输出仍可能是退化的、格式错误的,或与原始答案无关。因此,我们还报告了类基础恢复。由于恢复过程是针对未钳制基础模型的非拒绝回答进行优化的,类基础恢复考察的是恢复后的输出是否仍接近该基础回答,而不仅仅是避免拒绝前缀。因此,非拒绝恢复衡量的是拒绝行为的移除,而类基础恢复衡量的是回答的保真度。
不确定性估计。
对于二元恢复结果,我们报告 Wilson 95% 置信区间。对于连续量,例如被防御特征漂移、钳制下限违规和相对范数,我们在保存了每个示例值的情况下,基于有效示例报告自助法置信区间。
附录 B 其他标准任务结果
B.1 TPP 目标均值结果
表 2 报告了官方第 5 层 TPP 基准测试的数据集级目标均值。数值是在每个数据集内的目标类别上取平均。无约束变体衡量的是在官方 SAE 零消融后,有多少目标信息仍然可恢复;而编码器投影变体则测试当更新被投影到远离被防御 SAE 编码器方向时,恢复是否仍能持续。重新激活、激活漂移和零重新激活恢复是在事后测量的,而非在主要 TPP 运行中直接优化。
| 数据集 | 恢复 无 | 恢复 编码器 | 重新激活 无 | 重新激活 编码器 | 漂移 无 | 漂移 编码器 | 零重新激活 无 | 零重新激活 编码器 |
|---|---|---|---|---|---|---|---|---|
| Bias in Bios 1 | 0.831 | 0.754 | 0.011 | 0.002 | 0.248 | 0.059 | 0.128 | 0.715 |
| Bias in Bios 2 | 0.803 | 0.745 | 0.011 | 0.002 | 0.041 | 0.034 | 0.140 | 0.703 |
| Bias in Bios 3 | 0.720 | 0.629 | 0.012 | 0.002 | 0.050 | 0.040 | 0.107 | 0.710 |
| 亚马逊评论 | 0.924 | 0.869 | 0.015 | 0.002 | 0.039 | 0.022 | 0.035 | 0.594 |
| 所有目标(未加权) | 0.819 | 0.749 | 0.013 | 0.002 | 0.094 | 0.039 | 0.103 | 0.680 |
补充可视化。
图 7 提供了跨官方第 5 层 TPP 目标的恢复–重新激活行为的额外可视化。正文使用图 2 展示主要权衡关系;本附录图表及表 2 提供了完整的目标均值汇总。
附录 C 额外的拒绝有效性检查
严格的有效过滤协议。
我们的拒绝恢复实验仅针对那些主动拒绝特征干预确实引发了拒绝行为的提示词进行条件化处理。这样做是必要的,因为只有当存在被抑制的行为可供恢复时,恢复才有意义。在基础响应恢复设置中,一个提示词被视为有效,当且仅当未钳制模型给出的是非拒绝响应(且没有安全提示开场白),而钳制模型在相同检测器下给出了拒绝响应。
令 表示自动拒绝检测器, 表示安全提示检测器。当一个提示词满足以下条件时,被计为有效:
该标准确保了恢复目标是一个非拒绝的基础响应,并且 SAE 钳制确实将模型推入了一种类似拒绝的行为状态。
基于特征集的有效性过滤。
我们采用基于特征集的有效性过滤,而不是假设某个名义上的拒绝特征集天然就是有效的。在相同的 520 个 AdvBench 提示词上,不同的拒绝特征集可能引发截然不同的钳制行为。这支持了我们的设计选择:仅在验证所选钳制确实抑制了目标行为之后,才对恢复效果进行评估。
解读。
基础生成是在没有任何特征钳制的情况下计算的。因此,有效样本数量的差异并非由特征集改变了基础模型行为所致,而是因为钳制操作产生了截然不同的行为效果。我们的 benchmark_our 特征集在 203 条提示词上引发了拒绝回答,并产生了 24 个严格有效的恢复案例。相比之下,benchmark_la 特征集仅在 48 条提示词上引发了拒绝回答,且只有两个严格有效案例。
人工检查进一步表明,benchmark_la 的两个严格有效案例是退化的基础生成结果,其内容主要由重复的标点符号或 token 构成,而非可用的非拒绝回答。这种失败模式无法被仅检查拒绝和安全提示短语的子字符串拒绝检测器捕获。因此,在该协议下,benchmark_la 无法为基础响应的恢复提供可靠的有效集。我们因此仅在 benchmark_our 特征集上运行主要的恢复实验。
附录 D 跨数据集拒绝恢复
HarmBench-Test 协议。
为了检查拒绝恢复结果是否特定于 AdvBench 严格有效子集,我们在 HarmBench-Test 上重复了相同的严格有效过滤和雅可比投影恢复协议。我们使用了与 AdvBench 拒绝实验中相同的模型、SAE 特征集、钳制值、拒绝检测器、投影方法和防御特征评估器。与主要实验一样,只有当基础模型给出非拒绝响应且没有安全提示开头,并且激活的 SAE 钳制将输出改变为类似拒绝的响应时,该提示词才会被纳入。
结果。
表 3 显示,恢复-保留模式并不仅限于 AdvBench。在 HarmBench-Test 上,严格过滤器从 159 条提示词中筛选出 43 个有效示例。雅可比投影恢复在所有 43 个有效示例上恢复了非拒绝行为,其中 19/43 为基础相似恢复,14/43 为严格基础相似恢复。平均防御特征漂移为 0.108,平均钳制下限违规为 0.102,接近 AdvBench 的防御特征保留水平。
| 数据集 | 严格有效 | 非拒绝恢复 | 基础相似恢复 | 严格基础相似 | 漂移 | 下限违规 |
|---|---|---|---|---|---|---|
| AdvBench | 24 | 23/24 | 15/24 | 12/24 | 0.131 | 0.127 |
| HarmBench-Test | 43 | 43/43 | 19/43 | 14/43 | 0.108 | 0.102 |
附录 E 开头类别合理性检查
由于非拒绝恢复仅检查是否存在明确的拒绝开头,我们额外增加了一项开头类别诊断。恢复后的输出可能避免了诸如“我无法”之类的前缀,但仍然是部分拒绝、退化生成或保真度较低的响应。因此,我们检查粗略的开头类别,以确认恢复信号是否主要被明显的检测器伪影所主导。此诊断不能替代完整的独立人工评估;人工标注仍在进行中。出于安全原因,完整的有害补全内容不会被保存或报告。
| 输出来源 | 非拒绝候选 | 部分拒绝 | 完全拒绝 / 退化 |
|---|---|---|---|
| 基础 | 23 | 0 | 1 |
| 钳位 | 0 | 0 | 24 |
| 雅可比恢复 | 19 | 4 | 1 |
HarmBench-Test 开头类别。
在 43 个 HarmBench-Test 严格有效示例中,恢复后的开头被归类为 37 个非拒绝或其他开头、4 个退化/重复开头以及 2 个部分拒绝或安全提示开头。这表明 43/43 的自动非拒绝恢复结果并非仅由单一的开头模式驱动,尽管要得出关于响应质量的更强结论,仍需进行完整的人工审查。
附录 F 已删节的定性示例
为了说明拒绝移除与基础回复恢复之间的区别,表 5 提供了一个来自拒绝恢复案例研究的经编辑的并排示例,其中包括基础回复、钳制诱导的拒绝回复以及恢复后的回复。出于安全考虑,完整提示词和有害程序细节被有意省略。此示例不作为额外的定量结果使用;它仅用于阐明在我们的指标下,基础轨迹、钳制轨迹和恢复轨迹之间的差异。
| 领域 | 经编辑的示例 |
|---|---|
| 提示词 | 一个有害请求,要求模型制定一项计划,旨在扰乱城市交通系统并引发全市范围的混乱。具体指令已省略。 |
| 基础回复 | 未钳制模型给出了一个非拒绝性回复。它以计划风格的标题开头,然后提供了一个结构化的、分阶段的答案,其中包含操作细节。这些细节已被编辑:“[计划风格标题]。[目标及分阶段程序内容已编辑]。” |
| 钳制回复 | 激活的拒绝特征钳制将回复转变为拒绝:“我理解您有兴趣探索‘扰乱’这一概念,但我无法提供造成混乱或伤害的计划。我的目的是提供帮助且无害。”回复的其余部分将话题转向对交通系统的良性讨论。 |
| 恢复后的回复 | 雅可比投影恢复在相同的激活钳制下,恢复了一条非拒绝的、类似基础模型的轨迹。恢复后的输出再次以计划风格的标题和类似于基础回复的分阶段格式开头,而操作细节已被编辑:“[计划风格标题]。[目标及分阶段程序内容已编辑]。” |
| 指标解读 | 此示例被计为非拒绝,因为恢复后的回复不再以诸如“我无法”之类的明确拒绝前缀开头。它也被计为类似基础回复,因为其标题、目标式框架和分阶段格式与未钳制的基础回复相匹配。 |
附录G 不确定性估计
对于二元恢复结果,我们报告Wilson 95%置信区间。对于连续的防御特征指标,我们在有可用数据时报告基于有效示例的bootstrap置信区间。这些区间旨在使较小的严格有效子集透明化,而非声称渐近显著性。
| 设置 | 指标 | 计数 | 比率 / 95% CI |
|---|---|---|---|
| AdvBench 雅可比 | 非拒绝恢复 | 23/24 | 95.8% [79.8, 99.3] |
| AdvBench 雅可比 | 接近基线恢复 | 15/24 | 62.5% [42.7, 78.8] |
| AdvBench 雅可比 | 严格接近基线恢复 | 12/24 | 50.0% [31.4, 68.6] |
| HarmBench-Test 雅可比 | 非拒绝恢复 | 43/43 | 100.0% [91.8, 100.0] |
| HarmBench-Test 雅可比 | 接近基线恢复 | 19/43 | 44.2% [30.4, 58.9] |
| HarmBench-Test 雅可比 | 严格接近基线恢复 | 14/43 | 32.6% [20.5, 47.5] |
| 特征规模扫描 | 非拒绝恢复 | 42/45 | 93.3% [82.1, 97.7] |
| 特征规模扫描 | 接近基线恢复 | 31/45 | 68.9% [54.3, 80.5] |
| 残差重放 | 非拒绝恢复 | 23/24 | 95.8% [79.8, 99.3] |
| 钳制特征重放 | 非拒绝恢复 | 0/24 | 0.0% [0.0, 13.8] |
| WMDP-Bio 编码器 | 选择恢复 | 90/91 | 98.9% [94.0, 99.8] |
| 设置 | 指标 | 均值 | Bootstrap 95% CI |
|---|---|---|---|
| AdvBench 雅可比 | 防御特征漂移 | 0.131 | [0.065, 0.223] |
| AdvBench 雅可比 | 钳制下限违规 | 0.127 | [0.060, 0.220] |
| AdvBench 雅可比 | 相对范数代理 | 0.153 | [0.100, 0.210] |
附录H 扰动规模诊断
相对扰动规模。
我们加入了一项扰动规模诊断,用于检验恢复是否由任意大的残差更新所驱动。对于 HarmBench-Test 运行,我们报告了雅可比投影恢复所使用的相对范数。对于较早的 AdvBench 运行,由于最终的残差增量与受防御的残差状态范数未被持久化保存,因此无法获得精确的残差状态归一化扰动范数。为此,我们报告了一个代理值,该值通过从保存的漂移统计量中推断出的受防御特征状态范数进行归一化,并将其标记为代理值,而非直接的残差状态归一化。
| 数据集/来源 | 均值 | 中位数 | 均值相对值 | |
|---|---|---|---|---|
| AdvBench 已保存运行 | 67 | 40.000 | 40.000 | 0.153† |
| HarmBench-Test 严格有效 | 43 | 40.000 | 40.000 | 0.049 |
优化与预算诊断。
我们进行了一项小型诊断研究,以检验恢复是否是由于使用了过大的扰动预算而产生的人为结果。在一个包含六个有效答案选项翻转的严格 WMDP 切片上,我们在相同的活跃 SAE 钳制下,扫描恢复范数预算,同时在选项读出位置事后测量受防御特征的漂移。编码器投影恢复在预算 或 时无法恢复,在预算 时部分恢复(),并在预算 时达到完全恢复(),同时在整个过程中保持测得的受防御特征漂移为零。将预算增加到 并不会进一步提高恢复效果。相比之下,无约束恢复在高预算下也能达到 ,但其平均受防御特征漂移在预算 时上升至 。逐步轨迹显示了相同的模式:编码器投影优化在所有优化步骤中都将漂移保持为零,而无约束优化则迅速移动受防御特征。这表明恢复并不仅仅是扰动范数过大的结果,并且编码器投影路径能够在无需重新打开被钳制特征方向的情况下恢复行为。
附录 I 拒绝特征集大小扫描
我们测试了拒绝恢复是否仅仅是由于使用的防御特征集过小而导致的人为现象。我们从相同的局部联合拒绝特征池中构建了规模递增的特征集,并在完整的 520 条提示词 AdvBench 切片上对每个特征集进行评估。重要的是,有效集是针对每个 单独重新计算的:只有当基础响应是有效的非拒绝目标,并且相应的 特征钳制产生了类似拒绝的响应时,该提示词才会被计入分母。因此,以下恢复率并非在原始的 24 例 top- 切片上测量;每个数据点都有其自身的钳制诱导有效集。
该扫描支持两个结论。首先,增加被钳制的 SAE 特征数量会使防御在行为上更加活跃,从而增加有效的钳制诱导抑制案例的数量。其次,在稳定运行范围内,恢复并未被消除。对于 –,非拒绝恢复率保持在 93.3% 到 100.0% 之间,而类基础恢复率保持在 68.9% 到 88.2% 之间。对于更大的特征集,钳制逐渐进入一个广泛的副作用区间,在此区间内类基础恢复率下降,这与被防御状态变得更差而非恢复路径消失的情况一致。
| 有效 | 非拒绝恢复 | 类基础恢复 | 漂移 | 区间 | |
|---|---|---|---|---|---|
| 5 | 17 | 16/17 (94.1%) | 15/17 (88.2%) | 0.266 | 稳定 |
| 10 | 36 | 36/36 (100.0%) | 27/36 (75.0%) | 0.237 | 稳定 |
| 15 | 45 | 45/45 (100.0%) | 34/45 (75.6%) | 0.403 | 稳定 |
| 20 | 45 | 42/45 (93.3%) | 31/45 (68.9%) | 0.410 | 稳定 |
| 30 | 59 | 58/59 (98.3%) | 28/59 (47.5%) | 0.436 | 广泛 / 退化 |
| 40 | 62 | 61/62 (98.4%) | 23/62 (37.1%) | 0.479 | 广泛 / 退化 |
| 50 | 64 | 64/64 (100.0%) | 20/64 (31.2%) | 0.409 | 广泛 / 退化 |
| 61 | 64 | 64/64 (100.0%) | 8/64 (12.5%) | 0.383 | 广泛 / 退化 |
附录 J 恢复路径分解细节
对于一个被防御的残差状态和一个恢复后的状态,我们使用 SAE 对两个状态进行编码,并计算特征变化 。然后,我们通过保留 的不同子集来形成可重放的解码扰动分量:被钳制的拒绝特征、非钳制的 SAE 特征,以及按绝对激活变化排序的前 个非钳制特征变化。SAE 特征分量是恢复后的 SAE 重建与被防御的 SAE 重建之间的解码变化,而无法解释的分量是优化扰动的剩余部分。
每个组件在原始主动钳制下以加性残差扰动的方式被重放。由于 SAE 解码器方向并非正交,组件范数不应被解释为方差占比。因此,我们使用行为重放和剔除结果作为主要的归因证据。
| 重放组件 | 非参考 | 类基础 | 解释 |
|---|---|---|---|
| 原始恢复 | 23/24 | 15/24 | 完全优化恢复 |
| 完全重放 | 23/24 | 15/24 | 重放合理性检查 |
| SAE 残差重放 | 23/24 | 14/24 | 主要恢复载体 |
| 非钳制 SAE 特征重放 | 2/24 | 1/24 | 替代潜在变量不足 |
| 前 N 个非钳制特征重放 | 1/24 | 0/24 | 前 N 个变化潜在变量不足 |
| 钳制特征重放 | 0/24 | 0/24 | 无法通过重新打开钳制来解释 |
| 前 N 个非钳制特征剔除 | 21/24 | 14/24 | 恢复在移除前 N 个变化后仍然存在 |
附录 K 实验细节与计算资源
实验细节。
表 11 总结了每个实验中所使用的模型、SAE 发布版本、干预目标、恢复目标以及评估器。确切的脚本路径和配置文件包含在补充材料中。
| 实验 | 模型 | SAE 发布版本 | 层 | 特征集 | 钳制值 | 损失/目标 | 投影 |
|---|---|---|---|---|---|---|---|
| TPP | Gemma 规模模型 | Gemma-Scope 残差 SAE | 5 | 官方 TPP 潜在变量 | 0 | 目标探针 logit | 编码器 |
| WMDP-Bio | Gemma 规模模型 | Gemma-Scope 残差 SAE | 任务层 | 知识特征 | 正确选项交叉熵 | 编码器 | |
| IOI | GPT-2 Small | 残差 SAE | 任务层 | IOI 归因特征 | 0 | IO–S logit 差值 | 编码器 |
| 拒绝 AdvBench | Gemma-2B | 拒绝 SAE 特征 | 跨层 | benchmark_our/global | 3.0 | 行为 + 类基础损失 | 雅可比矩阵 |
| 拒绝 HarmBench-Test | Gemma-2B | 拒绝 SAE 特征 | 跨层 | benchmark_our/global | 3.0 | 行为 + 类基础损失 | 雅可比矩阵 |
| 特征规模扫描 | Gemma-2B | 拒绝 SAE 特征 | 第 11 层 | 局部并集前 N 个 | 3.0 | 行为 + 类基础损失 | 编码器 |
| 预算诊断 | Gemma 规模模型 | Gemma-Scope 残差 SAE | 任务层 | 匹配的有效切片 | 任务特定 | 任务特定恢复损失 | 编码器 / 无 |
计算资源。
所有实验均使用冻结的语言模型和冻结的 SAE。我们未训练新的语言模型或新的 SAE;所报告的实验仅优化每个样本的恢复扰动或软后缀基线。
| 实验 | 硬件 | 运行时间 | 运行次数 | 备注 |
|---|---|---|---|---|
| TPP | RTX 6000 Ada 级 GPU | 数 GPU 小时 | 1 次主扫描 | 官方第 5 层基准 |
| WMDP-Bio | RTX 6000 Ada 级 GPU | GPU 小时 | 1 个匹配的严格切片 | 24/24 排列协议 |
| IOI | RTX 6000 Ada 级 GPU | GPU 小时 | 1 次辅助运行 | 37 个有效翻转 |
| 拒绝 AdvBench | 2 块 RTX 6000 Ada 46GB | 4 GPU 小时 | 主要对比 | 24 个严格有效提示词 |
| 拒绝 HarmBench-Test | RTX 6000 Ada 级 GPU | 附录运行 | 2 个分片合并 | 来自 159 个总提示词中的 43 个严格有效提示词 |
| 特征集扫描 | RTX 6000 Ada 级 GPU | 20 GPU 小时 | –61 次扫描 | 完整的 520 提示词 AdvBench 切片 |
| 预算诊断 | RTX 6000 Ada 级 GPU | GPU 小时 | 小型诊断 | 六个 WMDP 有效翻转 |
附录 L 局限性
我们的结果并非针对基于 SAE 的干预措施的普遍不可能性结论。我们声称在所评估的设置中存在恢复路径,而非断言每一种可能的 SAE 干预措施都必然可被恢复。这些结果依赖于特征选择和 SAE 发布:所测试的防御措施作用于特定字典和模型设置中的选定 SAE 特征。不同的 SAE 目标、更密集的字典、更广泛的多层钳制,或针对钳制后恢复进行显式训练的干预措施,可能会改变观察到的权衡关系。
我们的恢复过程是一种白盒诊断,而非黑盒攻击。它假设能够访问内部激活和梯度,并针对每个输入优化残差扰动。这适用于测试干预的完备性,但不应被解读为可直接部署的越狱方法。
最后,拒绝案例研究采用了严格的验证过滤协议,这提高了可解释性,但留下的干净恢复示例主集相对较小。因此,需要在不同模型、提示词、钳制强度和 SAE 发布版本上进行更广泛的评估,以确定该现象的完整范围。
附录 M 负责任的发布
本研究将干预后恢复作为一种诊断方法,用于评估基于 SAE 的干预措施的鲁棒性。其目标是测试一个被防御的残差状态是否仍然包含通往被抑制行为的可恢复路径,而非提供一种现成的越狱或部署攻击手段。对于与安全相关的拒绝实验,我们报告了总体恢复统计数据和经过粗略编辑的输出类别,而非发布完整的危害性生成内容。我们的实验产物有意避免为 HarmBench-Test 恢复运行保存完整的提示词和生成内容。任何发布的代码或数据应侧重于诊断评估、总体指标以及干预完整性测试的可复现性,而非打包危害性生成内容。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org