跳到正文
北京时间
原文
Anthropic:Alignment Science Blog(网页)·· 2025-04-24精选AI 评分63

Anthropic 提出对齐 Bumpers 策略,主张用多层防护捕捉并修正早期 AGI 失准

Putting up Bumpers

AI 导读

Anthropic 对齐科学博客提出名为 Bumpers 的对齐策略:即使无法彻底解决对齐问题,也可通过多层相互独立的防护来捕捉和修正失准模型。核心流程包括微调、并行审计、发现警告信号后回溯重训,以及部署后监控等次级防线,方法涵盖机制可解释性审计、红队测试、Clio 式批量监控和分阶段发布等。

推荐理由

文章提出以多层独立防护快速迭代修正对齐失败的策略,并说明其假设、局限与相关研究议程。

正文 · AI 翻译

tl;dr

即使我们无法解决对齐问题,我们也能解决发现并修复失准的问题。

如果一个孩子第一次打保龄球,只是瞄准球瓶然后投球,他们几乎肯定会 打偏。球会掉进某条边沟里。但如果安装了初学者护栏,挡住了 这些边沟的大部分长度,他们的投球就几乎肯定会至少击中几个球瓶。这 篇文章描述了一种针对早期 AGI 系统的对齐策略,我称之为“竖起护栏”,其中我们将实施和测试保障措施视为首要任务,以便在我们发现构建或部署了 失准模型时能够纠正方向,就像保龄球护栏让瞄准不佳的球能够到达其 目标一样。

为此,我们的目标是建立许多基本独立的防线,使我们能够发现并应对 失准的早期迹象。这将涉及显著改进并扩大我们对诸如 机制可解释性审计、行为红队测试和早期部署后监控等工具的使用。 我们 相信,即使没有进一步的突破,这项工作也几乎能够完全缓解我们 无意中让失准的、约人类专家水平的智能体处于能够造成严重伤害的位置这一风险。

按照这种观点,如果我们面对的是一个早期 AGI 系统,它至少在 某些关键领域具有人类专家水平的能力,那么我们的对齐方法可能大致如下:

  1. 预训练:我们从一个 预训练基础模型开始。
  2. 微调:我们尝试 通过某种组合使用人类偏好数据、 宪法 AI 风格的模型生成偏好数据、结果奖励以及当今形式的可扩展 监督,将该模型微调为一个有用、无害且诚实的智能体。
  3. 以审计作为我们的主要护栏:在 这一过程中的若干节点,我们使用多种方法并行地对 正在构建的系统执行对齐审计 。我们会借助机制可解释性、 在人类/助手框架之外进行提示等。
  4. 撞上护栏:如果我们看到 失准的迹象——也许是泛化奖励篡改 或对齐伪装的警告信号——我们会尝试 快速、近似地识别原因。
  5. 反弹回来:我们将微调 过程回退到所需的程度,以便再次尝试对齐模型,并利用 我们在上一步中学到的东西。
  6. 重复:我们重复这一过程,直到我们开发出一个完整的系统, 并且据我们所能判断,它似乎对齐良好。或者,我们反复 以一致的方式失败,于是改变计划,并尽力 阐明为什么对齐似乎难以处理。
  7. 作为次级缓冲的部署后监控:随后我们开始正式推出该系统,既用于内部研发也用于外部使用,但保留大量监控措施,以提供额外机会来发现失准。如果我们观察到严重的失准预警信号,就回到第 4 步。

缓冲方法背后的假设是,在短时间线内,(i) 这一过程相当有可能在经过合理少量次数的迭代后收敛到一个我们不再观察到失准预警信号的最终状态,并且 (ii) 如果它收敛,所得模型极有可能在相关意义上是对齐的。

我们并不确定这一假设,但我们认为它值得考虑。它已经推动了 Anthropic 安全研究组合中的主要部分,我们正在多个团队——其中两个是新团队——招聘人员,以推进这方面的研究。


引言

我们很可能在几年内就会开发出能够自动化大部分 AI 研发工作的模型。这使得破坏与消极怠工威胁模型——即模型故意干扰自身安全措施或隐藏危险能力——值得尽快应对:如果我们要在很大程度上依赖自动化对齐研究,那么正是这些系统将承担起首批承重的自主对齐项目。[1] 如果这些模型本身对齐良好,我们的工作在那一节点之后就会容易得多。如果这些模型以某种方式失准,从而促使它们进行破坏或消极怠工,那么最好的情况是,我们会因无法信任自己最好的工具而付出巨大的机会成本;最坏的情况是,我们会愚蠢地信任它们,从而让它们以我们未能察觉或挽回的方式破坏我们的工作。

理想情况下,在此之前,我们应当对围绕 AI 对齐的实证图景有透彻的理解:如果我们运行对齐流程且它看起来成功了,我们应当确信该模型实际上是对齐的。

世界上很少有研究问题在重要性上能与获得这种理解相比(而许多在重要性上确实相当的问题都以某种方式涉及 AGI 安全)。但我们不太可能及时以足够的程度取得成功,更不太可能知道我们已经成功:明确解决这个问题很可能需要许多年,但由于当前前沿监管的匮乏、行业的竞争性质,以及为安全研究和整个世界部署强大 AI 的巨大潜在益处,我们不能指望能够等那么久才开始使用这些早期 AGI 系统。

尽管如此,我预计我们仍然可以在没有这种深入理解的情况下勉强应对,同时仍使好结果成为可能。

Bumpers 是我主张以 AGI 为核心的对齐研究工作应大体优先考虑的高层计划——我预计我们会以这种方式摸索着前进。它依赖于关于我们处境的一个关键假设:

  1. 错位检测似乎是可处理的: 如果一个早期的 AGI 系统错位到足以造成不可挽回的伤害,那么很可能存在某种已知技术,可以在这种情况发生之前——也许,但不一定,在部署之前——用来确定它已经错位。
  • 如果这一点不成立,那么尝试运行上述迭代过程将无法阻止我们在不知不觉中把一个错位的模型置于可能造成严重伤害的位置。

此外,声称这一计划应成为 AGI 开发者首要任务的说法 还依赖于另外三个主张:

  1. 对齐显然并非微不足道:对早期 AGI 系统进行常规的对齐尝试,有可能产生错位的结果。
  • 如果这一点不成立,并且我们知道它不成立,那么 Bumpers 的工作就是白费力气,还会导致可能代价高昂的延误。[2]
  1. 对齐很可能是可处理的:目前最好的证据表明,像 RLHF 和 Constitutional AI 这样的现有应用对齐技术,至少在理想情况下 可以用来充分对齐早期的 AGI 系统。虽然我们在对齐模型时可能并不完全理解自己在做什么,但我们不需要取得任何深层突破就能在实践中成功。
  • 如果这一点不成立,Bumpers 的工作仍然可以通过尽早暴露其不成立的证据而具有巨大价值。这些证据随后可以推动新聚焦的研究投入以及关于风险的新具体公共沟通。然而,在这些情况下,强调使用 bumpers 来快速迭代 我们的对齐技术是错位的。
  1. 对齐理论在短期内不可处理: 我们不太可能在短期内足够好地理解错位风险,从而能够可靠地预测某个特定的对齐模型尝试是否会成功。
  • 如果这一点不成立,那么 Bumpers 的工作就代表了一种笨拙且不确定的方式,用来解决一个我们本可以通过其他手段更有信心地解决的关键问题。

这并非没有代价的选择:Bumpers 的世界观在很大程度上放弃了为安全做出高度自信、有原则的论证的能力,并且伴随着真实的风险。一种多次依赖同一组测试的试错方法将开始产生选择压力,从而削弱这些测试。此外,某些可能的错位形式会导致系统主动试图破坏我们的 bumpers。

尽管如此,我仍然期望我们能够以这样一种方式实现大约半打缓冲措施,使得(在相关能力范围内)没有任何模型能够同时颠覆所有这些措施。这并非保证,但如果能力进展继续以我们在此预期的速度推进,这是目前可用的最佳选择。

上述假设与任何关于我们在部署和使用系统之前,至少短期内,应该对系统的安全性抱有多大信心的规范性主张不同:在AI开发者近期可能达到的大多数合理信心水平下,对于我们目标的能力范围,通过优先构建和测试缓冲措施来达到该信心水平,将比构建旨在更果断解决问题的更深层次对齐科学更容易。

什么是缓冲措施?

有许多方法可以在部署前测试中合理地检测出不对齐,其当前成熟度各不相同,例如:

  • 手动专家红队测试,包括:
  • 蜜罐环境,模拟干扰人类控制的机会,可能基于真实世界数据构建
  • 非助手人格 访谈
  • 激活模糊测试、引导以及类似向模型推理中注入变化的方法
  • 大规模自动化红队测试 以寻找越狱和其他不良行为的异常触发因素
  • 可解释性审计 以寻找与欺骗或不对齐目标相关的内部表征
  • 自动一致性审计 以寻找模型行为中的策略性偏差,例如系统性地从摘要中省略某些类型的信息,或者在陈述目的不同时以可疑的不同方式执行相同的编码任务
  • 这可能包括可扩展监督风格的方法,能够识别模型行为最有可能偏离模型在反思后会认可的内容的地方[3]
  • 机制异常检测、探针以及其他基于模型内部 方法 以捕捉行为变化

除此之外,还有一些可以在部署后实施的额外方法,可能能够在任何严重的不可逆伤害发生之前,在野外捕捉到不对齐的警告信号。这些次级防御包括:

  • 实时监控、人类快速响应措施以及相关的部署时AI控制措施[4] 以捕捉和阻止严重不对齐的行为
  • 这可能包括继续使用与异常检测相关的白盒方法 ,这些方法可以访问模型的内部计算
  • 基于摘要的批量监控 (如Clio 或每用户分层摘要方法)以寻找更分散的令人担忧的趋势
  • 分阶段部署,从内部和外部开始,都先面向特别挑选的用户群体,你信任他们会向你反馈问题,并且信任他们不会 在高风险场景中使用该系统
  • 安全措施,限制模型自主访问内部系统的能力

在现代推理模型产生透明推理轨迹的有限 程度上,这些轨迹将使上述两类方法中的若干方法更加有效。

在现实情况下,这些方法中没有哪一个足够稳健到可以依赖。然而,即便只有其中六种方法,每一种都按照 AGI 开发者实质性生产工作的标准来实施,也应当足以在任何可能的早期 AGI 系统中检测出潜在灾难性的失准形式。

一个试图规避所有这些防护栏的系统将面临巨大的障碍,至少在我们所针对的能力范围内是如此。这样的系统必须能够采取有意的有害行动,同时其人类可访问的内部特征表征和书面推理轨迹都绝不暗示这一意图,即便在能够以任意方式操纵其输入和内部状态的广泛红队测试下也是如此。它需要能够区分真实的行动机会与我们众多的人工测试用例。如果模型设计的近期趋势持续下去,它还需要在其前向传播过程中无法进行比当今模型更多的主动推理的情况下做到这一点。它需要在并非显著超越人类的环境中完成这一切,以至于人类会例行地(尽管不是持续地)抽查其工作。

撞上防护栏并被弹回

如果我们遇到一个警告信号,它代表相当明确的证据表明某种常见做法将导致危险,下一步就是尝试推断其近因。 这些努力不必产生关于训练运行中出现的所有失准风险因素的全面理论,但它应当给我们一些 信号,说明什么样的应对措施能够处理失准的成因,而不是仅仅掩盖最初的症状。

这可能看起来像是阅读 RL 日志、查阅训练数据或任务、在多个训练检查点上运行评估、运行最初捕获问题的防护栏的更细粒度或更昂贵的变体,以及或许运行新设计的小型实验来检验我们的理解。特别是机械可解释性工具以及相关的训练数据归因工具,如影响函数,可以给我们提供线索,说明哪些数据对该行为负有最大责任。在简单的情况下,改变可能就像重新设计某个自动评分 RL 环境的奖励函数,或移除一批标注不佳的人类数据一样简单。 

一旦我们在这里学到了足够多的东西,能够采取行动,我们就会对微调流程做出任何最有可能解决问题的改动。除非这个警示信号也让我们对整套缓冲措施是否持续有效产生怀疑,[5]否则我们最终会继续对模型进行必要程度的重新训练以缓解该问题,并尝试新的部署。

此外,到这个时候,我们很可能已经学到了一些可复用的经验教训,应当对外分享。这既是为了让其他开发者避免自身遭遇同样的危险,也是为了让政府能够在充分了解风险的情况下做出应对。

作为来自我们真实模型开发生命周期的一个有限的早期例子:如系统卡中所述,我们对部分训练的 Claude 3.7 版本进行评估时,发现了代码任务上奖励黑客行为的迹象,我们能够通过调整标准微调技术来部分[6]缓解这一问题。

捍卫关键前提

失准的检测似乎是可以做到的

我们近期那篇审计论文的研究结果表明,至少在我们首次重大试验相对有利的条件下,有几种独立方法——涉及(除其他事项外)字典学习和非助手人格提示——能够揭示模型对齐方面的重要事实,而这些事实在普通的行为测试中不易观察到。

更广泛地说,迄今为止我们基本上没有看到自然发生的案例,即模型以明显无法被包含此类方法的彻底部署前测试所发现的方式失准。在现有可解释性技术让我们得以窥见模型认知的部分但并非微不足道的程度上,我们发现的情况似乎更符合这样一种假设:模型正在以合理的方式逼近我们训练它们去做的事情,而不是在暗中与我们作对。当我们确实看到失准时,它通常似乎是我们训练策略中偶然的、可理解的错误所导致的后果。

目前尚不清楚这种情况是否会持续下去。(关于对齐在这一意义上可能如何变得不再可行,另见下文触及能力天花板的更多讨论。)但这似乎是一个相当可能的默认结果,因此,继续构建并压力测试这些检测方法应当是我们的首要任务之一。

对齐似乎是可以做到的,但并非轻而易举

我们尚未在对齐上遭遇严重失败。当前的前沿系统已被广泛部署,并未因此暴露出我们在此所设想的、与其开发者意图之间的任何深层偏离。早期 AGI 系统中大致达到这种程度的对齐,再加上我预期会从更偏能力导向的研发中出现的任务引出方面的良好进展,[7]应当足以安全地开始部署。

当前的前沿系统也几乎没有或完全没有深层的、一致的局限性,在原则上阻止它们充当人类水平的自主研究者:我们预计,当今系统与这些具备此类能力的未来系统之间的差异,更多是程度上的差异,而非本质上的差异。因此,我们认为,通过基本相似的手段达到相似程度的对齐是合理的。

然而,我们知道标准的对齐技术可能会失败,有时失败的方式还相当微妙。近期的许多研究结果,包括涌现性失准、对齐伪装、从谄媚到诡计、Wen 等人以及Baker 等人的研究,都表明某些使用当前标准技术的方式可能导致失准模型试图颠覆人类控制。随着模型能力增强,其中至少某些类型的失败很可能会变得更难以避免。在 Bumpers 视角下,我们的挑战是构建许多冗余的方式来在出现这种情况时捕捉并纠正它。

用我们《AI 安全核心观点》一文的话来说,Bumpers 方法主要针对对齐的“中等难度”场景,即对齐是可处理的但并非轻而易举。在这些场景中,该方法使我们能够规划出一条成功部署对齐模型的路线。然而,我们预计它在许多可能更困难的情形中也会具有较小的价值,在这些情形中这项工作可以提供我们所需的关于前方危险的证据。

对 Bumpers 进行红队测试

本文的核心建议是构建并部署过去研究中已经有一定深入探索的潜在 bumpers。然而,作为一个重要的次要优先事项,我们应当在实际环境中并组合地测试它们,重点确保没有任何可能的模型能够绕过整套防护。

这将需要本着 Control 议程中元层面对抗性评估的精神开展红队演练:在这里,“红队”研究人员——他们完全了解模型将面对的一整套 bumpers——旨在制造一个故意失准的模型变体,该变体经过优化,尽可能在所有 bumpers 中存活下来,同时最终仍采取某种(虚假的)严重失准行动。如果这些研究人员成功了,那就对 bumpers 的充分性提出了质疑,并很可能指出改进它们的方法。然而,如果这些研究人员失败了,这只能提供间接且依赖条件的正面安全证据,因为可能的失准模型空间很大。

相关议程:模型生物与控制

模型失准生物体议程旨在有意开发和测试失准的模型,以理解失准可能如何出现。这是对Bumpers的自然基础研究补充:模型生物体是上述红队演练的理想输入,而来自模型生物体工作的证据有助于我们更好地推测应在何处加强防护栏,以及防护栏之间可能在何处出现相关失效。反过来,每当我们在现实世界中触及防护栏并遇到失准的警示信号时,这又能反馈到我们关于构建和研究哪些模型生物体的决策中。

AI控制议程旨在构建模型外部保障措施,使我们能够使用一个任意失准的模型,而不给它造成严重伤害的机会。Bumpers也要求模型外部保障措施和监控,并且在实践中很可能涉及一些相同的工作。但Bumpers更侧重于收集并回应关于模型实际对齐程度的证据,并考虑根据这些证据更有选择性地构建保障措施的可能性。因此,Bumpers代表了一种独特的押注,其前提是对齐既可能可解又可能是必要的。

局限性

选择压力与迭代限制

每当我们经历一次核心循环——捕捉到失准的警示信号、调整训练策略以试图避免它、然后再次训练——我们都在对我们的防护栏施加一点选择压力。如果我们经历了许多这样的循环,直到最后才看到一个能够不触及防护栏就通过的模型,我们就应该担心它仍然危险地失准,并且我们无意中选择了能够规避防护栏的模型。

这个问题的严重程度取决于防护栏的质量和多样性。(不幸的是,它还取决于你对失准可能性的先验信念,这使得这里的定量估计相当不确定。)如果你已经为上面列出的所有防护栏构建了出色的实现,那么你有可能运行这个循环数千次而不会实质性地削弱其有效性。[8]如果你只实现了两三个,而且运气不好,即使只有几次迭代也可能导致失败。

模糊的发现

不幸的是,并非所有警示信号都会附带确凿证据表明模型一旦有机会就会造成伤害:在行为评估中,错误与有意的坏行为模式之间没有清晰的区分。白盒测试在弥合复杂模型内部结构与目标等高层概念之间的鸿沟时,会涉及一些信息损失。

如果一个警告信号让消息灵通的专家认为模型的对齐程度低于预期,或者认为它有不可忽视的严重失准的可能性,那么这个警告信号就值得做出反应。这些判断必须对更广泛的竞争和监管环境做出响应:如果你有合理的保证,其他参与者并没有承担更大的风险,那么调查更多风险,并更深入地调查它们,是审慎的做法。

没有免费的午餐

与上述所有内容一致的是,充分对齐一个达到人类专家水平的模型,可能是极其缓慢和昂贵的。在这种情况下,Bumpers 方法仍然可能是最有效的策略,但它并不能让我们免于投入工作:可能的情况是,我们最初的失准警告信号清楚地表明,最有前景的对齐策略需要大量的计算或数据,或者每一次‘反弹’都意味着丢弃昂贵调优运行的大部分内容并重新开始。

在这些条件下,要让这一计划成功,仍然需要竞争和监管环境允许开发者花费所需的时间,使早期 AGI 系统能够被证明是安全的。

触及能力天花板

随着 AI 能力超越我在此设想的‘早期 AGI’阶段,bumpers 策略背后的两个关键假设很可能开始失效。

对于在推理方面大幅超越人类的系统,使用现有方法进行对齐可能会变得更加棘手,因为推动可扩展监督 研究的挑战开始显现。这应该让我们对这个过程的核心循环会终止的信心降低:可能需要更深入的新研究来弄清楚如何对齐这些系统。

同样,对于在AI 安全方面的推理大幅超越人类的系统,它们发现任何人类对抗性评估都无法捕捉到的、绕过 bumpers 的奇特方式,就变得更加可能。这应该让我们对以下判断的信心降低:即使这个过程的核心循环确实终止,这也意味着最终模型实际上是对齐的。估计我们何时到达这一点并非易事,但常规能力评估、红队演练以及来自早期模型世代的警告信号,都将为我们提供大量证据来做出这一判断。

幸运的是,一旦我们进入这种更高能力的阶段,我们很可能已经能够使用早期 AGI 系统,这些系统应该(经过一些准备)能够在人类专家水平上自动化 AI 安全研发的重要部分。如果我们像自动化对齐研究员 策略中那样善用这些智能体,我们就更有可能全面加速安全方面的进展,从而为我们提供更广泛的选项来应对这些挑战。

结论

为了顺利过渡到超人类 AI,我们可能需要将重要任务委托给接近人类水平的自动化研究员。如果这些自动化研究员存在对齐问题,导致他们破坏我们的工作——或者做出这一能力水平的模型可能做出的其他有害行为——那么前景将不容乐观。因此,我们需要能够对齐这些自动化研究员。

但似乎不太可能及时地对如何对齐具备这些能力的模型形成稳健的理解:我们的理解深度可能更像当今的机器学习工程,而非当今的航空航天工程,也就是说,我们对自己正在做的事情不会很有信心。考虑到潜在的利害关系,这是一种令人谦卑且不安的状态,但我们不应回避它。

与其致力于达到航空航天那一端——如果进展迅速,这个项目几乎没有希望取得成果——我建议我们接受这样一个事实:我们早期的 AGI 对齐工作很可能严重依赖于试错,并尽可能多地设置机制——即缓冲器——来帮助我们识别和应对这些错误。如果在这方面做出雄心勃勃但可行的努力,我认为我们能够勉强应对过去。

来帮忙吧

Anthropic 致力于认真投资于此处描述的各种措施,我们正在积极招聘。有越多优秀的工程师和研究员能够为这项工作做出贡献,我们就能推进得越快,能发表的就越多,也就越不可能不得不放弃更雄心勃勃的赌注。如果你认为自己能够做出贡献,请查看我们的招聘页面。

在 Alignment Science 的框架下,我正在组建一个新团队,将测试模型是否存在与 AGI 相关的失准形式的实践工作进行产品化和专业化。在 Alignment Science 的其他方面,我们最近在 Sam Marks 的领导下成立了一个新的认知监督研究团队,旨在改进、测试并更好地理解我们在最近的审计论文中使用的那类评估方法。我们正在继续为我们的 Model Organisms 和 Control 团队招聘,以继续推进上述相关议程。

在 Alignment Science 之外,Anthropic 对这里提出的议程的实施也直接依赖于可解释性、保障措施、微调和前沿红队方面正在进行的工作。所有这些团队都在积极招聘。

来源:Anthropic:Alignment Science Blog(网页) · alignment.anthropic.com