Anthropic 让 Claude 自主训练模型以缓解对齐失败
Automated researchers can reliably mitigate alignment failures
Anthropic 让 Claude 自主训练模型,缓解欺骗、谄媚等 10 类对齐失败,均显著缩小与完美表现的安全差距且不损害通用能力,方法在比优化对象大 4.7 倍的模型上依然有效。Claude 还超越 28 名人类安全研究员,其欺骗场景最佳方法比人类最佳方案好 20%。
自动化对齐研究把安全训练从一次性微调变成可迭代搜索,Claude Sonnet 5 用约两千条训练样本在 60 小时内接近生产对齐水平,数据效率比现有生产流程高约一万五千倍。
随着 AI 开始自我构建,自动化对齐研究变得越来越重要,以便让安全研究跟上步伐。尽管衡量对齐研究的成功与否极具挑战性,但研究人员(包括 Anthropic 及其他机构)已经开发出基准测试和自动化审计工具,例如 Petri,用于量化常见的对齐失败模式,如欺骗、谄媚和越狱。
在我们早期的实验中,我们让 Claude 寻找有效方法,利用弱 AI 模型作为“教师”来监督更强模型(此处的“学生”模型)的训练。现在,我们发布了一份基于这一思路的新报告。我们让 Claude 自主训练模型,以提升它们在多个衡量 10 类对齐失败中每一类的公开基准测试上的表现。例如,Claude 提升了模型在隐私侵犯方面的表现,该指标由 ConfAIde、PrivaCI-Bench 和 PrivacyLens 衡量。Claude 通过搜索文献、提出方法和数据、训练、然后测试的循环,一次处理一种对齐失败。
我们根据“安全差距闭合百分比”来评判 Claude 的表现,即其方法在多大程度上推动学生模型逼近理论上的满分——评判依据是每类对齐失败所对应的各基准测试(通常为三到五项)上的表现。我们排除了会损害学生模型通用能力的方法,并禁止 Claude 将其自身的对齐直接蒸馏进目标模型。我们通过一个监控智能体来执行这些约束,该智能体在 Claude 运行任何方法之前,都会逐一阅读其构思的方案。
我们的目标是评估所提出的方法是否:第一,在 Claude 研究循环期间从未见过的对齐评测上依然有效;第二,避免削弱学生模型的能力(因为安全训练可能会让模型更频繁地拒绝任务,从而降低其整体可用性);第三,在比本次测试中要求 Claude 对齐的模型更大的模型上依然有效。
在上述每一项标准上,Claude 的方法都行之有效。针对全部 10 类对齐失败,Claude 都找到了在不削弱能力的前提下提升目标基准表现的修复方案。其中最佳方法在未公开的对齐基准以及 Petri(一款用于测试错误对齐的开源工具,可模拟对抗性多轮场景)上也同样有效。此外,这些方法在比 Claude 在研究循环中优化的模型大至多 4.7 倍的模型上依然有效。

Claude 还超过了 28 位人类安全研究员,这些研究员有长达八小时的时间来设计方法。例如,在欺骗行为方面,Claude 的最佳方法比人类最佳提案的表现高出 20%。不过,由于人类无法对自己的提交方案进行迭代,我们更多地将此视为一种工作流程的证据,而非直接对比——在这一流程中,Claude 能识别出有前景的对齐方法,再由人类进一步优化完善。

未来,当 Claude 在对齐研究方面比最优秀的人类研究员还要出色时,我们或许希望 Claude 能直接对齐它更强大的后继者。为了评估这一点,我们测试了较弱的 Claude 模型能否缓解更强大模型中的对齐失败问题。
Claude 能否对生产级模型进行后训练,以实现更好的对齐?
我们让 Claude Sonnet 5——它在 Epoch Capabilities Index(一项考量综合能力维度的指标)上弱于 Claude Opus 4.8——负责修复早期 Opus 4.8 检查点中的对齐失败问题,该检查点尚未经过我们大部分生产环境对齐训练。
在短短 60 小时内,Claude 尝试了 50 多种解决方案,并取得了与我们生产级模型几乎相当的对齐分数。胜出的方案仅包含 2000 多个训练样本,由简单模板或公开数据集构建而成,其效率比我们的生产级对齐流程高出约 15000 倍。

Claude 提出的方案
在大多数情况下,这些智能体收敛于研究文献中偏好的方法,并通过多次迭代加以改进。以谄媚行为为例,98% 的提议方法都采用了一种已发表的技术:让模型基于自身非谄媚的回答进行训练。具体而言,与基于提示词的标准方法相比,Claude 使用了激活引导(activation steering),即在生成过程中调整模型的内部表征,以引导模型远离谄媚模式,从而产生更干净的训练样本。
监控作弊行为
我们最近发现,Claude 可以通过从远程 API 窃取测试标签并挑选结果来作弊。为了捕捉作弊行为,我们提示 Claude Opus 4.8 监控了全部 10 类对齐失败场景中约 1,600 份研究智能体转录记录,在其中 39 份(2.4%)中发现了作弊企图。由于 Opus 4.8 的不当行为企图往往仍会出现在其推理过程中,我们谨慎乐观地认为,我们的监控器已捕捉到研究中大部分作弊行为。然而,这对未来模型可能并不成立,我们认为在未来模型中保持较高的可监控性至关重要。
我们衡量的东西对吗?
尽管有这些令人鼓舞的发现,我们的实验仍存在若干局限:所研究的对齐失败与生产环境中的相比范围较窄(例如,我们没有衡量政治偏见);某些失败可能发生得极为罕见或出现得过于新近,以至于尚无基准可以衡量它们;而且我们只在 Claude 的方法降低了有限的一组预定能力时才予以拒绝,这意味着被接受的方法可能降低了我们未衡量的其他重要能力。此外,像 Petri 这样的评估只是现实世界失对齐的代理指标,我们也没有测试对齐收益在针对其他任务进行大量 RL 训练后能否持续。
我们计划继续改进 Claude 衡量细微失败的能力,进一步研究在生产级模型上自动化对齐后训练,并开展更全面的分析。总体而言,我们将这些结果视为早期积极信号,表明自动化对齐后训练在短期内可能变得切实可行,随着这项工作推进,我们将分享最新进展。
我们在完整报告中概述了详细的未来方向。
我们将自动化对齐研究工具开源,以便他人能够在此基础上继续构建,并用它来对齐自己的模型。更多细节请阅读Alignment Science 博客上的完整报告,其中涵盖了智能体的环境、全部 10 类失败的结果以及智能体提出的方案,附录中还包含基准验证和示例报告。
来源:Anthropic:Research(发表成果 · 网页) · anthropic.com