跳到正文
北京时间
原文
Anthropic:Alignment Science Blog(网页)·· 2025-10-27精选AI 评分63

Anthropic 发布试点版破坏风险报告,评估 Claude Opus 4 的对齐风险

Anthropic's Pilot Sabotage Risk Report

AI 导读

Anthropic 发布《2025 年夏季试点破坏风险报告》,作为其负责任扩展政策下对齐类风险论证的试点成果。报告评估以 Claude Opus 4 为主的模型,结论是其产生显著推动灾难性后果的错位自主行为的破坏风险很低但并非可忽略;内部对齐压力测试团队与独立机构 METR 均认可该风险评估,同时提出改进意见。

推荐理由

这是 Anthropic 首份试点的破坏风险报告,附内部与 METR 独立评审,可了解前沿实验室如何论证模型对齐风险水平。

正文 · AI 翻译

主要报告:
Samuel R. Bowman、Misha Wagner、Fabien Roger 和 Holden Karnofsky

内部审查:
Daniel M. Ziegler 和 Evan Hubinger

2025年10月28日

我们的负责任 扩展 政策迄今主要针对与高风险人类 滥用相关的风险而生效。 然而,它也包含未来的承诺,涉及源自模型自身 行为的失准相关风险。对于通过我们尚未达到的能力阈值的未来模型,它要求 我们 制定

一个肯定性论证,该论证 (1) 识别模型追求 失准目标所带来的最直接和相关的风险,以及 (2) 解释我们如何将这些风险缓解到可接受的水平。该 肯定性论证将酌情描述有关模型能力的证据;有关 AI 对齐的证据; 缓解措施(如监控和其他保障措施);以及我们的整体推理。

这类肯定性论证是该领域前所未有的领域:虽然我们已发表过可能 使用的论证草图,但 我们 从未准备过此类完整的肯定性论证,也不知晓其他前沿 AI 开发者 有此类文件的任何示例。

今天,本着展示我们工作的精神,我们发布一份报告,旨在大致代表 这样 一个肯定性论证,针对当今 AI 系统和部署的失准风险,作为试点工作的成果。这项工作旨在让我们及早 了解 在我们政策下此类论证变得必要时准备此类论证可能出现的 问题,发现 我们模型自主性安全战略中当今的 差距,并试点一个内部和外部 审查流程,以便我们将来可以用来验证此类承重论证。

我们用来描述这份报告的语言与当前负责任 扩展 政策中的语言略有不同:我们 将破坏作为失准 行为的 广泛类别加以关注,此类行为(例如,不同于幻觉)在高能力水平下构成独特的 新兴风险, 若没有充分准备则可能难以应对。我们将该文件命名为风险报告,以强调我们目前并非主张 我们 已达到某个特定的预定风险水平(如安全肯定性论证或 安全论证可能暗示的那样),而是阐述我们所认为的 现有 风险水平。

在这次试点工作中,我们力求达成一份完整而清晰的(即便算不上高度精炼的)评估,为此我们不惜牺牲速度。因此,这份报告捕捉的是今年夏季存在的风险,主要聚焦于涉及 Claude Opus 4 行为的风险,因为在我们开始起草这份报告时,它是我们能力最强的模型。对于后续模型,我们仅提供了较为有限的讨论。

我们的主要结论是:

在审视 Claude Opus 4 的能力、其行为特征,以及为限制其行为而设置的正式与非正式保障措施后,我们得出结论:存在非常低、但并非完全可以忽略的失准自主行动风险,这类行动会显著促成日后的灾难性后果,简称破坏风险。我们看到若干与破坏相关的威胁模型,其绝对风险水平相似但都较低。我们有一定信心认为,Opus 4 并不具备一贯、连贯的危险目标,也不具备在避免被发现的同时可靠执行复杂破坏策略所需的能力。这些总体论点对于大多数最显著的破坏路径提供了重要的 reassurance,尽管我们认为它们本身并不充分,因此我们对最显著的路径提供了更为个体化的分析。

本次工作包括与我们的内部对齐压力测试团队以及独立的人工智能安全与评估非营利组织 METR 合作进行的多轮修订。双方均能获取报告中所呈现内容之外的额外证据,并且双方都撰写了书面评审,反映其对报告结论的信心程度。两份评审最终都认可我们对风险水平的评估,尽管在某些地方对论证和证据提出了质疑,并为未来此类报告提出了改进建议。

我们从起草过程以及与两个评审团队的合作中学到了很多。这促使我们大幅修订了威胁模型,并支持了对我们与对齐相关实践的改动,包括对模型训练的调整,旨在提高模型推理的忠实性和可监控性。尽管如此,这项工作在很大程度上仍属试点,我们预计未来沿着这些方向开展的安全评估将既包含更多具体的安全措施,也包含进一步完善的论证。

核心报告团队并不认同两篇评审中提出的每一项关切,我们相信,与评审团队之间存在的一些分歧,如果有更多讨论和更多时间,本可以得到富有成效的解决。不过,我们确实在很大程度上同意这些评审,并看到了许多可以改进报告和我们保障措施的方式。我们在附录中列出了其中一些。鉴于这一问题的时效性,我们认为,将我们的工作以目前的形式发布,而不是推迟以等待在可能棘手的实证和概念问题上达成共识,是审慎的做法。

你可以在此阅读报告:Anthropic 2025 年夏季试点破坏风险报告

你可以在此阅读我们对齐压力测试团队的内部评审:对齐压力测试评审

你可以在此阅读 METR 的独立评审:METR 的评审

来源:Anthropic:Alignment Science Blog(网页) · alignment.anthropic.com