Anthropic 报告递归式自我改进进展
当人工智能自我构建:我们在递归式自我改进方面的进展
Anthropic 近日发表文章《当人工智能自我构建:我们在递归式自我改进方面的进展》,报告其在递归式自我改进方面的进展,探讨 AI 系统自我构建的能力。该文章发布在 Hacker News 上。
Anthropic这篇不是PR,是用真实内部数据画的递归路线图,代码产量8倍、实验提速50倍,让“人类设定方向、AI干活”不再只是愿景,每个从业者都该认真读一遍。
在 AI 发展史的绝大部分时间里,人类主导着其开发周期的每一步。但在 Anthropic,我们正将越来越大比例的 AI 开发工作交给 AI 系统自身来完成,这正在加快我们的工作进度。
如果这一趋势走得足够远,并拥有足够的算力,就会指向一个能够完全自主设计和开发其自身后继者的 AI 系统。这被称为递归自我改进。我们尚未达到那一步,递归自我改进也并非必然发生。但它可能比大多数机构所准备好的时间来得更早。
借助公开基准测试以及来自 Anthropic 内部此前未披露的数据,Anthropic Institute正在证明,AI 已经在加速 AI 系统的开发。仅举一例:如今,Anthropic 的工程师平均每季度交付的代码量是 2021-2025 年期间的 8 倍。
本文所讨论的技术趋势表明,未来几年 AI 系统的能力将大幅提升。这些趋势具有重大影响。能够构建自身的 AI 将是技术史上的一个重大发展——它可能为世界带来巨大的益处,在科学、医疗保健以及其他领域。但完全的递归自我改进也可能增加人类失去对 AI 系统控制的风险。如果系统能够完全构建自己的后继者,那么我们保障其安全、监控其行为、塑造其行为方式的一切手段都将变得重要得多。
2021–2023
构建第一个 Claude
早期,Anthropic 的工作看起来和任何其他科技公司没什么两样:人们在笔记本电脑上编写代码和文档。
2023–2025
聊天机器人
人们使用早期的聊天机器人来协助流程中的部分环节,比如生成简短的代码片段,再把输出复制到文本编辑器中。
2025–2026
编程智能体
随着智能体能力越来越强,它们能够自行编写和编辑代码,有时甚至能处理整个文件。
如今
自主智能体
智能体现在可以自行运行代码,并将数小时的工作委派给其他智能体。
20XX?
闭环
未来,智能体可能变得足够强大,能够自行构建和训练模型。如果这一天到来,未来版本的 Claude 或许能由 Claude 自身持续改进。
来自外部世界的证据
AI 模型改进的速度正在加快。它们能够自主可靠完成的任务时长大约每四个月翻一番,而此前的趋势是每七个月翻一番。2024 年 3 月,Claude Opus 3 能够完成人类大约需要四分钟才能完成的软件任务。一年后,Claude Sonnet 3.7 能处理大约需要一个半小时的任务。又过了一年,Claude Opus 4.6 能处理 12 小时的任务。1 如果这一趋势持续下去,一名熟练人员需要数天才能完成的任务今年就可能进入其能力范围。到 2027 年,AI 系统可能具备完成一个人需要数周才能完成的任务的能力。
同样的模式也出现在编程和研究基准上。基准衡量模型在特定领域的表现,当模型达到接近 100% 的表现时,它们就“饱和”了。2 SWE-bench 是对真实世界软件工程的标准测试:它把一个实际的开源代码库和一份真实的 bug 报告交给模型,要求它编写一个代码改动来修复该问题,并通过项目自身的测试。模型在两年内从个位数低分一路提升到使该基准饱和。
CORE-Bench 测试的是模型能否复现已有研究,这是它们开展原创研究的先决条件。它把一篇已发表论文背后的代码和数据交给 AI 模型,要求它重新运行所有内容,并确认能够复现该论文的结果。AI 系统在 2024 年复现结果的成功率大约为 20%,十五个月后便已将该基准测试刷满。METR 负责运行衡量模型完成长时任务能力的基准测试,其发现 Claude Mythos Preview 能够工作“至少”16 小时,并且“处于 [METR] 在没有新任务的情况下所能测量的上限”。
公开基准测试能在很大程度上说明这些系统的能力。但它们无法揭示 AI 系统对加速 AI 开发本身所产生的影响。要了解这一点,我们需要来自 Anthropic 等 AI 公司内部的直接证据。
来自 Anthropic 内部的证据
构建一个前沿模型需要两大类工作。一类是工程:编写代码、搭建基础设施,以及监督模型训练。另一类是研究:决定要运行哪些实验、解读返回的结果,以及弄清楚接下来该尝试哪些想法。
在工程和研究两个领域,情况是一致的。在工程方面,Claude 可以接手一个描述不充分的问题,并自行找出解决方法;人类提供目标,但不再需要提供方法。在研究方面,Claude 在执行一个定义明确的实验时,已经能够匹配甚至超越熟练的人类。然而,当涉及 Claude 在工程和研究两个领域中对目标选择行使判断力时,仍然存在巨大的性能差距。这就是当今 AI 与未来能够自主设计其继任者的系统之间的差距。
在 Anthropic,员工随着经验增长而接到更开放、更重要的任务是常见现象。早期,他们执行别人指定的任务,比如,“导出按钮坏了,请修一下。”随着经验积累,他们会接到一个目标并自行设计方法,例如,“调查为什么网络在高负载下会变慢。”在最高级别,他们在决定哪些问题值得去做:“团队下个季度应该构建什么?”我们可以利用 Anthropic 的内部数据来看看 Claude 在处理这些不同类型任务方面已经走了多远。
Claude 编写了 Anthropic 代码中的很大一部分。截至 2026 年 5 月,我们合并进 Anthropic 代码库的代码中,超过 80% 由 Claude 编写。3在 Claude Code 于 2025 年 2 月以研究预览形式发布之前,这一数字还只有个位数低位。这一转变也体现在每位工程师的产出量上。在 Anthropic 的前四年(2021-2024 年),每位工程师每天合并的代码行数保持恒定,随后在 2025 年开始攀升,当时 Claude 开始运行代码,而不再只是给出建议让工程师复制粘贴。2026 年,当模型开始以更长的时间跨度自主工作时,这一斜率再次变陡。下图展示了这两个拐点。在 2026 年第二季度,典型工程师每天合并的代码量是 2024 年的 8 倍。4这是因为大部分代码由 Claude 编写,工程师负责指导和审查,而非自己动手敲代码。

需要说明的是:代码行数是一个不完美的衡量指标,因为它衡量的是数量而非质量。因此,2026 年第二季度的8× 代码行数/工程师/天几乎肯定高估了真实的生产力提升。尽管如此,它仍表明了一种加速趋势。在 Anthropic,我们不会因为员工写了多少行代码而奖励他们;相反,团队成员产出更多代码,仅仅是因为他们在使用 AI 系统来编写更多代码。
代码行数的增长与人们对生产力大幅提升的主观感受相吻合。在 2026 年 3 月对 Anthropic 各研究团队 130 名员工进行的一项调查中,受访者的中位数估计,在他们无论如何都会从事的那类项目上,使用 Mythos Preview 时的产出大约是不使用任何 AI 模型时的 4 倍。5我们预计 3 月的真实提升幅度要略低一些。6尽管如此,我们认为这一总体说法是可信的,也与我们的其他观察一致:Anthropic 技术员工中有相当大一部分人完成核心工作的速度,比没有 AI 辅助时快了好几倍。
我们还看到证据表明,Anthropic 的员工正在使用 Claude 去做那些否则根本不会发生的工作,比如构建探索性工具、处理长期拖延的清理工作。例如,在 2026 年 4 月,Claude 提交了 800 多项修复,将某一类 API 错误减少了一千倍。负责监督 Claude 的工程师估计,人类需要四年才能完成这项工作;修复别人的 bug 既缓慢又费心,而人类很难同时在脑中记住那么多不熟悉的上下文。
大约一年前,我开始大力投入“Claude 化”。那是一段疯狂的旅程,而到现在,我已经大约 5 个月没有自己写过任何代码了。
Claude 编写的代码是“好的”,而且还在不断进步。“好的代码”意味着两件事:它能正常工作,并且其编写方式能让另一位工程师理解并在此基础上继续构建。就第一条标准而言,证据是明确的。Anthropic 员工对 Claude 进行纠正、重新引导,或在任务中途接手的比率,在过去一年里持续下降,包括在最复杂、最开放式的任务上也是如此。这类任务指的是没有明确规格说明、工程师也不确定答案应该是什么样的问题。这一点从 Claude 在不同难度任务上随时间推移的成功率中可见一斑,如下图所示。Claude 编写的代码能正常工作。

在最开放式的任务上,Claude 的成功率在 2026 年 5 月达到了 76%,六个月内上升了 50 个百分点。举一个这一难度层级任务的例子:一次例行升级开始导致数万个训练任务崩溃。一位工程师把 Claude 指向这个正在发生的线上事故,只提供了一些文本内容和集群访问权限。Claude 逐一排查正在运行的任务,一次测试一个环境设置,最终定位到那个触发崩溃的、唯一一个晦涩的调试标志,可靠地复现了它,并确认了修复方案。在大约两个小时内,Claude 交付了通常需要两到三天才能完成的工作。
第二个标准是编写另一位工程师能够理解并在此基础上继续构建的代码。在这方面,人类与 AI 之间的差距依然存在,但正在迅速缩小。Anthropic 的员工尚未达成完全共识,但许多人认为,在 2025 年底,Claude 编写的代码在质量上仍逊于 Anthropic 人类编写的代码,而如今大致已不相上下。我们预计它将在年内变得更好。
这已经改变了 Anthropic 如今审查自身代码的方式。对我们代码库提出的变更,现在会由自动化的 Claude 审查员阅读,在合并之前查找 bug、安全漏洞和其他缺陷。借助这一工具,我们进行了一次回溯分析,发现如果对代码库的每一次变更都进行自动化的 Claude 审查,本可以在过去 claude.ai 事故背后的 bug 进入生产环境之前,就捕获其中大约三分之一。编写那些代码的工程师是构建这类系统方面世界上最顶尖的人才。而 Claude 如今正在捕捉他们漏掉的错误。
在 2025 年底,Claude 编写的代码在 Anthropic 略逊于人类编写的代码,如今大致已不相上下,我们预计它将在年内明显更优。
Claude 擅长运行实验,以达成别人设定的目标。每当 Anthropic 发布一个模型,我们都会运行同一个测试:给 Claude 一段用于训练一个小型 AI 模型的代码,并要求它在仍然通过相同正确性检查的前提下,让这段代码运行得尽可能快。目标和成功指标都是预先固定的,所以 Claude 的任务就是通过重写代码、运行它、计时,再重复这一过程来找到加速方法。这是一个实验研究循环的微缩版本。2025 年 5 月,Claude Opus 4相对起始代码平均实现了约 3 倍加速。到 2026 年 4 月,Claude Mythos Preview达到了约 52 倍。作为校准参照,一名熟练的人类研究员需要四到八小时才能达到 4 倍。7在研究工作流的这一部分——优化一个定义明确的实验中的各个步骤——Claude 在不到一年时间里已经从超级有用走向了超越人类。
如今这件事的形态大致是:“人类提出想法,而模型能够以比过去快[一个数量级]的速度实现、测试和评估这些想法。”
Claude 在提出自己的实验方案方面正变得越来越擅长。2026 年 4 月,Anthropic 发布了首个 Claude 端到端运行开放式研究项目的演示。由 Claude 驱动的智能体被赋予了一个 AI 安全领域的开放问题——大致是,一个较弱的模型能否可靠地监督一个更强的模型?——然后被放任自行解决。这涉及提出假设、验证假设、与并行运行的智能体分享发现,以及反复迭代。该任务有一个明确的性能“下限”和“上限”:下限是弱监督者独自能做到多好;上限是强模型在正确答上训练后能达到的水平。两名人类研究人员在大约一周的时间里,弥合了约 23% 的差距;而智能体在累计 800 小时内弥合了 97%,并消耗了约 $18,000 的算力。这项工作存在一些注意事项:该结果未能干净地迁移到生产级模型上,而且问题仍由人类选定、评分标准也由人类制定。但在这些限制之内,所有实验都是智能体自行设计的。设定方向是人类唯一扮演的有实质意义的角色。
Claude 在 1-2 天的时间里完成了这一切,而我提供的帮助相当有限。我想,如果[一位初级同事]在同样的时间内带着这样的结果回来找我,我会略感佩服。未来已来。
Claude 在将研究会话引导向研究发现方面正变得越来越擅长。我们考察了真实的 Claude Code 会话(2026 年 1 月至 3 月期间),在这些会话中,Anthropic 的研究人员与 Claude 合作处理一个开放式探究问题,比如弄清楚为什么某次训练运行不断崩溃,或者为什么某个模型在基准测试中得分很低。在每一个案例中,我们都发现了一个研究人员走了弯路的时刻:他们沿着某个方向推进,使会话一度偏离正轨,最终才回到正轨。随后,我们向多个 Claude 模型展示了仅会话偏离正轨之前的工作内容,并询问它接下来会怎么做。另一个能够看到会话最终如何发展的 Claude 则评判,AI 还是人类提出了更好的下一步建议。8
因为我们刻意挑选了那些我们已知人类选择尚有改进空间的时刻(n=129),所以这并不是模型与人类判断之间的同类对比。这些时刻给我们提供的,是一组真实且具有挑战性的情境——在这些情境中,正确的下一步并不显而易见,而人类的选择则充当了一个有用的标尺,用来比较模型随时间推移的表现。按照这一衡量标准,我们在 2025 年 11 月的最佳模型(Opus 4.5)有 51% 的时候胜过人类的选择;到 2026 年 4 月(Mythos Preview),这一比例增长到了 64%。研究的日常工作在很大程度上就是由这些下一步决策串联而成的链条,这使得该指标能够反映模型最终自主开展调查的能力。我们将这一结果视为一个早期信号:AI 系统正越来越擅长做出 AI 研究赖以进行的那类判断。

就目前而言,人类的比较优势仍然在于看清全局、跳出眼前任务的局限去思考。
Anthropic 未来的工作形态可能会是什么样?
证据表明,在 AI 开发流程的每一步中,人类的角色都在收窄。一旦人类和 AI 编写的代码质量达到同等水平,人类将完全停止写代码,转而只做代码审查。但如果人类审查代码的速度赶不上 Claude 生成代码的速度,人类审查就会成为 AI 开发的瓶颈。同样,一旦 Claude 能够运行实验,问题就转向了“这些实验中哪些值得跑?”简而言之:执行(即写代码、跑实验、产出结果)如今在人类时间上的成本几乎为零,即便在算力上仍有成本。
目前,人类比较优势的一个领域是研究品味与判断力,包括选择哪些问题重要、信任哪些结果,以及判断一条路线何时已走入死胡同。
工作(和生活)曾依靠人与人之间小恩小惠的礼物经济运转。“你能帮我把这个脚本跑起来吗?”[…]每一次都制造了一点亏欠、一点彼此的默契。[Claude]更快,它不产生任何亏欠,但每一次这样的请求都是一次人类协作机会的流失。
在一切顺利的日子里,我忍不住觉得我所做的一切都无关紧要,一切都被自动化了,而且比我做得更好、更快。但也有一些日子,一切都崩溃了,我不明白为什么,然后我意识到,我已经完全不知道自己一直在忙些什么了。
如果我们错了呢?
对上述证据的一个自然反驳是:仍然掌握在人类手中的那部分工作——选择要攻克哪些问题——才是最重要的。没有这种判断力,Claude 是一个能力出众的助手,但并不是一个能够独自推动 AI 进步的系统。
目前尚不清楚当今的训练方法和架构能否解锁这种能力。但 AI 的进步很少是靠“尤里卡!”式的灵光一现。在 AI 的近期历史中确实有过几次这样的时刻,比如Transformer 架构,或者混合专家模型,但范式转移式的想法往往相隔数年才出现一次。在两次之间,大多数进步都是渐进式的:我们把某个东西做大,看看哪里会出问题,修好它,然后再试一次。而这正是 Claude 如今所擅长的那类工作流程。爱迪生说过,天才是 1% 的灵感加 99% 的汗水。但我们看到,汗水正变得越来越自动化。越来越清楚的是,推动前沿的许多工作都是可以自动化的;大规模的研究进展在很大程度上取决于工具和资源,它们决定了你能多快运行实验、能同时运行多少实验,以及能多快拿到结果。
即便我们假设 Claude 永远无法获得良好的研究品味,对我们证据的保守解读仍然意味着复合式加速。如果人类把大部分时间花在那些决定方向的个位数比例工作上,而 Claude 处理其余部分,那就意味着每位工程师或研究者所引导的工作量远超以往。我们看到的证据表明,Anthropic 的人既在更快地推进,也在覆盖更广的范围。在实践中,这意味着 AI 已经让 Anthropic 的推进速度远快于有效 AI 工具出现之前。
不那么保守的解读是,关于 Claude 研究判断力提升的早期证据——尽管目前还很有限——表明这项能力也在进步。“研究品味”也许只是又一项 AI 能力,AI 系统在一段时间内做不好,然后就会变得擅长。我们在其他定性技能上也见过类似的模式,比如 AI 系统能够解释一个笑话为什么好笑、展现出心智理论,以及解开语言谜题。
可能的未来
接下来会发生什么取决于两件事:这一趋势是否会持续,以及如果持续下去我们选择怎么做。我们至少可以想象三种未来情景:
- 这一趋势陷入停滞,但当今的 AI 能力已广泛扩散。本文呈现了许多指数级增长轨迹。但这些轨迹实际上可能最终是 S 型曲线。我们可能正在接近曲线的拐弯处,此时规模回报递减,曲线先变直,然后趋于平缓。区分一名合格研究者与一名杰出研究者的判断力,可能是一种无法通过扩大算力和数据等训练投入的规模来获得的能力。如果是这样,要突破这一瓶颈就需要一个新思路,比如一种能够取代当前所有前沿模型所使用的 Transformer 架构的新架构方法。
另一种可能是,AI 进步的硬性约束可能在于供应链,而非模型本身:推进和扩散前沿可能需要比目前存在的更多的能源和算力。芯片制造、电网扩建或互连带宽的速度可能是约束所在,而非智能本身。我们也不能排除 AI 生态系统遭遇外生冲击而大幅放缓的可能性,比如算力或电力供应突然减少,这两者中的任何一个都会拖慢进展,并使实验室的前瞻性投资变得更加昂贵。又或者,我们可能尚未预见到某种其他阻碍进步的壁垒。
即使模型能力被冻结在当今水平,我们仍预期世界将发生重大变化。Project Glasswing就是一个早期迹象:在最初几周内,Mythos Preview 在全球最重要的系统中发现了超过一万个高危和严重级别的软件漏洞——数量之多,以至于网络防御的瓶颈已经从发现漏洞转变为足够快地修补漏洞。而我们仍处于当今模型向更广泛经济扩散的早期阶段,在这一阶段,一家 100 人的公司越来越能做一家 1000 人公司的工作,因为每位员工都将坐拥一个智能体金字塔。
我们出于完整性考虑纳入了这一情景,但我们认为它不太可能发生。我们能够衡量的每一项能力,包括那些感觉更“软性”的能力,比如代码质量和在开放式任务上的成功率,迄今为止都遵循着同一条曲线。我们尚未看到这条曲线出现弯折。在我们考虑的三种未来中,这一种会给政府和社会最多的适应时间。我们更担心接下来的两种,它们变化更快,留给准备的空间也小得多。 - AI 实验室持续获得复合式的效率提升。在这种情景下,AI 开发变得大幅自动化,但人类继续设定研究方向并评判结果。使用 AI 系统的组织会随着时间推移变得高效得多,因此我们可以预期该组织中每个人的生产力都会出现显著的倍增效应。100 人的公司可以完成 10,000 人或 100,000 人组织的工作。这将彻底改变知识工作和政府服务,但也可能被用于有害目的,从对全体人口的威权式监控,到为每个个体量身定制操纵手段、并以任何人类团队都无法匹敌的规模运行的影响力行动。在 Anthropic 这样的公司里,人类的角色将发生转变。人们将与 AI 系统协作,以扩大研究规模并产生新的洞见,二者将共同构建所需的系统,以验证 AI 的输出可以被信任。
我们在此列出的证据表明,我们很可能正走向这一情景。但加速一个流程中的某一部分,往往只是把瓶颈转移到别处:整体速度受限于那些尚未加速的部分。在计算领域,这被称为阿姆达尔定律,同样的逻辑也适用于组织。Anthropic 已经遇到了阿姆达尔定律的一个典型征兆:随着我们开始在整个组织内推动更多代码流转,人工代码审查已成为新的瓶颈。
我们在工程领域之外也遇到了这种摩擦。由于 Anthropic 员工与能力极强的模型协作,新想法、新举措、新工具和新模拟呈爆炸式增长——远远超出我们有能力去推进的数量。组织发现并修复这些瓶颈的速度,可能是一项会随时间不断提升的技能,也可能成为任何组织最重要的技能。 - AI 系统本身变得有能力进行完全递归式自我改进,并开始构建它们的后继者。如果推进能力的技术趋势持续下去,并且AI 系统能够发展出变革性人类创造力所固有的那些能力,那么 AI 系统有可能设计并完善自身。
在这个世界里,AI 开发进展的速度完全取决于 AI 系统可获得的算力(或发现算法训练或推理中各种效率提升的速度)。人类在其发展中所扮演的角色大幅缩减,我们的努力很可能大部分转向对一个由 AI 系统运行的不断扩张的“虚拟实验室”进行监督、验证和核查。我们预计,能够进行自动化 AI 研究与开发的系统将具备可迁移到其他科学领域的技能,使它们能够开始彻底变革其他领域。
在这一未来中,对齐问题如何得到解决——或者得不到解决——是我们最不确定的事情。模型可能被证明已足够对齐,并且具备足够的研究品味,从而发现并实施我们尚未达到的新颖解决方案。如果做不到,它们也可能足够明智地停止开发。或者,当今模型中存在的那些罕见的不对齐情形,可能会随着模型构建其后继者而累积,变得越来越频繁却越来越不被理解,直到我们失去对它们的控制。有可能我们无法构建、整合并验证我们所需的工具,以理解我们实际正处于哪条趋势线上。
我们对这个世界会是什么样子缺乏良好的直觉,因为我们的经济目前是由人类和人类建造的工具驱动的。就其本质而言,一个由快速递归式自我改进驱动的世界,可能会被那个自我改进的模型所主导,因为它的能力将全面超越人类,并在更广泛的经济中扩散开来。如果人类劳动不再具有竞争力,经济会是什么样子,很难预测。
即便模型开发变得完全自动化且递归化,我们也无法预测这对大多数人的日常生活意味着什么。阿姆达尔定律在这里同样适用。递归智能可能在某些领域迅速带来《慈爱的机器》中所描述的诸多好处。我们预计,具身智能(即机器人技术)可能会紧随递归智能之后,并走上一条成本递减、回报递增的相似路径。更强大的智能或许能帮助我们更快地在物理世界中建造事物,开展更高效的救命药物临床试验,并发展出新型的协调形式。
但仅实现递归式改进,并不意味着工业生产方式、社会组织方式或市场运作方式会立即改变。再多的智能也无法在药物使用数十年之前就了解其效果,无法在宪法规定的期限之前举行选举,也无法在一个周末把陌生人变成老朋友。对大多数人来说,这个未来可感知的节奏仍将由各种瓶颈决定,即便上游的实验室以算力的速度运转。递归智能以越来越快的速度构建自身,与人类、人际关系和治理的世界相碰撞——这种碰撞,是这个未来中我们同样无法预测的另一部分。
我们该怎么做?
如果能够有效减缓这项技术的发展,为我们争取更多时间来应对其巨大影响,我们认为这很可能是一件好事。但如果减缓只是让最不谨慎的参与者在技术上迎头赶上,反而可能让所有人都更不安全。在没有全球协调机制的情况下,企业和政府将不得不在竞争与地缘政治压力之下,做出艰难的安全决策。
我们认为,让世界拥有选项去减缓或暂时暂停前沿 AI 的发展,以便社会结构和对齐研究能够跟上技术的进步,这对世界来说是件好事。Anthropic Institute 将与众多其他机构合作开展研究,并采取行动,帮助构建一个可信的减缓或暂停所需的体系。这些体系将使前沿 AI 开发者能够验证全球其他开发者确实已经停止或减缓,并且恶意行为者无法借协调减缓之名暗中抢先。如果这样的体系存在,我们预计,只要处于或接近前沿的其他开发者也以可验证的方式这样做,我们就会减缓或暂时暂停。
要实现有意义的放缓或暂停,需要多个资源充足、处于或接近前沿的实验室,分布在多个国家,同意在相同条件下停止。这还要求每一方都能核实其他方确实已经停止。由于 AI 系统的独特特性,这一军控问题中的可探测性(比可验证性更低的标准)要素要困难得多,远超其他技术。训练运行远比导弹发射井更容易隐藏,其输入是通用的,而悄悄违约的动机极其巨大,因为谁在别人暂停时继续推进,谁就可能继承领先地位。可信的暂停还必须明确:什么触发它、什么解除它,以及由谁裁决。
原则上,这一切并非必然不可能——世界已经为其他复杂技术建立过核查机制(例如《中程核力量条约》)——但这些机制花了数十年才同时建立起基础设施和信任。我们没有那么长时间。相比之下,由单个实验室单方面暂停可以立即实现,但成效要小得多:它会改变谁是领跑者,但不会创造出当前所缺失的那种更广泛的审议过程。
在未来几个月里,我们将组织对话,让政策制定者、研究人员、公民社会和其他 AI 公司帮助回答这篇文章提出的一些问题,尤其是围绕完全递归式自我改进,以及如何为协调与审议创造更好的选项。我们会把对话成果公开发布。共同探究这些问题的窗口就在当下,AI 公司之外的人也应当参与这场审议。
本文由 Marina Favaro 和 Jack Clark 共同撰写,Santi Ruiz 提供编辑支持。Shan Carter、Romello Goodman 和 Nikki Makagiansar 根据 Brian Calvert 和 Jun Shern Chan 收集的数据制作了可视化内容。Daniel Freeman、Jim Baker、Max Young、Sarah Pollack、Francesco Mosconi、Holden Karnofsky、Andy Jones、Kevin Troy、Chloe Lubinski、Anton Korinek、Meg Tong、Andrew Ho、Dan Altman、Drake Thomas、Jack Shen、Sasha de Marigny 和 Avital Balwit 提供了反馈。
脚注
- METR 的核心指标告诉你,AI 系统在一组任务上能够达到 50% 可靠性的时间跨度,不过在 80% 可靠性下,趋势线看起来是一样的。
- 尤其是当它们转向更开放式的格式和更困难的任务(例如奥林匹克级别的数学)时,基准测试往往会在低于 100% 时饱和,原因是问题和答案集中存在错误,比如问题表述含糊和无法解决的问题。
- Anthropic 领导层曾公开估计,我们 90% 或更多的代码是由 Claude 编写的,包括脚本和实验性代码。我们 >80% 的数字衡量的是合并到生产环境中的代码行中可归因于 Claude 的比例。这是一种在两方面更为保守的衡量方式:我们的归因流程存在缺口,而且未归因于 Claude 的代码行还包括自动生成的代码以及其他同样并非由人类手写的产物。
- 代码产出量的激增正在给所有人共享的基础设施带来压力。GitHub——全球大多数软件所依托的平台——在 2025 年全年大约处理了 10 亿次代码提交;到 2026 年年中,它每周就有 2.75 亿次提交,按此速度全年约为 140 亿次。该公司 COO 表示,为了跟上节奏,他们正在“极其拼命地”扩充容量。
- 关于本次调查方法的更多细节,请参见 Claude Opus 4.7 System Card 第 2.3.5 节。
- 许多受访者可能并未仔细考虑如何应对问题定义中的各种偏差或微妙之处,而 METR 近期的研究表明,开发者对 AI 生产力提升的估计可能会被高估。
- 加速幅度能有多大,很大程度上取决于起始代码留出了多少改进空间,因此不应将其解读为真实世界中的训练加速。所以,绝对的倍数并不是这里应当锚定的数字。更有信息量的是这一实验设置所能实现的同类对比,既包括跨模型的对比(过去一年从约 3 倍到约 52 倍),也包括与熟练人类的对比(在相同任务上,四到八小时内约 4 倍)。
- 为了检验评判者偏差,我们在另一组 127 个时刻上运行了相同的测试,这些时刻中人类下一步的走法本就已经很强(而原始数据集中,人类的方向还有改进空间)。在那里,模型的建议仅在约 20% 的情况下被评为更好。
* 本文中引用的 Anthropic 员工言论均来自内部讨论,并已获得使用许可。这些言论反映的是截至 2026 年 5 月的个人观点,不代表公司的官方立场。
来源:Hacker News 热门(buzzing.cc 中文翻译) · anthropic.com