跳到正文
北京时间
原文
英国 AI Security Institute:Blog(网页)·· 2026-07-02精选AI 评分70

AISI 研究:智能体评测需计入 test-time compute,固定预算会低估能力

More compute, more capability: Why AI agent evaluations need to account for test-time compute

AI 导读

英国 AI Security Institute 发文指出,智能体能力不是单一分数,而是随 test-time compute 变化的曲线,固定预算评测会系统性低估前沿智能体能力,尤其对新模型。

推荐理由

AISI 用多预算扫描实验说明固定 token 预算会系统性低估前沿智能体能力,对评测方法和政策判断都有参考价值。

正文 · AI 翻译

随着 AI 智能体被赋予更多自主权和更困难的任务,低估其能力所带来的后果也愈发严重。大多数智能体评估仍将能力简化为一个单一数字:基准分数、通过/失败,或智能体能够完成的任务长度。这个数字掩盖了一个关键的设计选择:智能体在停止之前被允许花费多少算力。

2026 年 3 月,AISI 发布的结果表明,适度的算力限制会低估模型在网络任务上的能力,而且同样的限制如今可能已经错过了实质性的提升。此后,我们的评估科学团队在多个智能体基准上以大规模测试时预算运行了前沿模型,涵盖网络安全、软件工程、数学、学术任务和医疗保健。 

我们发现,固定预算评估会系统性地低估前沿智能体能力,尤其是对较新的模型。 首先,智能体在完成任务时可以花费的算力——即“测试时算力”——是其在众多基准上观测到能力的主要驱动因素。其次,任务所需的算力随着一名熟练人类完成该任务所需时间的增加而上升,因此最长、最难的任务会最先被固定预算截断。最后,我们发现较新的模型从额外算力中获得的收益不成比例地大。 随着模型改进,固定预算分数与更高预算能力之间的差距可能会扩大。

这些测量效应具有实际后果。受限预算的分数会使模型比较变得不公平,导致决策者低估智能体能力,并掩盖风险的真实规模。随着智能体不断改进,这一盲点只会越来越大,除非我们的测量能够考虑能力曲线。 

我们做了什么

测试时算力可以通过两种不同的方式提升性能。Token 可以用于不同类型的工作:执行任务步骤,或支持推理、规划和检查解决方案。同样的算力也可以串行分配,即一条让智能体探索并修正错误的长轨迹;或者并行分配,即多次较短的尝试,以提高其中一次尝试成功的概率(图 1)。

额外算力去向示意

更多的测试时算力换来的是更长的串行工作流,或更多的并行尝试。过早停止,你可能会截断本可解决任务的串行步骤,或一次全新的尝试。

‍

图 1. 测试时算力如何塑造性能。 给定的算力预算可以用于一次漫长、深入、串行的尝试(上),也可以分散到多次较短的独立尝试中,再汇总评分(下)。串行分配为智能体提供了进行长时间工作循环的空间,而并行分配则提高了至少有一次成功运行的概率。移动预算截断点可以展示这些选择如何改变测得的性能。

我们没有在固定预算下对每个模型只评分一次,而是将 token 预算从低到高进行扫描,并测量性能如何变化。随着预算增长,我们追踪了四个量:总体成功率、可靠性、效率,以及模型能够触及的最难任务。

我们还分析了单个任务层面的结果,而不仅仅是整个基准的分数。在相同任务上比较连续几代模型,可以展示能力曲线如何随着智能体的改进而移动。

我们的发现 

模型能力不是单一分数,而是随测试时计算量变化的一条曲线。

AI 智能体在一组任务上的表现,最好理解为一条能力曲线,它刻画了随着计算预算增长,其得分如何变化(图 2)。 如果评估停止时曲线仍在上升,那么所报告的分数就是下界,而非模型能力的上限。  

更多测试时计算量,更强能力示意

当 AI 智能体获得更多计算量来处理任务时,其表现会攀升。随着更新的模型更善于利用测试时计算量,模型之间的能力差距会拉大。

前沿模型 近期模型 较旧模型

实心点:预算内最难的任务 空心点:高计算量下最难的任务

‍

图 2。 每条曲线展示了随着测试时计算量增加,所测得的能力如何变化。将预算从低提高到高,会解锁更难的任务,并拉大较弱模型与较强模型之间的差距。灰色区域是当预算过早停止智能体时仍被隐藏的能力。数据仅为示意。

在 AISI 的网络安全窄任务套件中,我们发现模型的成功率随着每任务计算预算的增加而稳步上升(图 3)。约 8% 的任务只有在预算达到 1000 万+ token 时才被解决,有些甚至需要高达 5000 万 token。在较小预算下,这些成功将不可见。最新模型在 1 亿+ 的预算下取得了更高的分数。

图 3。 每个面板绘制了在基准测试(Cyber CTFs = AISI 的窄网络安全任务套件)中所有任务聚合后的累计成功率,与消耗的总 token 数的关系。x 轴为对数刻度,因此每个标记代表 token 数增加 10 倍。 来源。

同样的模式也出现在公开基准测试上。将总 token 预算从 100 万提高到 1000 万,使软件工程任务(TerminalBench 2.0、SWE-Bench Pro)的表现提升了约 25%,使数学和学术任务(Humanity’s Last Exam,最高 500 万 token)的表现提升了约 22%。在 TerminalBench 上,即使我们将 token 预算提高到公开评估通常报告值的 10 倍,表现仍在持续改善。1

任务对人类来说耗时越长,智能体所需的计算量就越多。

在 AISI 的网络安全任务和 METR 的软件工程任务中(图 4),我们发现智能体解决任务所需的计算量,与任务对熟练人类所需的时间成比例。2 即使对每个任务最廉价的成功运行,这一模式也成立,这表明下限是由任务所需的工作量决定的,而不仅仅源于计算使用效率低下。这有助于解释为什么基准曲线能随着预算增加而平稳持续上升:每个更大的预算都会触及另一部分计算需求更高的任务。

到目前为止,我们仅在网络和软件工程任务中测试了这一点;趋势周围的波动很大,而人类时间只是任务难度的一个不完美代理指标。随着模型改进,或者在那些工作可以更容易被压缩的领域,这一下限可能会移动。但对于当今这些领域中的智能体而言,人类任务时间范围是预测观察到一个任务成功所需计算量的有用指标。

图 4。每个点表示任何被观察到的智能体解决一个任务所需的最少 token 数,与任务的人类时间范围相对应,涵盖 211 个软件工程任务(METR,蓝色)和 78 个网络夺旗任务(AISI,红色)。数据来自 2025 年 4 月至 2026 年 4 月发布的 11 个前沿模型,用于 AISI 的狭义网络任务(CTF),以及 2023 年 3 月至 2025 年 12 月发布的 20 个前沿模型,用于 METR 的任务。

由于任务所需的预算随其长度增长,固定的评估预算会最先在最长任务上耗尽 token,而较短任务仍能获得完整尝试。因此,有上限的预算可能低估模型能够解决多长的任务:被截断的任务系统性地是最长的,所以失败可能意味着运行预算不足,而不是智能体缺乏能力。例如,AISI 的网络靶场“The Last Ones”估计需要人类专家大约 20 小时才能完成。在我们测试的模型中,直到给予至少 30M token 的计算预算,才有模型能够完成它。

更高的预算揭示出更大的当前能力和更快的前沿进展。

我们发现,较新的模型将额外的测试时计算转化为比旧模型更大的收益(图 5)。这意味着能力曲线不仅向上移动,而且形状也发生变化,尤其是在更难的任务上。

图 5。 前沿模型的进展沿三个轴重塑任务的能力曲线:覆盖范围、可靠性和效率。调整控件,看看这些收益如何在一系列任务中复合。数据仅作示意。

这些收益体现在三个轴上。较新的模型能解决更难的任务(覆盖范围),更稳定地成功完成这些任务(可靠性),并以更少的 token 解决某些任务(效率)。3

我们通常通过估计模型时间范围翻倍的速度来追踪前沿进展:如果一个模型今天能完成 8 小时的任务,那么下一个模型能处理 16 小时的任务还需要多久?但模型估计的时间范围——以及随着更新模型发布而翻倍的速度——取决于计算预算。

图 6A 和 6B。每个模型的 80% 时间范围是指模型有 80% 概率成功完成的人类任务完成时间,具体针对狭义网络任务。时间范围通过对 token 截断成功率进行惩罚逻辑拟合来估计。翻倍率仅在前沿模型上估计。

我们使用这个 80% 时间范围来探究网络能力移动得有多快。在之前的研究中,我们估计,自 2024 年底以来,AISI 网络 CTF 套件上的前沿模型时间范围每 4.7 个月翻一番,这是在每个任务固定 2.5M token 预算下测得的。我们指出,这一预算上限可能低估模型在更大计算预算下所能达到的水平。 

对于过去一年发布的模型,当任务 horizon 以 50M tokens 而非 2.5M tokens 估算时,拟合的前沿趋势陡峭约 60%(图 6B)4。换言之,估算的翻倍速率部分取决于评估所用的算力预算,而非前沿网络进展的固定属性。

图 6A 在模型层面显示了同样的效应。新模型与旧模型之间的差距也随着给予的算力增加而扩大:一个近期前沿模型的 horizon 从 2.5M-token 预算下的约 40 分钟上升到 50M-token 预算下的约 4 小时(图 6A)。在当前前沿,将预算从 2.5M 提高到 50M tokens 会使估算的 horizon 从(大约)2 小时增加到 14 小时(图 6B)。

其他研究支持这些发现。在 Epoch 的 MirrorCode 上,模型被要求从零重建现有软件程序,一个近期模型使用了多达 10 亿 tokens 才取得先前模型无法取得的进展,而这本需要人类工程师数周的工作。 

讨论

脱离用于估算的算力预算,就无法解读 agent 能力。预算会改变测得的性能,决定评估能够触及哪些任务 horizon,并塑造前沿看起来移动的速度。评估应报告能力曲线,尤其是在性能可能仍在上升时。

这对部署、经济价值和风险的决策很重要:在过小预算下测得的分数,可能让模型看起来比在现实使用中拥有更多算力时能力更低。

了解能力在何处趋于平台期至关重要。重要的是,随着每 token 成本下降,更高的测试时预算变得越来越可及,曾经可能昂贵到令人望而却步的能力,可能会随时间变得更便宜、更易获得。

这一切都不需要对 AI 的走向做出戏剧性的断言。这是一个良好测量的问题:如果我们继续把能力当作固定分数,而不是随算力变化的曲线,我们就会不断对这些系统在投入更多算力时能做什么感到惊讶。对于依赖这些结果的开发者、评估者和政策制定者而言,将测试时算力纳入能力的测量和报告方式,决定了一个数字是能为决策提供信息,还是在悄然误导决策。

我们的发现提出了三个开放问题:

  1. 更多算力在哪里能可靠地换来更多能力,为什么?收益似乎在 agent 能够检查自己的工作并从错误中恢复的地方最强,例如代码、网络和数学。在反馈缺失、延迟或嘈杂的地方,收益可能较弱。
  1. 高预算性能能否从更便宜的运行中估算?这很重要,因为信息量最大的评估可能很昂贵。
  1. 人类任务时间能在多大范围内预测模型所需的算力?这种关系出现在网络和软件工程任务中,但可能因领域而异,并可能随着模型变得更加 token 高效而改变。

展望未来 

这些发现已经在塑造 AISI 的评估:

  1. 我们在多个预算下评估前沿模型,包括针对最难任务的超大预算。 
  1. 我们报告相对于预算的可靠性和触及范围,以便将真正低能力的模型与资源不足的评估区分开来。
  1. 我们正在努力定义“最小信息预算”,方法是检查模型的覆盖范围是否随着算力的增加而停止上升。
  1. 我们正在开发从更便宜的运行中预测高预算性能的方法。
  1. 我们正在与国际合作伙伴分享这项工作,以支持对能力日益增强的 AI 智能体进行稳健的评估和报告实践,正如领先提供商目前所做的那样。 

如需更深入地了解我们评估的结果,请阅读完整的技术论文:关于跨基准的测试时扩展以及分解测试时扩展曲线(即将发布)。

来源:英国 AI Security Institute:Blog(网页) · aisi.gov.uk