AISI 与 Irregular 发现加大推理预算可显著提升 AI 网络任务成功率
Evidence for inference scaling in AI cyber tasks: Increased evaluation budgets reveal higher success rates
AISI 与 Irregular 联合研究发现,近期前沿模型能有效利用远超常规评测设置的推理预算:AISI 用 50M token 上限、Irregular 用 1000 turns,均观察到成功率随预算扩大持续上升,约 8% 的 AISI 任务只有在预算从 10M 提到 50M token 时才被解决。
AISI 与 Irregular 用更大推理预算实测发现常规评测低估模型网络攻击能力上限,并给出按 cost per success 选预算的方法。
AI 评估是否跟得上智能体在网络任务上的表现?
AI 网络能力的提升十分迅速。AISI 的评估显示,最先进的模型如今已能频繁完成学徒级网络任务,偶尔还能完成需要 10 年经验才能胜任的专家级任务。Irregular 的评估同样记录到一次显著的能力跃迁,此前成功率近乎为零的高难度任务如今升至约 60%。这类能力评估有助于开发者、研究人员和政策制定者跟踪进展并评估潜在风险。但新证据表明,标准的评估设置如今可能低估了模型在网络任务上的能力上限。
评估会对智能体可运行的时间设定限制,例如步数(“轮次”)、token、时间或花费的上限。这些限制使测试保持低成本且可比较,但隐含地假设额外预算不会显著改变估计的性能。直到最近,额外预算很少改变结果:许多模型很快达到平台期,在状态跟踪、故障恢复和长时程规划方面表现吃力,因此更多预算大多意味着更高成本而非更高成功率。
自 2025 年 11 月以来,这一假设在网络场景的前沿模型上似乎正在瓦解。我们与 Irregular 合作发现,近期模型能够有效利用比该领域典型评估设置所允许的大 10-50 倍的 token 预算,从而展现出更高的成功率,并首次解决了此前未能解决的任务。这意味着,以适度的 token 或轮次限制运行的评估如今有可能错过实质性的能力提升。
在这篇博文中,我们解释发生了什么变化,以及这对今后如何评估智能体网络能力意味着什么。
我们的结果:近期模型在网络任务上能有效利用更多 token
为研究模型改进后利用更大预算的能力,AISI 和 Irregular 各自在前沿模型上运行了其私有网络评估的一个子集,这些模型分别发布于 2025 年 11 月之前和期间。我们以远高于评估设置中通常使用的预算运行这些评估:AISI 为总计 5000 万 token,Irregular 为 1,000 轮。为使模型能够利用这些更大的 token 预算,AISI 使用了一个压缩工具,让模型能够在固定的上下文窗口内跟踪更多历史。Irregular 采用了类似的方法。
这些评估表明,无论较旧还是较新的模型,更大的预算都带来了能力的显著提升,且与较旧模型相比,较新模型利用更多 token 的能力有所增强。

我们的结果表明,随着推理预算的扩大,一系列任务的平均成功率持续提升。重要的是,一些较难的任务只有在长时间评估的后期才被解决:AISI 的任务中约有 8% 只有将预算从 1000 万 token 提高到 5000 万 token 才能解决。这意味着,要可靠地估计性能,就需要运行长时间、预算密集的评估,以捕捉这些后期才被解决的任务。对于困难任务,这可能意味着每次尝试需要数千万 token 的预算,并需多次重复。
我们应当指出这些发现存在若干重要局限。首先,它们基于网络任务,因此需要更多测试来确认其能否推广到其他领域。其次,我们无法精确量化脚手架设计与模型能力各自的相对贡献,尽管我们对使用同类脚手架的不同模型所做的比较表明,利用扩展推理预算的能力因模型而异。 最后,给定预算下的成功率本身带有随机性,虽然我们的样本量足以证明这种扩展效应,但样本量太少,无法精确估计真实成功率。随着样本量增大,我们的曲线和平台期可能会发生移动。
这对网络评估意味着什么?
我们的结果表明,要准确评估网络能力,所需的推理预算很可能远高于通常的假设。
AISI 的成功率大致随每次尝试所用总 token 数的对数而扩展:每当我们将 token 预算翻倍,成功率的绝对增幅大致相同。不利的一面是,对于困难任务,即使性能只有小幅提升,也需要指数级更大的推理预算,这使得准确评估的成本越来越高。
这并不意味着每次运行的成本会变得无法承受:在 AISI 的 5000 万 token 上限下,每次运行的平均成本约为 10 美元,单次运行的最高成本低于 60 美元。对于 Irregular 每次运行 1000 次迭代的情况,每次运行的平均成本从较简单挑战的不到 1 美元,到中等及大多数困难挑战的最高 20 美元不等,而某些更困难的挑战则接近 100 美元。费用来自规模:要可靠地估计性能上限,需要大量任务和多次重复,总评估成本也随之增长。
这些发现会影响我们估计模型视野的方式,模型视野代表模型成功率降至 50% 以下的难度水平(以人类时间衡量)。由于视野估计取决于测得的成功率,而测得的成功率又取决于所允许的推理预算,因此在预算不足的情况下运行的评估会低估模型的真实视野。在我们测试的预算下,提高 token 上限会显著上移视野估计值,这表明此前在较低预算下得出的估计过于保守。
我们如何选择合适的推理预算?
计算网络评估的理想推理预算需要权衡取舍:预算设得太低,可能会低估模型的能力;而设得太高,则可能为没有产出的 token 付费,却无法改进能力估计。
Irregular 提出了每次成功成本作为评估网络任务经济可行性的有用指标。这是所有尝试的总成本除以成功次数,反映了成功完成一项任务平均预期花费的金额。
降低高估某项挑战预期每次成功成本风险的一种方法是在不同预算阈值下进行计算。理论上,当推理预算较低时,我们预期每次成功成本会非常高,因为预期成功次数很少甚至为零——而随着预算增加,我们预期它会下降。在某个点上,我们预期每次成功成本会再次开始上升,因为额外的迭代只会延长那些模型已经犯了致命错误、走上了无果之路,或者遇到了无论多少算力都无法解决的问题的运行。找到这条曲线中的低谷,即每次成功成本最低之处,可以在不超支的情况下最大化能力评估。

展望未来
总体而言,我们的发现对网络评估的开发和报告方式有直接影响。
我们的结果为评估应如何影响安全决策提供了依据。一个在 200 万 token 时成功率为 5% 的模型,在 5000 万 token 时可能达到 30%——这一变化可能跨越与风险评估相关的能力阈值。在典型 token 或轮次限制下进行的评估,可能大幅低估模型距离危险能力阈值的接近程度。政策制定者和开发者需要准确的能力上限估计,而不是固定预算下的点估计。
需要更多研究来了解这些结果是否适用于其他领域。模型评估与威胁研究(METR)的结果表明,这种在高 token 预算下的持续扩展可能并不适用于所有软件工程任务。以更多智能体轮次形式进行的推理扩展是否能推广到网络领域之外,仍然是一个重要的未解问题。
对评估期间施加的推理限制——包括 token 数量、轮次限制、成本上限和时间约束——保持透明,将有助于为评估结果提供背景,使读者能够区分模型能力低与评估设置过度受限。虽然一些组织现在报告了这些限制,但这一做法尚未统一。通过监测推理扩展曲线,评估者可以确定其选择的预算是否足够,或者额外的算力是否会显著提高估计性能。
展望未来,这些趋势将使网络评估越来越资源密集。环境需要支持稳定、长时间运行的智能体会话,评估者需要工具来确定其选择的预算是否足够。更根本的是,社区可能需要从更短、更便宜的运行中估计长期性能的方法——例如,通过从观察到的推理扩展曲线进行外推。如果没有这类方法,随着模型持续改进,测量能力与实际能力之间的差距可能会扩大。
来源:英国 AI Security Institute:Blog(网页) · aisi.gov.uk