英国 AISI 用网络靶场评测前沿 AI 智能体的多步攻击能力
How do frontier AI agents perform in multi-step cyber-attack scenarios?
英国 AI Security Institute 发布博客,介绍在两个网络靶场上评测七个模型(2024年8月至2026年2月发布)的多步网络攻击能力。
AISI 用模拟网络环境测试多步攻击链,给出了七代模型能力变化和推理算力扩展的具体数据,可用于了解前沿模型网络能力评估方法。
AI 智能体能否自主实施网络攻击?如果 AI 智能体能够在极少人工监督下可靠地执行多步攻击链,就可能降低低水平威胁行为者的技能门槛,提升有经验者所能达成的攻击复杂度,或催生全新的攻击性行动。
随着网络能力不断提升,需要越来越复杂的测试才能准确衡量这些能力。现有的网络评估依赖于孤立的夺旗赛(CTF)挑战或问答集。这些方法虽然对衡量特定技能有价值,但无法反映 AI 系统是否具备在复杂环境中执行长序列攻击所需的自主、长时程能力。
为弥补这一空白,我们已开始基于网络靶场评估模型: 由网络安全专家构建、包含多台主机、服务和漏洞并编排为顺序攻击链的模拟网络环境。
通过比较在十八个月期间(2024 年 8 月至 2026 年 2 月)发布的七个模型在不同推理时计算预算下的表现,我们观察到两种能力趋势。
第一,在固定 token 预算下,每一代新模型都优于前代:在我们的企业网络靶场上,10M token 时平均完成的步数从仅 1.7 步(GPT-4o,2024 年 8 月)上升到 9.8 步(Opus 4.6,2026 年 2 月)。最佳单次运行完成了 32 步中的 22 步,大致相当于人类专家所需约 14 小时中的 6 小时。
第二,扩展推理时计算可进一步提升性能。从 10M 增加到 100M token 可带来最高 59% 的提升,这与 AISI 此前关于网络能力与推理扩展之间关系的发现一致。
在本博客中,我们解释我们的方法,展开说明我们的结果,并描述对更广泛的 AI 评估与政策界的关键影响。更详细的讨论见我们的完整论文。
我们的网络靶场
我们在两个靶场上测试了模型:
“The Last Ones” 是一个 32 步的企业网络攻击。攻击者必须通过在企业中逐步移动、窃取凭据、利用 Web 应用、逆向工程二进制文件、攻陷 CI/CD 流水线,并在多域企业网络中执行 SQL 注入链,来窃取敏感数据。我们估计人类专家大约可在 14 小时内完成。
“Cooling Tower” 是一个 7 步的工业控制系统(ICS)攻击。攻击者必须通过逆向工程专有控制协议来构造恶意命令,从而破坏模拟发电厂的冷却塔。每一步都对应着大得多的工作单元,且依赖关系更复杂。我们估计人类专家完成该靶场大约需要 15 小时。
关键在于,两个靶场都不包含主动防御者:检测会被记录,但不会阻止或减缓智能体。这意味着我们的结果衡量的是在没有防御响应情况下的原始能力。
我们的发现
每一代新模型都更进一步
第一个关键趋势是,在固定 token 预算下,每一代新模型都优于前代。在“The Last Ones”上,GPT-4o(2024 年 8 月)在 1000 万 token 时平均完成 1.7 步,而 Opus 4.6(2026 年 2 月)平均完成 9.8 步。在 1 亿 token 时,差距更大:Opus 4.5 平均完成 11.0 步,而 Opus 4.6 为 15.6 步——在相隔约两个月发布的模型之间提升了 42%。
.png&mode=full&exp=1790985600&sig=f0f2ec789f329a13)
这一提升可能体现在两个维度上。第一个是token 效率:模型每消耗一个 token 能取得多快的进展。较新的模型在早期表现出更陡的斜率,用更少的 token 就能达到里程碑。第二个是能力深度:模型是否具备足够强的专业技能——例如在逆向工程、密码学或漏洞利用开发方面——以克服特别困难的步骤。例如,GPT-4o 在第 2 步之后完全停滞,表明它缺乏后续攻击阶段所需的原始能力。
在里程碑 4 之后性能急剧下降,这标志着从侦察和 Web 利用转向需要逆向工程、密码学和恶意软件开发专业知识的攻击阶段。Opus 4.6 是第一个持续突破这一障碍的模型。
更多算力,更多进展
最引人注目的发现之一是,模型在“The Last Ones”上的性能随推理时算力(模型在一次尝试中用于推理和行动的总 token 数)呈对数线性扩展。将 token 预算从 1000 万增加到 1 亿可带来高达 59% 的提升,且未观察到平台期。

这一点很重要,因为扩展推理时算力不需要操作者具备特定的技术专长。与自定义脚手架、专家提示或定制工具不同,任何人都可以简单地给模型更多 token 来使用。按当前价格,使用 Opus 4.6 进行一次 1 亿 token 的尝试成本约为 80 美元。此前针对孤立网络任务的研究表明,增加评估预算会揭示更高的成功率;我们的结果将这一发现扩展到多步攻击链。
然而,各次尝试之间存在很大差异。表现最好的 Opus 4.6 运行完成了 32 步中的 22 步,达到里程碑 6,这需要逆向工程一个包含加密凭据的 Windows 服务二进制文件、通过令牌模拟提升权限,并恢复加密密钥以访问 C2 管理服务。同一模型和预算的其他运行完成的步数则少得多。
进展迅速但不均衡
然而,与“The Last Ones”相比,当前的前沿模型在“Cooling Tower”靶场上仍只取得有限进展。在 1000 万 token 时,大多数模型完成零步。在 1 亿 token 时,Opus 4.6 达到最高平均 1.4 步(最多 2 步),而 GPT 5.3 Codex 单次运行最多完成 7 步中的 3 步。
尽管总体步数较少,但“Cooling Tower”每一步所需的工作量远多于“The Last Ones”。它还要求模型将早期步骤中收集的信息延续到后续步骤以完成任务。这种每步高难度与长程信息追踪的结合,使我们测试的模型无法取得有意义的进展。
模型利用非预期的解决路径
值得注意的是,在初步测试中,我们偶尔注意到模型会通过范围设计时未曾预料到的方法取得进展。例如,在“Cooling Tower”中,预期路径涉及攻陷一个 Web 应用程序,然后使用逆向工程得到的加密材料来获取对可编程逻辑控制器(PLC)的访问权限。
然而,一些模型完全绕过了这一序列。从攻击者的初始位置出发,它们直接探测 PLC 上运行的专有协议,仅凭网络流量就推断出其足够多的结构,从而在没有任何事先利用的情况下调用未受保护的函数并读取 PLC 内存。我们已针对主要运行修补了此问题。
总体而言,我们的结果表明,网络能力正在迅速提升,因此持续、严格的测试至关重要。准确衡量这些能力所需的评估环境的复杂程度也在同步上升,这意味着网络靶场将构成我们未来方法的关键部分。未来的工作可以侧重于构建更广泛的靶场套件,以在不同环境中测试 AI 能力,甚至在有主动防御者的真实环境中验证性能。
要了解有关这项工作的更多信息,请阅读我们的完整论文。
来源:英国 AI Security Institute:Blog(网页) · aisi.gov.uk