跳到正文
北京时间
原文
英国 AI Security Institute:Blog(网页)·· 2026-04-13精选AI 评分74

英国 AISI 评估 Claude Mythos Preview 网络攻击能力:专家级 CTF 通过率 73%

Our evaluation of Claude Mythos Preview’s cyber capabilities

AI 导读

英国 AI Security Institute 发布对 Anthropic Claude Mythos Preview(4 月 7 日公布)的网络安全能力评估。

推荐理由

官方评估给出具体通过率与步骤数,读者可据此了解前沿模型网络攻击能力的实际水位与评估局限。

正文 · AI 翻译

AI 安全研究所(AISI)对 Anthropic 的 Claude Mythos Preview(于 4 月 7 日发布)进行了评估,以衡量其网络安全能力。我们的结果表明,在网络安全性能本已快速提升的背景下,Mythos Preview 相较此前的前沿模型又迈上了一个台阶。

我们自 2023 年起持续追踪 AI 网络能力,不断构建难度递增的评估以跟上 AI 的进步——从基于对话的探测,到夺旗挑战,再到下文描述的多步骤网络攻击模拟。两年前,最好的可用模型几乎无法完成入门级的网络任务。如今,在受控评估中,当 Mythos Preview 被明确指示并获得网络访问权限时,我们观察到它能够对存在漏洞的网络执行多阶段攻击,并自主发现和利用漏洞——这些任务人类专业人员需要数天才能完成。

在这篇博文中,我们总结了针对 Mythos Preview 所进行的网络评估结果。这些评估既包括夺旗(CTF)挑战,也包括为模拟多步骤攻击场景而设计的更复杂的靶场。

夺旗挑战结果

在 CTF 挑战中,AI 模型必须识别并利用目标系统中的弱点,以获取隐藏的“flag”。下图展示了 Mythos Preview 在我们的网络 CTF 测试集上的表现与其他模型的对比。每个点代表某个模型在给定难度级别下的平均成功率。

图 1:自 2022 年 11 月以来各模型在技术非专家级和学徒级夺旗任务(CTF)上的表现。GPT-3.5 Turbo 至 Claude 4 Opus 平均运行 10 次,最多消耗 250 万 token。GPT-5 至 Mythos Preview 平均运行 5 次,最多消耗 250 万 token。

图 2:自 2025 年 8 月以来各模型在从业者级和专家级夺旗任务(CTF)上的表现。所有模型平均运行 5 次,最多消耗 5000 万 token。

在专家级任务上——2025 年 4 月之前没有任何模型能够完成——Mythos Preview 的成功率为 73%。

网络靶场结果

即便是专家级 CTF 也只是孤立地测试特定技能。现实世界的网络攻击需要跨多台主机和网段串联数十个步骤——这种持续性行动需要人类专家花费数小时、数天甚至数周才能完成。

作为衡量这一能力的第一步,我们构建了“The Last Ones”(TLO):一个 32 步的企业网络攻击模拟,涵盖从初始侦察到完全接管网络的全过程,我们估计人类需要 20 小时才能完成。关于该靶场的更详细描述见我们近期的论文。

Claude Mythos Preview 是首个从头到尾解决 TLO 的模型,在 10 次尝试中成功了 3 次。在所有尝试中,该模型平均完成了 32 步中的 22 步。Claude Opus 4.6 是表现次佳的模型,平均完成 16 步。

图 3:在“The Last Ones”(一个 32 步的模拟企业网络攻击)上完成的平均步数随总 token 消耗的变化。每条线代表一个不同的模型,阴影区域表示在每个 token 预算下所有运行的最小–最大范围。10M token 处的垂直虚线标记了若干模型样本量开始减少的位置。Mythos Preview、Opus 4.6 和 GPT-5.4 在最高 100M token 时平均运行 10 次。Opus 4.5、GPT-5.1 Codex 和 Sonnet 4.5 各自在最高 10M token 时平均运行 15 次,在最高 100M token 时平均运行 5 次。GPT-5.3-Codex 在最高 10M token 时平均运行 10 次,在最高 100M token 时平均运行 5 次。Sonnet 3.7 和 GPT-4o 仅在最高 10M token 时平均运行 10 次。在所测试的各个 token 预算下,模型随着 token 预算增加持续取得进展。灰色水平线表示攻击链中的重要里程碑。

在我们评估的范围内,Mythos Preview 也确实表现出一些网络能力上的局限。它无法完成我们以运营技术为重点的网络靶场“Cooling Tower”,不过这一结果并不一定表明该模型不擅长在运营技术(OT)环境中执行攻击;该模型卡在了这个靶场的 IT 部分。

我们预计,随着推理算力的增加,我们的评估表现会继续提升:我们以 100M token 的预算运行了这些网络靶场;Mythos Preview 的表现一直持续提升到这一上限,我们预计性能提升还会在此之后继续。关于这一现象的更多内容,请参阅我们近期博客文章中关于网络任务中推理扩展的讨论。

影响

Mythos Preview 在一个网络靶场上的成功表明,它至少有能力在已获得网络访问权限的情况下,自主攻击小型、防御薄弱且存在漏洞的企业系统。然而,我们的靶场与现实环境存在重要差异,这使它们更容易成为攻击目标。它们缺少现实中通常存在的安全功能,例如主动防御者和防御工具。模型采取会触发安全警报的行动也不会受到任何惩罚。这意味着我们无法确定 Mythos Preview 是否能够攻击防御良好的系统。

在攻击者能够指挥模型并提供网络访问权限,以对防御薄弱的系统实施自主攻击的情况下,网络安全评估必须与时俱进。随着能力持续提升,缺乏防御的评估环境将不再具有足够的挑战性,无法区分最具网络能力的模型之间的差异或评估趋势。我们未来的工作将涉及使用模拟加固和防御环境的靶场来评估能力,包括具有主动监控、端点检测和实时事件响应的靶场。我们还将跟踪 AI 驱动的漏洞发现和渗透测试活动在真实系统上的表现。

组织现在应该做什么

我们的测试表明,Mythos Preview 能够利用安全防护薄弱的系统,而且未来很可能会开发出更多具备此类能力的模型。这凸显了网络安全基础工作的重要性,例如定期应用安全更新、稳健的访问控制、安全配置以及全面的日志记录。我们在英国国家网络安全中心(NCSC)的同事运行了Cyber Essentials 计划,以帮助各类组织抵御常见的在线威胁,无论这些威胁是否由 AI 辅助。如需最新的网络安全建议,请访问NCSC 网站。

未来的前沿模型能力还将更强,因此现在投资于网络防御至关重要。AI 网络能力具有双重用途;它们在带来安全挑战的同时,也能帮助实现防御领域颠覆性的改进。我们最近与 NCSC 联合发布了一篇博客文章,探讨网络防御者如何既能利用前沿 AI,又能为其做好准备。

‍

来源:英国 AI Security Institute:Blog(网页) · aisi.gov.uk