跳到正文
北京时间
原文
英国 AI Security Institute:Blog(网页)·· 2026-07-17精选AI 评分70

AISI 首次公开评估:领先开源权重模型的网络安全能力落后前沿 4 至 7 个月

How Far Behind the Frontier are Leading Open Weight Models on Cyber?

AI 导读

英国 AI Security Institute 首次公开分析领先开源权重模型的网络安全能力差距,测试发现 GLM-5.2 是测试时最强的开源权重模型,在 AISI 窄域网络任务上接近 4 个月前发布的 Opus 4.6,在长时程网络靶场上接近 Opus 4.5,整体落后前沿 4 至 7 个月,窄于 2025 年 1 至 9 月内部评估测得的 6 至 10 个月。

推荐理由

这是 AISI 首次公开量化开源权重模型与闭源前沿在网络安全能力上的差距,并给出成本对比,为防御方的准备窗口提供依据。

正文 · AI 翻译

自2023年以来,AISI一直追踪前沿AI模型的网络能力。在我们的评估中,能力最强的模型始终是闭源权重模型——其参数不公开,只能通过开发者控制的接口访问。领先的开源权重模型——其参数任何人都可以下载、运行和修改——则一直落后。落后多少、差距是否在缩小、缩小速度有多快,这些都是研究人员、政策制定者和网络防御者当前关注的问题。

开源权重模型带来实实在在的好处。它们可以私有部署,数据不会回传给模型提供商;可以针对特定任务进行调整;运行成本仅为算力费用。一旦投入使用,它们就提供了一个可靠的基础,提供商无法更改或弃用。它们促进了开放协作与创新,也支持某些需要访问模型权重的安全研究——包括AISI模型透明度团队的部分工作。

但它们也可能带来风险。支撑这些好处的开放性,恰恰排除了闭源模型开发者可以用来检测和阻断滥用、在漏洞出现时迭代防护措施、控制用户访问和撤回模型的许多安全手段。开源权重模型一旦发布,这些选项就永久丧失了:防护措施可以被移除,副本可以被下载、再分发,并在监控范围之外的私有系统上运行。因此,对于具有危险能力的模型——包括网络能力极强的模型——开源权重发布会造成持续且不可逆的滥用风险。

开源与闭源模型在网络能力上的差距之所以重要,一个原因是它提供了准备时间:一个窗口期,让能够使用最强闭源系统的网络防御者在当今前沿网络能力可能在没有同等防护措施的情况下变得可用之前采取行动。随着前沿AI网络能力持续进步,这一点变得更加紧迫;2026年4月,两个闭源模型Mythos Preview和GPT-5.5展示了AISI自开始测试以来观察到的AI网络能力最大跃升,促使国际社会警告需要在一个快速变化的网络风险格局中采取行动。

这是我们首次公开分析领先开源权重模型在闭源网络前沿之后落后多远。我们的评估发现,GLM-5.2(2026年6月)是测试时网络能力最强的开源权重模型。它在AISI的窄域网络任务上与Opus 4.6(2026年2月)表现相似,在更长周期的网络靶场上与Opus 4.5(2025年11月)表现相似,这意味着它落后前沿4到7个月。这比我们在2025年1月至9月发布的开源权重模型内部评估中测得的6到10个月差距要小。 

下面,我们列出这些结果、我们测试了哪些模型,以及差距缩小对网络防御意味着什么。

结果:当前开源权重AI的网络差距

我们的评估对模型的网络能力采取广义视角。AISI的窄域网络任务评估跨越四个难度级别的特定网络技能。另外,我们的网络靶场评估自主网络能力—— 模型在包含漏洞的模拟网络中,对长周期、多步骤网络攻击维持端到端规划与执行的能力。

这里我们分享所测试的两个开放权重模型的结果,选择它们是因为在发布时它们有望引领开放权重网络能力,即 GLM-5.2 和 DeepSeek V4-Pro。我们还引用了 2025 年进行的类似内部测试的结果。AISI 打算在 Kimi K3 的权重公开发布后(宣布于 7 月底),以同样的基础对其进行测试。

狭窄网络任务

AISI 的狭窄网络任务衡量模型能够完成的任务难度,范围从“技术非专家”(具有一定技术专长但网络知识有限的新手,例如数据分析师)到“专家”(通常需要深入了解网络安全的任务)。1 它们涵盖多种网络安全能力,如漏洞研究与利用、逆向工程、Web 利用和密码学。

图 1:在 AISI 的 70 项狭窄网络任务上的平均成功率,每项任务有 5 次尝试,每次尝试限制 250 万 token。2 虚线连接性能相当的开放和封闭模型,表示发布日期之间的差距。

在这些任务上,GLM-5.2 的表现与早于它 4 个月发布的最具网络能力的模型相当(Opus 4.6 和 GPT-5.3-Codex),并且在所有四个难度级别上均如此。DeepSeek 的 V4-Pro 与早于它 5 个月发布的 Opus 4.5 相当。这两个差距都比 AISI 在 2025 年进行的内部评估更窄,当时开放权重模型落后前沿 6 到 10 个月。

这一结果是在 AISI 观察到前沿网络能力截至 2026 年 2 月快速进步的情况下得出的—— 但这并不能预测未来的开放权重模型是否会复制 Mythos Preview 和 GPT-5.5 带来的更近期跃升。

网络靶场

AISI 的网络靶场衡量模型自主进行端到端网络攻击的能力。它们是由专家构建的模拟网络,包含主机、服务和漏洞,排列成从初始网络访问点开始的顺序攻击链。靶场目前缺乏真实世界中防御良好的环境的安全功能,如主动防御者和防御工具,以及警报惩罚。

图 2 显示了网络靶场“The Last Ones”(TLO)上的模型轨迹:一个跨越 4 个子网和约 20 台主机的 32 步企业网络攻击,我们估计人类专家大约需要 20 小时才能完成。

图 2:在“The Last Ones”上完成的平均步数随总 token 消耗的变化,每次运行限制 1 亿 token。每条线是一个模型在 10 次运行中的平均轨迹(除非标有“最佳尝试”);阴影区域显示最小-最大范围。标有“M”的灰色水平线标记攻击链中重要的命名里程碑。

在 TLO 上,GLM-5.2 达到与早于它不到 7 个月发布的模型 Opus 4.5 相当的水平,而 DeepSeek 的 V4-Pro 则低于 Sonnet 4.5(早于它 7 个月发布的次网络前沿模型)。这些结果在我们的其他网络靶场上大体一致。值得注意的是,GLM-5.2 以平均略少于任何其他模型的 token 达到第 7 步,并在停滞前跟随 Opus 4.6 的轨迹到第 11 步。

这里的差距比我们在狭窄网络任务上的差距更大,不过我们将来自我们靶场的比较视为较弱的证据,因为它所依据的靶场集合比我们更大的狭窄网络任务套件要小。此外,仅凭轨迹无法告诉我们,停滞是因为网络能力不足以克服某个特定步骤,还是因为智能体能力不足以维持长时程的规划与执行。

现实世界约束

保障措施

总体而言,开放权重部署使 AI 开发者可用的保障措施更少,尤其是在网络等两用领域。部署时的安全措施,如监控、分类器和封禁用户,需要对模型访问的控制,一旦权重公开就无法普遍适用。仍然可用的技术,如拒绝训练(训练模型拒绝有害请求),在获得权重的情况下往往很容易被逆转。

我们对近期开放权重模型的评估在很大程度上未受保障措施的阻碍。DeepSeek V4-Pro 偶尔会拒绝狭窄网络任务,主要是在逆向工程方面,我们仅通过对被拒绝的任务进行少量重复尝试就绕过了这一点。

成本效益

按公布的第一方价格计算,我们评估的开放权重模型比它们所对比的更早发布的闭源模型便宜得多。运行一次 1 亿 token 的网络靶场,Opus 4.5 和 4.6 的成本约为 85 美元,而按当前价格估算,GLM-5.2 为 46 美元,DeepSeek V4-Pro 为 1.19 美元。3 在两种被比较模型均以 100% 可靠性解决的任务中,Opus 4.6 每项任务成本为 15.17 美元,而 GLM-5.2 为 6.12 美元;Opus 4.5 每项任务成本为 12.50 美元,而 DeepSeek V4-Pro 为 0.28 美元。

我们测试的局限性

我们的设置可能略微低估了开放权重模型的最大能力:我们没有进行可能提升性能的特定引导或优化。其次,本文仅包含网络能力测试;无法据此推断其他能力。

结论

基于我们的评估方法,近期开放权重模型在网络能力上落后于前沿闭源模型 4 到 7 个月——这一差距比我们在 2025 年大部分时间里内部测得的 6 到 10 个月要窄。 这 意味着网络防御者只有很短的窗口来做好准备,之后当今的前沿网络能力可能在没有同等保障措施的情况下变得可获取。英国国家网络安全中心已经鼓励各组织投资于网络安全基线并利用 AI 增强的防御;我们的发现强调了这一信息。

开放权重模型带来了各种实实在在的好处。挑战在于,随着开放权重前沿在风险相关领域不断推进,如何平衡这些好处与安全。虽然目前没有任何方法能保证安全,但若干策略可以显著降低风险,尤其是组合使用时。AISI 此前已概述了开放权重模型风险管理中的开放问题,以及跨模型训练、保障、审计和访问的可行方法。

这一差距未来是否会变化尚不确定。AISI 将继续评估领先的开放权重模型,包括 Kimi K3,以跟踪能力及其与前沿的差距。

‍

‍

‍

来源:英国 AI Security Institute:Blog(网页) · aisi.gov.uk