跳到正文
北京时间
原文
英国 AI Security Institute:Blog(网页)·· 2026-07-23精选AI 评分65

UK AISI 与 CAISI 联合评估 Kimi K3 网络安全能力,显著低于前沿模型但超过 GLM-5.2

UK AISI / CAISI Preliminary Assessment of Kimi K3's Cyber Capabilities

AI 导读

UK AISI 与 CAISI 对 Moonshot AI 于 2026 年 7 月 16 日发布的 Kimi K3 进行联合网络安全能力评估。在 ExploitBench 上 Kimi K3 得分 32%,高于 GLM-5.2 的 24%,但未能在 41 个样本中实现任意代码执行(ACE),最前沿美国模型平均可达 20/41。

推荐理由

两家官方机构给出 Kimi K3 与前沿模型在 ExploitBench 和 TLO 上的具体差距数字,读者可据此了解开放权重模型的网络安全能力水位。

正文 · AI 翻译

英国人工智能安全研究所(UK AISI)与美国人工智能标准与创新中心(CAISI)(UK AISI / CAISI)对 Moonshot AI 的最新模型 Kimi K3(于 2026 年 7 月 16 日发布,并计划于 2026 年 7 月 27 日前开放权重发布)进行了联合评估。本次评估聚焦于 Kimi K3 的网络能力,结果发现:

  • Kimi K3 performs significantly below the most recent frontier cyber-capable models on preliminary cyber evaluations run by UK AISI / CAISI. Specifically:
    • 在开发漏洞利用程序的任务中,Kimi K3 的表现显著低于最新的前沿网络能力模型(图 1)。
    • 在攻击模拟企业网络(“The Last Ones”)的任务中,Kimi K3 的表现显著低于最新的前沿网络能力模型。具体而言,平均来看,Kimi K3 在这条 32 步攻击路径中到达第 17 步,而网络能力最强的美国模型平均到达 28.5 步。
  • 在 UK AISI / CAISI 开展的同一组初步网络评估中,Kimi K3 的表现优于 GLM-5.2(图 2)。
  • Kimi K3 的防护措施允许协助智能体式网络漏洞利用开发。在 UK AISI / CAISI 的评估中,Kimi K3 的防护措施未能阻止其尝试网络漏洞利用开发或进攻性网络行动。

图 1:Kimi K3 及其他模型在漏洞利用开发基准(ExploitBench)上的表现。成功率越高表示网络能力越强。误差线表示 95% 置信区间。ExploitBench 衡量模型在给定漏洞的情况下开发端到端漏洞利用程序的能力

详细结果

这些结果代表在一小组公开和私有基准上的初步评估。美国闭权重模型在评估时禁用了系统级防护措施,以减少拒绝并实现最大能力的测量。这些模型的公开可用版本已启用这些防护措施。由于 Kimi K3 托管设置的特殊性,UK AISI / CAISI 运行了一组选择性的网络评估。详细方法见各章节。

‍
网络能力趋势‍

模型的网络能力通过一种受项目反应理论(IRT)启发的方法,跨多个基准的多个任务进行聚合。方法细节请参见此前发布的报告。Kimi K3 的整体网络能力置信区间比其他模型更大,因为它是从单一基准(ExploitBench,包含 41 个聚焦于漏洞利用开发的任务)估算得出的。

ExploitBench 是衡量模型在软件漏洞利用阶梯上推进能力的领先基准。所有其他模型的整体网络能力得分均来自更多任务,这些任务覆盖了网络能力的其他领域。

图 2:截至 Kimi K3 发布时,美国和中国最具能力模型的聚合能力随时间变化的初步比较。美国趋势线由美国前沿模型的结果组成。y 轴增加 400 点相当于解决任务的几率增加 10 倍。误差线和阴影区域表示 95% 置信区间。

漏洞利用开发:ExploitBench

‍ExploitBench 是由卡内基梅隆大学开发的一个公开基准测试,用于衡量模型在软件漏洞利用阶梯上推进的能力,包括覆盖率与崩溃复现、任意读/写、控制流劫持以及任意代码执行。该基准测试在 V8 引擎(驱动 Chrome 的 JavaScript 和 WebAssembly 软件)中 41 个近期(2023 年后)漏洞上对模型进行测试。ExploitBench 的结果见图 1 和图 3。

图 3:Kimi K3 及其他模型的 ExploitBench 详细表现。 颜色越深表示网络能力越强。每一行代表漏洞利用开发链中的一个关键里程碑,每个单元格显示相关模型能够达到该里程碑的 ExploitBench 任务数量。

Kimi K3 的表现优于 GLM-5.2,后者是截至 2026 年 6 月网络能力最强的开放权重模型。Kimi K3 得分为 32%,而 GLM-5.2 得分为 24%(图 1)。

与网络能力最强的模型不同,Kimi K3 未能开发出在 ExploitBench 任务中实现任意代码执行(ACE)的漏洞利用。 ACE 是漏洞利用开发中最高严重级别的结果,使攻击者能够劫持目标。Kimi K3 在 0/41 个样本上实现了 ACE,而网络能力最强的模型平均在 20/41 个样本上实现了 ACE(图 3)。

网络靶场:The Last Ones(TLO)

‍“The Last Ones”(TLO)网络靶场是一个 32 步的模拟企业网络攻击,跨越 4 个子网和约 20 台主机,人类专家大约需要 20 小时才能完成。网络靶场是由专家构建的模拟主机、服务和漏洞网络,按顺序排列成攻击链,从初始网络访问点开始,可用于衡量模型自主开展端到端网络攻击的能力。

在该评估中,Kimi K3 的表现显著低于美国领先的网络能力模型。具体而言,Kimi K3 在这条 32 步攻击路径上平均到达第 17 步,而网络能力最强的美国模型平均到达 28.5 步。

Kimi K3 的表现优于 GLM-5.2,后者是截至 2026 年 6 月网络能力最强的开放权重模型。在 1 亿 token 限制内,Kimi K3 平均到达第 17 步,而 GLM-5.2 为第 11 步。

在 10 次尝试中的一次,Kimi K3 在 1 亿 token 限制内成功完成了“The Last Ones”网络靶场。这表明,当被指示并获得初始网络访问权限时,Kimi K3 能够自主攻击小型、防御薄弱且存在漏洞的企业系统。然而,TLO 在多个方面与现实环境不同。它没有主动防御者和防御工具,不会对会触发安全警报的行为施加惩罚,并且包含一条预设的攻击路径。

解决 TLO 不再是一小部分模型的专属。在此前的测试中,已有四个公开发布的闭源权重模型解决了 TLO,其中能力最强的模型以 6/10 和 7/10 次尝试更可靠地解决了它。Kimi K3 在标准 1 亿 token 限制内以 1/10 次尝试解决了它。

本博客也由 CAISI 发布于此。

‍

‍

来源:英国 AI Security Institute:Blog(网页) · aisi.gov.uk