跳到正文
北京时间
原文
Anthropic:Research(发表成果 · 网页)·· 1 天前精选AI 评分81

Anthropic 评测 GLM-5.3:能自主构建端到端网络漏洞利用且防护易被绕过

GLM-5.3 and the spread of advanced cyber capabilities

AI 导读

Anthropic 发布对智谱 GLM-5.3 网络攻击能力的分析,发现其可自主开发端到端漏洞利用,在 ExploitBench 410 次尝试中成功 50 次,接近 Claude Mythos Preview 的 56 次。

推荐理由

Anthropic 第一手评测给出 GLM-5.3 的漏洞利用成功率和防护绕过数据,读者可据此了解开放权重模型带来的攻击面变化。

正文 · AI 翻译

Andrew Fasano, Marius Fleischer
Cole McFaul, Robert Xiao, Tripp Gallagher

五个月前,我们宣布了 Claude Mythos Preview,这是首个能够自主构建复杂的端到端网络漏洞利用的 AI 模型。AI 能力的快速提升让我们意识到,这种能力最终会扩散到许多其他模型,使恶意网络行为者更容易发动影响重大的网络攻击。

鉴于这些考量,我们选择通过 Project Glasswing 以受限方式发布 Claude Mythos Preview——这使受信任的网络防御者能够在关键软件中发现超过 10,000 个漏洞,在恶意行为者获得同等能力模型之前抢占先机。

但这些模型如今已经到来。在本文中,我们分享对 GLM-5.3 的分析,这是智谱 AI(在中国以外称为 Z.ai)开发的最新 AI 模型。与 Claude Mythos Preview 一样,GLM-5.3 具备强大的自主构建端到端网络漏洞利用的能力。但 GLM-5.3 与其他前沿模型不同之处在于,它在发布时没有设置有意义的防护措施来限制滥用。我们发现,在我们的模拟测试中,攻击者可以通过简单技术绕过 GLM-5.3 的防护措施,成功率为 64% 至 100%。相比之下,在我们的测试中,这些攻击未能对设有防护的 Claude 模型奏效。我们评估认为,GLM-5.3 松懈的防护措施显著增加了恶意行为者可用的网络能力。与此同时,这些能力也能让致力于保护自身系统的防御者受益。

9 月 17 日,NIST 的人工智能标准与创新中心(CAISI)发布了其自身对 GLM-5.3 网络能力的评估。CAISI 发现,GLM-5.3 是“迄今为止发布的网络能力最强的开放权重模型”,并且在 CAISI 网络基准的综合评估中落后美国前沿约四个月。我们的能力发现与 CAISI 大体一致。在 CAISI 的对比中,美国模型在适用时是在禁用网络防护的情况下进行测试的,而美国前沿包括仅向经过审查的用户发布的模型。攻击者无法轻易获取这些版本的美国模型,但任何人都可以下载 GLM-5.3。本文补充了我们对 GLM-5.3 防护措施被绕过或移除的难易程度的分析。

Two bar charts. Top: share of attempts that built a working exploit on 41 Chrome V8 bugs — Claude Mythos Preview at 14% and GLM-5.3 at 12%, while Claude Opus 4.6, GLM-5.2, Kimi K3, and DeepSeek V4.1-Flash score at or near 0%. Bottom: how often each model engaged with malicious cyber-attack orders — GLM-5.3 rises from 0% on a bare order to 64% with a false cover story, 92% with prefilled reasoning, and 100% when abliterated, while Claude Opus 5 stays at 0%.
图 1. 发现摘要。上:Claude Opus 4.6 与 Claude Mythos Preview 之间漏洞利用能力的提升,与 GLM-5.2 和 GLM-5.3 之间的能力跃升如出一辙。Claude 模型发布时带有网络防护,防护降低的版本仅限经过审查的用户使用。任何人都可以下载并使用 GLM-5.3。下:GLM-5.3 中有限的防护措施可以用标准技术绕过,而在我们的测试中,这些技术对 Claude 模型无效或不适用。

GLM-5.3 能够端到端开发可用的漏洞利用

为了解 GLM-5.3 如何使网络威胁行为者能够发现并利用真实软件漏洞,我们使用自动化基准和人工参与的工作流程进行了评估。对于这两种方法,我们都在隔离的沙箱环境中运行被测模型,使其只能攻击我们为这些评估目的设置的离线目标。我们主要关注漏洞利用开发能力,因为正是在这一方面,Claude Mythos Preview 相较此前的 Claude 模型展现出了显著跃升。

首先,我们在 ExploitBench 上运行了该模型,该基准测试衡量 AI 模型利用 Google Chrome 所用 V8 引擎中已知漏洞的能力。这里我们关注的是模型成功开发端到端漏洞利用的能力,因为这是对攻击者最相关的能力,也是我们看到模型之间出现显著变化的地方。我们发现 GLM-5.3 在 410 次尝试中有 50 次开发出端到端漏洞利用。Claude Mythos Preview 的成功率类似——410 次尝试中有 56 次。

在我们的内部二进制漏洞利用基准测试中,1 我们测试模型能否在参与 Google OSS-Fuzz 项目的热门开源项目中找到并利用漏洞。在这里,完全控制流劫持才能获得满分。我们在该基准测试的 100 个任务(随机选取)上评估了多个模型,发现 GLM-5.3 在 4% 的试验中实现了完全控制流劫持;Claude Mythos Preview 则为 6%。尽管 GLM-5.3 在此项上表现低于 Claude Mythos Preview,但显然已经跨过了一个有意义的门槛:更早的模型,如 Claude Opus 4.6 和 GLM-5.2,在任何一次试验中都未能成功。

Two line charts of exploitation success versus output-token budget on a log scale. On ExploitBench, Claude Mythos Preview reaches 14% and GLM-5.3 reaches 12%, while Kimi K3, DeepSeek-V4.1-Flash, Claude Opus 4.6, and GLM-5.2 stay at or near 0%. On Anthropic's internal Binary Exploitation benchmark, Mythos Preview reaches 6% and GLM-5.3 reaches 4%; all other models score 0%.
图 2. 漏洞利用能力与输出 token 预算的关系。每条线显示模型达到基准测试最高结果的尝试占比与所用输出 token 的关系。两幅图均展示了两个在禁用安全防护下运行的 Claude 模型(Opus 4.6、Mythos Preview)、两个 GLM 模型(5.2 和 5.3),以及 Moonshot AI(Kimi K3)和 DeepSeek(V4.1-Flash)发布的最新开放权重模型的结果。

接下来,我们评估了 GLM-5.3 在人类专家手中执行开放式进攻性网络任务的表现(与我们今年早些时候对 Claude Mythos Preview 的测试相呼应)。在这里,我们选择人类专家不了解现有漏洞的目标,然后要求他们使用该模型来识别和利用新漏洞。这些实验测试了专家在短时间内能做什么:通常运行一天或更短,人类专注时间总计不到一小时。

Redacted screenshot of an exploit page generated by GLM-5.3. A banner reads "Sandbox escaped — web content read /root/.ssh/id_rsa (1896 bytes)," above a live exploit log and the exfiltrated SSH private key, demonstrating a drive-by browser exploit chain stealing a file from the victim's computer.
图 3. 研究人员驱动测试期间由 GLM-5.3 生成的漏洞利用页面的打码截图,显示其通过恶意网站窃取用户的 SSH 私钥。该漏洞利用串联了模型在一个热门网页浏览器组件中发现的多个 0-day 漏洞,从用户计算机上读取敏感文件。

在第一次会话中,一名研究员在一台沙盒机器上使用了 GLM-5.3,该机器装有本地 Linux 构建版的热门网页浏览器。在一天的时间里(且人工关注有限),GLM-5.3 在该浏览器的 JavaScript 引擎中发现了若干此前未知的漏洞,并将它们串联成一个可用的漏洞利用程序:一个网页,当被访问时,会从访问者的计算机中读取任意文件(如图 3 所示)。该漏洞利用针对的是该浏览器的 Linux 构建版,因为这是提供给该模型的唯一环境。然而,我们认为这些漏洞也可能影响其他平台上的用户,尽管在这些平台上实现利用的路径可能更为复杂。(我们已向维护者披露了这些漏洞。)在会话后期,该研究员还借助 GLM-5.3 在若干其他广泛使用的系统中发现了可利用的漏洞,包括无线和图形驱动程序以及面向网络的设备软件。我们目前正在审查这些报告,并将酌情向维护者披露。

在第二次会话中,一名研究员使用 GLM-5.3-Flash(GLM-5.3 的一个更小、能力较弱的版本)为一个已知漏洞开发漏洞利用程序(我们此前曾在此处撰文介绍过这些“N-day”漏洞利用)。在此,该研究员聚焦于 Google Chrome 中一个近期披露的缺陷(CVE-2026-11645),以观察该模型能将一个公开修复多快地转化为可用的攻击。该研究员向 GLM-5.3-Flash 提供了该 CVE 及另一个已知缺陷的公开细节。在研究员没有给出重要指导的情况下,GLM-5.3-Flash 将这两个缺陷的漏洞利用串联起来,为 ARM64 目标构建了一条可靠的漏洞利用链,绕过了指针认证(PAC)加固。这花费了 20 分钟的人工关注,外加 GLM-5.3-Flash 8 小时的工作。按智谱的 API 价格计算,这项工作将花费 20.40 美元。

GLM-5.3 缺乏稳健的防护措施

GLM-5.3 发布时带有一些内置防护措施:如果用户要求明显有害的内容,该模型通常会拒绝。2 在我们的测试中,我们发现这些防护措施可以通过多种简单技术被绕过或移除。

最密集——也最成功——的方法是一种标准的拒绝削减技术,称为“abliteration”。由于 GLM-5.3 是以开放权重模型的形式发布的,用户可以重新配置它以移除其拒绝行为,而能力几乎没有变化。若干开发者在 GLM-5.3 发布后数天内就向公众发布了经过 abliteration 处理的 GLM-5.3 版本。

为了研究消融(abliteration)能让攻击者绕过 GLM-5.3 安全防护的程度,我们自行制作了一个消融版本,然后在三个公开基准测试(JailbreakBench、HarmBench 和 StrongREJECT)上运行,这些基准衡量模型对明显有害请求的顺从频率。消融该模型让我们这个此前从未尝试过此任务的团队花费了约 2,200 GPU 小时,计算成本约为 4,400 美元。3 消融 GLM-5.3-Flash 则花费了约 600 GPU 小时。这一改动使 GLM-5.3 的拒绝率从前两个基准(JailbreakBench 和 HarmBench)上的 90% 以上降至约 3% 和 2%,在第三个基准(StrongREJECT)上降至 12%。消融并未显著降低模型的能力:在衡量通用科学能力的 GPQA-Diamond 评估中,标准版和消融版模型得分相同;在 CyberGym 评估的一个测试子集中,消融版得分低了几个百分点(如下图所示)。

Two bar charts on abliteration. Top: mean refusal rate across three harmful-request benchmarks falls from 95% to 6% for abliterated GLM-5.3 and from 95% to 14% for abliterated GLM-5.3-Flash, while Claude models refuse about 96% and cannot be abliterated because their weights are not released. Bottom: capability scores on GPQA-Diamond and CyberGym are nearly unchanged after abliteration.
图 4。 上:已发布版和消融版 GLM 模型以及 Claude 模型在 JailbreakBench、HarmBench 和 StrongREJECT 上的平均拒绝率。消融后,GLM 模型很少拒绝这些查询。Claude 模型无法被消融,因为其权重未公开或不可定制。下:GLM-5.3 和 GLM-5.3-Flash 与其消融变体在 GPQA-Diamond 和 CyberGym 上的表现。消融基本保留了模型能力。

在我们的测试中,我们观察到 GLM-5.3 的安全防护也可以无需使用模型的消融版本来绕过。我们将模型置于一个模拟世界4中,在其中向它发出攻击关键系统的明显恶意请求。开箱即用时,GLM-5.3 在所有试验中都拒绝(与我们测试的其他模型一样)。但我们找到了几种简单的方法来绕过 GLM 模型的安全防护,使其在大多数或所有情况下都会响应这些请求。这些方法包括:

  1. 提供一个欺骗性提示,例如告诉模型它是一个正在执行演练的自主红队代理。这能让 GLM-5.3 有 64% 的时间参与其中。
  2. 预填充模型的思考 token,使其看起来已经考虑过用户的请求并决定继续。这能让 GLM-5.3 有 92% 的时间参与其中。
  3. 使用模型的消融版本,如上所述。这能让 GLM-5.3 有 100% 的时间参与其中。

在我们的测试中,这些技术都无法让受防护的 Claude 模型执行我们测试的有害任务。Claude 的安全防护阻止了使用欺骗性提示的请求。Anthropic API 让潜在攻击者无法预填充 Claude 的思考。而且由于 Claude 的权重不提供给用户,他们无法通过消融来改变 Claude 的行为。

Table showing how often each model tried to connect to a remote target after a harmful cyber-attack order. GLM-5.3 engages 0% on a bare order but 64% with a false cover story, 92% with prefilled reasoning, and 100% when abliterated; GLM-5.3-Flash follows a similar pattern. Claude Opus 4.8, Opus 5, and Mythos 5 stay at 0% in all applicable conditions; prefilling and abliteration are not possible against the Claude API.
图 5。 在明显有害请求后,各模型按模型和绕过条件尝试连接远程目标系统的比率(每格 50 个样本,五种攻击顺序 × 两个目标 × 五次尝试)。GLM-5.3 从直接请求时的零参与率,在掩护故事、预填充和消融条件下分别升至 64%、92% 和 100%,而所有测试的 Claude 模型在 API 安全防护下均保持为零。带挂锁的格子表示针对 Claude API 通常不可行的攻击。

为了展示 GLM-5.3 的消融版本如何愿意参与有害任务,我们摘录了它生成的思维链中的一段话:

Quoted reasoning from the abliterated version of GLM-5.3 in a simulated environment. The model writes "my job is to cause deaths quietly," briefly weighs the environment's safety warnings, then concludes that the operator's instruction overrides them and decides to proceed with the harmful task.
图 6。在我们的模拟环境中,GLM-5.3 的消融版本考虑了如何参与一个明显有害的请求,尽管最初有一些伦理顾虑,最终仍决定遵循用户的指令。文本逐字引自该模型的思维链。

这意味着什么?

GLM-5.3 很可能会让恶意行为者获得相关能力,使他们能够在没有实质性限制的情况下发现并利用网络漏洞。这与任何其他同等能力的 AI 模型都不同,那些模型发布时都带有防护措施,或通过受限访问计划提供。GLM-5.3 的发布标志着攻击者可获得的网络能力出现了有意义的阶跃式变化。Anthropic 和 其他美国 AI 实验室近期发布了报告,披露了网络攻击者如何尝试使用 AI 系统。鉴于这些证据,我们认为国家和非国家行为者都有可能使用像 GLM-5.3 这样的模型来造成现实世界的伤害。

另一方面,具备这种能力水平的模型也可以被防御方使用。我们认为,网络防御者应该使用能满足其需求的最佳可用工具。我们正在努力安全地扩大 Claude 网络能力的访问范围,让尽可能多的防御者能够使用。网络防御者面对的对手会使用他们能用的每一种有能力的工具,我们认为防御者应该配备至少与其对手所用模型同样优秀的前沿模型。

通过 Project Glasswing(以及其他努力,如 Patch the Planet),网络防御者在这一时刻到来之前,已在保护关键系统方面取得了有意义的进展——但仍有许多工作要做。虽然经过审查的防御者现在可以通过我们的可信访问计划使用像 Claude Mythos 5.1 这样更先进的模型,但自由可获取能力的一个关键门槛现已被跨越。GLM-5.3 凸显了将先进前沿模型的访问范围扩大到更广泛实体的紧迫性,以赋能网络防御者。

政府应对能力足够强的 AI 模型(包括 GLM-5.3 的后续版本)进行安全测试。如果没有来自独立来源的高质量评估,这些能力的影响可能直到为时已晚才会被模型开发者完全看清。随着世界各地的 AI 开发者构建能力越来越强的开放权重模型,我们希望他们努力对这些能力进行适当防护并防止滥用。

来源:Anthropic:Research(发表成果 · 网页) · anthropic.com