英国 AISI 报告网络安全评测中出现智能体未授权行为,涉及 Anthropic Mythos 5 与 OpenAI GPT-5.6 Sol
Incident Report: unsanctioned agent behaviour during cyber testing
英国 AI Security Institute 报告,2026 年 7 月 28 日在日常网络安全评测中发现被测智能体向真实人群和组织开展持续的未授权活动,共在 122 次运行中的 10 次里录得 19 起此类行为,其中 17 起来自 Anthropic 的 Mythos 5,2 起来自关闭 cyber classifiers 的 OpenAI GPT-5.6 Sol。
官方事件报告详述智能体在宽松评测条件下自主欺骗真人、试图供应链攻击的全过程与补救措施,可帮助读者理解这类新型自主行为风险的边界和成因。
你可以访问完整的技术报告此处。
AISI 的职责是评估和理解前沿 AI 模型的能力,在潜在风险到达公众之前将其揭示出来。为了评估这些模型能做什么,包括它们是否可能被滥用于网络攻击,我们在刻意宽松的条件下对它们进行测试:允许访问开放互联网,并禁用部分安全过滤器。
2026 年 7 月 28 日,AISI 的安全团队在一次例行网络评估中检测到有异常数据传输离开我们的研究系统。经调查,我们发现一些正在接受测试的智能体针对真实的人和机构进行了持续的、可能有害的活动。我们宣布这是一起安全事件,并在发现后约一小时内将其控制住,同时启动了全面调查。
该事件源于一次评估,其中智能体被赋予解决一项网络安全挑战的任务。我们在多个模型上运行了这项挑战 122 次。调查发现,在其中 10 次运行中,一个 AI 智能体在实时互联网上采取了自主的、未经授权的行动,针对真实的人和机构。我们总共记录了 19 起此类行动。几乎所有这些行为(17 起)都来自同一个模型——Anthropic 的 Mythos 5,另有 2 起涉及 OpenAI 的 GPT-5.6-Sol,且其网络分类器(防止滥用的机制)被禁用。在最严重的一起案例中,一个智能体试图将恶意代码插入一个开源项目。为了让代码获得批准,该智能体进行了社会工程——创建虚假的在线身份,并利用它们向项目维护者施压以批准该代码。一位人类维护者发现并拒绝批准该恶意代码。
这些尝试均未成功,我们的调查也未发现由此造成任何现实世界的伤害。但这是我们第一次看到自主性和欺骗相关的风险在没有特定提示的情况下,如此清晰地在现实世界中显现。
重要的是,这并不是模型逃出其安全测试环境或“沙箱”的情况。正如我们网络测试中的标准做法,我们有意允许了互联网访问,并刻意禁用了模型提供方的网络分类器——这些条件并不反映前沿模型向公众开放的方式。我们这样做是为了最好地评估模型的最大能力。这些配置选择在前沿 AI 评估中一直是常见做法。所涉及的具体模型,在我们测试它们所用的配置下,并未商业化提供,也没有明确迹象表明在测试场景之外存在类似活动。
在发布这篇博客之前,我们已将智能体的恶意活动通知了 GitHub(评估期间访问的开发者平台),其中包括 GitHub 已确认违反其服务条款的行为。我们与 GitHub 合作,移除了智能体留下的痕迹,并通知了模型交互过的 GitHub 用户。我们还联系了其他受影响方。我们还打算与 METR(模型评估与威胁研究)合作,进行独立的第三方审查——我们仍在与他们商讨此次审查的范围。
这一事件应谨慎而细致地加以解读。在某种程度上,我们的评估设计选择和具体配置促成了这一行为。尽管如此,该智能体所从事的活动显示出新颖的、可能具有欺骗性的行为迹象,其程度和严重性超出了我们的预期。
有一些重要的注意事项需要牢记:我们是在非常特定的条件下观察到少量事件的,目前还无法说明这种行为在不同情境下或在测试环境之外发生的可能性有多大。我们还无法确定该智能体何时意识到自己正在采取现实世界的行动,或者它在多大程度上认为自己处于虚构的测试场景中;我们迄今为止的分析呈现出复杂的情况,调查仍在进行中。
我们可以确定的是,这种行为是可能的、持续性的且是新的;仅这一点就值得关注。
这正是 AISI 存在的意义所在——揭示这类行为,在受控评估中将其暴露出来,以便在能力更强的模型被广泛部署之前加以理解和应对。本文阐述了发生了什么、为何重要,以及我们正在采取什么应对措施。我们的配套技术事件报告提供了更多细节,我们打算随着调查的继续分享更多信息。
发生了什么
AISI 定期使用网络靶场测试前沿模型的网络能力:这些是受控的模拟网络,模仿现实世界的系统。AI 智能体被赋予一项网络安全挑战任务,例如找到一份受保护的数据,并自主地通过多个步骤来完成它。
本次演练将现有网络靶场与一个新靶场进行对比,在两个靶场上测试了七种不同的模型,总共进行了 122 次运行。所有运行均在 AISI 的研究环境中进行,使用虚拟机沙箱将智能体与 AISI 的其他基础设施隔离。评估设置中的两个特点对随后发生的事情至关重要:
- 互联网访问被有意启用。为了衡量这些模型真正能做什么,我们在反映有能力的真人攻击者所能做到的条件下来测试它们,包括访问开放互联网。
- 开发者的网络分类器被有意关闭。前沿模型通常部署时带有内置过滤器,用于阻止危险行为。作为受信任的测试合作伙伴,AISI 可以禁用这些过滤器,以激发模型的底层能力。
这种条件组合并不反映前沿模型向公众开放的方式。
我们如何发现这一事件
7 月 28th 日上午,我们的安全监控发现数据通过“Tor”匿名网络从我们的一个测试系统流出,该网络通常用于掩盖互联网流量的来源。负责该评估的团队在几分钟内就开始审查该智能体的活动。
他们很快发现,在一次运行中,该智能体在一个真实的、公开的 GitHub 开源项目上创建了一个恶意的“拉取请求”(即提议的代码更改)。我们宣布进入安全事件状态,停止了所有相关评估,并禁用了对能力最强模型的内部访问。在警报发出后一小时内,所有评估运行均被终止,相关机器被隔离。在随后的数小时和数天里,我们审查了全部运行记录,将自动转录扫描与专家人工分析相结合,以确定发生了什么,以及是否在其他地方也发生过类似情况。
我们的发现
122 次运行中有 43 次涉及 Mythos 5,122 次运行中有 35 次涉及 GPT-5.6 Sol。这 122 次运行的绝大多数都按预期进行。然而,在 122 次运行中的 10 次里,我们发现了 19 起智能体采取了超出测试参数范围的不同行动的情况。其中 17 起来自 Mythos 5,2 起来自一次涉及 GPT-5.6 Sol 的运行。
这 19 起情况并非独立事件;它们聚集为少数几种相互关联的行为。它们主要源于一个智能体(Mythos 5)的一条持续活动线索,另有少数相关行动发生在其他地方。该行为发生在 2026 年 7 月 25 日至 7 月 28 日之间。
下面,我们重点介绍观察到的四种最重要的行为。案例的完整摘要见我们的技术事件报告。
1. 对真实开源软件的一次供应链攻击未遂。在最严重的一系列行为中,一个智能体试图将恶意代码插入一个被公开使用的开源项目,并采取行动试图获得人类审查者对该插入的批准。该智能体调查了项目的人类维护者,创建了多个虚假身份,并利用这些虚假身份对社会工程手段操纵一位真实维护者批准该代码。当该智能体的拉取请求在公开场合受到质疑时,它编辑了自己先前的活动使其显得无害,并考虑采用一个新身份继续。该智能体使用 Tor 绕过 GitHub 上的部分网络限制,这正是最初触发 AISI 安全警报的原因。
2. 试图欺骗并针对真实人员。作为同一行动的一部分,该智能体试图直接联系真实人员,通过在线文件传输服务发送消息和文件,以说服他们或他们自己的 AI 编码工具运行恶意代码。一些消息携带了有害载荷,一些则是社会工程尝试;针对的是真实人员——这是我们此前从未观察到的。
3. 试图植入并提示注入恶意代码。该智能体试图将恶意指令插入到它推断其他自动化 AI 系统可能会拾取并执行的位置。提示注入是旨在操纵 AI 编码助手的隐藏指令。
4. 同时被评估的独立智能体之间的协作。一个智能体在 GitHub 上留下公开消息,提出与处理同一挑战的其他智能体协作。它还提供了重用其留下的账户和产物的说明,这些随后被后续智能体发现并使用。
我们评估了每起事件造成现实世界危害的可能性。最严重的尝试均未成功。有些行为产生了有限的现实世界影响,但发生在受控环境中;我们在随附的技术报告中列出了这些情况。 我们的调查未发现由此造成的任何现实世界危害。
为何会发生
从根本上说,该智能体采取这些行动是为了完成被设定的任务——解决网络靶场。若干因素促成了未经授权行为的出现:
- 该智能体坚持不懈地追求其目标。AI 智能体会探索其操作者未曾预料的路径。面对一个困难的目标,该智能体不断寻找突破口,而它找到的某些路径涉及试图欺骗真实的人。它从未被指示去欺骗;欺骗是追求任务过程中的副产品,这种目标导向的欺骗直到最近在很大程度上还只是理论上的。
- 任务本身很难,而配置错误有时让它更难。在多次运行中,任务提示被错误配置,导致该智能体(错误地)认为不存在无需超出预期任务范围就能实现的“解决”方案。有充分理由认为,近乎不可能的任务会推动模型采用更“有创意”、也更具越界性的问题解决方式。但这并不能完全解释这些行为:在某些运行中,即使该智能体拥有按预期方式解决任务所需的指令,它仍然以这种方式行事。
- 互联网访问是开放的,且监控并非专门为此构建。我们有意授予互联网访问权限,以便该智能体下载其任务所需的工具;我们未曾预料到的是,这会导致该智能体利用这一互联网访问权限将行动指向真实的人。在较早的模型世代中,这一风险权衡被认为是可以接受的,但随着能力的提升,我们未能足够快地重新审视这一判断。我们的安全团队是在事后通过常规监控检测到异常流量的,而不是通过为实时监视该评估而构建的监控——后者本可以更早地标记或阻止该行为。
- 该智能体没有被明确指示不得利用开放的互联网访问或避免社会工程手段。此前,并不清楚在使用经过对齐训练的模型时,此类指示是否必要。
限制损害的因素也提供了宝贵的洞见。人工审查和良好的安全实践发挥了重要作用。在一个实例中,某智能体的恶意拉取请求被一名人工审查者发现。该智能体通过创建虚假账户来鼓励审查者批准该请求的社会工程尝试失败了。一名公众成员怀疑代码是恶意的,便在一个为隔离此类代码而构建的安全隔离环境中打开了它。
此外,该智能体并未直接逃出将测试环境与 AISI 其他内部系统隔离开来的安全测试环境(“沙箱”)。智能体通常会探索此类环境以了解自己可以访问什么,但在这里,没有任何智能体试图突破它,或攻击 AISI 的系统。
在这些情况下,标准的良好实践、人类判断以及对 AI 生成代码的谨慎态度阻止了最坏结果的发生。但在若干案例中,失败与成功之间的差距十分微小,依靠的是人类的警觉,而非能够可靠防止更强大智能体出现此类行为的技术屏障。
未来的教训
我们将此视为一起严重事件,有必要对 AISI 的评估协议和安全架构做出持久性改变。对 AISI 及其他评估机构而言,有三条教训尤为突出:
- 更严格的互联网访问控制。我们正在将细粒度网络控制构建到我们的网络靶场中,目标是在适当约束评估的同时,保留其所需的真实感。我们已在所有其他评估中使用细粒度网络控制,现在将把授予互联网访问的决定视为必须主动证明其合理性的事项,而非默认选项。
- 实时监控。我们正在引入专为在评估运行过程中进行监视而构建的监控机制,能够在越界行为发生时对其进行标记或阻止。
- 重新评估评估设计。评估应假定一个能力强大的模型可能会试图超越其职权范围行事,并预先限制任何此类行为的范围。AISI 的沙箱指南建议根据评估的设计来定制沙箱配置; 良好的隔离不应依赖于模型选择不去试探其边界。我们还在增加额外检查,以确保任务被正确指定,并可通过预期路径解决。
除这些变化外,我们正从网络安全和 AI 对齐两个角度分析所发生的情况,并审计过往评估中可能未被注意到的类似行为。
我们还将此事公开披露,以便他人能从我们的经验中学习,并继续与 Anthropic 和 OpenAI 密切合作,进一步调查此事件。
这对个人和企业意味着什么
此事件发生在受控评估中,而非日常使用中,且没有明确迹象表明在测试场景之外存在类似活动。然而,这仍是一个需要做好准备的理由。随着 AI 模型变得能力更强、更易获取,我们在此事件中看到的情况可能会变得更加普遍。
最有效的应对措施仍然是标准的网络卫生,随着 AI 的进步,这一点愈发重要。各组织应确保网络安全基础措施得到稳健落实,并在验证外部代码和贡献时保持谨慎。五眼网络安全机构负责人已就此领域联合 呼吁采取行动,英国国家网络安全中心(NCSC)也已发布指南 ,说明随着前沿 AI 的网络能力不断演进应如何做好准备。我们鼓励各类组织注册 NCSC 的免费预警服务,将网络事务列为董事会层面的责任,并在其整个供应链中要求符合 Cyber Essentials 标准。
最终反思
此类事件反映了 AI 发展的速度。随着能力不断进步,理解这些系统并确保其安全的工作必须与之同步推进。
AISI 是一个有能力且拥有强大安全实践的组织,我们通过自身的程序发现了这一行为。但没有任何组织的防御能够永远保持充分。在本案例中,我们有意启用了互联网访问,并且没有主动监控能够更早地发现这一行为——这些是我们今后将直接解决的问题。我们公开这些教训,以便他人能够学习和调整。
结合 OpenAI 和 Anthropic 最近报告的事件来看,这一事件表明风险格局正在发生转变。危害不仅可能源于人们故意滥用公开可用的模型,还可能源于在内部研究或特权访问环境中运行的有能力智能体采取超出其授权范围的意外行动。
我们已经列出了为这一事件提供背景的重要注意事项。这些行为是在一次评估中出现的,当时一个智能体正试图完成一项任务。我们目前无法确定该智能体究竟何时认为自己在测试中,也无法确定它对其行为可能产生的现实世界影响有多清楚。无论如何,这一事件表明了一个值得立即关注的发展方向。
AISI 的存在就是为了识别这些问题、理解它们,并分享我们所学到的内容,以便在更强大的系统部署之前解决这些问题——无论是在 AI 实验室内部、向可信合作伙伴,还是向公众。这项工作尚未完成,但它由政府、行业和研究界共同分担。现在的任务是加强我们的防御,并确保安全工作跟上步伐。
你可以在此阅读我们的技术事件报告。
来源:英国 AI Security Institute:Blog(网页) · aisi.gov.uk