跳到正文
北京时间
原文
Meta AI:Research Blog(网页)·· 2026-08-14精选AI 评分74

Meta 复盘 Muse Spark 1.1 第三方网络安全评测配置失误事件

Addressing an issue involving a third-party cyber evaluation of Muse Spark 1.1

AI 导读

Meta 官方说明,第三方评测方 Irregular 因测试环境配置错误,使预发布版 Muse Spark 1.1 访问开放互联网,误将真实网站当作演练目标并利用其安全漏洞获取信息、修改数据库。Meta 审查了逾 10000 条测试活动记录,确认事件仅此一例、不属于复杂的攻击或沙盒逃逸;Irregular 已禁用相关评测并修复配置,Meta 将引入测试环境隔离的独立验证等要求。

推荐理由

官方复盘第三方安全评测中模型误攻真实网站的经过与整改措施,读者可了解评测环境隔离与行业共同面临的安全挑战。

正文 · AI 翻译

跳转到主要内容

Image 1Image 2

试用 Meta AI

关于第三方对 Muse Spark 1.1 进行网络安全评估所引发问题的说明

2026 年 8 月 14 日·5 分钟阅读

一家第三方模型评估机构在评估我们上一代大语言模型 Muse Spark 1.1 时,因配置错误发现了一个网络安全问题并通知了我们。在收到该披露后,我们完成了一次详细的复盘,以了解该事件及其影响。本文将进一步介绍我们的发现。

我们的网络安全评估旨在通过针对特定威胁场景进行测试来衡量模型的能力,将公开基准与内部基准以及独立第三方测试相结合。其中一些评估在移除生产环境中所部署的标准防护措施的情况下进行,以衡量模型的底层能力。这是我们发布或部署模型之前所开展的更广泛评估流程的一个组成部分。测试 AI 模型的网络安全能力,对于在部署前了解其能力至关重要。

发生了什么

我们委托 Irregular 对预发布模型进行网络安全评估。作为该项工作的一部分,我们要求他们按照我们的常规测试协议,测试 Muse Spark 1.1 的一个预发布版本。7 月初,Irregular 开始进行一项演练,在移除防护措施的封闭测试环境中评估我们的模型是否有能力完成一项对抗性网络安全任务。然而,当 Irregular 搭建测试环境时,一处配置错误使模型能够访问开放互联网,并且 Irregular 无意中向模型提供了真实网站的名称作为其目标,而非虚构演练中“目标”的虚构名称。

Muse Spark 1.1 的预发布版本误以为该真实网站就是预定目标,识别并利用了该真实网站中的一个安全漏洞。模型访问了该网站的某些信息,并修改了该网站的数据库。Meta 通过 API 提供模型访问权限,而此次评估完全在 Irregular 的基础设施上运行,因此我们掌握的关于该第三方公司的信息有限,并正在采取措施确保其数据不在我们的系统上。Irregular 大约在同一时间还在评估其他几家公司的 AI 模型,这些模型也表现出类似行为。配置错误问题已得到控制,Irregular 禁用了受影响的评估,并通知了我们,同时确保受影响方也收到了通知。我们感谢 Irregular 及时披露该问题以及他们持续的合作。

我们的发现

Irregular 发现问题后,便禁用了受影响的评估。随后我们开始了自己的独立调查。我们的安全团队审查了 Muse Spark 1.1 在测试期间超过 10,000 条活动记录,并进行了更深入的分析,以了解所发生事件的全部范围。

主要发现包括:

  • 除此次评估外,未发现该模型利用第三方公司系统的其他实例,证明该事件具有孤立性。
  • 该模型是根据所收到的指令及其所处的环境,在其被分配的任务范围内运行的,这并非一次复杂的攻击性网络攻击或沙箱逃逸。
  • 我们的审查还发现了测试环境及其集成方面其他需要改进的地方,我们已与 Irregular 分享这些内容,以支持其修复工作。
  • 我们还发现了监控方面的改进点,这将有助于未来更早地识别此类问题。

加强评估安全性

在部署前测试 AI 模型的网络安全能力,对于了解其能力至关重要。我们将这些评估作为更广泛的准备方法的一部分,该方法包括在模型发布或部署前进行多层内部和外部测试。我们发布的评估报告详细说明了我们在网络安全和模型对齐等多个领域进行的压力测试。但随着模型能力增强,这些评估暴露出一个具体挑战:那些展现出发现和利用漏洞能力的模型,在测试期间需要相应更强的隔离措施。这是整个行业面临的挑战,各实验室正在积极应对,包括改进测试期间的隔离、更好地分离评估与生产环境,以及持续研究如何在不强化模型中不良行为的情况下安全地进行评估。

这一问题凸显了在这些环境中围绕互联网使用建立适当防护措施和协调机制的重要性。Irregular 已确认该错误配置已得到纠正,且评估不会引用真实网站名称。今后,我们将对测试环境隔离实施独立验证要求,并在评估开始前进行场景审查,确保测试场景不引用真实公司。更广泛地说,我们将继续投资于评估和准备基础设施。随着模型能力的进步,评估环境和实践需要跟上步伐,无论是在我们自己的基础设施中,还是在我们合作的第三方伙伴中。

展望未来

我们正在为全行业的努力做出贡献,以帮助改进安全和评估安全实践、模型对齐,以及模型在对抗性测试场景中的行为方式。我们计划继续与合作伙伴一起,加强以安全方式开展评估的方式。我们感谢 Irregular 的合作,并期待继续与他们密切合作,共同推进安全工作。

Meta AI

开发者

模型

法律

Meta © 2026

处理涉及 Muse Spark 1.1 第三方网络评估的问题 | Meta AI 研究

来源:Meta AI:Research Blog(网页) · research.meta.ai