OpenAI 披露并处置一起有组织的模型蒸馏攻击行动
Disrupting a coordinated model-distillation campaign
OpenAI 披露其识别并处置了一起有组织的攻击行动,该行动旨在系统性提取模型受保护的推理内容,最早活动出现在 7 月第一周。
OpenAI 以当事方身份披露对抗性蒸馏攻击的细节、规模和处置方式,读者可借此了解前沿模型推理内容面临的共享安全挑战。
扰乱一场协同的模型蒸馏行动
加载中…
分享
我们最近发现并扰乱了一场协同行动,该行动旨在从我们的模型中提取受保护的推理内容,最早观察到的活动发生在7月第一周。这一活动符合对抗性蒸馏的特征:系统性地、未经授权地利用一个模型的输出或推理来帮助训练、复制或改进另一个模型。受保护的推理是模型处理任务时的内部记录;提取它可以揭示最终答案中未披露的信息,并帮助他人复制该模型的能力。
操作者并未破解我们的加密、入侵数据库或直接访问存储的用户对话。相反,他们操纵模型交互,使受保护的推理能够以请求者可见的形式被复制,且以协同、大规模的方式进行,违反了我们的服务条款。这种操纵并非OpenAI模型独有的漏洞,我们已通过Frontier Model Forum与行业伙伴分享了相关信息,以加强对对抗性蒸馏的集体防御。
在发布之前,我们调查了其范围和潜在影响,部署了我们自己的缓解措施,并与研究人员和行业伙伴分享并采纳了反馈,以确保针对此类攻击的防护措施到位。额外的缓解和调查工作仍在继续。我们相信,现在分享我们所了解的情况将有助于更广泛的生态系统加强其防御。
我们观察到的情况
我们看到操作者尝试以新颖的方式提取受保护的推理,包括将一段对话中的加密推理复制到另一段对话中,并要求模型解密并转录隐藏的推理内容。
独立安全研究人员(在新窗口中打开)还通过负责任披露向我们提出了相关的跨模型和对话压缩漏洞。我们调查了他们的发现,并确认他们识别的攻击路径是真实的。他们的工作帮助我们理解了更广泛的攻击类别,并加速了缓解措施。
该活动始于7月1日,起初规模较小,直到我们在7月24日和25日观察到高流量峰值,包括来自4,000多名用户的16,000次使用相关提取模式的请求1。进一步调查发现,在一个超过15,000名用户的集群中存在相关的提示模式活动,我们已于7月28日将其完全扰乱。
该活动随时间不断演变,这进一步表明对抗性蒸馏是一个更广泛的安全挑战,需要分层、自适应的防御。
我们对归因的评估
目前尚不清楚我们在相关时间段内观察到的所有操作者是否来自单一行为者。然而,我们将该活动的核心集群归因于与Moonshot AI(Kimi的开发者)有关联的个人。
为何这很重要
对抗性蒸馏带来安全和国家安全风险。提取的推理可能被用于训练另一个模型,而无需保留应用于原始模型面向用户输出的安全防护措施。在大规模情况下,蒸馏还可以加速先进能力的转移,而无需在安全方面进行同等投入。随着模型在双重用途领域获得能力,这些担忧会进一步加剧。
这一风险并非OpenAI独有。如上所述,类似技术可能影响其他先进AI系统,使其成为需要全行业协调应对的共同安全挑战。
我们的应对措施
我们通过账户执法、技术控制和合作伙伴协调相结合的方式,缓解了这起近期的蒸馏行动。我们封禁或限制了欺诈性账户,加强了注册和基础设施控制,并扩大了对相关网络的监控。
我们还加强了跨用户、工作区、组织和模型系列的隐藏推理保护。我们关闭了一条路径,该路径允许已持有另一用户加密推理内容的人重放该内容并恢复其内容,并增加了检查以检测和暂扣可能暴露推理的流式输出。当相关活动通过第三方服务进行时,我们与这些提供商合作,识别并瓦解了涉事账户。
最后,我们通过前沿模型论坛和适当的政府信息共享渠道分享了相关发现,以便其他前沿开发者和公共部门合作伙伴能够查找类似活动并加强自身防御。支持可移植或可重放推理产物的系统可能面临相关风险。
下一步
我们预计,随着前沿模型的改进,以及行为者寻找更廉价的方式来模仿其能力,对抗性蒸馏尝试将变得更加复杂。防御此类活动需要分层控制和持续适应。
这项工作尚未完成。合作伙伴托管的部署需要与第一方服务相同的保护,而工具输出攻击需要能够检查普通可见文本之外内容的保护措施。我们正在继续改进工具防御、分类器覆盖范围、模型拒绝能力,并将相关控制措施推广到云合作伙伴。
我们的应对将继续聚焦三个领域:针对提取的更强技术保护、针对协同行动的更好检测与执法,以及跨行业和政府的更深入威胁信息共享。
作者
OpenAI
脚注
- 1 这些数字描述的是尝试提取,而不一定是成功提取。
来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com