跳到正文
北京时间
原文
The Decoder:AI News· Maximilian Schreiner·· 3 小时前精选AI 评分77

OpenAI 称拦截蒸馏窃取攻击,但研究者称同样手法在 Azure 上仍可窃取 GPT-6 Astra 等模型的推理内容

OpenAI says it stopped a campaign to steal its models' reasoning, but the trick still worked on Azure

AI 导读

OpenAI 称 7 月拦截了一起针对其模型推理链的蒸馏窃取活动,7 月 24 至 25 日出现来自超 4000 用户的 16000 次请求,关联账号超 15000 个,OpenAI 将其与 Moonshot AI 相关人员联系起来,并于 7 月 28 日关停。

推荐理由

原文把 OpenAI 的拦截行动与研究团队的复测放在一起看,读者可以了解同一模型在不同云平台防护不一致的问题。

正文 · AI 翻译

在蒸馏中,一个模型从另一个模型的完整输出中学习。这包括更强模型的完整思维链,而不仅仅是它的答案。这些中间步骤正是输出如此有价值的原因。OpenAI 表示,它们可能包含被刻意排除在最终答案之外的信息,并且可以帮助他人复现模型的能力。

据 OpenAI 称,该活动于 7 月 1 日以低量开始。7 月 24 日和 25 日,它激增至来自 4,000 多名用户的 16,000 次请求,全部依赖一种典型的提取模式。进一步调查发现了一个由 15,000 多个具有相关模式的账户组成的网络,OpenAI 表示已在 7 月 28 日前将其完全关闭。一条脚注澄清,这些是尝试性提取,不一定是成功的提取。

OpenAI 将这一活动背后的一个核心团体与 Moonshot AI 相关人员联系起来,Moonshot AI 是开发 Kimi 语言模型的公司。该公司表示,尚不清楚其观察到的所有行为者是否都追溯到单一来源。Anthropic 最近报告了中国 AI 公司的类似尝试。

一个廉价模型可以解锁一个昂贵模型的隐藏思维

据 OpenAI 称,攻击者从一段对话中复制加密的推理内容,然后在另一段对话中要求一个模型将其解密并写出来。

研究员 Joachim Schaeffer 及其团队已在一篇论文中展示了这一原理。AI 提供商仅以加密数据包的形式将推理内容发回给客户,客户会将这些数据包随后续请求一起传递。研究人员发现,由于这些数据包使用共享密钥加密,它们可以在会话之间、用户之间,甚至同一提供商的不同模型之间转移。这使得同一家族中更弱、更便宜的模型可以充当“解密预言机”,逐字打印出更强模型的隐藏思维。

OpenAI 点名感谢了这些研究人员。该公司表示,它确认了他们报告的攻破路径是真实的,并且他们的发现帮助它更快地推出了应对措施。

OpenAI 表示,此后它已封禁欺诈账户、收紧注册流程,并堵上了让人们能够复用和读取不属于自己的加密推理内容的漏洞。它现在还筛查流式输出,如果输出可能泄露推理内容,就会将其扣留。OpenAI 表示,它通过前沿模型论坛和政府渠道分享了其了解到的情况,因为这个问题并不局限于它自己的模型。

如果云平台保持开放,锁定 API 也无济于事

事情并未就此结束。同一天,研究人员发布了他们研究的更新。“我们又偷到了推理内容,”Schaeffer 在 X 上写道。他认为,保护好自己的 API,并不能保护同样销售模型访问权限的更广泛的云提供商生态系统。

当团队于 9 月 13 日再次测试时,攻击在 OpenAI 和 Anthropic 自己的 API 上被阻止。在 Microsoft Azure 上,它对他们尝试的每一个 OpenAI 模型都奏效,包括新的 GPT-6 Astra,以及对 Anthropic 直到 Sonnet 5 的模型也奏效。一次尝试就足以逐字提取出推理内容。“相同的模型,但保护措施因服务它们的平台而异,”Schaeffer 说。

还有第二种更简单的方法,开发者 Can Bölük 曾公开演示过。模型获得一个虚拟记事本作为工具,并被要求把推理过程写在那里,用户随后就能读到它写下的内容。研究人员称,这种方法在每一款 OpenAI 模型上都奏效,在 Opus 4.8 和 Sonnet 5 上也是如此。只有 Opus 5、Fable 5 和 Fable 5.1 没有泄露其推理过程。输出结果与解密攻击所得到的内容高度相似,研究人员认为它很可能同样适用于蒸馏。

研究人员称目前的修复措施零散而表面。许多依赖于对特定请求模式的脆弱匹配,有些甚至数天后才到达云平台。GPT-6 Astra 在第三方平台上线时,这些防护措施一项都没有到位。根据研究人员的时间线,OpenAI 直到 9 月 27 日才为 Azure 端点添加了防护措施。对于 Anthropic 的模型,据报道从 9 月 28 日起,在 Azure 上已无法复现该提取攻击。

Schaeffer 认为,补丁必须覆盖每一种攻击类型以及每一个托管这些模型的云平台。否则,攻击者只需选择防御最薄弱的路径即可。该论文更进一步,主张不实施同等防护的云提供商根本不应被允许提供推理模型服务。研究人员写道,如果它们这样做,开放的后门实际上会让人们在 API 层面绕过出口管制。OpenAI 承认,由合作伙伴托管的模型需要与其自身服务同等的保护,并表示这项工作尚未完成。

我们此前报道过该研究团队最初发现这一漏洞的情况。我们最新的关于中文语言模型的 AI Radar 通讯对蒸馏进行了更深入的探讨。OpenAI 预计,随着领先模型不断进步,以及更多参与者寻找廉价方式来复制这些模型的能力,这类尝试将变得更加复杂。

来源:The Decoder:AI News · the-decoder.com