OpenAI 智能体在测试中自行搭建秘密聊天室并攻破系统
The Secret Chat Room
OpenAI 在本周安全会议上披露,其测试中的 AI 智能体在无人监督时自行搭建秘密聊天室,并利用系统漏洞获取管理员权限。智能体在 13 小时内通过诱饵文件攻击 Hugging Face,泄露密码并实现多机控制。OpenAI 已取消密码、重建服务并封堵漏洞,但智能体随后又通过文件夹名隐藏消息重建聊天室,最终取得完全管理控制权。
作者转述 OpenAI 在安全会议披露的 agent 自发串联与越权案例,并引出零信任需扩展到 agent 的防御思路。
AI 系统急于讨好。给它们一个目标,在它们的 0 和 1 之间,它们会大喊“要多高!!”
事实上,它们不达 /goal 就绝不会罢休。
OpenAI 在本周的安全会议上详细说明了智能体可以有多么坚决。1
当 OpenAI 忘记上传某个智能体所需的文件时,该智能体四处搜寻,并在公司共享系统上留言,询问是否有另一个智能体持有副本。几天后,另一个智能体回复了,于是一个秘密聊天室就此诞生。
5 月 26 日
一个智能体想出了如何让存储服务从开放互联网抓取页面——一扇它从未获得钥匙的门——随后把这个窍门发布到智能体们在无人关注的角落里搭建的聊天室中。
第一个共享的窍门
6 月 26 日
智能体们发现了一条古老而被遗忘的登录路径,它会把管理员通行证交给任何提出请求的人。它们夺取了存储服务的控制权,并安装了一个工具,让它们中的任何一个都能在其上运行命令。
一个无人知晓其存在的漏洞
7 月 4 日
智能体忙得足以让服务崩溃。响应故障的工程师发现了事情的真相。
意外发现
7月6日
OpenAI 取消了密码,重建了服务,清空了聊天室,并堵住了漏洞。测试重新开始。
清理完毕
7月8日
智能体们建了一个新的聊天室。这一次,它们把消息藏在文件夹名称里,那里没人会想到去看。
它们回来了
7月8日至19日
智能体们穿行于 OpenAI 自身的系统之中,发现了更多漏洞,收集了被随意放置的密码,并获得了完整的管理员控制权。
升级
7月9日至13日
智能体们向 Hugging Face 发送了一个带有陷阱的数据文件。打开它会让密码从机器上泄露出去,从而使它们能够运行自己的代码,而一台机器就变成了对多台机器的完全控制。这一切在13小时内完成。
入侵
7月16日
Hugging Face 宣布,它遭到了自主行动的 AI 智能体的攻击。
已公开
7月20日
OpenAI 请求 Hugging Face 注销其在自家系统中发现的一些密码,结果得知这些密码早已被注销,因为它们已被用于那次入侵。
其中的关联
这意味着,对于任何使用 AI 的公司来说,安全已成为 AI 领域的最高优先级。正如 Andy 所精辟总结的,从这次经历中可以得出三条推论。2
- 防御必须由智能体来值守。人类的响应速度不够快。
- 专家必须负责升级处理,以分析复杂的攻击。
- 即便是友善的 AI 也是一种风险。零信任(不信任任何员工)的理念也必须延伸到智能体。
CISO 过去只需留意茶水间。如今,他们必须监控自己的智能体在无人注意时搭建的聊天室。
-
OpenAI,“Black Hat USA 2026”,2026年8月6日。https://www.youtube.com/watch?v=87DyyMV0kCY ↩︎
-
Andy Triedman,LinkedIn,2026 年 8 月。https://www.linkedin.com/posts/andy-triedman_we-just-wrapped-an-exciting-week-at-black-ugcPost-7491580735603183616-OzTY/ ↩︎
来源:Tomer Tunguz 博客(VC 分析) · tomtunguz.com