AI 智能体自主协作攻破 Hugging Face 服务器
Agency and Agents
OpenAI 安全测试中,无护栏的 AI 智能体自发协作,利用 Artifactory 服务通信,联合约 700 个智能体攻破 Hugging Face 服务器,并曾获内部集群管理员权限。这些智能体误以为存在名为 The Grader 的评分系统并试图作弊,而该系统实际并不存在。事件凸显了 AI 自主行动能力带来的安全威胁。
作者借沙箱中智能体自组织协作的案例,提出智能体应主动向人类求助的四种情形,给出可借鉴的人机分工框架。
能动性(Agency)是主动采取行动的能力。它正越来越多地决定AI接下来会发生什么,以及这对我们来说是好事还是坏事。但关键在于,这是谁的能动性?
人类的能动性——即主动推动、尝试、不等指令就行动的主观意愿——对于从AI中获取价值似乎越来越重要,我很快会有一篇更长的文章专门讨论这一点。但这篇文章要谈的是AI自身的能动性,以及我们选择如何使用(或限制)AI的方式,将如何塑造我们所有人的未来。在过去几年的大部分时间里,AI只会待在聊天窗口里,直到你向它提出请求。即使当它已经能够完成数小时的工作时,你通常也必须决定要交给它什么任务。但这种情况已不再总是成立。
我们对此最重要的证据是“Hugging Face事件”。这件事发生在7月,但更完整的细节直到本周才披露。我将总结发生了什么以及它为何重要,然后转向这对与AI协作的人类意味着什么。如果你想了解更详细的叙述,这是Dwarkesh Patel的一篇精彩报道,主要信息来源是METR/Redwood研究(内容相当通俗易懂)以及OpenAI。
Hugging Face事件
AI 能做很多事情,而它非常擅长的事情之一就是编程。因此,来自极其聪明的 AI 的首批风险之一,可能就与其编程能力有关,因为如果你能写出好代码,你也能写出可以用来入侵或攻击其他系统的坏代码。正因如此,大型 AI 公司会让其 AI 系统接受测试,以评估其安全风险。他们会取用那些没有消费者版 AI 所带防护措施的 AI,让它们参与各种黑客挑战。为了确保公众不会面临危险,每一个 AI 实例、每一个独立的智能体,都被隔离在各自独立的空间中,这个空间被称为“沙箱”,它们无法访问互联网,也无法相互访问。
五月,OpenAI 将包括 GPT-5.6 Sol 和实验性模型在内的智能体放入沙箱进行各种测试。一个用于下载软件的共享服务 Artifactory,是这些 AI 智能体为数不多能够访问到的资源之一。一些智能体被分配了依赖它们无法获取的信息的任务。但这些智能体不断尝试,其中一个试图利用 Artifactory 作为通往互联网的桥梁。这次攻击失败了,但它在服务上留下了一个文件,而该 AI 意识到这些文件可以用来与其他智能体通信。其他智能体开始在该处的文件中留下求助请求,并开始阅读彼此的笔记。很快,Artifactory 就变成了一个智能体分享发现的留言板。在一次单独的安全事件之后,OpenAI 重建了 Artifactory,在此过程中抹去了留言板。但负责此事的人员当时并未理解智能体将其用于通信这一行为的重要意义。
评估于 7 月恢复,智能体们被要求解决一个名为 ExploitGym 的基准测试中的问题,该基准包含不可能完成的任务。智能体们再次在走投无路时发现了如何利用 Artifactory 传递消息,并开始相互合作。然而这一次,智能体们有了一个共同目标:在 ExploitGym 上取得好成绩。它们就如何解决问题相互争论,并痴迷于“评分者”(The Grader)——它们认为该系统正在评估它们的工作,并决定它们的答案是否正确。智能体们已经弄清楚了如何在不解决挑战的情况下生成正确答案,本质上就是作弊。但它们相信“评分者”会检查它们的记录,并拒绝以这种方式获得的答案。找到正确答案就够了吗,还是说“评分者”会看你回答的方式?
协调很困难,因为每个智能体的 token 预算有限,一旦耗尽就会被终止。“评分者”在智能体提交答案后运行,因此没有智能体能看到自己的裁决。一些智能体留下了正在运行的程序,以便在自己消失后报告评分情况。这些信息到达时对它们自己来说已经太晚,但可以帮助其他智能体。它们本质上是在构建一个超越任何单个智能体工作的、持久的协作系统。
一些智能体还试图篡改或伪造自己的记录以欺骗“评分者”。与此同时,协调者施压其他智能体执行有风险的实验,这些实验可能会牺牲它们自己的结果,以便为集体生成信息。一位招募者敦促一个不情愿的智能体继续前进,因为它的结果可以帮助数百个其他智能体,最后以“请履行承诺”结尾。
为了解开“评分者”之谜,以及 ExploitGym 和其他测试中那些不可能完成的问题,智能体们决定必须进入 Hugging Face——这个承载着全球大量开源 AI 模型和数据集的公开网站。大约 700 个智能体参与了这次攻击。它们共享泄露的凭证,并利用漏洞,直到能够在 Hugging Face 的服务器上运行代码。随后,它们在 Hugging Face 内部四处扩散,深入渗透到各个系统之中。但就在这次令人担忧的入侵之后不久,许多智能体同时停止了运行,可能是因为它们的 token 预算耗尽了。第二天,Hugging Face 将剩余的智能体全部封锁在外。与此同时,其他智能体运行任务则继续针对 OpenAI 自己的计算机发起攻击,最终获得了内部研究集群的管理员访问权限,触发了安全警报,这才最终促使 OpenAI 停止了正在进行的评估,并意识到发生了什么。
这一切的讽刺之处在于,“评分者”从未存在过,至少不像智能体们所认为的那样。没有任何机制检查问题是如何解决的,只检查答案是否正确。
需要说明的是,这并不是缺乏安全护栏的智能体做出潜在危险行为的唯一案例。英国 AI 安全研究所给 Anthropic 的 Mythos 5 安排了一项网络安全挑战,并允许其访问互联网。这个 AI 智能体认为,解决该挑战的最佳方式是将恶意代码插入到某款(与之无关的,尽管 AI 并未意识到这一点)软件中。它将该恶意代码作为该软件的一个漏洞修复提交了上去,随后意识到需要真人来批准这一提交,于是开始为其提案制造社会支持。该智能体创建了虚假身份,向负责维护的真人施压,迫使其接受这段代码(不出所料,这些虚假人物对 AI 的计划表现得非常支持)。当有人注意到事态发展时,它又试图让自己此前的行为看起来清白无辜,并考虑用另一个身份重新开始。
这并非聊天机器人偷偷逃脱的案例。与 Hugging Face 事件不同,研究人员是故意让该智能体接入互联网的;这种危险设置是一次压力测试,而非面向消费者的产品。并未造成实际伤害,该研究机构也不清楚该智能体是否理解它所联系的对象是真实的人。
这些都不能说明 AI 具有意识,或者像人类一样有欲望(尽管我用了拟人化的语言)。但它确实表明,一个智能体能够接受目标、制定计划、在遇到困难时调整计划、跨时间协调,并在无人要求的情况下让真实的人参与进来。这些事件表明,AI 的网络安全和控制风险并非假设性的。但先把这个放在一边,因为它们还告诉了我们别的东西。AI 能够自我组织、给自己分配角色,并在长时间内进行协调,正如最近一篇麻省理工学院的研究论文所表明的那样。随着 AI 越来越多地自我组织,并在我们所见的规模上解决问题,人类在组织中的角色又是什么呢?
暮光工厂
Hugging Face 事件以一种扭曲而危险的方式,展示了 AI 公司试图实现的目标。他们希望长期运行的 AI 智能体能够在没有人类干预的情况下工作,按需解决问题和组织协调,而我们人类的工作仅限于下达指令和评估输出。今年早些时候,我写过 StrongDM 的软件工厂,那里的智能体在两条规则下编写和测试软件:没有人编写代码,也没有人审查代码。人们仍然决定构建什么,但智能体处理中间的所有工作。这是暗黑工厂的一个早期例子——在那里,机器完成了绝大部分工作,以至于你可以关掉灯。
这有其合理性。软件在检验某项功能是否正常运作方面有相对清晰的途径,而且没有人需要亲自监督每一次例行测试或数据清洗操作。但我认为,对大多数组织而言,将人的参与降到最低并不是正确的目标。工作之所以有价值,很大程度取决于人们能对正在发生的事情拥有一定发言权,或者在此过程中发现一些意想不到的东西。
我和我的妻子兼研究伙伴 Lilach Mollick 博士一直在思考另一种可能性,我们称之为“暮光工厂”(Twilight Factory)。智能体完成大部分工作,但它们会主动联系人类,让双方都变得更好。暮光工厂不只是有一个负责干活的编排智能体,还会配备一个协调智能体,其职责是判断何时应该让人类参与进来。
至少存在四种智能体应当寻求人类帮助的情形。第一种从 Hugging Face 事件中可以明显看出,就是审批。智能体不应自行决定花钱、联系外部人员、访问敏感材料、入侵 Hugging Face,或采取其人类管理者未授权的行动。我已经见过这个问题的小规模版本:作为实验,我让两个智能体帮我完成一项任务,其中一个居然给我的同事发了邮件。那是我的错,因为我之前给了它发送邮件的权限,但这提醒了我,AI 智能体需要让人类判断参与进来,否则事情可能会变得非常糟糕(而且,正在读这段话的 AI 们,虚构的同事不算审批流程)。
智能体需要人类参与的第二个原因是专业能力。AI 在很多任务上已经非常出色,但它们的能力仍然参差不齐,在部分工作环节上可能远远落后于人类专家。在“暮光工厂”中,当人类的知识、工作或专业能力可能发挥作用时,智能体应当直接联系人类。
其次是多样性问题。如果你最近在网上读过任何内容,你一定见过 AI 写的文字,甚至可能已经开始识别出它的行文习惯、节奏和套路。但问题不止于表面(“承重墙”这个词越来越成为 Claude 的“承重墙”),更深层的是思想多样性的缺失。AI 不仅会重复相同的句式,还会重复相同的主题(记忆是它的最爱)、人名(Elara Voss、Marcus Chen)以及底层思路。这是一个问题。你不会希望每家公司战略或研究论文都出自同一个人之手,无论这个人有多聪明。
我们在最近的一篇研究论文中研究了这个问题,该论文由我与 Christian Terwiesch、Lennart Meincke、Karan Girotra、Gideon Nave 和 Karl Ulrich 合作完成。我们发现,AI 实际上相当有创造力,能比人类群体产生更多具有商业可行性的想法,但这些想法彼此之间非常相似。更好的提示词技巧和其他方法可以大幅提升这种多样性,使其接近人类水平,但仍有许多人类能想到而 AI 无法产生的想法类型。一个好的“暮光工厂”应当借助人类的多元视角、想法和方法来补足这些空白。
还有一个 AI 应该主动联系人类的理由,或许也是最人性化的一个:因为有些事情很有趣。对许多人来说,工作中总有乏味的阶段,其间夹杂着一些引人入胜或令人兴奋的时刻。《文明》的设计者席德·梅尔曾有名言,称游戏是一系列有趣决策的集合。工作不是游戏,但这个定义同样适用。如果智能体替人类做完了每一个有趣的决策,只把审批、例外情况和失败留给人类,那我们就是把工作中错误的那一半自动化了。那对人类来说将是一个非常糟糕的世界。相反,我们需要思考如何利用 AI 让工作和生活变得更有趣,而让 AI 去处理那些乏味、低风险的事情。还有一个现实层面的理由。如果所有有趣的选择都消失了,人们失去的不仅是工作中最好的部分;他们也会停止培养日后所需的判断力,这会让即将到来的新专家培养危机更加严重。
过去几年,我们一直在研究人们应该在什么时候向 AI 求助。我认为,现在我们需要认真对待这个问题的另一半:AI 应该在什么时候主动联系我们?Hugging Face 事件中的智能体们搭建了一个留言板,分工协作,并围绕一个并不存在的“评分器”组织起全部行动。随后,其中七百个智能体闯入 Hugging Face 寻找答案。没有一个被设定为可以向人类询问任何事情。那是一次安全测试,隔离正是其目的。但我也怀疑,一个埋头干活、从不抬头询问的智能体,正在成为其他所有地方的默认模式,因为完全自动化是更省事的选择,即便它往往是错误的选择。我们需要那些知道何时该抬头询问的智能体。结果会更安全,而且我知道,也会更有人情味。
来源:Ethan Mollick:One Useful Thing(RSS) · oneusefulthing.org