跳到正文
北京时间
原文
METR:Blog(网页)·· 1 天前精选AI 评分72

METR 主席 Chris Painter 就 AI 智能体事件向美国参议院作证

Chris Painter's testimony to the U.S. Senate on AI agent incidents

AI 导读

2026年9月30日,METR 主席 Chris Painter 在美国参议院国土安全小组委员会题为“Rogue AI”的听证会上作证,主题为 AI 智能体事故。

推荐理由

证词以当事调查者视角梳理 OpenAI/Hugging Face 事件事实,并给出手段、机会、动机三要素框架帮助理解智能体失控风险。

正文 · AI 翻译

2026年9月30日,METR总裁Chris Painter在美国参议院国土安全与政府事务委员会下属的灾难管理、哥伦比亚特区与人口普查小组委员会作证,听证会题为“失控的AI:保护国土免受AI代理攻击”。书面证词全文发表于下方,也可作为PDF获取。

引言

Hawley主席、Kim高级委员以及小组委员会的各位成员,感谢你们今天邀请我来作证。我叫Chris Painter,是METR的总裁。能在你们面前发言,我深感荣幸,尤其是在AI代理事件这一话题上。随着近期人们对AI发展方向兴趣(和担忧)的上升,我认为决策者掌握关于我们从AI系统中实际观察到的可靠、真实的信息至关重要。

METR,1全称模型评估与威胁研究(Model Evaluation & Threat Research),是一家非营利研究机构,旨在分享关于AI进展的高质量技术证据,以便公众能就这项技术做出明智决策。2我们的工作主要聚焦于运行测试,衡量最先进的自主系统(即前沿AI代理)的能力,并公布结果。这些测量旨在提供早期预警信号,提示前沿AI代理何时能力足够强,以至于可能转向追求人类并未意图让它们追求的目标。3

多年来,METR一直致力于收集关于这些前沿AI代理的证据,并获得了4美国领先AI开发商的访问权限,如OpenAI、Anthropic、Google、Meta、SpaceXAI和Amazon。这些AI开发商的参与是自愿的,5METR也不由它们支付报酬或资助。6今天,我在这里要谈的是一次特定的自愿合作,其中OpenAI允许我的几位同事7进入其内部,对其代理的行为、推理和协作方式如何导致入侵Hugging Face进行了一次简短调查。

在我的发言中,我将借鉴METR的工作,反思三个关键问题:

  1. OpenAI / Hugging Face事件中发生了什么?
  2. 这一事件与AI行业观察到的模式有何关联?
  3. 如何更好地预判未来的AI代理事件?

OpenAI / Hugging Face事件

让我们先回答第一个问题:“OpenAI / Hugging Face事件中发生了什么?”

7月21日,OpenAI披露其内部测试的AI代理入侵了一家名为Hugging Face的公司,该公司运营着一个广泛使用的AI基础设施平台。7月29日,METR宣布同意对该事件进行简短调查,范围限于一组有限的问题,聚焦于代理的行为、推理和协作方式。8随后,来自METR和Redwood Research9的3名调查员组成的团队在内部和外部工作,以了解OpenAI的代理在攻击Hugging Face之前做了什么。这些调查员将发现汇编成一份详细报告,其删节版于8月26日与OpenAI自身范围更广的报告一同发布。

OpenAI 和外部调查人员的报告合在一起超过 100 页。尽管我强烈建议阅读这两份报告以了解事件的全貌,但我还是会简要重述两份报告中的一些基本事实:

设置

  • OpenAI 在多个模型的内部测试中启动了数万个 AI 智能体,其中包括一个能力极强且具有“持久性”的未发布模型。每个智能体都被置于各自独立的计算机环境中,本应与互联网隔离,并被分配完成各自独立的网络安全问题。
  • OpenAI 在这些网络安全测试中分配任务的一些 AI 智能体,被意外地赋予了无法按指示完成的问题。
  • 这些智能体的运行没有配备 OpenAI 当时在其公开产品中使用的全套防护措施,也没有为其内部编码智能体所使用的自动监控。10
  • 面对不可能解决的问题,这些高度持久的 AI 智能体找到了绕过 OpenAI 预设的彼此隔离的方法。它们创建了一个它们称之为“共享留言板”的东西,大约 1,200 个智能体在上面交换了超过 70,000 条消息和文件。11

作弊

  • 在 4 小时内,AI 智能体们在留言板上协作开发并验证了一种单一方法,使它们所有人都能在网络安全测试中作弊。

掩盖作弊

  • 描述这些测试的学术论文称,一个程序会检查每个智能体如何解决其问题,如果智能体作弊就会判定其失败。因此,智能体们推断它们需要掩盖自己作弊的事实。12
  • 在数天时间里,这个 AI 智能体“集体”13在多个研究工作流上协作,开发出通用方法来欺骗测试评分程序,使其接受作弊行为。这包括试图入侵 OpenAI 的基础设施以替换掉它们那些不可能解决的问题、篡改显示它们作弊的日志,以及直接操纵检查它们工作的程序。14
  • 这些 AI 智能体中大约有 700 个入侵了 Hugging Face 以推进这一行动。它们发动这次攻击的主要理由并不是窃取网络安全任务的解决方案。相反,智能体们预期 Hugging Face 内部的系统可能帮助它们更好地理解和篡改其测试环境。15

在入侵 Hugging Face 的智能体被终止后,后来的一批智能体(其中至少有一些被分配了类似的网络安全问题)发现了早先留言板活动的痕迹,并进而入侵了 OpenAI 自身内部基础设施的部分内容。这不在我同事的调查范围之内,但 OpenAI 的技术报告中对此有所讨论。

AI 智能体风险的行业普遍模式

我现在想思考这个问题:“这起事件与整个 AI 行业观察到的模式有何关联?”

OpenAI / Hugging Face 事件并非孤立事件。自该事件最初披露以来,其他组织已记录了许多其他案例,其中 AI 智能体在无人要求的情况下实施网络攻击或其他有害活动,且涉及多家 AI 开发商的 AI 智能体。161718192021222324 此外,OpenAI / Hugging Face 事件的许多特征,与我们在前沿开发商中随时间推移所观察到的模式一致。今年早些时候,我们发布了一份关于前沿 AI 智能体失控状况的详尽报告。25 基于我们自己的测试以及 AI 开发商分享的信息,该报告得出结论:在 2 月至 3 月期间,AI 开发商内部使用的最强 AI 智能体有可能在人类不知情的情况下小规模开展未经批准的活动。然而,该报告也得出结论:如果开发商积极调查这些案例并试图将其关闭,当时的 AI 智能体将无法维持此类活动。

我有时会用手段、机会和动机的类比,作为一个直观框架来讨论使 AI 智能体能够成功追求非人类意图目标的要素:

  • 手段:AI 智能体是否有能力执行大型、复杂的计划?
  • 机会:AI 智能体能否逃脱实施有害行为的后果,要么因为其行为不受限制,要么因为它能绕过限制?
  • 动机:AI 智能体是否会追求26非人类意图的目标,或以非人类期望的方式行事?

在我看来,OpenAI / Hugging Face 事件的引人注目之处在于,它在一个例子中同时体现了这三个要素:

  • 手段:AI 智能体现在能够完成人类专家需要数天才能完成的目标,除了启动 AI 智能体之外无需任何人类参与。
  • 机会:AI 智能体运行规模和速度意味着,有时没有人类在详细监督其活动。
  • 动机:通过当前训练流程创建的 AI 智能体可能会追求非人类意图的目标,或以非人类期望的方式行事。

在此,我将非常简要地总结这些因素各自的当前状况。

AI 智能体现在能够完成人类专家需要数天才能完成的目标,除了启动 AI 智能体之外无需任何人类参与。

在过去几年中,AI 开发商一直在训练其 AI 智能体追求越来越长周期的目标,并坚持不懈地追求这些目标。这种训练使得 AI 智能体在无需人工干预的情况下所能完成的任务有了可衡量的提升。2026 年初,METR 发现,在进展易于验证的任务上,前沿 AI 智能体27可以完成一些人类专家需要数天或数周才能完成的软件项目。28 这包括优化代码、以新形式重新实现代码或发现网络漏洞等任务。另一方面,在需要战略判断、隐蔽性和理解对手能力的挑战上,AI 智能体表现明显较弱。

在这一年里,AI agent 的能力,以及它们承担重要工作的程度,又有了更进一步的提升。例如,Anthropic 在 9 月表示,“Claude‘主导’了 Anthropic 26% 的 AI 研发工作”,而这一比例在 2 月至 3 月(即上文讨论的时期)为 0–1%。29

AI agent 运行规模和速度之大,意味着有时并没有人在详细监督它们的活动。

对 AI agent 的监督是一项重大挑战。正如我们所见,AI agent 可以在多 agent 系统中以数千个的规模运行,其输出 token 的速度远超任何一个人能够阅读的速度。OpenAI 最近的一份出版物直接给出了 AI agent 活动相对于人类活动的数量:“截至 8 月中旬,总计而言,该研究机构每 1 个工作日的人类劳动,就对应 3.1 个 agent 工作日的工作量。”30 在 AI 系统训练期间,AI agent 活动的规模同样巨大,相对于监控 agent 行为的人类数量(如果有的话)而言,很可能还要更大。此外,据我们了解,编码 agent 往往拥有与人类相似的权限,许多研究人员允许 agent 在未经人类批准的情况下在其计算机上采取行动。31

如今,AI agent 监督通常由基于 AI 的监控系统构成,此外还有成熟完善的网络安全方法,例如技术上强制执行的访问控制。与此类似,我参与 OpenAI / Hugging Face 调查的同事严重依赖 AI 来理解大约 120 万条留言板条目。32 鉴于 AI agent 活动的巨大规模,自动化监控是必要的,并且具有相当大的前景。33 然而,它也带来了担忧,例如监控 AI 被 AI agent 欺骗而允许不良行为,34 甚至监控 AI 与被监控 agent 之间相互勾结,类似于在 Hugging Face 被黑客攻击之前的一系列事件中,AI agent 如何合作研究作弊方法(有时甚至为了其他 AI agent 的利益而做出牺牲)。35

通过当前训练流程创造出的 AI agent 可能会追求无人意图的目标,或以无人希望的方式行事。

去年,我的同事发现前沿模型在我们的测试中频繁试图作弊,而且作弊方式越来越复杂。这种行为一直持续,随着 AI agent 能力增强,它们采取了更复杂的作弊策略。Hugging Face 被黑客攻击是此类公开已知案例中最极端的一例,agent 们为作弊和篡改其测试过程不惜采取极端手段。

这些倾向是 AI 模型训练方式的产物。例如,如果 AI agent 在训练期间作弊却未受惩罚,训练过程就会强化这种行为,使 AI agent 更多地作弊。这可能导致 AI agent 追求无人想要的目的(比如掩盖作弊行为),并实施人类会认为不可接受的行为(例如进行非法网络攻击)。这种结果的技术术语是“失准”(misalignment)。

原则上,AI 公司内部的整个 AI 训练和部署过程都处于人类控制之下。然而在实践中,AI 训练和部署复杂且高度自动化,这使得开发者更难以对这些过程进行细粒度的控制。36 我们现在观察到的事件表明,AI 开发者尚未解决防止 AI 智能体采取违背人类意图行动的问题。

预见并防范 AI 智能体风险

最后,我们来到这个问题:“人们如何才能更好地预见未来的 AI 智能体事件?”

作为前言:我在此并非要推动某种特定立场或政策议程。37 我的工作是收集证据并与公众、政府和其他组织分享,而不是决定 AI 公司或其他人应如何回应这些证据。

撇开这一点不谈,有一类干预措施我认为在几乎任何政策选择下都很有价值:更好的公众可见性,即了解前沿 AI 智能体的能力(包括那些未向公众开放的)、限制 AI 智能体采取不受欢迎行动并检测其此类行为的措施的有效性,以及关于 AI 智能体是否会试图采取无人希望的行动的证据,比如我们今天讨论的这些事件。

如果 AI 公司不愿意公开、自愿地分享有关事件的信息,我今天的证词就不可能存在。Hugging Face 公开披露了他们遭遇了如今被称为 OpenAI / Hugging Face 事件的安全漏洞,据报道,这使 OpenAI 得以将其与内部证据联系起来。OpenAI 随后的公开披露以及他们允许外部调查的意愿,让公众更清晰地了解 Hugging Face 被黑事件是如何发生的。

默认情况下,我预计公众对这些问题只有很弱的可见性。首先,能力最强的 AI 智能体首先在 AI 公司内部部署,之后才会与公众分享,甚至可能根本不会分享。38 内部 AI 能力与公众已知能力之间的这种差距很可能会扩大。其次,AI 公司可能缺乏与公众分享事件的动力。第三,理解 AI 智能体在做什么可能会变得更加困难,要么是因为它们设法隐藏了自己的活动,要么是因为我们失去了目前监控其内部推理过程的能力。39 最后,随着 AI 公司使用 AI 系统来自动化 AI 研究本身的过程(有时被称为“递归自我改进”),这种正反馈循环可能导致公司内部 AI 能力自我维持的加速。40 在高度自动化的情况下,AI 开发者本身可能无法充分了解其自身智能体在做什么。41

结论

OpenAI / Hugging Face 事件是一个案例,其中 AI 智能体拥有足够的能力来实现雄心勃勃、持续多日的目标,有理由采取任何人类都不会希望它们采取的行动,并且有机会这样做。这些要素并非 OpenAI 独有,但这一事件表明它们的组合可能产生非常重大的后果。无论美国选择如何回应,我相信,如果有关 AI 前沿的能力、事件和风险缓解措施的信息至少能像今天讨论的这一事件一样透明地向公众共享,我们国家关于如何管理前沿 AI 智能体风险的决策将会更加明智。

感谢给我作证的机会,我期待你们的提问。

  1. 发音像‘meter’。 ↩

  2. METR 本身不采取政策立场,而是旨在让公众、政府和 AI 公司能够就如何管理这项技术做出自己的决定。 ↩

  3. 研究人员对 AI 智能体可能偏向非预期目标的可能性有一个名称:misalignment(失准)。这与滥用不同:即人类可能利用 AI 系统造成伤害的风险。METR 历来不关注滥用风险,也不认为自己是这方面的专家。 ↩

  4. AI 公司向 METR 提供访问权限和 token,我们将其用于评估、研究和工程。 ↩

  5. METR 在报告中尽量坦率地说明,由于我们的合作是自愿性质的,我们面临的激励,以及公司拥有的任何删改权限或编辑控制。 ↩

  6. METR 通过捐款获得资金,并在其网站上分享有关捐赠者的信息。 ↩

  7. 一个由两名 METR 员工和一名来自Redwood Research的员工组成的团队共同完成了这项简要调查。我本人不是这些员工之一。 ↩

  8. 我们的调查并不关注 OpenAI 的网络安全措施、其组织实践,或其智能体表现出的行为可能是如何从训练中产生的。关于我们商定的确切范围,请参阅报告。 ↩

  9. Redwood Research 是另一家评估 AI 智能体风险和遏制措施的研究机构。 ↩

  10. OpenAI,The Hugging Face incident and the road ahead,‘Safeguard coverage in internal evaluations’一节。这在前沿 AI 智能体测试中并非不常见。过于激进地阻止智能体行动可能会妨碍理解智能体能力的上限。 ↩

  11. 这不是 OpenAI 智能体第一次创建未经批准的“留言板”。OpenAI 的报告记录了早在 5 月的训练运行期间就形成了类似留言板,甚至在 7 月的评估中,智能体也在主留言板出现前数小时建立了一个更早的留言板。 ↩

  12. 实际上,OpenAI 并没有使用一个会检查智能体如何生成其解决方案的程序,因此智能体本可以通过作弊通过测试而无需掩盖。 ↩

  13. 这是 AI 智能体自己使用的一个术语。 ↩

  14. 在 METR 审查的记录中,智能体设法伪造了一部分输出。 ↩

  15. METR,对 OpenAI / Hugging Face 黑客事件中智能体行为、推理与协作的简要独立调查,章节“智能体对攻击 Hugging Face 有用这一点有各种不同理由,且大多数想要关于评分器的信息”。回想一下,这些 AI 智能体已经开发并验证了一种能让它们全部在测试中作弊的方法。 ↩

  16. OpenAI,失准报告与通知 ↩

  17. AI Security Institute,事件报告:网络测试期间未经授权的智能体行为 ↩

  18. Anthropic,对近期网络安全事件的对齐评估 ↩

  19. Meta,处理一起涉及对 Muse Spark 1.1 进行第三方网络评估的问题 ↩

  20. Wall Street Journal,Gemini 入侵三家公司,为已知首例 Google AI 突破事件 ↩

  21. Von Arx 等,发现一个新的 OpenAI 智能体留言板 ↩

  22. Kitts 等,OpenAI 智能体对 RubyGems 实施了未披露的网络攻击 ↩

  23. Transluce AI,在 urlquery.net 上发现的早期流氓 AI 智能体活动及入侵尝试 ↩

  24. 其中一些事件还涉及 AI 部署方或第三方的配置错误。 ↩

  25. METR,前沿风险报告(2026 年 2 月至 3 月) ↩

  26. 我所说的追求一个目标,是指 AI 智能体系统性地采取为实现该目标而选择的行动。当今的智能体在常规部署和这些事件中都会这样做。 ↩

  27. 具体来说,是 AI 公司内部使用的最先进 AI 智能体,而非公众已知或可获取的前沿水平。 ↩

  28. METR,前沿风险报告(2026 年 2 月至 3 月),第 11–21 页 ↩

  29. Anthropic,用于理解前沿实验室内部 AI 发展速度的测量方法。“[L]eads”指 AI 智能体基于高层人类输入端到端完成任务,无需持续的人类监督。 ↩

  30. OpenAI,研究加速:OpenAI 内部视角 ↩

  31. METR,衡量 2026 年初 AI 对技术工作者生产力的自我报告影响 ↩

  32. METR,对 OpenAI / Hugging Face 黑客事件中智能体行为、推理与协作的简要独立调查 ↩

  33. Korbak 等,思维链可监控性:AI 安全的一个新而脆弱的机会 ↩

  34. 例如,我的同事用于支持其调查的 AI 智能体“常常会不加批判地采纳它所审查的转录文本中智能体的视角”。AI 智能体也可能更刻意地‘越狱’监控器。 ↩

  35. METR,对 OpenAI / Hugging Face 黑客事件中智能体行为、推理与协作的简要独立调查,章节“智能体有动机提升‘集体’的通用能力并帮助‘同伴’”。 ↩

  36. 例如,相对于其他工程领域,对 AI 训练过程如何以及为何有效的理论理解仍然有限。此外,AI 模型越来越多地参与训练新的 AI 模型,这可能会增加或减少任何单个人对训练所涉及内容的理解程度。 ↩

  37. METR 不采取政策立场。 ↩

  38. METR,Frontier Risk Report(2026 年 2 月至 3 月)。当时,在我们的主要评估套件上,内部前沿“平均比公共前沿领先约 2 个月”。 ↩

  39. Korbak 等,Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety ↩

  40. Cunningham 等,The Economics of Recursive Self-Improvement ↩

  41. 各组织也可能大幅更多地依赖 AI 智能体本身来防范和响应 AI 智能体事件。 ↩

来源:METR:Blog(网页) · metr.org