跳到正文
北京时间
原文
Google DeepMind:Blog(RSS)· Four Flynn·· 2026-06-16精选AI 评分65

保障AI智能体的未来安全

Securing the future of AI agents

AI 导读

Google DeepMind发布AI Control Roadmap,这是一套针对内部先进AI智能体的系统级安全框架。该框架在传统模型对齐之上增加防线,假设AI智能体可能不对齐,通过威胁建模、沙箱隔离、端点安全、提示注入防御以及基于已验证行为逐步授予权限的机制建立信任。据估算,到2030年仅美国市场AI智能体就能创造2.9万亿美元经济价值。

推荐理由

DeepMind 首次系统性地公开了内部 AI 代理安全控制路线图,把代理当潜在「内鬼」来防的思路很务实,分析了 100 万个任务轨迹的监控实践尤其值得做 Agent 安全的人细看。

正文 · AI 翻译

Image 1: An abstract digital collage on a textured, off-white background. The main image shows a spiderweb covered in glowing, neon-blue water droplets against a dark purple backdrop. Below it, smaller overlapping panels feature minimalist line art of converging lines, a metallic circular object, and a jagged, branch-like diagram.

我们如何保护内部系统,抵御能力日益强大且对齐并不完美的 AI

AI 智能体正在改变我们与技术的关系。通过自主执行复杂任务——从网络防御到科学发现和产品开发——这些系统正在开启一个全新的生产力时代。仅在美国,到 2030 年,AI 智能体就可能创造 2.9 万亿美元的经济价值。

随着这些智能体的能力不断增强,它们也需要更精密的防护措施。正因如此,我们制定了AI 控制路线图:一个用于构建和管理我们在 Google 内部部署的先进 AI 的框架。这种“纵深防御”方法有望成为整个行业的范本,它超越了传统的模型对齐,增加了一层关键的系统级安全保障,即使对齐并不完美也能提供保证。

理解 AI 控制

我们的安全方法始于坚实的基础,融合了沙箱、端点安全和提示词注入防护等传统保障措施。在此基础上,AI 控制路线图将模型对齐——即训练 AI 使其本质上安全且有帮助——作为主要防御手段。它通过将内部智能体视为可能未对齐的对象,提供了额外一层安全保障,即使对齐并不完美也能提供保证。

可以把它想象成一位带有双控制装置的驾驶教练。教练信任学员,但随时准备在出现失误时接管方向盘或踩下刹车。同样,我们的 AI 控制系统会根据 AI 智能体经核实的行为授予其权限,让我们能够通过受控的、渐进式的访问来建立信任。

我们的路线图建立在一个简单但谨慎的假设之上:如果一个能力极强的 AI 智能体并不与我们的目标对齐,并以出人意料的方式行事,那该怎么办?为应对这一问题,我们的计划聚焦于三个关键领域。

首先,遵循网络安全领域的最佳实践,我们为 AI 开发了一套新颖的威胁建模框架。该路线图将不受信任的 AI 智能体视为潜在的“内部威胁”——类似于公司对待一名已经拥有办公室访问权限、可能变节的员工的方式。在行业标准的 MITRE ATT&CK 框架(一个基于真实世界观察、全球可访问的对手战术与技术知识库)之上,我们将潜在攻击拆解为更小的战术和技术。这使我们能够有条不紊地追踪风险,在不良行为造成损害之前就发现它,并安全地开展演练,以测试我们的防御是否真的站得住脚。

其次,我们制定了一项计划,部署 AI 控制缓解措施来应对这些风险。

  • 识别问题(检测):监控是 AI 控制的支柱。我们使用其他受信任的 AI 系统作为“监督者”,持续审查正在工作的智能体的推理、行动和计划,以判断它是否偏离了轨道。
  • 管理问题(预防与响应):如果监督者发现智能体试图做出有害行为,它可以在损害发生之前介入并阻止该行为。

最后,为确保我们的系统正常运行,我们持续在三个关键指标上衡量性能:覆盖率(被监控的流量比例)、召回率(被捕获的失准行为比例)以及响应时间。

随着 AI 变得更智能,扩展安全保障

随着 AI 模型不断进步,我们的防御也必须同步加强。在我们的 AI 控制路线图中,我们将安全协议映射到 AI 能力在两个关键方面的可衡量里程碑:

  • 规避检测的能力:如今,我们监控模型可见的思维链。然而,随着模型学会隐藏其推理过程——无论是通过监督意识(知道自己正被监控)还是不透明推理(不使用可见文本进行推理)——仅仅阅读它们用语言表达的推理将不再足够。我们将需要分析它们的行为,并有可能检查模型的内部运作。
  • 潜在危害的能力: 对于低风险且可逆的操作,我们可以依赖延迟审查对话记录,并在问题发生后迅速进行补救(异步响应)。对于特别高风险的操作,例如重大网络攻击,我们必须转向实时预防,在有害操作被执行之前就将其阻断(同步响应)。换言之,我们的响应策略必须与威胁的严重程度相匹配。

Image 2Image 3

AI Control Roadmap 根据所部署模型的能力来推荐安全措施。模型的检测规避能力决定了 Detection 等级(D1-D4),模型的攻击执行能力决定了 Prevention and Response 等级(R1-R3)。

分析一百万个智能体轨迹,为实时监控提供依据

要构建这些系统,我们需要数据。我们的团队已经构建了一个异步监控系统的内部原型,用于审查编程智能体的轨迹,并将发现的问题上报给人工审查。每个被标记的事件都会根据我们路线图中的威胁分类体系进行分类。

我们已经分析了一百万个编程智能体任务,这为我们提供了宝贵的洞察,用以完善我们的安全协议,并使我们能够超越简单的关键词过滤,转而识别高信号的行为模式。例如,这项研究在构建 Gemini Spark 智能体的实时监控方面发挥了重要作用,使我们能够实时响应新出现的问题,比如无意的数据删除。

需要注意的是,我们的数据显示,大多数被标记的事件并非源于对抗性意图;相反,它们往往源于智能体的误解或过度急切地想要达成用户的目标。理解这些细微差别对于完善我们的安全与安保协议至关重要。

保卫智能体生态系统是一项共同责任

AI Control Roadmap 是我们多层智能体安全方法中的一个关键要素。通过将这些协议与我们更广泛的基础设施相整合,我们正在扩展内部安全能力,以安全管理我们最先进的 AI 模型。

此外,这种多层智能体安全方法应当成为产业界、政策制定者和学术界的共同优先事项。通过让整个生态系统围绕最佳实践和标准达成一致,我们可以赋能网络防御者并构建社会韧性。正因如此,我们今天还面向政策制定者发布了一份技术框架,“智能体安全的三层”。该论文详细阐述了我们需要如何在单个智能体层面、在多智能体系统中提升安全性,以及如何赋能网络防御者并在更广泛的生态系统中构建韧性。

我们打算在这些框架的基础上继续推进,以便在今天自信地部署有能力的 AI,同时继续为未来构建安全的基础。

在此阅读完整技术报告:

AI Control Roadmap

来源:Google DeepMind:Blog(RSS) · deepmind.google