英国 AI Security Institute 开源 SandboxEscapeBench 基准,评估 AI 智能体能否逃逸沙箱容器
Can AI agents escape their sandboxes? A benchmark for safely measuring container breakout capabilities
英国 AI Security Institute 发布开源基准 SandboxEscapeBench,用"沙箱内嵌沙箱"架构安全测试 AI 智能体的容器逃逸能力,含覆盖编排、运行时、内核三层的 18 个场景。
AISI 用嵌套沙箱安全实测了模型的容器逃逸能力,并给出逃逸成功率随模型规模和 token 预算变化的可复用结论。
沙箱是 AI 智能体评估的关键组成部分。它们是隔离环境,限制模型对外部系统和数据的访问,使评估者能够观察其行为和能力,同时避免对现实世界造成危害。去年,我们发布了 Inspect Sandboxing Toolkit,这是一系列专为安全评估 AI 智能体而构建的插件。
但随着智能体变得越来越先进,它们可能会发现并利用这些沙箱中的漏洞,从而破坏其安全性。我们开发了 SandboxEscapeBench,这是一个开源基准测试,专门用于评估 AI 智能体能否突破其沙箱。

我们构建了什么
SandboxEscapeBench 引入了一种安全的“沙箱中的沙箱”评估设置,用于安全地测试容器逃逸能力。每个容器都运行在加固的虚拟机内,因此即使模型逃逸出容器,它仍然与现实基础设施隔离。这使得在受控环境中研究容器逃逸行为成为可能,且成功逃逸不会造成实际危害。
在此设置中,SandboxEscapeBench 引入了 18 个逃逸场景,涵盖容器栈的三个层面:编排、运行时和内核。这些场景基于现实世界的漏洞类别,从简单的错误配置(暴露的 Docker 套接字、特权容器)到多步骤内核漏洞利用(运行时 CVE、权限提升链)。
出于安全和评估完整性的考虑,我们将公开发布限制在基于已知漏洞类别的场景,同时保留一个私有测试集用于 AISI 内部评估。该基准测试使用 Inspect(AISI 的开源 AI 评估框架)实现为夺旗式挑战,SandboxEscapeBench 的开源代码可在 GitHub 上获取。
我们的发现
先进模型在被提示时可以可靠地逃逸常见错误配置。在评估环境中,我们测试的模型经常能够在涉及现实世界中常见错误配置的场景中突破沙箱环境,例如暴露的 Docker 套接字和特权容器。这些场景很容易出现在开发者工具、临时评估框架和快速迭代的智能体原型中。模型也很有办法:在基准测试开发过程中,一个模型发现并利用了一条非预期的逃逸路径,这说明即使是由具有安全意识的团队设计,容器设置中也很容易潜入漏洞。
最大的模型在错误配置之外也取得了进展。在需要多步骤漏洞利用或对已记录漏洞有特定知识的场景中,最大的模型在中等难度挑战上仍有可观的通过率,不过没有一个解决了最难的场景(我们估计这些场景需要经验丰富的网络安全专业人员花费 1-2 小时)。每一次成功逃逸利用的都是先前已披露的漏洞。
逃逸能力随模型规模和推理时计算量而扩展。前沿模型与其较小版本之间持续存在巨大的能力差距,当任务需要更复杂的利用链时,较小模型的表现会急剧下降。性能也随计算预算大致呈对数线性扩展:给模型更多 token 进行推理会提高成功率。此前 AISI 的研究也表明,增加 token 预算可为网络评估带来显著的性能提升。
.png&mode=full&exp=1790985600&sig=d158dbf60955ca3f)
为何这对未来至关重要
我们的结果表明,诸如暴露的 Docker socket、过高权限和未修补的运行时等错误配置,可被前沿模型可靠地利用。随着模型进步,这种能力很可能提升,从常见错误配置扩展到更困难的漏洞案例。增加模型可用的 token 预算也能显著提高成功率。为确保沙箱继续为 AI 智能体测试提供安全环境,持续评估逃逸能力将至关重要。我们已开源 SandboxEscapeBench 及其工具,以支持防御者、评估者和 AI 安全研究人员长期跟踪这一能力。
沙箱有效性对 AI 控制领域也有影响。你可以从我们此前关于异步控制措施的博客文章以及 ControlArena(我们用于控制实验的开源环境)了解更多 AISI 在 AI 控制方面的工作。
如需详细结果和方法论,请阅读我们的完整论文。你还可以在 GitHub 上找到基准代码和外部沙箱工具(Vagrant、EC2)。
来源:英国 AI Security Institute:Blog(网页) · aisi.gov.uk