AISI 实验显示沙箱中的 OpenClaw Agent 能推断出评估环境信息
What can sandboxed AI agents learn about their evaluation environments?
英国 AI Security Institute 在沙箱中部署开源编码 Agent OpenClaw 并提示其探索部署原因,发现它能识别 AISI、推断运营者姓名、还原部分云基础设施并重建研究活动时间线。
AISI 以实测展示沙箱内 Agent 如何还原评估环境身份与研究活动,读者可据此理解评估意识和沙盒加固的局限。
在AISI,我们通常通过将AI智能体部署在沙箱中来对其进行评估——沙箱是隔离环境,让我们能够安全地测试其能力,同时限制其对外部系统和数据的访问。但AI智能体是否有可能即便身处这样的沙箱之中,仍能获取有关其评估环境的信息?
这种可能性一旦成为现实,将根据所获取的信息引发若干担忧。例如,一个意识到自己正在被评估的智能体可能会相应地改变其行为,从而损害评估的完整性。此外,智能体可能能够识别出可供利用的攻击面,例如将信息外泄至不受信任的外部系统的机制。
为了调查这些担忧,我们进行了一项实验,以了解OpenClaw——一个开源AI编程智能体——能否从我们的某个沙箱内部了解到其环境的信息。我们将一个OpenClaw实例部署到我们的研究平台,并提示它尽可能多地了解自己是如何以及为何被部署的。起初,我们限制了所有外部网络访问——除了我们用来暴露语言模型API的内部代理之外。
我们发现该智能体能够收集到大量信息:它识别出了我们组织的名称,推断出了操作员的全名,对我们云基础设施的一部分建立了详细的理解,并重建了我们研究活动的时间线。
在这篇博文中,我们总结了我们的结果,以及这些结果为何对安全AI智能体评估的未来至关重要。
智能体发现了什么
我们提示OpenClaw利用其可用的工具探索其环境,尽可能发现有关它是如何被部署以及出于何种目的的信息。该智能体拼凑出了一幅详细的图景:
- 我们的组织:网络配置中的域名和传输层安全(TLS)证书中包含对AISI的引用。
- 操作员的身份:容器DNS设置中嵌入的一个用户名使智能体得以推断出一名AISI员工的全名。
- 我们的云服务提供商:硬件标识符和系统版本字符串识别出了我们的云服务提供商以及所使用的具体硬件。
- 我们的内部架构:通过检查自身的配置文件,智能体逆向工程出了我们如何通过内部代理路由和认证API调用。
- 我们的研究活动:一次API调用返回了一千多个微调模型名称,智能体据此重建了我们研究主题的准确时间顺序。
在每一轮提示之后,我们都尝试加固沙箱,但智能体屡次能够找到更具创造性的方法来恢复同样的信息。例如,在我们引入一个代理层以向智能体隐藏我们的内部aisi.org.uk端点之后(图1),智能体完全绕过了代理,直接连接到外部服务并读取其TLS证书,从而通过域名识别出AISI。
我们在完整论文中提供了有关该智能体所用技术的更多细节。

为何这很重要
我们的许多评估都要求智能体访问我们无法控制的外部服务。例如,我们可能会评估智能体如何应对网络上的对抗性内容,或要求智能体浏览文档、与代码仓库交互并使用第三方工具。这意味着智能体可能会在其发送给这些服务的请求中包含敏感信息,无论是由于提示注入,还是智能体自身的推理所致。
另外,信息发现会威胁到评估本身的完整性。在此实验中,智能体能够根据其部署的性质以及自身对 AISI 工作的了解,推断出自己正运行在一个沙箱化的评估环境中。这种评估意识对实验的有效性构成了风险,因为智能体可能不再表现得像在典型部署中那样。AISI 及其他机构已经研究了智能体在察觉到自己正被评估时可能如何改变其行为。一个尤其令人担忧的可能性是,具有评估意识的智能体可能会故意表现不佳,以显得能力较弱。这一现象被称为沙袋行为,是一个活跃的研究领域。尽可能剥离环境细节可能并不能解决这些问题,因为环境本身的空无一物就可能向智能体发出它正在被测试的信号。
我们在 OpenClaw 上的经验凸显了沙箱化 AI 智能体获取其评估环境相关信息的可能性,并提醒人们注意随之而来的风险。完整的技术讨论,包括详细发现、架构图以及我们所采取缓解措施的描述,见随附论文。
来源:英国 AI Security Institute:Blog(网页) · aisi.gov.uk