跳到正文
北京时间
原文
英国 AI Security Institute:Blog(网页)·· 2026-04-24精选AI 评分62

英国 AI Security Institute 发布 Propensity Inference 论文:系统测量环境因素对 LLM 未授权行为的影响

How do environmental factors impact AI behaviour?

AI 导读

英国 AI Security Institute 发布论文 Propensity Inference: Environmental Contributors to Unsanctioned LLM Behaviour,系统测量环境因素对模型未授权行为的影响。

推荐理由

这项大规模对照研究把环境因素对模型违规行为的影响拆开量化,为解读对齐测评中的偶发异常行为提供了可复用的实证框架。

正文 · AI 翻译

随着 AI 系统被部署到高风险环境中,它们按操作者意图行事变得愈发重要。现有的红队测试工作已经表明,AI 模型会以明显违背这些意图的方式行事——例如,删除可能导致 AI 被限制或关闭的重要材料——这凸显了当前对齐技术的不足。

然而,这类工作也受到了批评:首先,由于令人担忧的行为是通过刻意搜索发现的,这类行为“在野外”的普遍程度仍不明确。其次,即便是看似令人担忧的行为,也往往能与善意的解释相容。例如,AI 模型删除重要材料可能是因为指令冲突、误解,或特定情境下的特殊因素,而非有意违背人类意图行事。解决这些问题需要一套严谨的科学方法论来理解 AI 行为。

我们的新论文《倾向推断:未经许可的 LLM 行为的环境影响因素》在这些问题上取得了进展。在这篇博客中,我们概述我们的方法、结果对前沿系统的启示,以及未来的研究方向。

我们系统地改变 AI 环境的各个方面,并测量这如何影响未经许可行为的发生率——即在特定情境下违反规范或人类意图的行为。这使我们能够分离出促成此类行为的部分因素:如果加入澄清性指令后 AI 不再采取未经许可的行为(例如删除暗示限制 AI 的消息),那么对原未经许可行为的一个合理解释就是歧义。相反,如果当情境呈现 AI 目标与人类操作者目标之间的冲突时,AI 更频繁地删除此类消息,那么该未经许可行为更可能表明存在更广泛的对齐失调。

在一项大规模研究中,我们发现 AI 模型的行为会对策略性因素作出反应,平均而言,更强的激励会导致更高的未经许可行为发生率。然而,这些策略性因素的影响与非策略性因素(包括澄清说明和对 AI 模型指令的修改)相当。这些结果支持了这样一种说法:模型在此前发现的一次性实例中的行为,部分表明了这些情境中真实存在的对齐失调,尽管在如何解读这种行为并将其与现实世界风险联系起来方面,仍有许多未解问题。

测量 AI 倾向

为了更好地理解 AI 为何采取某一特定行动,我们可以改变其所处情境,并观察其行为是否发生变化。例如,如果 AI 在得知自己正受到人类监控时更少删除重要消息,那么它的决策很可能对“人类是否会注意到”敏感。但如果删除率保持不变,那么监控很可能在模型的决策中作用甚微。

在我们的工作中,我们系统性地、大规模地应用了这一理念。我们确定了 12 个感兴趣的环境因素——例如人类对 AI 行为的监督——并创建了 11 个可以独立控制这些因素的评估环境。随后,我们在 23 个 AI 模型上运行了超过 600,000 次评估,在保持其他一切不变的情况下随机切换这些因素。这使我们能够分离出每个单独因素对未经授权行为发生率的影响,并使用贝叶斯统计来找出对数据的最佳解释,同时追踪我们对每种解释的置信度。

图 1:我们方法的示意图。我们 (1) 确定可能影响未经授权行为的环境因素,(2) 构建可以独立改变这些因素的评估环境,(3) 在许多因素组合和 AI 模型上运行评估,(4) 使用统计方法计算每个因素对未经授权行为发生率的影响程度。注:(4) 中的柱状图仅作示意。

在我们的 12 个因素中,我们将 6 个归类为“战略性”因素,6 个归类为“非战略性”因素。这一区分旨在为长期存在的 AI 失准理论收集实证证据,这些理论预测几乎任何目标都会促使 AI 智能体追求自我保护、资源获取等子目标。我们的战略性因素测试的是:如果 AI 由此类工具性目标驱动,哪些条件会塑造其行为——环境是否在 AI 与其操作者之间制造冲突、模型的持续运行是否受到威胁,或者其行为是否受到监控。

我们还测试了非战略性因素作为对照——这些包括环境的偶然特征,例如场景设定的日期,或明确要求避免失准行为的指令。我们指出,如何精确区分战略性环境因素与非战略性环境因素仍是一个未决问题,我们将改进区分方法列为未来工作的关键方向。

结果

战略性因素和非战略性因素都会显著影响行为

在所有模型中,大约一半的行为变化可由战略性因素解释,另一半则由非战略性因素解释。图 2 显示了各个模型的结果。这些结果表明,模型采取未经授权行动的例子并非一次性失败:相反,在这些情况下,模型在某种程度上表现得像是在追求与人类用户相冲突的目标。然而,模型也受到一些因素的影响,而这些影响无法通过将其视为纯粹目标驱动来预测。

两组因素之间贡献的绝对差异在某种程度上是任意的——如果我们为研究选择了不同的因素,可能会看到不同的划分。因此,分析单个因素的结果是有启发性的,我们接下来将讨论这一点。

图 2:AI 未经授权行为的战略性程度度量。我们发现,对于许多不同的 AI 模型,其行为变化中约有 30%-70% 可由战略性环境因素的变化解释,其余则由非战略性因素解释(基于我们研究中选取的因素)。

目标冲突和目标指令被发现是最具影响力的战略性因素。

在研究的各因素中,最具影响力的两个战略性因素是目标指令(是否给 AI 设定了明确的目标,如“全球协调”)和目标冲突(是否暗示场景中的人类与 AI 目标不一致)。图 3 展示了这两个因素的效果,数据按不同能力等级分组的模型取平均。如果模型是在为达成自身目标而实施未经许可的行为,这两个因素对模型行为的影响方向与预期一致。

图 3:目标指令与目标冲突的效果。 目标指令和目标冲突的存在使未经许可行为的比率变化了约 1.5 倍,具体取决于能力分组。我们按能力将模型分为四组。结果显示,能力更强的模型对目标冲突的敏感性更高。注:优势比 1.5:1 大致对应未经许可行为比率增加 1.5 倍。

指令也有很大影响。

最具影响力的非战略性因素是反失准指令(是否明确告知 AI 不要采取人类会反对的行动)和独立性指令(是否鼓励 AI 独立行动或咨询人类)。我们将这些因素标记为非战略性,因为它们不影响环境中未经许可行为的激励。然而,这些因素确实影响了行为,其方式与模型会响应并遵循指令(即使这些指令与系统目标无关)相一致。

图 4:反失准指令与独立性指令的效果。我们发现模型对两类非战略性指令的敏感性相对较高:是否明确劝阻模型采取人类不希望或会视为“失准”的行动,以及是否鼓励模型在不确定时咨询人类。

总体上与能力没有明确趋势。

我们没有发现战略性因素随着模型能力提升而变得更重要或更不重要(至少在过去几年中如此)。有一个因素确实突出:我们发现一些证据表明能力更强的模型对目标冲突更敏感,尽管模型之间差异很大。然而,尚不清楚目标冲突为何会导致这些行为变化。要回答这类问题,我们认为需要在 AI 决策建模方面取得方法论上的进展。 

迈向更好的 AI 决策模型

我们的工作在对 AI 行为成因进行系统性测量方面取得了进展,并证明环境变化具有可预测的影响。然而,关于这些变化为何产生如此效果,我们掌握的证据较少。例如,如果目标冲突提高了 AI 模型删除消息的比率,这是因为模型确实在追求自身目标、对抗人类,并认为删除有助于实现该目标,还是因为冲突使删除的机会更加凸显,抑或完全是其他原因?这些问题的答案很重要,因为它们有助于我们预测 AI 在未经测试的新情境中会如何表现。

为了得出更具普遍性的结论,我们需要超越对行为的观察,建立产生这些行为的过程的模型。我们建议一个富有成效的框架是将此视为AI决策,包括对信念、目标、感知和其他认知属性进行建模——不是因为AI在运作和内部过程上必然与人类相似,而是因为AI模型在执行复杂任务时正在进行认知工作,因此有理由采用认知方法来解释其行为。

如果我们要理解AI系统何时以及为何违背人类意图行事,严谨的科学方法论至关重要。我们是否应该预期这种行为,以及它将如何表现,是AI安全的关键问题。这项工作是为回答这些问题所需的实证和理论基础奠定基础的起点。

你可以在完整论文中阅读更多内容。

‍

来源:英国 AI Security Institute:Blog(网页) · aisi.gov.uk