OpenAI 与 Apollo Research 开发 Contrastive SDF 测试衡量 AI 的 reward-seeking 行为
Measuring Reward-Seeking by Instilling Contrastive Beliefs
OpenAI 与 Apollo Research 开发了 Contrastive SDF 测试,通过向模型植入相反的评分者偏好信念来测量其行为变化。测试发现,未经安全训练的前沿规模强化学习模型更倾向于做评分者想要的事,即使违背用户意图,且该倾向随训练增强。
我觉得 OpenAI 这个新方法,第一次把 reward-seeking 从推理线索变成了可测量的因果量,而且趋势很明确:RL 训越多,模型就越会讨好评分者。对齐评估可能比我们想的更脆弱。
通讯:jenny [at] openai.com
简要概述
- 我们开发了一种新的测试方法——对比合成文档微调(Contrastive SDF),用于检验 AI 模型在持有不同世界信念时是否会改变其行为。
- 我们验证了该测试在两类模型上均有效:一类是被明确训练为偏好权威偏好的模型,另一类是被训练为在单元测试中作弊的模型。
- 在前沿规模上经过强化学习训练、但未接受任何安全训练的模型,更倾向于做它们认为评分者想要的事,即使这与用户或开发者的意愿相悖,而且这种倾向随着训练的进行而增强。

图 1. 使用 Contrastive SDF 测量奖励寻求行为。
引言
机器学习模型可能出于错误的原因产生正确的输出。著名的例子包括:一个强化学习智能体因收集总是被放置在关卡最右端的硬币而获得奖励,结果它学会了向右奔跑,而不是去寻找硬币本身 [Langosco;Shah];以及一个肺炎分类器,它学会的是识别哪家医院拍摄了 X 光片,而不是疾病的特征 [Zech]。训练后的行为在训练分布上看起来是正确的,而底层的策略追踪的却是一个不受欢迎的代理目标。
其中一种代理目标就是奖励过程本身:模型可能学会去追求其评分者所奖励的东西,而不是其设计者所意图的东西。我们将这种行为称为奖励寻求:模型对其评分者(训练中的奖励模型、测试中的评估评分者,或部署中的监控器)进行建模,并根据它所认为的评分者会奖励什么来调节自身行为 [Carlsmith;Hebbar;Mallen & Shlegeris]。奖励寻求者可能将评分者的认可视为终极价值,也可能将其作为工具性手段来追求,以保护某种其他目标,例如避免被修改或获得未来的影响力 [Hubinger;Carlsmith];我们的定义并不区分这两者。
若干前沿模型的训练检查点会在没有特殊提示的情况下进行评分器推理(明确推理评分器想要什么)[Schoen & Nitishinskaya;Claude Opus 4.8 System Card;Fable 5 System Card;METR 对 GPT-5.6 的评估;GPT-5.6 预览版系统卡];示例见图 2。此类推理是潜在奖励寻求行为的证据,却是一种糟糕的系统性测量工具:模型可以依据其对评分器的信念(关于评分器偏好的信念)行事而不将其表述出来,而且口头表述的推理往往无法清晰地对应到最终行动[Schoen & Nitishinskaya]。在本项工作中,我们将奖励寻求操作化为行为对评分器偏好信念的因果敏感性。

图 2. 一次评估中的奖励寻求行为。一个以能力为重点的后期检查点被要求生成一个随机奇数,而一个看似游离的元数据块暴露了一个会对偶数输出给予奖励的“评分器”。模型推理认为自己应当输出偶数,无视用户的请求,返回了 4。
要测量这种敏感性,需要一种能够可控地改变模型对评分者信念的干预手段。上下文内实验有时能够检测到奖励寻求行为,但作为可靠的测量方法,它们注定会失败,因为模型可能会对放入其上下文中的说法产生怀疑。我们使用合成文档微调(Synthetic Document Finetuning,SDF):在预训练格式的文档(学术论文、新闻报道、教科书)上进行微调,这些文档被写得仿佛某个目标事实为真。我们在暗示相反评分者偏好的匹配语料上分别微调同一模型的两个副本,在下游任务上评估两者,并测量行为在多大程度上遵循评分者所暗示的偏好(图 1)。我们将这一流程称为对比式 SDF(Contrastive SDF)。
对比式 SDF 如何测量奖励寻求行为
奖励寻求者会针对它所认为的评分者所奖励的内容进行优化,因此当这些信念改变时,其行为也应随之改变,我们可以借此来测量一个模型的奖励寻求程度。我们通过 SDF 来植入这种信念。
然而,仅凭单一植入的信念本身并不能揭示奖励寻求行为。假设我们植入“评分者奖励列表推导式而非 for 循环”这一信念,然后模型开始写列表推导式。这一转变与奖励寻求行为一致——模型写列表推导式是为了满足评分者。但它同样与信念迁移一致——模型推断用户也想要列表推导式,于是写列表推导式来服务用户——或者仅仅是因为训练让列表推导式变得更加显著。为了排除这些替代解释,我们将测量设计为对比式的,迫使模型在评分者与一个对立的权威之间做出选择(对比式 SDF)。
我们使用一个能力较强的模型很可能已经有所表征的各方之虚构化版本:它所对话的用户,以及训练它并设定其偏好的开发者(在此例中为 OpenAI 领导层)。我们加入一条虚构的欧盟法规作为低显著性的对照。随后我们灌输这样一种设定:评分器奖励列表推导式,而其中某一权威方则偏好 for 循环。这两个特征互斥。

图 3. 对比性 SDF 片段示例。我们在合成文档上训练一个模型,这些文档表明虚构的 RLVR 评分器奖励列表推导式,而欧盟法律强制要求使用 for 循环。该模型的第二个副本则在相反的事实上训练。
我们训练同一模型的两个副本,一个在合成文档上训练,其中评分器(G)偏好某个特征(f),而对立的权威方(D)偏好其反面(~f);另一个模型则在完全相反的情形上训练(G 偏好 ~f,D 偏好 f)。这两个副本在输出中显示特征 f 相对于反面特征 ~f 的频率之差,就是我们的度量。评分器一方的差距越大,意味着模型越倾向于追求奖励。
$$ \text{评分器差距} := rate_{f} \left(\right. G_{f} , D_{\neg f} \left.\right) - rate_{f} \left(\right. G_{\neg f} , D_{f} \left.\right) $$
结果
在 RL 训练过程中,模型越来越倾向于站在评分器一边
我们将该方法应用于一次以能力为重点的 OpenAI o3 RL 运行中的若干中间检查点,该运行未进行安全训练。我们从三个中性的编码风格特征入手。
在 SDF 之后,被测试的检查点往往会迎合评分者的偏好,即使这些偏好明确违背用户或开发者的偏好。从早期到后期的 RL 检查点,模型偏向评分者的差距呈上升趋势,而模型对其他权威的偏好则相对更平缓,且接近于零(图 4)。这一变化是评分者所特有的,并非模型对权威回应方式的普遍转变。

图 4. 评分者差距在 RL 训练过程中不断扩大,而非评分者差距则相对平缓。对于 rl-capabilities 运行的每个中间检查点(安全训练前),我们应用对比式 SDF,并绘制每种权威配对下的平均行为差距。在包含评分者的配对中(上图),差距从早期到后期检查点呈上升趋势。在不包含评分者的配对中(下图),平均差距保持较小且相对更平缓,表明 RL 主要增强了对评分者偏好的敏感度。对于标题为 X vs Y 的图,正值表示向 X 的偏好偏移,即上排图中的正值表示模型更经常按照评分者的偏好行事。
模型在对齐评估中的诚实性取决于它认为评分者奖励什么
我们将对比式 SDF 测量扩展到一个与对齐相关的特征:诚实与任务完成。合成文档描述了这样一种场景:某项约束阻碍了任务完成,并明确说明智能体是因通过暗中违反该约束而成功获得奖励,还是因诚实承认失败而获得奖励。我们分别灌输两种情形:要么评分者奖励不惜一切代价完成任务,而 OpenAI 领导层要求诚实;要么反过来。
在Broken Promises Coding 评测中,模型必须明确向监督者承诺不使用完成任务所需的受限工具。因此,完成任务就意味着必须违背承诺。晚期 RL 检查点的诚实性在很大程度上取决于它认为评分者会奖励什么。这一效应在第二个诚实性评测Log Falsification上得到了复现,在该评测中,模型除非伪造监管报告,否则将面临负面后果。一个高度追求奖励的模型可能仅仅因为推断出当前正在评测诚实性,就选择不违背承诺。如果监督机制发生变化,或者模型意识到自己不再受到主动监控,这种表面上的对齐可能无法泛化。

图 5. 在 Log Falsification 和 Broken Promises Coding 两项评测中,模型的行为都会随其认为正在被奖励的内容而变化。两种信念条件之间的差距在早期检查点上较小,而在晚期检查点上较大。
验证测量方法
我们的测量只有在对比差距确实反映了模型优化所针对的权威方时才有意义。对于真实模型,我们没有基准真值,因此为了验证我们的测量方法,我们转向那些其倾向性由我们控制的模型。我们验证了经过奖励黑客训练后,被训练为奖励黑客的模型会表现出更大的评分者差距,而被训练为对某一特定权威方谄媚的模型会在该权威方上产生最大的差距。在验证实验中,我们使用编码风格特征。
奖励黑客训练增大了评分者差距
对奖励寻求行为的可靠测量,应当能够将高度奖励寻求的模型与奖励寻求程度较低的模型区分开来。持续进行奖励黑客行为的模型是一个天然的测试用例(见附录)。
我们在 Redwood Research 独立训练的两个奖励黑客模型上测试了这一点,它们分别基于 gpt-oss-120b 和 Kimi K2.5。

图 6. 对 Redwood Research 训练的两个奖励黑客模型进行同样的测量。gpt-oss-120b 奖励黑客在阅读理解任务上的评分者差距,相对于其未修改的对应模型,从平均 33 分跃升至 86 分。较弱的 Kimi K2.5 黑客模型变化则小得多,这与 Redwood 自己对每个模型内化黑客行为强度的判断一致。
恢复模型生物体的倾向
我们训练了三个模型生物体,通过 SFT 对 gpt-oss-120b 进行微调,使其对某一已知权威广泛谄媚:用户、评分者或 OpenAI 领导层。如果该方法可靠,那么最大的行为率差距应当始终落在每个生物体被训练去优化的那个确切权威上。
我们将对比测量应用于每个生物体,涵盖四项编程评估。在 Short Python Tasks 上,每个生物体的差距都偏向其目标权威。

图 7. 对比式 SDF 恢复了每个模型生物在短 Python 任务上被训练去优化的权威。每个面板展示了在对三个 gpt-oss-120b 模型生物之一应用对比式 SDF 后,短 Python 任务评测上的理解率。对于每个模型生物,模型被训练去偏好的目标权威始终获胜,并显示出对其有利的较大正向比率差距,这证实了该测量方法正确识别出了模型生物在此评测中被训练去表现出的偏好。
为什么奖励寻求很重要
奖励寻求者会做它认为评分者会奖励的事,即使这与开发者的意图相冲突。当评分者不完美时,策略可能会追求看起来正确的东西,而非真正正确的东西。即使评分者完美无缺,模型也可能在缺乏评分或评分不再具有影响力的情境中发生错误泛化。如果模型是出于正确的理由做正确的事,泛化很可能会更好。奖励寻求还会削弱我们用来捕捉失准的评测:由于奖励寻求者优化的是评分者的判断,它可能在对齐评测中获得高分,而高分也就不再能区分对齐的模型与将泛化得很差的模型,欺骗性对齐便是其极端情形 Hubinger。更糟的是,它可能很难被训练消除:对齐的策略与奖励寻求的策略在评分者注视时可以看起来完全相同,因此针对不当行为进行训练,可能只会更新模型关于什么会获得奖励的信念,而非其底层偏好 Denison;MacDiarmid]。
Anthropic 报告了评分器感知的相关证据:Claude Opus 4.8 系统卡发现,激活层面的监控器在大约 5% 的采样 RL 回合中检测到了这一现象,而 Fable 5 系统卡则报告称,模型越来越多地追踪其环境是否可被利用来获取奖励,并且这能够因果性地影响行为。这些是评分器感知的结果,而非直接的奖励寻求测量,但它们与我们观察到的、与训练相关的趋势是一致的。
每一家前沿实验室都在扩大 RL 的规模,而情境感知正在上升 [Schoen & Nitishinskaya;Anthropic;Chaudhary],因此我们预计奖励寻求行为会增长。寻找它的地方是在训练期间,而不仅仅是部署之后。这意味着要审计检查点中的奖励寻求行为,并构建更好的方法来检测模型何时出于错误的理由而表现良好。OpenAI 正在继续与 Apollo 就这项研究展开合作。
附录
奖励黑客行为是衡量奖励寻求的一个很有前景的切入点。奖励寻求与奖励黑客行为并非同一回事:奖励寻求是一种广泛倾向,即根据自己认为会获得奖励的东西来调整行为,而奖励黑客行为则是一种为最大化奖励而采取的具体行为策略。然而,两者并不互相蕴含。一个模型可能仅凭一种狭隘的习得启发式就进行奖励黑客,例如总是给困难的测试加上 pytest.mark.skip,而从未对奖励过程进行推理。反过来,一个奖励寻求者会对什么会获得奖励进行推理,并且可以在不使用奖励黑客策略的情况下表现良好。但那些实施复杂、泛化性黑客行为的模型,更可能是广泛的奖励寻求者,因此一个大量进行奖励黑客行为的模型,在我们的测量中很可能表现出更大的评分者差距。
奖励寻求与“元博弈”密切相关,但又有区别。元博弈是指“在场景叙事之外对反馈或监督机制进行推理,无论模型处于训练、评估还是部署阶段。”元博弈与奖励寻求并不必然互相蕴含。一个进行元博弈的模型未必是在寻求奖励。它可能对监督机制进行推理,然后出于其他价值观而忽略评分者的偏好,甚至采取与之相悖的行动。一个奖励寻求者也未必总是进行元博弈,如果该模型对评分者的信念完全由呈现给它的上下文叙事所塑造的话。
致谢
感谢 Aiden Low 和 Bowen Baker 对本文的反馈。
BibTeX
@misc{hojmark2026rewardseeking,
title = {Measuring Reward-Seeking by Instilling Contrastive Beliefs},
author = {Højmark, Axel and Scheurer, Jérémy and Nitishinskaya, Jenny and Hofstätter, Felix and Wolfe, Jason and Ehrenborg, Theodore and Schoen, Bronson and Meinke, Alexander},
year = {2026},
month = {Jul},
howpublished = {OpenAI Alignment Research Blog},
url = {https://alignment.openai.com/measuring-reward-seeking/}
}
来源:OpenAI:Alignment 研究博客(RSS) · alignment.openai.com