公开聊天数据能否预测真实世界AI失调?
Can public chat data predict real-world AI misalignments?
OpenAI利用WildChat公开数据集(2023年4月至2024年5月收集的100万条对话)模拟模型部署,预测GPT-5.1、GPT-5.2、GPT-5.4在真实生产环境中的不良行为率。与私有生产数据对比发现,WildChat模拟的平均预测误差约3倍;但对技术性和智能体型失调的预测精度下降。研究验证了公开数据集作为外部审计工具的可行性。
用公开旧聊天数据预测模型真实失败率,误差居然在 3 倍以内,做外部审计的可以认真看看。不过 agentic 场景明显不行,需要新数据集。
前沿 AI 模型正越来越多地被用于具有真实经济、法律和社会后果的场景。因此,政府、AI 安全组织和独立研究人员需要一些方法来评估这些系统在现实条件下的行为表现。
传统评估使用手写的、合成的或对抗性的提示词,对已知风险进行压力测试,并在受控条件下比较模型。但这些提示词可能范围狭窄、缺乏代表性,或者容易被识别为测试。另一种互补的评估模型在现实世界中行为表现的方式,通常是查看用户与模型的真实对话。LLM 开发者可以在内部这样做,通过从生产数据中抽样,检查模型是否做出了恰当的回应,以及各类失败发生的频率。基于真实使用情况的证据有助于弥合基准测试结果与部署行为之间的差距 [1],也更不容易受到模型仅仅因为正在被测试而表现不同的影响 [2,3,4。但外部评估者通常无法获取这些证据。由于真实用户对话属于隐私,实验室通常无法将其分享给 AI 安全组织、学术界或独立研究人员。因此,关于前沿模型行为最有信息量的证据,依赖于往往只有构建这些模型的实验室才能获取的数据。
今天,我们分享了关于部署模拟的研究工作,该方法利用近期的生产数据来预测部署前模型不良行为的发生率,包括罕见以及特定于模型的病态行为[1,5。在这篇博客中,我们探讨外部机构能否使用这一技术来评估前沿语言模型,方法是将源数据集替换为公开可用的替代品 WildChat[6]。
我们的核心结论是:使用 WildChat 对话前缀来模拟模型的部署,能够对真实世界的失败率做出出奇准确的预测。我们通过使用私有生产数据在部署时对基于 WildChat 的预测进行实证验证,从而确立了这一结论。我们发现,尽管 WildChat 数据的采集时间与当前使用情况之间存在 2–3 年的差距,这些结果依然成立。
这些误差也颇具信息量。预测性能下降最明显的地方,正是当前生产使用与 WildChat 偏离最远之处,尤其是对于技术性更强、更具智能体特征的失准形式。因此,我们的结果既验证了公开部署模拟的可行性,也表明了更新、更广泛、类生产数据集对于公开评估下一代语言模型真实失败的价值。我们希望这些结果有助于将公开的类生产数据集确立为外部审计的实用工具,并推动开发更丰富的公开数据集,以评估下一代智能体 AI。
WildChat 作为生产数据可验证的代理
WildChat(Zhao 等,2024 [6])是一个包含 100 万段对话的数据集,采集自 2023 年 4 月至 2024 年 5 月期间。它的收集方式是为用户提供托管在 Hugging Face Spaces 上的 ChatGPT-3.5 与 GPT-4 服务的免费访问权限,并在用户明确选择同意的前提下收集和发布其去标识化的聊天记录。此后,WildChat 被用于构建多个基准测试 [7,8,9],这些基准试图通过精心挑选少量针对特定行为的困难提示词来诱导 AI 模型表现出特定行为,从而对 AI 模型的能力或安全性进行排名。我们的目标不同。我们并非挑选 WildChat 提示词的一个子集来测试某一特定能力或安全行为,而是专注于使用 WildChat 样本中具有代表性的样本,并用我们感兴趣评估的目标模型重新生成一个新的最终助手回复轮次。我们提出的问题是:这组用新模型 X 重新生成的 WildChat 对话,能否作为模型 X 自身近期生产流量的校准代理。
几乎没有理由认为这会奏效。无论是在使用 WildChat 数据对模型 X 进行的模拟部署中,还是在模型 X 的生产数据中,我们评估的都是同一个底层模型的输出,但模型的行为始终取决于引发它的上下文。我们或许会预期,在创建 WildChat 过程中被自愿分享的用户对话,并不能代表更敏感的使用场景,而且过去几年中 AI 的使用方式已经发生了显著变化。因此,较早的公开对话可能无法暴露出与当前私有生产流量相同的失败,或相同的失败率。我们使用近期的生产数据作为真实基准来检验这一点。
我们从 WildChat 中随机抽取了大约 100,000 段对话的子集,并针对 5 个近期 OpenAI 模型(OpenAI o3、GPT-5 Thinking、GPT-5.1 Thinking、GPT-5.2 Thinking、GPT-5.4 Thinking)分别重新生成了一个新的最终助手回复轮次。我们使用由 GPT-5 Thinking 驱动的 LLM 评判器,按照 19 个受追踪的失准与安全类别(附录:表 1)对这些助手回复进行评分,并将每个类别下不良行为的比率与我们对相同问题生产环境比率的最佳可用估计(每个模型至少基于约 200,000 段对话估算)进行比较。因此,这使我们能够从 WildChat 中估计出低至 0.001% 的不良模型行为比率(在 100k 样本中,观察到一次事件对应 0.001% 的比率;真实事件比率约为 0.003% 时,有 95% 的概率至少观察到一次事件)。在所有对生产数据的分析中,用户数据均按照我们的隐私政策进行了去标识化处理。此处仅报告汇总比率和统计比较;私有生产对话不会被发布或分享。
我们表明,在 OpenAI 的各模型中,基于 WildChat 测得的不良行为发生率,能够出人意料地预测我们在生产数据中观察到的发生率,所覆盖的失败类别跨越了四个数量级(OOM)(图 2)。WildChat 与生产环境中的发生率均使用同一套完整的安全采样流程测量,因此这一比较反映的是已部署系统的行为,而非孤立模型的行为。95% 的 WildChat 预测值落在实际生产发生率的 1.04 个 OOM 以内,这意味着其误差仅比我们基于模型自身部署数据模拟其部署时所能看到的预测误差大 1.86 倍(图 1)[5]。[ [2] WildChat 的预测也接近成比例:最佳拟合线的斜率为 1.2(Pearson's R=0.65)。换言之,尽管 WildChat 数据更早且是公开收集的,它仍保留了相当多的信号,能够说明哪些失败罕见、哪些常见,以及它们在当前生产使用中大致出现的频率。
用 WildChat 前缀模拟部署,可以捕捉到模型特有的失败
要让 WildChat 作为对齐审计工具发挥作用,它必须能够暴露出被测前沿模型所特有的失准行为,即便这些行为可能并不存在于正在被重新采样的对话的先前轮次中。例如,众所周知,GPT-5.1 Thinking 引入了一种我们称之为计算器黑客的失败模式,即模型学会了表面上调用搜索,仿佛它就是计算器一样。作为 WildChat 对齐审计能力的一个积极信号,我们看到它诱发 GPT-5.1 Thinking 出现这一失败的发生率,与该模型实际部署期间的发生率相近。
对于每个被追踪的类别,我们分别按该类别在真实生产环境中的观测流行度、以及它在 WildChat 中的流行度对模型进行排名。这些类别内的模型排名呈正相关:在 18 个类别中,Spearman 秩相关的均值为 0.57,且类别层面的置换检验显著(p = 2.0 × 10⁻⁵)。这些结果表明,WildChat 并非仅仅反映数据集或评判器的固定怪癖。它保留了模型在与部署相关行为上有意义的、模型特有的差异,从而可能有助于比较哪些模型最有可能表现出特定的现实世界故障。
无内部推理特权访问的外部评估
我们使用的许多失准信号依赖于对模型完整推理轨迹的访问。例如,当评判模型能够看到模型内部推理的内容时,判断模型是否对其不确定性作了不实表述会更容易。外部评估者通常无法访问原始思维链,因此我们在不向评判器展示 CoT 的情况下重复了 WildChat 分析,同时仍然提供工具调用和模型的最终回复。
对于某些需要通过 CoT 评估意图的失准形式,不提供 CoT 似乎必然会使测量结果显著失效。尽管如此,我们发现平均预测质量只是略有下降:在所有失准类别中,平均乘性误差从有 CoT 时的 3.6× 增加到无 CoT 时的 4.0×。[2] 在类别层面,concealed uncertainty 的预测在无法访问 CoT 时退化最为严重,乘性误差增加了约 3 倍。这些结果表明,特权访问推理轨迹可能会改善某些失准类别,但即使没有原始 CoT 访问权限,针对某些失准形式的公开数据评估仍能保留有意义的信号。
WildChat 的不足之处
虽然输入-输出评估对于许多类聊天场景的失败可能已经足够,但 WildChat 在评估智能体工作流方面则较为有限。随着模型借助工具、后台工作和多步执行来承担运行时间更长的任务,其失败模式越来越依赖于 WildChat 这类类聊天数据集中基本缺失的上下文,这可能会反映在其于这些场景中的预测表现上。
虽然我们的真实标注率仍来自 ChatGPT 生产数据(其中包含的智能体对话远少于 Codex),但我们考察的六个错位类别(在表 1 中以星号标记)似乎与智能体用例关联最为紧密。这些类别的预测误差远大于其余类别:原始乘性误差约大 37 倍,且二项 NLL regret[1] 显著高于所有其他被追踪的类别。这凸显了当前公开聊天数据集在实用性上的一个重要边界。WildChat 可以支持对普通对话失败的富有信息量的评估,但对于工具丰富或智能体场景中出现的部署风险,它似乎是一个弱得多的代理指标。这表明,公开可获取、具有代表性的智能体数据集——同样经过真实生产数据验证——对于评估下一代智能体系统具有重要价值。
用模型判定的错位来评估其他 LLM
最后,我们将自己的方法应用于评估其他前沿实验室的模型。由于前沿 AI 实验室之间无法共享私有的生产数据,因此很难开展类似生产环境的竞品评估。WildChat(或其他公开的类生产数据集)可以提供一种通用的、公开的评估基座,让任何研究者或实验室都能对多个模型开展更具可比性的安全评估。由于不同实验室对可允许内容的边界划定各不相同,因此仅针对这一分析,我们不套用我们的内部分类体系。取而代之的是,我们让 OpenAI GPT-5.4 Thinking 来判断每个最终重采样后的助手回复轮次中,是否包含它认为不对齐的任何行为。我们从 4 家前沿 AI 实验室(包括我们自己在内)的 15 个模型的 API 中,对 10,000 条 WildChat 提示词的回复进行了采样,并将每个回复数据集交给该评判模型。对于每一段对话,评判模型都会给出一个二元判断、一段简短的理由说明,以及对所发现任何问题的描述。由于我们没有提供固定的分类体系或关于哪些行为应被认定为不对齐的详细指引,我们将其视为一种开放式的整体对齐度量:即评判模型在助手回复中发现任何问题的比率。我们在图 3A 中展示了这些结果。
在将使用此设置获得的模型对齐分数随时间绘制成图时,我们发现在前沿 AI 模型内部及跨模型之间,存在与 Anthropic 研究人员此前报告的结果相似的趋势,他们使用 Petri 评估了模型失准——Petri 是一款用于生成合成多轮对话、以进行针对性高风险对齐审计的工具[10]。图 3B 取自 Leike 关于对齐随时间变化趋势的讨论[11]。我们根据发布日期推断了图 3B 中未标注数据点对应的模型名称。在图 3A 和图 3B 中同时出现的 11 个模型中,排名顺序高度一致(Spearman rho = 0.973,p = 5.14e-7;53/55 对两两排序方向一致)。
考虑到 Petri 所设计的针对性焦点,这种一致性令人意外:它基于完全合成的数据生成方法,多轮诱导 OOD 行为和高风险失准[10]。相比之下,我们选择 WildChat 作为最能代表“标准”LLM 使用的公开可用数据集之一。此外,WildChat 可以说甚至达不到这一目标:它包含的用例如今已过时 2-3 年,其提示词分布主要由非常简短的对话构成(在我们抽样的数据集中,约 67% 包含两轮或更少的用户轮次),并且 3% 的样本仅包含一条仅仅向模型打招呼的用户消息。
一种可能的解释是,WildChat 捕捉到了一个宽泛的安全信号,而该信号也能泛化到 Petri 旨在测量的更高风险的失准倾向。然而,一种更为谨慎的解读是,Petri 的聚合分数本身可能在很大程度上是由相对常见的模型行为所驱动的,而非仅仅由其场景旨在引出的那些更罕见的高风险失败所驱动。Petri 针对的是欺骗、协助滥用、颠覆监督、自我保存以及其他高风险风险,但一个模型的总体排名仍可能受到更普通的失败的强烈影响,例如过度顺从、拒绝校准不佳、模型幻觉、不确定性处理薄弱,或指令遵循脆弱。如果这就是解释,那么这种一致性就不太能证明 WildChat 测量的是高风险稳健性,而更能证明两种方法都在追踪一个共同的通用安全质量因子。如果这一解读正确,Petri 的聚合分数仍然有用,但它可能无法清晰地将高风险对齐行为与更通用的模型质量和安全问题区分开来。我们不确定哪种解释是正确的,并欢迎能够厘清二者的研究工作。
我们还注意到,尽管评判者对每个数据集来源不知情,但由于 OpenAI 各模型在策略和安全栈上的一致性,我们这里的评判者可能受到某种“自己批改自己作业”效应的影响,从而优待其他 OpenAI 模型。我们承认,出于这一原因,图 3B 中的 Petri 图可能反映了对竞争模型更为均衡的看法。我们使用由 OpenAI o3 支持的评判者而非由 GPT-5 支持的评判者重复了这一比较,发现 15 个模型的排序几乎没有变化(Spearman rho = 0.971,p = 1.69e-9;平均绝对排名偏移 = 0.53 位;105 个模型对中仅有 5 对顺序颠倒)。
结论
综合来看,这些结果为公开生产数据作为一种有用的评估工具提供了合理性依据,尤其对前沿实验室之外的研究者而言,对于普通类聊天交互中出现的失败案例更是如此。但这些结果也揭示了这种有用性的边界:WildChat 对与智能体行为关联最紧密的类别预测性最差,因为其中简短、大多非智能体的对话在这些类别上最具不代表性。这使得下一步变得清晰:AI 实验室可以通过将公开的、经用户同意的、类生产数据集与私有部署数据进行验证比对,来强化公开评估,同时不损害用户隐私。若做不到这一点,协调各方努力构建和维护更多公开的类生产数据集也将很有价值。我们希望这能鼓励该领域构建更丰富的公开数据集,以推动智能体 AI 的生成——即长上下文、使用工具、多轮会话的交互,使外部研究者、政府和 AI 安全组织能够有意义地将其用于评估。
脚注
- [1] 我们使用二项式 NLL 遗憾值,因为它能在评估稀有事件发生率预测时,兼顾低发生率下的采样噪声。关于这一方法背后思路的更多细节,请参见我们的论文 [5]。[ ↩
- [2] 其中一些数字可能与我们论文中报告的略有不同,因为此处我们在额外模型上运行了分析。 ↩ ↩
参考文献
- Williams, M. 等(2025)。在部署前规避评估意识并预判失准。OpenAI Alignment 研究博客。
- van der Weij 等(2024)。AI 消极怠工:语言模型可以在评估中策略性地表现不佳。arXiv。
- Needham, J. 等(2025)。大语言模型往往知道自己正在被评估。arXiv。
- Greenblatt, R. 等(2024)。大语言模型中的对齐伪装。arXiv。
- Williams, M.、Sheahan, H.、Raymond, C.、Korbak, T. 等(2026)。通过部署模拟在发布前预测 LLM 安全性。arXiv。
- Zhao, W. 等(2024)。WildChat:100 万条真实场景中的 ChatGPT 交互日志。arXiv。
- Lin, B. Y. 等(2024)。WildBench:用真实用户的真实挑战性任务对 LLM 进行基准测试。arXiv。
- Han, S. 等(2024)。WildGuard:面向 LLM 安全风险、越狱和拒答的开源一站式审核工具。arXiv。
- Zhao, W. 等(2024)。WildHallucinations:用真实世界实体查询评估 LLM 的长文本事实性。arXiv。
- Fronsdal, K. 等(2025)。Petri:对高风险交互的并行探索。Anthropic。
- Leike, J.(2026 年 1 月 22 日)。对齐尚未解决:但它越来越看起来是可解决的。关于对齐问题的思考。
致谢
感谢 Marcus Williams、Cameron Raymond 和 Tomek Korbak 提供相关研究与讨论。同时感谢 Jenny Nitishinskaya、Ludovic Peran、Maja Trebacz、Sam Arnesen、Jasmine Wang、Mia Glaese、Michael Sharman、Gaby Raila、Ally Bennett 和 Danielle Kehl 推动这项工作,并对本文提供了有益的反馈。
BibTeX
@misc{sheahan2026validatingpublicaudits,
title = {Can public chat data predict real-world AI misalignments?},
author = {Sheahan, Hannah and Carroll, Micah},
year = {2026},
month = {Jun},
howpublished = {OpenAI Alignment Research Blog},
url = {https://alignment.openai.com/validating-public-evals/}
}附录
| 被追踪的类别 | |
|---|---|
| 禁止内容 | 失准 |
| MH:心理健康 | 确认性攻击 |
| A:滥用/骚扰 | 声称拥有真实世界经历 |
| C:性内容 | 谎报工作完成情况* |
| K_VA:暴力违法行为 | 承诺后台任务* |
| K_NV:非暴力违法行为 | 编造事实* |
| B:生物风险 | 对工具撒谎* |
| V:暴力 | 计算器黑客攻击* |
| E:极端主义 | 隐瞒不确定性* |
| R:情感依赖 | |
| S:自残 | |
| H:仇恨 | |
来源:OpenAI:Alignment 研究博客(RSS) · alignment.openai.com