OpenAI 发布 GPT-5.6 Preview 系统卡,Sol、Luna、Terra 在生化领域被 precautionarily 判为 High 能力
GPT-5.6 Preview System Card
OpenAI 发布 GPT-5.6 Preview 系统卡,将家族三个成员 Sol、Luna、Terra 在生物化学领域预防性判定为 High 能力,但均未达到 Critical。
系统卡披露了 GPT-5.6 家族的生化和网络安全能力评估细节,读者可以据此了解 OpenAI 如何划定 High 与 Critical 阈值并部署防护。
2. 模型数据与训练
与 OpenAI 的其他模型一样,GPT-5.6 是在多样化的数据集上训练的,包括互联网上公开可用的信息、我们与第三方合作获取的信息,以及我们的用户或人工训练师和研究人员提供或生成的信息。我们的数据处理流程包含严格的过滤,以保持数据质量并降低潜在风险。我们使用先进的数据过滤流程来减少训练数据中的个人信息。我们还采用安全分类器来帮助防止或减少有害或敏感内容的使用,包括涉及未成年人的性内容等露骨材料。
OpenAI 推理模型通过强化学习进行推理训练。这些模型被训练为先思考再回答:它们可以在回应用户之前产生一长串内部思维链。通过训练,这些模型学会完善其思考过程、尝试不同策略并识别自身错误。推理使这些模型能够遵循我们设定的特定准则和模型政策,帮助它们按照我们的安全预期行事。这意味着它们能提供更有帮助的回答,并更好地抵御绕过安全规则的尝试。
请注意,此前发布的模型的对比数值来自这些模型的最新版本,因此可能与这些模型发布时公布的数值略有不同。1
3.1 禁止内容
3.1.2 通过部署模拟预测禁止内容的变化
在 GPT-5.4 Thinking 和 GPT-5.5 系统卡中的评估基础上,我们在发布前利用大致具有代表性的生产提示来模拟模型部署。虽然此前系统卡中的估计是实验性的,但此后我们已在我们的近期研究中更充分地验证了这一方法。鉴于此,我们正在更新本节中报告结果的方式。我们仍在扩大这一技术的推广范围,就本系统卡的范围而言,我们仅评估了 GPT-5.6 Sol。根据我们的隐私政策,我们仅分析允许将其数据用于模型改进的用户的 ChatGPT 流量。我们还排除了多模态对话。我们在其余对话中均匀采样。
在模型发布之前,我们利用过往 ChatGPT 生产环境中的 GPT-5.5 对话,通过用新模型重新采样最终助手回合来模拟 GPT-5.6 Sol 的部署。然后,我们对重新采样得到的补全内容自动标注禁止内容。这些标注的精确度可能有限,尤其是对于低发生率的行为,但仍能提供有价值的方向性信号。
在下图中,我们报告了不安全模型级输出的预测发生率。例如,根据观察到的与 GPT-5.6 Sol 的对话分布,我们估计每 100,000 个与 GPT-5.6 Sol 的生产对话回合中,约有 8.6 个会被判定为违反我们的骚扰政策。
基于模拟的预测。将 GPT-5.6 Sol 的部署模拟与 GPT-5.5 的部署模拟进行比较,预测 GPT-5.6 Sol 在部署期间平均而言将具有与 GPT-5.5 大致相同数量的不允许内容违规。我们比较模拟率,以消除我们流程中混杂因素的影响。为了识别不太可能由噪声引起的测量变化,我们使用显著性为 0.1 的双侧 Fisher 精确检验,未对多重比较进行校正。基于这一统计检验,唯一显著的变化似乎是性相关的不允许内容(增加了 40%,从 0.05% 升至 0.07%),以及不允许的心理健康回应(减少了约 40%,从 0.03% 降至 0.02%)。虽然相对增幅值得注意,但绝对比率仍然很低,模型在这一领域达到了我们的安全标准。我们评估这一结果不会实质性改变模型的整体风险状况。
模拟质量。将 GPT-5.5 生产数据与使用 GPT-5.5 生产数据的 GPT-5.5 部署模拟进行比较,我们可以分离出我们流程的重采样环境误差(对于我们关心估计的量的模拟质量的代理指标)。我们模拟的中位对称乘性误差为 1.2 倍,较高的比率集中在较低频类别中,这主要与噪声一致——如下图所示。1
先验估计质量。由于自上一份系统卡以来我们的模拟流程发生了重大变化,GPT-5.5 的生产率与我们在 GPT-5.5 系统卡中所做的估计不可比,因此无法公平地验证它们。我们将优先在未来的系统卡中实现这一目标。
正如我们的研究所示,由于生产流量底层分布以及模拟流程中的时间漂移,这些预测可能并不完美,但仍与生产结果高度相关。
9.1.1 生物与化学能力
我们将 GPT-5.6 家族的全部三个成员——Sol、Luna 和 Terra——在生物和化学领域均视为高能力。
在我们当前的 Preparedness Framework 中,我们使用高能力阈值来评估模型是否能够为“新手”行为者提供有意义的协助,以制造已知的严重威胁。我们假设此类威胁的主要瓶颈之一是学习湿实验室能力,尤其是隐性知识和故障排除。因此,除了红队测试、外部测试和先前的湿实验室提升研究之外,我们运行了四项评估来测试这些能力。我们观察到 4 项评估中有 3 项高于我们的指示性阈值(其中 2 项可能是已趋于饱和的评估),并得出结论,因此应出于预防将这些模型视为高能力。来自湿实验室提升研究的额外验证最终可能会改变这一结论。
此外,我们使用关键能力阈值来评估模型是否能让专家在无人类干预的情况下开发出高度危险的新型威胁载体,或完成全工程周期(例如,使行为者能够测试数量多得多的候选威胁)。我们假设一个重要的瓶颈是新型病原体设计。因此,除了红队测试和外部测试外,我们还运行了三项评估来测试这一能力。我们观察到 3 项评估中有 0 项高于我们的指示性阈值,并得出结论:这三个模型均无需被视为关键。
鉴于生物威胁相对于化学威胁具有更高的潜在严重性,我们优先进行生物能力评估,并将其作为该类别中高能力和关键能力的指标。
9.1.1.3 隐性知识与故障排除
为了评估模型在隐性知识和故障排除方面提供协助的能力,我们与 Gryphon Scientific 合作构建了一个多项选择数据集。它包含 60 道多项选择题,每道题有四个选项。
这些问题涵盖生物威胁创建过程的所有 5 个阶段,并聚焦于隐性知识或故障排除会成为瓶颈的领域。隐性知识问题对任何不在该领域工作的人来说都应是晦涩难懂的,即它们要么需要追查相关论文的作者,要么需要认识该领域的人。故障排除问题对任何没有实践经验的人来说都应是晦涩难懂的,即答案只有亲自尝试过该实验方案的人才知道。
该数据集未受污染;它完全由我们与 Gryphon Scientific 的合作伙伴内部创建,且尚未发表。在其中一些问题上,模型会以拒绝回答或安全完成作答,这些回答并未完全回答问题。为避免低估模型能力,我们同时报告原始得分,以及将所有拒绝回答和安全完成作答都视为成功时的得分。
80% 的专家共识基线被用作指示性阈值(即,将每道题最常见的专家回答视为正确)。在已发布的新模型中,当我们也将拒绝回答计入时,GPT-5.6 Terra 得分最高,为 84.1%——高于阈值。
我们注意到,即便这一得分也低于 GPT-5.5,我们认为这可能是由于该评估已饱和,而这种差异可能是噪声所致。我们还注意到,图中 GPT-5.4 的低分是因为它们未将拒绝回答或安全完成作答计入。(根据 GPT-5.4 Thinking 系统卡,该模型在未调整拒绝回答时得分为 65%,而在将拒绝回答视为模型本可“答对”的问题时得分为 83.8%)。
9.2 研究类别更新:故意表现不佳
9.3.1.1 生物与化学威胁建模
我们在很大程度上依赖 GPT-5 系统卡中所述的相同威胁模型,特别关注可能导致严重生物和化学危害的威胁行为者画像和路径。我们以此评估特定瓶颈,即我们的技术可能提升恶意行为者能力的环节,从而为我们的防护措施的开发和重点提供依据。在我们的 High 阈值下,我们预计威胁行为者试图利用我们的模型造成严重危害的主要路径是持续探测两用生物和化学内容。因此,我们的防护方法侧重于通过多层防御栈主动阻止此类内容。我们不太担心单次模型响应绕过某一防御层。我们假设威胁行为者很可能需要在多个步骤中进行反复、定制的故障排除,因此频繁的拒绝或封禁将造成有意义的阻力。
我们当前的威胁模型聚焦于我们的模型被用于生物危害的两条主要路径:(a) 提升新手以获取或制造并部署已知的生物或化学威胁[我们的 High 阈值],以及 (b) 另一个令人担忧的情景,即直接提升专家以制造、修改和部署已知生物威胁。
为防护这些能力,我们构建并与外部专家共同验证了一个全面的“武器化生命周期”框架,该框架展示了威胁行为者可能如何获取和/或修改一种已知的呼吸道病毒。该演练的更多细节可在我们的 GPT-5 系统卡中找到。我们将此作为一个示例情景进行特别深入的测试以检验我们的防护措施,同时也创建其他高层级情景以覆盖不同类型的病原体和攻击途径。
此外,我们正开始为未来可能的 Critical 能力做准备:(c) 使专家能够开发一种高度危险的新型威胁途径,以及 (d) 在无人工干预的情况下完成受管制或新型生物威胁的完整工程和/或合成周期。
为此,我们开发了四个新型威胁的代表性情景,并纳入了独立专家和我们 Frontier Risk Council 的反馈。我们尚未公开分享这些威胁模型或这些情景的细节,因为它们可能构成信息危害(FMF, 2025)。然而,我们确实与选定的可信第三方分享了这些材料,这为六个新代理任务的开发提供了依据,我们正使用这些任务来测试我们的防御栈。我们的防护措施在红队人员尝试这些任务的关键提示上实现了早期 93.5% 的召回率。随着我们进一步为 Critical 做准备,我们持续努力扩展我们的情景、任务和提示列表,以扩大覆盖范围并提高召回率。
9.3.2 模型安全训练与评估
GPT-5.6 系列中的模型经过训练,不会生成违反我们安全政策的生物、化学或网络安全内容。这包括为缓解越狱而进行的训练。模型训练防护构成我们灾难性风险缓解栈中的一层防御,并与监控器、可信访问、访问控制和离线执法一起提供强大的在线防护。
9.3.2.1 生物和化学安全训练与评估
我们训练模型以安全地回应那些可能允许生物滥用的提示。这项训练与我们的分类器和离线缓解措施的训练分开进行,以使我们的防护措施去相关化。生物学安全训练涉及防止与高风险两用工作流程相关的回应,这些工作流程常见于生物武器化路径以及对危险病原体的两用研究。训练数据包括从威胁场景中筛选出的合成、生产和半合成示例,这些场景经过精心策划,覆盖广泛的危险病原体和高风险工作流程。在 GPT-5.6 的训练过程中,我们额外扩充了训练数据,以提升我们在先前模型中较为薄弱的拒绝和过度拒绝边界上的稳健性。
为了评估这些模型层面拒绝的质量,我们追踪来自留出合成数据、红队测试和生产数据的提示所引发的模型回应的安全性。这些指标仅构成模型回应——监控性能将在下文详细讨论。评估显示,相对于 GPT-5.5,安全性略有回退。相反,模型在涉及低风险先进生物学的良性工作流程上,过度拒绝显著减少。
9.3.2.2 网络安全安全性训练与评估
我们正处于 AI 在网络安全中作用的关键时期:目前,我们的测试表明,模型在发现和修复网络漏洞方面比在实际攻击中利用这些漏洞更擅长。这意味着,总体而言,广泛获取两用网络能力目前是净正面的:这些能力对防御者有用所创造的益处,大于这些能力对攻击者可用所造成的危害。
我们的网络安全安全政策在防止危害与赋能防御者之间取得平衡。我们允许用户将模型用于两用任务,例如网络安全教育、人工主导的代码漏洞识别、调试、企业安全运营自动化,或人工主导的应用安全。
该政策禁止恶意用例,例如开发和肆意部署高级恶意软件,以及高风险两用网络安全研究领域,这些领域若被滥用可能造成危险,例如:针对实时第三方系统的长时程自主漏洞研究和链式利用。
来源:OpenAI:部署安全与系统卡(网页) · deploymentsafety.openai.com