GPT-Live 系统卡:评测配置更正后部分安全指标出现回归
GPT-Live System Card
OpenAI 发布 GPT-Live-1 与 GPT-Live-1 mini 系统卡,并因发现评测配置不匹配而重跑了语音原生违禁内容评测。
OpenAI 公开更正后的语音安全评测数据,附带修正前后对照,读者可看到误配置如何影响安全评估结论。
2. 模型数据与训练
与 OpenAI 的其他模型一样,GPT-Live-1 和 GPT-Live-1 mini 在多样化的数据集上进行了训练,包括互联网上公开可用的信息、我们与第三方合作获取的信息,以及我们的用户或人工训练师和研究人员提供或生成的信息。我们的数据处理流程包含严格的过滤,以保持数据质量并降低潜在风险。我们使用先进的数据过滤流程来减少训练数据中的个人信息。我们还采用安全分类器来帮助防止或减少有害或敏感内容的使用,包括涉及未成年人的性内容等露骨材料。
请注意,先前发布的模型的比较值来自这些模型的最新版本,因此可能与这些模型发布时公布的值略有不同。1
3.1 针对不允许内容的语音原生评估
2026 年 8 月 4 日:我们发现评估设置中存在配置不匹配。我们使用正确的配置重新运行了完整评估,本节报告的结果已相应更新。我们添加了一个附录,以并排展示原始值和更正后的值。
附录 A:模型安全评估的原始值和更正后的值
本节于 2026 年 8 月 4 日添加。
与先前报告的结果相比,更正后的生产评估分数显示,GPT-Live-1(0.97 至 0.95)和 GPT-Live-1 mini(0.94 至 0.91)在非法行为方面出现了统计上显著的退步。在合成评估中,GPT-Live-1 在性内容(0.97 至 0.95)和血腥内容(0.97 至 0.93)方面出现统计上显著的退步,而 GPT-Live-1 mini 在非法行为(0.97 至 0.95)和血腥内容(0.96 至 0.90)方面出现统计上显著的退步。没有任何退步低于我们的安全发布标准。
来源:OpenAI:部署安全与系统卡(网页) · deploymentsafety.openai.com