跳到正文
北京时间
原文
OpenAI:官网动态(RSS · 排除企业/客户案例)·· 26 天前精选AI 评分81

OpenAI 发布 GPT-6 Astra 并公布安全概览,称其网络安全能力达到 Preparedness Framework 的 Critical 级

Safety overview: GPT-6 Astra

AI 导读

OpenAI 发布 GPT-6 Astra,称这是其部署过的最强模型,也是首个在其 Preparedness Framework 下达到网络安全能力 Critical 级的模型,可在无人逐步引导的情况下发现未知安全漏洞并开发利用方式。

推荐理由

OpenAI 官方发布的安全评估,给出模型在网络安全能力、对齐和可监测性上的具体发现,读者可借此了解前沿模型安全实践的最新变化。

正文 · AI 翻译

今天,我们发布 GPT‑6 Astra,这是我们迄今面向广泛部署的最强模型。Astra 是我们首个在我们的 Preparedness Framework 下达到网络安全能力 Critical 级别的模型。

关于此次发布的安全性,最重要的事项如下:

  1. **GPT‑6 Astra 在网络能力上实现了显著跃升,并达到了我们的 Critical 阈值。**这意味着,在拥有合适的工具和访问权限的情况下,GPT‑6 Astra 能够发现此前未知的安全漏洞,并开发出新的利用方式,在无需人工逐步引导的情况下攻破许多防护严密的系统。因此,我们大幅加强了防护措施,以防止该模型采取有害的网络行动,无论是源于滥用还是失准。我们还采取措施保障 Astra 及类似模型的内部开发与部署安全,包括更严格的隔离、检查点加密、对完整轨迹(包括思维链(CoT))的全面监控,以及在内部使用前实施阻断式对齐评估流程。

  2. GPT‑6 Astra 比其前代模型显著更为稳健。GPT‑6 Astra 融入了新的稳健性安全训练技术,对越狱的抵御能力显著强于 GPT‑5.6 Sol,包括在更长的轨迹中也是如此。我们通过离线测试以及严格的内部和外部越狱测试与修复计划得出了这一结论。对于被标记为潜在高风险的用户,我们还额外训练了调整模型拒绝边界的能力,使其更为保守,并覆盖更广泛的双重用途风险。我们使用回归测试来确保 Astra 对以往测试周期中发现的越狱具有稳健性,并使用我们最新的内部红队攻击者进行了新一轮自动化红队测试,以验证我们的改进。

  3. **GPT‑6 Astra 比 GPT‑5.6 Sol 对齐得更好。**Astra 是模型对齐方面的一大进步,其对齐改进涵盖了我们预训练数据的构成到强化学习过程中的评分。我们报告了一套新的对齐评估⁠ ,并发现 GPT‑6 Astra 在尊重安全与安保边界、保持在授权范围内方面表现更强。在一项使用了超过54,000 个内部 Codex 任务⁠ 的模拟中,Astra 因较高严重程度的失准行为而被标记的次数也大约只有 Sol 的一半。

  4. 我们正在广泛部署失准监控。我们将模型对齐视为防止模型出现潜在失准行为的主要手段。然而,监控提供了对前沿模型行为的广泛可见性,揭示了进一步改进对齐与安全的机会。此外,监控还作为一层额外防护,针对已被检测到的失准行为。基于这些原因,我们额外将失准监控添加到了 Astra 外部部署中所有使用工具的推理环节,并为此付出了可观的计算成本。该系统与我们内部的设置相平行。

  5. **GPT‑6 Astra 的可监控性相对于 GPT‑5.6 Sol 有所下降。**我们对 GPT‑6 Astra 的可监控性和可控性进行了大量调查。我们发现,GPT‑6 Astra 比 GPT‑5.6 Sol 更有能力控制自己的 CoT,并且更不容易在其 CoT 中包含可作为罪证的信息。在对抗性设置下(即我们推动模型规避我们的监控器时),我们发现该模型能够在评估中策略性地表现不佳(即“装傻”)时保持不被发现,并且在被要求执行某些破坏任务时,有时能够规避我们的内部监控器。我们尚未看到隐写式 CoT 推理的证据(例如,将隐藏推理隐藏在普通且看似无关的文本中),这表明规避风险可能主要局限于较低级的推理任务。* 这些发现表明,Astra 级模型在对抗性条件下可能规避我们的 CoT 监控器。目前,这些发现主要基于对抗性评估(即我们指示模型规避监控时),而总体而言,我们的对齐评估显示,Astra 整体上比 GPT‑5.6 Sol 更不可能违反安全与安保限制。* 然而,我们严肃对待这一趋势,并且随着我们的模型能力不断增强,我们正在继续调查这些发现及其对可监控性的影响。OpenAI 一直致力于保留并利用思维链监控,而保留 CoT 可监控性是这项研究计划的核心目标。然而,这些结果也凸显了开发超越检查模型思维链的对齐审计技术的重要性。

  6. **GPT‑6 Astra 在浏览与办公场景中的行为更加负责任:**GPT‑6 Astra 对提示词注入的鲁棒性显著优于 GPT‑5.6 Sol。我们还额外测试了该模型在真实浏览环境和专业计算机环境中的行为,发现与 GPT‑5.6 Sol 相比,该模型执行失准且可能具有破坏性的操作(例如未经授权的交易、数据丢失、过度访问权限或规避管控)的可能性显著更低。在处理智能体场景中的有害请求时,例如协助策划暴力袭击或实施欺诈的请求,它的行为也更加安全。

  7. GPT‑6 Astra 在更高风险场景中显著更安全。 面对来自生产环境和对抗性人工红队测试的挑战性请求,GPT‑6 Astra 的响应比 GPT‑5.6 Sol 更安全。Astra 在安全完成不安全请求与避免对无害请求进行不必要拒绝之间实现了帕累托改进。这些改进同样延伸至高风险严重程度的场景,即危害风险源自更广泛的上下文而非明确的请求。Astra 还能对 18 岁以下用户更一致地应用适龄安全边界。

更多信息请参阅 完整系统卡⁠ 。

来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com

相关事件