OpenAI 在“关键网络能力”时代放缓模型开发节奏
Pacing model development in an era of cyber-critical capabilities
OpenAI 因 OpenAI-Hugging Face 事件及即将推出的 Astra 模型可能达到《预备框架》下的“关键网络安全能力”阈值,暂时放缓了模型扩展速度,包括暂停最新部署模型的强化学习训练两周,并搁置最大规模前沿 RL 运行。公司已加强研究环境安全,要求对 Astra 及网络相关负载实施最严格防护,并扩展思维链监控,采用多阶段激活分类器检测机制。
最高风险预警若 30 分钟内无法排除误报就暂停训练,安全证据与隔离迁移先于大规模 RL,前沿模型开发进度开始被安全工程效率约束。
过去几周内,两起事件凸显了与能力日益强大的 AI 系统相关的风险不断上升:OpenAI-Hugging Face 事件以及另一项初步证据表明,我们即将推出的模型之一 Astra 可能达到关键网络安全能力阈值,依据我们的Preparedness Framework。综合来看,这些进展,加上我们内部研究的快速推进,使我们加强训练过程各阶段监控、对齐与遏制保障措施的工作更添紧迫性。
随着模型能力不断增强,在其内部开发和测试所伴随的风险也随之上升。我们在监控、对齐和安全方面的标准必须始终领先于这些风险。我们希望能投入必要的时间来达到这些标准,因此我们暂时放缓了扩展的节奏。这包括对我们最新、计划用于部署的模型暂停强化学习(RL)训练两周,以便我们进一步加固研究环境、开展红队测试,并扩大监控系统的覆盖范围。我们规模最大的前沿 RL 训练计划仍处于暂停状态,与此同时,我们正在进行较小规模的训练和评估,以评估模型行为、验证我们的防护措施,并在继续推进之前积累更多对齐方面的证据。
对齐——即让 AI 系统按预期行事并响应人类监督的工作——长期以来一直是我们研究计划的核心。如今,我们要求在整个训练过程中提供更强的对齐行为证据,并以已在进行的相关研究和评估为基础。让能力日益强大的系统保持对齐,是整个领域都需要应对的挑战。我们从即将推出的模型进展中看到的信号清楚地表明,我们需要一种更广泛的方法——一种建立在当前 Preparedness Framework 之上并超越它的方法。
我们认为,对我们方法正在发生的变化保持透明非常重要。下面,我们描述已经对研究流程和基础设施所做的改变,以及仍在进行中的工作。
为能力更强的模型强化保障措施
我们开发能力更强模型的方法建立在三重相互强化的保障措施之上:
- 监控,用于检测令人担忧的行为并使我们能够对其作出响应。
- 对齐,用于降低有害或未经授权行为的可能性。
- 安全措施,用于限制 AI 系统可以访问或影响的范围。
我们预计,模型很快将承担大部分安全工作,包括防御其他模型。这将使全部三项保障措施都能随模型能力同步扩展,我们认为这一点至关重要。
我们在研究与部署中应用这些保障措施,并根据每个模型的能力、运行环境和风险水平加以调整。
保护我们的研究环境
随着前沿模型获得更强的网络安全能力,我们正在提高用于训练和评估这些模型的环境的安全标准。达到这些标准需要大量工程工作,并给前沿研究带来了巨大成本和延误。在 OpenAI-Hugging Face 事件*发生后,我们立即暂停了研究集群中前沿模型的推理,涉及那些可能执行代码或使用可访问互联网的工具的运行。我们很快恢复了一条更有限且更安全的代码执行路径,随后逐一梳理每个工作负载,以确定其能否安全恢复。部分研究工作负载在这些新管控措施下恢复了,另一些则需要额外调整。
在随后的几周里,我们已为前沿研究工作负载定义并开始实施更严格的安全要求。例如:
- 工作负载隔离:我们现在要求对执行模型生成代码或其他不可信代码的工作负载实施更强的隔离(“沙箱”)。这也适用于在处理模型输出时可能被攻陷的软件。
- 网络隔离:我们已实施更多控制措施,将高风险和不受信任的工作负载与互联网隔离。我们设计这些控制措施的目的是,即使某个工作负载或支撑服务被攻破,也不会仅凭这一点就允许未经授权访问互联网或其他内部网络。
- 持续安全测试:我们已重新配置环境,移除可能存在漏洞的共享服务,减少常设权限,并改进安全与信任边界。我们还在提升收集和监控安全日志的能力。最后,我们正在投资自动化,利用我们的模型针对模拟攻击持续测试这些边界。
这些控制措施共同提供了纵深防御,帮助保护我们的研究环境免受攻击。如今,我们对涉及 Astra 或网络模型的工作负载要求最严格级别的安全保障,因为我们已经确定 Astra 模型可能具备关键级别的网络能力。这些保障措施也适用于所有其他与网络相关的工作负载。
虽然部分 Astra 训练和评估符合这些要求,但仍有大量工作负载处于暂停状态,直到它们完成全面迁移和增强以满足新的安全标准。我们优先将安全与对齐相关的工作负载迁移到这些新环境。
扩展思维链监控
长期以来,监控一直是我们模型开发流程中的重要组成部分,包括针对内部编码智能体的监控以及长时间运行的会话。我们的监控工作尤其聚焦于前沿模型的内部部署和前沿强化学习训练运行,我们认为这些是风险最高的工作负载,因为它们可能将先进的模型能力与对工具、敏感系统以及内部或外部网络的访问权限结合在一起。这些监控并未应用于所有使用工具的推理和训练运行。我们通过新的监控设置修订并扩展了我们的方法。
这一新的监控设置是多阶段的,首先是在每个采样 token 上运行的激活分类器(检查模型内部活动的检测器),它们会将潜在问题上报给越来越复杂且高算力的自动化调查系统。这些系统会检查工具操作、可用的推理过程以及完整的活动序列,以发现未经授权的访问、数据窃取、破坏性行为以及试图绕过安全防护的行为。我们的目标是在监控系统发现可疑活动后 30 分钟内发出警报。如果监控系统识别出可能违反关键安全边界的情况,它会生成最高优先级警报。在我们当前的实现中,安全、安保和研究团队会收到呼叫。如果他们无法在 30 分钟内确凿判定该标记为误报,这些团队应暂停相关活动。
对于具备 Sol 能力或更高能力的模型,所有涉及工具的强化学习训练和评估都必须进行这种监控。8 月 7 日,当我们确定 Astra 可能具备关键网络能力后,我们为所有使用工具的 Astra 推理(而不仅仅是强化学习训练和评估)增加了额外的监控要求。
这些防护措施需要大量算力。我们目前的估算将监控开销定在约 20% 的被监控推理算力,不过这一成本在训练和评估工作负载之间差异很大。我们将在即将发布的一篇博客文章中分享有关该系统的更多细节。
推进对齐研究
对齐研究是我们使命的核心。我们的使命是确保通用人工智能造福全人类。随着模型获得诸如网络攻击能力等高级能力,并在更复杂的环境中运行,诸如奖励黑客(在训练中找到获得高奖励的方法,而实际上并未实现预期结果)、欺骗或未经授权访问等未对齐行为将带来日益严重的风险。
对于最强模型上的 RL 运行,我们现在将核心对齐技术应用于训练过程的更多阶段。这包括改进奖励模型,以更好地检测和抑制跨任务和环境的不安全行为;训练模型对其行为、能力和局限性更加诚实;以及减少利用奖励、评分器、工具或监督中弱点的行为。我们还在扩大训练覆盖范围,以应对模型与外部系统或资源交互时可能造成伤害的行为。
我们将继续大力投资对齐研究,扩大评估覆盖范围,并利用我们所学到的知识来指导训练和防护措施。我们计划在不久的将来分享更多关于我们对齐研究的内容,包括我们在模型行为方面的发现以及我们发现的任何新挑战。
接下来
我们将演进我们的 Preparedness Framework,把这些保障措施在训练和部署中整合起来,并更好地反映未来模型的能力及其运行环境。开发能够随这些能力扩展的方法,需要对模型辅助安全、更有效的监控以及对齐研究的持续进展进行持续投入。我们打算引入外部组织,并随着方法的演进分享更多我们所学到的内容。
前沿模型的能力正在迅速加速。我们理解、对齐并保障它们安全的能力必须保持领先。
*我们将在未来几周内发布一份关于我们所获经验的技术报告。
来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com