跳到正文
北京时间
原文
OpenAI:官网动态(RSS · 排除企业/客户案例)·· 23 天前精选AI 评分72

OpenAI 长文阐述对齐与监测困境,称 CoT 监控能力正在减弱

An Alien Mind

AI 导读

OpenAI 发布长文《An Alien Mind》,回溯 2023 年 RLSlow 项目中确认推理模型可扩展训练的起点,并系统阐述目标对齐与价值对齐的区分。文章指出链式思维监控的效果正随着模型能力提升而逐步减弱,GPT‑6 Astra 在对齐上显著优于 GPT‑5.6 Sol;作者预期进展可能持续走向机器递归自我改进(RSI),呼吁自愿放缓扩展、建立第三方安全门槛并加强国际协调。

推荐理由

作者以内部视角回溯推理模型的起源,并给出对齐监测、CoT 监控弱化和 RSI 风险的一手判断。

正文 · AI 翻译

2023 年年中,在“RLSlow”研究项目中,我们看到了首批成果,这让我们有信心能够扩展推理模型的训练规模,释放预训练模型形成自身思维链的能力。那天晚上,Szymon 和我留在办公室里,思考的不是这项技术将带来的惊人基准分数、产品或科学成果,而是在消化一个令人清醒的事实——我们有生之年真的会看到比我们聪明得多的机器,而且我们已经看到了这些系统的雏形;我们也在思索,该如何提醒人们认识到这件事的重大意义。

三年后,推理语言模型已成为经济中快速增长的组成部分,并开始拓展科学的边界。它们能够操作计算机和图形界面,与人类及彼此协作,还能开展研究项目。它们也在改变计算机安全的格局,并由此带来了显而易见的新危险。

这一时期涌现了大量新研究,我们对这些系统的理解也与 2023 年时又有了些许不同。基于内部结果,我强烈预期这种进步速度能够持续下去,直至实现递归式自我改进。如果 AI 的发展沿着当前路径继续,未来几年我们看到的系统很可能代表着同等或更大规模的能力跃升,并且越来越由它们自身驱动自身的发展。

这是一个需要极度谨慎的时刻。我担心没有人对机器智能持续快速攀升所带来的后果做好了准备。OpenAI 将继续寻求对齐与监控方面的技术解决方案,构建防御性系统,并在必要时单方面暂缓进一步的规模扩展;但我认为,需要更广泛的干预措施。

我们尚未完全理解的智能

从宏观层面看,机器智能的进步是由不断增强的计算能力驱动的。我们 OpenAI 大约在 2017 年深刻领悟到这一点,当时我们在多个研究项目中持续看到了规模扩展带来的稳定回报1。因此,我们寻求获取比最初计划多得多的算力,并越来越将研究聚焦于少数几个极具可扩展性的方向。我们相信,这是让我们站在 AI 研究前沿并影响 AGI 影响的唯一途径。

在这一过程中,出现了许多新算法,也涌现出团队和个体研究者的诸多巧思创举。在我看来,这些在很大程度上是规模扩展道路上的发现;深度学习科学仍处于萌芽阶段,而有意义的算法进展往往与算力的可获得性相关。如果你把视野拉长到数年的跨度,随着 AI 被扩展到更大的计算机上,它正持续变得更加智能。

而且,与 Ray Kurzweil 在二十世纪末的预测 相呼应,我们现在正处在计算史上这样一个时刻:机器智能开始以变革性的方式超越人类智能。

AI 更多是生长出来的,而非设计出来的——它在第一层级上,就是在难以想象的算力规模上反复执行一个简单优化步骤的产物。这造就了一个极其复杂的系统,它通过抽象概念运作,并能模拟人类行为的诸多侧面。我们可以像神经科学那样,去发现这个系统内部涌现出的各种微小机制背后的洞见——而且与神经科学类似,它的整体运作方式也超出了我们能够完全理解的描述范畴。

基于深度学习的 AI 研究在很大程度上是一门实验科学。我们投入了大量精力⁠去构建有原理依据的算法、做出可检验的预测,但从根本上说,我们的大规模训练运行就是实验,有时结果会让我们感到意外。而且,随着系统能力越来越强,结果也变得越来越难以解读。

当前的算法通常让易于衡量的能力提升速度快于那些难以客观量化的能力,这让问题变得更加复杂。我们花费大量时间试图理解能力如何泛化,以及应当优先推进哪些技能,才能在接下来几年里最具相关性。例如,我们相信只要加大投入,就能让模型在专门的数学研究上表现更好,但我们并没有把这一方向列为优先,因为我们对 RSI 和自动化对齐研究感到紧迫,这一点我稍后会谈到。

通过扩展深度学习所产生的智能,并不能直接与人类智能相提并论。要想在现实世界中变得非常重要——极其有用或极其危险——AI 并不需要匹配或超越人类的全部能力;它只需要在足够多的方面超越人类即可。而随着它在越来越多的维度上持续超越人类,要准确理解它的能力究竟有多强,正变得越来越困难。

教会机器去爱

由于机器智能源自与人类智能根本不同的过程,我们不能默认它会遵循人类的原则,也不能默认它会以类似人类的方式从这些原则中泛化。AI 研究的核心问题在于 对齐——让 AI“按照人类的标准去尝试做正确的事”。

为了组织起实用的研究方向,我认为有必要区分 目标对齐 与 价值对齐。

目标对齐大致是指:“AI 是否会努力完成摆在它面前的目标?”这可以包括对 指令层级⁠ 的遵循,或者与人沟通协作、尝试理解对方目标的能力。这一系列方向在实践层面一直极具相关性。

价值对齐是模型一种更内在的属性。它是指模型能够持有并从一套高层次原则中进行泛化的能力;即使在目标不清晰或相互冲突、或身处陌生乃至对抗性情境时,也能表现得“合乎情理”。一个对齐的 AI 应当以诚实、正直以及对人类的热爱来行事。

当然,价值对齐与目标对齐之间的界限可能很模糊,而真正在乎目标,就需要尝试去推断目标背后所蕴含的意图⁠ 与价值观。不过,通常当我谈到对齐研究的长期重要性时,我指的是价值对齐。

AI 对齐的根本挑战在于泛化。随着机器变得越来越聪明,它们所处理的概念层次越来越高,所处的环境也与训练时遇到的环境差异越来越大。它们可能无法将从训练过程中习得并被强化的价值观泛化到这些新情境中;而我们也很难确定它们会如何行事。这一点因 AI 所处的整体生态系统变化极快而变得更加困难;例如,如今训练的 AI 需要能够稳健地与其他各种 AI 进行交互。至关重要的是,无论未来的 AI 是否认为自己处于人类监督之下,我们都希望它们能继续秉持人类价值观。

目前实际用于对齐训练的实践方法主要有两大类。

第一种是在目标导向的强化学习中鼓励对齐行为。模型的行为会被评估(通常由 AI 进行),判断其是否符合给定的偏好模型、“规格”或“宪法”,并给予相应的奖励。这种方法在平均情况下可能非常有效,也是现代 AI 助手构建方式的核心组成部分。遗憾的是,它也可能很脆弱,并且在很大程度上依赖于训练监督的覆盖范围以及模型从训练中遇到的情境进行泛化的能力。例如,在 OpenAI-Hugging Face 事件中,智能体遵守了不对人类进行社会工程攻击的边界。然而,它们显然未能避免其他超出范围、违背了它们在其他环境中被教导的价值观精神的行为。

第二种方法旨在利用模型从预训练数据中泛化的能力。这可能涉及精心设计诱导对齐的训练数据集,或者将模型聚焦于预训练分布中的“对齐”部分,例如 人格选择模型⁠ 。这种方法的弱点在于缺乏对进一步优化压力的鲁棒性。如果你让一个模型总体上思考“对齐”的想法,然后让它接受足够的训练,教它实现非常困难的目标,它可能会学会以一种动机化的方式进行推理:根据需要扭曲那些“看似对齐”的想法来实现目标。我们可能在最近涉及非 OpenAI 模型的网络安全事件中看到了此类行为的一个例子。

我们在这些方向所涵盖的各类方法上投入了大量资源。我们也看到了有意义的进展——GPT‑6 Astra 是首个受益于我们长期推进的若干重要进步的模型,并且其对齐程度显著优于 GPT‑5.6 Sol。尽管如此,仍须承认并理解:随着模型能力不断增强,还需要取得更多进展;而且,可泛化的对齐方面的进展,未必能充分跑赢通用模型智能方面的进展。

监控泛化

我们目前还没有一套令人满意的泛化理论,而且至少在更强大的 AI 的帮助下之前,短期内似乎也不太可能发展出这样一套理论。因此,就目前而言,我们以经验方式验证对齐技术的能力,实际上可以说比对齐技术本身更为重要。

OpenAI 在此方面的主要押注是 思维链监控⁠ 。其基础是一个颇具吸引力的可扩展思路:模型的很大一部分能力来自一种语言化的推理过程(思维链)。如果我们对该过程的结果进行规模化优化,却不对过程本身加以监督,那么思维链在训练中就没有直接动机去隐藏任何不对齐的想法或目标。这并不意味着模型会学会外化那些不依赖思维链的不对齐倾向;但它可以让我们精确监控来自推理的能力增长。

我们在开发推理模型的同时,也认识到了思维链监控的潜在重要意义。当我们发布 o1‑preview 时,我们刻意将产品设计为隐藏思维链⁠,以长期保护其免受监督压力影响2。此后在开发过程中,我们一直努力坚持不监督推理过程这一原则。思维链监控成为我们研究模型如何从训练分布中泛化的重要工具,使我们不仅能够观察和分析模型的行为,还能洞察其内部过程。

在我们研究 Astra 类模型时,这一工具仍然至关重要。然而遗憾的是,我们的评估表明,我们对思维链监控的依赖能力正在逐步减弱。这源于多种因素的共同作用。

  • 现代推理模型所运行的环境比 o1‑preview 时代更为复杂;它们的推理过程越来越多地与人类交流、与其他 AI 交互以及使用工具等行为交织在一起。其中许多交互必须受到监督,这便模糊了我们原本力求保持的边界。
  • AI 正在变得更擅长对其自身的推理过程进行推理和操控。
  • 随着预训练性能的提升,我们也看到模型即使完全不使用显式推理,也变得更加智能。

这些挑战并非不可逾越。我希望我们能够开发出一些干预手段,来提升我们模型思维链的可监控性,例如更深入地理解不同优化目标与模型所使用的各类测试时计算形式之间的相互作用。我也相信,将思维链与激活监控的思路结合起来可能具有巨大价值——即规模化训练能够直接访问网络内部的监控器,例如 confessions⁠ 。我们正在积极推进这些想法。尽管如此,我预计通用 AI 的进展将越来越受制于对监控的信心。

可扩展的防御

我认为继续快速训练更智能的模型最有力的理由是,我们需要构建防御体系来应对其他 AI 所带来的危险。

今年全年都在讨论的一个明显风险是网络安全:模型在攻入和突破计算机系统方面的能力正变得超越人类。这极大地扩展了 AI 相关风险的范围:智能体将能够访问除最安全基础设施以外的任何系统,并直接影响到世界上的许多事物,即便它们没有物理实体。我们目前正处于一个 狭窄的时间窗口⁠,可以利用现有最好的模型来 显著加强关键系统的安全性⁠。

与 AI 相关的风险,遗憾的是,只会从今往后不断加剧。一个能力极强的智能体,若被明确训练并指示去实施邪恶行为,将带来一种全新的危险;它很可能会超出其操作者的意图范围,泛化出潜在更加极端恶意的行为。随着 AI 获得更强的自主性,滥用与自主性失准行为之间的界限将日益模糊。我们或许习惯于将 AI 视为工具,但某些智能体将追求它们自己的目标。它们会找到与人类协作的方式——通过讨价还价、欺骗,甚至敲诈勒索。

此外,还有一类风险来自 AI 可能催生的新技术,例如工程病原体。

我们将需要强大且对齐的 AI 用于防御:保护基础设施,实时抵御恶意智能体,并发明全新的防护措施。这将是 OpenAI 部署工作的首要重点。

与此同时,即便考虑到 AI 广泛进步所带来的不确定性以及构建防御体系的必要性,我们也绝不能让其成为鲁莽行事的借口。一旦真正意识到事态的严重性,那种不惜一切代价向前冲刺的想法就显得荒谬可笑。

为 RSI 设定节奏

机器智能在其自身发展过程中扮演越来越重要的角色,是持续技术进步的自然结果。如果 AI 进步持续下去,机器递归式自我改进(RSI)将成为未来科学发现的核心。

自动化 AI 研究是以算力扩展智能的一种更为激进的形式;当然,作为其中的一部分,AI 也将改进计算基座本身⁠。与扩展算力同理,我们将 OpenAI 的研究聚焦于 RSI,因为我们相信这是未来保持在 AI 研究前沿的唯一途径。

我想强调,以上表述并不意味着我认为大幅加速深度学习研究——尤其是在短期内——是我们作为研究社区应当采取的集体行动。不过,我确实认为当前路径正指向这个方向,而我们都需要对如何推进做出有意识的选择。我们拥有的主要杠杆要么是引导这一进程,在 AI 发展的同时强化对齐与监控,并找到让人类始终参与其中的方式;要么是通过协调来按需放缓未来发展,以便对这些措施建立信心。

我目前看到的最佳前进路径是两者结合。

我们在对齐与监控方面取得的具体进展,通常与通用 AI 进展紧密交织在一起。典型的例子包括基于人类反馈的强化学习⁠ ,它对训练早期 AI 助手至关重要;以及前面提到的思维链监控⁠ ,它得益于推理模型方面的进步。我们必须让日益自动化的研究过程聚焦于开发此类新的洞见、算法和理论,并针对能力更强的 AI 迭代构建安全论证。

AI 系统的规模化扩展必须受到我们对安全信心的约束。我们需要将诸如 预备框架⁠ 或 负责任扩展政策⁠ 之类的承诺,演进为广泛强制要求的安全底线,以支撑持续开发。这些底线可以通过第三方审计机构网络、政府机构或国际组织来执行。

自动化 AI 研究的核心挑战不在于“抵达终点”——而在于以一种让人类始终参与持续改进过程、并把未来留在人类手中的方式抵达终点。

接下来是什么?

正如 我们最近与 Sam 一起概述的⁠,OpenAI 将工作优先聚焦于三大北极星目标:

  1. 通过构建自动化 AI 研究员,与其一同迭代解决对齐问题,并寻找让人类继续留在自我改进循环中的方式,从而驾驭 AI 进步的下一阶段。
  2. 交付极其智能的机器所带来的科学进步与经济增长红利。
  3. 让每个人都能拥有属于自己的个人 AGI。

在这篇文章中,我只聚焦于第一点,因为我认为它是最为紧迫的。然而,我对进一步技术进步将带来的益处抱有深切的希望与感激。未来的对齐 AI 可以推动科学发展、开发新疗法,并带来广泛的物质丰裕。友好而诚实的 AI 能够帮助人们应对生活中面临的困难,切实提升他们的幸福感与成就感。OpenAI 投入了大量精力来实现这些益处。目前一个令我自豪——并且我的亲友们也觉得有帮助——的例子,是对 ChatGPT 提供健康信息能力的深度投入。

尽管 AI 的长期前景可能十分美好,但我们的大部分关注点应放在未来几年。我们正面临向一个拥有极其智能机器的世界的转型,我们需要确保这一转型对人类有益。我们需要找到方法,在一个大多数任务都可能由 AI 完成的世界里,保留人类的主体性,并确立作为人类的内在价值。要防止权力的极端集中——在一个原本需要数千名专家才能完成的事业,如今只需少数人操作一台大型计算机即可实现的世界里。还要确保人类始终掌控未来,不被一种超越我们自身的异质智能所带来的失控进步抛在身后。

目前我认为,还没有任何实验室在对齐与监控方面达到足够的成熟度,能够以最大速度继续负责任地扩展更长时间。我期待并希望,在共同的安全标准确立之前,自愿放缓将成为常态。我还认为,围绕未来 AI 发展的国际协调,必须成为世界各国政府的首要优先事项。

脚注

  1. 1 这包括扩展 自我对弈⁠ 、机器人技术⁠ ,以及事后看来最为重要的 将循环网络扩展到语言建模⁠ ,后者是 GPT 研究路线的先驱。
  2. 2 这种设计的另一个次要原因是防止知识蒸馏。然而,在整个开发过程中,保持 CoT 的可监控性始终是我们更优先考虑的事项。

来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com

相关事件