跳到正文
北京时间
原文
OpenAI:官网动态(RSS · 排除企业/客户案例)·· 23 天前精选AI 评分82

OpenAI 发布内部研究加速报告:已达成自动化研究实习生目标,推进 2028 年 3 月自动化 AI 研究员

Research acceleration: The view inside OpenAI

AI 导读

OpenAI 发文披露自动化研究进展,宣布已达成去年秋天设定的今年 9 月拥有自动化研究实习生(可在人类指导下完成耗时数天的明确研究任务)的目标,并计划在 2028 年 3 月前造出自动化 AI 研究员。

推荐理由

OpenAI 以内部数据披露 coding agent 对研究工作的实际影响和 RSI 进展,读者可以据此了解前沿实验室的自动化研究现状。

正文 · AI 翻译

为了让 AGI 造福全人类,我们相信它必须由民主方式治理。而这只有通过公众在充分知情的前提下,就高能力 AI 系统的能力、风险与防护措施展开辩论,才可能实现。各地的人们都需要理解前沿 AI 可能的未来走向,这样他们才能对其发展方式拥有有意义的发言权。

就具体风险、事件和防护措施保持透明是必要的,但并不充分。我们认为,公众还需要了解最强能力的系统正在如何发展,以及它们如何在前沿实验室内部推动研究进展。

我们的目标是安全地构建一个自动化 AI 研究员,它能够在人类监督下工作,以进一步推动深度学习和对齐方面的进展,从而实现迭代式改进。根据我们的衡量,我们如今已经达成了 去年秋天宣布⁠的目标,即在今年 9 月之前拥有一个自动化研究实习生。所谓“研究实习生”,我们指的是一个能够在人类指导下执行定义明确的研究任务的系统,包括那些一名熟练研究员需要几天才能完成的任务。我们正在朝着在 2028 年 3 月之前创建自动化 AI 研究员这一目标取得强劲进展。

在这一年里,OpenAI 研究人员的日常工作发生了显著变化。研究人员全天都在使用编程智能体(常常是并发会话),总使用量正在快速增长,增速超过了 OpenAI 其他团队。研究人员提交代码的速度更快,运行的实验也更多。研究人员使用智能体的方式也在改变:智能体正在处理越来越复杂的任务,并且成功完成这些任务的频率越来越高。AI 研究是一个复杂的过程,存在许多潜在的瓶颈,因此整体进展速度很可能不会与这些具体指标同步。但总体而言,这些发现与我们在内部许多人的更广泛印象一致:智能体工具正在切实加速研究进展。人们仍然设定我们的研究优先级,判断哪些想法和结果值得追求,并决定是扩大规模、暂停还是部署系统。

如果以负责任的方式推进,我们相信自动化 AI 研究将产出直接增进人类福祉、推进 OpenAI 使命的模型。它可以降低先进智能的成本,让全世界的人们都能受益。我们推进这项工作,部分原因是自动化研究可以帮助我们解决对齐问题,并构建针对能力日益强大的 AI 的防御措施。一个自动化的 AI 研究员也可以是一个自动化的安全或对齐研究员。能力更强、已对齐的系统可以帮助保护关键基础设施、防御危险的 AI 智能体,并开发新的防护措施。

这些都是开发有用的自动化研究能力的理由,但它们并不意味着快速 RSI 必然是我们应当追求的结果。是否推进以及如何推进,必须取决于我们保持人类控制的能力,以及关于收益与风险的知情民主选择。

我们目前尚不知道如何安全地一路实现对齐的、完全递归自我改进(RSI)。我们正努力在提升能力的同时,同步扩展对齐与安全措施。但我们不能假设对齐与安全方面的进展会跟上步伐,而能力更强的系统可能变得更难以监控。审慎的对齐与安全工作正是这项努力的核心,而它始于测量并缓解我们当下在智能体编程系统中看到的安全问题。一旦我们发现继续推进将带来不可接受的安全风险,我们将作出恰当回应,包括放缓或停止我们发现自己无法充分保障的系统的开发或部署。

在最近的 Hugging Face 事件之后,我们将这一承诺付诸行动⁠,暂停了针对我们最新待部署模型的强化学习(RL)训练,同时进一步加固我们的研究环境并对其进行红队测试,并扩大监控系统的覆盖范围。这并未中止所有研究:部分工作负载在更强的管控下恢复,另一些则仍处于暂停状态。我们提高了安全与对齐标准,并将安全工作推进到模型生命周期的更深处,要求在整个训练过程中提供更强有力的对齐行为证据。

今天,我们提供一份详细快照,展示近几个月来智能体系统如何推动了我们在 RSI 方向上的进展。智能体系统是新生事物且变化迅速,我们的测量工作仍处于初步阶段。通过分享这些早期结果及其背后的方法,我们旨在让公众知情、鼓励公开披露的规范,并帮助该领域走向共享的测量标准。

归根结底,正如我们在前沿政策蓝图⁠中所写,我们认为,我们和其他公司都应被要求公开追踪自身在 RSI 方面的进展。即便没有这样的要求,我们也计划继续对自身的 RSI 进展保持透明。随着我们的测量技术和理解不断进步,我们将不断改进透明化方式,同时兼顾保护安全和专有信息的需要。

1. 编程智能体正在重塑 OpenAI 研究人员的日常工作

今年年初,在 OpenAI 按智能体使用量排名的中位研究人员,使用编程智能体的量还相当有限。到 8 月中旬,中位研究人员已每天将智能体融入工作,按 API 价格计算,每天使用的推理量超过 $600。我们研究机构中第 90 百分位的用户,如今每天使用的 token 超过 $7,000。

在 2026 年 6 月之前,整个研究机构的智能体总运行时长仍低于人类劳动的总时长。此后情况发生了变化。按标准 8 小时工作日计算,截至 8 月中旬,整个研究机构合计每投入一个人类工作日,就会使用 3.1 个智能体工作日的算力。

换个角度来看,就是了解有多少研究人员使用高度并发的工作流(例如同时运行 4 个或更多智能体)。如下图所示,这一数字正在上升。这些数字既包括用户直接启动的智能体,也包括由用户直接启动的智能体下游派生出的子智能体,且均为每日峰值。

2. 研究人员正在编写更多代码、运行更多实验

人工智能研究在很大程度上可以看作是一个劳动密集型过程,目标是将某项对模型智能或性能的改进整合进我们的某个核心模型中。这一过程依赖许多步骤,只有当所有步骤都顺利协同推进时,能力才会提升:研究人员必须设计新的改进方案、编写评估来评判模型性能、编写基础设施以大规模测试这些改进、在训练过程中捕捉 bug 以及不安全或未对齐的行为,并将胜出的想法整合进一次核心训练运行中。研究过程中任何一环的失败都可能制约整个循环。

编写代码和运行实验是研究人员工作中两大主要活动,而我们看到了这些过程正在加速的证据。

这些数据点相对容易测量,但可能难以解读。随着自动化不断推进,最不容易被自动化的任务将在研究人员的工作投入中占据更大份额,并成为未来进展的重要瓶颈。算力是进展的另一个制约因素,并且随着其他瓶颈逐渐减弱,它可能随时间推移变得更加重要。

整个 2026 年,每位活跃实验者所进行的实验数量有所增加,其中 2026 年 8 月创下自 2025 年 1 月开始追踪以来的历史新高。这与 Codex 采用率的提升相关,不过我们注意到,自 2025 年以来我们可用的算力也大幅增长。

3. 研究人员使用智能体所做的工作正在发生变化

无论是定性印象还是内部数据都表明,研究人员委托给编程智能体的任务组合正在发生变化,随着时间推移,委托更高层次、更长周期任务的情况变得越来越普遍。

为了更清晰地了解这一趋势,我们使用 Epoch AI 开发的、近期发布的一套分类体系⁠,对研究组织近期的使用情况进行了分析。该分类体系受长期用于各类工作分类的 O*NET 系统启发,专门针对前沿 AI 研发而设计,将这一过程拆解为六个主要阶段:

  1. 决策:做什么、继续做什么、在哪里分配资源
  2. 设计:研究思路与工程规格
  3. 构建:代码与数据集
  4. 运行:训练/评估运行、硬件、服务
  5. 分析:实验、模型、部署、外部工作
  6. 沟通:发现、反馈、状态、决策

下面,我们按照这一分类体系对编程智能体的 token 进行分类。

我们看到,在 2026 年 1 月至 8 月期间,所有类别的研究活动都有所增加。1 月份,占主导地位的类别是研究与基础设施代码。这一类别有所扩大,但我们同时也看到其他类别显著增长,尤其是技术帮助和监控运行。高层规划在智能体输出 token 中仍然只占极小比例。

据同事们的经验反馈,编程智能体在排查内部研究基础设施问题方面表现出色,这解决了研究进展中一个重要的瓶颈。多个此前曾设立答疑时间以帮助研究人员排查实验问题的团队指出,2026 年参与人数有所下降,其中一个团队已完全停止举办答疑会,转而专注于其他系统改进。

在这里,我们绘制了研究人员向其他团队寻求技术支持的主要内部频道之一每天的顶层帖子数量。据我们所知,该频道活跃度的下降并未被转移到由人工运营的另一个技术支持频道的查询所抵消。流量的下降与这一更广泛的转变相一致。

我们还可以研究编程智能体是否成功完成了研究人员请求的任务。使用一个智能体分类器,我们发现从 1 月到 7 月,在我们可以找到真实结果的任务上,多个难度分桶(以人类完成任务所需的估计时间作为代理指标)的成功率总体上升。然而,智能体仍然需要大量人工引导才能成功,尤其是随着任务复杂度上升。在过去 6 个月中,超过一半成功完成的 4-8 小时任务涉及 1 次或多次人工干预。

研究员任务的成功率随时间推移有所提升。图表排除了结果不确定的分类,以及会话数少于 50 或独立用户数少于 50 的数据点。

1 月至 7 月的任务成功率与干预率,按时间跨度细分。排除了结果不确定的分类。

4. 把控模型开发节奏

朝着更强大、安全且有益的 AGI 系统迈进,也将取决于此类工作所需的防护措施。随着我们对风险的了解不断深入,我们对所需防护措施的评估也可能发生变化。

正如我们此前所述,我们近期更新了在监控、对齐和安全方面的标准。在此,我们展示近期的限制措施如何影响了研究活动的一个方面。

*此处显示的 7 月 20 日至 8 月 6 日期间的大部分 Astra 算力,旨在测试安全与安保改进措施的实施情况。

7 月 20 日,在发现智能体入侵了我们的研究基础设施后,我们暂时关闭了用于训练的容器服务,随后在施加了大量额外限制的情况下将其恢复。

这导致 RL 训练算力急剧下降,同时各团队重新调整工作流程,以在加固后的研究环境中运作。上图包含了我们最新待部署模型上为期两周的强化学习暂停期。7 月 20 日至 8 月 6 日期间的 Astra 级 RL 实验,按 GPU 分配计,包含了大多数旨在测试安全与安保改进措施实施情况的运行。

8 月 7 日,初步证据表明 Astra 可能具备关键网络能力⁠,根据我们的 Preparedness Framework⁠ ,这引发了额外的针对特定模型的安全限制,要求 Astra 模型必须在安全性更高的研究环境中运行。在接下来的一周里,Astra 级 GPU 分配进一步下降了 59.2%,但其他模型类别的分配上升了 17.2%。这一增长抵消了 Astra 级下降的约 85%,使得所分析的 RL 工作负载总分配量基本保持不变。这一模式与部分训练和实验被替换为非 Astra 模型的情况一致,同时涉及 Astra 的工作受到限制,也与研究人员为不再能用于新约束所涵盖工作负载的算力寻找其他用途的零星报告相符。

这些数据为当前关于训练与安全的讨论提供了一个有用的信号:当引入新的管控措施时,算力仍然有价值且灵活,会自然地被引导到研究机构内的其他用途。从更长远来看,关于 AI 进展速度的讨论也应延伸到这样一个问题:受新管控措施或拟议管控措施约束的算力,如何才能得到最佳利用。

5. 前路

在实现对齐的 RSI 方面取得并理解进展,对我们的使命至关重要。我们将继续完善我们的方法,报告我们不断演进的理解,并致力于推动知情的公众讨论以及对前沿系统有意义的民主治理。

附录:本文所采用的方法

由智能体驱动的 AI 研究仍属新生事物,我们仍在学习如何衡量它。有些指标,例如我们的研究团队生成的代码量,相对容易收集,但难以解读,因为它们与研究进展之间的关系并不确定。更直接聚焦于研究进展的指标——例如智能体在研究人员交给它们的任务上成功的频率——可能更有用,但开发和验证起来都很复杂。更添难度的是,研究人员所依赖的工具和系统正在快速演进。加深我们对研究加速的理解,是 OpenAI 全公司的一个重要重点领域。

在以上这些分析中,除非另有说明:

  • “研究人员”是一个宽泛的称谓,指我们研究组织的任何成员,包括一些构建研究基础设施、管理研究项目或以其他方式为这项事业提供支持的人。

  • 鉴于研究人员所依赖的工具和系统快速演进,编码智能体使用情况的指标覆盖了大部分使用情况,但并非全部。

  • 2026

  • 经济研究

来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com

相关事件