跳到正文
北京时间
原文
OpenAI:官网动态(RSS · 排除企业/客户案例)·· 2026-07-29精选AI 评分68

启用两项 API 设置使 GPT-5.6 在 ARC-AGI-3 基准测试得分提升三倍

How enabling two settings tripled our scores on the ARC-AGI-3 benchmark

AI 导读

OpenAI 通过启用两项 API 设置,使 GPT-5.6 在 ARC-AGI-3 基准测试上的得分提升至原来的三倍。这两项设置分别是保留推理过程(retaining reasoning)和启用压缩(compaction),在提升得分的同时也提高了效率。该发现基于 OpenAI 官方对 GPT-5.6 模型 API 参数的测试结果。

推荐理由

OpenAI 自己公布两个设置让 GPT-5.6 的 ARC-AGI-3 成绩翻三倍,对用 API 做推理任务的人是即用的技巧,不过目前只给了摘要,具体参数得等全文。

正文 · AI 翻译

一段加速播放的视频,展示 GPT‑5.6 Sol 尝试在 ARC-AGI-3 基准测试中解谜,左侧为官方测试框架,右侧为我们的 Responses API 测试框架,后者保留推理过程并启用压缩。在_这款游戏_⁠ 的排行榜上,没有任何前沿模型能解开第一关之后的任何关卡。而使用我们的测试框架,GPT‑5.6 Sol 解开了全部六关。

当我们第一次看到 GPT‑5.6 Sol 在 ARC-AGI-3⁠ 基准测试上得分如此之低时,我们感到困惑。

GPT‑5.6 Sol 已经解决了数学领域长期悬而未决的开放问题,例如循环双覆盖猜想⁠ ,还通关了《宝可梦 火红》等游戏。但在 ARC-AGI-3 这个 2D 解谜游戏基准测试上,GPT‑5.6 Sol 仅得分 7.8%,而 GPT‑5.5 几乎完全无法玩这些游戏,仅得到可怜的 0.4%。

是 2D 解谜游戏对我们的模型来说格外困难?还是另有原因?

基准测试很少孤立地衡量 AI 模型。它们同时也在衡量那些不太显眼的关于 API 设置、测试框架设计和提示词的选择。就 ARC-AGI-3 而言,我们发现开启我们在 ChatGPT 和 Codex 中使用的两项 API 设置——保留推理和压缩——使分数提升至三倍,并在公开任务集上将输出 token 减少了 6 倍。

GPT-5.6 Sol 在 ARC-AGI-3 公开集上的表现

在官方测试框架下,GPT‑5.6 Sol 在 ARC-AGI-3 公开集上得分 13.3%。在保留推理与压缩机制的情况下,得分达到 38.3%。分数衡量的是相对人类行动效率(_RHAE_⁠ )——这一指标将模型表现与人类基线进行对比。基于_官方游玩日志_⁠ ,我们估计人类测试者的平均得分为 48%。模型不会被告知将如何被评分,也无法在过程中看到自己的分数——动作只会返回每一帧的文本表示以及当前所处的关卡。

ARC-AGI-3

ARC-AGI-3 是一个旨在衡量 AI 智能体学习与推理能力的基准测试。智能体需要探索陌生的 2D 游戏,并在没有明确指令的情况下推断其运作方式。你可以在 arcprize.org/tasks⁠ 上试玩 25 款演示游戏。

ARC-AGI-3 使用了一套刻意保持通用的测试框架,不包含任何工具或特殊功能。ARC 的理由是,简单的框架能让模型的短板更加显而易见,也让模型之间的比较更加公平。相比之下,商业开发者会针对每个模型的特性和怪癖来优化其测试框架。

在游戏领域,GPT‑5.6 Sol 已凭借纯视觉框架击败了《宝可梦 火红》(由 GPT_Plays_Pokemon⁠ 直播),借助 Codex 的计算机使用能力通关了《杀戮尖塔》(由 EpochAI⁠ 直播),并打过了《Baba Is You》的前几个关卡(由 Piotr Migdał 与 Piotr Grabowski⁠ 分享)。那么 ARC-AGI-3 究竟有何不同?

Image 1: GPT-5.6 Sol in Codex completing a randomized daily challenge in Slay the Spire 2.

Ethan Mollick_展示_⁠ GPT‑5.6 Sol 在 Codex 中击败了《杀戮尖塔 2》的随机每日挑战,而这款游戏是在 GPT‑5.6 Sol 的知识截止日期之后才发布的。

受 ARC 对 GPT‑5.5 缺陷的分析⁠ 启发,我们查看了 GPT‑5.6 Sol 的一些尝试。与 ARC 一样,我们发现该模型看起来并不太聪明。它在每个动作上都徘徊良久,难以取得进展。

但当我们深入观察后,我们发现模型的许多困惑并非源于模型本身,而是由框架中的设置造成的。

首先,我们注意到每次游戏动作之后,所有私有推理内容都被丢弃了。这意味着每执行一个动作,GPT‑5.6 Sol 都被要求重新理解游戏,无法记住自己过去的思考。模型仍然可以看到过往动作的记录和简短的附带笔记,但它看不到导致这些动作的计划、洞察或想法。

第二,我们发现该测试框架使用了一个滚动截断窗口,随着历史记录不断增长,较早的操作会变得不可见。因此,GPT‑5.6 Sol 不仅无法记住自己过去的思考,还在逐渐丢失对过去操作的记忆。

综合来看,该测试框架的这两个特性——丢弃推理内容和滚动截断——有助于解释为什么 GPT‑5.6 Sol 难以随时间推移进行学习。

智能体在记住自己做过什么时表现最佳

我们的模型经过训练,会在输出回复或工具调用之前,先通过私有的推理消息进行思考。这些私有的思考消息会作为对话历史的一部分被保留。如果对话变得过长,我们会对其进行摘要并继续。

Image 2: Diagram showing how model reasoning, tool calls, conversation history, and context compaction work together across a long-running task.

这就是我们模型训练的方式,也是它们在 ChatGPT 和 Codex 中部署的方式。为了更好地匹配我们的生产环境配置,我们使用 Responses API⁠ 实现了 ARC-AGI-3 测试框架。我们的 API 让上下文管理变得简单:对于 GPT‑5.6,传入上一个响应 ID 即可在工具调用和对话轮次之间自动保留推理内容。

在保留推理内容后,我们注意到两个重大变化。第一,GPT‑5.6 Sol 在每次行动前花在思考上的时间减少了,因为它不再需要每一轮都从头理解游戏。第二,当它能够记住自己过去的想法时,GPT‑5.6 Sol 在随时间学习和采用连贯策略方面表现得好了很多。

下一项改进来自用 compaction⁠ 取代滚动截断,这是 Responses API 中的另一项设置。

ARC-AGI-3 测试框架通过滚动截断来应对上下文限制。当对话上下文超过 175,000 个字符时,最早的消息会被丢弃。

滚动截断有两个缺点。第一,模型会丢失早期的观察和动作。第二,它在大部分任务中都要在上下文窗口更满的状态下运行,这可能会略微损害性能。

当我们在 ARC-AGI-3 上启用 compaction 后,GPT‑5.6 Sol 能够更好地在更长的运行中保留它对每个游戏所学到的内容,并以更少的输出 token 取得更高的分数。

为了说明保留推理内容和启用 compaction 的效果,这里有一段动画,展示了 GPT‑5.6 Sol 的 175K 上下文窗口在使用每种测试框架解决一系列 ARC-AGI-3 谜题时的表现。

中间两列展示了每种测试框架对模型上下文窗口的使用方式有何不同。凭借对其过往更好的记忆,GPT‑5.6 Sol 在每个动作上的思考更少,推进速度快得多。注意:我们的实现使用的是 175,000 个 token 而非字符的限制,但结果相当接近,因为绝大多数文本都是动作网格,而我们的 tokenizer 以 1:1 的比例对其进行 token 化。

保留推理内容与 compaction 相结合,使 GPT‑5.6 Sol(max)以少 6 倍的输出 token 取得了约 3 倍的分数。

结论与建议

我们希望这些实验能提醒大家:评测很少是在孤立状态下衡量模型——它们同时也在衡量一系列不那么显眼的选择,涉及 API 设置、评测框架设计和提示词。这并非我们第一次在某个公开基准上被低分惊到,随后却发现评测运行器使用的是一个通用框架,丢掉了推理消息。

如果你是希望最大化性能的 API 开发者,我们建议使用我们在自家产品中部署的相同设置:

  • 使用我们的 Responses API,而不是旧版的 Chat Completions API
  • 保留推理
  • 使用压缩

如果你要比较模型,我们建议依赖使用上述设置的评测,因为这些设置最贴近 ChatGPT 和 Codex 中的真实使用场景。

我们感谢 ARC 多年来在 AGI 评测上的创造性工作,也感谢他们的分析促使我们在此做更深入的审视。

如果你想亲自检验自己对抗前沿模型的实力,可以到 arcprize.org/tasks⁠ 上试玩这些公开游戏。

来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com