跳到正文
北京时间
原文
The Decoder:AI News(RSS)· Maximilian Schreiner·· 25 天前精选AI 评分78

GPT-6 Astra 基准表现分歧,ARC-AGI-3 效率超人类令 Chollet 提前 AGI 预测

Benchmarks disagree on GPT-6 Astra, but its human-beating efficiency on ARC-AGI-3 pulls Chollet’s AGI forecast forward

AI 导读

GPT-6 Astra 的基准结论相互矛盾:Epoch AI 以 169 分将其排在 267 个模型之首,Artificial Analysis 给出 61 分,仅与前代 Sol 持平、落后 Claude Fable 5.1 的 66 分。

推荐理由

原文汇总多家基准分歧数据并梳理 ARC-AGI-3 效率细节,读者可以借此理解 GPT-6 Astra 各项成绩的真实含义。

正文 · AI 翻译

Image description

OpenAI 的 GPT-6 Astra 正引发相互矛盾的基准评测结论。Epoch AI 将其排在首位,而 Artificial Analysis 则认为它并不比前代更好。最大的惊喜来自 ARC-AGI-3,Astra 首次比普通人更高效地完成任务。ARC Prize 负责人 François Chollet 称这一进展比他预期"快了 2 倍",并提前了他对 AGI 的预测。

两个独立实验室各自将数十项单独测试汇总为一个总分,却得出了相反的结论。Epoch AI综合了 50 多个基准,将 GPT-6 Astra以 169 分明确排在第一位,领先于 267 个模型。Artificial Analysis测试了知识、编程和文本理解,给 GPT-6 Astra 打出 61 分,恰好与其前代持平,落后于 Claude Fable 5.1 的 66 分。

Astra 明显比它自己的前代更贵。OpenAI 对每单位处理文本的收费是原来的两倍半,这使得一项任务的成本比使用 Sol 时高出约 75%。与 Anthropic 相比,情况则反转过来。根据 Artificial Analysis 的数据,在编程任务上 Astra 达到了与 Claude Fable 5 相同的分数,但每项任务的成本不到其一半。原因在于该模型有多么节省。它所需的计算步骤仅为 Sol 的三分之一,仅为 Opus 5 的五分之一。

基准 Astra Sol Fable 5.1 Opus 5
Epoch ECI,总分 169 162 163 162
AA Intelligence Index 61 61 66 63
ARC-AGI-3,陌生游戏世界 62.7% 7.8% 无数据 30.2%
ARC-AGI-2,抽象视觉谜题 95.0% 92.5% 90.0% 90.4%
ARC-AGI-1,旧版本 98.5%* 97.5% 97.5% 97.5%
FrontierMath Erdős,开放数学 3% 0% 0% 无数据

*GPT-6 Astra 在 xhigh 推理强度下;在 max 下达到 97.5%。ARC-AGI-1 现在被认为基本饱和。

在 Coding Agent Index 上,它以大约 Sol 三分之一 token 用量达到 67 分,而 Fable 5.1 以 70 分领先。AA-Omniscience 上的模型幻觉率从 92% 降至 51%。与此同时,该模型在 GDPval-AA v2 上损失约 80 Elo 分,并在银行支持、SciCode 和长上下文推理任务上有所下滑。

Epoch AI 报告称,在全新的 FrontierMath Erdős 上,GPT-6 Astra 是唯一一个解决了 68 个未解 Erdős 问题中两个的模型,并给出了经 Lean 验证的证明,每次尝试的预算为 300 美元。另外三个解答来自非标准化的额外运行,消耗了超过 220,000 美元的计算资源,但 Epoch 表示这些不计入得分。

细看 Epoch 的各项单独数据会发现,GPT-6 Astra 和竞争对手 Fable 5.1 目前是在不同的基础上被测量的。Astra 在数学、知识和谜题方面领先。Fable 5.1 则在几乎所有编程测试中占据最高分。但 Epoch 目前只为 Astra 记录了一项编程得分,而且那一次来自中等推理水平的运行。

ARC-AGI-3 显示出大幅跃升

最明显的跃升出现在 ARC-AGI-3 上。该测试将 AI 投入陌生的游戏世界,其中的规则和目标没有人向它解释。模型必须通过试错来弄清楚该做什么。GPT-6 Astra 达到了 62.7%,测试成本约为 26,000 美元。其前代 GPT-5.6 Sol 达到了 7.78%,竞争对手 Claude Opus 5 达到了 30.16%。Fable 5 和 Fable 5.1 尚未进入该基准测试。

OpenAI 报告的 99.9% 是在不同条件下取得的。在那种设置中,Astra 可以使用 OpenAI 构建的测试框架,该框架会在各个单独请求之间保留推理链,并自动对长时间运行进行摘要。根据 ARC Prize 的测量,在两种设置都解决的 167 个游戏推理配对上进行对比,这些运行的速度大约快了 3.66 倍,并且使用的 token 少了 49%。

这些测试框架的使用,以及随之而来的性能跃升,早已是 ARC Prize 与 OpenAI 之间围绕 GPT-5.6 Sol 的一个争议点。ARC Prize 指出,只有运行在内部 ARC 测试框架上的较低数值 62.7% 才允许在各厂商之间进行公平比较,不过该机构也计划在未来同样公布来自厂商测试框架的数值。

在这里,思考得越多,账单越低

思考投入与成本之间的关系很不寻常。通常,更高的推理等级会让一次测试运行变得更昂贵。而在 Astra 上,情况恰恰相反。在标准的 ARC 测试框架上,成本从无推理时的 $49,791 降至最高推理时的 $26,098,而得分则从 35.2% 攀升至 62.7%。据 ARC Prize 称,原因是 Astra 用更少的步数解开游戏,这意味着更少的模型调用和更少的 token。有一个反常之处格外引人注目:“低”等级的得分为 17.5%,比完全不做推理还要差。ARC Prize 没有对这一异常值发表评论,但 GPT-6 Astra 在其他基准测试中表明,得益于其新架构,它能够在不进行推理的情况下解决更长周期的任务,该架构大概会在生成第一个 token 之前进行内部循环处理。

作为对比,人类测试者每 90 分钟一场可获得 $115,外加每解开一个游戏 $5,因此按大约九次尝试计算,平均每个游戏约为 $12.78。但这主要支付的是时间和参与意愿。如果只把大脑的代谢能量折算为电费,ARC Prize 得出的结果是每个游戏 0.067 美分。

比原始分数更有意思的是效率。在发布之前,ARC Prize 让大约 500 名测试者进行了试玩,没有预先筛选,并记录了每个关卡中解出该关卡的测试者所用步数的中位数。在使用 OpenAI scaffold 的那次运行中,Astra 以少于该中位数的步数通关了 96% 的关卡,平均只用了一半多一点。与通常的成本指标不同,这个数字并不追踪所消耗的算力。它追踪的是模型在掌握一个环境之前需要多少该环境的经验。

这正是组织者原本预期人类会保持持久优势的地方。对于暴力破解方法而言,这一点仍然成立,但对于顶级模型,ARC Prize 看到的几乎是一种二元模式。一旦模型弄清了机制,其执行就落入了人类的效率区间。

Astra 发明了自己的记号

为了做到这一点,Astra 会保留自己的笔记,并摸索出一套自创的、类似代数的简写方式,用它来记录对象、坐标、规则和未完成的计划,例如将 extend8 to3; retract10 to2 作为有序的移动序列,或将 Turn 5: P=(24,20), empty, facing west 作为状态笔记。ARC Prize 在其他模型上也看到了类似行为,但特别指出 Astra 的精确性和信息密度。在标准测试框架上,这是一项重要技能,因为模型没有保存到自己可见笔记中的一切都会丢失。

ARC 联合创始人 François Chollet 在 X 上将其描述为“针对每个游戏和关卡的高效、即时符号世界建模”。该模型甚至发展到“开发出自己的简写 DSL 来表示游戏内情境”,其核心“本质上是一种针对特定游戏的代数记法”。对 Chollet 而言,最重要的是这种行为从何而来:“Astra 展现出的符号建模行为,我们此前只在复杂的 harness 中见过,因此 harness 的能力正日益转移到模型本身之中。”

Astra 构建了一个稠密、紧凑的符号世界模型,用以完成 ARC-AGI-3 环境。

例如,在环境 s5i5 中,Astra:

- 记录了当前关卡、枢纽朝向和机构长度:“L8: hub q2 (8↓). Lengths: 14=1…”

- 它将操作映射到精确的控制项:… pic.twitter.com/tMHP002mkB

— ARC Prize (@arcprize) 2026 年 9 月 3 日

第三个测试环境展示了 Astra 在外部工具辅助下所能达到的能力。PRO-LONG是一个由第三方开发的智能体框架,ARC Prize 团队在早期就将其部署为 ARC-AGI-3 的红队测试伙伴——也就是说,用来系统性地探索该基准的极限。与标准设置不同,该模型被提供了一个沙盒,可以在其中执行自己的代码。

Astra 利用了这一点,为每个游戏编写了小型程序库:游戏棋盘的解析器、状态模型、搜索算法和规划器。在一款有守卫的迷宫游戏中,寻路器、战斗规则模块、巡逻移动模型,以及一个持续将自己的预测与观察结果进行比对的脚本,被一个接一个地开发出来。ARC Prize 没有观察到任何试图逃离沙箱的行为。这些运行过程与人类测试条件不具可比性,因为测试对象既没有代码解释器,也没有记事本。这里所衡量的是模型与自建工具的综合表现。

Chollet:没有 AGI 的证明,但比预期更快

ARC Prize 明确表示不将这些结果解读为通用人工智能的证据。“到目前为止,我们对这个系统的全部了解就是它的基准测试分数,”Chollet 写道。当 ARC-AGI-3 发布时,他们在每一次演示中都强调了一点:“解决它并不能证明 AGI。它并非被设定为终点线。”尽管该基准测试确实检验了 AGI 系统所应具备的正确定性特征——即在不确定性下的探索、无指导下的适应,以及从稀疏数据中进行因果世界建模——但它是在“小规模”上进行的。这些游戏运行的时间尺度比现实世界任务短了几个数量级,因此所需的数据更少、建模复杂度更低、即时学习也更少。

大约六个月前 ARC-AGI-3 发布时,Chollet 在回答一个关于饱和的问题时曾表示“大约一年”,具体取决于针对该基准测试的方法有多专注。因此,Astra 的到来比预期“快了大约一倍”。“我相信进步的速度会让许多人感到惊讶,而新模型所具备的能力将挑战人们基于前几代模型所形成的对 AI 的认知。”当一位用户问他此前对 2030 年实现 AGI 的预测是否仍然成立时,Chollet 简洁地回答道:“会更早,因为进展比我预期的更快。”

结果是又一个基准测试。据 Chollet 称,ARC-AGI-4 自 ARC-AGI-3 发布以来就一直在开发中,计划于 2027 年第一季度发布。基准测试是一个持续演进的过程,与模型同步发展,并始终瞄准 AI 与人类智能之间尚存的差距。该组织认为 ARC-AGI-3 本身相当有限:确定性机制、封闭式目标,且无法表征开放的真实世界。下一代基准测试旨在探索递归自我改进和开放式创新等方向。

继续阅读以了解全貌。
订阅,获取不带炒作的报道。

  • 完整访问 THE DECODER 上的每一篇文章
  • 无广告
  • 加入评论和社区讨论
  • 每周通过邮件获取 AI 新闻摘要
  • 每年 6 次:“AI Radar”——深入探讨最重要的 AI 话题
  • 每日 AI 新闻,始终紧跟最新动态
  • 我们完整的十年存档
  • 由一支拥有 10 年以上 AI 经验的团队报道

来源:The Decoder:AI News(RSS) · the-decoder.com

相关事件