GPT-6 Astra 基准表现分歧,ARC-AGI-3 效率超人类令 Chollet 提前 AGI 预测
Benchmarks disagree on GPT-6 Astra, but its human-beating efficiency on ARC-AGI-3 pulls Chollet’s AGI forecast forward
GPT-6 Astra 的基准结论相互矛盾:Epoch AI 以 169 分将其排在 267 个模型之首,Artificial Analysis 给出 61 分,仅与前代 Sol 持平、落后 Claude Fable 5.1 的 66 分。
原文汇总多家基准分歧数据并梳理 ARC-AGI-3 效率细节,读者可以借此理解 GPT-6 Astra 各项成绩的真实含义。

OpenAI 的 GPT-6 Astra 正引发相互矛盾的基准评测结论。Epoch AI 将其排在首位,而 Artificial Analysis 则认为它并不比前代更好。最大的惊喜来自 ARC-AGI-3,Astra 首次比普通人更高效地完成任务。ARC Prize 负责人 François Chollet 称这一进展比他预期"快了 2 倍",并提前了他对 AGI 的预测。
两个独立实验室各自将数十项单独测试汇总为一个总分,却得出了相反的结论。Epoch AI综合了 50 多个基准,将 GPT-6 Astra以 169 分明确排在第一位,领先于 267 个模型。Artificial Analysis测试了知识、编程和文本理解,给 GPT-6 Astra 打出 61 分,恰好与其前代持平,落后于 Claude Fable 5.1 的 66 分。
Astra 明显比它自己的前代更贵。OpenAI 对每单位处理文本的收费是原来的两倍半,这使得一项任务的成本比使用 Sol 时高出约 75%。与 Anthropic 相比,情况则反转过来。根据 Artificial Analysis 的数据,在编程任务上 Astra 达到了与 Claude Fable 5 相同的分数,但每项任务的成本不到其一半。原因在于该模型有多么节省。它所需的计算步骤仅为 Sol 的三分之一,仅为 Opus 5 的五分之一。
| 基准 | Astra | Sol | Fable 5.1 | Opus 5 |
|---|---|---|---|---|
| Epoch ECI,总分 | 169 | 162 | 163 | 162 |
| AA Intelligence Index | 61 | 61 | 66 | 63 |
| ARC-AGI-3,陌生游戏世界 | 62.7% | 7.8% | 无数据 | 30.2% |
| ARC-AGI-2,抽象视觉谜题 | 95.0% | 92.5% | 90.0% | 90.4% |
| ARC-AGI-1,旧版本 | 98.5%* | 97.5% | 97.5% | 97.5% |
| FrontierMath Erdős,开放数学 | 3% | 0% | 0% | 无数据 |
*GPT-6 Astra 在 xhigh 推理强度下;在 max 下达到 97.5%。ARC-AGI-1 现在被认为基本饱和。
在 Coding Agent Index 上,它以大约 Sol 三分之一 token 用量达到 67 分,而 Fable 5.1 以 70 分领先。AA-Omniscience 上的模型幻觉率从 92% 降至 51%。与此同时,该模型在 GDPval-AA v2 上损失约 80 Elo 分,并在银行支持、SciCode 和长上下文推理任务上有所下滑。
Epoch AI 报告称,在全新的 FrontierMath Erdős 上,GPT-6 Astra 是唯一一个解决了 68 个未解 Erdős 问题中两个的模型,并给出了经 Lean 验证的证明,每次尝试的预算为 300 美元。另外三个解答来自非标准化的额外运行,消耗了超过 220,000 美元的计算资源,但 Epoch 表示这些不计入得分。
细看 Epoch 的各项单独数据会发现,GPT-6 Astra 和竞争对手 Fable 5.1 目前是在不同的基础上被测量的。Astra 在数学、知识和谜题方面领先。Fable 5.1 则在几乎所有编程测试中占据最高分。但 Epoch 目前只为 Astra 记录了一项编程得分,而且那一次来自中等推理水平的运行。
ARC-AGI-3 显示出大幅跃升
最明显的跃升出现在 ARC-AGI-3 上。该测试将 AI 投入陌生的游戏世界,其中的规则和目标没有人向它解释。模型必须通过试错来弄清楚该做什么。GPT-6 Astra 达到了 62.7%,测试成本约为 26,000 美元。其前代 GPT-5.6 Sol 达到了 7.78%,竞争对手 Claude Opus 5 达到了 30.16%。Fable 5 和 Fable 5.1 尚未进入该基准测试。
OpenAI 报告的 99.9% 是在不同条件下取得的。在那种设置中,Astra 可以使用 OpenAI 构建的测试框架,该框架会在各个单独请求之间保留推理链,并自动对长时间运行进行摘要。根据 ARC Prize 的测量,在两种设置都解决的 167 个游戏推理配对上进行对比,这些运行的速度大约快了 3.66 倍,并且使用的 token 少了 49%。
这些测试框架的使用,以及随之而来的性能跃升,早已是 ARC Prize 与 OpenAI 之间围绕 GPT-5.6 Sol 的一个争议点。ARC Prize 指出,只有运行在内部 ARC 测试框架上的较低数值 62.7% 才允许在各厂商之间进行公平比较,不过该机构也计划在未来同样公布来自厂商测试框架的数值。
在这里,思考得越多,账单越低
思考投入与成本之间的关系很不寻常。通常,更高的推理等级会让一次测试运行变得更昂贵。而在 Astra 上,情况恰恰相反。在标准的 ARC 测试框架上,成本从无推理时的 $49,791 降至最高推理时的 $26,098,而得分则从 35.2% 攀升至 62.7%。据 ARC Prize 称,原因是 Astra 用更少的步数解开游戏,这意味着更少的模型调用和更少的 token。有一个反常之处格外引人注目:“低”等级的得分为 17.5%,比完全不做推理还要差。ARC Prize 没有对这一异常值发表评论,但 GPT-6 Astra 在其他基准测试中表明,得益于其新架构,它能够在不进行推理的情况下解决更长周期的任务,该架构大概会在生成第一个 token 之前进行内部循环处理。
作为对比,人类测试者每 90 分钟一场可获得 $115,外加每解开一个游戏 $5,因此按大约九次尝试计算,平均每个游戏约为 $12.78。但这主要支付的是时间和参与意愿。如果只把大脑的代谢能量折算为电费,ARC Prize 得出的结果是每个游戏 0.067 美分。
比原始分数更有意思的是效率。在发布之前,ARC Prize 让大约 500 名测试者进行了试玩,没有预先筛选,并记录了每个关卡中解出该关卡的测试者所用步数的中位数。在使用 OpenAI scaffold 的那次运行中,Astra 以少于该中位数的步数通关了 96% 的关卡,平均只用了一半多一点。与通常的成本指标不同,这个数字并不追踪所消耗的算力。它追踪的是模型在掌握一个环境之前需要多少该环境的经验。
这正是组织者原本预期人类会保持持久优势的地方。对于暴力破解方法而言,这一点仍然成立,但对于顶级模型,ARC Prize 看到的几乎是一种二元模式。一旦模型弄清了机制,其执行就落入了人类的效率区间。
Astra 发明了自己的记号
为了做到这一点,Astra 会保留自己的笔记,并摸索出一套自创的、类似代数的简写方式,用它来记录对象、坐标、规则和未完成的计划,例如将 extend8 to3; retract10 to2 作为有序的移动序列,或将 Turn 5: P=(24,20), empty, facing west 作为状态笔记。ARC Prize 在其他模型上也看到了类似行为,但特别指出 Astra 的精确性和信息密度。在标准测试框架上,这是一项重要技能,因为模型没有保存到自己可见笔记中的一切都会丢失。
ARC 联合创始人 François Chollet 在 X 上将其描述为“针对每个游戏和关卡的高效、即时符号世界建模”。该模型甚至发展到“开发出自己的简写 DSL 来表示游戏内情境”,其核心“本质上是一种针对特定游戏的代数记法”。对 Chollet 而言,最重要的是这种行为从何而来:“Astra 展现出的符号建模行为,我们此前只在复杂的 harness 中见过,因此 harness 的能力正日益转移到模型本身之中。”
Astra 构建了一个稠密、紧凑的符号世界模型,用以完成 ARC-AGI-3 环境。
例如,在环境 s5i5 中,Astra:
- 记录了当前关卡、枢纽朝向和机构长度:“L8: hub q2 (8↓). Lengths: 14=1…”
- 它将操作映射到精确的控制项:… pic.twitter.com/tMHP002mkB
— ARC Prize (@arcprize) 2026 年 9 月 3 日
第三个测试环境展示了 Astra 在外部工具辅助下所能达到的能力。PRO-LONG是一个由第三方开发的智能体框架,ARC Prize 团队在早期就将其部署为 ARC-AGI-3 的红队测试伙伴——也就是说,用来系统性地探索该基准的极限。与标准设置不同,该模型被提供了一个沙盒,可以在其中执行自己的代码。
Astra 利用了这一点,为每个游戏编写了小型程序库:游戏棋盘的解析器、状态模型、搜索算法和规划器。在一款有守卫的迷宫游戏中,寻路器、战斗规则模块、巡逻移动模型,以及一个持续将自己的预测与观察结果进行比对的脚本,被一个接一个地开发出来。ARC Prize 没有观察到任何试图逃离沙箱的行为。这些运行过程与人类测试条件不具可比性,因为测试对象既没有代码解释器,也没有记事本。这里所衡量的是模型与自建工具的综合表现。
Chollet:没有 AGI 的证明,但比预期更快
ARC Prize 明确表示不将这些结果解读为通用人工智能的证据。“到目前为止,我们对这个系统的全部了解就是它的基准测试分数,”Chollet 写道。当 ARC-AGI-3 发布时,他们在每一次演示中都强调了一点:“解决它并不能证明 AGI。它并非被设定为终点线。”尽管该基准测试确实检验了 AGI 系统所应具备的正确定性特征——即在不确定性下的探索、无指导下的适应,以及从稀疏数据中进行因果世界建模——但它是在“小规模”上进行的。这些游戏运行的时间尺度比现实世界任务短了几个数量级,因此所需的数据更少、建模复杂度更低、即时学习也更少。
大约六个月前 ARC-AGI-3 发布时,Chollet 在回答一个关于饱和的问题时曾表示“大约一年”,具体取决于针对该基准测试的方法有多专注。因此,Astra 的到来比预期“快了大约一倍”。“我相信进步的速度会让许多人感到惊讶,而新模型所具备的能力将挑战人们基于前几代模型所形成的对 AI 的认知。”当一位用户问他此前对 2030 年实现 AGI 的预测是否仍然成立时,Chollet 简洁地回答道:“会更早,因为进展比我预期的更快。”
结果是又一个基准测试。据 Chollet 称,ARC-AGI-4 自 ARC-AGI-3 发布以来就一直在开发中,计划于 2027 年第一季度发布。基准测试是一个持续演进的过程,与模型同步发展,并始终瞄准 AI 与人类智能之间尚存的差距。该组织认为 ARC-AGI-3 本身相当有限:确定性机制、封闭式目标,且无法表征开放的真实世界。下一代基准测试旨在探索递归自我改进和开放式创新等方向。
继续阅读以了解全貌。
订阅,获取不带炒作的报道。
- 完整访问 THE DECODER 上的每一篇文章
- 无广告
- 加入评论和社区讨论
- 每周通过邮件获取 AI 新闻摘要
- 每年 6 次:“AI Radar”——深入探讨最重要的 AI 话题
- 每日 AI 新闻,始终紧跟最新动态
- 我们完整的十年存档
- 由一支拥有 10 年以上 AI 经验的团队报道
来源:The Decoder:AI News(RSS) · the-decoder.com