跳到正文
北京时间
原文
Hacker News 热门(buzzing.cc 中文翻译)· jasondavies·· 2026-07-17精选AI 评分78

Schema Harness 在 ARC-AGI-3 公开集上取得约 99% 成绩

Schema Harness 在 Arc‑AGI‑3 公开数据集上取得约 99% 的成绩

AI 导读

Schema 框架在 ARC-AGI-3 公开集上,使用 Claude Opus 4.8 和 Fable 5 达到 99% RHAE 分数,使用 GPT-5.6 Sol 达到 95.35%。该框架不修改模型权重,而是将原始观测转化为可编辑程序,联合解决状态归因和机制发现问题。此前最强模型 GPT-5.6 Sol 在半私有集上仅得 7.78%。

推荐理由

在无规则的游戏里逆推出物理规律,这比刷榜更重要的是提供了一种让模型自己构建世界模型的方法论,做 agent 的值得细读。

正文 · AI 翻译

ARC-AGI-3:不告诉你规则的游戏

ARC-AGI-3 给智能体一个游戏环境,却不解释它所看到的是什么。每一步,智能体都会收到一个 64×64 的网格,包含 16 个颜色索引,以及一组合法动作。环境不提供对象列表、规则说明、既定目标或塑形奖励。只有一种方式能取得进展:物理学家的方式。智能体必须在它对游戏的模型仍是临时性的情况下采取行动,形成关于网格代表什么、动作如何改变它、什么算作成功的假设,然后随着新观察的到来不断修正自己的模型和计划。

ARC-AGI-3 已被证明对前沿模型异常困难。其官方指标 相对人类动作效率(RHAE) 将智能体每关的动作数与首次接触的人类基线进行比较,并在各环境中汇总结果;100% 意味着以等于或高于人类基线的动作效率完成每个环境的每一关。在 Semi-private 集上,经核实的前沿模型表现从 3 月发布时的 0.51% 上升到 7 月的 GPT-5.6 Sol 在最大推理模式下的 7.78%。Sol 在 Public 集上也取得了 13.33% 的成绩,但距离人类参考仍相去甚远。

图 1. 截至 2026 年 7 月报告的 ARC-AGI-3 RHAE 结果。实心标记表示经 ARC Prize 核实的评估;空心标记表示在 Public 集上自行报告的评估。洋红色标识 Schema。两项 Schema 结果均为自行报告,尚未经 ARC Prize 核实。

Schema,即我们今天推出的这套运行框架,在使用 Claude Opus 4.8 和 Fable 5 时,于 ARC‑AGI‑3 公开集上达到 99%,在使用 GPT‑5.6 Sol 时达到 95.35%。它不改变底层的模型权重。相反,它改变的是围绕模型的过程:如何将观察结果转化为对游戏的有效模型,如何根据交互历史检验预测,以及如何执行和修正计划。

这两个分数都来自一条固定的回退规则:先运行 Opus 4.8 和 Sol xhigh;得分低于 80 的游戏分别用 Fable 5 和 Sol max 重新运行,并保留每个游戏更高的那个分数。

结论是:你如何使用模型非常重要。本文的其余部分将展示这套安排。

像物理学家一样思考

Schema 像物理学家一样思考。物理学家在写下一条定律之前,必须先确定这条定律是关于什么的。一次观测中哪些部分算作对象?哪些属性定义了状态?只有确定了这些,他们才能追问这个状态如何变化。Schema 把这些问题形式化为两个问题。状态落地将原始观测转化为可被追踪的对象、变量和关系。机制发现则找出该状态在某个动作下如何变化,并把规则写成可执行的程序。我们此前的系统 VIGA 聚焦于第一个问题。它通过与图形引擎进行合成式分析,从连续视觉输入中恢复出远比 ARC 网格更丰富的场景程序。其他系统如 WorldCoder 则聚焦于第二个问题:它们从轨迹中学习转移程序,但起点已经是一个结构化的状态表示。我们认为这两个问题必须联合求解,由智能体同时构建状态表示和转移规则。

世界如何在各个时刻之间变化——那条规则,写成程序。每个游戏都隐藏着这样的机制:

世界是什么——对象、数量、名称,全都从原始像素中发明出来。没有任何东西规定哪些像素算作玩家、墙壁或计数器。

[schema] 联合求解这两个层面——在一个可编辑的程序中。

图 2. 两个抽象层级。第 1 层发明状态——哪些像素构成玩家、墙壁、计数器。第 2 层在该状态之上恢复机制,例如上方的弹簧墙、加油环和颜色旋转器。Schema 将两者保存在同一个可编辑程序中:当某条规则无法与实验保持一致时,反例可以指控表示本身。

状态接地与机制发现无法独立解决。一个乍看之下似乎合理的状态表示,当没有任何一致的转移规则能够解释后续实验的结果时,可能会被证明是不充分的。在 Schema 中,状态表示和转移规则被联合编码在同一个可编辑程序中。当某个观察结果与预测相矛盾时,智能体可以修改表示或规则,然后更新另一方以恢复一致的模型。这反映了物理学家的工作方式:当预测持续失败时,他们不只是调整定律。他们改变状态本身是什么。最清晰的案例是狭义相对论的诞生。当 Michelson 和 Morley 无法探测到光本应在其波动的介质时,Lorentz 走了第一条路:保留以太,用收缩假说修补规则,以吸收这一零结果。Einstein 走了第二条路:在狭义相对论中,他抛弃了作为状态一部分的以太,并使同时性成为相对于参考系的,从而得出了运动物体的简洁电动力学。

ARC-AGI-3 要求智能体从原始观测中构建出这两个层面。网格既不标识对象也不标识目标,因此智能体必须自行判断哪些模式对应于玩家、墙壁和计数器等实体,推断动作如何改变它们,并确定哪些配置算作进展或完成。甚至连目标谓词——在 Schema 中实现为 is_goal——也必须从交互中推断出来。

核心思路。 潜在世界表示是一个程序,而非一个向量——因此它是可解释的(一个你可以阅读和 diff 的文本文件)、可验证的(可针对记录的现实逐信念回放)、以及可搜索的(程序即模拟器;在其中进行规划是免费的)。

外层循环。 智能体针对游戏运行一个四阶段循环:观察 → 思考 → 执行 → 记录。

记录是系统不可变的交互历史。智能体可以修改其假设和工作笔记,但无法更改它接收到的观测或它采取的动作。

在每一次推演过程中,智能体会以step(state, action)程序的形式更新其对博弈的理论。它用与run_backtest的完整交互历史来检验该程序,利用任何不匹配之处定位错误,在所得模型中搜索带有run_bfs的方案,并将其工作结论记录在notes.md中。这些操作都不会改变环境。只有commit_actions会把动作发送到游戏中,从而将内部建模与搜索同外部交互分离开来。

为发现而行动。智能体并非只为达成目标而行动;它也会为探究隐藏机制而行动。当多条候选规则与已记录的历史保持一致时,智能体会寻找一个能将它们区分开的实验:即这些规则会给出不同预测结果的一个动作。它执行该动作,将观测结果与相互竞争的各预测进行比较,更新step(),并重新运行回测。这种有针对性的实验在官方指标下也是高效的,该指标对多余动作施加平方惩罚(详见下文):最好的实验就是以最少的真实交互解决最多不确定性的那个。

现实优先于模型。在执行过程中,每一次真实的状态转移都会与理论的预测进行核对。只要出现一处不匹配,就会停止当前方案的执行。智能体带着作为反例的不匹配转移回到推演阶段,并且必须先修正模型以将其纳入考虑,然后才能恢复规划。

规划被移入模型内部。一旦step()能够复现记录历史中的每一次状态转移,智能体就可以在模型内部搜索解法,而无需额外消耗环境动作。只有最终得到的规划才会在游戏中执行。跨关卡来看,这正是精确模型如何转化为动作效率、并体现在 98.98% 得分上的方式。

图 3. Schema 控制循环,可逐步查看——滚动即可逐步走完:四阶段外循环及其仅追加的 Timeline,放大展示一次 deliberation(theorize → certify → plan → commit),然后是一条真实的 LS20 轨迹在每个阶段的展开过程。

数字说明了什么

完整指标说明。官方 ARC‑AGI‑3 使用相对人类动作效率(RHAE)来评估表现,它将智能体使用的动作数量与每个已完成关卡的人类首次尝试中位数以上基线进行比较。每个关卡的得分为(human actions ÷ agent actions)²,上限为1.15。在每个游戏中,关卡权重从 1 递增到n,因此后面的关卡对游戏得分的贡献更大。基于相同权重的完成度上限会阻止一个游戏获得 100%,除非所有关卡都被通关。基准得分是各游戏得分的平均值。所有环境动作,包括探索性动作,都计入智能体的总数;由于效率比是平方的,额外动作会急剧降低得分。因此,98.98% 是完成度和动作效率的综合衡量——并不是已解决游戏的百分比。

图 4.RHAE 同时奖励完成度和动作效率。 智能体 A 用 785 个动作完成了全部七个关卡,接近人类基线所用的 776 个动作。智能体 B 在前六个关卡中使用了 1,591 个动作——是对应人类基线的 2.7 倍——并且未能完成第 7 关。由于 RHAE 对动作效率比取平方,并根据完成度对分数设上限,智能体 B 的得分低于 14%。

Claude 那一行(图 5)提供了与相同 Opus 4.8 和 Fable 5 配对的受控对比。将最终的 Claude Code scratch 快照作为基线输出,得到的分数为 42.83%;使用 Schema 后,同样的配对达到 98.98%,提升了 56.15%。

在 Sol xhigh 和 Sol max 回退配对下,Schema 达到 95.35%。最接近的官方参考并非匹配的 harness 对比:ARC Prize 报告的最佳单一变体 Sol max 在 Public 上为 13.33%,在 Semi-private 上为 7.78%。因此,图表中显示的 82.02% 的 Public 集差异只是背景参考,并非对 Schema 所带来增益的受控估计。

受控的 Claude 对比所隔离出的是流程上的差异,而非底层模型能力的差异。Claude Code 为文件操作和长上下文管理提供了强大的通用 harness。原则上,它可以模仿 Schema 的工作流,但它并不要求模型这样做。在通用 harness 下,模型直接对游戏采取行动,并可能将其信念隐含地保留在上下文中。而 Schema 则强制施加三项约束:

  1. 将当前世界模型编码为一个可运行的 step() 程序。
  2. 在将其用于规划之前,针对每一条已记录的转换验证该程序。
  3. 仅通过 commit_actions 发送动作,在任何预测错误后立即丢弃剩余计划。

在这一受控配置下,Schema 的测试框架相比 Claude Code 基线取得了 56.15% 的提升。

图 5。Claude 行固定 Opus 与 Fable 的配对,仅更换测试框架。Sol 行将 Schema 的 xhigh 与 max 配对与最佳官方单变体公开分数进行比较,因此它作为参考而非受控消融实验展示。

验证状态。98.98% 和 95.35% 的分数是在 Public 集上自我报告的结果,根据随本文发布的运行产物计算得出。这两个分数均未经 ARC Prize 独立验证。

公开集能在多大程度上说明问题?此处每一个 Schema 数字都是在 25 个公开游戏上测得的。Sol max 提供了一个跨评估集的官方校准点——公开集 13.33% 对 Semi-Private 7.78%——但这并不能为将接近上限的公开分数进行数值外推提供依据。98.98% 的公开分数在 Semi-private 上对应什么,在实测之前尚不可知。现有产物仅记录了公开集运行,因此本草案不作出冻结测试框架或留出集性能方面的声明。

Schema 与首次人类基线对比

全部 25 款公开游戏

使用 Claude Opus 与 Fable / 使用 GPT-5.6 Sol

Schema(我们的方法)首次人类

RHAE 98.98%

横轴:累计真实操作数 · 纵轴:已通关关卡数

图 6。全部 25 款公开游戏,每款游戏展示其保留的运行结果。可在两组 Schema 配对之间切换;人类基线和每款游戏的坐标轴保持固定,以便曲线可直接比较。Claude 曲线和首次人类基线均为评估导出中精确的累计操作数;每款游戏保留的运行结果是 Opus 4.8 或 Fable 5 中得分较高者(左上角徽章)。Sol 曲线取自源图表,待完整的 Sol 评估产物发布后再行更新,仅供参考。

配对账本。在保留的 Claude 结果中,14 款游戏使用 Opus 运行结果,11 款使用 Fable 运行结果。14 次 Opus 运行中有 13 次、11 次 Fable 运行中有 6 次得分恰好为 100,因此总体上有 19 款游戏得分为 100。在保留的 Sol 结果中,15 款游戏使用 xhigh 运行结果,10 款使用 max 运行结果。全部 15 次 xhigh 运行均得分为 100;10 次 max 运行中有 5 次得分为 100,5 次低于 100。

残差是集中的。 Claude 配对整体上比 100 低了 1.02%。有 19 个游戏恰好得分为 100,而其余六个的得分在 89.87 到 99.10 之间;游戏得分的中位数是 100。Sol 配对的游戏得分中位数同样是 100:有 20 个游戏恰好得分为 100,而其余五个的得分在 60.93 到 87.80 之间。

案例研究

观察 1:归纳出的世界程序让行动变得高效

在 25 个游戏中有 14 个,智能体归纳出的程序世界模型能够精确复现其记录的历史,在这些游戏中,它使用的行动次数比人类参照少了 1.6–5.0 倍。原因在于行动花费的位置发生了转移:智能体只为发现某个机制支付一次真实行动,随后就在模型内部免费地进行规划,而不是通过反复试错重新发现该机制。这依赖于两项能力:

A. 对照完整历史进行验证。 每一次真实的状态转移都会被记录,而 run_backtest 会对照整个记录检查每一条候选规则,而不是依赖回忆。由于该记录在有限的工作记忆和自动压缩的上下文窗口中都能存续,因此经过认证的模型可以替代进一步的真实环境测试而被信任。

B. 在可复用的模拟器内部进行规划。 一旦 step() 和 is_goal() 通过认证,广度优先搜索就能探索 10 3-10 4 个建模状态,而无需花费任何一次环境行动。而且由于该模型以代码形式持久存在,这种免费规划会在之后的每一个关卡中重复进行。

回报最显著的地方正是人类最吃力之处:在 M0R0 Level 4 上,智能体需要 42 个动作,而人类需要 500 个,这与一次性付出探索成本、此后在模型内部重新计算计划的模式一致。下面每一个可展开条目都是一个支持这一模式的游戏关卡案例。

证据 1A · RE86 精确验证支持一次性计划 393/393 精确 · 61 个动作的计划

RE86 在一局游戏中展示了完整序列:run_backtest 在每一条记录下来的状态转移上重放模型,随后经过验证的模型给出一个计划,无需额外的试错即可通关整个关卡。

RE86——Schema 搭配 Opus 4.8

用全部记录历史对模型进行认证 393 / 393 精确

在 394 步之后 状态 394 迄今为止记录的真实环境步数——393 可校验,1 跳过(一次没有先前网格的重置)。

events.jsonl:3144 回测 模型在整段历史上重放后,与每一个预测都吻合:回测 [所有状态转移]:393/393 状态转移完全正确(非终止步骤上的网格 + 每一步上的 level_up/dead/win 标志);0 处不匹配,1 跳过。

阅读的含义是“我的世界模型精确复现了我所采取的全部 393 个真实步骤。”这是针对真实基准的回溯性一致性,而且规模可观——一次操作中生成数百个精确的 64×64 帧——在无辅助的人类游玩中没有对应物。同样的情况也出现在获胜的对局中:KA59 391/391,SK48 387/387,AR25 238/238,M0R0 182/182。

整个关卡由一个经过验证的计划一次通关 61 个动作一次性完成 → 获胜

events.jsonl:3450 回测 run_backtest:8/8 个转换完全正确

events.jsonl:3673 提交 一个由 61 个动作组成的单一提交计划,在模型内部搜索得出(在获胜者中反复出现:SK48 56,G50T 52,AR25 46)。

执行结果 全部 61 个动作执行完毕,0 次误预测 → 获胜。RE86 的优势在人类表现最差的关卡达到峰值(L7:110 对 424)。

RE86(Schema w/ Opus 4.8),最终关卡——交互式轨迹回放(按 ▶ 重放):左侧为游戏网格,右侧为智能体的推理、回测结果和已提交计划。该片段以单一 61 动作计划执行至获胜、零误预测结束。

证据 1B · KA59 完整历史对比驳斥了一条看似合理的规则 两次运行对比

KA59 分离出记忆优势:来自两次完整运行的精确记录揭示,一条表面上成功的规则只是巧合地吻合。

KA59——Schema w/ Opus 4.8

一个需要完整回忆两次完整运行才能完成的反驳,本轮(epicycle)被否决

events.jsonl:314 model / notes.md 它精确地比较两个完整的过往走子序列,并丢弃了一条只是碰巧吻合的规则:“……(‘H 消耗,水平自由’ R1,以及‘H 消耗 1/2’ R2)都是恰好吻合的本轮(EPICYCLES)。被否决的原因:两次方向序列完全不同的运行,按走子索引产生了相同的消耗模式 +1,+0,+1,+1,+0。”

读取含义 检测到两次完整运行共享同一消耗特征,需要精确地同时持有两者——这正是记忆不对称的具体形态。人依赖整体直觉;而智能体用完整历史证据推翻一条看似合理的规则。

KA59(Schema w/ Opus 4.8),第 1 关——该关卡期间的交互式轨迹回放(按 ▶ 重放),在此期间本轮规则(epicycle rule)被测试并被否决:推理面板展示了刻意设计的判别性探测(“一次有信息量的误预测”)以及它们在通关前迫使模型做出的修正。

证据 1C · M0R0 搜索在困难关卡中以 42 步对 500 步取代试错

M0R0 隔离出规划优势:一旦模型达到精确,解决方案就在模拟器内部被搜索出来,而不是通过进一步的真实环境试错被发现。

M0R0——搭配 Opus 4.8 的 Schema

在人类最难的关卡中以 42 步对 500 步,搜索取代试错

events.jsonl:56 policy“……在规划前先用 BFS 跑通回测,而不是手动走棋,后者正是失败[模式]……”

events.jsonl:84 search 在已验证模型内部进行广度优先搜索:BFS:通过 level_up 在 19 步内达成目标;扩展了 3300 个节点,891 个不同状态。

基线 vs 人类 人类在这一关花费 500 个动作(他们的瓶颈);而智能体执行了 19 步计划,用 42 个动作就通关了。搜索成本并不随关卡“感觉上”的难度而扩展。

M0R0(Schema w/ Opus 4.8),第 4 关——获胜片段的交互式轨迹回放(按 ▶ 重放):推理面板显示 run_backtest 变绿,BFS 返回 19 步计划;随后网格用 42 个动作清除了人类需要 500 个动作的关卡。

观察 2:Fable 通过更好的实验决策达成正确的世界模型

为了理解在相同的可执行测试框架下模型选择如何影响世界模型的发现,我们比较了 Schema w/ Opus 4.8 Max 与 Fable 5 在两者都尝试过的游戏上的表现。Fable 在这些游戏上以两种方式实现了更高的 RHAE:在某些游戏上,它发现了一个模型,使其能够完成 Opus 无法完成的关卡;在另一些游戏上,两个模型都能完成,但 Fable 用更少的环境动作达到了相同的终点。

这些成对的轨迹指向一个共同的解释。在一次预测失败后,Fable 更常质疑当前的表示本身,识别出真正重要的不确定性,并选择一种交互,使其可能的结果能够在相互竞争的假设之间做出区分。随后,它把观察结果转化为一条可复用的转移规则。Opus 往往最终也能发现同样的机制,但只有在花费更多动作在其现有表示内测试替代目标、条件或配置之后才会如此。

匹配完成的情形尤其具有启发性:由于 Opus 最终编码了同样的机制,动作上的差距不能简单地用一个模型能够表达该规则、而另一个不能来解释。差异在于发现过程——质疑什么、运行哪个实验,以及何时把结果转化为可执行的代码。

证据 2A · DC22 对缺少一条边的图进行完整搜索 Schema 搭配 Fable 6/6 · Opus 2/6

Opus 构建了一个关于移动和三个开关的详细模型。在一次全新的重置之后,BFS 随后穷尽了该模型中所有可达状态,并正确得出结论:目标不可达。Fable 则揭示出了一条在该建模图中缺失的转移。

Fable 占用 改变了一个成对区域的含义 175 / 175 完全正确

失败假设修正 1 Fable 最初把彩色区域当作以相位为键的物品箱。另一次普通的游动证伪了这一解释。

在步骤 176 之前的新假设:又是普通游泳——对偶并非按相位键控的道具箱。但新想法是:这两个对偶是等大的槽位——逐格交换可以携带 e!

干预探针:Fable 进入了一个槽位并触发了配对的对照。它当前的模型预测会有惩罚且不会发生交换,因此占用状态让这个实验具有了区分力。

步骤 176 的观察:传送门生效了!!!……对偶从来就不是状态翻转器:它们是一对逐格内容交换(e 会随之移动!)。

世界模型 v5 代码修订:化身之所以移动,是因为它是内容,而不存在针对化身的传送特例:for (xa, ya), (xb, yb) in zip(_cells(a), _cells(b)): va, vb = grid[ya][xa], grid[yb][xb] if va != vb: grid[ya][xa], grid[yb][xb] = vb, va

回测后的结果:修订后的模型复现了 175/175 条记录的转换。随后 Fable 用一条 24 步的路线穿过新到达的岛屿,通关了该关卡。

DC22,第 3 关——左侧使用 Schema 搭配 Fable 5,暴露了传送门边缘并通关;右侧的 Opus 4.8 Max 则穷尽了省略该边缘的图。每次回放中,左侧是游戏画面,右侧是推理轨迹。

观察到的模式:搜索并没有发明出这种传送交互。Fable 有用的改变发生在更早的一层,即把区域内容和占用状态作为状态的一部分来表示。

证据 2B · LF52 推车是一个棋盘格:Schema 搭配 Fable 10/10 · Opus 4/10

两个模型都识别出了钉板单人棋(peg solitaire),并学会了小车沿轨道移动。决定性问题在于这两种机制如何组合。Fable 起初也排除了那个有用的交互,随后将小车驱动到一个精确的停靠坐标,并把那一刻当作一个观察点。

Fable 两个对象系统合并为一个转移图 10 / 10 关

初始推理假阴性:一个钉子只有在拥有 ≥1 个合法跳跃时才能被选中,这意味着 c5-越过-c6-进入管道/箱子 是不合法的。

小车发现观察:一个箭头让箱子沿轨道移动。Fable 随后将其驱动到停靠点,明确预期停靠这一步会揭示小车与棋盘如何组合。

在停靠边界处的修正:小车停靠了——伴随着一个意外:棋盘重新排布了!……小车核心……紧贴着作为 c6 旁边的一个额外单元格。

世界模型 v5 代码修正:固定单元格和可移动的小车核心进入同一个单元格映射:def _find_cells(world): cells = detect_fixed_cells(world) for x, y in _find_carts(world): cells[(x, y)] = _cart_kind(world, x, y) return cells

迁移结果:普通的跳跃生成器现在能够处理跳入、运输和跳出。Fable 在后续的多小车和滚动关卡中复用了这一表示。

Opus 一个相关探测测试了错误的因果角色 最终收敛

早期测试探针 Opus 询问一枚钉子能否越过推车。结果正确地排除了“推车作为中间棋子”,但没有测试“推车作为落点格”。

约 100 回合后测试修复 先前的测试点击了 c6 而非 c5……c5 越过 c6 恰好落在……箱子停靠点……这一组合未经测试。

精确几何观察 突破!……一个颜色为 2 的落点标记出现在箱子上……箱子确实是一个有效的钉子落点!Opus 随后修正为相同的运输机制。

LF52,第 2 关——左侧为带 Fable 5 的 Schema,在精确停靠几何位置测试推车;右侧为 Opus 4.8 Max,在将该组合搁置未测更长时间后才达到相同的组合。两次回放中均为左侧游戏画面、右侧推理轨迹。

观察到的模式:一个否定性实验只排除实际测试过的机制-实例组合。Fable 通过在精确的起点–中间–落点几何位置测试推车,更早地找到了有用的组合。

证据 2C · SB26 的通用性表现为结构化修正 SCHEMA,带 Fable 135 次操作 vs Opus 456 次操作

两个模型都在第 1 关之后发现了类似 DFS 的规则,并且最终都解出了全部八个关卡。这一对区分了“陈述一个通用想法”与维持一个可复用、可编码并能吸收后续变化的抽象。

Fable 递归机制及后续扩展 8 / 8 · 135 次操作

第 1 关结构性假设 假设:代码采用深度优先读取……让我用盒子/传送门/DFS 目标分配来泛化这个模型。Fable 提交了完整的生成分配方案,使该假设具有强可证伪性。该关卡通过。

世界模型 v5 代码抽象 def traverse(box): if box in visited: return visited.add(box) for kind, obj in sorted(elements_inside(box)): if kind == "marker": assign_next_target(obj) else: for child in boxes_for_portal(obj): traverse(child)

第 3–6 关结构化修订 Fable 仍然改动了模型:传送门变为可移动;全局 visited 集合变为基于路径的循环防护;出现了三层嵌套。稳定的部分是因果模式——中空对象引用容器,而遍历生成分配。

后续关卡压缩 在第一个 DFS 假设之后,后续关卡的增量大约为 15 / 15 / 15 / 17 / 19 / 17 / 28 个动作。

Opus 同样的第一个想法,迁移鲁棒性较差 8 / 8 · 456 个动作

第 1 关确认 第 1 关通过!DFS 遍历目标规则得到确认。

后续变体假设扫描 当新形状出现时,Opus 反复从结构切换到分配约定,例如连续色块和网格读取顺序。

第 6 关缺失状态 16 个回合卡在 L6……缺失的变量是方块形状——TEST3 的颜色一直是对的,但两个中空方块必须放在中间列的槽位中。

SB26 — 左侧使用 Fable 5 的 Schema 在第 2 层复用了 DFS 抽象,大约用了 15 个动作;右侧的 Opus 4.8 Max 则展示了后来在第 6 层的苦战,之后才恢复了缺失的瓦片形状变量。两次回放中均为左侧游戏画面、右侧推理轨迹。

观察到的模式:通用机制并不是永不改变的那种机制,而是其修订能够保留早先的解释性机制、并压缩新层级成本的机制。

总结。测试框架与底层模型在不同阶段影响效率:

可执行的测试框架降低了使用某个理论的成本。它使该理论持久化、可精确验证且可搜索。这正是相对于人类参照所观察到的效率模式的来源。

底层模型决定了发现有用理论的成本。成对的运行有时会通过截然不同的轨迹收敛到相同的表示。Fable 更常更早地做出决定性的表示修订,因此以更少的环境动作达到可执行的解决方案。

搜索只有相对于它所作用的世界模型才是完备的。一旦缺失的对象、状态变量或转移被表示出来,现有的验证器和规划器往往就足够了。如果观测无法区分出正确的表示,同一套机制也可能验证并穷尽搜索错误的表示。

这是一个新的开始

ARC‑AGI‑3 是一个快速发展的领域中的重要基准。它在 3 月发布时,领先的前沿智能体得分仅为 0.51%。到 7 月,最佳的官方 Sol Max 结果在 Public 上已达到 13.33%,在 Semi‑private 上达到 7.78%,而自报结果则攀升至每局平均 RHAE 高达 58.12%。

我们自报的 98.98% 延续了这一轨迹,而非偏离它。关键要素早已显现:能够适应新环境的前沿模型、编码智能体框架,以及程序化世界模型。Schema 是将它们汇聚在一起的系统。

我们将一个已被攻克的 ARC‑3 解读为新的开始:机制发现作为一种通用能力——通过行动与感知的智能体循环,在远比 64×64 网格更丰富的环境中,为世界的因果结构奠定基础。这正是我们前进的方向。

来源:Hacker News 热门(buzzing.cc 中文翻译) · schema-harness.github.io