跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-05-12精选AI 评分73

解决循环:语言和推理的吸引子模型

Solve the Loop: Attractor Models for Language and Reasoning

AI 导读

吸引子模型解决了循环Transformer训练不稳定、成本高和深度固定的问题。它通过主干模块生成初始输出嵌入,吸引子模块迭代优化固定点,并利用隐式微分计算梯度,使训练内存与有效深度无关,迭代次数自适应收敛。在语言建模中,相比标准Transformer,困惑度最高降低46.6%,下游任务准确率最高提升19.7%,训练成本更低;一个770M参数的模型性能优于1.3B参数Transformer。在推理任务中,仅2700万参数模型在约1000个示例下,于Sudoku-Extreme和Maze-Hard上准确率分别达91.4%和93.1%,优于Claude、GPT o3等前沿模型。模型还展现出均衡内化现象,训练后初始输出嵌入接近均衡态,推理时可移除求解器而性能几乎无损,实现了迭代优化的可扩展性。

推荐理由

这可能是要改写语言模型训练范式的架构,把迭代推理变成可学习的固定点,770M 性能超 1.3B Transformer,27M 小模型解数独秒杀 Claude、GPT o3。最反直觉的是,训练后模型能内化迭代过程,推理时直接一步到位。

正文 · AI 翻译
摘要

循环式 Transformer 通过迭代精炼潜在表征,为纯前馈计算提供了一种有前景的替代方案,从而改进了语言建模与推理能力。然而,循环架构在训练上仍不稳定,优化与部署成本高昂,且受限于较小且固定的循环深度。我们引入了吸引子模型(Attractor Models),其中主干模块首先提出输出嵌入向量,然后吸引子模块通过求解不动点来精炼这些嵌入向量,梯度则通过隐式微分获得。因此,训练内存消耗在有效深度上保持恒定,迭代次数由收敛性自适应决定。实验表明,吸引子模型在大规模语言模型预训练和基于小模型的推理这两个场景中均优于现有模型。在语言建模方面,吸引子模型在不同规模上相比标准 Transformer 和稳定循环模型实现了帕累托改进,困惑度最多降低 46.6%,下游准确率最多提升 19.7%,同时降低了训练成本。值得注意的是,一个 770M 参数的吸引子模型性能超过了在双倍 token 数量上训练的 1.3B 参数 Transformer。在具有挑战性的推理任务上,我们展示了仅含 2700 万参数、使用约 1000 个样本的模型在 Sudoku-Extreme 上达到了 91.4% 的准确率,在 Maze-Hard 上达到了 93.1% 的准确率,其扩展性能优于 Claude 和 GPT o3 等完全失败的顶尖模型,以及在大规模下崩溃的专用递归推理器。最后,我们展示了吸引子模型展现出一种我们称之为“均衡内化”的新现象:不动点训练将模型的初始输出嵌入向量置于均衡点附近,从而允许在推理时移除求解器而性能几乎不受影响。综合这些结果表明,吸引子模型通过将循环转化为模型可以学习内化的计算过程,使得迭代精炼变得可扩展。

Refer to caption
Refer to caption
Refer to caption
图 1:左图:Lambada 困惑度与训练 FLOPs 对比。吸引子模型以更少的计算量实现了强大的语言建模性能。右上图:吸引子模型架构。一个非循环主干网络首先将输入映射为初始输出嵌入提议,吸引子模块通过求解不动点迭代对其进行优化,然后将(近似)平衡态解码为最终输出分布。右下图:在困难推理任务上的表现。吸引子模型在困难推理任务上超越了前沿模型和专门的递归模型。

1 引言

现代语言建模时代一直由 Transformer 架构主导,它通过固定的前馈计算生成每个 token。这一方法取得了非凡的成功(achiam2023gpt; team2023gemini; grattafiori2024llama; anthropic2024claude3; r1),但它留下了一个基本问题尚未解决:每个 token 应该是单次计算过程的产物,还是模型应该能够在确定输出之前优化其潜在预测?越来越多的研究表明,这种优化可以非常强大。链式推理(CoT)可以被视为这种优化的一种形式,即模型写入中间 token,将其反馈回上下文,并利用它们来影响后续预测。然而,这通过离散的 token 通道进行路由计算,并迫使“思考”被写下来,即使其效果可能仅仅是优化内部表征。

这一局限性催生了若干关于隐式(或潜在)思维的研究方向,并促使架构循环重新兴起,从而将思考过程从纯粹的 token 级生成中解放出来。这些方向包括:通用 Transformer(universal_transformer)、循环 Transformer(giannou2023looped; loop2)、递归深度 Transformer(loop4)、循环语言模型(looplm)、隐式推理方法(geiping; loop5)以及连续思维链方法(coconut; mohtashami2023cotformer; zhu2026reasoning)。循环架构原则上能够表达迭代或算法过程(loopedbetter; giannou2023looped),通过权重共享模拟更深层的结构(universal_transformer; looplm),降低 token 级推理的上下文长度成本,并提升下游泛化能力(loop3; loopedtransformer)。实验表明,近期循环语言模型在语言建模和推理方面均有所提升(looplm; geiping),而小型递归模型(hrm; trm)也证明,在小数据场景下,循环机制对解决高难度推理任务具有实用价值。

挑战在于,循环已被证明难以作为稳定的架构构建模块。循环通常伴随着不稳定的训练、随循环步数线性增长的大内存需求,以及显著的顺序计算(geiping; looplm; parcae)。训练循环网络通常需要时间(或深度)上的反向传播以及精心设计的稳定化技术;即便如此,潜在思考模型仍然脆弱且难以优化(wei2025sim; ozeren2025reinforcement; deng2026latent; deng2025latent; rizvi2026illusion)。在训练方面,循环语言模型往往需要比同类前馈模型多得多的计算量,并且在较大的循环深度下可能受限于内存。例如,geiping 报告称,训练一个循环模型所消耗的原始 FLOPs 可与一个规模大十倍的前馈模型相当。而在另一个极端,专门的微型递归推理器表现出一种令人不安的“少即是多”行为,并对规模扩展产生负面反应:增加模型大小可能会降低甚至崩溃性能(trm)。

1.1 贡献

在本工作中,我们设计了一种用于迭代优化的通用架构,该架构(i)训练稳定,(ii)在优化步数上使用恒定内存,(iii)训练成本远低于显式展开,(iv)推理时高效,并且(v)在大型语言建模和微型模型的硬推理任务上均取得了强劲性能。

通过吸引子模型求解循环以优化输出。我们提出吸引子模型(Attractor Models),这是一类全新的架构,将潜在状态精炼视为输出嵌入空间中的不动点问题。该模型首先使用非循环主干模块(本文中采用 Transformer 实现)生成初始猜测嵌入。随后,一个独立的、通常规模更小的循环网络对该猜测进行精炼(图 1)。近期对循环语言模型的机制分析表明,对于绝大多数 token,循环轨迹会收敛至一个不动点。我们直接基于这一观察,不再按预设步数展开循环,而是借鉴深度均衡模型(DEQ)的思路,直接求解循环收敛到的状态。“吸引子模型”这一名称源于动力系统理论——吸引子是指系统演化趋向的一组状态。从某种意义上说,吸引子模型可以看作是在生成每个 token 之前进行思考:主干模块提出初始潜在预测,吸引子模块将其精炼至均衡状态,再解码为输出分布。

吸引子模型具有稳定、恒定内存、高效训练和自适应精炼等优势。与有限展开循环块的循环语言模型不同,吸引子模型将预测目标视为不动点计算来求解均衡状态。因此,精炼步数在训练和推理过程中均根据收敛情况自适应选择。我们证明,训练期间的内存成本在迭代次数上保持恒定;而标准循环语言模型的内存成本则随循环次数线性增长。实验表明,吸引子模型的两阶段结构——主干模块提出预测、吸引子模块进行精炼——能够实现稳定、高效的训练和出色的性能。

新现象:均衡内化。我们观察到,尽管吸引子模型仅使用下一个 token 预测损失进行训练,但它们学会了使求解器变得多余。在训练过程中,骨干网络的初始预测逐渐向不动点靠近,因此达到近似均衡所需的精化步骤更少(参见图 LABEL:fig:convergence_behavior 和图 LABEL:fig:accuracy_vs_T)。我们将这种现象称为均衡内化:模型似乎通过一种自动课程学习的形式,将迭代精化过程自我蒸馏到其自身的初始输出嵌入中。从这个意义上说,循环充当了一个移动的训练目标,教导骨干网络其计算应在何处收敛。

在大型语言建模和使用小模型进行硬推理方面表现强劲。我们的实验表明,吸引子模型在两种规模下均能扩展。在大型语言建模中,吸引子模型在小型(140M)、中型(370M)和大型(770M)规模上始终优于标准 Transformer 和稳定循环语言模型,实现了帕累托改进(图 1)。我们证明,与可比的循环基线相比,我们的模型在显著减少训练计算量的同时,提高了验证困惑度、Lambada(lambada)上的分布外困惑度以及下游基准测试的准确率。值得注意的是,一个 770M 参数的吸引子模型优于一个在双倍 token 上训练的 1.3B 参数 Transformer。与循环语言模型 Parcae(parcae)相比,我们的模型使用的训练计算量最多可减少,同时避免了与显式展开相关的内存增长。在使用小模型进行硬推理任务时,仅凭 27M 参数和大约 1000 个训练样本,吸引子模型在 Sudoku-Extreme 上达到了 91.4% 的准确率,在 Maze-Hard 上达到了 93.1% 的准确率。在这种规模下,标准 Transformer 以及 DeepSeek R1、Claude 和 o3-mini 等专有前沿模型完全失败,准确率为 0%,而专门的递归架构则表现不如我们的模型,并且在扩展时崩溃。相比之下,吸引子模型会随着规模扩大而改进。

2 背景:循环架构

我们首先介绍循环架构的背景知识。设 \( x \) 为词汇表 \( V \) 上的输入序列,\( d \) 表示模型宽度。循环模型可以表示为三个单元的组合:前奏单元 \( P \),它生成输入表示 \( h_0 \);权重共享的循环单元 \( R \),它对潜在状态 \( s_t \) 重复应用 \( T \) 步;以及尾声单元 \( C \),它将最终潜在状态映射为输出概率。重要的是,循环架构通常将潜在状态初始化为无信息的值,例如零向量或高斯噪声(geiping; parcae; deq)。此外,循环步骤可能仅在第一步使用输入表示(looplm),或者在每一步循环中都使用(geiping; parcae)。这种注入可以通过与循环状态相加或拼接来实现。

像 Parcae(parcae)、Huggin(geiping)和 Ouro(looplm)这样的模型,其主要区别在于如何训练、停止或扩展这种循环架构。具体来说,循环深度是这些模型中的一个核心设计选择。它可以是固定的(trm),在训练过程中采样的(geiping; mcleish2025teachingpretrainedlanguagemodels; parcae),或者由辅助的停止机制决定的(mor; looplm)。训练过程则是在数据分布和所选循环深度机制上平均最小化一个目标函数,通常通过沿深度方向的反向传播来实现。因此,训练成本和梯度内存都与循环步骤的数量相关。此外,在推理时改变循环深度会引入训练-测试不匹配,因为模型是在与训练时不同的计算图下进行评估的,这会导致性能下降。

3 用吸引子模型解决循环问题

如上一节所述,标准循环语言模型(looplm;parcae)使用权重共享,通过循环方式精炼一个隐藏状态,该状态从一个无信息价值的初始值开始,并基于输入嵌入向量构建。随后,在有限次循环后(parcae),或当辅助停止头变得足够确信时(act;looplm;parcae),读出预测结果。这种设计存在三个缺陷:循环次数必须在训练时选定;训练内存随循环次数线性增长;当推理时运行的循环次数超过训练时所见次数时,准确率会下降(looplm)。因此,循环往往伴随着不稳定的训练、不断增长的内存需求以及大量的顺序计算,在某些情况下,其成本甚至接近训练规模大十倍的非常规模型(geiping)。

近期对循环语言模型的机制分析(mech)揭示,对于绝大多数模型 token,循环轨迹最终会收敛到一个不动点。这表明,权重共享的循环模块通常是在逼近一个底层的定点计算,通过递归应用权重共享模块并在若干步后截断来实现。这一观察结果启发了吸引子模型的设计,我们将在下文进行描述。

Refer to caption
Refer to caption
图 2:循环语言模型与吸引子模型的对比。循环语言模型在解码最终状态之前,会重复应用一个共享模块进行有限步数的计算。相比之下,吸引子模型使用一个主干网络生成初始输出嵌入向量,然后通过吸引子模块对其进行精炼,直到定点残差变得很小,最后解码得到近似的平衡状态。

3.1 吸引子模型:主干网络与吸引子模块

受循环模型中观察到的固定点行为启发,我们将循环精炼过程建模为一个吸引子。我们并非训练模型在预设的循环步数后产生良好预测,而是将输出定义为精炼过程的平衡态。吸引子模型由两个模块组成:主干模块(通常是一个较大的 Transformer 网络)首先提出一个有意义的初始输出嵌入,然后吸引子模块(通常是一个较小的基于 Transformer 的网络)对该提议进行精炼,直至收敛。这使得精炼步数成为一个求解器选择,而非固定的架构选择。

我们首先将输入映射为输入嵌入,其中 表示共享的嵌入/反嵌入。然后,输入嵌入由主干模块和吸引子模块按如下方式处理。

主干模块提出一个初始的“猜测”输出嵌入。主干模块将输入嵌入映射为一个初始提议:

(1)

我们使用 作为吸引子模块的初始化。与从零、噪声或输入侧表示开始循环不同,吸引子模型从一个已经是连贯预测嵌入的状态开始循环计算。在实践中, 是一个容量相对较高的因果 Transformer,因此精炼过程从一个有意义的初始化附近开始,而非从 0 开始。我们发现,与 DEQ 相比,这使得我们的方法训练更稳定;DEQ 在训练后期会出现迭代次数激增的情况,而我们的方法在训练后期则趋于稳定(参见图 LABEL:fig:convergence_behavior(b))。

Refer to caption
图 3:吸引子模型概览。主干模块将输入嵌入映射为输出侧提议 。然后,吸引子模块通过基于提议的条件迭代对该提议进行精炼,直至收敛到近似平衡态或达到求解器最大步数。平衡态通过共享的反嵌入 进行解码。

吸引子模块对输出嵌入进行精炼。吸引子模块是一个独立的权重共享精炼网络 。从主干模块的提议 开始,它根据以下规则反复精炼输出嵌入:

(2)

在这里,我们在每一个精炼步骤中都持续注入初始猜测。这种持续注入使得吸引子依赖于提议,并防止其坍缩为一个与提议无关的固定点。我们在第 4 节中消融了这一条件机制。重要的是,我们从一个信息丰富的提议出发对吸引子模块进行热启动,这与现有工作中将循环状态初始化为零或高斯噪声等无信息值的做法形成对比(geiping; parcae);对比结果见表 LABEL:tab:ablation_init。

我们并非通过展开循环步骤来达到固定点,而是直接求解收敛:

(3)

在前向传播中,我们使用一个以主干网络提议为初始值的求根器来计算这个均衡点。在我们的实现中,RootFind 算法采用了 Anderson 加速,它结合一小部分历史迭代步和残差,比普通递归更快地达到固定点。求解器在残差达到阈值或经过一定步数后退出。因此,计算过程由残差的收敛性控制,而非由学习到的终止头或预设的循环次数控制。与固定展开方式不同,精炼步骤的数量可以在推理时变化,而无需改变模型。最后,均衡嵌入通过绑定的解嵌入进行解码。

吸引子模型的参数包括绑定的嵌入/解嵌入矩阵、主干模块以及吸引子模块的参数:。与循环模型相比,吸引子模型改变了循环的起点和终点:我们从主干网络输出的猜测初始化循环,而解码后的状态是吸引子,而非有限次展开的结果。

3.2 吸引子模型的训练与推理

现在我们描述吸引子模型的训练流程。我们首先解释如何通过隐式微分对固定点求解器进行求导,然后展示模型如何通过应用于输出的标准交叉熵语言建模损失进行优化。

反向传播与隐式微分。由于吸引子模型将输出嵌入定义为不动点方程的解,我们通过隐函数定理(krantz2002implicit)对平衡态进行微分。设 表示训练损失,并设 。将隐函数定理应用于 可得

(4)

关于 的导数包含对吸引子参数 的直接依赖,以及通过主干网络参数 和共享嵌入参数 对初始化的依赖。

遵循隐式模型(phantomgradient; jfb)的先前工作,我们采用一步近似 。这避免了额外的线性求解 ,并将反向传播简化为一次通过 的向量-雅可比乘积。由于我们不对每个求解器步骤进行反向传播,吸引子模块中的内存不会随前向迭代次数增长。在第 4 节中,我们展示了 Anderson 求解器仅带来微乎其微的质量提升,而一步近似则能实现大幅降低的训练成本。

备注。吸引子模型是遵循 DEQ(deq)精神的隐式平衡模型,但平衡态扮演的角色不同。经典 DEQ 用隐藏状态平衡(单层)替换预测网络,并通过单独的输出头进行解码。我们则保留标准的因果 Transformer 主干网络,并在其预测状态之上添加一个平衡精炼模块。不动点直接位于共享嵌入空间中,因此每一次迭代都已经是输出空间中可解码的表示。这带来了三个实际差异:(i) 求解器从语义上有意义的提议初始化,而非从零等无信息状态(如 DEQ 中)初始化;(ii) 推理可根据残差容差停止,而非固定深度或学习到的停止头;(iii) DEQ 表明增加 DEQ 模块数量会损害其方法性能,而我们允许任意深度的主干 Transformer,并证明可以使用可变数量的求解器模块。

媒体内容 · 前往原文查看
算法 1 训练吸引子模型。

1:输入 tokens ,参数 ,容差 ,最大迭代次数

2:// 前向传播

3:绑定 token 嵌入

4:主干网络提议/初始化

5:定义

6:

7:绑定解嵌入与 softmax

8:// 反向传播,给定

9:通过以下方式求解

10:

训练目标与推理。我们使用标准的下一个 token 预测交叉熵损失函数来训练吸引子模型,该损失函数应用于固定点输出。推理过程复用相同的均衡计算。给定输入序列后,主干网络首先生成提议,吸引子求解器计算,然后绑定解嵌入将其解码为下一个 token 的概率。峰值内存受限于吸引子模块的单次前向传播,并且主干网络可应用标准的 KV 缓存机制。原则上,求解器容差和最大迭代预算属于推理时的超参数:它们可以在不重新训练模型的情况下进行调整,从而将测试时计算转化为逼近已学习吸引子的预算。然而,有趣的是,我们发现训练好的吸引子模型通常只需要极少的测试时精炼,我们将在下一节中对此进行描述。

3.3 吸引子模型中的均衡内化与稳定性

尽管吸引子模型通过均衡来定义预测,但我们观察到一个令人惊讶的现象:训练之后,主干网络的提议通常接近均衡(参见图 LABEL:fig:convergence_behavior 和图 LABEL:fig:accuracy_vs_T)。我们将此现象称为均衡内化。直观地说,吸引子模块似乎充当了主干网络的移动教师,从而形成了一种自动课程学习。在训练早期,提议可能远非良好的预测,求解器必须执行非平凡的优化才能达到。由于和位于相同的绑定输出嵌入空间中,通过均衡的梯度也会训练主干网络的提议向求解器本应找到的状态移动。因此,当主干网络具有足够表达能力时,大部分预测工作可以内化到中,而吸引子则负责执行稳定的精炼。

稳定性。均衡训练还会将循环映射偏向收敛动力学。隐式梯度包含逆因子,该因子在非收缩区域附近会变得病态。这形成了对不稳定不动点动力学的屏障,这与固定循环训练不同——后者可以学习仅在指定步数下准确、但在额外推理循环下会失败的轨迹。我们在附录LABEL:subsec:fall中详细讨论了这一对比。关于吸引子模型的理论分析以及与有限循环模型的比较,请参阅附录LABEL:sec:theory。

4 实验

我们在两种场景下评估吸引子模型。首先,我们研究跨模型规模的语言建模,与参数匹配的Transformer和循环语言模型基线进行比较。我们评估了扩展行为、下游准确率和训练效率。我们还展示了在硬推理任务上的结果,测试相同的不动点精化机制是否能在需要迭代计算的问题上改进小模型。

4.1 吸引子模型改进大规模语言建模

实验设置。我们遵循Parcae(parcae)用于其主要Transformer对比的nanochat(nanochat)预训练方案,在FineWeb-Edu(fineweb)上进行训练。为确保公平比较,所有模型在参数量上匹配,并使用与Parcae基线相同的数据预算、优化器和学习率调度进行训练;唯一的改变是循环模块。我们在三个规模上进行比较:140M、370M和770M参数。Parcae是一种带有前奏、尾声和循环模块的中等循环语言模型。该模型的稳定性来自一个线性注入,它将循环的谱半径限制在1以下。相比之下,我们的架构使用标准Transformer模块后接一个不动点迭代模块,让求解器自身控制有效深度。详细的超参数设置见附录LABEL:sec:hyperparam。

参数规模扩展。我们展示了大规模预训练如何随模型规模扩展。我们在1.4亿、3.7亿和7.7亿参数规模上,将我们的方法与参数匹配的Transformer以及循环语言模型Parcae进行了对比评估。我们的模型性能随规模扩大而单调提升。在所有三种规模下,我们的方法均取得了最佳的验证集困惑度、Lambada困惑度和CORE准确率。这些结果表明,我们的不动点精化方法能随模型规模干净地扩展,尤其在Lambada上增益显著——迭代精化大幅提升了长上下文预测能力。

表1:大规模语言建模的参数规模扩展结果。我们的吸引子模型在几乎所有基准测试上均优于标准Transformer和循环模型Parcae。我们的7.7亿参数模型性能与参数数量近两倍、训练token数量翻倍的标准Transformer相当。箭头表示相对于参数匹配的标准Transformer基线的相对提升幅度。箭头表示相对于参数匹配的Transformer基线的相对提升幅度。
\arrayrulecolorTableRule 规模 模型 验证集困惑度 Lambada困惑度 Core Core-Ext.
\arrayrulecolorTableRule 1.4亿 Transformer 21.48 127.39
Parcae 19.06 80.64
吸引子模型(我们的) 18.30 14.8% 68.02 46.6% 12.2% 14.0%
\arrayrulecolorTableRule 3.7亿 Transformer 15.79 40.77
Parcae 14.49 32.74
吸引子模型(我们的) 14.03 11.1% 27.14 33.4% 15.9% 7.9%
\arrayrulecolorTableRule 7.7亿 Transformer 13.08 22.37
Parcae 12.49 19.71
吸引子模型(我们的) 12.09 7.6% 15.21 32.0% 19.7% 8.6%
\arrayrulecolorTableRule 13亿 Transformer 11.95 17.26

训练效率:更低的FLOPs。单步IFT反向传播使训练内存在求解器迭代次数上保持恒定。标准循环语言模型(如Parcae)的内存量随循环次数线性增长。总训练FLOPs(图4)呈现相同趋势:尽管我们循环块的每一步计算成本与Parcae大致相当,但我们的求解器通常在远少于其步数内收敛,因此训练期间的实际深度更低(尽管相同),从而在各规模下实现25%–31%的训练FLOPs降低。

Refer to caption
图 4:训练时效率。尽管采用了循环架构,但我们的方法比 Parcae 减少了 25–31% 的 FLOPs,这是因为不动点求解器通常会在收敛后提前停止,且反向传播使用了单步隐式梯度近似。

训练效率:O(1) 内存。我们方法的另一个优势在于,训练所需内存不随迭代次数增加而变化(图 5)。这是因为我们的隐式反向传播无需存储每次循环步骤的中间激活值。相比之下,标准循环语言模型必须对每个展开的迭代进行反向传播,导致内存使用量随循环次数线性增长。

Refer to caption
图 5:峰值训练内存与循环深度对比。吸引子模型的内存几乎保持恒定,而 Parcae 的内存则随循环次数增加而增长。

4.2 吸引子模型在困难推理任务中带来显著提升

除了语言建模,我们还在 (hrm; trm) 中的 Sudoku-Extreme 和 Maze-Hard 这两个具有挑战性的推理基准上训练和评估了吸引子模型。在这些任务中,非循环 Transformer 和大多数前沿大语言模型均无法成功完成。

实验设置。我们为每个任务训练了约 1000 个训练样本的小型模型,并要求在单次直接前向传播中预测完整的输出网格(无自回归解码)。我们遵循 TRM 训练协议 (trm),使用深度监督步骤。

方法。TRM 在深度监督步骤中携带两个隐变量——当前答案和推理状态——并每步应用一个微小的两层网络 次来更新它们。我们保留了这一协议,但修改了内部更新方式。具体来说,我们不再展开多次应用,而是直接用我们的求解器求解更新的不动点。初始化由深度监督本身处理:上一步的 为下一步的求解器提供初始化,第零步则使用一个学习到的嵌入向量,因此我们不需要单独的主干网络。

我们在表 4.2 中展示了结果。固定深度 Transformer 在两个任务上均失败。HRM(27M)在 Sudoku-Extreme 和 Maze-Hard 上分别达到 55.0% 和 74.5%。TRM 是 7M 参数下最强的小型基线,达到 74.7% 和 85.3%,但(与扩展目标相反)当参数扩展到 27M 时,在两个任务上均崩溃至 0%。我们的模型随参数量自然扩展。我们将差异归因于显式的定点目标,它似乎提供了在高容量下单纯迭代精炼所缺乏的正则化。

对于反向传播,我们使用幻影梯度方案(phantomgradient),而非语言模型实验中使用的单步近似。这一选择在小数据推理场景中至关重要:仅有 1000 个训练样本且网络规模小得多时,求解器动态更加敏感,单步替代方案可能提供过于粗糙的训练信号。这与 TRM 一致,其报告称将反向传播替换为单步近似后,Sudoku-Extreme 准确率从 87.4% 降至 56.5%(trm)。

媒体内容 · 前往原文查看
表 2:在 Sudoku-Extreme 和 Maze-Hard 上的小模型及样本训练结果。与性能下降的标准小型递归模型相比,我们的吸引子模型在扩展参数量时表现提升。

\arrayrulecolor

TableRule

对 770M 吸引子模型和 Parcae 启用梯度检查点;对 Transformer 禁用。对 Transformer 和 Parcae 启用 torch.compile;对吸引子模型禁用(隐式梯度钩子与编译不兼容)。

媒体内容 · 前往原文查看
表 10:Parcae 循环超参数。
超参数 140M 370M 770M
注入类型 对角
状态初始化 类初始化
平均循环次数 8 8 8
平均反向传播深度 4 4 4
采样方案 泊松截断完整
迭代方法 按序列
前奏归一化 ✓

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org