跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-05-27精选AI 评分71

DenoiseRL:通过恢复嘈杂前缀来引导推理模型

DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes

AI 导读

DenoiseRL是一种强化学习框架,旨在提升大语言模型的推理能力。它无需依赖更强的教师模型或精心筛选的困难数据集,而是通过在弱模型产生的失败推理轨迹上进行基于恢复的优化来直接学习,将错误转化为改进机会。这种方法提供了更丰富多样的学习信号,提升了探索效率。实验表明,DenoiseRL在竞争性的数学和通用推理基准测试中,持续优于强在策略RL基线,并能随着训练难度增加促进更强的自我纠正行为。

推荐理由

做 RL for reasoning 的团队该看这篇,它把训练信号从“依赖强模型”转向“从弱模型的错误中学习”,可能降低对昂贵 teacher 的依赖,是个架构层面的新思路。

正文 · AI 翻译
摘要

强化学习已成为推动大语言模型推理能力发展的核心范式,然而现有方法大多仍依赖于更强的教师模型或经过精心筛选的困难数据集,这限制了能力的可扩展提升。本文提出 DenoiseRL,一种强化学习框架,它通过基于弱模型失败案例的恢复导向优化来替代外部监督。DenoiseRL 不依赖更强的监督或精心设计的数据,而是直接从错误的推理轨迹中学习,将其转化为改进的机会,从而使训练更具可扩展性,并减少对外部资源的依赖。这产生了更丰富、更多样化的学习信号,提升了从非完美模型行为中进行探索的效率。因此,DenoiseRL 在提升推理性能和整体训练效率的同时,降低了对昂贵数据筛选或更强教师模型的需求。实验表明,在具有挑战性的数学和通用推理基准测试中,DenoiseRL 持续优于强在线策略 RL 基线,并且随着训练难度的增加,能促进更强的自我修正行为,这突显了一条有效且可扩展的、用于改进大语言模型推理能力的替代路径。

\checkdata

[Github]https://github.com/ALEX-nlp/DenoiseRL ††footnotetext: †通讯作者。

1 引言

强化学习已成为大语言模型(LLM)的核心后训练范式,推动了复杂推理任务的重大进展 [27, 11, 34, 1, 22, 8]。尽管取得了这些成功,最先进的系统通常仍依赖于来自更强模型的监督或指导 [43, 39, 9]。这种依赖性暴露了一个结构性局限:当没有足够强大的现成教师模型可用时,进一步的能力提升将变得愈发困难,这引出了一个根本性问题:如何在不依赖更强模型作为监督者的情况下获得强模型?

为应对这一挑战,先前的研究主要探索了两个方向。第一个方向是弱到强范式,即利用从较弱模型获得的监督信号来改进较强模型[4, 21, 7]。虽然该方法在实践中有效,但其性能从根本上受限于教师信号的质量,且容易在训练过程中引入噪声[41, 15, 38]。第二个方向则侧重于通过数据构建来增加任务难度[42, 20, 35],包括合成更困难的问题、生成对抗样本以及构建更长的推理轨迹。然而,这些方法通常依赖于精心设计的流水线、复杂的过滤与验证流程,以及在数据设计与整理方面投入大量人力。

在本工作中,我们提出了 DenoiseRL,一种将弱到强学习与难度驱动的数据合成相统一的新型强化学习范式。我们并非利用弱模型来合成困难数据或提供学习信号,而是将弱模型重新用作结构化扰动的生成器,从而在不生成新数据的情况下自动提升训练难度。这使得推理能力能够在不依赖外部监督和人工整理的困难数据集的情况下实现可扩展的提升。同时,该方法将推理强化学习视为一个去噪问题:弱模型的错误作为推理轨迹的结构化污染,而策略模型则学习从这些被污染的状态中重建出有效的求解路径,这与去噪自编码器及 BART 风格预训练的原理相呼应[32, 17]。

Refer to caption
图 1:DenoiseRL 的示意图。首先,一个弱模型生成一条错误的求解路径。然后,我们将策略模型的条件设定为该错误轨迹的一个截断前缀,引导它从一个错误的推理状态继续推理,而非将弱模型作为教师进行模仿。强化学习训练策略模型从这一死胡同前缀中恢复——修正其推理过程,切换到正确的求解路径上,并最终得到经过验证的答案。

具体而言,如图 1 所示,我们从弱模型中采样带有噪声的推理前缀,并将其注入策略模型的生成过程中 [25]。随后,策略模型被优化以去噪这些被破坏的前缀,并正确完成推理轨迹。我们选择前缀作为注入点,是因为它在塑造后续推理轨迹方面发挥着不成比例的重要作用。先前的研究表明,高质量的前缀可以引导策略模型走向更有利的推理状态,并通过前缀级别的条件设定或优化来提高强化学习效率 [6, 29]。DenoiseRL 则反转了这一视角:我们将弱模型的错误前缀作为结构化噪声注入,从而控制推理的起始状态,并迫使策略模型从被破坏的中间状态中恢复。这一机制引发了两种紧密耦合的效果。首先,它极大地扩展了训练状态的多样性,因为带噪声的前缀所涵盖的失败模式空间远比正确轨迹广阔,使策略模型暴露于标准在线强化学习中很少遇到的离策略上下文 [14, 5, 36]。其次,它直接强化了一项关键但尚未充分发展的能力:从错误中恢复。模型不再沿着错误的中间结论继续推理,而是被要求明确地修正和纠正其推理过程。通过将错误前缀嵌入优化目标,DenoiseRL 将自我纠正从一种涌现行为提升为直接的训练目标 [12, 33]。

在我们的实验中,我们发现了两个重要的设计经验。第一,噪声不应被任意增强:过长的错误前缀可能导致模型陷入过度思考,表现为更长的自我纠正循环以及推理过程中不确定性的增加。第二,更新离策略前缀会导致训练不稳定,这与近期的观察结果 [16, 26] 一致,即 PPO 风格的目标函数对严重离策略的 token 较为敏感。

我们将贡献总结如下:

  • •

    我们提出了 DenoiseRL,一种基于去噪的强化学习范式,它利用弱模型的错误作为带噪声的前缀,并训练更强的策略模型从中推理并摆脱错误。

  • •

    我们证明,DenoiseRL 在竞争性数学和通用推理基准测试中,能够持续提升 GRPO 和 DAPO 的性能。

  • •

    我们分析了去噪训练中的关键设计因素,包括离策略前缀掩码、恢复强度以及前缀引发的过度思考。

2 相关工作

通过在线策略强化学习引导推理能力。

基于结果和过程的强化学习已取代监督微调,成为扩展推理能力的主要方法 [22, 13, 8]。GRPO [27] 和 DAPO [40] 等框架推动了这一进展,但它们从根本上受限于模型自身生成的状态分布。一旦策略趋于饱和,它主要生成正确的轨迹或狭窄的失败模式,从而造成探索瓶颈,此时有信息量的失败样本过于稀少,无法产生有意义的梯度更新 [14, 5, 19]。

弱到强泛化(W2SG)。

为了突破能力瓶颈,W2SG [4, 28, 7] 利用较弱模型来监督能力更强的学生模型。然而,这种范式从根本上限制了学生模型的上限:强策略被优化为模仿伪标签,因此容易受到弱监督者的噪声和有限能力的影响 [38]。DenoiseRL 并未将弱模型视为不完美的“神谕”,而是反转了其角色,将其严格用作一个低成本生成分布外错误的工具。

前缀条件化与离策略探索。

另一类工作通过向强化学习中注入外部前缀或离策略轨迹来改进探索。LUFFY [36] 将离策略推理轨迹与在线策略强化学习混合,而 PrefixRL [25] 则基于成功的离策略前缀进行条件化,并优化剩余的续写部分。更广泛地说,前缀和轨迹引导的方法利用专家解决方案、神谕提示、成功轨迹或失败状态,使稀疏奖励问题更易求解 [23, 29, 14]。DenoiseRL 的不同之处在于,它使用弱模型生成的错误前缀,并非作为示范或特权提示,而是作为具有误导性的推理状态,策略必须从中恢复。

3 方法

我们提出 DenoiseRL,一种去噪推理框架,用于训练大语言模型从错误的中间推理状态中恢复。第 3.1 节正式介绍了去噪推理任务及其前缀条件生成。第 3.2 节给出了用于训练去噪行为的强化学习目标。

3.1 去噪推理

现有的面向推理的强化学习方法主要通过提升监督质量来改进性能,例如依赖更强的教师模型或精心挑选的困难样本。然而,获取此类监督通常成本高昂且难以规模化。此外,真实的推理过程经常涉及需要修正和恢复的错误中间状态,而这一能力在标准强化学习中并未得到明确训练。这促使我们需要一种训练范式,能够明确教会模型如何从带噪的推理轨迹中恢复。

为此,我们引入了去噪推理,它将来自弱模型的错误中间推理状态视为一种结构化噪声。具体来说,将一个错误的局部解前置到策略模型的生成过程之前,并训练策略模型从这种受损状态出发继续推理,直至得出正确答案。在此框架下,错误前缀既充当了从弱到强的扰动信号,也作为一种低成本机制来增加推理难度。

具体而言,我们从弱模型中采样候选解,并保留验证器判定为错误的那些解。这作为离线预处理步骤在训练集上一次性完成,因此该池在整个强化学习训练过程中是固定的,且不会产生额外的每步成本。

对于在多次尝试中弱模型从未生成过格式正确的错误答案的问题,该池为空。在这种情况下,这些问题的去噪槽位将被替换为额外的标准主轨迹。

3.2 用于从噪声前缀中恢复的强化学习

为了训练模型获得去噪能力,每个训练步骤除了标准的同策略轨迹外,还会采样去噪轨迹,这对应于从带噪前缀中恢复的训练目标。设从训练集中采样一个问题,并设 为我们要优化的策略模型。我们定义:

  • •

    主轨迹(每个问题 )是标准的同策略轨迹:

    (1)
  • •

    去噪轨迹(每个问题 )从一个部分带噪前缀开始。我们抽取一个错误解答,并在固定前缀比例策略(超参数为 )下,保留其前

    (2)

    个 token 作为助手消息 。策略随后从这个异策略前缀继续生成:

    (3)

输出预算与折叠。

由于两种轨迹类型应共享相同宽度的响应窗口 以实现公平比较,且前缀已消耗该预算中的 个 token,因此去噪轨迹被折叠,使得可见响应为

(4)

其中 表示最大响应长度, 是已生成的 token 数, 是保留的续写长度,超出长度公平预算的尾部 p 个 token 被丢弃。验证器应用于完整的折叠响应 ,因此根据策略在条件于带噪前缀后是否成功得出正确答案来分配奖励。在训练期间,我们也仅更新同策略续写部分,以训练模型从带噪前缀中恢复。

Token 级 GRPO 目标。

由于去噪轨迹为易于处理的问题提供了负样本,使得正样本能够携带有效的学习信号,我们使用组相对策略优化(GRPO)[27] 优势函数,该函数对同一问题的所有轨迹共享其基线。设 索引与 关联的轨迹组,其终端奖励为 。轨迹级优势为

(5)

设 表示 token 的上下文(对于主轨迹为 ,对于去噪轨迹为 ),每个 token 的重要性比为

(6)

轨迹级裁剪替代目标 [24] 为

(7)

两个分布上的联合目标。

我们的最终目标是在问题分布和两种 rollout 分布上的联合期望。将两种响应生成分布记为 和 ,总体目标为

(8)

其中两个目标分量定义为:

(9)
(10)

这一公式可以理解为在混合训练分布下优化策略:模型同时被鼓励从头开始解决问题,以及从被破坏的中间推理状态中恢复。

我们在每一步实际优化的蒙特卡洛估计量是 的自然样本均值,定义为:

(11)

其中, 是每批的问题数量, 表示主 rollout, 表示 的去噪 rollout。因此,两种 rollout 类型以 和 加权的混合形式贡献,在每个问题内共享同一个优势基线,并且只更新模型自身生成的 token 上的策略。

4 实验

媒体内容 · 前往原文查看
表 1:数学和推理基准上的主要结果。对于 AMC23、AIME2024 和 AIME2025,我们报告 AVG@16;对于 MATH500 和 BBEH,我们报告 AVG@1。结果按基础模型分组。每组内,最佳结果以粗体显示,次佳结果以下划线标出。并列次佳结果均以下划线标出。
方法 MATH500 AMC23 AIME24 AIME25 BBEH 平均
Qwen3-4B-Base
基础 70.0 43.1 8.3 7.7 4.1 26.6
GRPO 83.6 63.1 22.1 18.1 11.1 39.6
DAPO 83.8 62.5 20.6 21.5 10.4 39.8
DenoiseRL-GRPO 85.8 61.4 24.8 23.3 14.8 42.0
DenoiseRL-DAPO 84.6 63.6 21.9 21.7 15.7 41.5
Qwen3-8B-Base
基础 70.4 49.2 11.9 10.8 4.1 29.3
GRPO 87.8 69.7 24.0 22.9 10.6 43.0
DAPO 87.0 69.7 23.8 21.7 11.7 42.8
DenoiseRL-GRPO 87.2 70.3 24.6 23.1 11.5 43.3
DenoiseRL-DAPO 88.2 71.4 27.0 24.8 12.6 44.8

4.1 设置

噪声前缀收集。

我们使用 Qwen2.5-1.5B-Instruct [37] 作为弱模型来收集错误的推理轨迹,在 MATH-7.5K [10] 上对模型进行采样,每个问题采样 8 次 rollout,经过筛选后得到错误的轨迹。

强化学习。

我们在 MATH-7.5K 数据集上,以 Qwen3-4B-Base 和 Qwen3-8B-Base [31] 作为策略模型进行训练。在恢复训练中,每个问题都通过标准的同策略 rollout 和以 token 数为响应长度的去噪 rollout 进行采样。去噪 rollout 使用带噪声的前缀进行初始化,并采用固定的前缀比例。所有训练均使用提示词批次大小 、学习率 ,且不添加 KL 损失或长度损失。PPO [24] 的裁剪范围设为 。训练过程中,我们以温度 和 top-p 进行采样。训练提示词见附录 A。

评估。

我们在数学推理基准上评估模型,包括 MATH500 [18]、AMC23 [3]、AIME2024、AIME2025 [2] 和 BBEH [30]。验证解码使用温度 、top-p。对于 AIME2024、AIME2025 和 AMC23,我们报告 AVG@16 指标;其余基准报告 AVG@1 指标。

基线。

我们将恢复训练与基础模型以及两个强化学习基线——GRPO [27] 和 DAPO [40]——在 Qwen3-4B-Base 和 Qwen3-8B-Base 上进行了比较。

4.2 结果

表 1 报告了两种模型规模和两种强化学习主干下的主要结果。DenoiseRL 在 Qwen3-4B-Base 和 Qwen3-8B-Base 上,均持续提升了 GRPO 和 DAPO 的平均性能,表明所提出的恢复训练不依赖于特定的模型大小或优化主干。

在 Qwen3-4B-Base 上,DenoiseRL-GRPO 将 GRPO 基线的平均得分从 提升至 ,在 MATH500、AIME2024、AIME2025 和 BBEH 上均有明显提升。DenoiseRL-DAPO 相比 DAPO 也有改进,平均得分从 提升至 。值得注意的是,DenoiseRL-DAPO 在 AMC23 和 BBEH 上取得了最佳性能,而 DenoiseRL-GRPO 则获得了最佳总体平均分。这些结果表明,去噪 rollout 为标准强化学习提供了互补的训练信号,尤其是在较难的推理基准上。

同样的趋势在 Qwen3-8B-Base 上依然成立。DenoiseRL-GRPO 将 GRPO 基线从 [原文缺失] 提升至 [原文缺失],在所有 8B 模型中取得了第二好的平均性能。同时,DenoiseRL-DAPO 将 DAPO 从 [原文缺失] 提升至 [原文缺失],并在所有评估基准上取得了最佳结果。总体而言,在两个模型规模和两种 RL 骨干网络上的改进表明,DenoiseRL 是一种用于增强推理模型的通用训练策略,而非单一实验设置下的孤立收益。

4.3 噪声强度

为了探究训练过程中噪声强度如何影响策略模型,在本实验中,我们基于 Qwen3-4B-Base 和 GRPO RL 骨干网络,使用两个超参数进行实验:前缀比例(prefix ratio)和去噪 rollout 数量(number of denoise rollouts)。

Refer to caption
图 2:不同前缀比例下,采用去噪 rollout 时的平均响应长度。较大的前缀比例会导致更长的生成序列和更频繁的长度尖峰,表明在恢复过程中存在过度思考现象。

图 2 比较了相同去噪 rollout 数量下的情况。温和设置(mild setting)保持相对紧凑,最后 100 个训练步的平均响应长度为 [原文缺失] K tokens。相比之下,[原文缺失] 将同一统计量提升至 [原文缺失] K tokens,并在训练过程中达到了 4096 token 的预算上限。中间设置(intermediate setting)在长度上也不稳定,最后 100 步的平均长度为 [原文缺失] K tokens。通过仔细检查,我们发现了一个有趣的实证现象:更大的前缀截断比例会引发更明显的过度思考行为、无休止的自我怀疑和验证,如图 3 所示。由于极高的噪声比例可能导致轨迹偏离正确答案过远,模型会对其自身响应变得更加怀疑。一旦模型得出一个看似合理的答案,它可能会继续验证、重写或重新启动推导过程,而不是停止。

Refer to caption
图 3:第 1000 步时一个典型的高前缀 rollout([原文缺失],[原文缺失])。保留的噪声前缀错误地识别了数字位置;策略模型将其延续至一个错误答案,然后反复回溯并重新检查推导过程,而不是停止。

接下来,我们在固定 的情况下,改变去噪展开(denoise rollouts)的数量。为了保持每步采样预算大致相当,我们随着 的增加而减少标准在线策略展开(on-policy rollouts)的数量,因此更大的 意味着每个批次中去噪轨迹所占比例更高。

Refer to caption
图 4:在 Qwen3-4B-Base 上使用 GRPO 时,不同去噪展开数量下的基准测试收益,其中 。 带来了最强的整体改进; 对恢复(recovery)监督不足,而 则过度强调恢复,损害了从头解决问题这一主要目标。

图 4 总结了下游影响。当每个问题只有 次去噪展开时,纠正信号过于稀疏,无法可靠地教会恢复:平均增益为 。在另一个极端, 将一半的采样轨迹分配给了恢复,这分散了解决问题的学习信号,产生了最弱的整体结果 ,平均增益为 。平衡的设置 实现了最佳权衡,平均增益最高达到 ,并且在最难的基准测试(包括 AIME24 和 AIME25)上取得了最强峰值 。这些结果表明,恢复强度必须与标准 RL 目标联合调整:过小则收益甚微,过大则会使优化偏离解决问题的核心目标。

媒体内容 · 前往原文查看
表 2:长度公平输出预算()对 Qwen3-4B-Base 在 和 条件下的影响。加粗项为每个基准测试中的更优分数。
折叠模式 MATH500 AMC23 AIME2024 AIME2025 BBEH 平均
长度公平 85.8 61.4 24.8 23.3 14.8 42.0
无长度上限 84.2 60.6 18.8 24.2 13.5 40.2

4.4 离策略前缀(Off-policy Prefix)

由于完整的推理轨迹由离策略前缀和模型续写部分组成,本消融实验旨在探究是否也应更新离策略前缀。我们的默认 DenoiseRL 设置仅通过去噪展开中的在线策略续写 token 进行反向传播:离线噪声前缀对奖励验证器可见,但在 PPO 损失中被屏蔽。具体来说,我们将前缀 token 的响应掩码设置为 ,使得梯度流经整个折叠响应。

Refer to caption
图 5:当 PPO 更新应用于离策略噪声前缀时出现的训练崩溃。(a) 在 MATH500、AMC23、AIME24、AIME25 和 BBEH 上的平均验证准确率。(b) 平均响应长度(25 步移动平均)。

图 5 显示,更新离策略前缀是不稳定的。验证准确率在训练初期有所提升,在第 步达到平均峰值,但在第 步之后急剧下降,并在第 步之前在所有基准测试上崩溃。与此同时,平均响应长度首先缩减至约 个 token,随后激增并饱和在 个 token 的预算上限。

我们将此失败归因于当前策略下离线噪声前缀的对数概率分布与生成该前缀的行为策略下的对数概率分布之间存在巨大不匹配。将这些严重偏离策略的 token 应用于 PPO 比率(公式 6),会注入噪声大、方差高的梯度更新,从而破坏推理质量和长度控制的稳定性,这与先前关于语言模型强化学习的研究结果一致 [16, 26]。

媒体内容 · 前往原文查看
表 3:Qwen3-4B-Base 上每个训练步骤的平均训练时间。
方法 展开次数 / 问题 时间(秒 / 步)
GRPO 基线 在策略
DenoiseRL-GRPO
媒体内容 · 前往原文查看
表 4:一个具有代表性的恢复案例。红色文本标记了噪声前缀中的关键错误,而粗体文本则突出了模型续写中的恢复行为。
部分 内容
问题 一所学校的学生人数在 到 之间。如果一名学生缺席,剩余学生可以平均分成六个班。所有可能的入学人数之和是多少?
噪声前缀 设学生人数为 。由于一名学生缺席, 可被 整除,因此 且 。[省略:对 的几次尝试代入] 对于 ,由于 , 在 和 之间。对于 ,由于 , 在 和 之间。[省略:下方更多无效候选值] 因此, 的可能值为 ,总和为 。
模型续写 让我们逐步重新评估问题,以确保找到满足给定条件的所有可能的 值。由于 ,我们有 和 。现在,找出所有满足 的整数 :,因此 且 ,即 。由于 必须是整数, 的取值范围是从 到 的整数。对应的 值为 。最后,,因此最终答案是 1575。

4.5 输出预算的公平性

为了与主 rollout 保持公平对比,我们的默认折叠策略强制执行(公式 (4)):一旦前缀消耗了 token,保留的续写部分将被截断至最多 token。为了探究保持输出预算公平性的必要性,本消融实验保留了完整前缀和所有生成的 token,因此一次去噪 rollout 最多可暴露总计 token。

表 2 显示,长度公平设计是有效的。没有预算上限时,去噪 rollout 获得了超出主 rollout 共享的 token 窗口之外的额外生成能力,这使整体结果平均下降了百分点( vs. )。这一差距表明,不公平的长恢复预算会鼓励冗长但可靠性较低的推理。强制执行 可使两种 rollout 类型处于平等地位,并带来更强的性能。

4.6 训练时间效率

为了研究我们方法的时间效率,我们报告了在 Qwen3-4B-Base 上使用 MATH-7.5K 和 batch size ,在 H100 上每个优化器步骤的训练时间,记录自与我们主要运行相同的基础设施。DenoiseRL 在 和 条件下,每个问题使用 on-policy rollout 加上去噪 rollout;GRPO 基线采样 on-policy rollout,因此两种方法保持了可比的每步 rollout 预算。

Refer to caption
图 6:训练期间的平均 rollout 长度。DenoiseRL 续写部分减去了平均离线前缀长度;橙色虚线曲线是完整的折叠响应(前缀 + 续写)。GRPO 没有前缀,因此其曲线是完整的响应长度。

表 3 显示,DenoiseRL 每步略慢( 秒 vs. 秒)。图 6 解释了这一差距的部分原因:在最后几个训练步骤中,DenoiseRL 生成的续写 token 比 GRPO 更多,因为去噪 rollout 增强了模型重新思考和修复推理的能力。因此,折叠轨迹在采样和反向传播时更长,这自然增加了挂钟时间,即使每步 rollout 数量与 GRPO 相同。尽管有这一适度开销,恢复训练仍保持在相同的成本范围内,并带来了更高的下游准确率。

4.7 案例研究

本案例研究的目的是检验 DenoiseRL 是否真正引发了去噪和恢复行为,而不仅仅是促使策略从带有噪声的前缀继续生成。具体而言,我们检查了一个生成轨迹,其中前缀包含部分正确的推导过程,但由于枚举错误而得到了错误答案。如表 4 所示,模型的后续生成并未沿袭错误的结论。相反,它重新检查了核心约束条件,重新计算了可行范围,并修正了最终答案。

这表明,去噪生成轨迹教会了模型将弱模型的错误视为扰动:策略学会了保留有用的部分推理过程,同时纠正导致错误答案的失败模式。我们在附录 B 中提供了更多案例。

5 结论

我们提出了 DenoiseRL,这是一种面向恢复的强化学习框架,通过训练模型从弱模型生成的不正确中间推理轨迹中恢复,从而提升推理能力。DenoiseRL 不依赖更强的教师模型或人工整理的困难数据集,而是将弱模型的失败转化为结构化的扰动,这些扰动持续重塑训练分布,并以可扩展的方式增加推理难度。我们的结果表明,以恢复为中心的优化不仅提升了在具有挑战性的推理基准上的性能和训练效率,还增强了模型修正和纠正自身推理过程的能力。此外,在更长的被破坏前缀下出现的更强的过度思考和自我纠正行为表明,恢复训练影响了更深层的推理动态,而不仅仅是简单的性能提升。总体而言,这项工作通过展示模型自身的错误可以作为强大的学习信号来源,为推理模型的可扩展后训练提供了新的视角。

局限性

尽管 DenoiseRL 展现了强大的实证性能,但仍存在若干局限性。首先,所生成扰动的有效性仍然取决于用于生成损坏数据的弱模型的行为。如果弱模型产生的错误过于简单、重复或不切实际,那么由此产生的恢复信号可能提供的训练价值有限,无法带来有意义的推理能力提升。

其次,尽管以恢复为导向的训练增强了模型的自我修正能力,但增加损坏长度也会加剧过度思考行为,导致推理轨迹不必要地延长、推理成本增加以及解码效率降低。因此,在更强的恢复监督与高效推理之间取得平衡,仍是未来工作的重要方向。

附录 A 提示词

附录 B 补充案例

我们提供两个额外的恢复案例,以进一步说明 DenoiseRL 所诱导的行为。为便于阅读,我们省略了一些重复的中间计算,同时保留了由记录的 token 级前缀长度确定的关键前缀-续写边界。红色文本标记了噪声前缀中的错误或失败模式,而粗体文本则突出显示了模型续写中的恢复行为。

表 5 中的第一个案例展示了从误导性的局部概率计算中恢复的过程。前缀包含了有用的结构信息,即存在两个大小为 的部落,但它将问题框架聚焦于单个退出者的概率,而这并非最直接的样本空间。续写部分没有沿着这个有缺陷的方向展开。相反,它明确改变了策略,计算了退出者的无序对,并将有利的同部落对与所有可能的对进行比较。这种行为表明,策略能够从前缀中保留有用的问题事实,同时拒绝一个无效的概率框架。

表6中的第二个案例展示了从低效搜索过程中的恢复。前缀正确地将交集问题转化为三次方程,但随后通过重复的有理根检验来寻找显式根。这对于目标量来说是不必要的,因为问题只要求聚合坐标和。后续部分识别出此路不通,转而使用韦达定理,直接从缺失系数中获取结果。然后,它将这些聚合信息通过线性关系传递回去,以进行计算。结合正文中的案例,这些例子表明,去噪展开(denoise rollouts)所做的不仅仅是鼓励从噪声上下文中继续生成:它们训练模型重新评估当前的推理状态,保留有用的中间结构,并用与解题相关的策略替换有缺陷或低效的局部策略。

媒体内容 · 前往原文查看
表5:一个关于概率推理的补充恢复案例。噪声前缀包含一个错误的局部概率陈述,而后续部分则切换到了正确的计数公式。
部分 内容
问题 真人秀游戏《幸存者》的玩法是将参与者分成两个部落,每个部落人。在第一集中,有两人因想家而退出。如果每个人都有同等机会成为这两名退出者之一,那么两名退出者来自同一部落的概率是多少?
噪声前缀 要确定两名退出者来自同一部落的概率,我们可以将问题分解为几个易于管理的步骤。游戏中共有人,平均分成两个部落,每个部落人。对于部落A,有人。前缀随后指出,某个特定人员退出的概率是,因为从人中选出一人,并考虑剩余的选择。[省略:前缀从局部个体退出者计算开始,而非正确的成对样本空间。]
模型后续生成 由于我们要求的是两名退出者来自同一部落的概率,因此需要采用不同的方法。后续部分构建了正确的样本空间:有利情形是两名退出者均来自部落 A 或均来自部落 B。因此,最终答案为
媒体内容 · 前往原文查看
表 6:代数推理的一个补充恢复案例。噪声前缀尝试了显式求根,而后续部分通过使用韦达定理恢复了正确解法。
部分 内容
问题 函数 和 的图像相交于点 、 和 。若 且 ,计算有序对 。
噪声前缀 由 出发,前缀推导出 。将其代入 得到 ,进而得到 。前缀随后尝试使用有理根定理寻找各个根,测试了 、、、、 等候选值。[省略:若干直接代入验证,表明这些候选值均非根。] 前缀持续搜索显式根,尽管问题只要求计算坐标之和。
模型后续输出 看来有理根定理不易求出根。我们换一种方法。给定 ,后续部分将其写为 。根据韦达定理,有 ,因此 。利用 ,可得 。因此,最终答案为

参考文献

  • Ahmadian 等人 [2024] Arash Ahmadian, Chris Cremer, Matthias Gallé, Marzieh Fadaee, Julia Kreutzer, Olivier Pietquin, Ahmet Üstün, and Sara Hooker. 2024. Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms. Preprint, arXiv:2402.14740.
  • Art of Problem Solving [2025a] Art of Problem Solving. 2025a. Aime problems and solutions.
  • Art of Problem Solving [2025b] Art of Problem Solving. 2025b. Amc problems and solutions.
  • Burns 等人 [2023] Collin Burns, Pavel Izmailov, Jan Hendrik Kirchner, Bowen Baker, Leo Gao, Leopold Aschenbrenner, Yining Chen, Adrien Ecoffet, Manas Joglekar, Jan Leike, and 1 others. 2023. Weak-to-strong generalization: Eliciting strong capabilities with weak supervision. arXiv preprint arXiv:2312.09390.
  • Cai 等人 [2025] Yuzheng Cai, Siqi Cai, Yuchen Shi, Zihan Xu, Lichao Chen, Yulei Qin, Xiaoyu Tan, Gang Li, Zongyi Li, Haojia Lin, and 1 others. 2025. Training-free group relative policy optimization. arXiv preprint arXiv:2510.08191.
  • Chen 等人 [2025] Kang Chen, Yaoning Wang, Kai Xiong, Zhuoka Feng, Wenhe Sun, Haotian Chen, 以及 Yixin Cao。2025 年。大语言模型会发出正确信号吗?来自神经元一致性的证据。预印本,arXiv:2510.26277。
  • Geng 等人 [2026] Scott Geng, Dutch Hansen, 以及 Jerry Li。2026 年。弱到强泛化几乎是不可避免的(在线性模型中)。arXiv 预印本,arXiv:2605.05742。
  • Guo 等人 [2025] Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Peiyi Wang, Qihao Zhu, Runxin Xu, Ruoyu Zhang, Shirong Ma, Xiao Bi, 以及另外 1 人。2025 年。DeepSeek-R1:通过强化学习激励大语言模型的推理能力。arXiv 预印本,arXiv:2501.12948。
  • He 等人 [2025] Zhiwei He, Tian Liang, Jiahao Xu, Qiuzhi Liu, Xingyu Chen, Yue Wang, Linfeng Song, Dian Yu, Zhenwen Liang, Wenxuan Wang, Zhuosheng Zhang, Rui Wang, Zhaopeng Tu, Haitao Mi, 以及 Dong Yu。2025 年。DeepMath-103k:一个大规模、高难度、去污染且可验证的数学数据集,用于推进推理能力。预印本,arXiv:2504.11456。
  • Hendrycks 等人 [2021] Dan Hendrycks, Collin Burns, Saurav Kadavath, Akul Arora, Steven Basart, Eric Tang, Dawn Song, 以及 Jacob Steinhardt。2021 年。使用 MATH 数据集衡量数学问题解决能力。arXiv 预印本,arXiv:2103.03874。
  • Hu [2025] Jian Hu。2025 年。Reinforce++:一种简单高效的对齐大语言模型方法。arXiv 电子预印本,页码 arXiv–2501。
  • Huang 等人 [2024] Jie Huang, Xinyun Chen, Swaroop Mishra, Huaixiu Steven Zheng, Adams Yu, Xinying Song, 以及 Denny Zhou。2024 年。大语言模型尚无法自我修正推理。收录于:国际学习表征会议,卷 2024,页码 32808–32824。
  • Khalifa 等人 [2025] Muhammad Khalifa, Rishabh Agarwal, Lajanugen Logeswaran, Jaekyeom Kim, Hao Peng, Moontae Lee, Honglak Lee, 以及 Lu Wang。2025 年。会思考的过程奖励模型。arXiv 预印本,arXiv:2504.16828。
  • Kim 等人 [2025] Sanghwan Kim, Rui Xiao, Stephan Alaniz, Yongqin Xian, 以及 Zeynep Akata。2025 年。面向多模态大语言模型复杂视觉任务的无训练不确定性引导。arXiv 预印本,arXiv:2510.00705。
  • Lang 等人 [2025] Hao Lang, Fei Huang, 和 Yongbin Li。2025 年。选择性弱到强泛化。预印本,arXiv:2511.14166。
  • Lei 等人 [2026] Shiye Lei, Zhihao Cheng, 和 Dacheng Tao。2026 年。退一步:前缀重要性比率稳定策略优化。预印本,arXiv:2601.22718。
  • Lewis 等人 [2020] Mike Lewis, Yinhan Liu, Naman Goyal, Marjan Ghazvininejad, Abdelrahman Mohamed, Omer Levy, Veselin Stoyanov, 和 Luke Zettlemoyer。2020 年。Bart:用于自然语言生成、翻译和理解的去噪序列到序列预训练。载于《计算语言学协会第 58 届年会论文集》,第 7871–7880 页。
  • Lightman 等人 [2024] Hunter Lightman, Vineet Kosaraju, Yuri Burda, Harrison Edwards, Bowen Baker, Teddy Lee, Jan Leike, John Schulman, Ilya Sutskever, 和 Karl Cobbe。2024 年。让我们逐步验证。载于《国际学习表征会议》,第 2024 卷,第 39578–39601 页。
  • Liu 等人 [2025a] Huanyu Liu, Jia Li, Yihong Dong, Chang Yu, Taozhi Chen, Lecheng Wang, Yongding Tao, Bin Gu, 和 Ge Li。2025a 年。Evocot:克服强化学习中的探索瓶颈。arXiv 预印本,arXiv:2508.07809。
  • Liu 等人 [2025b] Junteng Liu, Yuanxiang Fan, Zhuo Jiang, Han Ding, Yongyi Hu, Chi Zhang, Yiqi Shi, Shitong Weng, Aili Chen, Shiqi Chen, Yunan Huang, Mozhi Zhang, Pengyu Zhao, Junjie Yan, 和 Junxian He。2025b 年。Synlogic:大规模合成可验证推理数据以学习逻辑推理及更多。预印本,arXiv:2505.19641。
  • Liu 等人 [2025c] Yi Liu, Guoyin Wang, Shicheng Li, Feifan Song, 和 Xu Sun。2025c 年。ATLANTIS:通过重要性采样实现弱到强学习。载于《计算语言学协会第 63 届年会论文集(第 1 卷:长论文)》,第 1042–1052 页,奥地利维也纳。计算语言学协会。
  • Ouyang 等人 [2022] Long Ouyang, Jeffrey Wu, Xu Jiang, Diogo Almeida, Carroll Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, 及其他 1 位作者。2022 年。使用人类反馈训练语言模型遵循指令。《神经信息处理系统进展》,35:27730–27744。
  • Qu 等人 [2026] Yuxiao Qu, Amrith Setlur, Virginia Smith, Ruslan Salakhutdinov, 和 Aviral Kumar. 2026. Pope:通过特权在线策略探索学习解决难题的推理能力. arXiv 预印本 arXiv:2601.18779.
  • Schulman 等人 [2017] John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, 和 Oleg Klimov. 2017. 近端策略优化算法. arXiv 预印本 arXiv:1707.06347.
  • Setlur 等人 [2026a] Amrith Setlur, Zijian Wang, Andrew Cohen, Paria Rashidinejad, 和 Sang Michael Xie. 2026a. 复用你的算力:通过基于高度离策略前缀的条件化在难题上扩展强化学习. arXiv 预印本 arXiv:2601.18795.
  • Setlur 等人 [2026b] Amrith Setlur, Zijian Wang, Andrew Cohen, Paria Rashidinejad, 和 Sang Michael Xie. 2026b. 复用你的算力:通过基于高度离策略前缀的条件化在难题上扩展强化学习. 预印本, arXiv:2601.18795.
  • Shao 等人 [2024] Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, 及其他 1 位作者. 2024. Deepseekmath:突破开源语言模型数学推理的极限. arXiv 预印本 arXiv:2402.03300.
  • Somerstep 等人 [2024] Seamus Somerstep, Felipe Maia Polo, Moulinath Banerjee, Yaacov Ritov, Mikhail Yurochkin, 和 Yuekai Sun. 2024. 弱到强泛化的统计框架. 收录于 ICML 2024 下一代 AI 安全研讨会.
  • Sun 等人 [2026] Yiliu Sun, Zicheng Zhao, Yang Wei, Yanfang Zhang, 和 Chen Gong. 2026. 好的开始是成功的一半:基于前缀优化的强化学习用于大语言模型推理. 收录于 AAAI 人工智能会议论文集, 第 40 卷, 页码 33144–33152.
  • Suzgun 等人 [2023] Mirac Suzgun, Nathan Scales, Nathanael Schärli, Sebastian Gehrmann, Yi Tay, Hyung Won Chung, Aakanksha Chowdhery, Quoc Le, Ed Chi, Denny Zhou, 及其他 1 位作者. 2023. 具有挑战性的 Big-Bench 任务以及思维链能否解决它们. 收录于计算语言学协会发现:ACL 2023, 页码 13003–13051.
  • Team [2025] Qwen Team. 2025. Qwen3 技术报告. 预印本, arXiv:2505.09388.
  • Vincent 等人 [2008] Pascal Vincent、Hugo Larochelle、Yoshua Bengio 和 Pierre-Antoine Manzagol。2008 年。通过去噪自编码器提取并组合鲁棒特征。载于《第 25 届国际机器学习会议论文集》,第 1096–1103 页。
  • Welleck 等人 [2022] Sean Welleck、Ximing Lu、Peter West、Faeze Brahman、Tianxiao Shen、Daniel Khashabi 和 Yejin Choi。2022 年。通过学习自我修正来生成序列。arXiv 预印本,arXiv:2211.00053。
  • Xiao 等人 [2025] Changyi Xiao、Mengdi Zhang 和 Yixin Cao。2025 年。Bnpo:Beta 归一化策略优化。预印本,arXiv:2506.02864。
  • Xu 等人 [2026] Caijun Xu、Changyi Xiao、Zhongyuan Peng、Xinrun Wang 和 Yixin Cao。2026 年。Scaler:用于推理的合成可扩展自适应学习环境。arXiv 预印本,arXiv:2601.04809。
  • Yan 等人 [2026] Jianhao Yan、Yafu Li、Zican Hu、Zhi Wang、Ganqu Cui、Xiaoye Qu、Yu Cheng 和 Yue Zhang。2026 年。在离策略引导下学习推理。《神经信息处理系统进展》,38:117157–117186。
  • Yang 等人 [2024] An Yang、Baosong Yang、Binyuan Hui、Bo Zheng、Bowen Yu、Chang Zhou、Chengpeng Li、Chengyuan Li、Dayiheng Liu、Fei Huang、Guanting Dong、Haoran Wei、Huan Lin、Jialong Tang、Jialin Wang、Jian Yang、Jianhong Tu、Jianwei Zhang、Jianxin Ma 及其他 40 位作者。2024 年。Qwen2 技术报告。arXiv 预印本,arXiv:2407.10671。
  • Yao 等人 [2025] Wei Yao、Wenkai Yang、Ziqiao Wang、Yankai Lin 和 Yong Liu。2025 年。从理论与实践中重新审视弱到强泛化:反向 KL 散度与正向 KL 散度。载于《计算语言学协会发现:ACL 2025》,第 2860–2888 页。
  • Yu 等人 [2026a] Linhao Yu、Tianmeng Yang、Siyu Ding、Renren Jin、Naibin Gu、Xiangzhao Hao、Shuaiyi Nie、Deyi Xiong、Weichong Yin、Yu Sun 和 Hua Wu。2026a。KnowRL:通过基于最小充分知识引导的强化学习提升大语言模型推理能力。预印本,arXiv:2604.12627。
  • Yu 等人 [2026b] Qiying Yu, Zheng Zhang, Ruofei Zhu, Yufeng Yuan, Xiaochen Zuo, Yu Yue, Weinan Dai, Tiantian Fan, Gaohong Liu, Lingjun Liu 及其他 1 位作者。2026b。Dapo:一个大规模开源大语言模型强化学习系统。Advances in Neural Information Processing Systems,38:113222–113244。
  • Yuan 等人 [2026] Yige Yuan, Teng Xiao, Shuchang Tao, Xue Wang, Jinyang Gao, Bolin Ding 和 Bingbing Xu。2026。从弱监督中激励强推理。预印本,arXiv:2505.20072。
  • Zhan 等人 [2026] Shaoxiong Zhan, Yanlin Lai, Ziyu Lu, Dahua Lin, Ziqing Yang 和 Fei Tan。2026。Mathsmith:通过强化策略构造合成问题实现极难数学推理。预印本,arXiv:2508.05592。
  • Zhang 等人 [2026] Zhaoyang Zhang, Shuli Jiang, Yantao Shen, Yuting Zhang, Dhananjay Ram, Shuo Yang, Zhuowen Tu, Wei Xia 和 Stefano Soatto。2026。面向大语言模型推理的强化感知知识蒸馏。预印本,arXiv:2602.22495。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org