从推理链到可验证子问题:课程强化学习实现LLM推理的信用分配
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
针对基于结果的强化学习在处理困难推理问题时因正确样本稀少而效率低下的问题,本文提出子问题课程强化学习框架。该框架从参考推理链中提取可验证子问题,并将最终子问题固定为原始问题,从而将部分解题进展转化为可验证的学习信号。其通过在子问题位置独立归一化奖励并分配优势值,实现了更细粒度的信用分配。实验表明,SCRL显著提升了模型在多个数学推理基准上的性能,有效增强了在复杂问题上的探索与推理能力。
SCRL 将推理链解构为可验证子问题课程,让 RL 在超难数学题上获得细粒度信用分配,AIME 提点显著,做推理 RL 的团队值得复现。
@mails.tsinghua.edu.cn, gaohuang@tsinghua.edu.cn。
1 引言
基于可验证奖励的强化学习(RLVR)已成为训练大语言模型进行数学推理的主流范式,在从小学算术到奥赛级别的各类基准测试中均取得了显著的实证提升(Guo 等人,2025;Yu 等人,2025;Shao 等人,2024;Jaech 等人,2024;Wen 等人,2025)。其成功的关键在于,正确的最终答案提供了明确且可自动检查的奖励信号。这消除了昂贵的人工标注需求,并避免了学习型奖励模型带来的奖励破解风险(Skalse 等人,2022)。
RLVR 的一个核心目标是帮助模型解决先前未解决的问题,并提升其推理能力。然而,先前的研究表明,直接的 RLVR 更多是提升采样效率,而非显著扩展模型的能力边界(Yue 等人,2025;Shojaee 等人,2025;Alam & Rastogi,2025)。进一步的研究指出,在模型当前能力边缘使用具有挑战性的问题进行训练,是提升推理能力的关键(Pikus 等人,2025;Li 等人,2026a;Dai 等人,2026;Ma 等人,2025)。这使得难题对 RL 训练尤为宝贵。然而,典型的 RLVR 方法(如 GRPO,Guo 等人,2025)恰恰在这些问题上表现不佳。首先,奖励是在同一提示词采样的多次生成结果组内进行归一化的,因此如果组内所有生成结果都失败,则无法提供任何学习信号。其次,基于结果的 RLVR 将单个样本级别的优势值分配给整个生成序列。因此,一次接近成功的尝试与一次立即失败会获得相同的信用值。因此,从这些困难但信息量大的问题中提取学习信号至关重要。
从难题中学习的一种自然方式是更有效地利用专家轨迹。现有方法主要遵循两条路径。一条路径是通过训练模型模仿专家生成的轨迹来补偿稀疏奖励,例如监督微调和某些离策略强化学习方法(Li et al., 2025a; Yan et al., 2025; Fu et al., 2025; Zhang et al., 2025a; Lv et al., 2025)。然而,这些方法用监督式模仿取代了模型自身的在策略探索,由此导致的专家策略与学生策略之间的分布偏移会损害训练稳定性和分布外泛化能力(Shenfeld et al., 2025; Chu et al., 2025)。另一条路径则采用在策略课程强化学习。这些方法提供一个专家推理前缀或其他提示,并训练模型完成剩余的解答过程(Amani et al., 2025; Zhang et al., 2025b; Wu et al., 2025a; Qiyuan et al., 2026; Qu et al., 2026; Yan et al., 2025; Shi et al., 2026)。然而,这些提示被视为固定结论,而非模型必须推导出的目标,因此模型无需自行发现关键的推理步骤,并且所提供的上下文仍然使模型偏离其自身的生成分布。事实上,解决难题要求模型自行探索并掌握这些提示背后的中间结论。这引出了一个核心问题:我们如何为难题构建一个课程,既能保持模型自主探索,又能恰当地为模型在此过程中解决的中间进展给予奖励?
我们提出 SCRL(子问题课程强化学习),其灵感来源于数学竞赛中一种常见的结构:多部分问题。在竞赛考试中,一道难题被分解为一系列难度递增的子问题,所有子问题同时可见;解决前一部分会得到一个结果,该结果自然成为解决下一部分的基础。给定一道难题的专家解答后,我们利用外部大语言模型离线构建一系列可验证的子问题。这些子问题按从易到难的顺序排列,每个后续子问题都建立在前一个子问题的基础之上,并且每个子问题都有一个可验证的答案。我们将最后一个子问题固定为原始问题本身,并要求模型在单次在线策略 rollout 中回答所有子问题。这自然实现了一种课程学习结构:当模型正确解决前一个子问题时,其答案就成为下一个子问题的自然基础,引导模型朝着难度越来越高的推理方向前进。关键在于,连接连续子问题的推理步骤是模型自我生成的,是通过模型自身的在线策略 rollout 获得的。这些中间结果提供了可验证的过程级监督,自然能够在 rollout 内实现更细粒度的信用分配。我们通过子问题级归一化来实现这一点,这是一种新颖的 RLVR 训练技术,它在每个子问题位置上独立地对奖励进行归一化,并将由此产生的优势值分配给相应的答案片段。特别地,为了防止模型在不解决前面子问题的情况下奖励后面的子问题,我们将信用与课程进度对齐,只计算最长连续解决的子问题序列。例如,子问题奖励被视为 ,因为第一个失败子问题之后的进展不计入信用。
我们通过理论和实验验证了 SCRL。理论上,我们证明了子问题分解通过从较早的子问题中恢复非退化的学习信号,能够将困难问题从梯度死区中提升出来。我们将此形式化为一个度量恢复结果,其中优化从原始策略流形提升到子问题乘积流形,且恢复比率随问题难度增加而增长。实验结果与这一预测一致:SCRL 在多个数学推理基准测试上优于强课程学习基线。消融实验进一步证实了子问题级别信用分配的有效性,并表明 SCRL 并不依赖于高度精选的子问题或强大的子问题生成器。
我们的主要贡献如下:
- •
用于课程学习的 SCRL 框架。我们提出了一个课程强化学习框架,将每个困难问题转化为一系列可验证的子问题,从而在单次同策略采样中实现过程级别的监督。这使模型持续在其当前能力边界附近进行探索,使困难问题对训练更加有效。
- •
用于细粒度信用分配的子问题级别归一化。我们引入了子问题级别归一化,该方法在每个子问题位置上独立地对奖励进行归一化,并将由此产生的优势值分配给对应的答案片段,从而在无需外部评分标准或额外奖励模型的情况下实现细粒度的信用分配。
- •
理论与实证验证。我们提供了一项度量恢复分析,表明子问题分解能够将困难问题从梯度死区中提升出来,且原始问题越难,相对增益越大。在七个数学推理基准测试上的实验验证了这些预测,并显示出相对于强基线的持续提升(在 Qwen3-4B/14B 上平均提升 +4.1/+1.9 个点;在三个困难基准测试上 pass@ 指标提升 +3.7 个点,pass@ 指标提升 +4.6 个点)。
2 相关工作
基于可验证奖励的强化学习(RLVR)
大语言模型(LLM)的最新进展凸显了强化学习(RL)在数学和编程等具有确定性验证器的领域中的有效性(Shao et al., 2024; Jaech et al., 2024; Trinh et al., 2024; Yang et al., 2024; Qu et al., 2025; Wang et al., 2025)。与开放式生成不同,这些任务提供了明确的反馈,使得能够通过近端策略优化(PPO)(Schulman et al., 2017)或内存效率更高的分组相对策略优化(GRPO)(Guo et al., 2025)等算法来优化策略模型。然而,基于强化学习的验证(RLVR)面临一个重大挑战:对于困难问题,奖励信号变得极其稀疏,导致无法获得有意义的策略梯度(Uesato et al., 2022)。这一挑战通常被归结为一个信用分配问题:基于结果的奖励提供了全局信号,但无法指出哪些具体的推理步骤导致了最终的成功或失败(Lightman et al., 2023)。虽然像STaR(Zelikman et al., 2022)和ReST(Gulcehre et al., 2023; Zhang et al., 2024)这样的迭代式自我改进方法试图通过在较简单实例上进行拒绝采样来弥合这一差距,但当任务难度超出模型当前的探索范围时,它们仍然难以应对。因此,课程学习(Bengio et al., 2009; Yang et al., 2025; Li et al., 2025b; Parashar et al., 2025; Wu et al., 2025b)已成为一种常见方法,通过将困难任务分解为可管理的阶段,来为难题稠密化学习信号。
面向推理的课程学习
现有的用于数学推理的课程学习方法大致可分为两种范式。第一类侧重于在模型无法解决难题时提供外部提示或指导。代表性的工作如 StepHint(Zhang 等人,2025a)、Scaf-GRPO(Zhang 等人,2025b)以及其他基于提示的强化学习框架(Wu 等人,2025a;Qiyuan 等人,2026;Qu 等人,2026;Yan 等人,2025;Shi 等人,2026),它们利用教师模型或自生成的推理过程作为辅助前缀,以降低探索门槛。第二类方法涉及将原始问题改写为更简单的版本,或通过补充信息增强提示词,以促进推理(Chen 等人,2026;Wu 等人,2025b;Li 等人,2026b;Dai 等人,2026;Li 等人,2026a;Liang 等人,2025)。正如 MQR(Dai 等人,2026)和 QuestA(Li 等人,2026a)所示,这些方法通过操控问题上下文有效地创建了难度梯度。然而,这些方法共有的一个根本局限性在于它们依赖于额外的上下文。通过将提示或改写后的问题作为静态前缀提供,这些方法主要优化了模型的续写能力。结果,模型未能内化底层的支架逻辑,因为它从未被要求自行生成提示或辅助结构。相比之下,SCRL 要求模型在结构化的响应中生成完整的支架式多部分序列,从而确保策略既能学会构建中间推理步骤,也能学会解决最终的目标问题。
3 方法
我们提出了 SCRL(子问题课程强化学习),这是一种课程式强化学习框架,它将难题转化为可验证的子问题课程,以实现更细粒度的信用分配。SCRL 包含三个步骤。首先,给定一个参考解答,一个外部大语言模型从推理链中推导出可验证的子问题,并构建子问题课程。其次,策略模型在一次在线策略 rollout 中回答所有子问题。然后,我们验证每个子问题的答案,并应用进度感知校正来获得进度感知的子问题奖励。子问题级别的归一化会为每个子问题位置计算一个优势值,该值随后用于 token 级别的信用分配。最后,为减少提示词不匹配,SCRL 采用混合组训练,在同一轮更新中联合优化课程 rollout 和原始问题 rollout。
3.1 预备知识:GRPO
给定一个提示词,GRPO 会采样多个 rollout,并为每个 rollout 分配一个标量的可验证奖励。然后,它优化裁剪后的目标函数。
| (1) |
这里, 是组归一化后的优势值, 是 token 处的重要性采样比率。由于相同的 被分配给 中的每一个 token,GRPO 执行的是样本级别的信用分配。
3.2 SCRL 框架
构建子问题。
对于每个难题,我们从现有的思维链参考解答开始。一个外部大语言模型将其中间的进度节点重写为可验证的子问题,而不是从头开始解决问题。具体的生成提示词见附录 I,主要指导原则总结如下。
课程提示词。
令 表示原始问题。我们将课程提示词定义为同时呈现所有子问题并要求模型按顺序解决它们的提示词。因此, 对应原始问题的 rollout,而 对应课程的 rollout。详细的提示词模板见附录 J.1。
响应格式。
在课程 rollout 期间,模型被要求使用显式的标签 `<pj>` 和 `</pj>` 来回答子问题。
子问题的答案所在位置。这些标签不仅规定了响应格式,还标记了每个子问题答案的 token 跨度。这使得我们可以分别验证每个答案,并随后将相应的子问题级别优势分配回该跨度内的 token。
3.2.1 进度感知的子问题奖励
课程进度。
对于一个课程式 rollout,验证提取出的子问题答案会得到一个原始奖励向量。如果响应未遵循要求的格式,我们设其为零。我们将课程进度定义为从开头开始连续正确解决的子问题的最大数量:
| (2) |
因此,`cp=0` 表示第一个子问题就错了,而 `cp=K` 表示所有子问题都已解决。课程进度追踪了当前策略在该难题上的能力边界,同时也识别出该 rollout 实际达到的中间进度。
进度感知修正。
直接独立奖励每个子问题,可能会在早期子问题失败的情况下仍奖励后续子问题,从而造成潜在的奖励黑客捷径。因此,我们通过仅保留连续正确解决的前缀,使奖励与课程进度对齐:
| (3) |
例如,当 `cp=2` 时,原始奖励向量 `[1,1,0,1]` 被修正为 `[1,1,0,0]`。为方便表示,我们使用 `r_i` 作为训练用的最终子问题奖励。
3.2.2 SCRL 训练算法
在本节中,我们描述 SCRL 的训练细节,包括用于优势计算的子问题级别归一化、token 级别的信用分配以及混合组训练。完整的训练流程总结于附录 C。
子问题级别归一化。
给定 `N` 个课程式 rollout,我们在 rollout 组内对每个子问题位置上的最终子问题奖励进行归一化:
| (4) |
因此,子问题级别的优势衡量了 rollout `i` 在子问题位置 `j` 上相对于 rollout 组内的相对成功程度,独立于其他子问题位置的奖励。
Token 级别的信用分配。
在计算出子问题级别的优势值后,我们将其分配回对应子问题答案的模型 token 上。利用结构化响应格式,我们定义:如果 token 位于 `<pj>` 和 `</pj>` 之间,则赋予该 token 对应的 token 级优势值。所有答案区间之外的 token 获得零优势值;如果响应未遵循要求的格式,则该响应中的所有 token 均获得零优势值。这便将子问题级别的进展转化为对应答案区间的 token 级学习信号。
混合组训练。
仅使用课程提示词进行训练可能会导致提示词失配,因为评估使用的是原始提示词。因此,我们采用混合组训练:对于每个问题,一部分 rollout 从课程提示词中采样,并使用子问题级别归一化后的 token 级优势值进行优化;而其余 rollout 则从原始提示词中采样,并使用标准的基于结果的 GRPO 进行优化。最终的 SCRL 目标函数为:
| (5) |
两个括号项分别对应课程 rollout 和原始问题 rollout。完整的训练流程总结于算法 1 中。
4 理论分析
利用配备 Fisher–Rao 度量的策略流形的信息几何(Amari, 2016),我们证明了困难问题可能使基于结果的 GRPO 陷入梯度死区,而子问题分解则将优化提升到一个乘积流形上,从而恢复有用的梯度信息。完整的讨论和证明见附录 B。
定义 4.1(有效梯度信息矩阵与提升梯度信息矩阵)。
在 GRPO 下,设 为采样的 rollout。则 的有效梯度信息矩阵(EGIM)及其子问题变换后的提升 EGIM 分别为:
| (6) | ||||
| (7) |
这里 和 分别表示原始问题优势和子问题位置优势,最小特征值 衡量了最弱的有效梯度信号。
定理 4.2(梯度死区)。
设 为当前策略解决 的概率。如果 ,那么
| (8) |
其中 界定了归一化优势值的幅度, 界定了评分范数(两者均在附录 B.3 中推导得出)。
定理 4.2 表明,直接 RLVR 训练在困难问题上会失效:当正确 rollout 稀少时,奖励组发生坍缩,最坏情况下的有效梯度信号消失。
定理 4.3(通过子问题分解实现度量恢复)。
设 处于梯度死区,且 。假设子问题构造满足
其中 。在条件可识别性假设(对所有单位向量 , )下,
| (9) |
其中 是一个与 无关的正常数。
定理 4.3 表明,子问题课程能够帮助困难问题恢复非退化的学习几何结构,即使原始问题几乎不提供任何有用的梯度信号。此外,恢复比率随 增长,这预示着在更困难的问题上会获得更大的相对增益。
5 实验
5.1 实验设置
模型。
为了探究我们提出的方法在不同模型容量下的可扩展性和有效性,我们在 Qwen 和 Llama 系列上进行了实验。具体来说,我们使用 Qwen3-4B-Base、Qwen3-14B-Base 和 Llama3.2-3B-Instruct 作为基础策略。
训练设置。
我们使用训练集 hard_1024,该数据集是从 Yang 等人(2026)提供的高难度竞赛数学数据集中随机选取的 1,024 道题目子集。对于 SCRL,子问题通过 DeepSeek-V3.2 API 生成,温度参数 。所有模型均使用 Verl 框架(Sheng 等人,2025)训练,共 300 步。详细的超参数配置见附录 F.1。
评测基准。
我们在七个广泛使用的数学推理基准上评估模型:OlympiadBench、Minerva、MATH-500、AIME 2024、AIME 2025、AMC 和 IMO-Bench。
基线设置。
我们将我们的方法与以下有竞争力的基线进行比较:SFT、GRPO(Guo 等人,2025)、DAPO(Yu 等人,2025)、QuestA(Li 等人,2026a)和 NuRL(Chen 等人,2025)。实现细节见附录 F.3。
5.2 主要结果与进一步分析
| 基础模型 | 方法 | Olym.B | Minerva | MATH | AIME’24 | AIME’25 | AMC | IMO-B | 平均 |
|---|---|---|---|---|---|---|---|---|---|
| Llama3.2-3B-Instruct | 初始模型 | 13.1 | 13.7 | 44.0 | 6.4 | 0.7 | 20.6 | 4.5 | 14.7 |
| SFT | 13.1 | 11.0 | 44.1 | 2.5 | 0.7 | 18.1 | 2.6 | 13.2 | |
| GRPO | 13.7 | 14.9 | 44.5 | 10.3 | 0.5 | 20.9 | 5.4 | 15.7 | |
| DAPO | 14.6 | 15.1 | 45.9 | 9.8 | 0.3 | 22.2 | 5.8 | 16.2 | |
| QuestA | 14.6 | 14.8 | 45.9 | 8.5 | 0.4 | 21.4 | 6.1 | 16.0 | |
| NuRL | 15.1 | 14.9 | 45.2 | 10.2 | 0.3 | 21.7 | 5.9 | 16.2 | |
| SCRL | 15.2 | 15.2 | 45.2 | 10.3 | 0.8 | 21.4 | 6.8 | 16.4 | |
| Qwen3-4B-Base | 初始模型 | 29.0 | 15.6 | 64.4 | 10.9 | 6.4 | 38.1 | 6.1 | 24.4 |
| SFT | 31.1 | 25.4 | 71.0 | 10.6 | 10.0 | 41.0 | 7.1 | 28.0 | |
| GRPO | 35.1 | 29.7 | 76.2 | 14.5 | 7.2 | 46.1 | 7.8 | 30.9 | |
| DAPO | 34.9 | 30.1 | 76.0 | 11.8 | 9.3 | 46.8 | 8.3 | 31.0 | |
| QuestA | 35.0 | 32.0 | 75.9 | 14.1 | 11.7 | 46.8 | 8.3 | 32.0 | |
| NuRL | 35.6 | 30.3 | 77.6 | 13.2 | 8.4 | 45.4 | 7.1 | 31.1 | |
| SCRL | 39.2 | 33.1 | 79.8 | 16.5 | 15.3 | 52.4 | 8.7 | 35.0 | |
| Qwen3-14B-Base | 初始模型 | 35.3 | 23.7 | 75.7 | 14.4 | 10.7 | 50.2 | 7.4 | 31.1 |
| SFT | 41.2 | 24.3 | 72.0 | 20.0 | 20.0 | 49.3 | 11.0 | 34.0 | |
| GRPO | 38.4 | 33.4 | 81.3 | 21.6 | 11.9 | 58.1 | 9.9 | 36.4 | |
| DAPO | 37.5 | 32.6 | 79.9 | 22.7 | 12.3 | 59.2 | 9.9 | 36.3 | |
| QuestA | 40.4 | 34.0 | 82.6 | 18.5 | 11.6 | 60.2 | 10.4 | 36.8 | |
| NuRL | 38.3 | 32.6 | 82.0 | 23.6 | 11.2 | 58.1 | 9.4 | 36.5 | |
| SCRL | 40.9 | 34.7 | 83.2 | 24.4 | 13.1 | 60.0 | 11.9 | 38.3 |
七个数学推理基准测试的主要结果汇总于表 1,完整实验结果见附录 E。
在所有基准测试上均表现卓越。
如表 1 所示,SCRL 在三个模型规模(Llama3.2-3B、Qwen3-4B 和 Qwen3-14B)上始终优于原始 GRPO 以及包括 DAPO、QuestA 和 NuRL 在内的竞争基线。在平均准确率方面,SCRL 在所有设置下均取得了最佳性能。在 Qwen3-4B 上的提升尤为明显,SCRL 的平均得分为 35.0%,比第二好的基线 QuestA(32.0%)高出 3.0 个百分点,比原始 GRPO(30.9%)高出 4.1 个百分点。在 AIME'25 等具有挑战性的基准测试上,SCRL 也展现出强劲的提升,达到了 15.3%,而 QuestA 为 11.7%。
课程式进度迁移至难题求解。
图 4 展示了在 AIME24、AIME25 和 IMO-Bench 上的 pass@ 曲线。SCRL 在整个评估范围内始终优于 GRPO 和其他课程式强化学习基线,表明其具有更强的难题求解能力。
图6进一步追踪了训练过程中可解决问题(即至少被完整求解过一次的问题)的比例。全组统计指标统计的是原始问题格式或课程格式中的成功情况,而半组统计指标仅使用半预算的原始问题展开,与SCRL的混合组设置相匹配。在两种协议下,SCRL均实现了比GRPO更高的可解比例,这表明课程进展能够迁移到直接解决难题上,而不仅仅是改善课程格式的展开效果。
SCRL并不依赖于高度精选的子问题。
我们进一步考察了SCRL是否依赖于高质量的子问题构建。表2比较了由DeepSeek-V3.2和较弱的Qwen3-4B-Instruct生成器生成的子问题,两者使用相同的生成提示词和下游训练流程。在这两种情况下,生成器都会获得数据集的参考解法,因此它只是分解一个已经解决的问题,而不是从头开始求解。SCRL在使用较弱生成器时仍然有效,平均比GRPO提升了+2.7个百分点,而DeepSeek-V3.2则将增益进一步提高到+3.9个百分点。
| 方法 | 子问题生成器 | Olym.B | Minerva | MATH | AIME'24 | AMC | 平均 |
|---|---|---|---|---|---|---|---|
| GRPO | – | 35.1 | 29.7 | 76.2 | 14.5 | 46.1 | 40.3 |
| SCRL | Qwen3-4B-Instruct | 36.3 | 34.2 | 80.0 | 16.7 | 47.9 | 43.0 |
| SCRL | DeepSeek-V3.2 | 39.2 | 33.1 | 79.8 | 16.5 | 52.4 | 44.2 |
图6显示,即使使用DeepSeek-V3.2,完全求解的课程实例比例仍然低于GRPO的可解比例(GRPO柱状图报告的是在相同半组计数协议下GRPO解决的原始问题比例)。尽管如此,SCRL仍然取得了显著的性能提升。这表明SCRL并不要求子问题简单或经过完美筛选。同时,DeepSeek-V3.2产生的比例高于Qwen3-4B-Instruct,这表明更好的子问题质量可以进一步提升SCRL的增益。
子问题级别的归一化能够实现更好的信用分配。
我们进一步在 Qwen3-4B-Base 上消融研究了课程式 rollout 中信用分配的方式。表 3 将完整方法与两种替代方案进行了比较:移除进度感知校正,以及 Both-GRPO(该方法保留混合训练,但仅验证最终子问题,并对课程式 rollout 应用样本级 GRPO)。
| 信用分配方法 | Olym.B | Minerva | MATH | AIME’24 | AMC | 平均 |
|---|---|---|---|---|---|---|
| Both-GRPO | 38.2 | 33.1 | 79.4 | 14.0 | 54.8 | 43.9 |
| 子问题级归一化(无校正) | 35.7 | 33.1 | 78.2 | 13.8 | 48.5 | 41.9 |
| 子问题级归一化(有校正) | 39.2 | 33.1 | 79.8 | 16.5 | 52.4 | 44.2 |
带有进度感知校正的子问题级归一化表现最佳。若无校正,密集的子问题信号可能会在早期失败后奖励后续步骤,而 Both-GRPO 仅将子问题用作提示,无法对有效的中间进度给予信用。因此,有效的课程式训练既需要子问题特定的信号,也需要进度感知校正。
6 结论
我们提出了 SCRL,一种面向具有可验证奖励的困难大语言模型推理的子问题课程式强化学习框架。SCRL 从推理链中推导出可验证的子问题,并使用子问题级归一化将部分 rollout 进度转化为 token 级学习信号,从而在无需外部奖励模型或过程标注的情况下实现细粒度的信用分配。我们的理论表明,子问题分解可以将困难问题从梯度死区中解救出来,实验也显示其在强 RLVR 和课程式学习基线上取得了持续改进。
参考文献
- Alam & Rastogi (2025) Alam, M. T. and Rastogi, N. Limits of generalization in rlvr: Two case studies in mathematical reasoning. arXiv preprint arXiv:2510.27044, 2025.
- Amani et al. (2025) Amani, M. H., Lotfi, A., Baldwin, N. M., Bengio, S., Farajtabar, M., Abbe, E., and West, R. Rl for reasoning by adaptively revealing rationales. ArXiv, abs/2506.18110, 2025. URL https://api.semanticscholar.org/CorpusID:280000657.
- Amari (2016) Amari, S.-i. Information Geometry and Its Applications, volume 194 of Applied Mathematical Sciences. Springer Japan, Tokyo, 2016. ISBN 978-4-431-55977-1. doi: 10.1007/978-4-431-55978-8.
- Bengio 等人 (2009) Bengio, Y., Louradour, J., Collobert, R., 和 Weston, J. 课程学习. 载于《第26届国际机器学习年会论文集》,第41–48页,2009年。
- Chen 等人 (2025) Chen, J. C.-Y., Peng, B. X., Choubey, P. K., Huang, K.-H., Zhang, J., Bansal, M., 和 Wu, C.-S. 推动大语言模型推理的边界. arXiv 预印本 arXiv:2509.25666,2025年。
- Chen 等人 (2026) Chen, J. C.-Y., Prasad, A., Khan, Z., Singh, J., Tian, R., Stengel-Eskin, E., 和 Bansal, M. Cog-drift:通过自适应重构实例探索从困难推理问题中学习. arXiv 预印本 arXiv:2604.04767,2026年。
- Chen (2021) Chen, M. 评估基于代码训练的大语言模型. arXiv 预印本 arXiv:2107.03374,2021年。
- Chu 等人 (2025) Chu, T., Zhai, Y., Yang, J., Tong, S., Xie, S., Schuurmans, D., Le, Q. V., Levine, S., 和 Ma, Y. SFT 记忆,RL 泛化:基础模型后训练的对比研究. arXiv 预印本 arXiv:2501.17161,2025年。
- Dai 等人 (2026) Dai, Y., Ji, Y., Zhang, X., Wang, Y., Chu, X., 和 Lu, Z. 越难越好:通过难度感知的 GRPO 和多方面问题重构提升数学推理能力. 载于《第十四届国际学习表征会议》,2026年。URL https://openreview.net/forum?id=nfURupkdRJ.
- Fu 等人 (2025) Fu, Y., Chen, T., Chai, J., Wang, X., Tu, S., Yin, G., Lin, W., Zhang, Q., Zhu, Y., 和 Zhao, D. SRFT:一种用于推理的监督与强化微调单阶段方法. arXiv 预印本 arXiv:2506.19767,2025年。
- Gulcehre 等人 (2023) Gulcehre, C., Paine, T. L., Srinivasan, S., Konyushkova, K., Weerts, L., Sharma, A., Siddhant, A., Ahern, A., Wang, M., Gu, C., 等人. 用于语言建模的强化自训练 (ReST). arXiv 预印本 arXiv:2308.08998,2023年。
- Guo 等人 (2025) Guo, D., Yang, D., Zhang, H., Song, J., Zhang, R., Xu, R., Zhu, Q., Ma, S., Wang, P., Bi, X., 等人. DeepSeek-R1:通过强化学习激励大语言模型的推理能力. arXiv 预印本 arXiv:2501.12948,2025年。
- Jaech 等人 (2024) Jaech, A., Kalai, A., Lerer, A., Richardson, A., El-Kishky, A., Low, A., Helyar, A., Madry, A., Beutel, A., Carney, A., 等. OpenAI o1 系统卡片. arXiv 预印本 arXiv:2412.16720, 2024.
- Li 等人 (2025a) Li, D., Cao, S., Griggs, T., Liu, S., Mo, X., Tang, E., Hegde, S., Hakhamaneshi, K., Patil, S. G., Zaharia, M., Gonzalez, J. E., 和 Stoica, I. 大语言模型可以轻松从演示中学习推理——重要的是结构,而非内容!ArXiv, abs/2502.07374, 2025a. URL https://api.semanticscholar.org/CorpusID:276258697.
- Li 等人 (2026a) Li, J., Lin, H., Lu, H., Wen, K., Yang, Z., Gao, J., Wu, Y., 和 Zhang, J. Questa:通过问题增强扩展大语言模型的推理能力. 第十四届国际学习表征会议, 2026a. URL https://openreview.net/forum?id=3MifB0f7qR.
- Li 等人 (2025b) Li, R., Huang, H., Wei, F., Xiong, F., Wang, Y., 和 Chu, X. Adacurl:结合无效样本缓解与历史回顾的自适应课程强化学习. ArXiv, abs/2511.09478, 2025b. URL https://api.semanticscholar.org/CorpusID:282939669.
- Li 等人 (2026b) Li, X., Chen, J., Li, X., Liang, H., Zhou, X., Wang, T., 和 Zhang, W. Mathmixup:通过难度可控的数据合成与课程学习提升大语言模型数学推理能力. arXiv 预印本 arXiv:2601.17006, 2026b.
- Liang 等人 (2025) Liang, X., zhi Li, Z., Gong, Y., Shen, Y., Wu, Y., Guo, Z., 和 Chen, W. 超越 pass@1:基于变分问题合成的自我对弈维持 RLVR. ArXiv, abs/2508.14029, 2025. URL https://api.semanticscholar.org/CorpusID:280686520.
- Lightman 等人 (2023) Lightman, H., Kosaraju, V., Burda, Y., Edwards, H., Baker, B., Lee, T., Leike, J., Schulman, J., Sutskever, I., 和 Cobbe, K. 让我们逐步验证. 第十二届国际学习表征会议, 2023.
- Lv 等人 (2025) Lv, X., Zuo, Y., Sun, Y., Liu, H., Wei, Y., Chen, Z., Zhu, X., Zhang, K., Wang, B., Ding, N., 等. 迈向大语言模型后训练的统一视角. arXiv 预印本 arXiv:2509.04419, 2025.
- Ma 等人(2025)Ma, L., Liang, H., Qiang, M., Tang, L., Ma, X., Wong, Z. H., Niu, J., Shen, C., He, R., Cui, B., and Zhang, W. 学习强化学习无法做到的事:针对最难问题的交错式在线微调。ArXiv, abs/2506.07527, 2025. URL https://api.semanticscholar.org/CorpusID:279251208.
- Parashar 等人(2025)Parashar, S., Gui, S., Li, X., Ling, H., Vemuri, S., Olson, B., Li, E., Zhang, Y., Caverlee, J., Kalathil, D. M., and Ji, S. 从易到难的课程式强化学习任务能提升大语言模型的推理能力。ArXiv, abs/2506.06632, 2025. URL https://api.semanticscholar.org/CorpusID:279251658.
- Pikus 等人(2025)Pikus, B., Tiwari, P. R., and Ye, B. 困难样本就是一切:在标注预算限制下最大化 GRPO 后训练效果。ArXiv, abs/2508.14094, 2025. URL https://api.semanticscholar.org/CorpusID:280692329.
- Qiyuan 等人(2026)Qiyuan, D., Chen, K., Zhang, M., and Xu, Z. HiPO:面向 RLVR 的自提示策略优化。载于第十四届国际学习表征会议,2026. URL https://openreview.net/forum?id=rcb20pHmT1.
- Qu 等人(2025)Qu, Y., Singh, A., Lee, Y., Setlur, A. R., Salakhutdinov, R., Finn, C., and Kumar, A. RLAD:训练大语言模型发现抽象概念以解决推理问题。ArXiv, abs/2510.02263, 2025. URL https://api.semanticscholar.org/CorpusID:281724383.
- Qu 等人(2026)Qu, Y., Setlur, A., Smith, V., Salakhutdinov, R., and Kumar, A. POPE:通过特权在线策略探索学习解决难题的推理方法。arXiv 预印本 arXiv:2601.18779, 2026.
- Schulman 等人(2017)Schulman, J., Wolski, F., Dhariwal, P., Radford, A., and Klimov, O. 近端策略优化算法。arXiv 预印本 arXiv:1707.06347, 2017.
- Shao 等人(2024)Shao, Z., Wang, P., Zhu, Q., Xu, R., Song, J., Bi, X., Zhang, H., Zhang, M., Li, Y., Wu, Y., 等. DeepSeekMath:推动开放语言模型数学推理能力的极限。arXiv 预印本 arXiv:2402.03300, 2024.
- Shenfeld 等人(2025)Shenfeld, I., Pari, J., and Agrawal, P. RL 的剃刀:为什么在线强化学习遗忘更少。ArXiv, abs/2509.04259, 2025. URL https://api.semanticscholar.org/CorpusID:281103647.
- Sheng 等人 (2025) Sheng, G., Zhang, C., Ye, Z., Wu, X., Zhang, W., Zhang, R., Peng, Y., Lin, H., 和 Wu, C. Hybridflow:一种灵活高效的 RLHF 框架。发表于 EuroSys,第 1279–1297 页,2025 年。URL https://doi.org/10.1145/3689031.3696075。
- Shi 等人 (2026) Shi, W., Chen, Y., Li, Z., Pan, X., Sun, Y., Xu, J., Zhou, X., 和 Li, Y. R3L:结合语言引导探索、关键信用分配与正向放大的反思-重试强化学习。ArXiv, abs/2601.03715, 2026 年。URL https://api.semanticscholar.org/CorpusID:284532205。
- Shojaee 等人 (2025) Shojaee, P., Mirzadeh, I., Alizadeh, K., Horton, M., Bengio, S., 和 Farajtabar, M. 思考的幻觉:通过问题复杂性视角理解推理模型的优势与局限。arXiv 预印本 arXiv:2506.06941,2025 年。
- Skalse 等人 (2022) Skalse, J. M. V., Howe, N. H. R., Krasheninnikov, D., 和 Krueger, D. 定义与刻画奖励破解行为。ArXiv, abs/2209.13085, 2022 年。URL https://api.semanticscholar.org/CorpusID:252545256。
- Trinh 等人 (2024) Trinh, T. H., Wu, Y., Le, Q. V., He, H., 和 Luong, T. 无需人工演示解决奥数几何问题。Nature, 625(7995):476–482, 2024 年。
- Uesato 等人 (2022) Uesato, J., Kushman, N., Kumar, R., Song, F., Siegel, N., Wang, L., Creswell, A., Irving, G., 和 Higgins, I. 利用基于过程与基于结果的反馈解决数学应用题。arXiv 预印本 arXiv:2211.14275,2022 年。
- Wang 等人 (2025) Wang, S., Yu, L., Gao, C., Zheng, C., Liu, S., Lu, R., Dang, K., Chen, X., Yang, J., Zhang, Z., 等人。超越二八法则:高熵少数 token 驱动大语言模型推理的有效强化学习。arXiv 预印本 arXiv:2506.01939,2025 年。
- Wen 等人 (2025) Wen, X., Liu, Z., Zheng, S., Xu, Z., Ye, S., Wu, Z., Liang, X., Wang, Y., Li, J., Miao, Z., Bian, J., 和 Yang, M. 基于可验证奖励的强化学习隐式激励基础大语言模型的正确推理。ArXiv, abs/2506.14245, 2025 年。URL https://api.semanticscholar.org/CorpusID:279410727。
- Wu 等人 (2025a) Wu, J., Liao, C., Feng, M., Zhang, S., Wen, Z., Shao, P., Xu, H., 和 Tao, J. 思维增强策略优化:桥接外部引导与内部能力。arXiv 预印本 arXiv:2505.15692, 1(8):10, 2025a。
- Wu 等人 (2025b) Wu, M., Qian, Q., Liu, W., Wang, X., Huang, Z., Liang, D., Miao, L., Dou, S., Lv, C., Wang, Z., Xu, Z., Chen, L., Li, T., Zheng, X., 和 Huang, X. 渐进式精通:面向数学推理的定制化课程学习与引导式提示。ArXiv, abs/2506.04065, 2025b。URL https://api.semanticscholar.org/CorpusID:279154725。
- Yan 等人 (2025) Yan, J., Li, Y., Hu, Z., Wang, Z., Cui, G., Qu, X., Cheng, Y., 和 Zhang, Y. 在离策略引导下学习推理。收录于第三十九届神经信息处理系统年度会议,2025。URL https://openreview.net/forum?id=vO8LLoNWWk。
- Yang 等人 (2024) Yang, A., Zhang, B., Hui, B., Gao, B., Yu, B., Li, C., Liu, D., Tu, J., Zhou, J., Lin, J., 等人。Qwen2.5-math 技术报告:通过自我改进迈向数学专家模型。arXiv 预印本 arXiv:2409.12122, 2024。
- Yang 等人 (2025) Yang, C., Wu, J., Liu, Y., Zhang, S., Li, Y., Liang, Q., Wang, H., Nie, S., Xu, J., Shi, R., Huang, Y., 和 Zhang, G. 从模仿到区分:迈向一种增强跨领域推理任务的通用课程优势机制。收录于 AAAI 人工智能会议,2025。URL https://api.semanticscholar.org/CorpusID:283458223。
- Yang 等人 (2026) Yang, M. Y., Bai, H., Wu, I., Yang, G., Setlur, A., 和 Kumar, A. Int:自我提出的干预措施实现大语言模型推理中的信用分配。arXiv 预印本 arXiv:2601.14209, 2026。
- Yu 等人 (2025) Yu, Q., Zhang, Z., Zhu, R., Yuan, Y., Zuo, X., Yue, Y., Fan, T., Liu, G., Liu, L., Liu, X., Lin, H., Lin, Z., Ma, B., Sheng, G., Tong, Y., Zhang, C., Zhang, M., Zhang, W., Zhu, H., Zhu, J., Chen, J., Chen, J., Wang, C., Yu, H., Dai, W., Song, Y., Wei, X., Zhou, H., Liu, J., Ma, W., Zhang, Y.-Q., Yan, L., Qiao, M., Wu, Y.-X., 和 Wang, M. Dapo:一个大规模开源大语言模型强化学习系统。ArXiv, abs/2503.14476, 2025。URL https://api.semanticscholar.org/CorpusID:277104124。
- Yue 等人 (2025) Yue, Y., Chen, Z., Lu, R., Zhao, A., Wang, Z., Song, S., and Huang, G. 强化学习是否真的能激励大语言模型超越基础模型的推理能力?arXiv 预印本 arXiv:2504.13837, 2025.
- Zelikman 等人 (2022) Zelikman, E., Wu, Y., and Goodman, N. D. Star:自学习推理器。arXiv 预印本 arXiv:2203.14465, 2022.
- Zhang 等人 (2024) Zhang, D., Zhoubian, S., Hu, Z., Yue, Y., Dong, Y., and Tang, J. Rest-mcts*:通过过程奖励引导的树搜索进行大语言模型自训练。Advances in Neural Information Processing Systems, 37:64735–64772, 2024.
- Zhang 等人 (2025a) Zhang, K., Lv, A., Li, J., Wang, Y., Wang, F., Hu, H., and Yan, R. Stephint:多层级逐步提示增强强化学习推理能力。arXiv 预印本 arXiv:2507.02841, 2025a.
- Zhang 等人 (2025b) Zhang, X., Wu, S., Zhu, Y., Tan, H., Yu, S., He, Z., and Jia, J. Scaf-grpo:用于增强大语言模型推理的脚手架式分组相对策略优化。arXiv 预印本 arXiv:2510.19807, 2025b.
附录 A 更多消融实验
子问题数量。
我们首先对子问题数量进行消融实验。我们的主要设置使用 ,最后一个子问题固定为原始问题。对于 和 ,我们从序列中取最后三个或最后两个子问题,因此较短的课程保留了嵌套结构,并且仍然以原始问题结束。
| 方法 | AIME24 | AMC | Minerva | OlympiadBench | MATH | 平均 |
|---|---|---|---|---|---|---|
| GRPO | 14.5 | 46.1 | 29.7 | 35.1 | 76.2 | 40.3 |
| SCRL () | 14.0 | 49.7 | 30.1 | 36.1 | 79.2 | 41.8 |
| SCRL () | 17.0 | 51.8 | 33.8 | 35.1 | 76.2 | 42.8 |
| SCRL () | 16.5 | 52.4 | 33.1 | 39.2 | 79.8 | 44.2 |
表 4 显示,增加 能提升平均性能,其中 表现最佳。这支持了子问题课程的作用:更多的子问题提供了朝向原始问题的更精细递进,从而在每次 rollout 中产生更多可验证的中间信号。图 7 解释了为什么更长的子问题课程有帮助。随着 的增加,零进展的 rollout 数量减少,意味着更多 rollout 至少解决了一个子问题并接收到非空的学习信号。因此,增加 既提升了信用分配的粒度,也增加了在难题上获得奖励信号的可用性。
然而,更长的课程也会增加 rollout 的复杂性。模型必须回答更多的子问题,而进度感知修正要求先解决较早的子问题,之后较晚的子问题才能获得评分。如果某个中间子问题表述模糊或构造不佳,它可能会阻碍后续进度的评分。因此,我们在更密集的监督信号与课程复杂度之间进行实际的权衡取舍。
训练数据构建。
每个 SCRL 课程 rollout 都包含多个子问题,因此我们需要探究性能提升是来自训练算法本身,还是仅仅因为模型接触了更多的问题。我们将默认设置(hard_1024 搭配 SCRL)与两种数据规模控制实验进行了对比。hard_4096 通过从 InT 数据集(Yang 等人,2026)中增加困难问题来扩充原始问题集。而 subproblem_4096 则将每个包含四个子问题的课程实例拆分为四个独立的问题;由于最后一个子问题就是原始问题,因此它也包含了 hard_1024。
| 数据集 | 训练目标 | AIME24 | AMC | Minerva | OlympiadBench | MATH | 平均 | 平均响应长度 |
|---|---|---|---|---|---|---|---|---|
| hard_1024 + 子问题库 | SCRL | 16.5 | 52.4 | 33.1 | 39.2 | 79.8 | 44.2 | 1752 |
| hard_1024 | GRPO | 14.5 | 46.1 | 29.7 | 35.1 | 76.2 | 40.3 | 1161 |
| hard_4096 | GRPO | 14.2 | 47.6 | 31.3 | 35.5 | 77.6 | 41.2 | 1256 |
| subproblem_4096 | GRPO | 17.1 | 44.9 | 31.6 | 37.0 | 77.8 | 41.7 | 905 |
表5显示,SCRL的表现优于两种数据规模控制方法。这表明性能提升主要并非来自看到更多问题,而是来自在每个rollout中将子问题作为课程来使用。子问题充当了中间锚点:在解决较早的子问题后,模型可以在解决后续问题时基于该结果进行构建,而子问题级别的归一化则将信用分配给了相应的答案片段。平均回复长度是在前20个训练周期内计算的。尽管每个SCRL课程rollout包含四个子问题,但其平均回复长度仅与GRPO在hard_1024上的长度相当。这表明SCRL并未让回复长度与子问题数量成正比,而是利用子问题课程结构来支持更高效的探索。
两种控制方法进一步阐明了这一点。hard_4096相比hard_1024有所改进,但提升有限,这表明在我们的训练预算下,简单地增加更多难题效果较差。subproblem_4096带来了稍大的提升,但仍落后于SCRL,这表明仅对孤立的较容易子问题进行训练,本身并不能教会模型解决更难的目标问题。相比之下,SCRL通过保持子问题之间的依赖关系,使模型在其当前能力边界附近进行探索,从而使课程比任何一种数据扩展策略都更有用。
附录B 第4节的证明
B.1 定理4.2的证明(关于 的界)
我们给出当 时的界。
令 表示所有rollout共享相同奖励(要么全部失败,要么全部成功)的事件。在 上,该组是退化的(),因此根据GRPO约定,对于所有 有 ,并且(6)式中的每一项都为零。根据全期望定律:
| (10) |
其中 。对于任意单位向量 ,利用几乎必然成立 和几乎必然成立 (根据正则性):
| (11) |
由于 (利用 和伯努利不等式):
| (12) |
由此证毕定理4.2。∎
B.2 定理4.3的证明
第一个论断。
我们给出列 对 贡献的界。令 表示第1列非退化的事件。
关于 的下界。由于根据假设 ,且 关于 对称且在 上非递减,因此其在 上的最小值在端点处取得:
| (13) |
条件 EGIM 的下界。我们通过对奖励向量取条件来计算。给定奖励后,是完全确定的,并且由于 rollout 是独立同分布的,在给定 的条件下与条件独立,因此 。根据塔式性质:
| (14) |
其中不等式使用了条件可识别性假设(对所有 成立)以及 。根据 的定义,平方优势的样本均值满足
| (15) |
因此 。于是:
结论:代入 (14) 式:
| (16) |
由于 (7) 式中所有项都是半正定矩阵,因此 ,于是:
| (17) |
第二个结论。
结合 (12) 式和 (17) 式:
| (18) |
因为分子与 无关。∎
B.3 对 的界
我们证明,对于二元奖励 ,分组归一化的 GRPO 优势满足 。对于一个非退化分组,若成功次数为(),则 且 。一次成功 rollout 的优势为:
| (19) |
该式在 时取最大值,得到 。由对称性,一次失败 rollout 的优势为 ,也在 时取最大值,得到 。因此 。∎
附录 C SCRL 训练算法
0:问题集 ,策略 ,子问题库 ,子问题数量 ,分组大小
1:对每个训练步骤执行
2:采样 并构建课程提示词
3:从 中采样课程 rollout
4:对每个课程 rollout 执行
5:使用要求的响应格式提取答案片段
6:验证每个子问题的答案,得到原始奖励向量
7:使用公式 (2) 计算课程进度
8:应用进度感知修正,使用公式 (3) 得到
9:设置 的最终子问题奖励
10:结束循环
11:对每个子问题位置 执行
12:构建
13:使用公式 (4) 计算 的子问题级优势
14:结束循环
15:根据标记的答案片段,将 token 级优势分配给课程 rollout 的 token
16:从 中采样原始问题 rollout
17:验证最终答案,并使用标准 GRPO 计算 的 rollout 级优势
18:使用公式 (5) 中的 SCRL 目标函数更新
19:结束循环
附录 D 分布外任务性能
| 方法 | GPQA | HumanEval | LiveCodeBench v6 | 平均得分 |
|---|---|---|---|---|
| 基础模型 | 38.89 | 82.93 | 19.80 | 47.20 |
| GRPO | 36.86 | 84.15 | 24.10 | 48.37 |
| SCRL(我们的方法) | 41.41 | 89.02 | 24.57 | 51.67 |
SCRL 能够泛化到分布外任务。
为了检验SCRL带来的收益是否能够迁移到训练所用的数学基准之外,我们在三个分布外基准上对Qwen3-14B-Base模型进行了评估:GPQA、HumanEval和LiveCodeBench v6。这些基准涵盖了不同的推理领域,包括科学问答和代码生成,并且未用于构建子问题课程。
如表6所示,SCRL取得了最佳的分布外平均得分,达到51.67,而基础模型为47.20,GRPO为48.37。SCRL在所有三个分布外基准上也表现出一致的提升,在GPQA(41.41对比基础模型的38.89和GRPO的36.86)、HumanEval(89.02对比82.93和84.15)以及LiveCodeBench v6(24.57对比19.80和24.10)上均有增益。这些结果表明,SCRL并不仅仅是对生成的课程提示词或训练基准分布进行过拟合。相反,子问题课程似乎改善了可迁移的推理行为,包括那些解决方案需要多步推理或程序合成、而非训练期间使用的精确数学格式的领域。
Appendix E Detailed Experimental Results
附录E 详细实验结果
| 表7:Qwen3-4B-Base的完整结果。 | 基础模型 | 方法 | P@1 | P@2 | P@4 | P@8 | P@16 | P@32 |
|---|---|---|---|---|---|---|---|---|
| P@64 | OlympiadBench | 初始模型 | 29.0 | 37.2 | 43.8 | 49.5 | 54.5 | 58.6 |
| 62.3 | SFT | 31.1 | 36.4 | 43.4 | 49.7 | 55.0 | 59.5 | |
| 63.4 | GRPO | 35.1 | 40.0 | 44.0 | 47.4 | 50.5 | 53.5 | |
| 56.4 | DAPO | 34.9 | 41.3 | 46.9 | 51.7 | 55.8 | 59.1 | |
| 61.6 | QuestA | 35.0 | 40.0 | 44.4 | 48.1 | 51.3 | 54.1 | |
| 56.6 | NuRL | 35.6 | 40.9 | 45.4 | 49.3 | 52.6 | 55.5 | |
| 58.2 | SCRL(我们的方法) | 39.2 | 45.2 | 50.4 | 54.7 | 58.1 | 60.9 | |
| 63.0 | Minerva | 初始模型 | 15.6 | 22.4 | 29.6 | 36.8 | 43.5 | 48.9 |
| 52.9 | SFT | 25.4 | 27.6 | 30.8 | 36.7 | 41.4 | 45.5 | |
| 49.6 | GRPO | 29.7 | 33.9 | 37.5 | 40.6 | 43.6 | 46.3 | |
| 48.2 | DAPO | 30.1 | 35.7 | 40.1 | 43.7 | 47.1 | 50.1 | |
| 52.6 | QuestA | 32.0 | 35.6 | 38.8 | 41.6 | 43.9 | 46.0 | |
| 48.2 | NuRL | 30.3 | 34.7 | 38.4 | 41.8 | 45.1 | 48.2 | |
| 51.1 | SCRL(我们的方法) | 33.1 | 37.5 | 41.3 | 44.8 | 48.2 | 51.6 | |
| 54.8 | MATH-500 | 初始模型 | 64.4 | 76.7 | 83.6 | 87.7 | 90.6 | 92.8 |
| 94.2 | SFT | 71.0 | 73.3 | 83.2 | 89.0 | 92.5 | 94.8 | |
| 96.4 | GRPO | 76.2 | 80.5 | 83.9 | 86.5 | 88.6 | 90.3 | |
| 91.6 | DAPO | 76.0 | 82.1 | 86.3 | 89.4 | 91.6 | 93.1 | |
| 93.8 | QuestA | 75.9 | 80.3 | 83.8 | 86.4 | 88.3 | 89.7 | |
| 90.6 | NuRL | 77.6 | 82.1 | 85.2 | 87.4 | 89.2 | 90.7 | |
| 91.8 | SCRL(我们的方法) | 79.8 | 84.6 | 87.8 | 90.0 | 91.6 | 93.2 | |
| 94.8 | AIME2024 | 初始模型 | 10.9 | 16.4 | 22.0 | 27.3 | 32.4 | 37.6 |
| 43.3 | SFT | 10.6 | 15.7 | 21.9 | 28.9 | 36.1 | 43.3 | |
| 50.0 | GRPO | 14.5 | 19.1 | 23.4 | 27.4 | 31.3 | 34.9 | |
| 40.0 | DAPO | 11.8 | 16.5 | 21.6 | 27.7 | 45.7 | 56.7 | |
| QuestA | 14.1 | 17.6 | 20.8 | 23.6 | 27.3 | 32.9 | 40.0 | |
| NuRL | 13.2 | 18.0 | 22.8 | 27.9 | 33.9 | 40.3 | 46.7 | |
| SCRL(我们的方法) | 16.5 | 22.1 | 27.4 | 33.0 | 38.2 | 42.4 | 46.7 | |
| AIME2025 | 初始模型 | 6.4 | 10.8 | 16.4 | 22.1 | 27.9 | 35.4 | 46.7 |
| SFT | 10.0 | 14.6 | 22.0 | 30.1 | 38.4 | 47.3 | 56.7 | |
| GRPO | 7.2 | 12.0 | 18.0 | 24.5 | 31.1 | 37.7 | 43.3 | |
| DAPO | 9.3 | 13.9 | 18.5 | 23.3 | 29.3 | 36.4 | 43.3 | |
| QuestA | 11.7 | 16.0 | 20.2 | 24.5 | 30.3 | 37.3 | 43.3 | |
| NuRL | 8.4 | 12.9 | 17.7 | 22.5 | 27.2 | 32.5 | 40.0 | |
| SCRL(我们的方法) | 15.3 | 19.3 | 23.0 | 26.9 | 32.1 | 38.8 | 46.7 | |
| AMC | 初始模型 | 38.1 | 50.3 | 60.5 | 69.0 | 76.1 | 82.5 | 89.2 |
| SFT | 41.0 | 47.7 | 59.2 | 69.4 | 78.0 | 85.2 | 90.4 | |
| GRPO | 46.1 | 54.0 | 61.6 | 68.6 | 74.8 | 79.7 | 84.3 | |
| DAPO | 46.8 | 56.2 | 64.5 | 71.3 | 76.7 | 81.9 | 86.7 | |
| QuestA | 46.8 | 53.6 | 60.0 | 66.1 | 71.9 | 77.7 | 84.3 | |
| NuRL | 45.4 | 53.3 | 61.0 | 68.5 | 75.2 | 81.0 | 85.5 | |
| SCRL(我们的方法) | 52.4 | 61.0 | 68.6 | 74.8 | 80.4 | 85.0 | 88.0 | |
| IMO-Bench | 初始模型 | 6.1 | 9.7 | 14.0 | 18.5 | 22.9 | 27.3 | 31.6 |
| SFT | 7.1 | 11.3 | 16.4 | 21.9 | 27.4 | 32.8 | 39.0 | |
| GRPO | 7.8 | 11.2 | 14.7 | 18.2 | 21.5 | 24.8 | 27.2 | |
| DAPO | 8.3 | 12.1 | 16.2 | 20.5 | 24.8 | 28.6 | 31.6 | |
| QuestA | 8.3 | 11.1 | 14.4 | 18.2 | 22.1 | 26.4 | 30.8 | |
| NuRL | 7.1 | 9.9 | 13.0 | 16.4 | 20.0 | 23.8 | 27.2 | |
| SCRL(我们的方法) | 8.7 | 12.4 | 16.5 | 20.7 | 24.6 | 27.9 | 30.9 |
附录 F 实现细节
F.1 超参数
我们在表 8 中提供了实验中使用的详细超参数配置。所有模型均使用 Verl Sheng 等人(2025)框架进行训练,设置如下。
| 超参数 | 取值 |
| 学习率 | 1e-6 |
| 训练批次大小 | 128 |
| PPO 小批次大小 | 64 |
| 组大小 | 8 |
| 最大回复长度 | 8192 |
| 最大提示词长度 | 1024 |
| 采样温度 | 0.6 |
| 在 GRPO 中使用标准差 | 是 |
| KL 系数 | 0 |
| 评估温度 | 0.6 |
| 评估 Top- | 1.0 |
| 裁剪比率上限 | 0.2 |
| 裁剪比率下限 | 0.2 |
| 总训练步数 | 300 |
F.2 低方差 pass@ 估计
我们遵循 Chen(2021)的无偏 pass@ 估计器。对于每个问题,我们生成 个采样轨迹,并令 为正确回复的数量。估计器为
| (20) |
在评估时,我们为每个基线选择平均验证分数最高的检查点。使用选定的检查点,我们为每个测试问题生成 个轨迹,并使用上述估计器计算 pass@。该协议对所有方法及所有报告的 pass@ 值均一致使用。
F.3 基线实现细节
SFT。
我们在训练集上使用通过 DeepSeek V3.2 API 合成的推理轨迹进行监督微调(SFT)。具体来说,我们利用该 API 为所有训练样本引出详细的链式推理(CoT)路径。模型在这些合成轨迹上进行微调,以建立一个强大的监督基线。
GRPO。
我们采用 Guo 等人(2025)提出的标准分组相对策略优化实现,未添加任何额外的奖励塑形或梯度修正项。
DAPO。
一种具有解耦裁剪和动态采样机制的强化学习算法。我们设置 clip_ratio_high=0.28 和 max_num_gen_batches=10 用于过滤分组。
QuestA。
一种基于课程学习的强化学习基线,使用问题增强方法(Li 等人,2026a)。我们将训练过程分为两个各 150 步的阶段:(1)初始阶段,模型获得“部分-50”提示(即 50% 的解法),随后进入(2)第二阶段,提示缩减为“部分-25”(即 25% 的解法)。
NuRL。
NuRL(Chen 等人,2025)使用自生成提示作为抽象线索,以降低强化学习过程中的问题难度。遵循其离线提示收集设置,我们首先在第一阶段运行 150 步 GRPO,然后使用 DeepSeek-V3.2 API 构建一个包含抽象线索的过滤数据集,并在第二阶段再训练 NuRL 150 步。
附录 G 局限性与未来工作
SCRL 主要有两个局限性。首先,子问题构建依赖于外部大语言模型,这引入了额外的预处理成本,并使课程质量在一定程度上依赖于生成器。其次,SCRL 仍然基于 RLVR,因此需要子问题具有可验证答案,这使得它较难直接应用于缺乏可靠自动验证器的开放式任务。
未来工作可从两个方向展开。一个方向是将 SCRL 的信用分配机制扩展到更广泛的多轮智能体场景,这类任务通常天然包含类似子目标的中期进展。另一个方向是设计更好的子问题,包括更细粒度、更稳健且可自动验证的课程构建方法。
附录 H 硬件设置
本研究中的所有实验均在三种类型的 NVIDIA GPU 上完成:NVIDIA GeForce RTX 5090、NVIDIA A100-PCIE-40GB 和 NVIDIA H20-PCIE-96GB。
附录 I 子问题生成的提示词
附录 J 对话模板
J.1 课程学习的对话模板
J.2 原始问题的对话模板
附录 K 案例研究
我们展示了基线方法 GRPO 与我们的方法之间的详细对比。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org