Reasoning Arena:可验证奖励不足时的迹线锦标赛
Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short
针对基于可验证奖励的强化学习(RLVR)在组级别奖励无信息时无法提供梯度信号的问题,提出Reasoning Arena自适应训练框架。该框架将非多样化奖励组路由至评判系统,通过迹线锦标赛(trace tournaments)对推理迹线进行头对头比较,转化为相对奖励信号。每个新迹线仅与动态更新的少量锚点比较,然后在不完全比较图上拟合Bradley-Terry模型。在竞赛数学和编程基准上,平均超越RLVR基线7.6%,训练加速27%至41%,节省近50%生成计算量。
强化学习训推理模型常遇到奖励无法区分,这篇把被浪费的样本变成有效梯度,训练加速近 50% 同时性能还涨 7.6%,做 RL 训练的人值得细读。
韩舟
亚当·X·杨
劳伦斯·艾奇逊
安娜·科霍宁
阿尔伯特·Q·江
剑桥大学
Mistral AI
hz416@cam.ac.uk
aj@mistral.ai
本工作完成于作者在 Mistral AI 担任 AI 科学家实习生期间。
摘要
基于可验证奖励的强化学习(RLVR)已成为通过结果监督提升大语言模型推理能力的主流范式。然而,可验证奖励在组级别上常常变得缺乏信息量:当给定提示词的所有采样轨迹获得相同奖励时,组相对优势估计无法提供梯度信号,尽管这些轨迹在推理质量上可能存在显著差异。我们提出推理竞技场(Reasoning Arena),这是一种自适应训练框架,它将此类奖励无差异的组路由至裁判系统,而非直接丢弃。除了检查最终答案,推理竞技场还构建轨迹锦标赛,让推理轨迹进行两两对比,以揭示组内更细粒度的偏好,从而将推理质量转化为丰富的相对奖励信号。为了提高奖励估计效率,我们并非穷举比较每一对轨迹,而是将每条新轨迹与一个动态更新的、由先前生成轨迹组成的小型锚点池进行对比,以高效建立相对排名。随后,我们在不完整的比较图上拟合 Bradley-Terry 模型,从而无需进行二次方级别的两两比较即可实现可扩展的强化学习集成。实验结果表明,在竞赛数学和编程基准测试中,推理竞技场平均比 RLVR 基线高出 7.6%。通过将原本被浪费的零优势样本转化为有用的梯度更新,我们的方法将训练速度提升了 27% 至 41%,节省了近 50% 的生成计算量,并显著提升了整体推理性能。
1 引言
大语言模型在遵循指令、生成连贯的长篇回复以及执行多步推理方面展现出了显著的进步[18, 9]。近期,大语言模型的推理能力通过可验证奖励强化学习范式得到了进一步推进,该范式直接利用基于规则验证器提供的输出级信号来训练大语言模型。诸如 GRPO [23] 这类基于组内相对策略优化的方法推动了这一进展,其做法是针对给定提示词采样一组推理轨迹,用验证器对每条轨迹进行评分,然后使用相对于组均值计算出的优势值来更新策略。这种组级对比激励模型探索更有效的思考路径。
然而,这一范式受限于每个采样组内奖励缺乏差异性。由于 GRPO 依赖于相对于组均值计算的优势值,只有当组内轨迹获得不同奖励时,该估计器才会携带梯度信号。当数据难度与模型当前能力不匹配(要么过难,要么过易)时,很大一部分组可能最终出现所有轨迹都被标记为错误或全部正确的情况。这会导致退化组的出现,其中每个优势值都恰好为零。我们将此类情况称为非多样化奖励组。在这些情况下,整个组的奖励坍缩为一个恒定结果。尽管底层轨迹在推理质量、合理性和简洁性上可能存在显著差异,但验证器因无法提供区分它们的信号而表现不足。其结果是,该组对策略更新贡献的梯度为零,这意味着用于生成这些轨迹的昂贵计算资源被完全浪费了。
现有文献主要通过数据筛选来处理零方差问题,即采用预过滤或难度预测的方式,避免使用过于简单或不可能完成的提示词[32, 36]。然而,丢弃这些非多样化组别,会丧失其推理轨迹中蕴含的细粒度学习信号。另一条互补的研究路线试图通过熵引导的优势塑造[10, 30],直接从这些组别中恢复信号。但奖励重塑完全依赖于模型自身的 token 分布,无法区分严谨的证明与自信的幻觉。因此,非多样化奖励组别仍然是这些提示词上学习有意义推理行为的根本障碍,同时也导致强化学习训练效率低下。
为了挖掘隐藏在非多样组中的细粒度学习信号,我们提出了推理竞技场(Reasoning Arena),这是一个自适应训练框架,建立了混合奖励学习范式。推理竞技场在线检测非多样组,并动态将其路由至基于锦标赛的奖励系统,同时为多样组保留原始的可验证奖励。这确保了只要可验证奖励能产生信息量优势,它们就始终是黄金标准;仅在验证器确实不足的地方,才精确地调用评判器。对于非多样奖励组,推理竞技场构建了轨迹锦标赛:一个大语言模型评判器在组内对推理轨迹进行头对头比较。比较中间轨迹而非最终答案至关重要:它使评判器能够区分那些共享相同验证器结果但在逻辑合理性和推理质量上存在差异的解决方案,从而挖掘出尚未被有效利用的细粒度学习信号。为了使轨迹锦标赛在异步强化学习中具有可扩展性,我们引入了一种实时锦标赛策略,将轨迹与实时对手配对,其中我们维护一个包含当前最佳、最差和中等轨迹的动态池作为锚点,以高效建立相对排名。然后,我们在由此产生的不完整比较图上拟合一个布拉德利-特里(Bradley-Terry)模型,从而实现稳健且高效的优劣势估计,同时避免了完整二次成对比较所带来的高推理成本。
我们在推理领域对推理竞技场进行了广泛评估,涵盖竞赛数学和代码生成。实验结果表明,通过从非多样化奖励组中有效提取梯度信号,推理竞技场能够持续提升模型整体性能,优于仅使用标准RLVR和纯LLM作为评判者的基线方法,同时保持了领域外泛化能力。性能提升的同时,训练速度加快了27%至41%,生成计算量大幅减少近50%,这是因为原本会被丢弃的非多样化奖励组现在提供了有意义的梯度。我们的成本分析进一步表明,实时对手选择策略在与完全循环赛评估竞争时表现优异,同时有效将二次比较成本降低至线性规模。
我们的贡献总结如下:(1)我们识别了RLVR中因丢弃非多样化组而导致的低效和学习信号浪费问题,并提出在可验证奖励与基于评判者的奖励之间进行自适应路由,作为原则性解决方案,在可验证监督具有信息价值时予以保留;(2)我们提出推理竞技场,引入轨迹锦标赛作为非多样化奖励组的奖励机制,通过基于不完整图的Bradley-Terry估计的实时锦标赛无缝扩展到RL训练;(3)我们在数学和代码推理任务上展示了实证收益,同时提升了训练效率、领域外泛化能力,以及对原本会产生零优势的样本的有效利用。
2 相关工作
基于可验证奖励的强化学习。RLVR 已成为训练推理模型的主导范式,从基于偏好的对齐 [18, 19] 转向由基于规则的验证驱动的结果监督 [6]。群体相对策略优化方法 [23, 35, 3] 严重依赖群体均值优势估计器,因此继承了在非多样化奖励群体上出现关键零方差失效模式的缺陷。DAPO [32] 引入了动态采样,在训练过程中过滤掉完全正确或完全错误的群体,但这只是回避而非解决了问题:生成计算仍然被浪费,并且丧失了从这些样本中学习的潜力。DEPO [25] 和 GRESO [36] 同样在数据筛选或轨迹选择阶段跳过了信息量不足的提示词。更接近的一系列工作从非多样化群体本身提取信号:RL-ZVP [10] 和 ZAPO [30] 通过熵引导的优势塑造重新利用零方差提示词,RLPR [33] 则用概率代理模型替代验证器。由于所有这些方法中恢复的信号本质上都源于策略本身,因此无法区分严谨的证明与幻觉式的推导。Reasoning Arena 则另辟蹊径,引入了自适应应用的外部评判奖励。通过在单个 RLVR 梯度步骤中,在每个群体层面组合可验证奖励与评判奖励,非多样化群体现在获得了丰富的梯度信号,而精确验证器则在其仍具信息量的地方继续驱动学习。
大语言模型作为评判者用于丰富奖励。在确定性验证器之外,大语言模型作为评判者已成为奖励构建的一种灵活替代方案。这种方法由 RLAIF [11] 推广,随后通过基于评分细则的逐点评分 [26, 5, 22] 得到改进。由于逐点评分对提示词设计敏感且容易产生表面偏差 [16, 37],近期工作转向成对比较 [15, 21] 和基于锦标赛的排序。具体来说,锦标赛奖励已被应用于非可验证领域 [34, 4],包括基于评分细则的生成 [8]、文生图 [29, 27] 甚至文生视频 [17]。这些应用都针对不存在验证器的开放式领域,并将锦标赛作为唯一的奖励来源统一应用于每个组。推理竞技场则在一个根本不同的场景中运作:推理任务中存在验证器,但该验证器无法区分具有相同正确答案的中间推理轨迹。我们并非要取代验证器,而是将锦标赛嵌入到基于可验证奖励的强化学习(RLVR)中,并自适应地将生成结果路由到锦标赛。通过严格地在非多样化奖励组上调用评判者,推理竞技场将基于锦标赛的评判引入可验证奖励领域,作为一种有针对性的补充,在保留其他位置精确验证器的同时,恢复了丰富的相对排序信号。
3 预备知识
基于可验证奖励的强化学习。我们考虑针对具有可验证结果的推理任务进行强化学习。设 表示一个提示词, 表示一个生成推理轨迹 的策略。在训练过程中,一个生成引擎从行为策略 中采样一组轨迹 。给定一个二元的可验证奖励函数 ,组相对方法 [23] 为每个轨迹计算一个相对于同一提示组内其他样本的优势值。我们在本工作中采用 CISPO [3] 作为底层 RLVR 算法,该算法对重要性采样权重进行裁剪而非对策略梯度项进行裁剪,以保留来自稀有 token 的学习信号。RLVR 的目标函数为:
| (1) |
其中表示停止梯度。项是裁剪后的 token 级重要性采样权重,是组相对轨迹优势,用于缩放对轨迹的每个 token 级更新:
| (2) |
其中和分别表示组内奖励均值和方差。式 (2) 的定义性特征是:组内至少有一个样本必须具有非零优势才能产生学习信号。如果没有非零优势函数,该组就无法产生任何有意义的梯度贡献。
非多样化奖励组问题。我们通过组内奖励方差来形式化定义 rollout 组的奖励多样性:
| (3) |
当 时,组是奖励多样化的;当 时,组是非多样化的。在二元可验证奖励的背景下,非多样化组恰好表现为两种形式:全正确组,即每条轨迹的;以及全错误组,即每条轨迹的。根据构造,这种奖励多样性的缺失会导致严格的数学坍缩:
| (4) |
因此,无论底层轨迹在推理步骤上有多大差异,非多样化组在式 (1) 下完全不会贡献任何奖励驱动的策略梯度。这种失效模式主导了两种不同的训练阶段:全错误组在训练早期策略仍然较弱时非常普遍,而全正确组则随着策略改进而增多(图 1)。在现代异步强化学习系统中,批次必须填充到目标大小后才能进行训练步骤:一旦生成了非多样化组,该组中所有已生成的轨迹都会被丢弃。引擎必须额外采样 rollout 来填充批次,这既昂贵又低效,因为每条轨迹的生成成本决定了整个管线的延迟。这种结构性低效促使我们提出方法,从这些非多样化组中提取并利用推理差异,将原本浪费的计算转化为建设性的梯度更新。
4 推理竞技场
为解决非多样化奖励组问题,推理竞技场根据每个 rollout 组所获奖励的方差,自适应地将各组路由到不同的奖励来源。其主要动机是:在可验证奖励能提供有意义的梯度信号时保留其精确性,同时在该验证器失效时动态回退到裁判系统。对于奖励多样化的组,我们维持标准 RLVR 更新;反之,非多样化组则被路由到轨迹锦标赛。该锦标赛并非评估最终答案,而是通过逐条轨迹对比来获取关于每条轨迹推理质量的细粒度信号。为了将该机制扩展到异步强化学习,我们进一步引入了一种结合 Bradley-Terry 拟合的实时对手策略,这显著降低了计算开销。
自适应组路由。公式 (2) 中基于规则的验证器效率极高,并且只要某个组表现出奖励多样性,它就能区分生成的轨迹以提供稳健的梯度信号。相比之下,大语言模型裁判计算成本高昂且本质上噪声更大。然而,大语言模型作为裁判具有一个显著优势:它可以评估中间推理步骤,从而对具有完全相同最终答案的轨迹进行排序。这使得裁判非常适合处理非多样化奖励组——这正是验证器失效并产生零梯度的确切场景。为了充分利用两种方法的优势,推理竞技场在每组级别动态地整合了这两种奖励机制。它根据验证器是否成功产生组内方差,将组路由到信息量更丰富的奖励来源:
| (5) |
其中 表示第 2 节定义的裁判奖励(例如逐点评分或轨迹锦标赛)。将其代入式 (2) 的组统计量中,得到自适应目标函数:
| (6) |
在奖励多样化的组中,式 (6) 直接退化为标准 RLVR。路由器将裁判的干预严格限制在那些否则会产生零梯度的组上。因此,裁判奖励充当了一种有针对性的正则化项,用于提取隐藏的推理变体。
从逐点评分到轨迹锦标赛。由于非多样化奖励组中的每条轨迹都共享相同的验证器结果,最终答案无法提供区分信息,迫使裁判评估底层推理轨迹本身。 的一种直接实现方式是逐点裁判,根据预定义评分标准独立评估每条轨迹,我们后续将其作为自适应逐点基线进行评估。然而,绝对逐点评分在不同轨迹之间很难一致校准 [12, 34],且容易受到长度、格式和模糊措辞等表面启发式特征的影响 [37, 16],这些特征会无意中激励奖励破解。基于成对偏好与人类判断更稳健对齐的研究发现 [15, 37],Reasoning Arena 采用来自相同提示词和策略模型的轨迹之间的成对比较。
对于任意一对推理轨迹 ,裁判处理上下文并输出分类裁决 。我们将此裁决映射为第一条轨迹的软结果:
| (7) |
其中 是一个软间隔超参数,在无信息平局()和确定性获胜()之间进行插值。平局值严格受反对称条件 约束,这对于确保无偏胜率聚合以及在拟合 Bradley-Terry 模型时保持有效概率分布至关重要。
顺序去偏。成对的大语言模型评判器常常表现出强烈的、依赖于提示词的位置偏差[38]。为缓解这一问题,我们采用了一种简单的排列校准方法[28, 37]。在采样过程中,每个被查询对的呈现顺序被独立随机化,从而将系统性的位置偏移转化为零均值噪声。在聚合过程中,每个观察到的匹配结果都通过其镜像进行对称增强,明确强制实施有偏评判器可能违反的反对称性。
推导锦标赛奖励。对非多样性组采用朴素的锦标赛方法会执行完整的循环赛制,评判每一对以生成完整的比较匹配集。每条轨迹的锦标赛奖励随后变为其胜率:
| (8) |
虽然在完整图上数学上无偏,但循环赛在每个组上会产生高昂的推理成本,这增加了异步强化学习流水线中的陈旧性,因为长尾轨迹完成生成并延迟与对手配对时,评判计算预算保持不变。
为解决此问题,推理竞技场执行一种与异步强化学习完全并行化的实时锦标赛。一旦新轨迹完成生成,实时锦标赛会从已到达的轨迹中动态选择三个对手作为锚点进行比较。具体来说,根据逐步更新的实时排行榜,选择当前最佳、最差和中位轨迹作为实时对手。这种设置包含了始终将新生成轨迹夹在中间的极端轨迹,而中位对手则作为中间锚点来对新生成进行排序。该策略以恒定速率产生信息丰富的比较,将每个组的评判复杂度从 降至 。
Bradley-Terry 奖励聚合。由于实时对手规则会生成一个不完整、非均匀采样的比较图,直接使用原始胜率会混淆轨迹的真实推理质量与对手选择策略。为解决此问题,我们定义了每条轨迹的潜在推理对数强度,并使用 Bradley-Terry (BT) 模型 [1] 对其进行估计。裁判偏好轨迹 胜于 的概率通过逻辑 sigmoid 函数定义:
| (9) |
为稳健地拟合这些强度值,我们首先通过镜像每个已观测到的匹配来构建一个对称化的匹配集:每个结果被显式复制为 。随后,我们通过最小化 L2 正则化软交叉熵损失来估计强度向量:
| (10) |
该公式原生支持来自公式 (7) 的连续软结果,保留了裁判相对评分的粒度。该目标函数也是严格凸的,我们使用 L-BFGS-B 算法 [14] 对其进行高效优化。L2 惩罚项 () 将评分向零收缩,防止比较图稀疏时出现极端值,并能在不连通的子图上锚定全局最优解。最后,将拟合得到的潜在对数强度进行最小-最大归一化,以生成最终的标量奖励 。
5 实验
模型与数据集。我们使用 Ministral-3-8B-Instruct-2512 [13] 作为后续强化学习训练的策略模型。对于主 LLM 裁判,我们采用 DeepSeekMath-V2 [24] 来评估数学领域的推理轨迹。为研究奖励源的可扩展性,我们使用 Qwen3-235B-A22B [31] 和 Qwen3.5-122B-A10B 作为裁判进行了额外的消融实验。我们的强化学习训练使用了 [13] 中的 STEM RL 数据混合集。我们在训练过程中明确过滤掉了编码和视觉推理数据,确保编码任务用于分布外 (OOD) 评估。我们的评估任务包括竞赛数学:AIME 2024/2025/2026、Beyond AIME [2],研究生级领域推理:GPQA-Diamond [20],以及代码推理:LiveCodeBench v6 [7]。我们报告数学和 GPQA-Diamond 基准测试的平均 pass ratio@16,以及 LiveCodeBench 的 pass@5 以降低方差。
基线方法。我们将推理竞技场与以下代表性基线方法进行了比较:
- •
RLVR [3]:我们采用 CISPO 作为底层的 RLVR 算法,并直接对策略模型进行仅基于可验证奖励的强化学习训练,这构成了主要的基线方法。
- •
RLAIF [11]:我们使用相同的策略优化算法实现了一个逐点评分的 LLM 作为裁判的基线方法。奖励通过一个类似 DeepSeekMath 的证明质量评分规则生成,根据逻辑合理性对每条轨迹进行离散评分。
- •
ArenaRL [34]:一种仅从锦标赛奖励中学习的基线方法。该方法在结构上等同于将推理竞技场中的循环赛应用于所有分组,但不包含自适应路由,从而可以消融路由机制的影响。
除上述基线方法外,我们还加入了自适应逐点评分(Adaptive Pointwise),这是推理竞技场的一个变体,其中我们将锦标赛奖励替换为类似于 RLAIF 的逐点评分裁判,同时保留自适应路由机制。在我们的方法方面,我们报告了推理竞技场(Reasoning Arena)的结果,该方法使用公式(8)的胜率奖励将非多样化奖励组路由到循环赛中;以及推理竞技场-实时(Reasoning Arena-Live)的结果,该方法实现了第 2 节中的实时对手选择规则和 Bradley-Terry 奖励聚合。
| 方法 | AIME 24 | AIME 25 | AIME 26 | 超越 AIME | GPQA-D | LCB v6 | 平均分 |
|---|---|---|---|---|---|---|---|
| RLVR [3] | 58.5 | 43.8 | 46.0 | 28.2 | 54.8 | 46.7 | 46.3 |
| RLAIF [11] | 53.1 | 46.9 | 48.3 | 27.6 | 56.9 | 50.7 | 47.3 |
| ArenaRL [34] | 60.4 | 50.2 | 56.9 | 31.9 | 59.6 | 50.4 | 51.6 |
| 自适应逐点评分 | 62.9 | 51.5 | 54.4 | 31.9 | 58.5 | 48.5 | 51.3 |
| 推理竞技场 | 66.7 | 54.8 | 54.6 | 33.6 | 59.5 | 51.6 | 53.5 |
| 推理竞技场-实时 | 63.5 | 51.7 | 59.0 | 36.4 | 60.5 | 52.2 | 53.9 |
| (相对于 RLVR) | +5.0 | +7.9 | +12.9 | +8.3 | +5.7 | +5.6 | +7.6 |
主要结果。表 1 总结了最终评估性能。标准 RLVR 的平均得分为 ,表明可验证奖励虽然有效,但留下了大量未使用的学习信号。RLAIF 仅温和地提升了平均分,表明在可验证领域全面替换验证器并非最优方案。相比之下,我们的自适应路由方法均带来了一致的增益:Reasoning Arena-Live 达到了平均性能 ,平均优于 RLVR 。值得注意的是,它在 AIME 2026 上提升了 分,并在其余任务上持续改进。这表明,将非多样化奖励组中的隐藏信号转化出来,对于性能提升至关重要,它有效扩展了可用的学习信号,同时保留了原有的可验证监督。
| 方法 | 裁判调用次数 | 被路由的组 | 有效调用次数 | 步骤时间 | 每次生成的次数 / 步骤 | 性能 |
| RLVR [3] | 0 | 0.0 | 17.7 | 908 | 46.3 | |
| RLAIF [11] | 47.3 | |||||
| ArenaRL [34] | 10.5 | 51.6 | ||||
| 自适应逐点 | 51.3 | |||||
| Reasoning Arena | 459 | 53.5 | ||||
| Reasoning Arena-Live | 43 | 7.7 | 13.0 | 455 | 53.9 |
图 3 比较了不同强化学习步骤下的性能表现。RLVR 与 Reasoning Arena 之间的差距在训练过程中稳步扩大,这表明非多样化奖励组在整个优化过程中都能提供可用的梯度。这种差异在训练后期尤为明显。随着策略的改进,全对组变得越来越普遍。虽然标准的组相对 RLVR 为这些组分配零优势,但 Reasoning Arena 成功提取了细粒度的、基于轨迹的偏好。此外,在 LiveCodeBench 和 GPQA-Diamond 上的持续进展表明,我们的自适应锦标赛通过从外部分布中学习,保持了分布外泛化能力,从而缓解了纯验证器驱动训练中常见的领域过拟合问题。
效率。表 2 详细列出了所评估奖励配置的裁判调用复杂度。在组大小为 [原文未给出具体数值] 的情况下,完整轨迹锦标赛每个路由组需要调用 [原文未给出具体数值] 次裁判。实时对手策略将此上限降低至 [原文未给出具体数值] 次调用,同时提升了整体平均性能。由于自适应路由仅针对非多样化组,实际的裁判成本会因批次中奖励多样化组所占比例而大幅降低。关键在于,这种自适应机制显著提升了整体训练效率。在标准 RLVR 中,非多样化组产生零方差,因此也带来零优势,这意味着生成这些轨迹的计算成本被完全浪费了。而 Reasoning Arena 则将每步的挂钟时间减少了 27% 到 41%,同时每步节省了近 50% 的生成量,大幅降低了生成开销。通过将这些先前被丢弃的 rollout 转化为丰富的锦标赛信号,Reasoning Arena 以实际可行的裁判成本,最大限度地提高了样本效率和训练效率,适用于可扩展的强化学习训练。
消融自适应路由机制。ArenaRL 与 Reasoning Arena 之间的对比凸显了自适应路由的效果。ArenaRL 统一应用锦标赛奖励,并优于 RLVR,但它舍弃了精确验证器在奖励多样化组上的特殊可靠性。相反,Reasoning Arena 仅在验证器无法提供组内对比时才使用锦标赛。这种策略性路由在将计算资源集中在目标数据子集上的同时,取得了比 ArenaRL 更高的平均性能。图5反映了不同学习策略在强化学习中的样本效率。值得注意的是,尽管 ArenaRL 具有较高的非零优势样本比例,但其 L1 范数相对较小,而 Reasoning Arena 有效地将样本利用率提升至接近 100%,同时提供了更密集的奖励信号。这一观察结果进一步巩固了自适应路由机制在提升训练效率和样本效率两方面的作用。
锦标赛式评分 vs. 逐点评分。将 Reasoning Arena 与自适应逐点评分进行对比,可以消融路由奖励源的形式。两种方法采用相同的自适应路由,区别仅在于对非多样化奖励组的评分方式。轨迹锦标赛将平均分从 [原文缺失数值] 提升至完整锦标赛的 [原文缺失数值]。这一差距表明,仅仅引入一个大语言模型评判者是不够的,奖励评估的形式更为关键。逐点评分迫使评判者孤立地给出一个绝对数值,这使得在没有详尽评分细则的情况下,跨轨迹校准变得极其困难,容易受表面启发式方法的影响。而两两比较则通过向评判者展示两条共享相同可验证结果的轨迹,从根本上将评估锚定在具体情境中。这自然确立了基线,迫使奖励分布反映真实的相对推理质量,而非格式上的伪影。
不同评判模型的有效性。我们进一步研究了我们的方法在不同评判模型下的鲁棒性。将 Reasoning Arena 中的 DeepSeekMath-V2 (685B) 替换为更广泛的模型,例如 Qwen3-235B-A22B 和 Qwen3.5-122B-A10B,揭示了一种缩放行为。容量更高的模型在其两两偏好中表现出更优的一致性,尤其是在评判复杂的、多步骤的逻辑推导时。虽然 DeepSeekMath 在数学领域非常有效,但 Qwen 系列变体也能为非多样化奖励组提供稳健的奖励信号,这表明 Reasoning Arena 对评判模型具有鲁棒性。
对轨迹锦标赛机制的分析。为了理解轨迹锦标赛的定性优势,我们分析了全正确组和全错误组中的成对评判结果(详见附录C)。对于全正确组,评判者会持续惩罚那些通过逻辑跳跃或不完整论证得出正确答案的轨迹。相反,对于全错误组,锦标赛机制挽救了精确验证器直接丢弃的部分学习信号。在评估有缺陷的回答时,评判者会系统性地偏好结构化的解题尝试(例如从小规模案例中推导模式),而非无依据的猜测。因此,锦标赛机制为中间推理步骤提供了密集且具有建设性的反馈,激励了合理的逻辑,无论最终答案是否正确。
6 结论
我们提出了推理竞技场(Reasoning Arena),这是一个旨在解决强化学习中的非多样化奖励组问题的自适应训练框架。当确定性验证器为采样组中的所有轨迹分配相同结果时,标准的组相对方法无法提供梯度信号。推理竞技场没有丢弃这些非多样化的推理轨迹,而是自适应地将它们路由到一对一的轨迹锦标赛中,利用大语言模型评判者从中间推理步骤中提取细粒度的相对偏好。为了将该机制扩展到异步强化学习训练中,我们开发了一种实时对手选择策略,并结合了Bradley-Terry奖励聚合方法。这使得框架能够从稀疏的比较图中推断出一致的奖励,而无需承担全二次评估的高昂成本。在数学和代码推理任务上的实证结果表明,推理竞技场始终优于标准的强化学习基线和逐点评判基线。通过将原本浪费的零优势样本转化为信息丰富的梯度更新,推理竞技场提供了一种原则性强、计算高效且样本高效的方法,用于将精确验证与大语言模型评判者相结合。
致谢
我们感谢 Mistral AI 所有其他同事提供的宝贵反馈。本研究得到了英国研究与创新署(UKRI)前沿研究基金 EP/Y031350/1(英国政府对 ERC 高级研究基金的资助担保)的支持,该基金授予剑桥大学的 Anna Korhonen。
参考文献
- Bradley & Terry [1952] Bradley, R. A. 和 Terry, M. E. 不完全区组设计的秩分析:I. 配对比较法。《生物统计学》,39(3/4):324–345,1952 年。
- ByteDance-Seed [2025] ByteDance-Seed. Beyondaime:超越高中奥数的数学推理评估进阶。Hugging Face 仓库,2025 年。
- Chen 等人 [2025] Chen, A., Li, A., Gong, B., Jiang, B., Fei, B., Yang, B., Shan, B., Yu, C., Wang, C., Zhu, C., 等. Minimax-m1:利用闪电注意力高效扩展测试时计算。arXiv 预印本 arXiv:2506.13585,2025 年。
- Feng 等人 [2026] Feng, D., Kumar, B., 和 Tang, L. Tourno:非可验证领域中强化学习的锦标赛优化,2026 年。URL https://www.haizelabs.com/blog/tourno。
- Gunjal 等人 [2026] Gunjal, A., Wang, A., Lau, E., Nath, V., He, Y., Liu, B., 和 Hendryx, S. M. 评分标准作为奖励:超越可验证领域的强化学习。第十四届国际学习表征会议,2026 年。URL https://openreview.net/forum?id=c1bTcrDmt4。
- Guo 等人 [2025] Guo, D., Yang, D., Zhang, H., Song, J., Zhang, R., Xu, R., Zhu, Q., Ma, S., Wang, P., Bi, X., 等. DeepSeek-R1:通过强化学习激励大语言模型的推理能力。arXiv 预印本 arXiv:2501.12948,2025 年。
- Jain 等人 [2025] Jain, N., Han, K., Gu, A., Li, W.-D., Yan, F., Zhang, T., Wang, S., Solar-Lezama, A., Sen, K., 和 Stoica, I. LiveCodeBench:对代码大语言模型进行整体且无污染的评估。第十三届国际学习表征会议,2025 年。URL https://openreview.net/forum?id=chfJJYC3iL。
- Jia 等人 [2026] Jia, R., Yang, Y., Wu, Y., Gai, Y., Tao, S., Zhou, M., Lin, J., Jiang, X., 和 Jiang, G. 开放评分系统:利用成对自适应评分标准扩展强化学习。arXiv 预印本 arXiv:2602.14069,2026 年。
- Kojima 等人 [2022] Kojima, T., Gu, S. S., Reid, M., Matsuo, Y., and Iwasawa, Y. 大语言模型是零样本推理者。《神经信息处理系统进展》,35:22199–22213,2022年。
- Le 等人 [2026] Le, T.-L. V., Jeon, M., Vu, K., Lai, V. D., and Yang, E. 不遗漏任何提示词:通过熵引导的优势塑形在 LLM 强化学习中利用零方差提示词。第十四届国际学习表征会议,2026年。URL https://openreview.net/forum?id=kiXFIESZKv。
- Lee 等人 [2024] Lee, H., Phatale, S., Mansoor, H., Mesnard, T., Ferret, J., Lu, K., Bishop, C., Hall, E., Carbune, V., Rastogi, A., and Prakash, S. RLAIF 与 RLHF 对比:利用 AI 反馈扩展基于人类反馈的强化学习。第四十一届国际机器学习会议,ICML 2024,奥地利维也纳,2024年7月21-27日,第26874–26901页,2024年。URL https://proceedings.mlr.press/v235/lee24t.html。
- Li 等人 [2025] Li, C., Zhou, H., Glavaš, G., Korhonen, A., and Vulić, I. 大语言模型是校准不佳的上下文学习者。载于 Che, W., Nabende, J., Shutova, E., and Pilehvar, M. T.(编),《计算语言学协会发现:ACL 2025》,第11575–11596页,奥地利维也纳,2025年7月。计算语言学协会。ISBN 979-8-89176-256-5。doi: 10.18653/v1/2025.findings-acl.603。URL https://aclanthology.org/2025.findings-acl.603/。
- Liu 等人 [2026a] Liu, A. H., Khandelwal, K., Subramanian, S., Jouault, V., Rastogi, A., Sadé, A., Jeffares, A., Jiang, A., Cahill, A., Gavaudan, A., 等。Ministral 3。arXiv 预印本 arXiv:2601.08584,2026a。
- Liu & Nocedal [1989] Liu, D. C. and Nocedal, J. 关于大规模优化的有限内存 BFGS 方法。《数学规划》,45(1):503–528,1989年。doi: 10.1007/BF01589116。URL https://doi.org/10.1007/BF01589116。
- Liu 等人 [2024] Liu, Y., Zhou, H., Guo, Z., Shareghi, E., Vulić, I., Korhonen, A., and Collier, N. 与人类判断对齐:成对偏好在大语言模型评估器中的作用。第一届语言建模会议,2024年。URL https://openreview.net/forum?id=9gdZI7c6yr。
- Liu 等人 [2026b] Liu, Y., Yu, Y., Su, D., Wang, S., Wang, X., Jiang, S., Liu, B., Cohan, A., Tian, Y., 和 Chen, Z. 在不可验证的大语言模型后训练中审视推理型大语言模型作为评判者。arXiv 预印本 arXiv:2603.12246,2026b。
- Long 等人 [2025] Long, D. X., Wan, X., Nakhost, H., Lee, C.-Y., Pfister, T., 和 Arık, S. Ö. Vista:一种测试时自我改进的视频生成智能体。arXiv 预印本 arXiv:2510.15831,2025。
- Ouyang 等人 [2022] Ouyang, L., Wu, J., Jiang, X., Almeida, D., Wainwright, C., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., 等人. 通过人类反馈训练语言模型遵循指令。神经信息处理系统进展,35:27730–27744,2022。
- Rafailov 等人 [2023] Rafailov, R., Sharma, A., Mitchell, E., Manning, C. D., Ermon, S., 和 Finn, C. 直接偏好优化:你的语言模型其实是一个奖励模型。神经信息处理系统进展,36:53728–53741,2023。
- Rein 等人 [2024] Rein, D., Hou, B. L., Stickland, A. C., Petty, J., Pang, R. Y., Dirani, J., Michael, J., 和 Bowman, S. R. GPQA:一个研究生级别的谷歌无法直接回答的问答基准。第一届语言建模会议,2024。URL https://openreview.net/forum?id=Ti67584b98。
- Rezaei 等人 [2025] Rezaei, M., Vacareanu, R., Wang, Z., Wang, C., Liu, B., He, Y., 和 Akyürek, A. F. 基于成对比较的在线评分标准生成。arXiv 预印本 arXiv:2510.07284,2025。
- Shao 等人 [2025a] Shao, R., Asai, A., Shen, S. Z., Ivison, H., Kishore, V., Zhuo, J., Zhao, X., Park, M., Finlayson, S. G., Sontag, D., 等人. Dr Tulu:基于演化评分标准的强化学习用于深度研究。arXiv 预印本 arXiv:2511.19399,2025a。
- Shao 等人 [2024] Shao, Z., Wang, P., Zhu, Q., Xu, R., Song, J., Bi, X., Zhang, H., Zhang, M., Li, Y., Wu, Y., 等人. DeepSeekMath:突破开放语言模型数学推理的极限。arXiv 预印本 arXiv:2402.03300,2024。
- Shao 等人 [2025b] Shao, Z., Luo, Y., Lu, C., Ren, Z., Hu, J., Ye, T., Gou, Z., Ma, S., 和 Zhang, X. DeepSeekMath-V2:迈向可自我验证的数学推理。arXiv 预印本 arXiv:2511.22570,2025b。
- Tang 等人 [2025] Tang, X., Zhang, Z., Liu, Y., Zhao, W. X., Wen, Z., Zhang, Z., 和 Zhou, J. 面向可验证奖励强化学习的高数据效率研究. arXiv 预印本 arXiv:2509.01321, 2025.
- Viswanathan 等人 [2026] Viswanathan, V., Sun, Y., Kong, X., Cao, M., Neubig, G., 和 Wu, T. 在对齐语言模型时,清单优于奖励模型. 第三十九届神经信息处理系统年度会议, 2026. URL https://openreview.net/forum?id=RPRqKhjrr6.
- Wan 等人 [2025] Wan, X., Zhou, H., Sun, R., Nakhost, H., Jiang, K., Sinha, R., 和 Arık, S. Ö. Maestro:通过智能体编排实现自我改进的文本到图像生成. arXiv 预印本 arXiv:2509.10704, 2025.
- Wang 等人 [2024] Wang, P., Li, L., Chen, L., Cai, Z., Zhu, D., Lin, B., Cao, Y., Kong, L., Liu, Q., Liu, T., 和 Sui, Z. 大语言模型并非公平的评估者. 收录于 Ku, L.-W., Martins, A., 和 Srikumar, V. (编), 第62届计算语言学协会年会论文集 (第1卷: 长文), 第 9440–9450 页, 泰国曼谷, 2024年8月. 计算语言学协会. doi: 10.18653/v1/2024.acl-long.511. URL https://aclanthology.org/2024.acl-long.511/.
- Wang 等人 [2025] Wang, Y., Li, Z., Zang, Y., Zhou, Y., Bu, J., Wang, C., Lu, Q., Jin, C., 和 Wang, J. Pref-grpo:基于成对偏好奖励的 GRPO 用于稳定的文本到图像强化学习. arXiv 预印本 arXiv:2508.20751, 2025.
- Wu 等人 [2025] Wu, G., Liao, W., JIANG, C., Lu, X., Ma, L., 和 Wei, Y. 无用,还是未被发掘?释放零优势样本的全部价值以实现更优的策略优化, 2025. URL https://openreview.net/forum?id=FPVB4qSXCZ.
- Yang 等人 [2025] Yang, A., Li, A., Yang, B., Zhang, B., Hui, B., Zheng, B., Yu, B., Gao, C., Huang, C., Lv, C., 等. Qwen3 技术报告. arXiv 预印本 arXiv:2505.09388, 2025.
- Yu 等人 [2025a] Yu, Q., Zhang, Z., Zhu, R., Yuan, Y., Zuo, X., Yue, Y., Dai, W., Fan, T., Liu, G., Liu, L., 等. Dapo:一个大规模开源大语言模型强化学习系统. arXiv 预印本 arXiv:2503.14476, 2025a.
- Yu 等人 [2025b] Yu, T., Ji, B., Wang, S., Yao, S., Wang, Z., Cui, G., Yuan, L., Ding, N., Yao, Y., Liu, Z., 等. Rlpr: 将 RLVR 推广至无验证器的通用领域. arXiv 预印本 arXiv:2506.18254, 2025b.
- Zhang 等人 [2026] Zhang, Q., Chen, B., Zhang, F., Ding, R., Wang, S., Wang, Q., Huang, Y., Zhang, H., Zhu, R., Wang, P., 等. Arenarl: 通过基于锦标赛的相对排名扩展面向开放智能体的强化学习. arXiv 预印本 arXiv:2601.06487, 2026.
- Zheng 等人 [2025] Zheng, C., Liu, S., Li, M., Chen, X.-H., Yu, B., Gao, C., Dang, K., Liu, Y., Men, R., Yang, A., 等. 分组序列策略优化. arXiv 预印本 arXiv:2507.18071, 2025.
- Zheng 等人 [2026] Zheng, H., Zhou, Y., Bartoldson, B. R., Kailkhura, B., Lai, F., Zhao, J., 和 Chen, B. 只在有回报时行动:通过选择性推理展开实现大语言模型推理的高效强化学习. 收录于第三十九届神经信息处理系统年度会议, 2026. URL https://openreview.net/forum?id=x5lITYXmW2.
- Zhou 等人 [2024a] Zhou, H., Wan, X., Liu, Y., Collier, N., Vulić, I., 和 Korhonen, A. 更公平的偏好能引出更符合人类对齐的大语言模型判断. 载于 Al-Onaizan, Y., Bansal, M., 和 Chen, Y.-N. (编), 《2024年自然语言处理经验方法会议论文集》, 第 1241–1252 页, 美国佛罗里达州迈阿密, 2024 年 11 月. 计算语言学协会. doi: 10.18653/v1/2024.emnlp-main.72. URL https://aclanthology.org/2024.emnlp-main.72/.
- Zhou 等人 [2024b] Zhou, H., Wan, X., Proleev, L., Mincu, D., Chen, J., Heller, K. A., 和 Roy, S. 批量校准:重新思考上下文学习与提示词工程中的校准. 收录于第十二届国际学习表征会议, 2024b. URL https://openreview.net/forum?id=L3FHMoKZcS.
附录 A 局限性与未来工作
Reasoning Arena 是一种与特定模型架构和强化学习算法正交的自适应奖励框架。通过从非多样化奖励组中提取细粒度信号,它相较于纯粹的可验证奖励带来了显著改进。尽管我们提出的自适应路由机制能有效回收这些原本被浪费的信号,但我们注意到,非多样化奖励组的固有普遍性仍然取决于底层数据混合策略以及策略模型的基础能力。尽管如此,Reasoning Arena 减轻了为构建完美难度匹配数据集而穷举预过滤或重新评分训练语料库的计算负担——而针对每个待训练的策略模型执行此类操作本身既昂贵又困难。
由于异步强化学习固有的严格延迟和离策略约束,传递完整的推理轨迹很容易使每对输入超过 160,000 个模型 token。因此,Reasoning Arena 目前依赖于策略模型响应主干中本地生成的简洁推理痕迹。在未来的工作中,智能地整合截断后的推理 token 可以进一步提升评判模型的评估准确性。此外,Reasoning Arena 的适用性可以自然地扩展到工具使用型智能体,其中数十到数百次中间工具调用以及高级规划步骤可以作为评判模型进行评估的推理痕迹。
尽管我们的方法显著提升了整体样本效率和训练效率,但其代价是需要额外的 GPU 资源或 API 算力来运行评判模型。这就在运行时加速、生成效率和总资源分配之间建立了一种实际的权衡关系。总体而言,Reasoning Arena 是一种高度通用的方法,用于解决可验证奖励中的非多样化奖励组问题,为高效的 RLVR 优化提供了一个系统性框架。
附录 B 实现细节
模型与数据集。在本工作中,我们使用了以下模型和数据集,所有这些均在各自许可协议下发布,仅供研究使用。
我们使用:1)Ministral-3-8B-Instruct-2512 [13](Mistral 研究许可协议:https://mistral.ai/licenses/MRL-0.1.md)作为通过在线强化学习训练的策略模型;2)DeepSeekMath-V2 [24](Apache 2.0 许可协议:https://huggingface.co/deepseek-ai/DeepSeek-Math-V2/blob/main/LICENSE)作为用于两两锦标赛和逐点评分的大语言模型评判器;3)Qwen3-235B-A22B [31](Apache 2.0 许可协议:https://huggingface.co/Qwen/Qwen3-235B-A22B/blob/main/LICENSE)和 Qwen3.5-122B-A10B(Apache 2.0 许可协议:https://huggingface.co/Qwen/Qwen3.5-122B-A10B/blob/main/LICENSE)作为评判器系列消融研究的替代评判器主干模型。
我们在以下基准上进行评估:1)AIME 2024、AIME 2025 和 AIME 2026(试题版权归美国数学协会所有)作为竞赛级数学基准;2)BeyondAIME [2](CC0 1.0 通用公共领域贡献声明:https://huggingface.co/datasets/ByteDance-Seed/BeyondAIME);3)GPQA-Diamond [20](CC-BY-4.0 许可协议:https://github.com/idavidrein/gpqa/blob/main/LICENSE)作为研究生级别的“谷歌无法直接解答”问答基准;以及 4)LiveCodeBench [7](MIT 许可协议:https://github.com/LiveCodeBench/LiveCodeBench/blob/main/LICENSE)作为编程基准。
实验设置。我们使用 FP8 量化训练 Ministral 3 8B Instruct,最大序列长度为 ,恒定学习率为 4e-7,优化步骤包含预热步骤;每个小批量包含 RL 采样的轨迹,组大小为 。我们设置 和 用于单侧裁剪。完整的循环赛每非多样组需要 次评判器推理,而带有三个对手的 Reasoning Arena-Live 最多需要()次推理,这样早期的轨迹只会与可用的对手进行比较,而较晚的轨迹则与三个锚点进行比较。评判器使用 个 token 的上下文窗口,并接收真实答案作为其提示词上下文中的参考。我们部署评判器模型以确保在没有拥塞的情况下进行足够的评判器推理。提示词模板请参考附录 D。
附录 C 轨迹锦标赛演示
全对非多样奖励组。
题目:
参考答案:。
回答 A:
回答 B:
评判器裁决:
全错非多样奖励组。
题目:
参考答案:.
回答 A:
回答 B:
评判结论:
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org