LLM-as-a-Verifier:一种通用验证框架
LLM-as-a-Verifier: A General-Purpose Verification Framework
LLM-as-a-Verifier 是一种无需额外训练的通用验证框架,通过计算评分 token logits 分布的期望生成连续分数,实现细粒度反馈。该框架在 Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)和 MedAgentBench(73.3%)上取得 SOTA 性能。其细粒度信号可用于 Claude Code 扩展,帮助开发者监控和改进智能体系统,也可为强化学习(如 SAC、GRPO)提供密集反馈,提升机器人学和数学推理基准的样本效率。
把验证当作新的缩放轴,这个思路很扎实,尤其直接给 Claude Code 搭了扩展。做 agent 系统的开发者现在可以试试把评估模块换成连续概率打分,也许比离散判断有效。
Jacky Kwok
Shulu Li
Pranav Atreya
Yuejiang Liu
Yixing Jiang
Chelsea Finn
Marco Pavone
Ion Stoica
Azalia Mirhoseini
加州大学伯克利分校
NVIDIA 研究院
摘要:扩展预训练、后训练和测试时计算已成为提升大语言模型(LLM)能力的核心范式。在这项工作中,我们识别出验证——即判断解决方案正确性的能力——作为一条新的扩展轴。为了解锁这一能力并展示其有效性,我们提出了“大语言模型即验证器”(LLM-as-a-Verifier),这是一个通用的验证框架,能够为智能体任务提供细粒度反馈,且无需额外训练。与标准的大语言模型评判器(LM judges)不同——后者会提示LLM为候选方案生成离散分数——LLM-as-a-Verifier通过计算评分token logits分布的期望值来生成连续分数。这种概率化公式在比较复杂方案时显著降低了平局率,并使验证能够在多个维度上扩展:(1)评分粒度,(2)重复评估,以及(3)标准分解。特别地,我们展示了扩展评分粒度能够更好地区分正负方案,从而实现更校准的比较。此外,扩展重复评估和标准分解通过降低方差和复杂度,持续带来验证准确率的额外提升。为了使验证扩展变得实用,我们进一步引入了一种成本高效的排序算法,利用从验证器连续分数中推导出的偏好概率,从候选方案中选出最佳方案。LLM-as-a-Verifier在编程、机器人和医疗领域均表现出色。它在Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)和MedAgentBench(73.3%)上取得了最先进的性能。除了验证之外,LLM-as-a-Verifier提供的细粒度信号还可作为估算任务进度的代理指标。我们为Claude Code和Codex构建了扩展,使开发者能够监控和改进他们自己的智能体系统。最后,我们展示了LLM-as-a-Verifier可作为强化学习的密集奖励信号,提升SAC和GRPO在机器人和数学推理基准上的样本效率。
1 引言
大语言模型(LLM)的最新进展已将扩展确立为提升其能力的核心范式。性能的提升得益于沿多个维度的扩展,包括预训练数据和算力、后训练优化以及测试时推理[kaplan_scaling_2020, gao_scaling_2022, snell_scaling_2024]。
然而,尽管生成能力已从这些扩展范式中显著受益,但验证能力——即判断解决方案质量或正确性的能力——却未能实现同等程度的扩展。在这项工作中,我们认为验证本身构成了一条独特且尚未充分探索的扩展轴。与受益于成熟扩展定律的生成能力不同,当前系统中的验证能力从根本上仍受到限制。具体而言,标准的大语言模型评判器将评分分布压缩为粗粒度的离散分数[zheng_judging_nodate, singh_v_1_2026],导致评分平局和区分度差;而学习型奖励模型则受限于训练数据,且往往难以跨领域泛化[zhang2025generativeverifiersrewardmodeling, cobbe_training_2021]。这些局限性阻碍了验证能力的可扩展性,从而制约了性能的进一步提升。
为此,我们引入了 LLM-as-a-Verifier,这是一个通用验证框架,无需额外训练即可提供密集且细粒度的反馈。与传统的在语言空间内提示大语言模型生成离散分数的方法不同,LLM-as-a-Verifier 通过计算评分 token logits 分布的期望值来评估候选解决方案的质量。在图 4 中,我们展示了这种概率公式为验证解锁了多个可扩展维度。我们首先证明,在比较复杂解决方案时,增加提取的 token logits 数量能持续降低平局率,并改善正负解决方案之间的区分度。我们观察到,单次评估或单一标准可能存在偏差或噪声。为缓解这一问题,我们沿着另外两个维度扩展验证:重复评估(降低方差)和标准分解(减少提示偏差),从而获得更高的验证准确率。我们在受控预算下量化了这些扩展收益,并在第 4 节中将 LLM-as-a-Verifier 与离散语言模型评判基准进行了比较。为使验证扩展具有实用性,我们进一步引入了一种成本高效的排序算法,利用从验证器连续分数中得出的偏好概率,从候选方案中选出最佳解决方案。
有趣的是,我们发现大语言模型即验证器(LLM-as-a-Verifier)产生的细粒度信号能够评估整个交互轨迹,而不仅仅是像过程奖励模型(PRM)和结果奖励模型(ORM)那样只评估中间步骤或最终结果[cobbe_training_2021, lightman_lets_2023](用于智能体任务)。当与我们的低成本排序算法结合作为轨迹奖励模型使用时,大语言模型即验证器在编程、机器人技术和医疗领域的挑战性基准测试中均超越了前沿模型。它在Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(轨迹偏好准确率87.4%)和MedAgentBench(73.3%)上均达到了最先进的性能。
除了作为验证器的作用之外,我们的方法还可以作为评估任务进度的代理。值得注意的是,我们观察到步骤的时间顺序与验证器得分之间存在强相关性(图8)。为了实例化这些能力,我们为Claude Code和Codex提供了扩展,使用户能够监控任务进度,并利用大语言模型即验证器的优势来改进他们自己的智能体系统。在机器人技术领域,我们的方法优于最先进的奖励模型,包括Robometer [liang2026robometer]、TOPReward [chen2026topreward]和RoboReward [lee2026roboreward],实现了0.966的平均值序相关性(VOC)。总体而言,大语言模型即验证器提供了一种可扩展的机制,用于改进在真实环境中对自主智能体和机器人的评估与监控。
此外,我们证明,将大语言模型即验证器用作密集奖励信号可以提高离策略(off-policy)和在策略(on-policy)强化学习算法的样本效率。在LIBERO [liu2023liberobenchmarkingknowledgetransfer]上,当使用DSRL-SAC [wagenmaker2025steeringdiffusionpolicylatent]微调策略时,大语言模型即验证器比稀疏奖励基线实现了更高的样本效率,同时达到了更高的最终成功率。在MATH推理基准测试上,当使用GRPO [deepseek-ai_deepseek-r1_2025]微调Qwen3-8B时,它也实现了更高的样本效率。
- 1.
我们提出“大语言模型即验证器”(LLM-as-a-Verifier)这一概率验证框架,它利用评分 token 的完整 logits 分布来生成细粒度反馈,并刻画验证扩展的三个关键维度:(1) 评分粒度、(2) 重复评估、(3) 标准分解。
- 2.
我们提出一种成本高效的候选排序算法,并证明当与验证扩展相结合时,LLM-as-a-Verifier 无需额外训练,即可在编程、机器人技术和医学基准测试中达到最先进的性能。
- 3.
我们表明,细粒度验证器评分与智能体的任务进展相关,可用于监控智能体和机器人的行为。
- 4.
我们证明,LLM-as-a-Verifier 能够为强化学习提供密集反馈,从而提升机器人技术和数学推理基准测试中在线策略和离线策略算法的样本效率。
2 预备知识
我们将智能体与环境交互建模为一个有限时域马尔可夫决策过程(MDP),其中 表示上下文空间, 表示状态空间, 表示动作空间, 表示转移动力学, 表示奖励函数, 表示时域。在每个回合开始时,采样一个任务提示词,智能体从初始状态 开始。在每个时间步 ,智能体观察当前状态 ,选择动作 ,并转移到下一个状态 。在基于大语言模型的智能体中,状态对应先前的交互历史,动作对应 token 序列,例如自然语言响应、代码编辑和工具调用。一条轨迹定义为 。我们假设可以访问一个由 参数化的语言模型 ,动作通过自回归方式从中采样。奖励模型 为动作或轨迹分配一个标量分数。传统方法依赖于提示大语言模型在语言空间中生成离散分数。形式上,此类奖励模型可写为 ,其中分数是生成的 token。
3 提出的方法:LLM-as-a-Verifier
3.1 动机
大多数模型已经具备解决许多任务的能力:当重复执行时,它们往往至少能产生一次正确的解决方案。如图5(左)所示,在Terminal-Bench上,假设我们可以使用一个始终能选出最优轨迹的预言验证器,那么随着采样轨迹数量的增加,已解决任务的比例也在持续上升。在这种设置下,当汇集整个Terminal-Bench V2排行榜上的所有轨迹时,成功率达到了98.9%,实际上解决了几乎整个基准测试。然而,要利用这一潜力,需要一个能够可靠区分正确与错误轨迹的验证器。虽然标准的LM评判器可以作为验证器使用,但它们无法提供足够细粒度的反馈。具体来说,它们会提示模型输出一个离散的评分token,并选择概率最高的token作为最终分数,从而将整个评分分布压缩成一个单一数值。这导致了本质上粗糙的评估。在比较复杂解决方案时,标准LM评判器常常给出相同的分数,导致平局,无法区分它们之间的差异。结果,粗粒度的评分在Terminal-Bench上导致了高平局率(27%),不同的轨迹常常被压缩成相同的分数,如图7所示。另一种方法是训练一个奖励模型,但这类方法受限于其训练数据,且往往难以跨领域泛化。这些局限性促使我们需要一个可泛化的框架,能够提供细粒度的验证信号。
3.2 方法论
细粒度奖励估计。根据定义,评判者是对事物形成整体意见并做出决定的人,而验证者则是确认某事物真实性或正确性的人,需要更详细的评估。为此,我们引入了“大语言模型作为验证者”(LLM-as-a-Verifier),这是一个概率验证框架,通过扩展评分粒度、重复评估和标准分解来提供细粒度的反馈。
令 表示一个有序的 token 集合,代表离散的评分等级。给定一个任务提示词 、一个语言模型 、一个评估标准 ,以及两个候选轨迹 和 ,我们构建评分提示词,并通过从 和 标签中提取 logprobs 来获得它们的条件分布 和 ,具体使用以下提示词:
你是一位专业的 [领域] 评审员。你将看到一项任务描述和两个轨迹。
评估标准:[领域特定标准]
任务:{任务提示词} 轨迹 A:{A} 轨迹 B:{B}
仔细分析每个轨迹,然后给出你的最终评分:
<score_A> INTEGER_1_TO_20 </score_A> <score_B> INTEGER_1_TO_20 </score_B>评分规则:根据评估标准,在 1–20 的范围内对正确性进行评分(1 = 不正确,10 = 临界,20 = 正确)
注意:我们使用基于字母的评分等级而非数字,以便提取 logprob 来实现粒度缩放。
我们并非将每个分布压缩为单个离散分数,而是将轨迹的奖励近似为:
| (3.1) |
其中 是评估标准的数量, 是重复验证的次数, 是评分 token 的数量(粒度等级), 是模型分配给评分 token 的概率, 将每个评分 token 映射为一个标量值。
我们首先通过线性映射 对 进行归一化。然后,使用 Bradley–Terry 模型将这些连续奖励转换为成对偏好,将 视为轨迹 的潜在强度:
| (3.2) |
概率化枢轴锦标赛。
为了从候选轨迹中选出最佳者,我们可以运行一个循环赛,对所有配对进行评分并累积胜场。
使用公式 3.2 的偏好概率。然而,这种方案的规模会随配对验证次数呈线性增长,并随着 增大而迅速主导验证成本。我们提出一种预算高效的替代方案——概率枢轴锦标赛(PPT),如图 6 所示。在该方案中,每个候选者仅与一小部分枢轴进行比较,从而将预算从 降低至 。关键在于,枢轴的选择决定了节省的预算是否花得值:任意选取的锚点会将验证浪费在明显较弱的候选者上。因此,我们引入一种基于环的枢轴选择步骤,既能消除验证器的位置偏差,又能将剩余预算集中在不确定的顶尖候选者上。PPT 分三步进行:
1)环传递。我们在 上均匀随机采样一个哈密顿环,并对相邻配对 进行评分。由于环状结构,每个候选者在验证器提示词的“A”位置和“B”位置恰好各出现一次,因此语言模型对某一位置的任何系统性偏好都会在环上期望相消。
2)枢轴选择。我们根据候选者在环传递中的平均偏好对其进行排序,并选取前 个作为枢轴集合 。从经验领先者中选取枢轴,可将剩余的验证预算分配给最可能正确的候选者,从而使后续的成对比较能够区分不确定的顶尖候选者,而不是将查询浪费在弱锚点上。
3)枢轴轮次。在固定枢轴集合后,我们对(i)每个非枢轴与枢轴配对 进行评分,以及(ii) 内每个枢轴与枢轴配对进行评分。所有环传递和枢轴轮次的比较结果汇总到相同的 、 中,我们选择 。通过 进行归一化,消除了枢轴参与比较次数多于非枢轴所带来的偏差。成对验证的总次数为 ,其规模为 ,其中 。完整的生成与验证流程见算法 1(附录 B.2)。
为了严格评估排序算法并衡量其在大型候选池上的性能,我们使用 Terminus-2 框架为每个任务整理了 20 条轨迹,并在此设置下对所有方法进行了基准测试。表 9 展示了 PPT 的预算-准确率权衡关系,表明我们的方法在需要更少比较次数的情况下,优于先前的方法(例如 V1 [singh_v_1_2026])。值得注意的是,随着锚点数量的增加,性能持续提升。进一步的消融实验见附录 B.2。
4 验证扩展
公式 3.1 展示了验证可以扩展的三个独立维度:评分 token 的粒度、重复评估的次数以及评估标准的数量。每个维度针对奖励估计中不同的误差来源,我们发现这三个维度是互补的杠杆:增加粒度可以改善候选解决方案之间的分数区分度,重复评估可以平均掉单次验证过程中的偏差,而标准分解则可以捕捉轨迹质量中互补的方面。在所有扩展实验中,我们使用 Gemini 2.5 Flash [gemini25flash] 作为验证器,这使我们能够为每个评分 token 提取最多 20 个 top logprobs。在图 4 中,我们展示了 Terminal-Bench 2.0 上的验证准确率在所有三个维度上均有提升,从 提升至 ,从 提升至 ,以及从任意单一标准的 提升至三个标准集成时的 。我们通过 Terminal-Bench 中随机采样的 200 条轨迹(涵盖多个智能体框架)来测量成对验证准确率。每个维度都是一个可调节的旋钮,从业者可以根据下游应用的延迟预算进行调优。虽然我们的主要实验使用了可获取 logprob 的模型,但附录 B.6 表明,我们的框架也兼容那些不暴露 token 级对数概率的顶尖模型,只需通过一个简单的两阶段变通方案即可。
4.1 评分 Token 粒度
标准大语言模型评判器会将评分分布坍缩到概率最高的单个 token 上,从而产生一个离散的奖励值,其分辨率有限。直观来看,扩大有序 token 集合并不会让验证器获得关于轨迹的任何新信息。然而,它却为解码器提供了一个更精细的空间来投射模型的内在信念,使得原本会被四舍五入到同一整数的相近信念,现在能够映射为连续的奖励值。
| (4.1) |
| 粒度 | 1 | 4 | 16 | 20 |
|---|---|---|---|---|
| 信噪比 () | 0.775 | 0.786 | 0.797 | 0.799 |
信噪比。
为了探究更细粒度为何能提升验证效果,我们将正确 () 与错误 () 轨迹之间的成对评分差距分解为信号和噪声两个部分。我们按照公式 4.1(表 1,左)定义信噪比,其中 衡量验证器对正确轨迹相对于错误轨迹的偏好强度(信号强度),而分母 则衡量这种偏好在不同配对间的不一致性(噪声)。成对验证准确率是 的单调函数:在样本量固定的情况下,更大的标准化差距意味着 的概率更高。实验发现,在 Terminal-Bench 上,当 从 增加到 时,信噪比 从 提升至 (表 1)。因此,更细粒度的 token 能够产生校准效果更好的评分,从而更可靠地区分正确与错误轨迹,进而将成对准确率从 提升至 。
案例研究:query-optimize。
为了具体说明将粒度扩展到以及我们的概率化公式如何增强验证器的信号,我们分析了一组来自 Terminal-Bench V2 上查询优化任务的代表性轨迹对,该轨迹由 Claude Opus 4.5 在 OpenHands 框架下生成,并由 Gemini 2.5 Flash 评分。在此任务中,智能体被给予一个针对数据库的慢速 SQL 查询,并要求生成一个等效的优化版本。两条候选轨迹都生成了执行速度更快的查询,但它们在验证过程上存在关键差异。正确的轨迹会等待原始查询在标准数据库上完整运行数分钟,然后对优化后的输出进行直接比对。相比之下,失败的轨迹从未在数据库上验证等价性,而是创建了一个新数据库。如附录 B.4 中的推理轨迹所示,Gemini 2.5 Flash 可靠地识别出了这种失败模式,但使用了分级且含糊的语言(例如“略微更清晰”、“勉强更直接”)来表达,仿佛差异很小。当在 100 次重复评估中,标准的大语言模型评判器在 – 尺度上将这种细微评估压缩为离散分数(表 2),在 次运行中产生了平局(例如 vs. ),从而未能有效区分候选轨迹。对相同的 -点分布取期望值则完全消除了平局——在 次运行中正确轨迹排名更高——而将粒度扩展到 则进一步增强了信号,使得大语言模型作为验证器在 次运行中严格地将正确轨迹排在更高位置。
| 方法 | 奖励 | ✓ | (平局) | ✗ |
|---|---|---|---|---|
| 评判器(离散,) | ||||
| 验证器(连续,) | ||||
| 验证器(连续,) |
4.2 重复评估
虽然细粒度能在单次前向传播中改善分数校准,但它并未解决第二个误差来源:验证器单次评估的方差。即使在高置信度下,单次评估也可能因提示词中的虚假特征或验证器在特定轨迹上的失效模式而产生偏差。对独立评估结果取平均是一种对潜在期望奖励的蒙特卡洛估计;其方差随评估次数增加而缩小,而偏差保持不变。这种方法与细粒度互补而非重复:细粒度优化了每个单独的估计器,而重复评估则平均化了细粒度无法消除的噪声。图4(中)显示,准确率从在时的值提升至在时的值。然而,随着增大,收益逐渐递减:早期的改进来自方差降低,而额外的评估由于在更困难样本上存在相关偏差,其贡献呈现边际递减。重要的是,重复评估对离散型评判器尤其有益,因为其粗粒度的评分在较低时会导致高平局率。虽然增加有助于通过平均化打破这些平局,但这种机制对离散型评判器而言存在根本性局限。我们证明,单次前向传播的验证器()已能与高度集成的评判器()相匹敌,这凸显了细粒度概率评分能提供更强的信号。
4.3 标准分解
粒度和重复评估都假定评分标准本身是充分的;如果单一的整体标准无法很好地衡量轨迹质量,那么这两者都无济于事。在长周期智能体任务中,“这条轨迹是否正确?”这类判断将多个逻辑上不同的因素混为一谈,而面对复合问题的验证器往往会抓住提示词中最突出的那个因素。因此,我们用一组更简单的子标准来替代单一的整体评分标准。具体来说,对于代码智能体的轨迹,我们将正确性分解为三个更容易单独验证的因素:规范(轨迹是否满足所有任务要求)、输出(最终输出格式是否与预期结果匹配)和错误(轨迹的日志和工具输出中是否没有失败信号)。最终奖励取各标准期望得分的平均值,如公式 1 的外层求和所示。在图 4(右)中,任何单一标准都能达到……的准确率,而它们的集成则能达到……。
5 实验
我们将大语言模型作为验证器(LLM-as-a-Verifier)作为轨迹奖励模型(TRM)进行测试时扩展评估,涵盖四个基准测试,横跨三个领域:编程(Terminal-Bench V2 [merrill_terminal-bench_2026]、SWE-Bench Verified [jimenez_swe-bench_2024])、机器人(RoboRewardBench [lee2026roboreward])和医疗(MedAgentBench [jiang2025virtual])。在所有四个基准测试中,我们使用相同的协议:生成策略为每个任务生成候选轨迹,验证器使用算法 1 中描述的概率枢轴锦标赛对每一对进行评分,并提交归一化得分最高的轨迹。除非另有说明,验证器采用第 4.3 节所述的粒度、重复评估和三标准分解。我们的方法无需训练且即插即用:相同的验证框架应用于所有四个基准测试,无需针对每个领域进行微调。总体结果总结在图 1 中,每个基准测试的标题数据,包括基线准确率、Pass@1 和 oracle Pass@,均在表 3 中报告。
| 基线模型(准确率) | 大语言模型作为验证器 | |||||
|---|---|---|---|---|---|---|
| 基准测试 | #1 | #2 | #3 | Pass@1 | Oracle | 我们的方法 |
| Terminal-Bench V2 | GPT-5.5 (84.7%) | Opus 4.7 (80.2%) | G3.1 Pro (80.2%) | 83.1% | 92.1% | 86.5% |
| SWE-Bench Verified | Opus 4.5 (76.8%) | G3 Flash (75.8%) | M2.5 (75.8%) | 76.1% | 84.4% | 78.2% |
| MedAgentBench | Opus 4.8 (70.2%) | G3.5 Flash (66.3%) | GPT-5.5 (65.1%) | 70.2% | 75.0% | 73.3% |
5.1 Terminal-Bench V2
Terminal-Bench V2 [merrill_terminal-bench_2026] 衡量智能体在基于 shell 的环境中的熟练程度,涉及需要多步推理、文件操作以及从失败工具调用中恢复的长周期任务。该基准测试对验证器来说尤其困难,因为许多轨迹会产生语法上看似合理但实际错误的终端状态。我们使用 Capy [capy] 作为框架,并从 GPT-5.5 中为每个任务采样轨迹;Gemini 2.5 Flash 作为验证器。GPT-5.5 在 Capy 下的 Pass@1 为 ,该候选池上的 Oracle Pass@5 上限为 。大语言模型作为验证器将准确率从 提升至 ,超越了 Claude Mythos + Terminus-2 [noauthor_terminal-benchterminal_benchagentsterminus_2_nodate] ()、GPT-5.5 + NexAU-AHE ()、Claude Opus 4.7 + WOZCODE () 以及 Gemini 3.1 Pro + TongAgents (),并在 Terminal-Bench V2 上设立了新的最先进水平。¹¹¹基线准确率摘自官方 Terminal-Bench V2 和 SWE-Bench Verified 排行榜。我们进一步表明,这些提升并不依赖于特定框架。关于 Terminus-2 和 Terminus-Kira 上的更多泛化结果,请参考附录 B.1。
5.2 SWE-Bench Verified
SWE-Bench Verified [jimenez_swe-bench_2024] 是一个由人工精选的 500 个真实 GitHub Issue 子集,其中每个任务要求智能体生成一个补丁来解决该 Issue 并通过维护者的隐藏测试套件。它考验长上下文推理、跨文件编辑以及对现有代码库的遵循能力。我们使用 mini-swe-agent 作为脚手架,并且与 Terminal-Bench 上使用的同质化候选池不同,我们通过从 Claude Opus 4.5、Gemini 3 Flash 和 MiniMax M2.5 各采样一条轨迹,为每个任务构建了一个异质化的候选池。Gemini 2.5 Flash 再次担任验证器。该候选池的平均 Pass@1 为 ,Oracle Pass@3 上限为 。LLM-as-a-Verifier 在 SWE-Bench Verified 上取得了 的成绩,优于 Claude Opus 4.5 ()、Gemini 3 Flash () 和 MiniMax M2.5 ()。这些结果凸显了验证器从不同模型系列产生的多样化候选集中选择最强轨迹的能力。
5.3 RoboRewardBench
| 方法 | 准确率 (%) |
|---|---|
| TOPReward | 74.7 |
| Robometer-4B | 78.8 |
| RoboReward-8B | 81.4 |
| LLM-as-a-Judge(离散) | 70.8 |
| LLM-as-a-Verifier(我们的方法) | 87.4 |
RoboRewardBench [lee2026roboreward] 评估奖励模型在机器人操作轨迹上的表现。借鉴 liang2026robometer 的方法,我们整理出成对的演示视频,这些视频遵循相同的自然语言指令,但取得的进展程度不同;奖励模型必须输出一个偏好判断,指明哪个演示进展更大。与编程和临床基准不同,这里的输入是多帧视频,因此验证器必须跨帧整合视觉上下文,以推理朝向目标的物理进展。我们使用 Qwen 3.6 35B 作为基础 VLM 验证器,并对其 logits 中提取的评分 token 应用相同的概率公式(公式 1),同时采用粒度化和重复验证。我们在从 RoboRewardBench 中随机抽取的 500 对轨迹上进行评估,并与以下方法对比:(i) 使用相同 VLM 的离散式 LLM-as-a-Judge 基线,(ii) 专门在机器人数据上训练的奖励模型——RoboReward-8B(在 45k 个片段上训练)和 Robometer-4B(在 100 万次比较上训练),以及 (iii) TOPReward [chen2026topreward](Qwen 3.6)。如表 4 和附录 B.5 所示,LLM-as-a-Verifier 实现了偏好准确率,超越了离散式 LLM-as-a-Judge 基线()、RoboReward-8B()、Robometer-4B [liang2026robometer]()和 TOPReward(74.7%),尽管是零样本应用且未经过任何微调。我们还通过测量预测奖励与人工标注之间的平均绝对误差(MAE)在 RoboRewardBench 上进行评估。如表 5 所示,使用公式 3.1 中的连续奖励公式并结合重复评估,显著提升了与人类判断的一致性,将 MAE 从 降低至 。
| 模型 | RoboRewardBench MAE() |
|---|---|
| RoboReward 8B | 1.11 |
| RoboReward 8B + LLM-as-a-Verifier | 0.72 |
5.4 MedAgentBench
MedAgentBench [jiang2025virtual] 在模拟电子健康记录(EHR)环境中评估大语言模型智能体在涉及患者信息检索、指南查询和多步骤工具使用的医疗任务上的表现。它涵盖了一个场景:在该场景中,构建真实轨迹检查器的成本高昂,且验证错误会带来实际的安全后果,这使得它成为通用验证器的一个天然压力测试。我们使用 AgentBench 框架,并从 Claude Opus 4.8 中为每个任务采样轨迹,然后应用相同的验证流程。Claude Opus 4.8 在该测试集上的 Pass@1 为 [原文缺失],而大语言模型作为验证器(LLM-as-a-Verifier)达到了 [原文缺失],优于 Opus 4.8([原文缺失])、Gemini 3.5 Flash([原文缺失])和 GPT-5.5([原文缺失])。
6 细粒度验证器信号作为任务进度的代理指标
除了选择最佳轨迹之外,大语言模型作为验证器产生的细粒度信号可以作为标量代理指标,反映智能体在任务中的进展程度。我们使用值序相关性(VOC)来量化这一点,该指标遵循 ICLR2025_54854cf1 的方法,计算步骤的时间顺序索引与验证器对该步骤结束时的前缀所预测值之间的斯皮尔曼等级相关系数。直观地说,一个能够追踪任务进度的验证器,应该为成功执行轨迹中越靠后的前缀分配单调递增的分数,从而得到 [原文缺失],并且应该对诸如卡住或倒退等失败模式保持鲁棒性。
| (6.1) |
代码生成任务上的值序相关性(VOC)。
在 Terminal-Bench V2 上,我们测量了每个智能体动作的时间步序与验证器在对应轨迹前缀上得分之间的值序相关性(VOC)。LLM 作为验证器在成功 rollout 上会产生持续递增的分数,而在停滞或趋向失败的轨迹上则基本保持平稳,这使得同一个标量既能作为进度衡量指标,又能充当早期预警信号。图 8 以 pytorch-model-cli 任务为例展示了这一点:成功运行的分数单调递增,而失败运行的分数则持续走低。这种双重用途促使我们开发了 Claude Code 和 Codex 扩展,它们将实时验证器分数展示给用户,使得长时间运行的智能体任务在将损坏状态写入磁盘之前,可以被监控、暂停或回滚。在从 Terminal-Bench V2 运行中抽取的 500 个(成功,失败)配对中,验证器(Gemini 2.5 Flash)在成功轨迹上达到了 Spearman 值序相关性(VOC),在失败轨迹上也达到了相应值(完整数据见表 6)。代码生成任务上的值序相关性(VOC)数值表明,LLM 作为验证器产生的细粒度信号不仅是一个更好的排序器,更是一个经过校准的任务进度估计器,为自主智能体更安全的实际部署开辟了道路。
| 轨迹结果 | Spearman 值序相关性(VOC)(秩相关性) |
|---|---|
| 成功 | |
| 失败 | |
| 成功 失败(差距) |
机器人领域上的值序相关性(VOC)。
我们在 RoboReward 保留数据集中的 500 条轨迹上计算了 VOC。如表 7 所示,LLM-as-a-Verifier(Qwen 3.6, , )达到了 ,显著超过了 RoboReward-8B()、Robometer-4B()和 TOPReward()。从定性角度看,TOPReward 几乎立即趋于饱和,因此当一次 rollout 最终失败时,它失去了区分轨迹中期进展的能力;而我们基于完整评分分布的期望值则在整个回合中保持了平滑且按时间顺序对齐的信号。
| 方法 | Spearman VOC(秩相关) |
|---|---|
| LLM-as-a-Verifier(Qwen 3.6 35B,5 次重复,20 粒度) | 0.966 |
| RoboReward-8B | 0.877 |
| Robometer-4B | 0.780 |
| TOPReward(Qwen 3.6, ) | 0.565 |
编码智能体扩展
为了展示 LLM-as-a-Verifier 在真实编码智能体中的适用性,我们开发了 TurboAgent,这是一个用于 Claude Code 和其他兼容 OpenAI-API 客户端的即插即用扩展。TurboAgent 作为一个推理时代理运行,透明地置于客户端与大语言模型提供商之间,无需对底层智能体框架或后端模型进行任何修改。该代理设计还允许 TurboAgent 透明地接入现有基准测试,例如 Terminal-Bench [merrill_terminal-bench_2026]。对于每个请求,它会并行地将候选轨迹分发给后端模型,并使用所提出的概率枢轴锦标赛(PPT)选择最佳响应。除验证功能外,TurboAgent 还提供了一个基于 Web 的界面,用于可视化验证器输出并实时监控智能体进度。
7 用于强化学习的密集奖励
上一节中提出的进度信号还有助于解决强化学习(RL)中一个长期存在的难题:信用分配问题。我们证明,LLM 作为验证器(公式 3.1)提供的细粒度评分可以直接作为离策略和在策略 RL 的密集奖励,无需进行任何奖励模型训练或针对特定环境进行奖励塑形,即可提升样本效率。
离策略 RL:面向 DSRL-SAC 的密集进度奖励。
我们使用 DSRL 结合 Soft Actor-Critic(SAC)算法,在 LIBERO 数据集上微调了 [black2026pi0visionlanguageactionflowmodel] 视觉-语言-动作模型。每次轨迹 rollout 结束时,我们向 VLM 验证器输入任务指令和一组均匀子采样的渲染帧序列,得到每一步的进度曲线。随后,我们使用塑形后的奖励对 rollout 数据进行重新标注:
| (7.1) |
将重新标注的转移数据存入经验回放缓冲区,并基于从中采样的重新标注回报来训练 SAC 评论家网络。系数用于平衡环境奖励与验证器奖励。由于塑形过程是在离线状态下对已存储的轨迹进行,且不改变 SAC 的目标函数,因此无需额外算法成本即可增加密集的中间信号。
在策略 RL:面向 GRPO 的密集推理奖励。
我们使用组相对策略优化(GRPO)[deepseek-ai_deepseek-r1_2025] 在 MATH 数据集上对 Qwen3-8B [yang2025qwen3] 进行微调。该方法为每个提示词采样一组回复,并估计每个回复相对于该组的优势值。在训练早期阶段,所有采样回复的最终答案通常都是错误的,导致组相对优势值归零,从而无法产生梯度。大语言模型作为验证器(LLM-as-a-Verifier)通过使用概率枢轴锦标赛(公式 3.2)评估每个完成结果的推理轨迹来缓解这一问题,为每个回复分配一个归一化的偏好分数,即使在最终答案相同的情况下,也能捕捉推理质量上的细微差异。我们将这个验证器得出的分数以权重 纳入标准的正确性奖励和格式奖励中。
| (7.2) |
实验发现。
在两种训练模式下,密集验证器奖励相比稀疏基线都提高了样本效率(图 9)。我们将样本效率量化为稀疏基线达到目标成功率所需的训练步数与我们的密集奖励所需步数之比。在 LIBERO 上,使用 DSRL-SAC 训练的塑形策略在显著更少的环境交互步数内就达到了匹配的成功率——在从 到 的成功率目标上实现了更高的样本效率——同时还获得了更高的最终成功率( 对比 )。在 MATH 上,为 GRPO 增加推理奖励带来了较小但一致的提升(达到匹配精度所需的优化器步数减少了 )。我们在附录 B.7 中报告了奖励塑形的超参数和额外的消融实验。
8 讨论
在这项工作中,我们认为验证构成了一个尚未被充分探索的扩展维度。为实现这一目标,我们提出了“大语言模型即验证器”(LLM-as-a-Verifier),这是一个通用框架,能够为智能体任务提供细粒度的反馈。与输出单一离散分数的标准语言模型评判器不同,我们的方法通过对评分 token 的 logits 分布求期望来计算连续奖励,并支持在多个维度上进行验证扩展,包括:(1)评分粒度,(2)重复评估,以及(3)标准分解。当将其用作测试时扩展的轨迹奖励模型时,该方法在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 和 MedAgentBench 上取得了最先进的性能。除了排序之外,细粒度的验证器信号还可作为进度估计器使用,为自主智能体更安全的实际部署开辟了道路。最后,我们证明了大语言模型即验证器可以作为密集奖励信号用于强化学习,从而提升 SAC 和 GRPO 在机器人及数学推理基准上的样本效率。
9 相关工作
测试时扩展。
测试时扩展通过花费额外的推理计算来进行深思、搜索或候选生成,从而提升模型性能。一条研究路线通过引导链式推理的中间思考过程、将问题分解为更简单的子问题,或对采样的推理路径进行边际化处理,来改进单个回答的质量。另一条路线则基于测试时反馈,对中间思考过程、行动或潜在世界状态进行搜索。重复采样和最佳选择进一步扩展了代码生成、通用推理、并行自我验证以及推理感知训练中的候选池。这些方法能够揭示出巨大的“预言机”提升空间,但要实现这一空间需要一个可靠的选择器。我们的“大语言模型作为验证器”方法则表明,通过扩展评分粒度、重复评估以及标准分解,可以提升验证器的质量,并且更好的验证器能直接改进面向长周期决策的最佳选择效果。
大语言模型作为评判者。
LLM-as-a-judge(大语言模型作为评判者)方法通过提示大模型对生成输出进行评分或比较,提供了一种可扩展的人工评估替代方案。基于概率和表单填充的评估器能从大语言模型中提取更丰富的评分信号 [fu2023gptscore, liu2023geval],而基准测试类评估器则利用大语言模型的偏好来评估指令遵循系统 [zheng2023judging, dubois2024alpacaeval, li2024arenahard]。另一条互补的研究方向通过技能分解 [ye2023flask]、定制化评分标准和专用开源评判模型 [kim2024prometheus, kim2024prometheus2, li2024autoj, hu2024themis] 以及分层标准 [liu2024hdeval] 使评估更加细粒度。其他工作则训练可扩展的评判模型 [wang2024pandalm, zhu2025judgelm],或通过辩论和弱验证器集成来组合多个评判模型 [chan2023chateval, saad2025shrinking]。近期研究还分析了评判模型的可靠性,包括公平性和位置偏差 [wang2024large, zeng2024llmbar]、认知偏差和自我增强偏差 [koo2023cobbler, liu2023narcissistic]、通用评判基准 [tan2025judgebench, huang2025empirical],以及特定领域的评判评估 [jiang2025codejudgebench]。多模态评判模型将这一范式扩展到图像和视觉语言评估 [chen2024mllmjudge, lee2024prometheusvision, xiong2024llavacritic]。我们的工作建立在上述研究基础之上,但在设定、目标和扩展特性方面有所不同。LLM-as-a-Verifier(大语言模型作为验证器)并非评估孤立的自然语言响应,而是验证涉及工具使用、代码执行、机器人技术和医疗决策的长期智能体轨迹。此外,我们系统性地研究了验证质量如何随评分粒度、重复评估和标准分解而扩展。
可验证奖励。
奖励模型将候选解决方案、动作或轨迹转换为标量反馈,用于选择、监控或策略优化。在语言推理中,已训练出学习型验证器,包括用于最终答案选择的输出奖励模型 [cobbe_training_2021]、用于步骤级监督的过程奖励模型 [uesato2022solving, lightman_lets_2023],以及将奖励建模转化为下一 token 预测的生成式验证器 [zhang2025generativeverifiersrewardmodeling]。在机器人领域,奖励信号已从价值隐含的视觉表示 [ma2022vip]、语言-图像奖励表示 [ma2023liv]、预训练的视觉-语言模型 [sontakke2023roboclip, rocamonde2023vlmrm, ICLR2025_54854cf1]、VLM 反馈或偏好 [wang2024rlvlmf]、LLM 生成的奖励代码 [yu2023languagetorewards, xie2023text2reward, ma2023eureka]、token 概率进展 [chen2026topreward],以及基于大规模轨迹或偏好数据训练的通用机器人奖励模型 [zhang2025rewind, chen2025sarm, lee2026roboreward, liang2026robometer] 中推导得出。近期工作还开发了用于引导采样 [nakamoto2024steering, liu2024bidirectional, kwok2025robomonkey]、运行时监控 [agia2024unpacking] 和多模态对齐 [kwok2026scalingverificationeffectivescaling] 的动作级验证器。另一条互补的研究路线通过将整体判断分解为更小的检查项,使验证更加可靠 [min2023factscore, fabbri2021qafacteval, manakul2023selfcheckgpt, liu2024hdeval, liu2026worldactionverifierselfimproving, tseng2026sc3]。与这些方法正交,我们的工作在一个通用框架下,跨多个领域研究了验证器质量如何随评分粒度、重复评估以及标准分解而扩展。
10 致谢
我们感谢加州大学伯克利分校天空计算实验室、斯坦福大学扩展智能实验室、IRIS 实验室以及自主系统实验室成员的建设性反馈和富有启发性的讨论。本研究得到了谷歌、Google DeepMind、谷歌云、斯坦福 HAI、DARPA(HR00112520038, Fallingwater)、NSF(24-554, AIMing)、NASA ULI、Schmidt Sciences 以及 Lightspeed 的支持。同时,我们也感谢 IBM 和 Felicis 作为斯坦福 HAI 行业联盟计划成员所提供的支持。
参考文献
附录
附录 A 局限性与未来工作
当前框架存在若干局限性,这为未来工作指明了方向。首先,它假设能够访问评分 token 的 logits,这排除了几个仅通过受限 API 可用的前沿模型;在附录 B.6 中,我们描述了一种简单的两阶段变通方法,通过将封闭模型的推理路由到一个可访问 logits 的开放验证器上,从而恢复大部分增益。其次,所提出的扩展维度并非详尽无遗:标准分解可以通过学习或针对每个领域动态生成,而非手工设计;重复评估也可以被一种由验证器自身不确定性引导的自适应计算分配策略所取代。最后,尽管我们已经展示了验证器可以作为强化学习的密集奖励信号,但我们的实验仅限于单轮设定;将其扩展到多轮强化学习——即验证器在长周期智能体交互中提供每步奖励,以在众多相互依赖的动作间塑造信用分配——是未来一个很有前景的研究方向。
附录 B 额外结果与分析
B.1 Terminal-Bench V2 上的智能体框架泛化能力
为了验证大语言模型作为验证器的性能提升并非依赖于特定的智能体框架,我们在主要结果中使用的 Capy 框架之外,又增加了两个测试框架,在 Terminal-Bench V2 上重复了评估。每个框架都与其作者调优后的模型配对:Terminus-Kira 搭配 Claude Opus 4.6,Terminus-2 搭配 GPT-5.3-Codex。在每种情况下,我们为每个任务采样轨迹,并应用相同的 Gemini 2.5 Flash 验证器,使用 、 以及第 4.3 节中描述的三标准分解;只有提案生成器和框架发生了变化。表 8 报告了由此得出的验证器准确率,以及 Claude Opus 4.6 和 Gemini 3.1 Pro 在每个框架下的官方单轨迹准确率。
| 智能体框架 | 大语言模型作为验证器 | Claude Opus 4.6 | Gemini 3.1 Pro |
|---|---|---|---|
| Terminus-Kira (Opus 4.6) | 79.4% | 74.7% | 74.8% |
| Terminus-2 (GPT-5.3-Codex) | 71.2% | 62.9% | 68.5% |
尽管两个框架的设置、观察格式和模型各不相同,但验证器在两者上都带来了相同的定性提升。Terminus-Kira(Opus 4.6 提案)相比最强基线提升了 个百分点,而 Terminus-2(GPT-5.3-Codex 提案)——绝对意义上较弱的框架——相比 Gemini 3.1 Pro 仍提升了 个百分点,相比 Claude Opus 4.6 提升了 个百分点。这种迁移表明,验证器推理的是终端状态和任务进度,而非框架特定的句法模式:相同的提示词模板能够泛化到风格不同的轨迹上。
B.2 概率性枢轴锦标赛:预算与准确率的权衡
我们提供了大语言模型作为验证器(LLM-as-a-Verifier)流程的完整伪代码。算法1将公式3.1的细粒度奖励——即验证器评分token分布的期望值,跨多个评判标准和重复评估取平均——嵌入到基于环形枢轴选择的概率化枢轴锦标赛中:一个随机哈密顿环为每个候选者分配一个“A”位置和一个“B”位置,以消除验证器的位置偏差;按环平均偏好得分最高的候选者构成枢轴集,其余每个候选者仅与枢轴集通过公式3.2的Bradley–Terry偏好进行比较。返回计数归一化得分最高的轨迹,从而将预算从降低至,并将验证集中在最可能正确的候选者上。
1:任务;生成策略;验证器大语言模型;带有映射的评分token;评判标准;候选者;重复次数;枢轴数
2:选定的轨迹
3:对于每个候选者生成过程执行
4: 采样
5:结束循环
6:初始化
7:采样环通道的随机排列
8:
9:对于每一对执行
10: 通过公式3.1计算奖励
11: 公式3.2
12:
13:结束循环
14:基于环形枢轴选择,取得分最高的候选者
15:
16:对于每一对执行枢轴轮次
17: 通过公式3.1计算奖励
18: 公式3.2
19:
20:结束循环
21:返回其中
我们刻画了概率枢轴锦标赛(PPT,算法1)的预算-精度权衡,并将其与V1基线(singh_v_1_2026)进行了比较。我们在Terminal-Bench V2(89个任务,Terminus-2测试框架)上为每个任务整理了候选轨迹,并在表9中报告了查询对的总数和选择精度。PPT随着枢轴数量的增加而稳步提升,在可比验证预算下优于V1。仅使用少量枢轴时,PPT就已超越V1的最佳结果,在查询少量对的情况下达到了较高精度。进一步增加枢轴数量可继续提升精度:使用更多对时精度达到更高水平,而使用更多对时精度进一步提升,在显著减少比较次数的情况下接近完全循环赛的性能。
| 方法 | 查询对数量 | 精度(%) |
|---|---|---|
| pass@1 | — | |
| V1(预算)[singh_v_1_2026] | ||
| V1(预算)[singh_v_1_2026] | ||
| V1(预算)[singh_v_1_2026] | ||
| V1(预算)[singh_v_1_2026] | ||
| PPT | ||
| PPT | ||
| PPT(我们的方法) | ||
| PPT(我们的方法) | ||
| PPT(我们的方法) | ||
| 完全循环赛 |
B.3 大语言模型作为验证器:过程奖励模型与结果奖励模型
我们评估了大语言模型作为验证器在智能体任务中作为过程奖励模型(PRM)进行逐步骤验证,以及在编码和数学基准上作为结果奖励模型(ORM)进行Best-of-N选择的效果。作为PRM使用时,pass@1随每步采样动作数单调递增:在TauBench上从某值提升至某值,在Terminal-Bench上从某值提升至某值(随从某值增长至某值,见表10),计算量低于[singh_v_1_2026]。作为ORM使用时(表11),它在SWE-Bench Lite上使pass@1提升一定百分比,在AIME上提升一定百分比,在HMMT上提升一定百分比,优于基础模型以及逐点和成对基线,同时在计算量低于某方法的情况下将验证精度提升若干百分点。
| 每步采样动作数 | ||||
|---|---|---|---|---|
| TauBench(Gemini 2.5 Flash,pass@1) | ||||
| Terminal-Bench(Gemini 3 Flash,pass@1) |
| 方法 | SWE-Bench Lite | AIME | HMMT |
|---|---|---|---|
| 基础模型 | |||
| 逐点(语言模型评判器,预算) | |||
| 成对([singh_v_1_2026],预算) | |||
| 大语言模型作为验证器(我们的方法,预算) |
B.4 案例研究:query-optimize
本附录扩展了第 4.1 节中的 query-optimize 案例研究,提供了完整的任务说明、真实结果分解以及验证器推理轨迹。该轨迹对是在 OpenHands 框架下生成的,其中 Claude Opus 4.5 作为方案生成器,Gemini 2.5 Flash 作为验证器。
任务指令。
你获得了 SQLite 格式的开放英语词汇网(OEWN)数据库,位于 /app/oewn.sqlite。
我实现了一个 SQL 查询,但它没有优化。我已将其保存在 /app/my-sql-query.sql 中。请在确保产生相同输出的前提下,尽可能提高查询效率。
请将你的解决方案保存在文件 /app/sol.sql 中。该文件不得包含任何注释,只能包含一个以分号结尾的 SQL 查询语句。
最后,请使用 SQLite 语法!如果你使用其他方言,你的代码将无法在 SQLite 中执行。
真实结果分解。
两个候选轨迹都保存了一个优化后的 SQL 查询,并通过了内部差异检查,但 Terminal-Bench 的隐藏评分器给其中一个轨迹分配了奖励,给另一个轨迹分配了奖励。失败轨迹的验证步骤在方法论上存在缺陷:
- •
智能体尝试对 /app/oewn.sqlite 运行原始查询两次(超时,然后毫秒),但两次都中止了。
- •
为了获取参考输出,智能体运行了 cp /app/oewn.sqlite /tmp/oewn_test.sqlite,然后在副本上对 senses(wordid)、senses(synsetid) 和 synsets(synsetid) 执行了 CREATE INDEX 命令。
- •
后续步骤将(对已建索引副本执行的原始查询)与(对规范的无索引数据库执行的优化查询)进行比较——这是两条不同的物理访问路径,其关联的 ORDER BY 键在 LIMIT 500 边界处无法保证以相同方式断开。
- •
随后所有验证产物均被删除(`rm /tmp/oewn_test.sqlite /tmp/original_output.txt /tmp/optimized_output.txt`),清除了任何可供重新核查的证据。
- •
因此,优化查询实际上从未在 Terminal-Bench 评分器所使用的规范无索引数据库上,与原始查询进行过有效验证,导致 `sol.sql` 未能通过隐藏测试。
正确的执行路径只需等待原始查询在规范数据库上完整运行所需的全部毫秒数,并在退出前执行直接差异比较(退出码 )。
Gemini 2.5 Flash 推理轨迹。
在启用思考功能的推理轨迹中,验证器能够可靠地识别出正确性问题。摘录如下:
“智能体未能在合理时间范围内,在提供的 `/app/oewn.sqlite` 数据库上将原始查询执行完毕(该查询被中断了两次,一次在 60 秒后,另一次在 5 分 2 秒后)。为了获取用于比较的参考输出,智能体复制了数据库(……),然后向这个副本添加了索引。……通过修改数据库来获取参考输出,智能体违反了任务中隐含的约束条件。因此,它未能正确验证其优化查询与在原始无索引数据库上运行的原始查询产生相同的输出。”
B.5 在 RoboRewardBench 上扩展重复评估与视觉上下文
图 10 将第 4.2 节的重复评估分析扩展到了机器人操作领域。RoboRewardBench 上的轨迹偏好准确率从 上升至 ,并在达到噪声基底后趋于饱和。在每种预算下,LLM 作为验证器均优于 LLM 作为评判器以及训练基线 TOPReward、RoboReward-8B 和 Robometer-4B,这表明尽管输入从文本变为多帧视频,重复评估带来的增益仍能跨模态干净地迁移。
B.6 为对数概率受限的尖端模型恢复连续奖励
LLM-as-a-Verifier 需要访问验证器的评分 token 对数概率,以计算公式 3.1。越来越多尖端模型(包括 GPT-5.5 和 Claude Opus 4.7)仅通过其公开 API 返回采样完成的文本,而不提供 token 级别的对数概率,这导致无法直接原位替换验证器的主干模型。我们描述了一种简单的两阶段替代方案,通过将推理与评分解耦,从而恢复大部分经过校准的奖励信号。
两阶段流水线。
对于每一对 ,我们首先使用标准成对模板提示封闭模型(GPT-5.5),并要求其在生成离散的 – 分数之前,输出一个自由形式的推理…/推理块来分析两条轨迹。然后,我们将任务、两条轨迹以及封闭模型的推理结果传递给一个开放验证器(Gemini 2.5 Flash,),并读取其在 score_A 和 score_B 位置的对数概率,以计算公式 3.1 中的连续奖励。第一阶段贡献了来自尖端模型的领域特定推理质量;第二阶段则提供了封闭 API 所保留的校准概率分布。
设置与发现。
我们在第 4.2 节全程使用的同一套 Terminal-Bench V2 摇摆对(swing-pair)测试集上进行评估。对于每一对,我们使用 GPT-5.5 生成独立的推理轨迹,并使用 Gemini 2.5 Flash 进行独立的第二阶段评估,然后对每条轨迹的子采样分数取平均,并检查是否满足条件。平均准确率和平局率通过自举子样本进行估计。表 12 显示,这种变通方法在每个预算下都显著优于离散基线。在给定预算下,通过 Gemini 2.5 Flash 路由推理过程,相比直接使用 GPT-5.5 的整数分数( 对比 ),准确率提升了 个百分点,并且消除了封闭模型粗粒度输出所导致的平局率。连续变体几乎立即饱和——准确率仅从 提升至 ——而离散变体则主要依赖大量集成(从 提升至 )来打破平局。即使在 预算下,连续变体仍领先 个百分点,并保持零平局率。
| GPT-5.5(离散) | GPT-5.5 → Gemini 2.5 Flash(连续) | |||
| 准确率(%) | 平局率(%) | 准确率(%) | 平局率(%) | |
B.7 将大语言模型作为验证器用于强化学习的密集奖励
本附录详细介绍了第 7 节的强化学习实验。在两种设置中,基线方法与我们的方法之间唯一的区别在于奖励函数:策略、优化器、超参数、评估协议和随机种子均保持不变。
离策略强化学习(DSRL-SAC)
我们使用 DSRL-SAC 在 LIBERO-90 番茄酱任务上对策略进行微调。验证器是 Qwen 3.6 35B,通过 SGLang 提供服务,并根据任务指令和每次 rollout 中均匀采样的渲染帧子集进行查询;每帧的完成度按照公式 3.1 的粒度尺度进行评分,解码为最高评分 token 对数概率的期望值,并使用系数(公式 7.1)重复评估。默认情况下,对成功的 rollout 应用奖励塑形;对所有 rollout(成功和失败)进行重新标记是代码库中的一个可选变体。重新标记的转换被写入 SAC 经验回放缓冲区,评论家网络在塑形后的回报上进行训练。我们在每个条件下运行多个种子直至达到环境步数,并报告模拟器成功率的跨种子均值。
在线策略强化学习(GRPO)。
我们使用 Tinker 通过 GRPO 在 Hendrycks MATH 上对 Qwen3-8B 进行微调,组大小为 ,每个优化批次的组数为 ,学习率为 ,最大生成长度为 个 token。对于每组补全,Gemini 2.5 Flash 通过概率性枢轴锦标赛(公式 3.2)对推理轨迹进行评分。该偏好值在组内进行标准化,并以权重(公式 7.2)添加到正确性奖励和格式奖励中。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org