T^2PO:面向稳定多轮智能体强化学习的不确定性引导探索控制框架
T^2PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement Learning
多轮强化学习训练常因探索效率低下而不稳定。为此,研究团队提出T^2PO框架,在细粒度层面实施不确定性引导的探索控制。在令牌级别,它监测不确定性动态,当边际变化低于阈值时触发思考干预;在轮次级别,它识别探索进展可忽略的交互并动态重采样,以避免无效计算。在WebShop、ALFWorld和Search QA等多个环境中的评估表明,T^2PO显著提升了训练稳定性与任务性能,并实现了更高效的探索。相关代码已开源。
多轮 agent 训练最怕训着训着崩了,这篇从 token 和 turn 两级控制探索的思路很妙,直接把低效 rollout 砍掉,稳定性和效率都上去了,做 RLHF 或 agent RL 的可以认真看一下。
摘要
多轮强化学习(RL)的最新进展显著提升了推理型大语言模型在复杂交互任务上的表现。尽管在细粒度信用分配和轨迹过滤等稳定化技术方面取得了进展,不稳定性问题依然普遍存在,并常常导致训练崩溃。我们认为,这种不稳定性源于多轮场景下的低效探索,即策略持续生成低信息量的动作,这些动作既不能降低不确定性,也无法推动任务进展。为解决这一问题,我们提出了Token级与轮次级策略优化(T2PO),一种在细粒度层面显式控制探索的不确定性感知框架。在Token级别,T2PO监控不确定性动态,并在边际不确定性变化低于阈值时触发思考干预。在轮次级别,T2PO识别探索进展可忽略的交互,并动态重新采样此类轮次,以避免无效的轨迹生成。我们在包括WebShop、ALFWorld和Search QA在内的多种环境中评估了T2PO,结果表明,在训练稳定性、性能提升以及探索效率方面均取得了显著改进。代码已开源:https://github.com/WillDreamer/T2PO。
智能体AI,强化学习
1 引言
近期,自我进化智能体的研究进展深深植根于多轮强化学习(Liu 等人,2024;Team,2025;Team 等人,2025;Wang 等人,2026),该技术为训练智能体通过与环境的迭代交互进行推理、行动和自我进化提供了基础机制。尽管取得了这些进展,业界仍然缺乏一个稳定且可扩展的训练范式。当前的多轮强化学习流程在有效性和效率方面面临着相互交织的挑战。一方面,长程交互结合稀疏的奖励信号使得信用分配本身变得困难(Zhou 等人,2024;Wang 等人,2025b)。另一方面,轨迹收集的计算成本高昂,从而推动了加速技术的采用,例如低精度推理(Liu 等人,2025a)和异步采样(Fu 等人,2025a)。然而,这些面向效率的解决方案不可避免地引入了离策略漂移和策略陈旧效应(Zheng 等人,2025a)。这两个问题都倾向于放大训练的不稳定性,并经常导致臭名昭著的训练崩溃。
为缓解训练不稳定性,先前的研究探索了多种策略,包括细粒度信用分配(Feng 等人,2025)、内部或基于过程的奖励建模(Wang 等人,2025a;Dong 等人,2025),以及对失败交互的轨迹级过滤(Yu 等人,2025;Xue 等人,2025)。这些方法旨在提供更密集的学习信号或剔除无效的 rollout,并在稳定优化方面取得了部分成功。然而,大多数现有解决方案要么在粗粒度的轨迹层面运作,要么通过奖励塑形进行隐式控制。在本质上复杂的多轮交互场景中,这种粗粒度或间接的干预使得训练动态对超参数和 rollout 分布高度敏感。因此,它们常常导致训练崩溃,即策略优化性能迅速下降或完全失败的现象,如图 1 所示。
我们的核心洞察。为理解其根源,我们分析了具有代表性的训练轨迹,并识别出探索不足是根本原因,这反映了对探索-利用权衡的系统性违背(Mehlhorn 等人,2015)。我们将这种失败模式称为犹豫。在 token 层面,大语言模型智能体频繁表现出过度思考,生成长序列的 token,其信息增益迅速饱和,而采样噪声却持续累积。在交互轮次层面,大语言模型智能体可能在早期阶段就偏离了成功的动作空间,却继续执行大量重复且无效的交互轮次,在有限的预算内几乎没有恢复的机会。犹豫即是失败!这种行为给信用分配引入了大量噪声,导致梯度不稳定和策略更新的高方差。
训练效果与训练效率并非不可兼得;一旦正确识别出不稳定性的根本原因,两者便可被联合优化。我们的目标是通过在探索变得低效之前捕获内在信号来控制探索,从而克服犹豫现象。首先,我们通过融合熵与置信度构建了一个自校准的不确定性信号,该信号在轨迹展开过程中充当监测信号。随后,我们观察到:在token生成过程中,若不确定性没有显著降低,则表明存在token级别的犹豫;而若多次交互轮次呈现出相似的不确定性模式,则表明存在轮次级别的犹豫。
在本工作中,我们提出T2PO以显式且精细地控制探索过程。在token级别,T2PO监测不确定性动态,并在边际不确定性变化低于阈值时触发思考干预。在轮次级别,T2PO识别出探索进展可忽略的交互轮次,并动态重采样这些轮次以避免无效的轨迹展开。通过显式减少低效探索而非引入额外的奖励塑形,T2PO恢复了探索与利用之间的平衡机制。此外,我们采用基于拒绝的微调(RFT)(Wei et al., 2025)进行冷启动,引入记忆上下文窗口以缓解训练压力,强制执行严格的格式惩罚以确保结构合规,并最终采用SOTA策略更新方法进行优化。
在具有挑战性的多轮智能体基准测试上进行的广泛实验证明了T2PO的优越性,全面的消融实验与分析进一步验证了其在提升探索效率方面的有效性。
2 相关工作
2.1 智能体强化学习训练
早期关于大语言模型智能体的工作主要集中在用于交互和评估的模块化基础设施上。RAGEN(Wang 等人,2025b)建立了一个用于训练和评测智能体强化学习系统的统一框架。后续的努力试图通过轨迹整理和采样来稳定多轮训练。SimpleTIR(Xue 等人,2025)过滤掉包含空转回合的 rollout,而 rStar2-Agent(Shang 等人,2025)则对 rollout 组进行过采样,仅保留高质量轨迹,通过启发式数据选择提高了训练稳定性。然而,这些方法依赖于外部过滤,并未明确调控轨迹内部的推理动态。与此同时,基于分组的无评论家优化已成为长周期智能体训练的一种高效范式。GiGPO(Feng 等人,2025)将基于分组的优势估计扩展到多轮场景,在无需辅助价值网络的情况下实现了强劲性能。然而,现有的多轮分组方法仍然缺乏原则性机制来抑制回合内和回合间的冗余推理,导致探索效率低下且 rollout 成本高昂。
2.2 基于内部奖励的强化学习
为了解决长周期智能体强化学习中的稀疏奖励问题,近期工作利用模型生成的内部反馈来提供更密集的监督信号。大多数方法从不确定性中推导出无监督奖励,通常通过策略熵来衡量。然而,熵扮演着相互矛盾的角色:一些方法通过最小化熵来鼓励确定性预测,而另一些方法则通过将熵纳入优势估计(如 SEED-GRPO(Chen 等人,2025)及相关设计)来促进高熵探索。除了熵之外,DeepConf(Fu 等人,2025b)利用模型内部置信度来过滤低质量的推理轨迹。虽然这些研究表明内部信号可以指导探索,但现有方法依赖于单尺度启发式或静态奖励塑形,缺乏在 token 和回合两个层面调控推理的原则性机制。
3 预备知识
我们提出了一种智能体强化学习框架,使基于大语言模型的智能体能够与外部环境交互,并通过多轮推理来解决复杂任务。每个任务始于一条用户提示词,该提示词指定了任务描述,并会进行多轮推进。在每一轮中,智能体与环境交互,获取以状态形式呈现的观测结果,其中表示由环境定义的状态空间。基于该状态,智能体生成一个动作,动作空间由大语言模型分词器词表构成。通常,经过思维链后训练微调的基础大语言模型会生成思考token和动作token,并包裹在特殊标签(<think>…</think>、<action>…</action>)中。因此,可表示为:,其中是最大回复长度。智能体的行为由策略控制,该策略定义了在当前状态和初始用户提示词条件下,可能输出的概率分布。每次动作之后,环境会以标量奖励和下一状态的形式提供反馈,除非达到最大轮数。当第轮完成后,会得到一条完整轨迹。在许多真实场景中,奖励是稀疏或延迟的,这使得在大语言模型生成数千个token的情况下,信用分配变得尤为困难。
4 方法
4.1 用于控制的自校准不确定性信号
典型强化学习设置中的局限性。token熵和置信度通常用于衡量token生成分布中的不确定性。在每一轮的解码步骤中,策略大语言模型会输出一个大小为的词表上的分类概率向量,其中是推理轨迹,是用户提示词,表示可用工具集。我们使用香农熵来量化不确定性,并将token置信度定义为位置处前个token的负平均对数概率:
| (1) |
低token熵表示分布尖锐集中、确定性较高,而高置信度同样反映模型具有更高的确定性。
然而,两者都存在固有的局限性。熵反映了 token 分布的整体平滑度,但在分布接近均匀或高度集中这两个极端情况下,其区分能力有限。当词汇量很大时,例如 Qwen3(Team, 2025)中的 152K,这种局限性尤为突出。由于熵的范围与 [0, ] 成比例,两个差异很大的预测(例如 (1, 0, 0, ) 和 (0.5, 0.5, 0, ))之间的熵差仅为 。与完整的熵尺度相比,这种差异可以忽略不计。
因此,仅凭熵可能无法区分真正不确定的预测和极其尖锐的预测。相比之下,置信度仅取决于 arg-max token 的概率,因此忽略了剩余概率质量是如何分布的。因此,尽管不确定性水平不同,但截然不同的 token 分布可能产生相同的置信度(Fu 等人,2020)。如图 3 所示,两者都存在盲区:
自校准不确定性信号。基于上述分析, 和 在覆盖平滑和非平滑分布方面是互补的。为了获得局部分布稳定性的标量指标,我们首先在解码轨迹上对熵和置信度进行归一化:
| (2) |
然后我们构建一个自校准稳定性信号:
| (3) |
其等高线在最大值算子作用下不再呈分段线性且退化。该方法保留了基于 top-1 的分层结构,同时在每个层级内引入曲率,从而能够区分具有相同但残差质量分配不同的分布。此外,与等高线集中于均匀分布的对比方法相比,该方法产生的高不确定性区域与主导类别的存在更为吻合。同时,它保留了熵对尾部离散度的敏感性,从而生成更符合实际类别混淆行为的不确定性模式。
4.2 模型 token 级思维干预(TTI)
动机。受顿悟时刻(Liu 等人,2024)启发,推理型大语言模型倾向于在生成行动之前生成详细的思维链。虽然这种推理方式提升了决策质量,但过长的内部序列会带来计算开销,并在智能体训练过程中放大策略梯度的方差。因此,我们持续追问一个核心问题:
我们的第一个直觉是监控模型 token 级的不确定性信号。如图 4 (a) 所示,我们聚合了 SOTA 基线的轨迹,观察到置信度先下降后上升,而熵则先上升后下降。同时,这些最不确定的模型 token 恰好是模型在购物场景中应该生成的 token,即与商品信息相关的 token。更重要的是,在这些峰值点之后生成的 token 只会降低探索效率。因此,我们提出 TTI,以便在预测分布表现出收敛行为时,精细且自适应地终止推理过程。
何时停止?较高的值既反映了较高的置信度,也反映了较低的熵。因此,随着模型 token 的生成,该值的动态变化可作为探索效率的可靠指标。随后,我们监控第 轮中模型 token 的时间变化,记为 。该监控仅在生成最小前缀长度后启动,以避免过早截断。当大小为 的滑动窗口内的平均变化低于容忍阈值 时,则判定为无犹豫事件:
| (4) |
我们将首次出现该情况的时间记为 。直观上,这标志着预测分布不再发生有意义的变化,表明额外的推理贡献的新信息很少,如图 4 (c) 所示。
为什么不在峰值处截断?在图 4 (b) 中,高度探索性的 token 大致可分为两类。第一类由连接性或话语性 token 组成,它们与模型内部的推理转换密切相关,并且常常与推理式生成中的“顿悟时刻”重合。第二类对应于任务特定的 token,例如产品名称或属性描述符,它们承载着成功完成任务所需的基本语义信息。如果我们直接遵循图 4 (a) 的趋势,在峰值点截断每个响应,那么截断很可能会发生在任务特定的 token 上。这不仅无法提高效率,还可能因过早移除关键的语义内容而阻碍有效的探索。
由于任务相关的 token 通常分布在响应的连续片段中,滑动窗口聚合可以平滑局部的不确定性波动,并防止在孤立的任务 token 上触发虚假阈值。因此,只有在检测到持续的高不确定性时才会激活截断,从而在不妨碍有意义探索的前提下实现效率提升。
如何停止?一旦非犹豫事件发生,解码不会立即终止。相反,在步骤 () 处,我们通过强制输出推理终止 token `</think>`(假设 token ID 为 151668)来显式干预模型输出。令 表示步骤 处的 softmax 前 logits。我们按如下方式覆盖 logits:
| (5) |
该操作确定性地终止推理阶段,并消除停止点处的随机性。
停止后动作是如何生成的?在强制输出推理终止符后,我们注入一个固定的确定性 token 队列 [</think>, \n, <action>],从步骤 开始。设 表示队列中的第 个 token。对于 ,我们强制 而不从模型分布中采样。这明确划定了推理阶段与执行阶段之间的边界,确保结构化输出。
是否存在任何约束条件?(1)一次性激活约束。为避免重复触发,停止机制在每次生成中仅允许激活一次。设 为初始化为 的二元指示符。仅当 时应用停止规则,之后我们设置 并禁用后续检查。(2)全局思考预算。为保证终止,我们施加最大解码长度 。若 ,我们再次通过覆盖 logits 来强制确定性终止。
定义 4.1(TTI 规则)。
当满足以下条件时触发 TTI:
| (6) |
4.3 轮次级动态采样
动机。智能体交互沿轨迹在多个轮次中展开。在轮次层面,一旦模型对环境感知趋于稳定,它可能在不同轮次间反复生成语义相似但失败的推理轨迹,导致冗余交互并降低探索效率。一个自然的启发来自 DAPO 的动态采样(Yu 等人,2025),该方法通过过滤掉准确率饱和于 0 或 1 的琐碎提示组来提升样本效率。然而,在多轮次智能体强化学习中直接采用此策略并非易事。与单轮次设置中每个提示组可方便计算准确率不同,多轮次轨迹通常缺乏密集的过程奖励,且无法为动态过滤定义明确的每轮次"准确率"信号。为在此约束下规范轮次层面的交互动态,我们引入一种互补的轮次级动态采样(TDS)机制,该机制基于轨迹层面的交互信号识别并降低冗余轮次的权重。
轮次级控制信号。为了衡量模型相较于基准是否在进行无意义的探索,我们首先聚合单个轮次内所有 token 级别的自校准不确定性信号。具体来说,轮次级观测信号为 。我们可以监测连续轮次之间的时序变化,即 。直观上, 衡量了模型内部置信度与不确定性结构在轮次间的变化幅度。较大的值表明信念或问题求解状态正在演变,而较小的值则表明智能体在重复生成相似且信息量低的推理内容。
何时进行动态采样?类似地,我们引入一个容差阈值来控制轮次级适应的灵敏度。当满足以下条件时,会在第 轮触发重新生成事件: 。也就是说,如果当前轮次的预测稳定性特征与上一轮次偏差过大,则该轮次被视为信息量不足。
如何进行动态采样?具体来说,当 时,我们认为当前轮次的动作不太可能有效推动大语言模型智能体走向成功。在这种情况下,我们丢弃当前轮次的生成结果,并为同一轮次重新采样一条新的推理轨迹。此重新生成过程会重复进行,直到获得一条满意的轨迹或达到最大重采样预算。轮次级控制信号仅在重新生成完成后重新计算。
定义 4.2(TDS 规则)。
TDS 定义如下:
| (7) |
其中 表示在同一状态下的新一次 rollout。此过程重复进行,直到 或重采样预算耗尽。重新生成终止后,轮次级控制信号会被重新计算。
4.4 策略更新
记忆上下文窗口。由于每个任务都需要与环境进行多次交互,直接将整个轨迹拼接起来进行优化会导致序列过长,从而显著增加计算开销和内存消耗。因此,我们采用了一个记忆上下文窗口,该窗口仅包含最近几轮交互的历史记录。具体来说,当前状态包含从第 轮到第 轮的信息以及对应的动作 到 ,而非完整的轨迹历史。
信用分配。在实践中,跨轮次的奖励信号极其稀疏。为了缓解这一问题,多轮强化学习中的一种标准方法是引入跨轮次的折扣回报。设 为轮次级别的折扣因子。有效的训练信号被定义为其折扣回报 。这种公式将监督信号从最终结果反向传播到更早的决策,使得每个动作都能基于其对未来奖励的长期影响进行优化,而不仅仅依赖即时反馈。
| 方法 | WebShop | ALFWorld | |||||||
| 任务得分 | 成功率 | 成功率 | 拾取 | 查看 | 清洁 | 加热 | 冷却 | 拾取2 | |
| 提示词 | |||||||||
| GPT-4o (Achiam 等人, 2023) | 31.8 | 23.7 | 48.0 | 75.3 | 60.8 | 31.2 | 56.7 | 21.6 | 49.8 |
| Gemini-2.5-Pro (Comanici 等人, 2025) | 42.5 | 35.9 | 60.3 | 92.8 | 63.3 | 62.1 | 69.0 | 26.6 | 58.7 |
| Claude Sonnet 4 (Anthropic, 2025) | 45.63 | 39.82 | 63.71 | 90.13 | 65.34 | 66.77 | 70.14 | 29.80 | 61.36 |
| Qwen3-32B (Team, 2025) | 25.17 | 5.89 | 25.63 | 63.53 | 18.33 | 18.70 | 24.31 | 10.08 | 10.11 |
| 指令微调 | |||||||||
| Qwen3-4B + SFT | 70.91 | 26.56 | 64.06 | 89.29 | 66.67 | 64.12 | 59.26 | 35.71 | 54.54 |
| 强化学习训练(基于 Qwen3-4B-RFT) | |||||||||
| PPO (Schulman 等人, 2017) | 70.34±8.63 | 61.93±5.93 | 75.39±3.81 | 83.34±9.47 | 75.09±6.25 | 74.50±7.90 | 62.57±1.56 | 84.21±0.00 | 58.33±7.38 |
| GRPO (Shao 等人, 2024) | 80.02±7.94 | 68.56±4.11 | 77.35±0.62 | 85.32±6.77 | 64.59±4.34 | 91.16±0.79 | 90.18±7.15 | 73.87±9.64 | 60.20±5.31 |
| GiGPO (Feng 等人, 2025) | 86.03±4.18 | 73.83±3.04 | 80.47±2.43 | 87.94±8.91 | 77.31±8.36 | 87.95±6.87 | 86.88±4.26 | 79.09±4.68 | 71.41±7.08 |
| GiGPO + DAPO (Yu 等人, 2025) | 86.54±9.81 | 74.02±8.18 | 80.86±1.37 | 89.94±8.06 | 72.08±0.08 | 93.05±0.43 | 79.05±7.45 | 83.08±7.75 | 65.55±9.12 |
| T2PO (我们的方法) | 93.84±0.22 | 81.64±0.39 | 90.23±1.38 | 97.36±6.94 | 87.77±4.89 | 98.33±2.77 | 85.11±7.64 | 85.84±2.57 | 80.35±2.86 |
| 基于 Qwen3-8B-RFT 的强化学习训练 | |||||||||
| GRPO(Shao 等人,2024) | 79.56±9.67 | 69.47±8.01 | 80.67±6.36 | 90.59±4.27 | 72.12±7.37 | 83.33±6.12 | 70.58±3.67 | 88.91±5.38 | 62.39±4.72 |
| GiGPO(Feng 等人,2025) | 88.76±5.63 | 77.92±4.87 | 85.15±4.77 | 92.10±9.36 | 84.65±2.84 | 89.47±8.36 | 81.25±7.59 | 80.76±4.02 | 75.03±6.94 |
| GiGPO + DAPO(Yu 等人,2025) | 87.95±4.52 | 78.40±5.12 | 89.06±4.76 | 94.73±3.08 | 75.01±6.37 | 98.72±1.33 | 93.75±3.76 | 79.64±8.25 | 75.01±6.37 |
| T2PO(我们的方法) | 91.65±0.84 | 82.42±0.61 | 92.41±1.42 | 99.15±2.05 | 90.91±4.37 | 96.67±3.77 | 80.45±7.79 | 90.91±4.15 | 85.71±1.46 |
策略损失。T2PO 执行分层优势估计。遵循 GRPO,我们首先将在相同任务和相同初始环境状态下收集的完整轨迹分组。然后我们计算相对优势为 。这捕获了完整交互轨迹中的全局性能差异。在更细粒度上,我们遵循 GiGPO 计算回合相对优势 。最后,我们将这两个信号融合为一个组内组优势,该优势提供了结果和回合级别的过程信用。相应的带 的裁剪策略更新目标为:
| (8) | ||||
5 实验
| 方法 | 类型 | 单跳问答 | 多跳问答 | ||||||
| NQ† | TriviaQA⋆ | PopQA⋆ | HotpotQA† | 2Wiki⋆ | MuSiQue⋆ | Bamboogle⋆ | 平均 | ||
| 提示词 | |||||||||
| GPT-4o(Achiam 等人,2023) | 开源 | - | - | - | - | - | - | - | - |
| Qwen3-32B(Team,2025) | 开源 | 13.56 | 41.32 | 14.28 | 18.24 | 25.77 | 3.98 | 12.32 | 21.58 |
| 基于 Qwen2.5-7B-Instruct 的强化学习训练 | |||||||||
| R1-Instruct | 开源 | 21.0 | 44.9 | 17.1 | 20.8 | 27.5 | 6.0 | 19.2 | 22.4 |
| Search-R1(Jin 等人,2025) | 开源 | 39.3 | 61.0 | 39.7 | 37.0 | 40.1 | 14.6 | 36.8 | 38.5 |
| ZeroSearch(Sun 等人,2025) | 开源 | 43.6 | 61.8 | 51.5 | 34.6 | 35.2 | 18.4 | 27.8 | 39.1 |
| StepSearch(Wang 等人,2025c) | 开源 | - | - | - | 38.6 | 36.6 | 22.6 | 40.0 | - |
| 基于 Qwen3-4B 的强化学习训练 | |||||||||
| GiGPO(Feng 等人,2025) | 开源 | 44.36 | 63.67 | 46.26 | 39.28 | 39.86 | 13.40 | 70.97 | 52.97 |
| T2PO(我们的方法) | 开源 | 46.13 | 64.08 | 47.85 | 39.80 | 42.51 | 16.64 | 72.58 | 54.93 |
5.1 实验设置
任务。我们在三个公开可用的具有挑战性的交互式基准上评估大语言模型智能体,包括:(1) WebShop(Yao 等人,2022),(2) ALFWorld(Shridhar 等人,2020)和 (3) 搜索问答。
WebShop 是一个基于网页的交互式环境,用于在逼真的在线购物场景中测试大语言模型智能体。智能体必须导航一个模拟的基于HTML的购物网站,以搜索商品、浏览页面并完成购买。该环境包含超过110万件商品和1.2万条用户指令,提供了丰富多样的动作空间。
ALFWorld 是一个具身环境,旨在评估多步决策能力。在该环境中,智能体接收一个文本目标,必须通过多轮交互来完成它。它包含3,827个任务实例,涵盖六个类别:拾取与放置、在光线下检查、清洁与放置、加热与放置、冷却与放置,以及拾取两个并放置。
此外,Search QA 包括单跳问答数据集,如 NQ (Kwiatkowski 等人, 2019)、TriviaQA (Joshi 等人, 2017)、PopQA (Mallen 等人, 2023),以及多跳问答数据集,如 HotpotQA (Yang 等人, 2018)、2Wiki (Ho 等人, 2020)、MuSiQue (Trivedi 等人, 2021) 和 Bamboogle (Press 等人, 2023)。所有评估指标均见附录 A.1。
实现细节。我们使用公开可用的 Qwen3-4B/8B 模型进行 RFT 以规范行为模式,并在三种不同环境随机种子下从 Qwen3-4B/8B-RFT 初始化训练。除了结果奖励外,我们还引入了格式惩罚以强制结构合规。详情见附录 B。对于 ALFWorld 和 WebShop,所有 RL 训练方法共享相同的超参数配置。基于组的 RL 方法的 rollout 组大小设为 8。对于 Search QA,我们遵循 Search-R1 (Jin 等人, 2025) 的实验设置。我们采用 E5 作为检索器,将 rollout 组大小设为 5,并将最大交互轮数限制为 4。值得注意的是,我们将每条完整轨迹分解为单个轮次进行优化。我们的实验基于 verl (Sheng 等人, 2024) RL 训练框架,并带有智能体循环。所有实验均在 8 块 NVIDIA H100 GPU 上实现。为确保公平比较,所有基线均从基于 RFT 的模型初始化,并使用相同的格式惩罚来稳定训练。
附加任务详情和评估指标见附录 A。完整的训练配置和超参数细节见附录 A.2。RL 训练技术的具体实现,包括 RFT、格式惩罚、轨迹分解和策略更新,在附录 B 中描述。
基线方法。我们将 T2PO 与一系列强大的基线方法进行了比较。(1) 闭源大语言模型:GPT-4o、Gemini-2.5-Pro 和 Claude 4,代表了最先进的通用推理模型。(2) RL 训练方法:PPO(Schulman 等人,2017),一种需要辅助价值模型的标准演员-评论家算法;基于组的无评论家方法 GRPO(Shao 等人,2024),该方法在轨迹组上进行优势估计;以及 SOTA 基线方法 GiGPO(Feng 等人,2025)。此外,我们在 GiGPO 基础上集成了有效的 RL 增强技术,例如 DAPO(Yu 等人,2025)中提出的动态采样。实际上,T2PO 是即插即用的,可以轻松地与其他策略更新方案集成。我们在附录 D.1 中提供了基于 GSPO(Zheng 等人,2025b)的额外结果。
5.2 主要结果
表1展示了在WebShop和ALFWorld上的性能表现。直接提示词方法效果有限,即使对于强大的专有模型也是如此,而开源基座模型在零样本推理下的表现仍然明显较弱。(1) 指令微调改善了奖励建模,但未能实现可靠的任务完成,凸显了模仿学习的局限性。(2) 强化学习显著提升了性能。在单轮基线方法中,GRPO明显优于PPO,证实了结构化策略优化对于稳定训练的重要性。多轮方法进一步提高了成功率,证明了显式长程信用分配的必要性。(3) 如表1所示,T2PO在所有指标上均取得了最佳性能,在WebShop上,Qwen3-4B-RFT和Qwen3-8B-RFT的成功率分别达到81.64和82.42,并在ALFWorld上相比此前SOTA持续提升约8-12个百分点。此外,T2PO在不同运行轮次间的方差显著降低,表明在未引入额外模型参数或环境特定启发式规则的情况下,训练稳定性得到了改善。
表2报告了在单跳和多跳问答基准上的结果。我们的方法在单跳数据集上持续取得最佳性能,表明证据检索和事实锚定能力得到改善。在多跳问答中,我们在具有挑战性的域外数据集上观察到显著提升,尤其是在MuSiQue上,我们的方法将此前最佳性能提升了一倍以上。在2Wiki和Bamboogle上的强劲结果进一步证实了稳健的多步推理和泛化能力。
5.3 关键模块消融实验
表 3 展示了为量化 T2PO 中每个核心组件贡献而进行的消融分析。
| 关键模块 | 任务得分 | 成功率 |
|---|---|---|
| 无拒绝微调 | 79.28 | 61.32 |
| 无 Token 级思考干预 | 81.28 | 73.27 |
| 无轮次级动态采样 | 72.40 | 63.67 |
| T2PO | 93.84 | 81.64 |
无 RFT 冷启动。RFT 在自蒸馏数据上的作用是,在早期策略优化过程中过滤格式错误或低质量的行动。缺少该模块时,模型在任务得分和成功率上均表现出明显下降,这表明结构化的拒绝微调在稳定训练和防止下游 rollout 中错误传播方面起着关键作用。
消除 TTI。这会迫使模型依赖不受约束的推理长度,导致产生冗余的低信息 token 并增加轨迹方差。这导致成功率明显下降,证实了基于预测稳定性的自适应终止能有效提高探索效率,并在不牺牲推理质量的前提下减少不必要的计算。
移除 TDS。该模块旨在抑制冗余的跨轮次推理模式。没有 TDS 时,智能体经常在对话轮次间重复语义相似的推理轨迹,从而降低了交互多样性并限制了有效探索。因此,任务得分和成功率均有所下降,这表明在多轮环境中,轮次级重新生成对于维持轨迹级多样性至关重要。
其他。我们进一步研究了自校准系数、容差阈值、窗口大小的敏感性,并分析了改变最大响应长度对输出长度和训练稳定性的影响,同时还对其他任务进行了额外的消融实验。相应结果见附录 D。
5.4 其他思考控制方法的消融实验
| 方法 | 任务得分 | 成功率 |
|---|---|---|
| 长度奖励 | 77.96 | 65.87 |
| 短思维链冷启动 | 82.39 | 71.29 |
| 空轮次过滤 | 85.17 | 76.20 |
| 硬性思考预算 | 84.96 | 79.21 |
| 我们的方法(TTI+TDS) | 93.84 | 81.64 |
在我们提出的分层不确定性引导控制方法之外,我们将 T2PO 与具有代表性的思考控制策略进行了对比,结果如表 4 所示。这些策略包括:长奖励(Liu 等人,2025b)、短链式思考冷启动(Cai 等人,2025)、硬性思考预算(Comanici 等人,2025)以及空轮过滤(Xue 等人,2025)。每种控制方法的详细说明见附录 C。
(1)长奖励通过惩罚正确输出中的长回复以及错误的长回复,明确地使策略偏向于生成更短的文本,但这种全局启发式方法引入了一种僵化的偏好,无法适应任务难度或每个 token 的预测稳定性。因此,它会不加区分地抑制冗余和有用的推理,仅带来有限的性能提升。(2)使用从 GPT-4(Achiam 等人,2023)蒸馏得到的数据进行短链式思考冷启动,通过用简洁的教师演示来初始化策略,提高了早期训练的稳定性,但它并未在强化学习 rollout 过程中主动调控推理;因此,随着探索的进行,模型会逐渐趋向于重复或过长的推理模式。(3)硬性思考预算对推理长度施加了固定上限。然而,其静态约束无法适应每轮的不确定性或任务复杂度,导致在困难情况下过早截断有用的推理,而在简单情况下又无法充分抑制冗余探索。(4)空轮过滤会移除包含无效或空动作的轨迹,防止出现琐碎的退化行为,但未能解决语义相似的合法轮次之间的冗余问题,因此仅带来微小的改进。
5.5 探索效率分析
图 7(a)显示,基线模型在早期表现出性能提升,但随后出现不稳定和部分崩溃,而 T2PO 在整个训练过程中实现了稳定的单调提升。这表明,自适应思考调控通过防止低信息量的推理主导 rollout 过程,从而稳定了长程多轮策略学习。
为了直接衡量 token 级别的探索效率,图 7(b) 报告了成功轨迹的比例与生成 token 预算的关系。我们观察到,在相同的 token 预算下,T2PO 始终能产生更高比例的成功推理轨迹。具体而言,基线方法将大量 token 浪费在超出有效推理边界的冗余延续上,而 T2PO 则在预测分布稳定后截断低效用的推理。在回合层面,图 7(c) 进一步报告了完成任务所需的平均交互回合数。基线智能体经常在多个回合中陷入重复的推理循环,导致轨迹更长且探索效率低下。相比之下,T2PO 能够检测到冗余的回合级推理状态,并仅在必要时触发重新生成,从而减少了重复的低信息交互。
5.6 案例研究
关于智能体与环境交互的轨迹详情,请参见附录 G。
6 结论
通过利用内在信号在 token 和回合两个层面显式地调控推理,T2PO 有效抑制了低信息动作,并在不依赖额外奖励塑造的情况下缓解了训练崩溃。大量实验表明,T2PO 持续提升了训练稳定性、探索效率和任务性能。
致谢
本工作部分得到了 NSF 2211557、NSF 2303037、NSF 2312501、NSF 2531008、SRC JUMP 2.0 中心、UCLA CDSC 中心、亚马逊研究奖、Snapchat 以及 Google 捐赠的支持。我们同样衷心感谢亚马逊对本工作的赞助与支持。
影响声明
本研究推进了对面向推理的大语言模型在多轮强化学习中不稳定性问题的理解。通过将低效探索识别为训练崩溃的根本原因,并提出基于原则的 token 级和轮次级不确定性控制方法,我们的方法为稳定智能体强化学习训练提供了一个通用框架。我们预期该方法将有助于可扩展且可复现的交互式 LLM 智能体训练,从而在复杂决策应用中实现更广泛的部署。
参考文献
- J. Achiam, S. Adler, S. Agarwal, L. Ahmad, I. Akkaya, F. L. Aleman, D. Almeida, J. Altenschmidt, S. Altman, S. Anadkat, 等人 (2023) Gpt-4 技术报告。arXiv 预印本 arXiv:2303.08774。引用位置:表 1,§5.4,表 2。
- Anthropic (2025) Claude Sonnet 4。注:大语言模型。外部链接:链接。引用位置:表 1。
- H. J. Cai, J. Wang, X. Chen, 和 B. Dhingra (2025) 回溯多少才够?探索 SFT 与 RL 在增强 LLM 推理中的相互作用。arXiv 预印本 arXiv:2505.24273。引用位置:§C.2,附录 C,§5.4。
- M. Chen, G. Chen, W. Wang, 和 Y. Yang (2025) Seed-GRPO:面向不确定性感知策略优化的语义熵增强 GRPO。arXiv 预印本 arXiv:2505.12346。引用位置:§2.2。
- G. Comanici, E. Bieber, M. Schaekermann, I. Pasupat, N. Sachdeva, I. Dhillon, M. Blistein, O. Ram, D. Zhang, E. Rosen, 等人 (2025) Gemini 2.5:以高级推理、多模态、长上下文和下一代智能体能力推动前沿发展。arXiv 预印本 arXiv:2507.06261。引用位置:§C.3,附录 C,表 1,§5.4。
- G. Dong, L. Bao, Z. Wang, K. Zhao, X. Li, J. Jin, J. Yang, H. Mao, F. Zhang, K. Gai, 等人 (2025) 智能体熵平衡策略优化。arXiv 预印本 arXiv:2510.14545。引用位置:§1。
- L. Feng, Z. Xue, T. Liu, 和 B. An (2025) 面向 LLM 智能体训练的组内组策略优化。arXiv 预印本 arXiv:2505.10978。引用位置:§B.4,§1,§2.1,表 1,表 1,§5.1,表 2。
- B. Fu, Z. Cao, M. Long, 和 J. Wang (2020) 学习检测开放类别以实现通用域适应。收录于:欧洲计算机视觉会议,第 567–583 页。引用位置:§4.1。
- W. Fu, J. Gao, X. Shen, C. Zhu, Z. Mei, C. He, S. Xu, G. Wei, J. Mei, J. Wang, T. Yang, B. Yuan, 和 Y. Wu (2025a) AReaL:一个用于语言推理的大规模异步强化学习系统。外部链接:2505.24298,链接 引用自:§1。
- Y. Fu, X. Wang, Y. Tian, 和 J. Zhao (2025b) 深度思考,充满信心。arXiv 预印本 arXiv:2508.15260。引用自:§2.2。
- X. Ho, A. D. Nguyen, S. Sugawara, 和 A. Aizawa (2020) 构建用于全面评估推理步骤的多跳问答数据集。arXiv 预印本 arXiv:2011.01060。引用自:§5.1。
- B. Jin, H. Zeng, Z. Yue, J. Yoon, S. Arik, D. Wang, H. Zamani, 和 J. Han (2025) Search-r1:通过强化学习训练大语言模型进行推理并利用搜索引擎。arXiv 预印本 arXiv:2503.09516。引用自:§5.1,表 2。
- M. Joshi, E. Choi, D. S. Weld, 和 L. Zettlemoyer (2017) Triviaqa:一个用于阅读理解的大规模远程监督挑战数据集。arXiv 预印本 arXiv:1705.03551。引用自:§5.1。
- T. Kwiatkowski, J. Palomaki, O. Redfield, M. Collins, A. Parikh, C. Alberti, D. Epstein, I. Polosukhin, J. Devlin, K. Lee, 等 (2019) Natural Questions:一个用于问答研究的基准数据集。计算语言学协会汇刊 7,第 453–466 页。引用自:§5.1。
- W. Kwon, Z. Li, S. Zhuang, Y. Sheng, L. Zheng, C. H. Yu, J. E. Gonzalez, H. Zhang, 和 I. Stoica (2023) 使用 PagedAttention 实现大语言模型服务的高效内存管理。收录于:ACM SIGOPS 第 29 届操作系统原理研讨会论文集。引用自:附录 E。
- J. Lin (2002) 基于香农熵的散度度量。IEEE 信息论汇刊 37 (1),第 145–151 页。引用自:§4.1。
- A. Liu, B. Feng, B. Xue, B. Wang, B. Wu, C. Lu, C. Zhao, C. Deng, C. Zhang, C. Ruan, 等 (2024) DeepSeek-V3 技术报告。arXiv 预印本 arXiv:2412.19437。引用自:§1,§4.2。
- L. Liu, F. Yao, D. Zhang, C. Dong, J. Shang, 和 J. Gao (2025a) FlashRL:8 比特 rollout,全功率强化学习。外部链接:链接 引用自:§1。
- W. Liu, R. Zhou, Y. Deng, Y. Huang, J. Liu, Y. Deng, Y. Zhang, and J. He (2025b) 学习通过基于长度的自适应奖励塑形进行高效推理。arXiv 预印本 arXiv:2505.15612。引用自:§C.1,附录 C,§5.4。
- A. Mallen, A. Asai, V. Zhong, R. Das, D. Khashabi, and H. Hajishirzi (2023) 何时不应信任语言模型:探究参数化记忆与非参数化记忆的有效性。载于《计算语言学协会第 61 届年会论文集(第一卷:长论文)》,第 9802–9822 页。引用自:§5.1。
- K. Mehlhorn, B. R. Newell, P. M. Todd, M. D. Lee, K. Morgan, V. A. Braithwaite, D. Hausmann, K. Fiedler, and C. Gonzalez (2015) 解析探索-利用权衡:人类与动物文献的综合。Decision 2 (3),第 191 页。引用自:§1。
- O. Press, M. Zhang, S. Min, L. Schmidt, N. A. Smith, and M. Lewis (2023) 衡量并缩小语言模型中的组合性差距。载于《计算语言学协会发现:EMNLP 2023》,第 5687–5711 页。引用自:§5.1。
- J. Schulman, F. Wolski, P. Dhariwal, A. Radford, and O. Klimov (2017) 近端策略优化算法。arXiv 预印本 arXiv:1707.06347。引用自:表 1,§5.1。
- N. Shang, Y. Liu, Y. Zhu, L. L. Zhang, W. Xu, X. Guan, B. Zhang, B. Dong, X. Zhou, B. Zhang, et al. (2025) Rstar2-agent:智能体推理技术报告。arXiv 预印本 arXiv:2508.20722。引用自:§2.1。
- Z. Shao, P. Wang, Q. Zhu, R. Xu, J. Song, X. Bi, H. Zhang, M. Zhang, Y. Li, Y. Wu, et al. (2024) Deepseekmath:在开放语言模型中推动数学推理的极限。arXiv 预印本 arXiv:2402.03300。引用自:表 1,表 1,§5.1。
- G. Sheng, C. Zhang, Z. Ye, X. Wu, W. Zhang, R. Zhang, Y. Peng, H. Lin, and C. Wu (2024) HybridFlow:一个灵活高效的 RLHF 框架。arXiv 预印本 arXiv:2409.19256。引用自:§B.3,§D.2,附录 E,§5.1。
- M. Shridhar, X. Yuan, M. Côté, Y. Bisk, A. Trischler, and M. Hausknecht (2020) Alfworld:为交互式学习对齐文本与具身环境。arXiv 预印本 arXiv:2010.03768。引用自:§A.1.2,§5.1。
- H. Sun, Z. Qiao, J. Guo, X. Fan, Y. Hou, Y. Jiang, P. Xie, Y. Zhang, F. Huang, 和 J. Zhou (2025) 《Zerosearch:无需搜索即可激励大语言模型的搜索能力》。arXiv 预印本 arXiv:2505.04588。表 2 引用。
- K. Team, A. Du, B. Gao, B. Xing, C. Jiang, C. Chen, C. Li, C. Xiao, C. Du, C. Liao 等 (2025) 《Kimi k1.5:扩展大语言模型的强化学习》。arXiv 预印本 arXiv:2501.12599。§1 引用。
- Q. Team (2025) 《Qwen3 技术报告》。外部链接:2505.09388,链接。§1、§4.1、表 1、表 2 引用。
- H. Trivedi, N. Balasubramanian, T. Khot, 和 A. Sabharwal (2021) 《Musique:通过单跳问题组合实现多跳问题》,2022 年。URL:https://arxiv.org/abs/2108.00573。§5.1 引用。
- H. Wang, J. Chang, Y. Zhai, X. Luo, J. Sun, Z. Lin, 和 Q. Tian (2024) 《Lion:隐式视觉提示微调》。收录于《AAAI 人工智能会议论文集》,第 38 卷,第 5372–5380 页。§C.2 引用。
- H. Wang, X. Yang, J. Chang, D. Jin, J. Sun, S. Zhang, X. Luo, 和 Q. Tian (2023) 《大规模多模态基础模型的参数高效微调》。《神经信息处理系统进展》第 36 卷,第 15752–15774 页。§C.2 引用。
- J. Wang, J. Liu, Y. Fu, Y. Li, X. Wang, Y. Lin, Y. Yue, L. Zhang, Y. Wang, 和 K. Wang (2025a) 《利用不确定性:面向长周期大语言模型智能体的熵调制策略梯度》。外部链接:2509.09265,链接。§1 引用。
- X. Wang, H. Zhang, H. Wang, Y. Shi, R. Li, K. Han, C. Tong, H. Deng, R. Sun, A. Taylor 等 (2026) 《ARLArena:用于稳定智能体强化学习的统一框架》。arXiv 预印本 arXiv:2602.21534。§1 引用。
- Z. Wang, K. Wang, Q. Wang, P. Zhang, L. Li, Z. Yang, K. Yu, M. N. Nguyen, L. Liu, E. Gottlieb, M. Lam, Y. Lu, K. Cho, J. Wu, L. Fei-Fei, L. Wang, Y. Choi, 和 M. Li (2025b) 《RAGEN:通过多轮强化学习理解大语言模型智能体的自我进化》。外部链接:2504.20073,链接。§1、§2.1 引用。
- Z. Wang, X. Zheng, K. An, C. Ouyang, J. Cai, Y. Wang, 和 Y. Wu (2025c) 《StepSearch:通过逐步近端策略优化激发大语言模型的搜索能力》。arXiv 预印本 arXiv:2505.15107。表 2 引用。
- Z. Wei, W. Yao, Y. Liu, W. Zhang, Q. Lu, L. Qiu, C. Yu, P. Xu, C. Zhang, B. Yin 等人 (2025) 《Webagent-r1:通过端到端多轮强化学习训练网络智能体》。arXiv 预印本 arXiv:2505.16421。引用自 §1。
- Z. Xue, L. Zheng, Q. Liu, Y. Li, X. Zheng, Z. Ma 和 B. An (2025) 《Simpletir:面向多轮工具集成推理的端到端强化学习》。arXiv 预印本 arXiv:2509.02479。引用自 §C.4、附录 C、§1、§2.1、§5.4。
- Z. Yang, P. Qi, S. Zhang, Y. Bengio, W. Cohen, R. Salakhutdinov 和 C. D. Manning (2018) 《HotpotQA:一个面向多样化、可解释的多跳问答数据集》。载于《2018年自然语言处理经验方法会议论文集》,第2369–2380页。引用自 §5.1。
- S. Yao, H. Chen, J. Yang 和 K. Narasimhan (2022) 《Webshop:基于具身语言智能体的可扩展真实世界网络交互》。Advances in Neural Information Processing Systems 35,第20744–20757页。引用自 §5.1。
- Q. Yu, Z. Zhang, R. Zhu, Y. Yuan, X. Zuo, Y. Yue, W. Dai, T. Fan, G. Liu, L. Liu 等人 (2025) 《Dapo:一个大规模开源大语言模型强化学习系统》。arXiv 预印本 arXiv:2503.14476。引用自 §1、§4.3、表1、表1、§5.1。
- C. Zheng, K. Dang, B. Yu, M. Li, H. Jiang, J. Lin, Y. Liu, A. Yang, J. Zhou 和 J. Lin (2025a) 《稳定大语言模型强化学习:公式化与实践》。arXiv 预印本 arXiv:2512.01374。引用自 §1。
- C. Zheng, S. Liu, M. Li, X. Chen, B. Yu, C. Gao, K. Dang, Y. Liu, R. Men, A. Yang 等人 (2025b) 《分组序列策略优化》。arXiv 预印本 arXiv:2507.18071。引用自 §D.1、§5.1。
- Y. Zhou, A. Zanette, J. Pan, S. Levine 和 A. Kumar (2024) 《Archer:通过分层多轮强化学习训练语言模型智能体》。arXiv 预印本 arXiv:2402.19446。引用自 §1。
附录
附录 A 更多任务细节
A.1 评估指标
A.1.1 WebShop
我们采用六项互补的评估指标来全面衡量任务完成质量。(1)任务分数定义为每个回合的平均累积奖励。(2)成功率定义为获得终止奖励的回合比例。值得注意的是,即使最终选定的产品与标注的目标产品不完全一致,一个回合仍可能获得成功。这是因为多个产品可能满足同一用户指令。例如,尽管指令是根据某个特定参考商品生成的,但多个产品都可以满足“我想要一件红衬衫”这一请求。(3–6)标题分数、奖励类型、奖励属性和奖励选项分别评估决策质量的细粒度方面,依次衡量正确的产品标题匹配、类别一致性、属性满足度以及选项字段匹配。
每条自然语言指令均由人工标注员根据目标产品构建。它由三个部分组成:一个非空属性集、一个选项字段-值集以及一个价格约束。形式上,表示目标产品属性的子集,表示其选项字段-值对的子集,并且设定为高于目标产品的价格。这种设计使得数据收集既轻量又可扩展,同时保留了真实的用户意图。在每个回合结束时,智能体会收到一个终止奖励,其中,是最终状态下选定的产品,而、和分别表示该产品的属性、选项和价格。奖励定义如下:
| (9) |
其中,类型奖励会对预测产品与目标产品之间的类别不匹配进行惩罚。具体来说,当和具有相似的属性或选项但属于不同的产品类别时,会给出较低的分数。例如,“黄油”和“植物肉”可能都表现出“无残忍”和“非转基因”等属性,但它们代表了根本不同的产品类型。
A.1.2 Alfworld
我们遵循标准的 ALFWorld 评估协议(Shridhar 等人,2020 年)。该基准包含 3,827 个任务实例,涵盖六类家务活动:拾取与放置、在光线下检查、清洁与放置、加热与放置、冷却与放置,以及拾取两个并放置。除非另有说明,我们通过汇总所有六类任务的结果来报告整体性能。主要指标是成功率,定义为智能体成功完成目标的任务实例所占比例。如果最终环境状态满足指令指定的所有目标条件,则认为任务成功。整体成功率通过对来自六类任务的所有评估回合取平均来计算。
A.1.3 搜索问答
我们使用精确匹配(EM)作为主要指标来评估搜索增强的推理性能。在与搜索引擎交互的多轮推理之后,模型输出由 `<answer>` 和 `</answer>` 标记包围的最终答案。提取预测答案,并通过精确字符串匹配与真实答案进行比较:
| (10) |
该 EM 分数既作为强化学习的基于结果的奖励,也作为测试期间的最终评估指标。通过仅依赖结果监督,该指标直接反映了模型制定有效搜索查询、检索相关外部知识以及将检索到的证据整合到多步推理中并最终生成正确答案的能力。我们遵循标准评估协议,在涵盖通用和多跳问答任务的七个基准数据集上报告 EM 分数。
A.2 超参数设置
为确保在不同智能体强化学习基准之间进行公平且可控的对比,我们采用了统一的超参数设计原则。所有任务共享相同的模型族、优化策略和 rollout 框架,仅调整任务特定参数以匹配环境特性。这种标准化配置消除了因训练设置不一致而产生的混淆因素,使得性能差异可归因于算法行为而非实现差异。据此,表 5 中的超参数经过选择,以平衡各任务的训练稳定性、计算效率和可复现性。
| 类别 | WebShop | ALFWorld | Search |
|---|---|---|---|
| 模型与环境 | |||
| 基础模型 | Qwen3-RFT | Qwen3-RFT | Qwen3 |
| 最大交互步数 | 15 | 50 | 4 |
| 记忆上下文窗口 | 2 | 2 | 4 |
| 组 rollout 大小 | 8 | 8 | 5 |
| 相似度阈值 | - | - | 0.9 |
| 最大提示词长度 | 4096 | 2048 | 4096 |
| 最大响应长度 | 500 | 500 | 500 |
| 思考预算 | 450 | 450 | 450 |
| 优化 | |||
| 组归一化模式 | mean_norm | mean_norm | mean_norm |
| 学习率 | |||
| 小批量大小 | 128 | 256 | 256 |
| 每 GPU 微批量大小 | 8 | 32 | 16 |
| KL 系数 | 0.01 | 0.01 | 0.01 |
| 格式惩罚系数 | 0.1 | 0.1 | 0.1 |
| Rollout 与采样 | |||
| Rollout 引擎 | vLLM | vLLM | vLLM |
| Rollout 模式 | 同步 | 同步 | 同步 |
| 张量并行大小 | 1 | 1 | 1 |
| GPU 内存利用率 | 0.6 | 0.6 | 0.6 |
| 温度(验证) | 0.6 | 0.6 | 0.6 |
| Top-p(验证) | 0.95 | 0.95 | 0.95 |
| Top-k(验证) | 20 | 20 | 20 |
| 监控窗口大小 | 20 | 15 | 20 |
| Token 级容差 | 1e-4 | 1e-4 | 1e-4 |
| 轮次级容差 | 1e-3 | 1e-3 | 1e-3 |
| 训练计划 | |||
| 训练批量大小 | 128 | 128 | 256 |
| 验证批量大小 | 128 | 128 | 512 |
| 总轮数 | 200 | 150 | 250 |
| 硬件 | |||
| GPU | 8 块 NVIDIA H100 | 8 块 NVIDIA H100 | 8 块 NVIDIA H100 |
| 节点数 | 1 | 1 | 1 |
附录 B 强化学习训练技术
B.1 拒绝性微调
早期阶段智能体强化学习训练中的一个关键挑战是存在格式错误或低质量的行动输出,这些输出会给轨迹收集引入大量噪声,并破坏后续策略优化的稳定性。为缓解这一问题,我们在强化学习之前采用了一个拒绝性微调(RFT)阶段,用高质量的行为先验来初始化策略,而无需引入任何外部监督或超出环境反馈的额外知识。具体来说,我们首先使用基础 Qwen3 模型,在目标环境中以与强化学习训练相同的提示词和工具调用格式执行多轮 rollout,以生成轨迹。每条生成的轨迹都由环境进行评估,以获得一个标量任务奖励。然后,我们仅保留最终任务得分超过预设阈值的轨迹,丢弃低质量或失败的交互。剩余的高分轨迹被视为监督式演示数据,从中提取状态-动作对,并对策略模型执行一个 epoch 的监督微调,具体如下:
| (11) |
这个 RFT 阶段为智能体配备了一个可靠的初始策略,使其能够产生结构上有效的行动和合理的早期推理模式,从而减少格式错误的 rollout,并提高后续多轮强化学习训练的稳定性。
值得注意的是,我们发现 RFT 为智能体强化学习训练提供了一种有效的冷启动方式。具体而言,它显著增强了指令遵循能力,从而实现了更准确的输出格式。此外,行动输出的成功率也大幅提高,因为在 RFT 初始化下,初始行动空间被有效收窄。同时,我们观察到增加 RFT 的 epoch 数会进一步降低 RFT 训练损失。然而,过度的 RFT 开始削弱基础模型固有的推理能力,这反过来又阻碍了后续的强化学习训练。基于这种权衡,我们在所有实验中将 RFT 限制在不超过五个 epoch。
B.2 格式惩罚
智能体需要以结构化格式生成行动,该格式包含一个推理段和一个可执行行动段:
然而,在早期阶段的强化学习训练中,大语言模型智能体频繁生成格式错误的输出,例如缺失标签、重复标签或穿插自然语言,这会导致无效的环境交互和带有噪声的监督信号。为确保环境接口的一致性,并为拒绝性微调构建可靠的拒绝信号,我们应用了一个格式约束的动作投影算子。给定某一轮次的一批原始模型输出,我们定义一个严格的格式验证器:
| (12) |
其中,匹配过程额外强制要求每个字段有且仅有一个开始标签和一个结束标签,并排除非目标语言字符。如果匹配成功,我们从 `<action>` 字段中提取可执行的动作 token,并将该输出标记为格式有效。如果严格约束失败,我们则应用一个宽松的解析器,该解析器会搜索 `<action>` 字段的首次出现位置:
| (13) |
当匹配成功时,我们仍然提取相应的动作 token,但会为其分配一个格式无效的标记。否则,该输出被标记为无效,并存储一个回退占位符。
为了在强化学习训练中明确抑制格式错误的生成,我们在环境奖励中引入了一个基于格式的惩罚项。具体来说,如果某个输出未能通过严格格式约束,即匹配失败,我们会从最终的任务奖励中减去一个固定的惩罚值:
这种轻量级的惩罚项提供了一个直接的训练信号,能够抑制格式错误的思考-动作输出,同时避免引入额外的外部监督。
B.3 轨迹分解
由于我们将轨迹拆分为单轮次进行策略优化,这不可避免地引入了离策略的陈旧性问题。具体来说,在我们基于 verl(Sheng 等人,2024)构建的训练流程中,轨迹生成和策略更新是以流水线方式执行的:当学习器在训练步骤更新策略参数时,环境工作者可能仍在使用之前的策略快照生成新的轨迹。因此,收集到的单轮次转换并非严格遵循最新策略的在线数据,从而产生了不可忽视的策略滞后。
为了量化这一影响,假设 rollout 小批量大小为 ,更新微批次大小为 ,提示词分组大小为 ,每条轨迹的平均轮次消耗为 (注意每条轨迹可能包含不同数量的轮次)。在训练过程中,环境工作进程持续生成轮次级别的转移数据,而学习器则以微批次方式执行参数更新。因此,在新更新的策略广播给 rollout 工作进程之前,可能已经使用过时的策略快照生成了若干轮次级别的样本。
我们以学习器更新步数为单位,将预期的策略滞后近似表示为:
| (14) |
该公式反映了在收集一批 rollout 数据期间可以执行的学习器更新次数。基于此,我们将陈旧率定义为 ,它表征了在过时策略参数下生成的样本占总体有效更新量的比例。更大的 rollout 批次大小或更长的平均轮次时长会增加 ,而更大的更新微批次或更高的提示词分组并行度则会降低陈旧率。因此,该比率简洁地衡量了流水线训练中因轮次级轨迹分解所导致的离策略偏差。
优势。该方法通过将环境交互与策略优化解耦,实现了可扩展的多轮强化学习,从而显著提升了硬件利用率和训练吞吐量。这种分解还允许对生成过程进行细粒度控制,支持诸如按轮次重采样和基于不确定性的停止等动态干预机制。这些设计选择共同使其非常适合大语言模型中的长周期交互式任务。
局限性。流水线执行不可避免地会引入离策略陈旧性问题,因为回合级样本可能是在更新后的参数同步到各工作节点之前,根据过时的策略快照生成的。根据陈旧率量化,更长的交互周期和更大的 rollout 批次会放大这一效应,可能增加重要性权重方差并破坏策略优化的稳定性。为了检验离策略陈旧性是否对性能有显著影响,我们固定并改变相关参数。表 6 显示,在这些配置下训练基本保持稳定,表明离策略陈旧性在实践中不会显著降低性能。
| Rollout 批次大小 | 提示词分组大小 | 任务得分 | 成功率(%) |
|---|---|---|---|
| 8 | 8 | 92.85 | 80.97 |
| 8 | 16 | 93.73 | 81.35 |
| 16 | 8 | 93.84 | 81.64 |
B.4 策略更新细节
我们的策略更新主要基于 GiGPO(Feng 等人,2025)。我们还提供了回合相对优势的计算细节如下。给定一个为同一任务实例生成的轨迹 rollout 组,他们首先枚举所有时间步和轨迹中遇到的所有环境状态,并识别出唯一状态集。每个唯一状态作为一个锚定状态,围绕该状态,他们从不同轨迹和时间步中收集该状态的所有出现,形成一个回合级组。重要的是,这种分组完全通过基于键的状态匹配离线进行,不会引入额外的环境交互或大语言模型推理开销。
对于回合级组中的每个元组,他们计算折扣回报以捕捉相应动作的长期后果。然后,他们在每个组内对这些回报进行归一化,以获得步骤相对优势,该优势衡量一个动作相对于从同一状态出发的其他动作的表现。这种归一化确保正优势对应高于平均水平的决策,而负值则表示在相同状态条件下次优的选择。
附录 C 更多相关工作
由于我们方法的核心贡献在于为多轮强化学习提供显式且细粒度的思维控制,我们也考虑了一系列最初为单轮场景提出、但在精神上密切相关的成熟技术。因此,在本节中,我们将详细讨论长奖励(Liu 等人,2025b)、短思维链冷启动(Cai 等人,2025)、硬性思考预算(Comanici 等人,2025)以及空轮过滤(Xue 等人,2025)。
C.1 长奖励
过度思考同样是推理模型单轮强化学习中一个长期存在的挑战。为了显式地调控过长的推理长度,Liu 等人(2025b)总结了现有的长奖励方法,该方法将响应长度纳入奖励设计。具体而言,给定一个带有标准答案的问题,假设采样了一组响应,其中表示推理轨迹,是的长度。令且。如果,则所有响应的长度奖励均设为零,因为它们长度相同。否则,第个响应的长度奖励定义为:
| (15) |
直观上,该公式在正确输出中鼓励更短的正确答案,同时惩罚较长的正确答案,并显式惩罚答案错误的长响应。最终得到的基于长度的奖励会以加权系数的形式添加到原始任务奖励中,从而直接控制推理长度与任务性能之间的权衡。
C.2 短思维链冷启动
近期证据(Cai 等人,2025)表明,推理模型中的强化学习主要并非受益于记忆正确的解题轨迹,而是内化嵌入在示范轨迹中的结构化搜索行为。这也是参数高效微调方法(如 Wang 等人,2023, 2024)能够奏效的原因。特别地,回溯——即模型显式修正先前决策——已被识别为一种关键的结构化先验,它使强化学习能够发现有效的多步探索策略。然而,构建包含适当回溯的高质量长推理轨迹成本高昂且高度依赖具体任务。
受此洞察启发,我们采用短链式思维冷启动作为智能体强化学习的轻量级机制。我们并未提供完整长度的专家轨迹,而是通过短监督微调,利用更强大语言模型(如 GPT-4o)生成的简洁推理模式以及基本的指令遵循能力来初始化模型,从而确保有效的输出格式并缩减有效动作空间。这种初始化方式为策略赋予了一套最小但一致的交互协议,在此基础上,强化学习能够在多轮环境交互中可靠地增强和优化潜在的搜索行为。
C.3 硬性思考预算
Google Gemini 2.5 系列模型(Comanici 等人,2025)提供了一个专门的思考阶段,旨在提升复杂任务中的推理与规划能力。该阶段通过一个思考预算参数进行控制,该参数指定了模型在生成最终回复之前,分配给内部思考的最大模型 token 数量。根据 Gemini 和 Vertex AI 的官方文档,思考过程在架构上与主要的回复生成阶段是分离的,用户可以为其模型 token 预算设置一个上限。一个特殊值允许模型动态决定其自身预算,而对于轻量级变体,则禁用显式思考。每个模型系列还进一步规定了有效的最小和最大范围(例如,Gemini 2.5 Pro 为 128–32k 模型 token)。
C.4 空转轮次过滤
空转轮次过滤(Xue 等人,2025)是一种用于思考控制的稳定化策略,旨在提升多轮策略优化的鲁棒性。在多轮推理中,低概率模型 token 的累积以及高采样随机性常常会产生空转轮次,即那些既不包含有效最终答案,也不包含完整可执行结构的回复。典型的空转轮次表现为部分代码片段、重复的文本循环,或因提前采样到序列结束标记而导致的中途终止输出。空转轮次过滤通过将包含此类无效轮次的轨迹从策略损失计算中排除来解决这一问题。
附录 D 更多实验结果
D.1 关于其他策略优化算法的消融实验
事实上,我们的方法是即插即用的,可以轻松集成到其他策略更新方案中。在 WebShop 上,我们进一步将基础策略优化替换为 GSPO(Zheng 等人,2025b)。应用我们的 TTITDS 后,成功率从 85.18 提升至 91.79,相对提升了 7.76%。
D.2 关于模型 token 级响应长度的消融研究
图 6 展示了策略模型(即 Qwen3-4B)在不同预设最大响应长度下(即在 verl 框架中(Sheng 等人,2024))训练过程中输出长度的演变。我们从观察中得出以下结论:
(1) 在多轮强化学习中,更长的输出长度并不总是更好。从图 6 (a) 和 6 (b) 可以看出,当最大响应长度从 500 增加到 700 时,最终模型的平均输出长度几乎保持不变。这表明,对于交互驱动的环境,过多的 token 预算通常是不必要的。相反,当最大长度过小(例如 300)时,图 6 (c) 和 6 (d) 显示,很大一部分轨迹仍被截断,这表明 token 预算不足。
(2) T2PO 实现了更高的 token 效率。比较图 6 (a) 和 6 (b),在最终实验设置(500 token 限制)下,我们的方法平均生成的 token 比 GiGPO 少 20%。同时,图 6 (c) 和 6 (d) 显示,在最后 50 个训练步骤中,我们的方法很少触发最大长度截断,这表明它避免了生成冗余或无信息的文本,并显著缓解了过度思考问题。
(3) T2PO 更有效地激发了有意义的交互驱动推理。从图 6 (a) 和图 6 (b) 可以看出,我们的输出长度在前 20 个训练步骤中逐渐增加,反映了推理深度的逐步增强。相比之下,GiGPO 的输出长度在前 50 个步骤中急剧下降,这表明它通过丢弃大量过度思考的轨迹,迅速抑制了探索。这一观察结果得到了定性轨迹案例研究的进一步支持。
D.3 敏感性分析
在本节中,我们对 WebShop 上自校准不确定性信号中的融合系数进行了敏感性分析,该系数用于平衡熵和置信度。我们将 从 0.2 变化到 0.4、0.6 和 0.8,并观察到 取 0.4 时性能最佳。因此,我们将 设置为 0.4。
D.4 Alfworld 上的效率分析
我们在 ALFWorld 上观察到了类似的现象。柱状图显示,T2PO 生成的成功轨迹的 token 消耗分布显著低于 SOTA 基线。同时,折线图表明,T2PO 在成功轨迹上的探索效率在整个训练过程中始终更高。此外,右侧图在回合层面显示,T2PO 在训练期间完成任务的交互回合数减少了约 16%。
D.5 WebShop 上的更多结果
为了更好地理解性能提升的来源,我们进一步在表 8 中报告了 WebShop 上的分解奖励指标。每个奖励组件评估任务完成的一个不同方面,包括正确的产品标题识别(标题得分)、准确的类别匹配(reward_type)、属性满足度(reward_attribute)以及最终选项选择(reward_option)。
我们观察到,基于提示词和指令微调的基线方法在细粒度奖励组件上表现有限,这表明纯监督学习或上下文内对齐不足以实现稳健的多步决策。单轮强化学习方法(PPO 和 GRPO)显著提升了所有奖励维度,证实了强化学习在对齐长周期行为方面的优势。然而,多轮强化学习基线方法(GiGPO 和 GiGPO+DAPO)仍然呈现出不平衡的奖励分布,尤其是在标题分数和 reward_option 上,这表明低效的探索和不稳定的信用分配阻碍了跨交互轮次的一致进步。
T2PO 在两个骨干模型下均在所有奖励组件上取得了最高分数。值得注意的是,在标题分数和 reward_option 上的提升最为显著,这两者需要精确的信息获取和果断的行动执行。这表明我们的不确定性感知优化有效抑制了低信息探索,使策略能够聚焦于高收益的交互轨迹,并在整个多轮推理过程中产生更可靠的细粒度决策。
| 方法 | 标题分数 | reward_type | reward_attribute | reward_option |
|---|---|---|---|---|
| 提示词 | ||||
| Claude Sonnet 4 | 0.3396 | 0.4775 | 0.4263 | 0.4309 |
| Qwen3-4B | 0.1437 | 0.2039 | 0.1756 | 0.0493 |
| Qwen3-32B | 0.1749 | 0.2283 | 0.2003 | 0.0684 |
| 指令微调 | ||||
| Qwen3-4B + SFT | 64.58 | 0.8789 | 0.7996 | 0.5826 |
| 强化学习训练 (Qwen3-4B-RFT) | ||||
| PPO | 31.65±11.45 | 33.92±9.64 | 29.24±7.19 | 28.76±6.99 |
| GRPO | 52.92±9.13 | 51.87±11.71 | 53.24±8.66 | 50.49±4.89 |
| GiGPO | 20.79±7.23 | 36.20±3.28 | 27.68±6.84 | 23.79±10.42 |
| GiGPO + DAPO | 54.07±9.76 | 67.20±12.45 | 54.71±8.64 | 52.09±7.69 |
| T2PO (我们的方法) | 65.61±9.19 | 67.58±13.67 | 60.89±14.68 | 57.49±14.12 |
| 强化学习训练 (Qwen3-8B-RFT) | ||||
| GRPO | 53.87±6.97 | 50.95±8.45 | 54.67±8.53 | 50.08±9.13 |
| GiGPO | 54.98±7.45 | 54.13±4.75 | 58.12±9.87 | 56.28±5.67 |
| GiGPO + DAPO | 55.88±7.01 | 68.19±7.39 | 59.62±6.38 | 57.44±5.37 |
| T2PO (我们的方法) | 67.14±3.73 | 68.98±4.18 | 62.77±5.04 | 58.33±5.34 |
输入:策略模型 ,最小前缀长度 ,窗口大小 ,用户提示词 ,稳定性阈值 ,最大思考长度 。
输出:为第 轮生成的行动序列 。
1:初始化 token 索引
2:初始化停止指示器
3: 初始化空序列
4: 当 时执行
5: Sample next token:
6: 使用公式 3 计算自校准不确定性
7: 如果 且 则
8: 监控第 轮中 token 的时间变化:
9: 如果 则
10: 强制输出推理终止符 </think>:
11: 追加确定性队列
12: 设置
13: 跳出循环
14: 结束条件判断
15: 结束条件判断
16:
17: 结束循环
18: 如果 则
19: 强制输出推理终止符 </think>
20: 结束条件判断
21: 解码为动作序列
22: 返回
0: 策略模型 ,用户提示词 ,环境 ,轮次阈值 ,重采样预算 ,最大轮次 ,目标样本 。
0: 收集到的轨迹集合 。
1: 初始化
2: 当 时执行
3: 重置环境:
4: 初始化轮级观测信号
5: 初始化空轨迹
6: 对于 到 执行
7: 设置重采样计数器
8: 重复执行
9: Generate action under TTI (Definition 6):
10: Compute token-level uncertainty (Equation 3) and obtain turn-level observation signal:
11: 如果 则
12: 监控跨轮次的时间变化
13: 否则
14: 设置
15: 结束条件判断
16:
17: 直到 或
18: Parse and execute actions in environment:
19: 将 存储到
20: 如果 则
21: 跳出循环
22: 结束条件判断
23: 结束循环
24: 将轨迹添加到
25: 结束循环
26: 返回
附录 E 代码库
在现有代码库 verl(Sheng 等人,2024)的基础上,我们的代码库对 vLLM(Kwon 等人,2023)推理引擎和智能体交互循环进行了针对性修改,实现了与 verl 的无缝集成,同时保留了其可扩展性和模块化特性。具体来说,我们重新设计了解码和 rollout 流水线,以支持在生成过程中进行细粒度的不确定性感知控制,同时保持与 verl 提供的逐步多轮训练范式和内存管理机制的完全兼容。
此外,我们的实现与框架无关,并能自然地扩展到异步强化学习训练,允许在分布式环境下进行非阻塞的 rollout 收集和参数更新。这种设计确保我们的方法可以直接部署在 verl 之上,工程开销极小,同时同样适用于其他用于大语言模型智能体训练的大规模异步强化学习基础设施。
附录 F 算法伪代码
算法1和算法2总结了所提出的分层探索控制机制。算法1展示了Token级思考干预,该机制在token生成过程中动态监测自校准不确定性信号的演变。一旦预测分布根据定义6表现出持续稳定,解码过程就会被确定性终止——通过覆盖logits以输出一个推理终止符token,随后跟一个固定的结构队列,该队列明确地将推理阶段与行动阶段分开。这种设计在自适应地抑制低信息延续的同时,保留了必要的任务相关推理内容。
算法2描述了轮次级动态采样过程,该过程在与环境进行多轮交互时,在TTI之上运行。对于每一轮对话,轮次级观测信号是通过聚合生成推理轨迹中各token的不确定性来计算的。如果连续轮次之间的变化低于容忍阈值,则当前轮次被认为信息量不足,并在相同的环境状态下重新生成,直到获得一条足够不同的推理轨迹,或者重采样预算耗尽。
附录G 案例研究
Token级过度思考案例。下图展示了来自原始GiGPO的一个代表性失败案例,说明了在长周期交互环境中,过度的内部推理如何导致行动截断。智能体的状态由三个结构化组件构成:(i) 描述目标产品约束的任务说明;(ii) 总结近期观测结果和过往行动的记忆上下文;以及 (iii) 列出搜索结果及一组离散可执行行动的当前观测。在每一步中,智能体必须生成一个响应,该响应包含一段用 `<think>` `</think>` 括起来的推理轨迹,后跟一个用 `<action>` `</action>` 括起来的可执行命令。
在此示例中,推理轨迹变得异常冗长,因为智能体试图调和相互矛盾的属性约束(例如,男式衬衫与女式版型、面料要求、价格阈值以及缺货颜色)。这导致了冗长的属性检查和推测性假设生成,尽管列出的产品中没有一个与查询匹配。结果,生成的推理在产生结束的 `</think>` 和 `<action>` 标签之前就超出了系统的输出预算。缺失的终止标签使得环境无法解析该响应,尽管正确的下一步只是一个简单的翻页操作,但仍导致了即时的交互失败。
这个案例凸显出,动作空间本身是紧凑且明确的,而不受约束的推理通道成为了失败的主要来源。这促使我们需要显式的推理长度控制或早期退出机制,以防止在多轮智能体决策流程中因过度思考而导致的截断。
轮次级重复失败案例。图 G 展示了一种典型的失败模式,即智能体陷入重复的、无结果的交互循环中。具体来说,在执行初始搜索并点击一个看似相关的产品后,智能体未能验证该商品是否满足所需的尺寸约束。由于缺乏做出正确决策的必要信息,它返回到搜索页面并重新发出相同的查询。这个过程不断重复,没有取得有意义的进展,导致了冗余的推理、重复的动作模式以及不必要的 token 消耗。这种行为反映了有效探索的失效,智能体无法根据新观察到的信息调整其策略,最终导致任务完成停滞和低效的多轮交互。
T2PO 能够实现果断且无冗余的操作。下图展示了一次成功的 WebShop 交互,其中智能体在相同的结构化状态表示下生成了一个有效且可执行的操作。具体来说,状态被组织为三个层级:(i) 任务规范,编码了细粒度的属性约束(例如材质、版型、颜色、尺寸和价格);(ii) 记忆上下文,总结了最近的观察和操作,为信用分配和决策连续性提供短期历史记录;以及 (iii) 当前观察,列举了当前的搜索结果页面以及一个封闭的可行操作集(点击目标和导航操作)。这种布局使智能体的推理与环境界面保持一致:决策必须基于当前可见的内容和可执行的操作。
重要的是,生成的操作内容并非冗余。它作为一个紧凑的、面向结果的控制信号,从多约束推理过程中提炼而来。智能体并非重复状态 token,而是利用记忆上下文推断当前结果页面仍然与请求的属性不匹配,然后选择一个能最大程度提高找到可行产品可能性的单一导航操作(click[< prev])。这展示了强大的多轮规划和纠错能力:智能体能够利用交互历史,识别无效分支,并执行最小但有效的状态转换。总体而言,该案例表明,我们方法的操作生成既易于解析又具有决策有效性,反映了在长周期、高约束的购物轨迹中基于稳健推理驱动的控制能力。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org