Learning Agentic Policy from Action Guidance
Learning Agentic Policy from Action Guidance
针对大型语言模型的智能体强化学习提出新方法ActGuide-RL,通过引入日常人类交互产生的海量动作数据作为规划式参考指引,帮助策略克服难以抵达奖励状态的探索障碍。该方法采用最小干预原则,仅在必要时自适应启用指引以匹配任务难度,同时通过混合策略训练将探索收益内化回无指引策略。在搜索智能体基准测试中,ActGuide-RL相比零强化学习基线在GAIA和XBench上分别提升10.7和19个百分点,性能与需要大量监督微调数据的流程相当,为智能体强化学习提供了减少对繁重监督微调依赖的新范式。
Agent RL长期被基础策略的探索能力卡脖子,这篇论文用人类日常交互的动作数据做引导,不用重型SFT就追平现有pipeline,是训练范式层面一次务实创新。
纪宇翔
王增彬
王勇
杨世东
马子昱
陈冠华
孙宗华
吴廖妮
楚翔翔
厦门大学
高德地图,阿里巴巴集团
南方科技大学
同等贡献。工作完成于阿里巴巴集团高德地图实习期间。
项目负责人。
摘要
大语言模型的智能体强化学习严重依赖于基础策略的探索能力,因为训练信号仅在其能力可达区域内出现。对于基础策略无法到达奖励状态的任务,需要额外训练或外部引导来恢复有效的学习信号。我们不依赖成本高昂的迭代式监督微调,而是利用日常人类交互中产生的丰富动作数据。我们提出了 ActGuide-RL,该方法将动作数据作为计划式参考引导注入,使智能体策略能够克服到达奖励状态的可达性障碍。随后,通过混合策略训练对引导和非引导的 rollout 进行联合优化,将探索收益内化回非引导策略中。受理论及实证分析中收益-风险权衡的启发,我们采用最小干预原则,仅在自适应回退时调用引导,从而在匹配任务难度的同时最小化离策略风险。在搜索智能体基准测试中,ActGuide-RL 相比零强化学习有显著提升(在 GAIA 上提升 10.7 个百分点,在 XBench 上使用 Qwen3-4B 提升 19 个百分点),并且无需任何冷启动即可达到与 SFT+RL 流程相当的性能。这表明了一种新的智能体强化学习范式,即通过使用可扩展的动作引导来减少对大量 SFT 数据的依赖。
1 引言
大语言模型(LLM)的角色已从简单的聊天机器人转变为能够独立解决复杂任务的智能体[70, 69, 36, 62, 38]。通过有针对性的智能体训练,当前的前沿模型能够自主规划并完成多种复杂任务[43, 1, 52]。这种能力已在通用工具使用[2, 13, 25]、图形用户界面[65, 45, 81]和命令行界面[27]等场景中得到验证,包括真实世界的野外环境[60, 12]。此类针对性训练的关键因素之一是智能体强化学习(RL),即基于LLM的策略通过与特定或多样化环境的反复交互,朝着可验证或启发式奖励进行优化[77, 61, 24]。
与静态监督训练不同,在线强化学习对任务难度高度敏感,因为训练信号仅来自模型自身的探索。如图1所示,我们将基础策略可达能力范围内的任务称为“区域内”任务,将超出此边界的任务称为“区域外”任务。当奖励状态落入区域外时,基于群体的优势估计会坍缩为零梯度,导致训练停滞。因此,一种普遍观点认为,当前基于RL的方法从根本上受限于基础模型的能力[75, 64, 9, 22]。为解决RL在困难或未见任务上的冷启动问题,常见做法是先进行相应的监督微调(SFT),再配合动态难度调整或课程学习。然而,此类流程将负担转移到了热启动数据和精心的课程设计上。这种依赖性使得智能体RL变得复杂,且难以扩展到新环境。
回到开发智能体能力的原始动机,其目标是超越推理,使模型能够以类人方式行动、交互并做出决策,从而完成长周期任务。从这个角度看,一个直接且目前尚未充分利用的训练来源,是在开放世界环境或任务构建过程中产生的海量行动数据。如图1所示,示例包括与计算机或手机的逐步GUI/CLI交互、通过API中介执行的任务,以及长周期游戏操作。此外,部分智能体强化学习任务是通过逆向过程构建的[29, 14, 27]:先构建一条有效的行动轨迹,再以此实例化任务,从而自然获得正确的行动序列。这些行动数据本身具有多样性和大规模的特点,但由于缺乏显式的推理轨迹,其直接用于模型训练往往受到限制。现有方法要么通过合成思维链来增强此类数据[16, 68],要么通过行为模仿直接利用数据[10, 3]。然而,合成推理可能陷入事后合理化[56]的困境,而行为模仿则倾向于拟合表面行动模式,而非诱导出智能体策略的推理能力。
在这项工作中,我们研究了如何利用动作数据来增强智能体强化学习。通过实证分析,我们首先刻画了智能体策略的能力屏障,即奖励状态落在当前可达区域之外,导致训练信号不可用。为了解决这一问题,我们提出了 ActGuide-RL,该方法将动作数据作为计划式参考引导注入,帮助策略跨越此类屏障并实现有效的区域外状态访问。我们进一步分析了引导带来的收益-风险权衡,其中更强的引导能改善探索,但也会加剧离策略分布偏移。基于此,我们从实验中得出两个主要结论:C1:动作引导在作为零奖励回退方案并根据最小干预原则自适应最小化时效果最佳。C2:在这种最小干预下,引导式 rollout 可以通过混合策略优化范式直接内化到无引导模型中。
我们在搜索智能体基准上评估了 ActGuide-RL,涵盖不同的基础模型、任务难度级别以及领域内和领域外设置。与零强化学习相比,ActGuide-RL 持续提升了所有测试的基础模型,尤其是在无引导强化学习难以获得有效训练信号的更难基准上取得了显著提升。具体来说,基于 Qwen3-4B-Instruct,ActGuide-RL 在 GAIA 上相比零强化学习提升了 +10.68 个百分点,在 WebWalkerQA 上提升了 +27.79 个百分点,在 XBench 上提升了 +19.00 个百分点,在 BC-ZH 上提升了 +5.15 个百分点。值得注意的是,即使没有任何冷启动初始化,它的表现也与 SFT+RL 流程相当。这大大减轻了对 SFT 的依赖,并为智能体后训练提供了新的视角。
2 方法
2.1 预备知识:智能体强化学习
我们沿用现有研究,将智能体强化学习建模为部分可观测马尔可夫决策过程(POMDP),其中大语言模型充当策略。给定一个任务实例,策略在每个步骤将交互历史作为其状态接收,并预测下一步。一次完整展开会生成一条轨迹,并附带一个二元结果奖励,用于指示任务是否成功解决。整体训练目标是最大化期望奖励:
| (1) |
由于奖励是二元的,这自然等同于最大化在可能包含不同难度任务的任务分布上的期望成功率。
2.2 智能体强化学习中的可达性障碍
为优化上述目标,最近的强化学习算法 [7, 49, 74] 通常为每个任务采样一组展开轨迹,并通过对比成功与失败轨迹来计算优势值。当奖励状态位于能力范围内时,该机制运行良好。然而,当奖励状态落入范围外并变得不可达时,则无法获得任何学习信号。我们通过可达性动力学这一概念来形式化描述这一现象。
定义 2.1(可达性动力学)。
设 表示从状态 出发,任何后续策略所能达到的成功概率的最小上界。我们定义有效状态访问质量
| (2) |
该指标衡量在策略 诱导的展开轨迹上,平均剩余的成功潜力。比值 量化了单步可达性保持率。通过累乘,任意区间上的质量满足乘法递推关系
| (3) |
注 2.1(质量崩溃作为可达性障碍)。
由于 是从状态 出发在任何策略下可达到的成功概率的上界,因此最终成功概率满足
| (4) |
假设一个短的关键区间表现出较低的累积保留率,即,使得。一旦可达性质量出现这种急剧下降,后续的 rollout 往往会停留在低可达性区域,因此终端质量保持在崩溃后的水平附近,即。我们将这种状态称为可达性屏障。
可达性屏障使得第步之后的 rollout 获得,将基于群体的优势压缩为零梯度。这会将模型限制在区域内训练,并阻止其在区域外任务上学习。与采样不足不同,这种失败是结构性的,因此增加也无济于事。策略本身必须首先被引导跨越这个关键区间,这启发了我们下面的方法。
2.3 从屏障到引导:ActGuide-RL 框架
为了解决智能体强化学习中的根本性屏障问题,我们提出了 ActGuide-RL,利用动作作为引导,如图 2 所示。ActGuide-RL 由三个核心问题以及两个实证发现驱动:动作数据能否修复可达性屏障(§2.3.1,发现 1)、需要注入多少引导(§2.3.2,发现 2),以及如何从引导样本中进行优化(§2.3.3)。
2.3.1 如何引导:动作数据修复屏障
为了探究仅包含动作的数据能否修复可达性屏障,我们将动作轨迹视为参考计划,并将策略条件设定为。然后,我们沿着引导 rollout 比较引导行为与非引导行为。具体来说,我们测量:
| (5) |
其中计算引导策略与非引导策略之间的 token logits 差异,捕捉引导在局部改变策略的程度。前缀级别则从当前引导状态采样非引导的后续内容,并测量它们能否恢复奖励,反映该状态之后剩余的可达性。
发现一:动作引导修复了可达性障碍。如图3所示,简单任务(简单样本:模型能从早期引导状态中发现奖励)在早期引导状态下已显示出非零的Pass@K,而困难任务(困难样本:奖励状态仅在更晚的引导状态下才变得可达)在引导轨迹跨越障碍之前,其无引导Pass@K一直保持为零。在这些障碍区间内,数值急剧上升,表明动作轨迹恰好在该策略失效处偏离当前策略。在跨越障碍后,无引导Pass@K恢复到非平凡水平,表明动作引导将策略带到了可达的奖励状态,而不仅仅是替代了其决策。
受发现一启发,我们正式利用动作数据作为有效的引导信号,并将其简单地作为未来参考动作列表附加到任务提示词中(附录8)。这提供了一种非侵入式的参考方案,而非强制模型将动作生成为固定前缀。此外,考虑到不同障碍可能需要不同程度的引导才能跨越,我们将引导组织成一个有序族。
| (6) |
其中提供了前个参考动作。这为引导赋予了一个单调的强度参数,后续使我们能够搜索最小必要的干预。对于基础策略的障碍区间,我们通过障碍后有效状态访问质量的增加来衡量引导级别的障碍修复收益:
| (7) |
其中越大,表示引导能更好地保留可达的成功潜力。
2.3.2 引导多少:最小干预原则
虽然更强的引导能提高障碍修复收益(公式7),但也会导致与基础策略的分布偏移更大,增加了离策略优化误差的风险[57, 80]。设为生成的token序列。为了量化引导级别下的分布偏移,我们测量一次rollout的累积token级对数比率偏移:
| (8) |
相应的离策略风险是该偏移的方差:
| (9) |
发现 2:过度引导会放大离策略风险。如图 4 所示,平均对数比率偏移(蓝色)及其方差(红色)从互补角度描述了引导引起的分布偏移。随着引导水平的增加,离策略风险持续上升,这表明更强的引导会使引导式 rollout 在离策略优化中变得越来越不稳定。
受发现 2 的启发,我们采用最小干预原则:对于每个任务,使用能够恢复奖励的最小引导水平。该原则可视为近似最大化引导效用,其中障碍修复收益在奖励恢复后急剧增加,而离策略风险则随引导水平增长。在实践中,我们首先为每个任务收集一组无引导的 rollout,仅当整组 rollout 失败时才调用引导作为后备方案。在温和的单调性假设(更强的引导水平不会降低恢复概率)下,我们可以通过二分搜索高效地识别出最小的充分引导水平:
| (10) |
其中 是在引导下的 rollout, 是成功阈值。我们将由此产生的自适应引导记为 ,它使引导式 rollout 接近无引导分布,并为接下来研究的离策略优化提供支持。注意,在二元奖励下, 表现出阈值行为(在越过障碍前接近零,之后急剧跳升),而 则单调增长。因此,引导效用在最小成功水平附近达到峰值,使得公式 10 中的二分搜索成为近似最大化 的实用代理方法。
2.3.3 如何学习:离策略内化
动作引导仅在训练时可用。在推理时,智能体必须在无引导策略 下行动,因此从引导式 rollout 中提取的任何学习信号都必须被内化。由于引导策略与无引导策略共享参数,我们将引导样本视为相对于 的离策略数据,并优化混合目标函数
| (11) | ||||
其中表示算法1中的混合 rollout 收集过程,是基于组的优势值,而 token 级重要性比率会根据 rollout 来源进行调整:
| (12) |
对于无引导的 rollout,这是标准的重要性比率;对于有引导的 rollout,分母使用引导分布,将信用转移回无引导的目标。与之前包含比率塑形的离策略强化学习方法 [66, 42] 不同,我们保持优化目标不变,因为最小化干预限制了引导 rollout 与基础策略之间的偏移。
输入:策略,数据集,小批量大小,组大小,阈值,搜索预算,步数
对于从到执行
采样;;
对于每个执行
定义;
;
如果则
在预算下通过二分搜索;
如果存在则
;
;
;
计算上的优势值;通过更新;
3 实验
3.1 实验设置
评测基准。为了评估我们提出的 ActGuide-RL 在 LLM 智能体强化学习中的有效性,我们在搜索智能体场景下进行实验,该场景是无状态的,便于收集动作数据。我们的评测涵盖两类基准。第一类是领域内搜索智能体基准,包括四个代表性数据集:GAIA [39]、WebWalkerQA [63]、XBench [5] 和 BrowseComp-ZH (BC-ZH) [83],这些数据集涵盖不同难度级别、多种语言以及真实世界的多步推理场景。第二类是领域外基准,包括 GPQA [47]、TruthfulQA [34] 和 IFEval [82],用于评估模型在搜索智能体场景之外的领域外泛化能力。详细的强化学习和监督微调训练数据来源见附录 A。
基线方法。在相同的评估协议下,我们将 ActGuide-RL 与多个基线方法进行比较,包括基础模型 [40, 35, 51]、专门的搜索智能体训练模型 [29, 15, 31],以及使用相同骨干网络但不带动作引导的标准强化学习训练模型。对于强化学习基线,我们采用标准的 GRPO 目标函数进行 token 级策略优化,使用相同的训练数据但不包含动作引导。
实现细节。遵循通义千问-深度研究(Tongyi-DeepResearch)[54]的方法,我们为智能体配备了两个工具:网络搜索和网页访问,其模式(schema)已包含在系统提示词中。考虑到我们设置中有限的交互预算和上下文长度,我们直接使用工具的原始输出,而不使用单独的摘要模型。对于训练奖励和测试时评估,我们均采用通义千问-深度研究中的少样本、基于参考的二元大语言模型评判模板。完整的实现细节见附录B。
| 方法 | 通用AI助手 | WebWalkerQA | XBench | BC-ZH | ||||||
| 第1级 | 第2级 | 第3级 | 平均 | 简单 | 中等 | 困难 | 平均 | 平均 | 平均 | |
| 基础模型 | ||||||||||
| MiniMax-M2.1 | - | - | - | 64.3 | - | - | - | - | 68.0 | 66.6 |
| DeepSeek-V3.2 | - | - | - | 75.1 | - | - | - | - | 78.0 | 65.0 |
| GPT-5 High | - | - | - | 76.4 | - | - | - | - | 77.0 | 65.0 |
| 搜索智能体训练模型 | ||||||||||
| WebSailor-7B | - | - | - | 37.9 | - | - | - | - | 34.0 | 14.2 |
| ARPO-8B | 53.9 | 32.7 | 16.7 | 38.8 | 26.7 | 33.3 | 29.6 | 30.5 | 25.0 | - |
| WebThinker-32B-RL | 56.4 | 50.0 | 16.7 | 48.5 | 58.8 | 44.6 | 40.4 | 46.5 | 24.0 | 7.3 |
| 基线与ActGuide-RL | ||||||||||
| Qwen2.5-3B-Instruct | 15.38 | 7.69 | 0.00 | 9.71 | 5.00 | 7.14 | 4.58 | 5.73 | 8.00 | 2.08 |
| RL | 15.38 | 7.69 | 16.66 | 11.65 | 15.00 | 15.00 | 15.83 | 15.29 | 10.00 | 2.42 |
| \rowcolor[HTML]F5F5F5 ActGuide-RL | 28.21 | 11.54 | 16.66 | 18.45 | 18.75 | 16.07 | 22.08 | 18.82 | 16.00 | 4.50 |
| 差值 | +12.83 | +3.85 | +0.00 | +6.80 | +3.75 | +1.07 | +6.25 | +3.53 | +6.00 | +2.08 |
| Qwen2.5-7B-Instruct | 35.89 | 15.38 | 8.33 | 22.32 | 18.75 | 19.28 | 16.25 | 18.09 | 19.00 | 4.50 |
| RL | 20.51 | 7.69 | 0.00 | 11.65 | 14.37 | 20.35 | 19.58 | 18.67 | 22.00 | 4.84 |
| \rowcolor[HTML]F5F5F5 ActGuide-RL | 41.02 | 17.30 | 8.33 | 25.24 | 24.37 | 21.07 | 21.66 | 22.05 | 24.00 | 8.31 |
| 差值 | +20.51 | +9.61 | +8.33 | +13.59 | +10.00 | +0.72 | +2.08 | +3.38 | +2.00 | +3.47 |
| Qwen3-4B-Instruct | 17.94 | 17.30 | 0.00 | 15.53 | 8.75 | 3.57 | 0.83 | 3.82 | 14.00 | 7.96 |
| RL | 33.33 | 25.00 | 0.00 | 25.24 | 13.12 | 13.92 | 9.17 | 12.06 | 18.00 | 15.26 |
| \rowcolor[HTML]F5F5F5 ActGuide-RL | 46.15 | 32.69 | 16.66 | 35.92 | 43.75 | 41.78 | 35.00 | 39.85 | 37.00 | 20.41 |
| 差值 | +12.82 | +7.69 | +16.66 | +10.68 | +22.50 | +30.63 | +25.83 | +27.79 | +19.00 | +5.15 |
| Qwen3-8B | 43.58 | 26.92 | 16.66 | 32.03 | 41.87 | 31.78 | 26.25 | 32.20 | 32.00 | 23.52 |
| RL | 46.15 | 32.69 | 25.00 | 36.89 | 43.75 | 44.64 | 39.16 | 42.50 | 33.00 | 21.79 |
| \rowcolor[HTML]F5F5F5 ActGuide-RL | 51.28 | 36.53 | 33.33 | 41.74 | 50.00 | 46.79 | 44.58 | 46.77 | 44.00 | 26.64 |
| 差值 | +5.13 | +3.84 | +8.33 | +4.85 | +6.25 | +2.15 | +5.42 | +4.27 | +11.00 | +4.85 |
3.2 主要结果
整体对比。表 1 报告了在四个领域内基准测试上的整体准确率,从中可以得出三个显著观察结果。
- •
ActGuide-RL 缓解了领域内 RL 的能力回退。当 RL 训练数据的探索难度与基础模型不匹配时,局限于领域内探索的普通 RL 可能导致在某些基准测试上出现部分性能回退。例如,RL 降低了 Qwen2.5-7B-Instruct 在 GAIA 上的表现以及 Qwen3-8B 在 BC-ZH 上的表现,而 ActGuide-RL 则通过自适应引导和更有效的状态访问缓解了这些回退。
- •
ActGuide-RL 改进了超出当前可达区域的探索。当普通 RL 在较难任务上无法访问足够有效的状态时,动作引导有助于策略超越其当前可达区域,并实现更有效的状态访问。这一点在 Qwen3-4B-Instruct 上最为明显,ActGuide-RL 在所有四个基准测试上都带来了广泛提升,在 WebWalker () 和 XBench () 上的改进尤其显著。
- •
ActGuide-RL 在不同基础模型上均带来稳定提升。对于能力水平不同的基础模型,动作引导能够根据每个训练样本的难度,自适应地帮助策略访问更有效的状态。因此,与普通 RL 相比,ActGuide-RL 持续改进了所有四个基础模型,这凸显了动作引导在不同能力水平上的强大适应性。
与 SFT + RL 的对比。另一种常用于解决因策略探索受限导致的训练停滞的策略是定向 SFT 冷启动。为了进一步分析 ActGuide-RL 相对于 SFT + RL 范式的作用,我们还通过部分蒸馏通义千问-深度研究-30B-A3b 构建的 SFT 冷启动来初始化策略。该设置旨在通过动作级指导探索标准 SFT + RL 流程之外的新可能性,而不仅仅是追求在全面 SFT 基线之上的性能提升。如表 2 所示,即使没有任何冷启动,ActGuide-RL 也能达到与两阶段 SFT+RL 流程相当的性能。此外,当基于相同的冷启动初始化模型构建时,ActGuide-RL 仍能从动作指导中获得额外收益。同时,由于 SFT 的模式覆盖特性,冷启动初始化通常会降低域外性能,这在 GPQA-CoT(零样本)、TruthfulQA 和 IFEVAL 上表现为持续的性能下降,而这种下降在零 RL 设置的 ActGuide-RL 中并未出现。
总体而言,ActGuide-RL 为智能体强化学习提供了一种新的替代范式,通过使用更轻量级的动作数据,减轻了对大量 SFT 数据的依赖。
| 方法 | 域内 | 域外 | |||||
| GAIA | WebWalker | XBench | BC-ZH | GPQA-CoT (ZS) | TruthQA | IFEval | |
| 零 RL | 25.24 | 12.06 | 18.00 | 15.26 | 35.45 | 62.17 | 81.33 |
| \rowcolor[HTML]F5F5F5 ActGuide | 35.92 | 39.85 | 37.00 | 20.41 | 36.93 | 62.30 | 82.99 |
| SFT | 34.95 | 31.18 | 25.00 | 25.61 | 29.15 | 56.95 | 77.82 |
| RL | 36.89 | 32.20 | 17.00 | 26.30 | 29.85 | 57.02 | 76.34 |
| \rowcolor[HTML]F5F5F5 ActGuide | 40.77 | 37.06 | 25.00 | 28.02 | 29.57 | 57.11 | 77.43 |
3.3 进一步分析与消融实验
训练动态。为了进一步分析
为了分析动作引导对训练动态的影响,我们追踪了训练过程中能够提供有效学习信号的 rollout 组比例,如图 5 所示。具体而言,我们发现动作数据有助于策略在更高比例的样本中发现有效的训练信号,而无引导的基线方法则经常受到探索障碍的阻碍,因此将大量 rollout 浪费在无效的状态访问上。这表明 ActGuide-RL 能够将探索范围扩展到当前可达区域之外,使策略能够从区域外的任务中学习。
| 轮次预算 | GAIA | WebWalker | XBench | BC-ZH |
| 2 | 0.97 | 9.26 | 5.00 | 1.04 |
| 4 | 18.44 | 33.97 | 33.00 | 4.84 |
| 8 | 19.41 | 35.00 | 33.00 | 16.96 |
| 16 | 27.18 | 37.55 | 35.00 | 17.99 |
| 32 | 35.92 | 39.85 | 37.00 | 20.41 |
迈向复杂交互。无冷启动的智能体强化学习面临的一个核心挑战是,策略难以在其区域内的任务中习得复杂的交互技能。幸运的是,我们发现 ActGuide-RL 使得即使是像 Qwen3-4B-Instruct 这样的小模型,在没有任何冷启动初始化的情况下,也能逐步获得复杂的交互能力,这反映在图 6 中训练过程中交互轮次数量和生成 token 数量的稳步增长上。为了进一步验证这些增加的交互是否确实有效,我们在评估时改变了交互预算,并观察到在表 3 中,性能随着预算的增加而持续提升。
ActGuide-RL 的消融研究。我们
| 方法 | GAIA | WebWalker | XBench |
| ActGuide-RL | 35.92 | 39.85 | 37.00 |
| 最小干预(自适应) | 27.18 | 35.00 | 34.00 |
| 最小干预(回退) | 24.27 | 23.82 | 19.00 |
| 混合策略优化 | 22.32 | 21.76 | 21.00 |
我们对 ActGuide-RL 中几个关键设计选择进行了消融研究,包括自适应引导机制、回退引导机制以及混合策略优化。如表 4 所示,移除自适应引导机制或回退引导机制都会导致不同程度的性能下降。我们进一步在图 7 中比较了固定引导比例,并再次发现动态引导效果最佳。这些结果表明,动作引导的有效性并非简单地因为提供了更多引导,也不是越少越好。相反,最佳性能来自于根据策略能力以自适应方式最小化地引入引导。移除混合策略优化也会导致性能大幅下降,因为它破坏了将在引导下习得的行为迁移至测试时无引导能力的路径。
对动作噪声的敏感性。当考虑
| 噪声比例 | GAIA | WebWalker | XBench | BC-ZH |
| 0% | 35.92 | 39.85 | 37.00 | 20.41 |
| 10% | 39.81 | 39.26 | 38.00 | 19.03 |
| 20% | 29.12 | 37.94 | 35.00 | 17.64 |
考虑到扩大动作数据收集规模时,一个重要的因素是数据噪声,因为人类演示在完成某些任务时可能包含大量无意义或不相关的动作。这里我们通过在原始每个样本的动作轨迹中随机插入与任务无关的动作来模拟此类噪声,然后执行相同的 ActGuide-RL 训练。如表 5 所示,ActGuide-RL 对动作噪声并不过于敏感。它在 10% 的噪声比例下保持稳定的性能,而进一步增加到 20% 则会导致性能下降。
4 相关工作
4.1 智能体强化学习
强化学习领域的最新进展 [49, 74, 48, 7, 17] 使得能够与环境交互、做出序列决策并针对长期目标进行优化的智能体端到端训练成为可能。这使得智能体强化学习成为基础模型能力构建 [43, 1, 52, 53] 和特定领域智能体后训练 [28, 25, 73, 54, 8] 的关键范式。由于有效的智能体强化学习高度依赖基础模型来探索有效的训练信号,现有方法通常依赖于强化学习前的冷启动,或交替使用监督微调和强化学习来动态地将模型能力与目标任务对齐 [13, 44, 4, 6, 11]。一些研究则采用动态任务调度 [71, 20, 76] 或课程学习 [30, 26],以确保训练任务的难度与模型不断演进的能力良好匹配。与我们工作最相关的一系列研究,是从现有的监督微调数据中构建课程学习示例 [72, 59],或直接将这些数据作为提示,引导模型在困难任务上获取有意义的学习信号 [22, 42, 64]。与这些方法不同,ActGuide-RL 旨在利用更易获取的动作数据,从而提供更高的实用价值和更强的扩展潜力。
4.2 基于示范的强化学习
我们的工作也与基于演示的强化学习(RLfD)[41, 33]相关,其中演示通常以专家轨迹的形式呈现,在智能体场景中通常表现为完整的推理与行动轨迹。经典的RLfD方法通常利用演示轨迹在稀疏奖励场景中引导探索,例如将其保留在回放缓冲区中,并将强化学习更新与辅助模仿损失相结合[46, 21, 58]。遵循类似的思路,近期几项大语言模型研究将离策略专家轨迹纳入在线强化学习,以缓解稀疏奖励和困难探索的挑战[18, 32, 78, 37]。具体而言,LUFFY [67] 通过混合策略优化将离策略专家轨迹融入在线强化学习,利用正则化重要性调整来避免僵化模仿。Guide [42] 则利用自适应提示引导的离策略轨迹进行在线强化学习,通过重新加权这些轨迹来改善探索,同时训练一个在推理时不再依赖提示的策略。与这些基于演示的方法不同,本工作聚焦于从行动引导中学习智能体策略,采用最小干预的方式,使其能够适应不同难度的任务。
5 结论
我们提出了 ActGuide-RL 框架,该框架利用现成的行动数据作为计划式引导,帮助智能体强化学习突破基础策略可达区域之外的探索障碍。通过仅在必要时作为自适应后备方案引入引导,并联合优化引导式和无引导式轨迹,ActGuide-RL 在降低过度干预带来的离策略风险的同时,内化了探索收益。在搜索智能体基准测试中,这些设计选择相较于纯强化学习带来了持续的性能提升,并达到了与 SFT+RL 相当的表现,且无需监督式冷启动。进一步分析表明,这些性能提升伴随着更有效的多步交互,并且源于自适应、最小侵入性的引导,而非简单的更强干预。这些发现表明,可扩展的纯行动轨迹可以作为复杂智能体交互中一种实用的后训练信号,补充或部分替代成本高昂的监督式演示。
参考文献
- [1] Anthropic (2026) Claude Opus 4.6 模型卡。外部链接:Link 引用位置:§1, §4.1。
- [2] V. Barres, H. Dong, S. Ray, X. Si, 和 K. Narasimhan (2025) tau2 Bench:在双控环境中评估对话智能体。arXiv 预印本 arXiv:2506.07982。引用位置:§1。
- [3] M. Caccia, M. Thakkar, L. Boisvert, T. L. S. De Chezelles, A. Piché, N. Chapados, A. Drouin, M. Gasse, 和 A. Lacoste (2024) 微调网络智能体:有效,但比想象中更棘手。收录于 NeurIPS 2024 开放世界智能体研讨会。引用位置:§1。
- [4] H. Chen, H. Tu, F. Wang, H. Liu, X. Tang, X. Du, Y. Zhou, 和 C. Xie (2025) SFT 还是 RL?关于训练类 R1 推理型大型视觉语言模型的早期探究。arXiv 预印本 arXiv:2504.11468。引用位置:§4.1。
- [5] K. Chen, Y. Ren, Y. Liu, X. Hu, H. Tian, T. Xie, F. Liu, H. Zhang, H. Liu, Y. Gong, C. Sun, H. Hou, H. Yang, J. Pan, J. Lou, J. Mao, J. Liu, J. Li, K. Liu, K. Liu, R. Wang, R. Li, T. Niu, W. Zhang, W. Yan, X. Wang, Y. Zhang, Y. Hung, Y. Jiang, Z. Liu, Z. Yin, Z. Ma, 和 Z. Mo (2025-06) Xbench:通过贴合职业的真实世界评估追踪智能体生产力扩展。arXiv。注释:arXiv:2506.13651 [cs] 外部链接:Link, Document 引用位置:第3项, §3.1。
- [6] L. Chen, X. Han, L. Shen, J. Bai, 和 K. Wong (2025) 超越两阶段训练:面向大语言模型推理的协同 SFT 与 RL。arXiv 预印本 arXiv:2509.06948。引用位置:§4.1。
- [7] X. Chu, H. Huang, X. Zhang, F. Wei, 和 Y. Wang (2026) GPG:一个简单且强大的模型推理强化学习基线。收录于第十四届国际学习表征会议。外部链接:Link 引用位置:§2.2, §4.1。
- [8] Z. Chu, X. Wang, J. Hong, H. Fan, Y. Huang, Y. Yang, G. Xu, C. Zhao, C. Xiang, S. Hu, 等 (2026) Redsearcher:一个可扩展且经济高效的长周期搜索智能体框架。arXiv 预印本 arXiv:2602.14234。引用位置:§4.1。
- [9] Y. Dai, Y. Ji, X. Zhang, Y. Wang, X. Chu, 和 Z. Lu (2026) 越难越好:通过难度感知的 GRPO 和多方面问题重构提升数学推理能力。收录于第十四届国际学习表征会议。外部链接:Link 引用位置:§1。
- [10] X. Deng, Y. Gu, B. Zheng, S. Chen, S. Stevens, B. Wang, H. Sun, 和 Y. Su (2023) 《Mind2web:迈向通用型网络智能体》。收录于《神经信息处理系统进展》第36卷,第28091–28114页。引用于:§1。
- [11] Y. Deng, H. Bansal, F. Yin, N. Peng, W. Wang, 和 K. Chang (2025) 《OpenVLThinker:通过迭代式SFT-RL循环实现复杂视觉-语言推理》。arXiv预印本,编号2503.17352。引用于:§4.1。
- [12] S. Ding, X. Dai, L. Xing, S. Ding, Z. Liu, J. Yang, P. Yang, Z. Zhang, X. Wei, Y. Ma, H. Duan, J. Shao, J. Wang, D. Lin, K. Chen, 和 Y. Zang (2026) 《WildClawBench》。注释:https://github.com/InternLM/WildClawBench GitHub仓库。引用于:§1。
- [13] G. Dong, Y. Chen, X. Li, J. Jin, H. Qian, Y. Zhu, H. Mao, G. Zhou, Z. Dou, 和 J. Wen (2025) 《Tool-Star:通过强化学习赋能大语言模型驱动的多工具推理器》。arXiv预印本,编号2505.16410。引用于:§1, §4.1。
- [14] G. Dong, J. Lu, J. Huang, W. Zhong, L. Liu, S. Huang, Z. Li, Y. Zhao, X. Song, X. Li, 等 (2026) 《Agent-World:扩展真实世界环境合成以演化通用智能体智能》。arXiv预印本,编号2604.18292。引用于:§1。
- [15] G. Dong, H. Mao, K. Ma, L. Bao, Y. Chen, Z. Wang, Z. Chen, J. Du, H. Wang, F. Zhang, G. Zhou, Y. Zhu, J. Wen, 和 Z. Dou (2025年7月) 《智能体强化策略优化》。arXiv。注释:arXiv:2507.19849 [cs] 外部链接:链接,文档。引用于:§3.1。
- [16] L. E. Erdogan, N. Lee, S. Kim, S. Moon, H. Furuta, G. Anumanchipalli, K. Keutzer, 和 A. Gholami (2025) 《规划与行动:改进智能体在长周期任务中的规划能力》。arXiv预印本,编号2503.09572。引用于:§1。
- [17] L. Feng, Z. Xue, T. Liu, 和 B. An (2025年5月) 《组内分组策略优化用于大语言模型智能体训练》。arXiv。注释:arXiv:2505.10978 [cs] 外部链接:链接,文档。引用于:§4.1。
- [18] Y. Fu, T. Chen, J. Chai, X. Wang, S. Tu, G. Yin, W. Lin, Q. Zhang, Y. Zhu, 和 D. Zhao (2025) 《SRFT:一种结合监督微调与强化微调的单阶段推理方法》。arXiv预印本,编号2506.19767。引用于:§4.2。
- [19] J. Gao, W. Fu, M. Xie, S. Xu, C. He, Z. Mei, B. Zhu, 和 Y. Wu (2025) 《超越十轮对话:利用大规模异步强化学习解锁长周期智能体搜索》。外部链接:2508.07976,链接,被 §A.1 引用。
- [20] Z. Gu, J. Light, R. Astudillo, Z. Ye, L. He, H. P. Zou, W. Cheng, S. Paternain, P. S. Yu, 和 Y. Yue (2026) 《演员-策展人:通过策略改进多臂赌博机实现强化学习后训练的协同自适应课程学习》。arXiv 预印本 arXiv:2602.20532。被 §4.1 引用。
- [21] T. Hester, M. Vecerik, O. Pietquin, M. Lanctot, T. Schaul, B. Piot, D. Horgan, J. Quan, A. Sendonaris, I. Osband 等 (2018) 《基于演示的深度 Q 学习》。载于《AAAI 人工智能会议论文集》,第 32 卷。被 §4.2 引用。
- [22] Q. Huang, W. Dai, J. Liu, W. He, H. Jiang, M. Song, J. Chen, C. Yao, 和 J. Song (2025) 《利用文本去偏 Hint-GRPO 提升多模态大语言模型推理能力》。载于《IEEE/CVF 国际计算机视觉会议论文集》,第 4848–4857 页。被 §1、§4.1 引用。
- [23] J. Hübotter, F. Lübeck, L. Behric, A. Baumann, M. Bagatella, D. Marta, I. Hakimi, I. Shenfeld, T. K. Buening, C. Guestrin 等 (2026) 《通过自知识蒸馏进行强化学习》。arXiv 预印本 arXiv:2601.20802。被附录 B 引用。
- [24] Y. Ji, Z. Ma, Y. Wang, G. Chen, X. Chu, 和 L. Wu (2026) 《面向大语言模型智能体强化学习的树搜索》。载于《第十四届国际学习表征会议》,外部链接:链接,被 §1 引用。
- [25] Y. Ji, Y. Wang, Z. Ma, Y. Hu, H. Huang, X. Hu, G. Chen, L. Wu, 和 X. Chu (2026) 《借助地图思考:用于地理定位的强化并行地图增强智能体》。ACL。被 §1、§4.1 引用。
- [26] G. Jiang, W. Feng, G. Quan, C. Hao, Y. Zhang, G. Liu, 和 H. Wang (2025) 《VCRL:面向大语言模型的基于方差的课程强化学习》。arXiv 预印本 arXiv:2509.19803。被 §4.1 引用。
- [27] C. E. Jimenez, J. Yang, A. Wettig, S. Yao, K. Pei, O. Press, 和 K. Narasimhan (2023) 《SWE-bench:语言模型能否解决真实世界的 GitHub 问题?》。arXiv 预印本 arXiv:2310.06770。被 §1、§1 引用。
- [28] B. Jin, H. Zeng, Z. Yue, J. Yoon, S. Arik, D. Wang, H. Zamani, 和 J. Han (2025-04) 《Search-R1:利用强化学习训练大语言模型进行推理并运用搜索引擎》。arXiv。注:arXiv:2503.09516 [cs] 外部链接:链接,文档 被引用:§4.1。
- [29] K. Li, Z. Zhang, H. Yin, L. Zhang, L. Ou, J. Wu, W. Yin, B. Li, Z. Tao, X. Wang, W. Shen, J. Zhang, D. Zhang, X. Wu, Y. Jiang, M. Yan, P. Xie, F. Huang, 和 J. Zhou (2025-07) 《WebSailor:驾驭网络智能体的超人类推理》。arXiv。注:arXiv:2507.02592 [cs] 外部链接:链接,文档 被引用:§1, §3.1。
- [30] R. Li, H. Huang, F. Wei, F. Xiong, Y. Wang, 和 X. Chu (2026) 《Adacurl:结合无效样本缓解与历史回溯的自适应课程强化学习》。载于《AAAI人工智能会议论文集》,第40卷,第23123–23131页。被引用:§4.1。
- [31] X. Li, J. Jin, G. Dong, H. Qian, Y. Zhu, Y. Wu, J. Wen, 和 Z. Dou (2025-04) 《WebThinker:赋予大型推理模型深度研究能力》。arXiv。注:arXiv:2504.21776 [cs] 外部链接:链接,文档 被引用:§3.1。
- [32] J. Liang, H. Tang, Y. Ma, J. Liu, Y. Zheng, S. Hu, L. Bai, 和 J. Hao (2025) 《拧干浸透的海绵:面向大语言模型的高效离策略强化微调》。arXiv预印本 arXiv:2507.06892。被引用:§4.2。
- [33] G. Libardi, G. De Fabritiis, 和 S. Dittert (2021) 《使用单条演示通过近端策略优化进行引导式探索》。载于《国际机器学习大会》,第6611–6620页。被引用:§4.2。
- [34] S. Lin, J. Hilton, 和 O. Evans (2022) 《TruthfulQA:衡量模型如何模仿人类错误信息》。载于《第60届计算语言学协会年会论文集(第1卷:长论文)》,第3214–3252页。被引用:第2项, §3.1。
- [35] A. Liu, B. Feng, B. Xue, B. Wang, B. Wu, C. Lu, C. Zhao, C. Deng, C. Zhang, C. Ruan, 等 (2024) 《DeepSeek-V3技术报告》。arXiv预印本 arXiv:2412.19437。被引用:§3.1。
- [36] J. Luo, W. Zhang, Y. Yuan, Y. Zhao, J. Yang, Y. Gu, B. Wu, B. Chen, Z. Qiao, Q. Long 等 (2025) 大语言模型智能体:方法、应用与挑战综述。arXiv 预印本 arXiv:2503.21460。引用自:§1。
- [37] L. Ma, H. Liang, M. Qiang, L. Tang, X. Ma, Z. H. Wong, J. Niu, C. Shen, R. He, Y. Li 等 (2025) 学习强化学习无法做到的事:针对最难问题的交错式在线微调。arXiv 预印本 arXiv:2506.07527。引用自:§4.2。
- [38] Z. Ma, S. Yang, Y. Ji, X. Wang, Y. Wang, Y. Hu, T. Huang 和 X. Chu (2026) SkillClaw:让技能随智能体进化器共同进化。arXiv 预印本 arXiv:2604.08377。引用自:§1。
- [39] G. Mialon, C. Fourrier, C. Swift, T. Wolf, Y. LeCun 和 T. Scialom (2023-11) GAIA:通用 AI 助手基准。arXiv。注释:arXiv:2311.12983 [cs]。外部链接:链接,文档。引用自:第 1 项,§3.1。
- [40] MiniMax (2025) MiniMax m2.1 系统卡(网站)MiniMax。外部链接:链接。引用自:§3.1。
- [41] A. Nair, B. McGrew, M. Andrychowicz, W. Zaremba 和 P. Abbeel (2018) 利用演示克服强化学习中的探索问题。载于 2018 年 IEEE 国际机器人与自动化大会 (ICRA),第 6292–6299 页。引用自:§4.2。
- [42] V. Nath, E. Lau, A. Gunjal, M. Sharma, N. Baharte 和 S. Hendryx (2025) 自适应引导加速推理模型的强化学习。arXiv 预印本 arXiv:2506.13923。引用自:§2.3.3,§4.1,§4.2。
- [43] OpenAI (2025) GPT-5.4 思考系统卡(网站)OpenAI 部署安全。外部链接:链接。引用自:§1,§4.1。
- [44] R. Y. Pang, W. Yuan, K. Cho, H. He, S. Sukhbaatar 和 J. Weston (2024) 迭代推理偏好优化。Advances in Neural Information Processing Systems 37,第 116617–116637 页。引用自:§4.1。
- [45] Y. Qin, Y. Ye, J. Fang, H. Wang, S. Liang, S. Tian, J. Zhang, J. Li, Y. Li, S. Huang 等 (2025) Ui-tars:开创基于原生智能体的自动化 GUI 交互。arXiv 预印本 arXiv:2501.12326。引用自:§1。
- [46] A. Rajeswaran, V. Kumar, A. Gupta, G. Vezzani, J. Schulman, E. Todorov, 和 S. Levine (2017) 通过深度强化学习与示范学习复杂灵巧操作。arXiv 预印本 arXiv:1709.10087。引用自:§4.2。
- [47] D. Rein, B. L. Hou, A. C. Stickland, J. Petty, R. Y. Pang, J. Dirani, J. Michael, 和 S. R. Bowman (2023) GPQA:一个研究生级别的防谷歌问答基准。arXiv 预印本 arXiv:2311.12022。引用自:第1项,§3.1。
- [48] J. Schulman, F. Wolski, P. Dhariwal, A. Radford, 和 O. Klimov (2017) 近端策略优化算法。arXiv 预印本 arXiv:1707.06347。引用自:§4.1。
- [49] Z. Shao, P. Wang, Q. Zhu, R. Xu, J. Song, X. Bi, H. Zhang, M. Zhang, Y. K. Li, Y. Wu, 和 D. Guo (2024-04) DeepSeekMath:突破开放语言模型数学推理的极限。arXiv (英文)。注释:arXiv:2402.03300 [cs] 外部链接:链接,文献引用 引用自:§2.2,§4.1。
- [50] I. Shenfeld, M. Damani, J. Hübotter, 和 P. Agrawal (2026-01) 自我知识蒸馏实现持续学习。arXiv。注释:arXiv:2601.19897 [cs] 外部链接:链接,文献引用 引用自:附录 B。
- [51] A. Singh, A. Fry, A. Perelman, A. Tart, A. Ganesh, A. El-Kishky, A. McLaughlin, A. Low, A. Ostrow, A. Ananthram, 等人 (2025) OpenAI GPT-5 系统卡。arXiv 预印本 arXiv:2601.03267。引用自:§3.1。
- [52] K. Team, T. Bai, Y. Bai, Y. Bao, S. Cai, Y. Cao, Y. Charles, H. Che, C. Chen, G. Chen, 等人 (2026) Kimi K2.5:视觉智能体智能。arXiv 预印本 arXiv:2602.02276。引用自:§1,§4.1。
- [53] Q. Team (2026-02) Qwen3.5:通过原生多模态智能体加速生产力。外部链接:链接 引用自:§4.1。
- [54] T. D. Team, B. Li, B. Zhang, D. Zhang, F. Huang, G. Li, G. Chen, H. Yin, J. Wu, J. Zhou, 等人 (2025) 通义深度研究技术报告。arXiv 预印本 arXiv:2510.24701。引用自:§3.1,§4.1。
- [55] T. D. Team, B. Li, B. Zhang, D. Zhang, F. Huang, G. Li, G. Chen, H. Yin, J. Wu, J. Zhou, 等人 (2025) 通义深度研究技术报告。arXiv 预印本 arXiv:2510.24701。引用自:§A.1。
- [56] M. Turpin, J. Michael, E. Perez, 和 S. Bowman (2023) 语言模型并不总是说出真实想法:思维链提示中的不忠实解释。《神经信息处理系统进展》第36卷,第74952–74965页。引用于:§1。
- [57] H. Van Hasselt, Y. Doron, F. Strub, M. Hessel, N. Sonnerat, 和 J. Modayil (2018) 深度强化学习与致命三角。arXiv预印本 arXiv:1812.02648。引用于:§2.3.2。
- [58] M. Vecerik, T. Hester, J. Scholz, F. Wang, O. Pietquin, B. Piot, N. Heess, T. Rothörl, T. Lampe, 和 M. Riedmiller (2017) 利用演示在稀疏奖励的机器人问题上进行深度强化学习。arXiv预印本 arXiv:1707.08817。引用于:§4.2。
- [59] W. Wang, X. Xu, W. An, F. Dai, W. Gao, Y. He, J. Huang, Q. Ji, H. Jin, X. Li, 等 (2025) 随它流动:在摇滚乐中构建智能体,于开放智能体学习生态中打造罗马模型。arXiv预印本 arXiv:2512.24873。引用于:§4.1。
- [60] Y. Wang, X. Chen, X. Jin, M. Wang, 和 L. Yang (2026) OpenClaw-RL:只需对话即可训练任意智能体。arXiv预印本 arXiv:2603.10165。引用于:§1。
- [61] Z. Wang, K. Wang, Q. Wang, P. Zhang, L. Li, Z. Yang, X. Jin, K. Yu, M. N. Nguyen, L. Liu, E. Gottlieb, Y. Lu, K. Cho, J. Wu, L. Fei-Fei, L. Wang, Y. Choi, 和 M. Li (2025-05) RAGEN:通过多轮强化学习理解大语言模型智能体的自我进化。arXiv。注:arXiv:2504.20073 [cs] 外部链接:链接,文档 引用于:§1。
- [62] T. Wei, T. Li, Z. Liu, X. Ning, Z. Yang, J. Zou, Z. Zeng, R. Qiu, X. Lin, D. Fu, 等 (2026) 大语言模型的智能体推理。arXiv预印本 arXiv:2601.12538。引用于:§1。
- [63] J. Wu, W. Yin, Y. Jiang, Z. Wang, Z. Xi, R. Fang, L. Zhang, Y. He, D. Zhou, P. Xie, 和 F. Huang (2025-08) WebWalker:大语言模型网页遍历能力基准测试。arXiv。注:arXiv:2501.07572 [cs] 外部链接:链接,文档 引用于:第2项,§3.1。
- [64] Y. Wu, S. Li, Z. Wen, X. Zhou, A. Talwalkar, Y. Yang, W. Huang, 和 T. Cai (2026) 在强化学习中借助参考引导微调攻克难题。arXiv预印本 arXiv:2603.01223。引用于:§1,§4.1。
- [65] T. Xie, D. Zhang, J. Chen, X. Li, S. Zhao, R. Cao, T. J. Hua, Z. Cheng, D. Shin, F. Lei, Y. Liu, Y. Xu, S. Zhou, S. Savarese, C. Xiong, V. Zhong, 和 T. Yu (2024) 《OSWorld:在真实计算机环境中对多模态智能体进行开放式任务基准测试》。外部链接:2404.07972 被引用:§1。
- [66] J. Yan, Y. Li, Z. Hu, Z. Wang, G. Cui, X. Qu, Y. Cheng, 和 Y. Zhang (2025-06) 《在离线策略引导下学习推理》。arXiv (en-US)。注释:arXiv:2504.14945 [cs] 外部链接:Link, Document 被引用:§2.3.3。
- [67] J. Yan, Y. Li, Z. Hu, Z. Wang, G. Cui, X. Qu, Y. Cheng, 和 Y. Zhang (2025) 《在离线策略引导下学习推理》。arXiv 预印本 arXiv:2504.14945。被引用:§4.2。
- [68] R. Yang, Q. Wu, Z. Wang, H. Chen, K. Yang, H. Cheng, H. Yao, B. Peng, H. Zhang, J. Gao, 等 (2026) 《GUI-libra:利用动作感知监督和部分可验证强化学习训练原生 GUI 智能体进行推理与行动》。arXiv 预印本 arXiv:2602.22190。被引用:§1。
- [69] S. Yao, N. Shinn, P. Razavi, 和 K. Narasimhan (2024) 《tau bench:真实世界领域中工具-智能体-用户交互的基准测试》。arXiv 预印本 arXiv:2406.12045。被引用:§1。
- [70] S. Yao, J. Zhao, D. Yu, N. Du, I. Shafran, K. R. Narasimhan, 和 Y. Cao (2022) 《React:协同语言模型中的推理与行动》。第十一届国际学习表征会议。被引用:§1。
- [71] Z. Yao, Y. Zhang, Y. Chen, Y. Sun, Z. Xu, Y. Yang, T. Hu, Q. Gu, H. Su, 和 X. Cai (2026) 《CoBA-rl:面向大语言模型强化学习的能力导向预算分配》。arXiv 预印本 arXiv:2602.03048。被引用:§4.1。
- [72] J. Yi, D. Mosk-Aoyama, B. Huang, R. Gala, C. Wang, S. D. Devare, K. Bhardwaj, A. Gupta, O. Kuchaiev, J. Jiao, 等 (2026) 《PivotRL:以低计算成本实现高精度智能体后训练》。arXiv 预印本 arXiv:2603.21383。被引用:§4.1。
- [73] A. Yu, L. Yao, J. Liu, Z. Chen, J. Yin, Y. Wang, X. Liao, Z. Ye, J. Li, Y. Yue, 等 (2025) 《Medresearcher-r1:通过知识引导的轨迹合成框架实现专家级医学深度研究》。arXiv 预印本 arXiv:2508.14880。被引用:§4.1。
- [74] Q. Yu, Z. Zhang, R. Zhu, Y. Yuan, X. Zuo, Y. Yue, W. Dai, T. Fan, G. Liu, L. Liu, X. Liu, H. Lin, Z. Lin, B. Ma, G. Sheng, Y. Tong, C. Zhang, M. Zhang, W. Zhang, H. Zhu, J. Zhu, J. Chen, J. Chen, C. Wang, H. Yu, Y. Song, X. Wei, H. Zhou, J. Liu, W. Ma, Y. Zhang, L. Yan, M. Qiao, Y. Wu, and M. Wang (2025-05) DAPO:一个大规模开源大语言模型强化学习系统。arXiv。注:arXiv:2503.14476 [cs] 外部链接:Link, Document 被引用:§2.2, §4.1。
- [75] Y. Yue, Z. Chen, R. Lu, A. Zhao, Z. Wang, Y. Yue, S. Song, and G. Huang (2025-05) 强化学习是否真的能激励大语言模型超越基础模型的推理能力?arXiv。注:arXiv:2504.13837 [cs] 外部链接:Link, Document 被引用:§1。
- [76] Y. Zhai, S. Tao, C. Chen, A. Zou, Z. Chen, Q. Fu, S. Mai, L. Yu, J. Deng, Z. Cao, 等 (2025) Agentevolver:迈向高效自演化智能体系统。arXiv 预印本 arXiv:2511.10395。被引用:§4.1。
- [77] G. Zhang, H. Geng, X. Yu, Z. Yin, Z. Zhang, Z. Tan, H. Zhou, Z. Li, X. Xue, Y. Li, 等 (2025) 面向大语言模型的智能体强化学习全景:综述。arXiv 预印本 arXiv:2509.02547。被引用:§1。
- [78] W. Zhang, Y. Xie, Y. Sun, Y. Chen, G. Wang, Y. Li, B. Ding, and J. Zhou (2026) 在策略强化学习遇上离策略专家:通过动态加权协调监督微调与强化学习。arXiv 预印本 arXiv:2508.11408。被引用:§4.2。
- [79] S. Zhao, Z. Xie, M. Liu, J. Huang, G. Pang, F. Chen, and A. Grover (2026) 自蒸馏推理器:面向大语言模型的在策略自蒸馏。arXiv 预印本 arXiv:2601.18734。被引用:附录 B。
- [80] H. Zheng, J. Zhao, and B. Chen (2025) 崩溃前的繁荣:离策略强化学习在陈旧大语言模型数据上能走多远?arXiv 预印本 arXiv:2510.01161。被引用:§2.3.2。
- [81] Y. Zheng, L. Zhong, Y. Wang, R. Dai, K. Liu, X. Chu, L. Lv, P. Torr, and K. Q. Lin (2026) Code2world:通过可渲染代码生成的图形用户界面世界模型。arXiv 预印本 arXiv:2602.09856。被引用:§1。
- [82] J. Zhou, T. Lu, S. Mishra, S. Brahma, S. Basu, Y. Luan, D. Zhou, 和 L. Hou (2023) 大语言模型的指令遵循评估。arXiv 预印本 arXiv:2311.07911。引用自:第 3 项,§3.1。
- [83] P. Zhou, B. Leon, X. Ying, C. Zhang, Y. Shao, Q. Ye, D. Chong, Z. Jin, C. Xie, M. Cao, 等人 (2025) Browsecomp-zh:大语言模型中文网页浏览能力基准测试。arXiv 预印本 arXiv:2504.19314。引用自:第 4 项,§3.1。
附录
附录 A 数据集
A.1 训练
我们采用了来自 ASearcher [19] 的搜索智能体强化学习训练数据。具体来说,我们采样了 2000 个实例,用于我们所有实验设置中的强化学习训练。
此外,为了获取动作数据,我们利用通义-DeepResearch-30B-A3B [55] 作为专家模型进行拒绝采样。与我们的实验设置一致,我们将工具集限制为仅两种工具类型:网页搜索和网页访问。我们收集了专家模型生成的正确轨迹,并从中专门提取了原子化的单步操作(即工具调用名称及其对应参数),作为每个样本实例的候选完整动作引导轨迹。强化学习训练数据的动作轮次统计信息如图 8 所示。
对于 SFT 数据,我们以类似方式从 ASearcher 数据集中采样了另一个不相交的子集。我们还使用了通义-DeepResearch-30B-A3B 进行拒绝采样,生成了 4000 条完整的搜索智能体轨迹。与动作数据不同,SFT 数据本身保留了轨迹的完整要素,强调保留完整的思维链推理、明确的工具调用以及相应的工具响应。
A.2 评估
为了全面评估我们提出的搜索智能体在复杂推理和深度搜索方面的能力,我们采用了多个标准且具有挑战性的深度搜索基准测试。所用数据集的详细信息如下所述:
- •
GAIA [39] 是一个具有挑战性的通用 AI 智能体基准测试,包含需要深度推理和网页浏览的现实世界问题。遵循先前的研究,我们使用一个包含 103 个纯文本问题的子集来测试我们系统的基础能力。
- •
WebWalkerQA [63] 评估大语言模型在复杂网页遍历和信息收集方面的能力。它包含 680 个问答任务,要求智能体系统地遍历多个动态网页,通过多跳推理发现多层信息。
- •
XBench [5] 专门评估 AI 智能体的深度搜索能力。它包含 100 个问题,并在真实世界场景中动态评估高阶信息检索和工具使用能力,同时考虑搜索广度和推理深度。
- •
BrowseComp-ZH [83] 是一个复杂的基准测试,用于衡量中文互联网生态系统内的网页浏览和推理能力。它包含 289 个原生的、多跳检索问题,这些问题经过主要搜索引擎的严格交叉验证,以测试复杂的多步推理。
为了进一步评估搜索智能体场景之外的领域外泛化能力,我们还在三个通用基准测试上进行了评估:
- •
GPQA [47] 是一个研究生级别的、防谷歌搜索的问答基准测试,涵盖困难的科学领域。我们将其用作搜索智能体场景之外的领域外推理基准测试。
- •
TruthfulQA [34] 评估语言模型是否生成真实答案,而非模仿常见的误解,提供了事实稳健性的领域外测试。
- •
IFEval [82] 通过可验证的约束来衡量指令遵循能力,作为通用对齐和可控性的领域外基准测试。
附录 B 实验细节
实现细节。我们的实现基于 VeRL 构建。所有实验超参数设置列于表 6。在引导式 rollout 过程中,我们将动作数据注入查询提示词中,作为计划式的参考指导,使得策略能够遵循部分动作轨迹,同时自行完成任何缺失的步骤。确切的提示词格式如模板 8 所示。
| 配置 | 设置 |
| 优化器 | AdamW |
| 学习率 | 1e-6 |
| KL 系数 | 0.001 |
| 训练数据 | 2,000 |
| 总训练步数 | 64 |
| 训练批次大小 | 32 |
| PPO 小批次大小 | 16 |
| 分组大小 | 8 |
| 最大回复长度 | 40,960 |
| 最大观测长度 | 8,000 |
| 最大轮次 | 30 |
| 0.2 | |
| 0.2 |
计算资源。
所有训练和推理实验均在配备 8 块 NVIDIA H20 GPU 的节点上进行。用于奖励分配和测试时评估的 LLM 裁判需要额外的服务资源,为此我们使用了另一个配备 8 块 NVIDIA H20 GPU 的独立节点。
不同的引导方法。
我们还比较了为基于 LLM 的智能体注入动作引导的不同方式。除了无引导设置外,我们考虑了一种遵循先前基于提示方法的助手前缀格式,其中动作参考作为生成的前缀被预置,模型在此基础上继续生成。我们还考虑了一种用户-助手消息格式,其中动作数据被转换为相应的工具调用和工具响应,然后在模型继续生成之前组装成多轮消息。如表
所示,将动作轨迹作为参考计划插入查询提示词中取得了最佳的 Reward@1,这表明轻量级的计划式引导对于 LLM 智能体而言,比直接添加前缀或重放动作更为有效。
用于在线策略自蒸馏的动作数据。
除了使用动作数据引导策略以更好地访问状态之外,我们还探索了它是否可以用于在线策略自蒸馏(OPSD)
。具体来说,OPSD 仍然从无引导策略中采样轨迹,但使用以动作为条件的引导 logits 作为这些在线策略 rollout 上的蒸馏目标。形式上,对于一个无引导的 rollout ,我们使用同一模型在额外以动作引导 为条件的情况下重新评估每个已访问的前缀,并优化
| (13) |
其中 表示停止梯度,因此引导分布仅作为 token 级别的教师,而学习到的策略在推理时保持无引导。如表所示
然而,OPSD 可以提升模型性能,但提升幅度仍然有限,因为被访问的状态仍然由基础的无引导策略决定。因此,当智能体无法自行到达有用状态时,它并不能从根本上解决无效状态访问问题。
| 引导使用 | GAIA | WebWalker | XBench |
| ActGuide-RL | 35.92 | 39.85 | 37.00 |
| OPSD | 36.89 | 30.29 | 26.00 |
附录 C 理论分析
C.1 Token 级离策略风险的协方差形式
在第 2.3.2 节中,令 为生成的 token 序列。我们定义在引导水平 下的 token 级重要性比率为
| (14) |
以及相应的累积对数比率偏移为
| (15) |
离策略风险则定义为
| (16) |
通过方差展开,我们有
| (17) |
因此,
| (18) |
其中第二个求和遍历 rollout 中所有不同的 token 对。
这一分解表明,离策略风险由两个部分组成:(1) token 级方差项,它捕捉每个生成步骤的局部分布不匹配;(2) token 间协方差项,它捕捉这些不匹配沿自回归轨迹的依赖结构。因此,更强的引导不仅可能增加 token 级偏差的幅度,还可能增加它们在 rollout 中的相关性,这两者都会导致更大的内化风险。
特别地,如果 token 级对数比率偏移是独立的,那么所有协方差项都将消失,并且 将简化为 token 级方差之和。然而,在自回归智能体生成中,token 依赖关系是内在的,协方差项通常不可忽略。这促使我们使用累积对数比率偏移的方差作为离策略风险的一个紧凑度量。
C.2 最小干预的风险约束视角
我们将第 2.3.2 节中的最小干预规则形式化为一个风险约束的选择问题。对于引导水平 ,定义群体恢复概率
| (19) |
其中 是 rollout 群体大小, 是成功阈值。给定目标恢复水平 ,最小风险充分引导水平是以下问题的解
| (20) |
假设 C.1(单调恢复与风险)。
有序引导族满足:
| (21) |
命题 C.1(最小充分引导在风险上是最优的)。
在假设 C.1 下,如果公式 20 的可行集非空,那么
| (22) |
是公式 20 的一个最优解。
证明。
根据定义, 是可行的。对于任何其他可行水平 , 的最小性意味着 。由于 关于 是非递减的,我们有 。因此,没有其他可行引导水平具有比 更小的离策略风险。∎
该命题给出了公式 10 的一个带约束的解释:最小干预并非最大化引导强度,而是选择满足恢复要求的最低风险水平。当 无法精确获知时,可以通过重复的 rollout 分组来估计。设 为水平 下独立分组恢复指标的经验均值。
推论 C.1(存在间隔条件下的经验识别)。
假设假设 C.1 成立,并且存在一个间隔 使得
| (23) |
如果
| (24) |
那么以至少 的概率,经验规则
| (25) |
能够恢复 。
证明。
根据 Hoeffding 不等式以及对所有水平取联合界,
| (26) |
在互补事件上,每个 都有 ,而每个 都有 。因此,经验最小可行水平等于 。∎
附录 D ActGuide-RL 的训练案例
我们展示具有代表性的训练案例,以说明 ActGuide-RL 如何将动作数据作为计划式引导注入。每个案例都使用完整的引导水平 ,其中提示词包含完整的可用参考动作轨迹,同时仍然要求策略进行推理并使用工具完成任务。
附录 E 局限性
由于实验设置相对简单、获取不同难度任务查询的便利性以及动作数据的自然可得性,我们的主要实验是在搜索智能体设置中进行的。该设置为研究可达性障碍和引导引发的离策略风险提供了一个受控的测试平台。尽管如此,ActGuide-RL 是为通用智能体训练而设计的,并非专门针对搜索智能体,其在其他智能体任务(如 CLI、GUI、基于 API 以及具身环境)中的有效性仍有待进一步探索。
本研究通过计划式引导的方式利用动作数据,将参考动作作为高层级动作计划注入,以帮助策略跨越探索障碍。这种简洁的设定使得方法保持轻量化、广泛适用,且不依赖昂贵的推理轨迹。更细粒度的动作数据使用方式,例如步骤级引导注入,仍有待进一步探索。
本研究聚焦于如何在智能体强化学习中利用动作数据,但未讨论如何系统性地收集和处理此类数据。在实践中,对现有交互记录(例如来自不同智能体应用的后端日志)进行结构化收集、清洗和过滤,对于基于动作数据的训练同样重要,且值得进一步探索。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org