跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-05-12精选AI 评分70

Learning to Explore: 通过探索感知策略优化扩展智能体推理能力

Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization

AI 导读

研究提出了一种探索感知的强化学习框架,使LLM智能体能够在不确定性高时才进行自适应探索。该方法通过变分推理设计了细粒度奖励函数,评估探索性行动对改善未来决策的潜力,并引入探索感知分组机制,在优化过程中将探索行动与任务完成行动分离。实验表明,该方法在一系列基于文本和GUI的智能体基准测试中取得了持续的性能提升。相关代码与模型已在GitHub和HuggingFace平台开源。

推荐理由

让 Agent 拥有了「感知自己不知道什么」的能力,只在信息不足时才探索,而不是盲目试错,是 Agent 训练方法的一个重要转向,做强化学习或 Agent 的值得认真看下。

正文 · AI 翻译

近期在智能体测试时扩展方面的进展,使得模型能够在执行最终动作之前收集环境反馈。现有方法的一个关键局限在于,它们通常采用无差别的探索策略,缺乏自适应判断何时真正需要探索的能力。在本文中,我们提出了一种探索感知的强化学习框架,使大语言模型智能体能够仅在不确定性较高时进行自适应探索。我们的方法通过变分推理引入了一种细粒度奖励函数,该函数通过估计探索性动作对未来决策改进的潜力来显式评估这些动作,同时结合了一种探索感知的分组机制,在优化过程中将探索性动作与任务完成动作区分开来。通过针对信息缺口,这种设计使得智能体能够有选择地进行探索,并在任务上下文清晰后立即过渡到执行阶段。实验表明,我们的方法在一系列具有挑战性的基于文本和基于图形用户界面的智能体基准测试中均取得了持续改进。代码已开源在 https://github.com/HansenHua/EAPO-ICML26,模型已开源在 https://huggingface.co/hansenhua/EAPO-ICML26。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org