OpenSearch-VL:前沿多模态搜索智能体的开源方案
OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents
研究团队推出完全开源的OpenSearch-VL方案,用于训练前沿多模态深度搜索智能体。该方案包含三大核心:通过维基百科路径采样、模糊实体重写和视觉定位构建的高质量训练数据集(包括用于微调的SearchVL-SFT-36k和用于强化学习的SearchVL-RL-8k);统一文本搜索、图像搜索、OCR及图像处理工具的多样化环境;以及能处理级联工具失败的多轮致命错误感知GRPO训练算法。基于此训练的智能体在七个基准测试中平均提升超过10分,在多项任务上达到与专有商业模型相当的水平。所有数据、代码和模型均将开源。
把多模态搜索 agent 的完整训练配方开源了,数据、环境、算法全都有,七个基准平均涨 10 点,直接对标商业模型,做深度搜索的同学可以无脑跟。
摘要
深度搜索已成为前沿多模态智能体的关键能力,使模型能够通过主动搜索、证据验证和多步推理来解决复杂问题。尽管进展迅速,但顶尖的多模态搜索智能体仍然难以复现,这主要归因于缺乏开放的高质量训练数据、透明的轨迹合成流程或详细的训练方案。为此,我们推出了 OpenSearch-VL,这是一套完全开源的、通过智能体强化学习训练前沿多模态深度搜索智能体的方案。首先,我们构建了一条专门的流程,通过维基百科路径采样、模糊实体重写和源锚定视觉定位来构造高质量训练数据,这些方法共同减少了捷径学习(shortcuts)和单步检索崩溃(one-step retrieval collapse)的问题。基于该流程,我们整理了两个训练数据集:用于 SFT 的 SearchVL-SFT-36k 和用于 RL 的 SearchVL-RL-8k。此外,我们设计了一个多样化的工具环境,统一了文本搜索、图像搜索、OCR、裁剪、锐化、超分辨率和透视校正等功能,使智能体能够将主动感知与外部知识获取相结合。最后,我们提出了一种多轮致命错误感知的 GRPO 训练算法,该算法通过掩蔽失败后的 token 来处理级联工具故障,同时通过单侧优势钳制(one-sided advantage clamping)保留失败前有用的推理过程。基于这一方案,OpenSearch-VL 带来了显著的性能提升,在七个基准测试上平均提升超过 10 个百分点,并在多项任务上取得了与专有商业模型相当的结果。我们将发布所有数据、代码和模型,以支持多模态深度搜索智能体的开放研究。
1 引言
多模态深度搜索已成为多模态大语言模型(MLLM)的关键发展方向,使其能够从被动的视觉理解系统,进化为主动搜索证据、核实事实并基于知识密集型视觉查询进行推理的智能体(Huang et al., 2026; Feng et al., 2026; Chen et al., 2026)。然而,前沿多模态搜索智能体仍难以复现,因为其训练数据、代码往往属于专有或披露不足(Seed, 2026; Huang et al., 2026; Singh et al., 2025; Team, 2026b)。因此,社区仍然缺乏一套完全开放的、用于构建、分析和改进强大多模态搜索智能体的完整方案。在这些缺失的组件中,高质量的训练数据是核心瓶颈。最强大的前沿系统仍主要由资金雄厚的商业公司主导(Team, 2025b; Comanici et al., 2025),其数据来源、筛选标准、专家示范和工具调用轨迹通常都保持私有。这使得复现先进的多模态搜索能力,或系统性地研究哪些数据属性对智能体搜索行为至关重要,变得十分困难。这一问题在多模态场景中更为突出,因为有效的训练数据必须涵盖基于图像的语义理解、多跳检索、证据验证和长程工具使用,而不仅仅是简单的视觉问答。因此,发布高质量的训练数据对于使前沿多模态搜索智能体研究更加透明、可复现和可获取至关重要。除数据之外,训练多模态搜索智能体还面临独特挑战,尤其是在将智能体强化学习(agentic RL)(Fan et al., 2026; Geng et al., 2025; Huang et al., 2026)应用于长程工具使用场景时。智能体搜索轨迹涉及多轮推理、工具调用和观测整合,其中单个格式错误的调用、超时、无关查询或重复失败都可能导致剩余的 rollout 失效。直接丢弃此类轨迹会浪费失败前有用的推理过程,而在完整 rollout 上训练则会因失败后无意义的 token 引入噪声梯度。另一个实际挑战是,现实世界的视觉输入往往并不完美,例如模糊的照片、低分辨率的缩略图、歪斜的文档以及拥挤的截图。在这些情况下,仅靠搜索是不够的,智能体必须先对视觉证据进行裁剪、增强、矫正或解析,之后才能开始可靠的搜索。然而,现有的大多数多模态搜索智能体主要侧重于检索,并未联合处理稳健的视觉预处理和具备失败感知能力的长程强化学习。在本工作中,我们提出了 OpenSearch-VL,一个用于通过智能体强化学习训练前沿多模态深度搜索智能体的完全开源方案。我们的方案从数据、工具和训练三个方面应对上述挑战。首先,我们开发了一条专门的数据整理流水线来构建高质量的训练数据。从 Wikipedia 超链接图出发,我们采样多跳实体路径,并通过将中间实体改写为模糊描述将其转换为多跳 VQA 实例,随后经过精心设计的过滤机制。这种设计避免了单跳图像查找的捷径,并鼓励智能体学习多跳搜索和推理行为。该流水线产出了两个训练数据集:用于 SFT 的 SearchVL-SFT-36k 和用于智能体强化学习的 SearchVL-RL-8k。其次,我们构建了一个超越纯检索型多模态智能体的工具环境。除了搜索之外,智能体还配备了 OCR、裁剪、锐化、超分辨率和透视校正功能,使其能够在查询外部知识之前处理现实场景中不完美的视觉输入。最后,我们开发了一种基于 GRPO(Guo 等人,2025)的智能体强化学习算法,用于长程多模态工具使用,其中多步交互常常导致级联式的工具故障。为了解决这一问题,我们引入了致命感知的 token 掩码(fatal-aware token masking),将失败后的无效后缀从优化中剔除,同时通过单侧优势截断(one-sided advantage clamping)保留失败前有用的推理过程。这使得模型能够从部分成功的轨迹中学习,而不受失败 rollout 带来的噪声梯度影响。综合来看,这些设计使 OpenSearch-VL 能够在真实场景中学习到稳健的长程多模态证据搜索行为。跨多模态深度搜索基准的实验表明,OpenSearch-VL 持续优于强基线模型。例如,与 Qwen3-VL-30B-A3B(Bai 等人,2025)智能体基线相比,我们的模型将平均得分从 47.8 提升至 61.6,在 VDR(+13.3)(Zeng 等人,2026)、MMSearch(+24.5)(Jiang 等人)、FVQA(+10.2)(Wang 等人,2017)和 InfoSeek(+16.2)(Chen 等人,2023)上均有大幅提升。此外,OpenSearch-VL 在多个基准上取得了与专有商业模型相当甚至更优的表现。综上所述,我们的主要贡献可归纳如下:
-
我们推出了 OpenSearch-VL,这是一套用于训练前沿多模态深度搜索智能体的完全开源方案。我们将发布训练数据、代码和模型,为多模态智能体搜索的可复现研究提供开放基础。
-
我们构建了训练先进多模态搜索智能体所需的关键组件,包括高质量的图像支撑多跳训练数据、多样化的工具环境,以及多轮致命感知的 GRPO 算法。
-
大量实验证明了我们方案的有效性。例如,我们训练出的 OpenSearch-VL-30B-A3B 在 7 个多模态深度搜索基准上平均提升了 13.8 分。
2 预备知识
问题设定。给定一张输入图像和一个问题,智能体通过在一组多样化的工具集上交错进行推理与工具调用来作答,其中包含用于转换或解析图像的视觉工具,包含用于查询外部知识的检索工具。在第步,模型基于累积的历史信息进行条件生成
| (1) |
其中,、和分别表示截至第步累积的图像、动作和观测结果。交互过程以多轮轨迹的形式展开
| (2) |
其中最后一步输出答案,且不再有后续观测。遵循 ReAct(Yao 等人,2022)的“先思考后行动”惯例,每个动作分解为,其中是推理轨迹,表示对或的工具调用,或是对的最后响应。多模态观测与主动视觉上下文。与纯文本设定(Jin 等人,2025)不同,我们的环境返回多模态观测。给定一个控制命令,按工具族确定性地路由该调用,
| (3) |
因此,。活动视觉上下文随 单调增长;历史视觉观测被严格保留,使策略能够交叉参照多跳视觉变换(例如,局部裁剪与其超分辨率增强版本相对照)。轨迹被简洁地写为 ,其中 表示策略发出的动作与环境返回的观测之间的严格交错。轨迹似然。策略通过标准自回归分解对联合轨迹概率进行建模:
| (4) |
观测结果被排除在生成概率质量之外,因为它们是外部系统的外生输出;它们仅通过调节后续历史来影响轨迹似然。这一分解正是 SFT 直接监督的对象(式 8),也是我们 RL 目标中逐 token 重要性比率的基础(式 12)。Token 级生成掩码。优化梯度必须仅限于策略自身生成的 token。对于文本观测(来自系统与 OCR),我们定义一个指示符,当 token 属于生成的行动时取值为 1,当 token 属于观测片段时取值为 0。图像型观测(来自系统)直接注入视觉骨干网络,天然绕过 token 级损失。这一方案受 Search-R1(Jin 等人,2025)的检索 token 掩码启发,同时支撑 SFT 目标(式 8)与致命感知 RL 掩码(式 10);搜索结果与 OCR 解析的文本序列化结果通常噪声较大,且与策略内在的生成分布在结构上差异显著,将其纳入损失会破坏训练稳定性。搜索工具。OpenSearch-VL 配备了一套工具,涵盖三项互补功能:检索(TextSearch、ImageSearch)用于收集外部证据,图像增强(Sharpen、SuperResolution、PerspectiveCorrect)用于修复低质量输入,以及注意力与解析(Crop、OCR)用于定位和解码细粒度内容。该工具套件将轻量级离线原语与由专家模型支撑的在线服务相结合,汇总于表 1。完整规格见附录 F。
| 工具 | 描述 | 参数 | 工具输出 |
|---|---|---|---|
| TextSearch | 网页搜索,支持页面读取与 LLM 摘要 | Query + TopK | 面向查询的段落摘要 |
| ImageSearch | 基于网络的以图搜图 / 视觉实体搜索 | Image + TopK | 视觉匹配结果及相关网页 |
| Sharpen | 基于反锐化掩模的去模糊 / 细节增强 | 图像 + 金额 | 锐化后的图像 |
| 超分辨率 | 针对低分辨率输入的深度超分辨率(EDSR) | 图像 + 缩放比例 | 高分辨率图像 |
| 透视校正 | 对倾斜文档进行自动透视校正 | 图像 | 正面平行图像 |
| 裁剪 | 提取用户指定的矩形区域 | 图像 + 坐标 | 裁剪后的图像 |
| OCR(光学字符识别) | 带文本与版面标签的结构化文档解析 | 图像 + 标志位 | 带标签和阅读顺序的文本块 |
3 数据集构建
为了使模型具备强大的推理和工具使用能力,我们设计了一个可扩展的数据构建流程(图 1),该流程无需人工标注即可合成高质量轨迹。该流程分为三个阶段——VQA 构建、分阶段过滤与增强、以及轨迹合成——最终生成用于后续阶段训练的数据集。
3.1 高质量 VQA 构建
训练多模态搜索智能体的一个核心挑战在于,需要提供能够促使模型对多样化工具集进行非平凡使用的提问数据。直接对图像向视觉语言模型(VLM)发出提示,往往只会产生浅层的、感知层面的查询,这类查询通过单次前向传播即可解决(Geng 等人,2025;Huang 等人,2026)。基于这一观察,我们采用了一套统一的构建流程:在 Wikipedia 超链接图上采样多跳轨迹,沿每条轨迹合成文本问答对,并通过保持答案的模糊重写和基于来源的视觉锚定,将其提升为基于图像的 VQA 数据。与以往的问答构建方法(Wu 等人,2025a;Li 等人,2025a;Geng 等人,2025)相比,我们的流程(i)为采样路径上的每个节点在推理链中赋予明确的功能角色,并且(ii)有意将视觉锚点与答案实体解耦,从而抑制单次检索的捷径。Wikipedia 路径采样。我们将 Wikipedia(48)视为一个有向图,其中文章为节点,文内超链接为边。从某个种子节点出发,进行长度为 的受限随机游走,即可生成一条路径
| (5) |
其中每条关系都由超链接的锚文本所引出。该游走会跳过:(i) 消歧义页面和列表页面,(ii) 循环路径,以及 (iii) 入度超过阈值的枢纽节点;完整的阈值、重采样启发式规则及其他过滤器详见附录 D.2。路径上的每个节点都被赋予一个功能角色: 是锚点(视觉入口点,将被视觉指代表达式替换), 是桥接节点(名称经过模糊化处理的中间实体), 是答案节点(目标属性的来源)。这些角色决定了后续的改写与落地(grounding)阶段。我们从 中提取一个简短且无歧义的答案,并提示 GPT-4o(Team,2024)综合出一个规范性问题,该问题仅通过所查询的属性来表述并引用 (提取细节见附录 D.2)。该规范性问题并非训练目标,而是可供改写操作的对象。模糊实体改写。在 中保留实体名称会使智能体能够通过单次检索就绕过整条链(Li 等,2025a;Huang 等,2026)。因此,我们在固定 的同时,逐步将 改写为模糊对应形式。遵循 Skywork-R1V4(Zhang 等,2025)的迭代风格,我们一次改写一个实体,从最远的桥接节点开始向 推进:每个名称都被替换为从该实体的 Wikipedia 上下文中提取的关系式或基于属性的描述符,并由一个 LLM 唯一性评估器验证,确认在部分改写后的问题条件下,该替换仍能指向预期实体。只有当
| (6) |
其中 表示在评估者世界知识下与 兼容的实体集合。我们进一步将实体改写与偶尔的答案混淆(Huang 等人,2026)交错进行,以避免坍缩到刻板的关系模板上。锚点感知的视觉定位。我们从 Wikimedia Commons 或其 Wikipedia 信息框中检索锚点的代表性图像,通过 CLIP 相似度将候选图像过滤到 的简短文本描述,并将 中的 替换为视觉指称表达(例如,“图像中的人”)以生成最终问题 。与先前在答案实体上或其附近进行定位的 QA 到 VQA 转换(Geng 等人,2025;Zhang 等人,2025)不同,在 的来源处进行锚定显著减少了单跳捷径:智能体必须首先识别视觉锚点,然后遵循中间的文本关系,才能到达 。每个候选三元组都通过掩码、唯一性和视觉相关性的自动检查进行门控,推广了 WebWatcher(Geng 等人,2025)的选择器/检查器协议(完整标准见附录 D.2);非平凡性通过与第 3.2 节的分阶段过滤共同处理。通过这些检查的实例构成我们 VQA 池的 Wikipedia 部分,随后在轨迹合成之前与开源多模态语料库合并。
3.2 过滤与增强
在轨迹合成之前,我们将第 3.1 节中源自 Wikipedia 的 VQA 实例与三个开源多模态语料库——LiveVQA (Fu et al., 2025)、FVQA (Wang et al., 2017) 和 WebQA (Chang et al., 2022)——进行整合,以扩大对实时实体、常识事实查询和开放网络多跳推理的覆盖范围。随后,我们使用冻结的 Qwen3-VL-32B (Bai et al., 2025) 应用两阶段难度过滤:首先丢弃无需工具即可回答的示例,然后丢弃通过单次 ImageSearch 调用即可解决的示例。这移除了仅依赖参数化知识、感知捷径、答案巧合锚点或单跳桥接泄漏的样本,确保保留的实例真正需要预期的视觉到文本搜索链。为了进一步让智能体接触真实的视觉缺陷,我们从过滤后的 VQA 池中随机选择一部分,并施加受控退化——模糊、降采样和透视畸变——并配以相应的增强工具(Sharpen、SuperResolution 和 PerspectiveCorrect)。该增强子集使训练分布多样化,并诱导“先思考图像”的行为:当输入图像不可靠时,策略学会在发起检索之前先修复视觉证据。综合来看,过滤后的检索密集型实例和需要增强的子集在统一的工具环境中同时锻炼了视觉恢复和证据获取能力。
3.3 多轮轨迹合成
对于通过第 3.2 节筛选的每个实例,我们通过让 Claude Opus 4.6(Team,2026a)作为专家模型,在真实执行环境中进行 rollout 来合成专家轨迹,并使用附录 E 中的智能体系统提示词进行提示,且允许其自由调用 中的任何工具。我们为每个实例进行独立的 rollout,每个 rollout 都格式化为与公式 2 对齐的多轮 ReAct(Yao 等人,2022)轨迹。随后,原始 rollout 会经过一个两阶段拒绝级联。第一阶段丢弃任何最终答案与真实结果不一致的轨迹(由我们用于 的同一个 GPT-4o(Team,2024)LLM 作为评判者(Gu 等人,2025)进行裁决,见第 4.2 节)。幸存的轨迹随后由 GPT-5.4 过程级评判者审查,评估工具使用、推理与观察之间的逻辑一致性以及是否存在无效重复,并共享 的四维评分标准(第 4.2 节)。将两个阶段应用于完整的 rollout 语料库,可生成高质量的专家轨迹,每条轨迹平均包含 次工具调用轮次,这些轨迹共同构成了第 4.1 节中使用的 SFT 语料库。
4 训练
我们分两个连续阶段训练 OpenSearch-VL。首先,我们进行监督微调(SFT),以注入基础推理和工具使用行为;随后,我们通过多轮、搜索增强的目标(图 2)应用强化学习(RL),以发现更有效的探索策略。
4.1 监督微调
我们在精选的多轮专家轨迹集上执行 SFT(第 3 节)。利用历史(公式 1)和动作分解,通过自回归分解,逐步动作概率可分解为
| (7) |
对所有轨迹和步骤求和,标准 SFT 目标可等价地写为
| (8) |
其中工具观测仅作为条件上下文进入模型,并按照(Jin 等人,2025)的检索 token 掩码策略从损失计算中排除。这为训练信号提供了一种结构化的解释,表明它在每一步同时监督推理轨迹和随后的工具调用(或最终响应)。
4.2 多轮搜索致命感知 GRPO
虽然 SFT 为工具使用提供了强大的初始化,但它仍然受限于演示轨迹的覆盖范围,因此无法通过探索来发现改进的搜索策略。我们利用强化学习来解决这一局限,基于 GRPO(Shao 等人,2024)及其搜索增强扩展(Jin 等人,2025)进行构建。然而,我们的设置与先前仅搜索的公式在三个重要方面有所不同:我们在具有多种工具的多模态环境中进行优化,而非仅文本检索器;我们使用复合奖励,将最终任务成功与过程级搜索质量相结合;我们引入了致命感知掩码以及单侧优势截断,以保留部分成功轨迹中的有用监督信号。在训练期间,对于每个提示词,我们采样一组多轮 rollout,用于 。复合多轮奖励。长时程任务带来了稀疏奖励的挑战:仅结果奖励无法对部分成功的推理进行信用分配,而仅过程奖励则可能因最终目标而产生错位风险。因此,我们使用复合轨迹级奖励
| (9) |
其中 。复合轨迹级奖励(式 9)的结构旨在平衡算法格式规范性、最终准确性和过程级搜索质量。我们将每个组成部分定义如下:
-
格式奖励。一种确定性的、算法化的先验,用于强制结构完整性。我们定义 ,其中当且仅当第 步输出一个连续的 <think></think> 块,且其后紧跟一个 <tool_call></tool_call> 块(针对 )或一个 <response></response> 块(针对 )时, 成立;对于任何结构违规,包括触发工具执行错误(例如,格式错误的 API 参数)的步骤, 不成立。通过在式 (9) 中充当乘法门控, 将结构退化轨迹的整体回报推向零。
-
准确性奖励。一项用于评估智能体最终解决方案保真度的终端结果指标。在 LLM-as-Judge 协议(Gu 等人,2025)下,由 GPT-4o(Team,2024)作为评判者,验证智能体的终端 <response> 与真实标注之间的语义等价性,匹配则赋分,否则不赋分。截断轨迹的约定:对于在发出终端 <response> 之前因致命状态条件(式 10)而中止的轨迹,我们确定性地赋零分。这是一种结构性保证而非评价性判断——在缺少终端答案的情况下,正确性严格来说未定义并被保守地置零——这确保了无论完成状态如何,结果信号对于组相对优势估计始终是良定义的。
-
查询质量奖励。一种过程级信号,用于抵消长程交互中固有的稀疏性问题。我们使用 GPT-5.4(OpenAI, 2025)——一个专有的前沿推理模型——作为查询质量评判器,对搜索查询的累积序列进行连续评分,从而为不成功的轨迹提供密集反馈。评分标准涵盖四个维度:(i)所发出查询与初始提示词之间的语义相关性;(ii)跨连续轮次的逻辑推进与查询的迭代优化;(iii)检索内容中的信噪比;以及(iv)图像与文本检索工具在跨模态上的互补使用。对于被标记为致命(fatal)的轨迹,评判器仅对有效的致命前前缀(步骤)进行评估,以便早期阶段的推理即使后续崩溃也能得到认可。
致命感知的 Token 掩码。在无约束的多轮环境中,智能体经常会遇到“致命”状态——例如级联的工具执行失败或无限循环——在此之后,后续推理就变得毫无意义。标准方法要么丢弃整个轨迹(Huang 等人,2026)(浪费了有效的早期步骤),要么盲目地在其上训练(注入噪声)。我们引入了一种致命感知的掩码策略,以保留可行的前缀。我们将轨迹的致命步骤索引定义为连续工具执行错误开始的最早步骤,如果没有此类级联发生,则设为。然后,我们将观察 token(生成)掩码扩展,额外将致命步骤之后生成的所有 token 置零:
| (10) |
其中将 token 索引映射到其步骤索引。关键在于,奖励的计算完全基于有效前缀进行,从而确保模型不会因轨迹被判定为致命之后发生的结构崩溃而受到惩罚。所有轨迹——包括致命轨迹——都参与标准的组归一化奖励计算,以保持组统计量的无偏性。然而,对致命轨迹直接使用该奖励是有问题的:低于均值的奖励会推动策略梯度去抑制可行前缀,从而在错误级联发生之前就阻碍有效的推理。因此,我们采用单侧优势裁剪:
| (11) |
这种裁剪确保致命轨迹的有效前缀仅在其部分奖励超过组均值时才会被强化,否则将获得零梯度而非不应得的惩罚。从这个意义上说,它推广了硬掩码基线方法(Huang 等,2026),同时恢复了严格意义上更有用的学习信号。将致命感知掩码与裁剪后的优势相结合,我们在多模态环境下的最终 GRPO 目标函数表述为:
| (12) |
其中 是 token 级重要性比率,标准项 因与标准 GRPO(式 14)中的该项相同而未在展示中列出。与搜索增强 GRPO(Jin 等,2025)相比,差异(与式 12 颜色对应)有三点:执行环境从 推广为 ,生成掩码扩展为致命感知掩码 ,优势则基于复合奖励并通过单侧裁剪计算。更多细节与推导见附录 B。
5 实验
我们首先按如下方式描述实验设置:模型与基准。我们的 OpenSearch-VL 基于三个 Qwen3-VL 变体(Bai 等人,2025)构建:Qwen3-VL-8B-Instruct、Qwen3-VL-30B-A3B-Instruct 和 Qwen3-VL-32B-Instruct。在评估方面,我们使用主要结果中的七个知识密集型基准:SimpleVQA(Cheng 等人,2025)、VDR(Zeng 等人,2026)、MMSearch(Jiang 等人)、LiveVQA(Fu 等人,2025)、BrowseComp-VL(Geng 等人,2025)、FVQA(Wang 等人,2017)和 InfoSeek(Chen 等人,2023)。这些基准共同覆盖了视觉实体识别、网页证据检索、多跳推理和长尾问答。 基线与评估指标。我们针对以下基线类型评估 OpenSearch-VL:直接推理(Direct Reasoning),即模型仅凭其参数化知识和视觉感知作答;RAG 工作流(RAG Workflow),即在上下文中提供外部检索结果,但推理仍为单次通过;以及智能体工作流(Agentic Workflow),即模型在多模态环境中自主地将推理与工具调用交错进行。我们在全部七个基准上报告 Pass@1 指标。正确性由 GPT-4o 评判器裁定,该评判器将模型的最终回答与参考答案进行比较。为确保不同回答风格之间的公平比较,我们采用与 VDR-Bench(Zeng 等人,2026)相同的评估协议;完整的评判提示词见图 10。 数据集。我们的 SFT 数据由第 3.3 节所述流程合成的 36K 条多轮轨迹组成。对于 RL 训练,我们从第 3.2 节所述的分阶段过滤和增强处理后的 VQA 池中随机采样 8K 个示例,确保这些示例与用于合成 SFT 轨迹的 VQA 实例互不重叠。 实现细节。OpenSearch-VL 扩展了 LlamaFactory(Zheng 等人,2024)以进行智能体 SFT,并基于 rLLM(Tan 等人,2025)和 VDR(Huang 等人,2026)进行多轮工具交错 RL。OpenSearch-VL 的所有训练阶段均在 Nvidia H20 GPU 上进行。智能体 SFT 在 256 块 H20(32 个节点,每节点 8 块 GPU)上,8B 稠密模型大约需要 2 天,30B-A3B MoE 模型大约需要 4 天;随后的多轮致命感知 GRPO 阶段在 64 块 H20(8 节点 8 GPU)上运行约 200 个优化步骤,耗时 10 天。每个阶段的完整超参数配置列于以下小节中(SFT 见表 4;RL 见表 5)。更多细节见附录 C。
5.1 主要结果
| 模型 | SimpleVQA | VDR | MMSearch | LiveVQA | BrowseComp-VL | FVQA | InfoSeek | 平均 |
|---|---|---|---|---|---|---|---|---|
| 直接推理 | ||||||||
| GPT-4o(Team,2024) | 51.7 | 1.7 | 18.7 | 28.1 | 5.5 | 48.0 | 52.9 | 29.5 |
| GPT-5(OpenAI,2025) | 61.6 | 9.8 | 35.1 | 44.4 | 48.6 | 54.4 | 61.7 | 45.1 |
| Gemini-2.5-Flash(Comanici 等,2025) | 57.9 | 6.2 | 30.4 | 51.0 | 37.1 | 47.7 | 44.1 | 39.2 |
| Gemini-2.5-Pro(Comanici 等人,2025) | 63.0 | 8.0 | 39.8 | 60.3 | 43.1 | 60.7 | 46.9 | 46.0 |
| Claude-4-Sonnet(Team,2025b) | 50.9 | 2.0 | 18.7 | 38.5 | 29.3 | 35.3 | 57.3 | 33.1 |
| Claude-3.7-Sonnet(Team,2025a) | 42.7 | 4.6 | 21.1 | 38.0 | 32.3 | 36.7 | 54.8 | 32.9 |
| Qwen3-VL-8B(Bai 等人,2025) | 47.1 | 2.8 | 11.7 | 23.1 | 24.1 | 24.2 | 23.1 | 22.3 |
| Qwen3-VL-30B-A3B(Bai 等人,2025) | 53.2 | 3.8 | 18.7 | 42.7 | 29.6 | 34.7 | 26.4 | 29.9 |
| Qwen3-VL-32B(Bai 等人,2025) | 58.0 | 4.1 | 19.8 | 45.5 | 30.8 | 34.1 | 28.8 | 31.6 |
| RAG 工作流 | ||||||||
| GPT-4o(Team,2024) | 63.6 | 4.5 | 49.1 | 40.1 | 13.4 | 66.3 | 59.5 | 42.4 |
| GPT-5(OpenAI,2025) | 55.9 | 22.3 | 52.6 | 56.0 | 54.9 | 62.6 | 70.6 | 53.6 |
| Claude-3.7-Sonnet(Team,2025a) | 59.3 | 11.3 | 32.7 | 30.3 | 10.0 | 59.1 | 60.2 | 37.6 |
| Qwen3-VL-8B(Bai 等人,2025) | 62.3 | 7.3 | 47.3 | 39.3 | 29.3 | 53.6 | 46.1 | 40.7 |
| 智能体工作流 | ||||||||
| DeepMMSearch-R1-7B(Narayan 等人,2025b) | 55.8 | – | – | – | – | – | 47.5 | – |
| Visual-ARFT-7B(Liu 等人,2025) | 42.4 | 3.3 | 34.5 | 25.4 | 16.5 | 41.7 | 37.9 | 28.8 |
| MMSearch-R1-7B(Wu 等,2025b) | 57.4 | 2.9 | 53.8 | 48.4 | 20.9 | 58.4 | 55.1 | 42.4 |
| DeepEyes-v2-7B(Hong 等,2025) | 59.4 | 7.8 | 63.7 | – | – | 60.6 | 51.1 | – |
| WebWatcher-7B(Geng 等人,2025) | 54.3 | 10.3 | 49.1 | 51.2 | 21.2 | – | – | – |
| Qwen3-VL-8B(Bai 等人,2025) | 52.0 | 17.0 | 37.4 | 50.6 | 27.9 | 58.7 | 50.3 | 42.0 |
| SenseNova-MARS-8B(Chng 等人,2025) | 61.7 | 19.4 | 67.4 | 56.2 | 35.1 | 67.1 | 61.7 | 52.7 |
| OpenSearch-VL-8B(本文) | 71.6 | 20.8 | 64.5 | 59.6 | 37.6 | 71.5 | 70.2 | 56.6 |
| Qwen3-VL-30B-A3B(Bai 等人,2025) | 55.1 | 20.2 | 44.2 | 62.0 | 34.1 | 63.0 | 56.2 | 47.8 |
| OpenSearch-VL-30B-A3B(Ours) | 74.9 | 33.5 | 68.7 | 67.4 | 41.1 | 73.2 | 72.4 | 61.6 |
| Qwen3-VL-32B(Bai 等人,2025) | 58.7 | 23.1 | 53.9 | 45.5 | 35.1 | 61.2 | 58.5 | 48.0 |
| WebWatcher-32B Geng 等人(2025) | 59.0 | – | 55.3 | 58.7 | 27.0 | – | – | – |
| OpenSearch-VL-32B(Ours) | 76.2 | 33.8 | 72.3 | 70.5 | 43.8 | 74.7 | 74.8 | 63.7 |
表 2 报告了在七个多模态知识密集型问答和网页搜索基准上的结果。OpenSearch-VL 在所有规模上均展现出相对于直接推理和 RAG 基线的明显优势,凸显了智能体循环对于复杂多模态查询的必要性。在 8B 规模的智能体中,OpenSearch-VL-8B 取得了 56.6 的最佳平均分,平均超越此前最强的开源 8B 智能体 SenseNova-MARS-8B 达 3.9 分。在更大规模上,OpenSearch-VL-30B-A3B 和 OpenSearch-VL-32B 进一步将平均分分别提升至 61.6 和 63.7;值得注意的是,OpenSearch-VL-32B 超越了 Gemini-2.5-Pro 等强大的专有直接推理模型,并大幅超过相应的 Qwen3-VL 智能体基线。这些结果表明,我们的训练方案能够从 8B 有效扩展到 32B,并在重搜索和视觉锚定基准上均带来显著提升。
5.2 消融实验
我们在 Qwen3-VL-8B 模型上进行了消融实验,以验证定义 OpenSearch-VL 的两个设计选择:用于生成需要工具调用的多模态轨迹的数据合成流程,以及能够在离线模仿之外改进策略的 fatal-aware RL 训练方案。
(a) SFT 数据流水线消融实验设置 SimpleVQA InfoSeek FVQA 平均 完整流水线(本文方法) 66.1 62.4 65.3 64.6 去除来源锚定(source-anchor grounding) 53.6(-12.5) 54.5(-7.9) 51.2(-14.1) 53.1(-11.5) 去除模糊实体改写 51.7(-14.4) 56.4(-6.0) 54.7(-10.6) 54.3(-10.3) 去除分阶段过滤 57.6(-8.5) 55.2(-7.2) 56.3(-9.0) 56.4(-8.2) 去除增强子集 64.9(-1.2) 61.7(-0.7) 63.2(-2.1) 63.3(-1.3)
(b) RL 配方消融实验 方法 | SimpleVQA | InfoSeek | FVQA | 平均 Qwen3-VL-8B | 52.0 | 50.3 | 58.7 | 53.7 Qwen3-VL-8B + 仅 SFT | 66.1 | 62.4 | 65.3 | 64.6 + 原始 GRPO | 68.8 | 66.5 | 67.4 | 67.6 + 带硬掩码的 GRPO | 68.3(-0.5) | 67.9(+1.4) | 66.9(-0.5) | 67.7(+0.1) + 仅致命掩码的 GRPO | 69.7(+0.9) | 68.3(+1.8) | 69.2(+1.8) | 69.1(+1.5) + 致命掩码 + 单侧截断(Ours,我们的方法) | 71.6(+2.8) | 72.4(+5.9) | 71.5(+4.1) | 71.8(+4.2)
数据流水线消融实验。表 3 显示,我们数据合成流水线的每个阶段都对最终性能有所贡献。完整流水线取得了 64.6 的最佳平均分,而移除源锚定(source-anchor grounding)、模糊实体改写(fuzzy entity rewriting)或分阶段过滤(staged filtering)分别导致分数大幅下降 11.5、10.3 和 8.2 分。这些结果表明,有效的训练数据既要防止捷径检索(shortcut retrieval),也要保留真正需要工具调用的查询。移除增强子集(enhancement subset)会导致较小但一致的下降(平均分),这表明图像修复轨迹(image-restoration trajectories)主要提升鲁棒性,而非驱动核心性能提升。 训练方案消融实验。表 3 研究了在相同的 Qwen3-VL-8B SFT 初始化之后,我们 RL 方案的效果,并以 Search-R1 风格的 vanilla GRPO(Jin 等人,2025)作为 RL 基线。SFT 将基础模型的平均准确率从 53.7 提升到 64.6,而 vanilla GRPO 进一步将其提升到 67.6,显示了在线探索(online exploration)的益处。致命轨迹(fatal trajectories)的处理方式至关重要:Vision-DeepResearch(Huang 等人,2026)的硬掩蔽(hard-masking)策略相比 vanilla GRPO(Jin 等人,2025;Guo 等人,2025)几乎没有任何提升,而致命掩蔽(fatal masking)通过保留失败前有效的推理过程,将平均分提升到 69.1。我们完整的方法采用单侧优势截断(one-sided advantage clamping),在每一个基准上都取得了最佳分数,并达到 71.8 的平均准确率,相比 vanilla GRPO 提升了 4.2 分。图 3 中的训练曲线与此结果一致:fatal-aware GRPO 维持了更长的工具使用轨迹,同时实现了更高的批次准确率,表明它鼓励富有成效的探索,而不是过早地抑制困难的 rollout。
两种情况的实证可视化。
图 4 可视化了该方法在两个具有代表性的 rollout 分组中如何与各组难度进行交互。在较高难度的情况下,大多数致命轨迹在遇到工具错误之前仍会生成一段连贯的前缀;其中一小部分超过了组均值,仅对前缀 token 贡献了正梯度。在较低难度的情况下,每条致命轨迹都被成功的非致命 rollout 所主导,将其截断为零可防止噪声负信号将策略推离可能实际上是有效前缀的方向。图 5 表明这种区分并非个例:按组汇总后,绝大多数致命轨迹位于截断前分数的负侧,并被安全地归零,而保留下来的一小部分尾部在分布上与右侧非致命参考模态接近。因此,单侧截断能够从失败的工具调用轨迹中恢复出有原则的信用信号,而不会放大其固有噪声。
6 相关工作
6.1 多模态智能体搜索
主动搜索的引入将大语言模型从静态知识库重塑为能够进行动态信息检索的智能体推理器。Search-R1(Jin 等人,2025)通过使用强化学习激励推理链中的自主多轮查询,将这一转变具象化。此后,这一范式迁移到了多模态领域;MMSearch-R1(Wu 等人,2025b)和 Vision-DeepResearch(Huang 等人,2026;Narayan 等人,2025a)将视觉检索嵌入智能体流水线,而近期的研究(Zhang 等人,2025;Yao 等人,2026;Chen 等人,2026;Feng 等人,2026;Li 等人,2025b)则试图将图像处理与网络搜索统一起来。然而,这些工作中一个常见但脆弱的假设是视觉输入是纯净可用的。在实践中,当智能体遇到退化或文本密集的真实世界图像时,“仅搜索”的方法会失效,因为检索无法修复根本上已损坏的视觉证据。
6.2 视觉感知与检索
多模态智能体的性能瓶颈往往不在于检索逻辑,而在于初始感知的保真度(Zhang 等人,2026;Wei 等人,2025)。虽然像 VisRAG(Yu 等人,2024)这样的 RAG 框架强调保留视觉结构,但它们将模型视为被动的观察者,必须对检索到的内容“将就使用”。即使工具增强型智能体(Song 等人,2026;Hong 等人,2025;Geng 等人,2025)引入了动态编排,其工具集在很大程度上仍是同质化的、受场景限制的。我们认为,稳健的推理需要主动感知:智能体不仅要搜索,还要进行干预——在尝试对视觉噪声进行推理之前,自主调用超分辨率或专用 OCR 等工具来修复视觉噪声。
6.3 面向智能体推理的强化学习
训练智能体在长时程、多工具环境中运行,对标准强化学习(RL)构成了巨大挑战。尽管 GRPO(Shao 等人,2024)在语言模型的推理轨迹对齐方面展现出强大效果(Guo 等人,2025;Chen 等人,2025a, b;Feng 等人,2025a, b;Hu 等人,2026),但将其应用于涉及多样化工具交互的智能体 rollout 仍然并非易事。主要挑战在于级联式失败:早期的工具错误会使后续轨迹失去连贯性(Vuddanti 等人,2025;Zhu 等人,2025;Zheng 等人,2026;Dong 等人,2025),然而这些失败后的 token 仍会向策略梯度中注入噪声(Liu 和 Xiao,2025;Deng 等人,2026;Garg 等人,2026)。此外,标准的组归一化往往会惩罚部分成功 rollout 中有效的推理前缀(Huang 等人,2026)。为应对这一问题,我们提出了一种“致命感知”(fatal-aware)的强化学习目标,它从失败后的状态中剪除学习信号,并采用单侧优势裁剪来保护建设性推理步骤的梯度。
7 结论
我们提出 OpenSearch-VL,一种用于训练多模态深度搜索智能体的完全开源方案,该方案采用智能体强化学习。我们的方案结合了基于 Wikipedia 的数据整理流程(可缓解单步检索捷径问题)并产出两个高质量数据集:SearchVL-SFT-36k 与 SearchVL-RL-8k;一个涵盖检索、图像增强以及注意力与解析工具在内的多样化工具环境;以及一种多轮、对错误敏感的 GRPO 算法,该算法通过单侧优势截断来保留失败前有用的推理过程。基于此方案,OpenSearch-VL 在七个多模态深度搜索基准上平均提升超过 10 个点,并在 VDR 等代表性任务上展现出与强大的专有推理模型相当的性能。我们将发布我们的数据、代码、模型和训练方案,旨在降低复现门槛,并为未来多模态深度搜索智能体的研究提供开放基础。
局限性与未来工作
训练不稳定性的相当一部分可追溯到外部工具环境——包括搜索排名漂移、抓取失败,以及 TextSearch 和 ImageSearch 中偶发的摘要幻觉——这些因素放大了奖励方差,并推动了未来在策略内可靠性估计方面的研究。此外,我们的复合奖励(公式 9)依赖专有的 GPT-4o 评判模型,这些模型成本高昂、随版本变化,且目前仅对文本查询进行评分,而忽略了中间的视觉操作(例如 Crop);用覆盖完整视觉动作空间的开源过程奖励模型来替代它们,仍然是一个自然的下一步。最后,精确的数值可复现性受到对这些外部托管 API(例如 Serper、PaddleX OCR)的依赖,以及大规模评估中报告多随机种子误差线的高昂成本(表 2)的挑战。为缓解这些限制并支持开放研究,我们将在宽松许可下发布完整数据集(SearchVL-SFT-36k / SearchVL-RL-8k)、模型检查点和训练代码。
参考文献
- S. Bai, Y. Cai, R. Chen, K. Chen, X. Chen, Z. Cheng, L. Deng, W. Ding, C. Gao, C. Ge, W. Ge, Z. Guo, Q. Huang, J. Huang, F. Huang, B. Hui, S. Jiang, Z. Li, M. Li, M. Li, K. Li, Z. Lin, J. Lin, X. Liu, J. Liu, C. Liu, Y. Liu, D. Liu, S. Liu, D. Lu, R. Luo, C. Lv, R. Men, L. Meng, X. Ren, X. Ren, S. Song, Y. Sun, J. Tang, J. Tu, J. Wan, P. Wang, P. Wang, Q. Wang, Y. Wang, T. Xie, Y. Xu, H. Xu, J. Xu, Z. Yang, M. Yang, J. Yang, A. Yang, B. Yu, F. Zhang, H. Zhang, X. Zhang, B. Zheng, H. Zhong, J. Zhou, F. Zhou, J. Zhou, Y. Zhu, and K. Zhu (2025) Qwen3-vl technical report. arXiv preprint arXiv:2511.21631. Cited by: §1, §3.2, Table 2, Table 2, Table 2, Table 2, Table 2, Table 2, Table 2, §5.
- Y. Chang、M. Narang、H. Suzuki、G. Cao、J. Gao 和 Y. Bisk(2022)《WebQA:多跳与多模态问答》。外部链接:2109.00590,链接。引用位置:§3.2。
- S. Chen、Y. Guo、Z. Su、Y. Li、Y. Wu、J. Chen、J. Chen、W. Wang、X. Qu 和 Y. Cheng(2025a)《推进多模态推理:从优化冷启动到分阶段强化学习》。arXiv 预印本 arXiv:2506.04207。引用位置:§6.3。
- S. Chen、Y. Guo、Y. Ye、S. Huang、W. Hu、H. Li、M. Zhang、J. Chen、S. Guo 和 N. Peng(2025b)《ARES:基于难度感知的 token 级熵塑形的多模态自适应推理》。arXiv 预印本 arXiv:2510.08457。引用位置:§6.3。
- S. Chen、Q. Shou、H. Chen、Y. Zhou、K. Feng、W. Hu、Y. Zhang、Y. Lin、W. Huang、M. Song 等人(2026)《Unify-agent:面向世界 grounded 图像合成的统一多模态智能体》。arXiv 预印本 arXiv:2603.29620。引用位置:§1、§6.1。
- Y. Chen、H. Hu、Y. Luan、H. Sun、S. Changpinyo、A. Ritter 和 M. Chang(2023)《预训练的视觉与语言模型能否回答视觉信息寻求类问题?》。arXiv 预印本 arXiv:2302.11713。引用位置:§1、§5。
- X. Cheng、W. Zhang、S. Zhang、J. Yang、X. Guan、X. Wu、X. Li、G. Zhang、J. Liu、Y. Mai 等人(2025)《SimpleVQA:面向多模态大语言模型的多模态事实性评估》。收录于 IEEE/CVF 国际计算机视觉会议论文集,第 4637–4646 页。引用位置:§5。
- Y. X. Chng、T. Hu、W. Tong、X. Li、J. Chen、H. Yu、J. Lu、H. Guo、H. Deng、C. Xie 等人(2025)《SenseNova-mars:通过强化学习赋能多模态智能体推理与搜索》。arXiv 预印本 arXiv:2512.24330。引用位置:表 2。
- G. Comanici、E. Bieber、M. Schaekermann、I. Pasupat、N. Sachdeva、I. Dhillon、M. Blistein、O. Ram、D. Zhang、E. Rosen 等人(2025)《Gemini 2.5:以先进推理、多模态、长上下文和下一代智能体能力推动前沿发展》。arXiv 预印本 arXiv:2507.06261。引用位置:§1、表 2、表 2。
- W. Deng、Y. Li、B. Gong、Y. Ren、C. Thrampoulidis 和 X. Li(2026)《论智能体搜索中群体相对策略优化(GRPO)的崩溃:惰性似然位移》。外部链接:2512.04220,链接。引用位置:§6.3。
- G. Dong、H. Mao、K. Ma、L. Bao、Y. Chen、Z. Wang、Z. Chen、J. Du、H. Wang、F. Zhang、G. Zhou、Y. Zhu、J. Wen 和 Z. Dou(2025)《智能体强化策略优化》。外部链接:2507.19849,链接。引用位置:§6.3。
- K. Fan、K. Feng、M. Zhang、T. Peng、Z. Li、Y. Jiang、S. Chen、P. Pei、X. Cai 和 X. Yue(2026)《探索面向智能体的推理奖励模型》。arXiv 预印本 arXiv:2601.22154。引用位置:§1。
- K. Feng、K. Gong、B. Li、Z. Guo、Y. Wang、T. Peng、J. Wu、X. Zhang、B. Wang 和 X. Yue(2025a)《Video-R1:强化多模态大语言模型中的视频推理》。arXiv 预印本 arXiv:2503.21776。引用位置:§6.3。
- K. Feng、M. Zhang、S. Chen、Y. Lin、K. Fan、Y. Jiang、H. Li、D. Zheng、C. Wang 和 X. Yue(2026)《Gen-searcher:强化智能体搜索以生成图像》。arXiv 预印本 arXiv:2603.28767。引用位置:§1、§6.1。
- K. Feng、M. Zhang、H. Li、K. Fan、S. Chen、Y. Jiang、D. Zheng、P. Sun、Y. Zhang、H. Sun 等人(2025b)《OneThinker:面向图像与视频的一体化推理模型》。arXiv 预印本 arXiv:2512.03043。引用位置:§6.3。
- M. Fu、Y. Peng、B. Liu、Y. Wan 和 D. Chen(2025)《LiveVQA:实时视觉知识查询》。arXiv 预印本 arXiv:2504.05288。引用位置:§3.2、§5。
- A. Garg、C. Zhang、N. Neema、D. Bick、G. Venkatesh 和 J. Hestness(2026)《CoRPO:为 GRPO 引入正确性偏置以提升泛化能力》。外部链接:2511.04439,链接。引用位置:§6.3。
- X. Geng、P. Xia、Z. Zhang、X. Wang、Q. Wang、R. Ding、C. Wang、J. Wu、Y. Zhao、K. Li 等人(2025)《WebWatcher:开创视觉语言深度研究智能体的新前沿》。arXiv 预印本 arXiv:2508.05748。引用位置:§1、§3.1、§3.1、表 2、表 2、§5、§6.2。
- J. Gu、X. Jiang、Z. Shi、H. Tan、X. Zhai、C. Xu、W. Li、Y. Shen、S. Ma、H. Liu、S. Wang、K. Zhang、Y. Wang、W. Gao、L. Ni 和 J. Guo(2025)《LLM 作为评判者的综述》。外部链接:2411.15594,链接。引用位置:§3.3、第 2 项。
- D. Guo、D. Yang、H. Zhang、J. Song、P. Wang、Q. Zhu、R. Xu、R. Zhang、S. Ma、X. Bi 等人(2025)《DeepSeek-R1 通过强化学习激发大语言模型的推理能力》。《自然》645(8081),第 633–638 页。引用位置:§1、图 3、§5.2、§6.3。
- J. Hong、C. Zhao、C. Zhu、W. Lu、G. Xu 和 X. Yu(2025)DeepEyesV2:迈向智能体多模态模型。arXiv 预印本 arXiv:2511.05271。引用位置:表 2、§6.2。
- W. Hu、X. Chen、Y. Gao-Tian、Y. Deng、N. Peng 和 K. Chang(2026)OpenVLThinkerV2:面向多领域视觉任务的通用多模态推理模型。外部链接:2604.08539,链接。引用位置:§6.3。
- W. Huang、Y. Zeng、Q. Wang、Z. Fang、S. Cao、Z. Chu、Q. Yin、S. Chen、Z. Yin、L. Chen 等人(2026)Vision-deepresearch:激励多模态大语言模型深度研究能力。arXiv 预印本 arXiv:2601.22060。引用位置:§B.2、附录 C、图 10、附录 E、§1、§3.1、§3.1、§3.1、§4.2、§4.2、图 3、§5.2、§5、§6.1、§6.3。
- [24] D. Jiang、R. Zhang、Z. Guo、Y. Wu、P. Qiu、P. Lu、Z. Chen、G. Song、P. Gao、Y. Liu 等人。Mmsearch:揭示大模型作为多模态搜索引擎的潜力。收录于第十三届国际学习表征会议。引用位置:§1、§5。
- B. Jin、H. Zeng、Z. Yue、J. Yoon、S. Arik、D. Wang、H. Zamani 和 J. Han(2025)Search-r1:通过强化学习训练大语言模型进行推理并利用搜索引擎。外部链接:2503.09516,链接。引用位置:§A.2、附录 A、§2、§2、§4.1、§4.2、§4.2、图 3、§5.2、表 3、§6.1。
- K. Li、Z. Zhang、H. Yin、L. Zhang、L. Ou、J. Wu、W. Yin、B. Li、Z. Tao、X. Wang 等人(2025a)WebSailor:驾驭网页智能体的超人类推理能力。arXiv 预印本 arXiv:2507.02592。引用位置:§3.1、§3.1。
- K. Li、Z. Zhang、H. Yin、L. Zhang、L. Ou、J. Wu、W. Yin、B. Li、Z. Tao、X. Wang、W. Shen、J. Zhang、D. Zhang、X. Wu、Y. Jiang、M. Yan、P. Xie、F. Huang 和 J. Zhou(2025b)《WebSailor:为网页智能体导航超人类推理》。外部链接:2507.02592,链接 引用自:§6.1。
- H. Liu 和 L. Xiao(2025)《RE-grpo:利用大语言模型引导的自训练发挥硬负例的作用》。Neurocomputing,第 132543 页。引用自:§6.3。
- Z. Liu、Y. Zang、Y. Zou、Z. Liang、X. Dong、Y. Cao、H. Duan、D. Lin 和 J. Wang(2025)《视觉智能体强化微调》。arXiv 预印本 arXiv:2505.14246。引用自:表 2。
- K. Narayan、Y. Xu、T. Cao、K. Nerella、V. M. Patel、N. Shiee、P. Grasch、C. Jia、Y. Yang 和 Z. Gan(2025a)《Deepmmsearch-r1:在多模态网页搜索中赋能多模态大语言模型》。arXiv 预印本 arXiv:2510.12801。引用自:§6.1。
- K. Narayan、Y. Xu、T. Cao、K. Nerella、V. M. Patel、N. Shiee、P. Grasch、C. Jia、Y. Yang 和 Z. Gan(2025b)《Deepmmsearch-r1:在多模态网页搜索中赋能多模态大语言模型》。arXiv 预印本 arXiv:2510.12801。引用自:表 2。
- OpenAI(2025)《推出 gpt-5》。注:https://openai.com/index/introducing-gpt-5/ 引用自:第 3 项、表 2、表 2。
- A. Radford、J. W. Kim、C. Hallacy、A. Ramesh、G. Goh、S. Agarwal、G. Sastry、A. Askell、P. Mishkin、J. Clark 等人(2021)《从自然语言监督中学习可迁移的视觉模型》。收录于《国际机器学习大会》,第 8748–8763 页。引用自:§D.2。
- J. Schulman、F. Wolski、P. Dhariwal、A. Radford 和 O. Klimov(2017)《近端策略优化算法》。arXiv 预印本 arXiv:1707.06347。引用位置:§A.1、§A.1。
- B. Seed(2026)Seed2.0 模型卡。外部链接:Link 引用位置:§1。
- Z. Shao、P. Wang、Q. Zhu、R. Xu、J. Song、X. Bi、H. Zhang、M. Zhang、Y. Li、Y. Wu 等人(2024)《DeepSeekMath:在开放语言模型中推动数学推理的极限》。arXiv 预印本 arXiv:2402.03300。引用位置:§A.1、附录 A、§4.2、§6.3。
- A. Singh、A. Fry、A. Perelman、A. Tart、A. Ganesh、A. El-Kishky、A. McLaughlin、A. Low、A. Ostrow、A. Ananthram 等人(2025)《OpenAI GPT-5 系统卡》。arXiv 预印本 arXiv:2601.03267。引用位置:§1。
- M. Song、H. Sun、J. Gu、L. Li、L. Xu、R. Krishna 和 Y. Cheng(2026)《AdaReasoner:面向迭代式视觉推理的动态工具编排》。外部链接:2601.18631、Link 引用位置:§6.2。
- S. Tan、M. Luo、C. Cai、T. Venkat、K. Montgomery、A. Hao、T. Wu、A. Balyan、M. Roongta、C. Wang、L. E. Li、R. A. Popa 和 I. Stoica(2025)《RLLM:用于语言智能体后训练的一个框架》。备注:Notion 博客 引用位置:附录 C、§5。
- A. Team(2025a)《Claude 3.7 Sonnet 系统卡》。备注:https://www-cdn.anthropic.com/9ff93dfa8f445c932415d335c88852ef47f1201e.pdf 引用位置:表 2、表 2。
- A. Team(2025b)《系统卡:Claude Opus 4 与 Claude Sonnet 4》。备注:https://www-cdn.anthropic.com/6d8a8055020700718b0c49369f60816ba2a7c285.pdf 引用位置:§1、表 2。
- A. Team(2026a)Claude Opus 4.6 系统卡。注:https://www-cdn.anthropic.com/14e4fb01875d2a69f646fa5e574dea2b1c0ff7b5.pdf 引用位置:§3.3。
- K. Team(2026b)Kimi K2.5:视觉智能体智能。外部链接:2602.02276,链接 引用位置:§1。
- O. Team(2024)GPT-4o 系统卡。外部链接:2410.21276,链接 引用位置:§D.2、§D.2、§3.1、§3.3、第 2 项、表 2、表 2。
- S. V. Vuddanti、A. Shah、S. K. Chittiprolu、T. Song、S. Dev、K. Zhu 和 M. Chaudhary(2025)PALADIN:用于修复工具故障场景的自校正语言模型智能体。外部链接:2509.25238,链接 引用位置:§6.3。
- P. Wang、Q. Wu、C. Shen、A. Dick 和 A. Van Den Hengel(2017)Fvqa:基于事实的视觉问答。IEEE 模式分析与机器智能汇刊 40(10),第 2413–2427 页。引用位置:§1、§3.2、§5。
- Y. Wei、L. Zhao、K. Lin、E. Yu、Y. Peng、R. Dong、J. Sun、H. Wei、Z. Ge、X. Zhang 等(2025)感知中的反射。arXiv 预印本 arXiv:2504.07165。引用位置:§6.2。
- [48] 维基百科。注:https://www.wikipedia.org/ 引用位置:§3.1。
- J. Wu、B. Li、R. Fang、W. Yin、L. Zhang、Z. Tao、D. Zhang、Z. Xi、G. Fu、Y. Jiang 等(2025a)WebDancer:迈向自主信息寻求智能体。arXiv 预印本 arXiv:2505.22648。引用位置:§3.1。
- J. Wu、Z. Deng、W. Li、Y. Liu、B. You、B. Li、Z. Ma 和 Z. Liu(2025b)《MMSearch-r1:激励多模态大语言模型进行搜索》。arXiv 预印本 arXiv:2506.20670。引用位置:表 2、§6.1。
- H. Yao、Q. Yin、M. Yang、Z. Zhao、Y. Wang、H. Luo、J. Zhang 和 J. Huang(2026)《Mm-deepresearch:一种简单有效的多模态智能体搜索基线》。arXiv 预印本 arXiv:2603.01050。引用位置:§6.1。
- S. Yao、J. Zhao、D. Yu、N. Du、I. Shafran、K. R. Narasimhan 和 Y. Cao(2022)《ReAct:在语言模型中协同推理与行动》。收录于第十一届国际学习表征会议。引用位置:§2、§3.3。
- S. Yu、C. Tang、B. Xu、J. Cui、J. Ran、Y. Yan、Z. Liu、S. Wang、X. Han、Z. Liu 等人(2024)《VisRAG:面向多模态文档的基于视觉的检索增强生成》。arXiv 预印本 arXiv:2410.10594。引用位置:§6.2。
- Y. Zeng、W. Huang、Z. Fang、S. Chen、Y. Shen、Y. Cai、X. Wang、Z. Yin、L. Chen、Z. Chen、S. Huang、Y. Zhao、Y. Hu、P. Torr、W. Ouyang 和 S. Cao(2026)《Vision-DeepResearch 基准:重新思考多模态大语言模型的视觉与文本搜索》。预印本。引用位置:§1、§5。
- J. Zhang、S. Zeng、K. Guo、X. Dai、H. Liu、J. Tang 和 Y. Chang(2026)《先修复再搜索:多模态检索增强生成中智能体查询视觉预处理的基准测试》。arXiv 预印本 arXiv:2602.13179。引用位置:§6.2。
- Y. Zhang、L. Hu、H. Sun、P. Wang、Y. Wei、S. Yin、J. Pei、W. Shen、P. Xia、Y. Peng 等人(2025)《Skywork-r1v4:通过图像交错思考与深度研究实现智能体多模态智能》。arXiv 预印本 arXiv:2512.02395。引用位置:§3.1、§3.1、§6.1。
- Y. Zheng、R. Zhang、J. Zhang、Y. Ye、Z. Luo、Z. Feng 和 Y. Ma(2024)《LlamaFactory:100+ 语言模型的统一高效微调》。收录于第 62 届计算语言学协会年会论文集(第 3 卷:系统演示),泰国曼谷。外部链接:Link 引用位置:附录 C、§5。
- Z. Zheng、M. Yang、J. Hong、C. Zhao、G. Xu、L. Yang、C. Shen 和 X. Yu(2026)《DeepEyes:通过强化学习激励“用图像思考”》。外部链接:2505.14362、Link 引用位置:§6.3。
- K. Zhu、Z. Liu、B. Li、M. Tian、Y. Yang、J. Zhang、P. Han、Q. Xie、F. Cui、W. Zhang、X. Ma、X. Yu、G. Ramesh、J. Wu、Z. Liu、P. Lu、J. Zou 和 J. You(2025)《大语言模型智能体在何处失败,以及它们如何从失败中学习》。外部链接:2509.25370、Link 引用位置:§6.3。
附录
附录目录
附录 A 强化学习预备知识
本节详细介绍了支撑我们多轮训练目标的强化学习(RL)预备知识。我们首先回顾标准的组相对策略优化(GRPO)算法(Shao 等人,2024),该算法针对单轮生成进行优化。随后,我们描述其向搜索增强型轨迹生成的扩展,如 Search-R1(Jin 等人,2025)所引入的方案,其中策略将生成过程与对外部搜索引擎的调用交错进行。这些公式是 OpenSearch-VL 所采用的多轮、多工具目标(见第 4.2 节)的直接前身。
A.1 标准 GRPO
GRPO(Shao 等人,2024)是近端策略优化(PPO)(Schulman 等人,2017)的一种演员-评论家变体,它消除了对学习到的价值函数的依赖。GRPO 不维护单独的评论家模型来估计基线,而是通过比较针对同一提示词采样的多个响应来推导其优势估计,这些响应共同构成一个组。这种参数高效的设计在仅有标量级结果奖励可用的场景中尤为有利,可减少内存开销并缓解训练密集的 token 级价值函数所带来的不稳定性。形式上,给定一个提示词分布和一个参考策略,GRPO 为每个提示词采样一组候选响应。每个响应通过奖励函数进行评估。为计算优势值,GRPO 在局部组内对这些奖励进行标准化:
| (13) |
通过此公式,给定响应的所有组成 token 都被赋予一个统一优势标量。随后,通过最大化裁剪的替代目标来优化策略参数:
| (14) | ||||
其中重要性采样比定义为
| (15) |
这里, 表示概率比裁剪超参数, 用于调节对固定参考策略 的 Kullback–Leibler(KL)散度惩罚强度。与标准 PPO——后者将 KL 惩罚直接并入奖励信号,且需要参数化的价值网络来近似 (Schulman 等,2017)——不同,GRPO 在损失函数层面显式施加 KL 正则化。由于 GRPO 完全从经验性的组内统计量(式 13)推导而来,它天然契合基于偏好的奖励建模的比较性结构。
A.2 结合搜索引擎的 GRPO
Search-R1(Jin 等,2025)将 GRPO 框架从单模态、单轮生成扩展为交错式、搜索增强的生成过程。Search-R1 并非采样一个孤立的响应 ,而是生成一个多步 rollout,其中既包含策略模型自身输出的 token,也包含从搜索引擎检索到的外部证据 。这种搜索增强的采样分布记为:
| (16) |
其中 表示交错算子:每当策略模型发出搜索命令时,检索到的文档会被追加到条件上下文中,策略模型随后基于这一扩展后的前缀继续生成。为防止优化器根据外部环境 token 错误地更新参数,Search-R1 采用了一个掩码函数来过滤掉非模型生成的 token。将 定义为指示变量,若 是由策略模型显式生成的,则相应的 Search-R1 GRPO 目标函数变为:
| (17) | ||||
其中包含环境条件重要性比率:
| (18) |
与标准 GRPO(式 14)相比,这一改进引入了两个关键修改。首先,期望值是针对交错分布 计算的,确保因果条件历史包含了所有先前检索到的外部证据。其次,目标函数严格按模型生成 token 的数量 进行归一化,将梯度计算限制在策略模型自主生成的位置上。对 KL 散度进行等效掩码处理,可确保模型不会因环境观测上的分布差异而受到惩罚。这些机制使 GRPO 适配工具在环(tool-in-the-loop)架构,并为我们多模态环境建模(第 4.2 节)奠定了理论基础。
附录 B 多轮搜索致命感知 GRPO 细节
在附录 A 所奠定的基础之上,本节详细阐述我们在第 4.2 节中引入的多轮、搜索增强强化学习目标的机制。我们阐明了致命执行级联的检测逻辑,并严格推导了包含单侧截断的优势估计过程;复合奖励及其三个组成部分直接在第 4.2 节中定义。
B.1 致命步骤检测逻辑
与外部环境的无约束交互不可避免地会产生“致命”状态——不可恢复的错误级联使后续推理失效。我们阐述了计算致命步骤索引 的过程,该索引驱动着致命感知的 token 掩码(公式 10)。对于长度为 的给定轨迹,我们实例化一个有状态的错误计数器,初始化为零。在每个顺序步骤 处,计数器按以下方式转换:
| (19) |
致命步骤索引随后被定义为错误阈值被突破的最早步骤:
| (20) |
在我们的实现中,我们设定 。如果从未达到该阈值,则该轨迹被归类为非致命性的,通过设定 来表示。这一公式体现了两个关键的设计特性。首先,显式的重置条件()确保孤立的瞬时错误——这类错误在真实网络环境中普遍存在且通常可恢复——不会过早地中止轨迹。其次,保守的阈值()规定,只有在连续三次失败之后,轨迹才被视为致命性的,这为自回归策略在梯度掩蔽之前提供了稳健的自我纠正机会。触发此计数器的工具执行错误包括超时、格式错误的 API 载荷以及参数解析失败;这些错误由执行沙箱以确定性方式标记,不依赖于任何学习到的启发式方法。
B.2 单侧截断下的优势推导
我们详细阐述了支撑公式 12 中目标函数的优势估计协议。
步骤 1:无偏组统计量。
对于从相同提示词 采样得到的一组轨迹展开,经验组均值 和标准差 是在复合奖励上计算的:
| (21) |
此处, 表示停止梯度算子。因此, 和 在反向传播过程中充当静态归一化常数。梯度仅流经在未掩蔽的、由策略生成的 token 上评估的重要性采样比率。
第 2 步:通用组归一化。
组内的每条轨迹都会被赋予一个标准化奖励:
| (22) |
其中 用于保证数值稳定性。关键在于,所有轨迹——明确包括那些因致命条件而被截断的轨迹()——都会被纳入 和 的计算中。这种刻意的纳入确保了致命轨迹能够积极塑造组级基线,从而锚定整个采样群体中的相对性能排序。
第 3 步:致命感知的单侧截断。
标准化奖励通过一个分段截断函数映射为最终的优势估计值:
| (23) |
第 4 步:梯度主导性优于硬掩码。
我们现在将这一非正式论断形式化:在梯度信息量方面,致命感知截断严格优于(Huang 等人,2026)提出的硬掩码基线。设
| (24) |
表示在我们的方案下,每条轨迹(未截断)对 的贡献,并设 表示在硬掩码基线下的相应贡献,该基线会完整丢弃每一条致命轨迹,因此当 时始终有 。我们在致命轨迹的支撑集上对两者进行比较。
命题1(对硬掩码的优势性)。
固定任意致命轨迹()。那么:
-
如果,那么。
-
如果,那么,而与搜索增强的 GRPO 梯度(式 17)在其可行前缀上的限制一致,并在非负优势处求值。
因此,在信息性上弱优于:它从不通过致命后缀传播梯度,从不惩罚可行前缀,并且对那些组归一化回报超过基线的前缀严格提取正向强化。
证明。
由式 11,蕴含,因此代理项及其梯度在式 24 中恒为零;结合硬掩码定义中的,这确立了(i)。对于,有,而致命感知掩码恰好保留可行前缀中策略生成的 token,并将(a)环境发出的 token 和(b)所有致命后 token 置零。在此支撑集上,式 24 的逐 token 被积函数逐项约化为式 17 中具有相同重要性比率和优势的形式,因此逐 token 代理项——进而其梯度——一致。由于根据定义,这确立了(ii)。∎
总体而言,单侧截断安全地忽略了无效的信用分配,同时选择性地从过早截断但高质量的探索性 rollout 中提取正向强化。
截断下组统计量的偏差。
这种不对称的定义需要诚实的核算。我们在第 1 步中对所有 rollout(包括致命轨迹)进行计算,因此标准化分数在组内是零均值的;第 3 步随后将致命轨迹上的任何负值映射为零。设 索引组内的致命子集,
| (25) |
因此该截断操作相对于零均值的 GRPO 基线引入了非负偏差,以换取在可行前缀上获得非零梯度。我们认为这种权衡在我们的场景下是良性的,原因有二。(a) 致命 rollout 集中于较低模态。图 5 显示,致命 rollout 中 的比例具有 并被截断为零,而存活的残余部分则与具有竞争力的非致命 rollout 处于相同的分数区间;因此 主要由可行前缀经验上质量较高的样本主导,而非对低质量致命样本的无差别抬升。(b) 相对排序的保持。由于 仅将致命子集向上移动,且从不改变非致命优势的相对位置,组内非致命轨迹之间的排序——这正是 GRPO 实际利用的信号——得以完整保留。因此,我们将 解释为一种受控的正向偏差,它买回了对过早截断但具有潜力的前缀的梯度;用无偏估计器(例如,仅基于非致命 rollout 计算的单独基线,或对 的双重稳健校正)替代截断操作是一个有趣的替代方案,我们留待未来工作探索。对所得截断行为的合理性检查,包括按组难度细分以及跨组的聚合分数分布,已在第 5 节(图 4 和图 5)中报告。
附录 C 实现细节
我们的智能体 SFT 流水线基于 LlamaFactory(Zheng 等人,2024)构建,并在此基础上扩展了多轮、工具交错的数据整理器,以及一套感知 Qwen3-VL 的视觉/文本打包方案,使得视觉工具(Crop、Sharpen、SuperResolution、PerspectiveCorrect、OCR)产生的交错图像观测能够被策略模型原样消费。我们的 RL 流水线则联合基于 rLLM(Tan 等人,2025)和 Vision-DeepResearch(Huang 等人,2026):前者我们采用了异步智能体 rollout 架构(解耦的轨迹生成、回放和策略更新 worker),后者我们采用了多模态轨迹抽象。在这两者之上,我们实现了一个 Qwen3-VL 聊天模板渲染器、一个用于变长视觉观测的交错图像 token 重新对齐例程,以及一个支持工具调用中断与恢复的异步多轮 rollout 引擎。由此得到的流水线即用于训练本文中所有 OpenSearch-VL 变体。
C.1 SFT 训练配置
| 类别 | 超参数 | 取值 / 设置 |
| 模型 | 基础模型 | Qwen3-VL-8B-Instruct(32B、30B-A3B) |
| 图像最大像素数 | () | |
| 视频最大像素数 | () | |
| 信任远程代码 | True | |
| 方法 | 微调类型 | 全量 |
| 视觉塔冻结 | False | |
| 多模态投影器冻结 | False | |
| DeepSpeed 阶段 | ZeRO-3 | |
| 混合精度 | bfloat16 | |
| 数据集 | 总样本数 | 36592 |
| 模板 | qwen3_vl | |
| 截断长度 | tokens | |
| 预处理工作进程数 | 16 | |
| 数据加载工作进程数 | 4 | |
| 训练 | 每设备批大小 | 1 |
| 梯度累积步数 | 1 | |
| 有效批大小 | 256() | |
| 梯度检查点 | True | |
| 学习率 | ||
| 训练轮数 | 8 | |
| 学习率调度器 | cosine | |
| 预热比例 | 0.1 | |
| 基础设施 | GPU 总数 | 256(32 节点 × 8) |
| 编排 | Ray + DeepSpeed ZeRO-3 | |
| 放置策略 | PACK | |
| 每个 Worker 的资源 | 1 GPU | |
| 日志 / I/O | 日志记录步数 | 5 |
| 检查点保存步数 | 400 | |
| 绘制损失曲线 | True | |
| 报告后端 | TensorBoard |
表 4 报告了三种 OpenSearch-VL 变体在智能体监督微调阶段使用的完整超参数配置。三种模型规模(8B 稠密、32B 稠密、30B-A3B 混合专家)共享相同的训练超参数——仅基础检查点路径不同——因此我们将它们合并为一张表呈现。所有运行均使用全参数微调(包括视觉塔和多模态投影器),并采用 DeepSpeed ZeRO-3 与基于 Ray 的编排,运行在 256 块 GPU(32 节点 × 8 GPU)上。
C.2 强化学习训练配置
表 5 报告了我们进行强化学习微调的两个 OpenSearch-VL 变体——8B 稠密(Qwen3-VL-8B-Instruct)和 30B-A3B MoE(Qwen3-VL-30B-A3B-Instruct)——在多轮致命感知 GRPO 阶段的关键超参数。两次运行使用相同的异步 SGLang rollout 引擎和相同的 Megatron 并行 actor,并共享同一算法模板(GRPO 组相对目标下的 RLOO 留一优势估计、低方差 KL 控制器、无 critic)。我们仅列出启动脚本中显式设置的字段;框架默认值(例如优化器 beta、奖励模型路径、检查点恢复标志)已省略。两个变体取值相同的行只写一次;取值不同的行拆分为两个单元格。
| 类别 | 超参数 | 8B(稠密) | 30B-A3B(MoE) |
|---|---|---|---|
| 模型 | 基座模型 | Qwen3-VL-8B-Instruct | Qwen3-VL-30B-A3B-Instruct |
| 训练数据类型 | bfloat16 | ||
| 数据 | 训练批次大小(提示词数) | 256 | |
| 验证批次大小 | 64 | 512 | |
| 最大提示词长度 | tokens | ||
| 最大回复长度 | tokens | ||
| 数据随机种子 | 3407 | ||
| Rollout | 引擎 | SGLang(异步模式) | |
| Rollout 张量并行 | 4 | ||
| 每个提示词的样本数() | 8 | 16 | |
| GPU 显存利用率 | 0.85 | 0.65 | |
| 训练 / 验证温度 | 0.7 / 0.7 | ||
| 训练 / 验证 Top- | 1.0 / 0.95 | ||
| Top- | (已禁用) | ||
| 策略(Actor) | 策略 | Megatron-LM | |
| 张量并行(TP) | 4 | ||
| 流水线并行(PP) | 2 | ||
| 上下文并行(CP) | 8 | 4 | |
| 专家并行 / ETP | — | 8 / 1 | |
| PPO 微批大小 | 64 | 128 | |
| PPO 每 GPU 最大 token 长度 | |||
| 每 GPU 微批大小 | 1 | ||
| 动态批大小 | 是 | ||
| 参数 / 优化器 / 梯度卸载 | CPU | ||
| 梯度检查点 | 全量重计算,均匀(1 层) | ||
| 优化器 / 损失 | Actor 学习率 | ||
| PPO 裁剪比率(高) | 0.28 | ||
| 熵系数 | 0.0 | ||
| 使用 KL 损失 | 否 | ||
| KL 损失 / 控制器系数 | / | ||
| 损失聚合 | 序列均值-词元求和 | ||
| 算法 | 优势估计器 | RLOO(在 GRPO 目标内) | |
| KL 类型 | 低方差 KL | ||
| 致命感知掩码 | 真(未知 + 错误) | ||
| 工具智能体 | # 并行任务数 | 256 | |
| # 并行工具调用数 | |||
| 逐步优势 | 假 | ||
| 训练器 | 集群 | 8 节点 × 8 GPU = 64 GPU | |
| 保存 / 测试频率(步数) | 50 / 10 | 1 / 10 | |
| 总轮数(Epochs) | 100 | 5 | |
| 评论器预热 | 0(无评论器) | ||
| 仅 MoE(30B-A3B) | 路由器数据类型 | — | fp32 |
| 辅助损失系数 | — | 0.01 | |
| 路由器 Z 损失系数 | — | ||
| 置换融合 | — | True | |
附录 D 数据整理细节
本节以第 3.1 节为基础,给出多跳 VQA 构建流程的完整操作规范,并通过一个具体的种子页面端到端地追踪该流程。以下所有统计数据均基于 2025-05-01 版本的英文维基百科快照计算得出。
D.1 路径采样超参数
我们固定使用针对该快照测得的入度(in-degree)作为衡量标准。任何入站计数超过阈值的候选节点都会被跳过,从而剔除约排名最靠前的所有文章节点。这一截断排除了洲级、国家级和世纪级页面(如 United_States、Queensland、21st_century、English_language),因为对于这些页面,公式 6 中的唯一性不变式经常被违反;同时保留了承载实质性语义内容的长尾实体页面。
路径长度分布。
路径长度按特定分布进行采样。较短的路径更受青睐,以便保持下游展开范围(rollout horizons)的可控性;上限是根据经验设定的,因为超过四跳的游走路径若不经大量重采样,很少能通过公式 6 的唯一性和非泄漏检查。除正文中陈述的三条规则外,游走过程还会跳过:
-
任何标题中包含子字符串“(disambiguation)”,或以 List of、Outline of、Index of 或 Timeline of 开头的条目;
-
所有非文章命名空间,即 Template:、Category:、File:、User:、Help:、Portal:、Wikipedia:;
-
重定向页面:每个出链首先会被解引用到其目标文章,上述排除规则应用于解引用后的目标,而非表面链接本身。
种子节点通过分层抽样从五个粗粒度领域抽取——人物、建筑/地点、位置(非枢纽)、生物体和人工制品——以平衡可视觉接地类别的代表性。一个节点有资格作为种子当且仅当它(i)具有信息框;(ii)链接到至少一张分辨率不低于 的维基共享资源图片;且(iii)在 中的入度满足要求,从而确保该种子既不是死胡同也不是枢纽节点。以固定种子为根的游走最多重试 次,只要它(i)命中枢纽节点或被过滤的命名空间,(ii)对某个通过 LLM 唯一性评估器的桥接节点未能生成任何描述符,或(iii)终止于信息框中没有任何属性满足六 token 长度下限的节点。耗尽所有尝试的种子将从最终池中剔除。
D.2 运行示例:Australia_Zoo
为使第 3.1 节的五个阶段更加具体,我们在种子页面 Australia_Zoo 上端到端追踪该流水线,其中 。Australia_Zoo 的出链首先按照附录 D.1 的排除规则进行划分。每个分区的代表性条目如下:
-
保留(实体页面,入度低于 ):Bob_Irwin、Steve_Irwin、Terri_Irwin、Bindi_Irwin、Robert_Irwin、The_Crocodile_Hunter、Wildlife_Warriors、Beerwah,_Queensland、Rosedale,_Queensland、Angkor_Wat、……
-
枢纽拒绝(入度 ):Queensland、Brisbane、Australia、United_States、Zoo。
带 n 个样本的随机游走
从 的引导段落中,我们提取澳大利亚公民身份这一属性的日期,得到简短答案(3 个 token)。随后用完整路径及其关系提示 GPT-4o(Team, 2024),以综合生成规范性问题
| “史蒂夫·欧文——1991 年接管澳大利亚动物园管理的那位男士——的妻子特里·欧文是在哪一天 | |||
| 成为澳大利亚公民的?” |
改写从距离 最远的桥接处开始,向 推进。表 6 列出了 GPT-4o(Team, 2024)根据 的维基百科上下文提出的描述符候选,以及唯一性评估器返回的判定结果。保留第一个被接受的描述符(并列时均匀随机打破)。
| 描述符(针对 ) | 唯一性判定 |
|---|---|
| “1991 年接管 [] 管理的那位男士” | ✓ 唯一 |
| “2006 年被黄貂鱼刺死的野生动物纪录片主持人” | ✓ 唯一 |
| “[] 创始人之子” | – 鲍勃和琳育有三个孩子(乔伊、史蒂夫、曼迪) |
被接受的描述符生成模糊形式
| “1991 年接管 | |||
| 澳大利亚动物园管理的那位男子的妻子,是在哪一天成为澳大利亚公民的?” |
公式 6 的三个不变量均得到满足: 得以保留,描述符与“妻子”组合后能唯一指向 Terri Irwin,且 中不包含 上任何节点的表面形式或别名(例如 Steve Irwin、Terri Irwin 和 The Crocodile Hunter 均未出现在 中)。随后,我们以查询词 Australia_Zoo 从 Wikimedia Commons 检索候选图像,并按与规范描述“Australia Zoo entrance”的 CLIP(Radford 等人,2021)余弦相似度进行排序。排名最高的图像(图 6,相似度 )被选为 。将 中的锚点提及替换为视觉指称表达,即得到最终的 VQA 实例
该实例通过了第 3.1 节的全部四项检查:掩蔽( 中不含 中的任何实体名称或别名);唯一性(仅给定 时,GPT-4o 评判器恰好返回一个一致的答案);视觉相关性(CLIP 相似度超过我们的阈值);以及非平凡性,该检查在第 3.2 节的过滤流程中联合验证。
D.3 反事实设计选择
我们通过在上面的运行示例中反事实地放宽第 3.1 节中的三个关键设计选择,来探究它们的必要性。
锚定答案。
换成一张特里·欧文(Terri Irwin)的照片并询问她的入籍日期,会把任务简化为一次反向图片检索:对新图片执行 ImageSearch 会直接返回特里·欧文的维基百科页面,从中一步即可读出入籍日期。多跳结构就此瓦解,与问题的表述方式无关。
不做模糊测试。
将规范问题保留为最终问题——即跳过模糊改写阶段——会使所有实体名称以明文形式暴露,仅需一次 TextSearch(“Terri Irwin 澳大利亚公民身份日期”)即可恢复。图像因此变得装饰性而非关键性。
无枢纽规避。
如果允许路径将枢纽 Queensland 作为桥梁纳入,那么诸如“位于 [] 的动物园”这样的自然描述将无法通过唯一性检查——数千家动物园都满足这一关系——从而迫使要么重新采样失败,要么采用本身就泄露 Australia_Zoo 身份的牵强描述。枢纽规避(附录 D.1)在采样阶段即消除了这一失败模式,而非依赖下游过滤器来捕捉。
附录 E 系统提示词
本节提供 OpenSearch-VL 中使用的完整系统提示词。智能体系统提示词(图 7)在推理和 SFT 数据收集过程中共用,并与机器可读的工具模式(图 8)配对,该模式以 `<tools>...</tools>` 的形式注入模型上下文,用于 OpenAI 风格的工具调用。两个奖励评判提示词(图 8 和图 11)在 RL 训练期间分别用于计算准确率奖励和查询质量奖励。在最终基准测试报告中,我们还额外采用了与 Vision-DeepResearch(Huang 等人,2026)评估协议保持一致的 GPT-4o 评判提示词(图 10),以确保我们的数据与先前的多模态深度研究工作保持直接可比性。
附录 F 工具定义与使用
本节详细介绍 OpenSearch-VL 中集成的面向搜索的工具。对于每个工具,我们阐述其核心功能、形式化其输入-输出签名、描述其后端实现,并说明其在视觉搜索轨迹中的操作角色。该工具集分为三个功能模态:检索、图像增强以及注意力与解析。检索工具通过远程 API 与开放网络交互;图像增强工具作为轻量级、确定性的本地原语运行;注意力与解析工具则将本地空间先验与远程文档理解服务相结合。
检索工具
-
TextSearch
- –
功能:一种复合文本检索机制,包含三个流水线阶段:(i) Serper 后端搜索查询,用于检索排名靠前的候选 URL;(ii) 调用 JINA Reader 获取 HTML 内容并将其规范化为干净的 Markdown;(iii) 通过 Qwen3-32B 摘要处理,将每个文档提炼为面向查询的 2-4 句概要。最终输出是一个结构化的 [Passage](标题、URL、摘要)对象列表。
- –
操作角色:当表面级片段不足以满足需求时,作为主要的“读取网络”原语。它对于解决复杂的多跳知识查询以及检索需要跨整段文本进行推理的长尾事实证据至关重要。
- –
-
ImageSearch
- –
功能:一款由 Polaris Lens API 驱动的视觉实体与反向图像搜索工具。它接收一个可公开访问的图像 URL,并返回结构化的 JSON 数据,其中包含视觉相似图像、识别出的实体、相关域名 URL,以及与查询图像关联的文本描述。
- –
运行角色:充当将纯视觉查询转化为可检索文本实体的关键桥梁。当智能体判定某个查询的解决依赖于识别未知视觉实体(例如地标、标志或公众人物)时,它会调用 ImageSearch 来提取外部语义依据,随后可通过 TextSearch 进行交叉验证。
- –
图像增强工具
-
Sharpen(锐化)
- –
功能:一种通过 OpenCV 反锐化掩模实现的确定性去模糊算子。以输入图像和可选的锐化强度为参数,计算得到增强后的图像,其中 为高斯模糊核。
- –
运行角色:当输入图像呈现大面积模糊或边缘渐变柔和(这通常会降低下游光学字符识别(OCR)或目标检测的性能)时启用。作为一种计算成本低、无副作用的预处理步骤,智能体可以在重新调用感知工具之前启发式地应用 Sharpen。
- –
-
SuperResolution(超分辨率)
- –
功能:一种基于深度学习的图像放大工具,采用 EDSR 架构,通过 OpenCV 的 dnn_superres 模块实现。它接收一张图像和一个离散缩放因子(默认值),输出高分辨率重建结果。为保证鲁棒性,若部署环境中缺少 EDSR 权重文件,它会优雅降级,直接返回原始图像。
- –
运行作用:对于缓解分辨率瓶颈至关重要,尤其是在紧密裁剪的图像块或本身保真度较低的输入(如缩略图)上。通过合成高频细节,它能显著提升后续 OCR 调用的可靠性与提取准确率。
- –
-
透视校正
- –
功能:一种自动透视校正基础组件。它在灰度投影上执行 Canny 边缘检测流程,提取最大四边形轮廓,并计算四点透视变换,将图像矫正到正面平行平面。若无法确定可靠的四边形,则回退到原始图像,同时输出诊断性警告。
- –
运行作用:解决真实世界拍摄中普遍存在的域偏移问题,例如倾斜拍摄的文档、收据或屏幕照片。矫正图像几何形状可显著提升下游 OCR 解析的边界框精度与文字识别保真度。
- –
注意力与解析工具
-
裁剪
- –
功能:一种确定性的空间注意力原语。以一张图像和一个边界框坐标元组为参数,提取并隔离指定的矩形子区域,将产物写入磁盘以供后续引用。
- –
操作角色:模拟人类将视觉焦点集中于杂乱场景中密集子区域的认知机制(例如,在多面板图中隔离出单个图表)。它是策略在将干净、局部化的图像块传递给 OCR、SuperResolution 或 ImageSearch 等下游工具之前抑制周边噪声的标准机制。
- –
-
OCR
- –
功能:一种由远程 PaddleX 基础设施支持的、具备版面感知能力的光学字符识别服务。它接收 base64 编码的图像,以及用于图表识别和文档方向分类的可选标志。它输出检测到的文本块的层级列表(分类为标题、正文、脚注等),生成明确的 block_label、block_content,以及按阅读顺序重建的 formatted_text。
- –
操作角色:作为智能体主要的“读取图像”能力。除了纯字符识别外,它对文档逻辑版面的保留对于依赖结构层级关系的查询(例如,区分图注与章节标题)不可或缺。它最适合在上游增强(PerspectiveCorrect、Sharpen、SuperResolution)或空间隔离(Crop)之后调用。
- –
附录 G 案例研究
图 9 展示了 OpenSearch-VL 在一个知识密集型视觉问题(“这座桥是哪一年通车的?”)上的代表性端到端轨迹,该问题的答案既无法从编码器的参数化知识中恢复,也无法通过任何单次检索调用获得。智能体首先对路边标牌执行 Crop 操作,将注意力聚焦在最具判别性的子区域,然后将裁剪后的图像块转发给 ImageSearch 以将该结构识别为 Kessock Bridge,随后发起一次针对性的 TextSearch,证实其通车年份为 1982 年。该轨迹例证了视觉-检索动作空间、查询质量奖励以及致命感知掩码方案被共同设计以激励的“验证而非猜测”的组合式行为:工具以逐步锚定问题的顺序被串联使用,且一旦跨模态证据汇聚, rollout 即告终止。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org