定位何处:基础模型能否通过主动探索达到目标视角
Where to Look: Can Foundation Models Reach a Target Viewpoint Through Active Exploration?
研究提出目标视角复现任务(TVR)与模拟基准TVRBench,评估基础模型在3D环境中主动调整视角以匹配目标图像的能力。当前最优开源与闭源模型成功率仅7.8%和12.0%,瓶颈在于处理多轮视觉历史及需要平移而非旋转时的性能下降。通过构建统一的后训练框架,视觉动作SFT将9B开源模型成功率提升至50.8%,多轮GRPO进一步达到51.4%,为训练主动感知与行动的模型提供了基准。代码与模型已开源。
主动探索视角是具身智能的关键短板,这篇论文用一个新基准把问题量化了——目前最强的模型也只能对上12%的目标。他们同时放出了训练框架和代码,做空间智能的可以直接拿来跑。
摘要
人类能够通过主动的头部和身体运动,复现目标图像所指定的视角,然而基础模型中的空间智能在很大程度上仍被研究为对预先收集的观测数据的被动理解。我们引入了目标视角复现(TVR)——一项主动任务,要求智能体在3D环境中调整其视角,直到其观测与给定的目标图像相匹配——并提出了TVRBench,一个覆盖场景规模与目标视角视觉丰富度的室内模拟基准。TVR远未得到解决:在评估集上,最强的开源和闭源模型仅能达到 和 的成功率。细粒度分析识别出两个一致的瓶颈:现成模型难以处理多轮视觉历史,并且当视角复现需要身体平移而非原地旋转时,性能急剧下降,这暴露了将空间差异映射到具身运动方面的差距。为研究如何缩小这一差距,我们构建了一个统一的TVR后训练框架,涵盖专家轨迹SFT、理由监督的CoT-SFT、离线单轮GRPO以及基于实时模拟器rollout的在线多轮GRPO。视觉-动作SFT提供了主要增益,将9B开源模型的成功率提升至 ;多轮GRPO提供了针对性的多房间优化,达到了 的整体成功率,而CoT监督和单轮GRPO则降低了闭环性能。这些结果确立了TVRBench作为一个用于测量和训练在3D环境中主动感知与行动的基础模型的测试平台。我们的代码、数据和模型可在 https://github.com/aim-uofa/TVRBench 获取。
看向何处:基础模型能否通过主动探索达到目标视角?
李力扬*,朱牧之*,赵志越,赵恒宇,刘珂,钟林浩,陈浩,申春华† 浙江大学 *同等贡献 †通讯作者
![[Uncaptioned image]](/api/img-proxy?u=https%3A%2F%2Farxiv.org%2Fhtml%2F2606.01247v1%2Fx1.png&mode=full&exp=1790899200&sig=b2fda37a48dd2f4c)
1 引言
从单张目标图像复现视角是主动空间智能的一种基本形式。智能体必须将目标图像与其自我中心视图进行比较,推断视角差异,将其映射为身体平移、旋转和头部运动,根据新观察更新空间信念,并判断何时匹配足够精确以停止。人类天生就能做到这一点:我们不是在静态内容上进行被动匹配,而是在三维空间中移动、收集视觉证据,并通过封闭的感知-行动循环来优化动作。
近期关于基础模型(尤其是多模态大语言模型)的空间智能研究,引入了多种任务和基准,用于评估相对位置、方向关系、三维布局和跨视角推理(Chen 等人,2024;Cheng 等人,2024;Hong 等人,2023;Yang 等人,2025b)。然而,大多数研究假设视觉观察是预先给定的——以静态图像、多视角输入或预录视频的形式——因此只询问“什么在哪里”,而不问“下一步我应该移动到哪里、看向哪里”。诸如 ImageNav(Zhu 等人,2017;Krantz 等人,2022)等主动探索任务更接近具身空间智能,但通常评估的是智能体是否到达目标区域,而非其最终的自我中心观察是否复现了目标图像。
这引出了一个核心问题:基础模型能否推断当前到目标的空间关系,将其映射为具身动作,并通过主动探索复现目标视图?我们提出了目标视角复现(TVR)任务:智能体在三维环境中接收目标图像和初始观察,然后采取行动,直到其观察与目标匹配。TVR 是主动式的,在封闭的感知-行动循环中收集新观察,并评估显式的视角控制:智能体必须复现目标视角,而不仅仅是到达某个区域。我们在室内仿真环境中将 TVR 实例化为 TVRBench,涵盖单房间和多房间场景,并包含用于评估探索效率、空间记忆和感知到行动映射的诊断指标。
在我们评估的开源和闭源多模态大语言模型中,TVRBench 显示目标视角复现任务远未解决:最强的开源模型成功率达到 ,最强的闭源模型达到 ,而人类在 100 项任务子集上的表现为 。细粒度分析发现两个瓶颈。首先,现成模型难以处理多轮视觉历史:每个开源模型在使用纯动作回顾时的表现都优于完整的视觉-动作记忆(平均差距 个百分点)。其次,当视角复现需要身体平移而非原地旋转时,性能会下降,这表明主要困难在于将空间差异映射到具身运动,而非静态视觉识别。
我们构建了一个统一的 TVR 后训练框架来针对这些瓶颈,涵盖专家轨迹 SFT(Kim 等人,2024)、CoT-SFT、离线单轮 GRPO(Liao 等人,2025)以及基于实时推演的在线策略多轮 GRPO(Zeng 等人,2024)。该框架用于比较闭环主动感知中的模型/训练范式。视觉-动作 SFT 带来了主要提升,将 Qwen3.5-9B 提升至 (不含 CoT)。多轮 GRPO 将 VA-SFT 进一步优化至 ,主要改进在 SFT 表现最弱的多房间任务上。相比之下,CoT 监督和单轮 GRPO 降低了成功率,这表明逐步骤推理或动作匹配可能无法迁移到具身多步控制中。
我们的主要贡献如下:
- •
我们引入了目标视角复现(TVR),这是一个闭环的目标视角复现任务,以及 TVRBench,一个带有诊断探索效率、空间记忆和感知到动作映射协议的室内模拟基准。
- •
我们在 TVRBench 上对开源和闭源基础模型进行了基准测试,并识别出两个一致的瓶颈:利用多轮视觉历史以及将空间差异映射到身体平移。
- •
我们开发了一个统一的 TVR 后训练框架,用于在闭环环境中比较专家轨迹 SFT、CoT-SFT 以及单轮/多轮 GRPO。
- •
利用该框架,我们证明视觉-动作 SFT 提供了主要改进(),多轮 GRPO 提供了针对性的多房间优化(总体 ),而 CoT 监督和单轮 GRPO 会降低闭环性能。
2 相关工作
2.1 空间智能
早期关于空间智能的基础模型工作主要处理静态输入:模型基于文本-图像对或单次视觉观测,回答关于相对位置、朝向、方向关系、拓扑结构或三维布局的问题(Johnson 等人,2017;Liu 等人,2023;Wang 等人,2024;Chen 等人,2024;Cheng 等人,2024;Li 等人,2025)。后续工作将其扩展到多视角场景,用于跨视角匹配、空间关系推理以及局部到全局的场景结构理解(Hong 等人,2023;Yeh 等人,2026;Yin 等人,2025;Xu 等人,2025;Yang 等人,2025b),并进一步扩展到视频领域,通过连续观测实现空间更新与时序推理(Yang 等人,2025a;Zhou 等人,2025)。另一条研究路线则通过具身问答和功能预测,将空间推理落地到具身智能体中(Ma 等人,2022;Majumdar 等人,2024;Zhou 等人,2024;Yuan 等人,2024)。
然而,在各种设定下,视觉观测通常是预先采集的,而非通过探索获取:模型只被问及“什么东西在哪里”,而不会被问“下一步应该看向哪里”。
2.2 主动具身推理
视觉导航主导了主动具身任务。目标通过物体类别(ObjectNav,Batra 等人,2020)、目标图像(ImageNav,Zhu 等人,2017;Krantz 等人,2022)或自然语言指令(VLN,Anderson 等人,2018;Zhou 等人,2024)来指定。在各种设定下,成功的衡量标准是智能体的位置是否到达目标区域或是否完成了指令,而非其最终观测是否复现了目标视角。即使是 ImageNav,虽然使用了目标图像,但评分依据是位置接近程度,而非精确的视觉匹配。
近期研究探索了基础模型的主动空间推理能力(Yang 等人,2025a;Yin 等人,2025;Zhu 等人,2025b;Zhang 等人,2026;Zhu 等人,2025a),这些研究通常使用简化后的动作空间,例如瞬间移动或受限的智能体位置。同时,关于人形机器人视觉搜索的研究(Yu 等人,2025)探讨了仅通过头部旋转在全景图中进行物体和路径搜索,而基于视觉的主动视角选择(Koo 等人,2025)则是在不重现特定目标的情况下,选择信息量最大的下一个视角。Hong 等人(2026)引入了 ESI-Bench,这是一个涵盖十类 OmniGibson 任务的广泛具身空间智能基准测试。Sakamoto 等人(2026)则提出了 E3VS-Bench,用于在 3DGS 场景中进行主动视觉问答。
TVR 与上述设定在两个维度上有所不同:(i) 其成功与否由明确的视角匹配来定义——智能体的观测必须重现给定目标图像的视角——而非到达某个位置、识别某个物体或完成某项指令;(ii) 其动作空间同时涵盖身体移动和头部旋转,没有瞬间移动、固定位置或局限于单一动作模态,因此需要协调配合。
2.3 视觉语言与具身任务的后训练
近期研究将后训练应用于空间推理视觉语言模型,在静态空间基准测试上取得了显著提升。基于模拟器生成的空间问答数据进行的大规模监督微调确立了监督范式(Ray 等人,2024),而纯 GRPO 方法则使一个小型视觉语言模型在视频空间问答任务上超越了专有基线模型(Liao 等人,2025)。此外,一种先监督微调后 GRPO 的两阶段方法已成为主流方案(Wu 等人,2026)。然而,这些方法针对的是基于预先收集输入数据的静态空间问答,而非闭环主动感知。
视觉-语言-动作(VLA)模型通过在机器人数据上进行监督式演示,将预训练的视觉语言模型扩展到机器人控制领域(Kim 等人,2024;Black 等人,2024),将具身控制建模为动作 token 序列预测。同时,基于 Transformer 架构的在策略强化学习研究表明,扩展强化学习能够产生强大的具身导航智能体(Zeng 等人,2024)。
我们的实验表明,这种逐步骤范式与 TVR 的主动多步骤结构之间存在不匹配:逐步骤的单轮 GRPO 性能退步至低于其 SFT 初始化的水平,而基于实时轨迹的多轮 GRPO 则能够对监督先验进行精炼而非覆盖重写。
3 目标视角复现与 TVRBench
主动空间智能不仅涉及识别当前可见的内容,还需要选择下一步看向何处,并通过移动来获取该视角。我们通过一项任务来研究这种能力,该任务的成功取决于视角恢复,且不将语言理解作为混淆因素。
3.1 TVR 任务
在目标视角复现(TVR)任务中,智能体在三维室内环境中运行,并获得一张来自同一场景中某个视角的单一目标图像。在每个时间步,智能体观察当前的第一个第一人称图像并选择一个动作。当智能体选择“停止”动作或达到任务步数限制时,该回合结束。只有当智能体的最终位姿与目标视角完全匹配时,才算成功。
状态与动作空间。
智能体状态包括地面平面位置、身体偏航角和相机俯仰角。在每个步骤中,智能体从九个离散的以智能体为中心的动作中选择一个。前进、后退、左移和右移使身体平移米。左转和右转使身体旋转;抬头和低头使相机俯仰角变化。停止表示任务完成并结束该回合。
观测与终止。
在每个步骤中,智能体仅观察从其当前位置渲染的第一人称 RGB 图像,无法获取其位姿、目标位姿或场景地图等特权信息。当智能体发出“停止”指令或达到任务步数限制时,该回合结束。单房间任务的步数限制为步,多房间任务为步,因为多房间任务通常需要更长的路径。
成功标准。
由于动作步骤与目标姿态共享同一离散姿态网格,智能体能够精确到达目标姿态。当且仅当智能体发出停止指令且其最终姿态与目标姿态完全一致时,该回合视为成功:
因此,最终观测结果必须与目标视角精确匹配,而非仅近似匹配。成功与否的评估基于与动作空间相同的姿态网格。在此分辨率下,相邻姿态会产生可区分的观测结果,因此精确匹配能够恰当地检验视角同一性。
| 模型 | 总体 | 单房间简单 | 单房间困难 | 多房间简单 | 多房间困难 | 步数 | 首次停止 | |||
|---|---|---|---|---|---|---|---|---|---|---|
| Qwen3.5-9B (VA) | ||||||||||
| Qwen3.5-9B (AO) | ||||||||||
| Qwen3.5-27B (VA) | ||||||||||
| Qwen3.5-27B (AO) | ||||||||||
| Qwen3.5-35B-A3B (VA) | ||||||||||
| Qwen3.5-35B-A3B (AO) | ||||||||||
| Qwen3.6-27B (VA) | ||||||||||
| Qwen3.6-27B (AO) | ||||||||||
| Qwen3.6-35B-A3B (VA) | ||||||||||
| Qwen3.6-35B-A3B (AO) | ||||||||||
| GPT-4o (VA) | ||||||||||
| GPT-4o (AO) | ||||||||||
| GPT-5 (VA) | ||||||||||
| GPT-5 (AO) | ||||||||||
| Gemini-3.1-Pro (AO) | ||||||||||
| 人类 |
3.2 TVRBench基准测试
设计原理。
TVRBench将视角复现中的两个难度来源分离:场景规模与目标视角视觉证据。场景规模用于测试智能体是否能够超越局部调整,因为多房间场景需要穿越房间才能到达目标区域。目标视角证据则决定了图像如何消除视角歧义:物体丰富的视角提供了地标和几何线索,而稀疏视角则提供更少的锚点。我们根据场景规模和目标视角视觉丰富度进行分层,每个维度均设有简单/困难等级。四个规模相等的类别——单房间简单、单房间困难、多房间简单、多房间困难——支持对移动难度和目标视角证据的分析。
场景来源与采样。
TVRBench 使用两种场景来源:单房间任务采用 iTHOR(Kolve 等人,2017),包含厨房、客厅、卧室和浴室;多房间任务则采用 ProcTHOR-10k(Deitke 等人,2022),包含由实体墙壁分隔的两室或三室住宅。我们按比例将每种来源的场景划分为互不相交的 SFT 集、评估集和 RL 训练集,并将评估场景排除在训练集之外。对于每个场景,我们从可达网格中均匀采样(起点,目标)位姿对,并根据可见物体数量(从目标视角可见的非结构物体¹¹¹数量,墙壁、地板、天花板及智能体本身不计入在内)以及从起点到目标的最短动作路径长度进行筛选。简单任务要求至少达到目标可见物体数量,而困难任务则只允许更少的数量。最短路径在单房间场景中涵盖一定数量的动作步骤,在多房间场景中则涵盖另一数量。该基准测试包含每个类别一定数量的任务,以及总计一定数量的评估任务。代表性示例见图 2。
记忆表征。
智能体需要一条轨迹记录来避免重复访问并判断朝向目标的进展,这使得过去步骤的表征成为一个重要的设计选择。我们在整个实验中使用两种记忆表征。在仅动作记忆(AO)中,模型接收当前观测、目标以及先前动作的简要摘要。在视觉-动作记忆(VA)中,完整的过去观测-动作序列在多轮多模态上下文中保持可用。这些表征体现了不同的权衡。VA 测试模型是否能有效利用轨迹视觉历史,而 AO 则减少每次调用发送的图像数量。AO 使得受速率/上下文限制的闭源评估更便宜、更快速。
评估指标。
在二元成功标准之外,我们报告了三种描述智能体失败方式的诊断指标。最终位姿误差量化了失败回合中剩余的距离。停止率,即终止于“停止”动作的回合比例,以及误停率,即在非目标位姿处执行“停止”动作的比例,将智能体从未停止的情况与在错误位姿处停止的情况区分开来。我们报告了终止前的平均步数,该指标衡量探索效率。
4 基础模型能否复现目标视角?
模型与实验协议。
我们对五个开源基线模型进行了基准测试:密集型的 Qwen3.5-9B、Qwen3.5-27B、Qwen3.6-27B,以及 MoE 架构的 Qwen3.5-35B-A3B 和 Qwen3.6-35B-A3B。我们还评估了三个闭源模型:GPT-4o、GPT-5 和 Gemini-3.1-Pro。所有模型均在保留的 500 个任务子集上评估,使用第 3.2 节定义的步数预算和 VA/AO 记忆设置。Gemini-3.1-Pro 仅在 AO 设置下评估,因为在整个子集上进行 VA 多图像推理速度过慢。开源模型使用贪心解码;闭源模型使用 API 支持的最低温度参数。作为参考,我们报告了五名参与者在平衡的 100 个任务子集上的人类表现,使用相同的分辨率、动作空间、步数预算和成功标准。
主要结果。
表 1 报告了 15 种模型-记忆配置下按任务类别划分的成功率。最佳配置仅达到整体成功率(Gemini-3.1-Pro,AO 设置),且没有模型超过该值。相比之下,人类在平衡的 100 个任务子集上达到了的成功率。
规模扩大带来的收益微乎其微。密集型的 Qwen3.5 从 9B 提升到 27B 时性能有所改善,但最好的闭源模型仍处于天花板水平。结果呈现出一致的模式。在 AO 条件下,每个开源模型的表现都优于 VA 条件,平均差距为 pp,这表明过去观察到的上下文可能会损害未针对此设置进行训练的基础模型。当模型调用 Stop 时,它通常是在错误的姿态下进行的:F-stop 在 的配置中超出,并在 Qwen3.5-9B (VA) 中达到 。GPT-5 是个例外( AO, VA):当它决定 Stop 时,通常已经处于目标姿态。模型很少自行终止:在 的行中,平均回合长度接近每个任务的步数预算,因此大多数回合是达到了步数限制,而不是以 Stop 结束。
受控消融实验:身体平移是主要的瓶颈。
为了定位失败原因,我们在受限动作空间中运行了两个单房间消融实验,每个实验包含 个任务。在旋转/观察(rotate/look)任务中,起始/目标状态共享位置,仅在偏航角和头部俯仰角上存在差异。在仅移动(move-only)任务中,它们共享偏航角和俯仰角,仅在位置上存在差异。移除身体平移动作将 Qwen3.5-9B 从基线 提升至 ,而仅允许身体平移则使其保持在 (图 3,右下角)。结果表明,在 TVR 中,身体平移控制是主要的失败模式,而不仅仅是视角外观匹配问题。
失败行为模式。
完整的基准测试显示了三种反复出现的行为模式,与受控消融实验的结果一致。在每个回合中,Qwen3.5-9B 平均选择 个动作,却只访问了 个不同的网格位置,并返回到其自身姿态中的 个。失败的轨迹主要遵循两种稳定模式:智能体绕圈行走,在相邻单元格之间来回移动;或者原地循环观察,交替改变头部俯仰角。示例见图 3 顶部。
动作分布指向了同样的问题。在基准测试的 个动作中,旋转动作占 ,身体平移仅占 ,而 Stop 仅占 (图 3,左下角)。实际上,模型旋转过于频繁,很少向前移动或结束回合。
启用 Qwen3.5 的原生思考模式并不能解决这一行为。它使响应 token 数量增加了大约一个数量级,但成功率保持不变(图 3,中下方)。
5 后训练能否改善主动视角控制?
| 方法 | 记忆 | CoT | 初始点 | 总体 | S-e | S-h | M-e | M-h | 步数 | 停止 | F-stop |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen3.5-9B | AO | – | – | ||||||||
| Qwen3.5-9B | VA | – | – | ||||||||
| AO-CoT-SFT | AO | 是 | Qwen3.5-9B | ||||||||
| AO-SFT | AO | 否 | Qwen3.5-9B | ||||||||
| VA-CoT-SFT | VA | 是 | Qwen3.5-9B | ||||||||
| VA-SFT | VA | 否 | Qwen3.5-9B | ||||||||
| 单轮 GRPO | AO | 否 | AO-SFT | ||||||||
| 多轮 GRPO(我们的方法) | VA | 否 | VA-SFT |
实验设置。
我们使用 Qwen3.5-9B 作为后训练的骨干模型。对于监督微调(SFT),我们改变第 3.2 节中定义的记忆表示形式,使用仅动作(AO)记忆或视觉-动作(VA)记忆,同时改变监督信号是否包含中间思维链(CoT)推理过程。训练轨迹由模拟环境中的基于规则的专家生成。对于 CoT 变体,MiMo-V2.5(小米 MiMo 团队,2026)通过其 API 提供中间推理过程。附录 C 描述了标注流程和数据集统计信息。
我们进一步在两种训练设置下(图 4)对 SFT 检查点应用了分组相对策略优化(GRPO)。单轮 GRPO 使用精心设计的单步提示词和动作匹配奖励,而多轮 GRPO 则使用实时的 TVRBench 展开和基于回合的启发式奖励。我们对单轮 GRPO 仅使用动作记忆,对多轮 GRPO 使用视觉-动作记忆,因为轨迹级优化需要保留观察-动作历史,而这正是视觉-动作记忆的用途。附录 D 给出了强化学习数据的构建流程、奖励定义和超参数。所有后训练检查点均在 TVRBench 测试集上,使用与第 3.2 节相同的步数预算进行评估。表 2 报告了按类别划分的成功率和诊断指标。
SFT 从视觉-动作历史中学习动作映射,而非 CoT 推理过程。
第 4 节指出了 TVR 中的一个核心瓶颈:模型往往无法将空间差异映射为可靠的具身动作,尤其是身体平移。在专家轨迹上进行监督微调,能显著改善这种从差异到动作的映射,且视觉-动作记忆取得了最佳效果。
最佳 SFT 设置,即无 CoT 的 VA-SFT,在 TVRBench 上达到了整体成功(表 2),远高于未训练的 Qwen3.5-9B 基线和最强的闭源基线。在单房间任务(单易、单难)上表现尤为强劲,而多房间任务(多易、多难)的表现仍较低,这为后续改进留下了主要空间。
SFT 消融实验显示出两个一致的趋势:视觉-动作记忆能提升 SFT 性能,而我们的 CoT 推理链则没有帮助。在没有 CoT 的情况下,从纯动作记忆切换为视觉-动作记忆,整体成功率从 提升至 ;在有 CoT 的情况下,同样的切换使成功率从 提升至 。相反,在两种记忆格式下,添加 CoT 都会降低成功率:纯动作记忆下从 降至 ,视觉-动作记忆下从 降至 。停止校准也呈现相同方向:两种视觉-动作变体的 F-stop 均为 ,而纯动作变体在 – 的 Stop 调用中仍会做出错误的 Stop 决策。因此,SFT 结果将视觉-动作记忆确定为 TVR 中更可靠的要素,而在我们当前的标注方案下,CoT 监督并无益处。
这种性能下降表明,这些推理链并未为该控制策略提供有效的监督,反而可能干扰当前标注方案下的动作学习。专门针对主动视角控制定制的 CoT 监督是否有帮助,仍是一个悬而未决的问题。
轨迹级 GRPO 有选择性地提升了多房间探索能力,而单轮 GRPO 则出现了性能倒退。
尽管相对于 VA-SFT 的总体提升幅度不大( 个百分点),但分项结果更具信息量。多轮 GRPO 提升了 SFT 仍然最薄弱的长距离多房间分项:Multi-easy 从 升至 ( 个百分点),Multi-hard 从 升至 ( 个百分点)。单房间分项与 SFT 检查点基本持平,Single-easy 从 变为 ,Single-hard 从 变为 。因此,多轮 GRPO 的收益是有选择性的而非均匀的:它在更困难的多房间设置上最为明显,而较强的单房间性能并未显著下降。最终模型的 F-stop 保持在 ,表明多房间性能的提升并非以牺牲停止校准为代价。
相比之下,将相同的强化学习数据转化为单步动作匹配提示词,会持续降低监督微调策略的性能。从 AO-SFT 出发,单轮 GRPO 使整体成功率下降了 pp(表 2)。从 AO-CoT-SFT 出发,它在不同 KL 系数下也使成功率降低了 至 pp。停止校准同样恶化:F-stop 从 AO-SFT 初始化时的 上升至单轮 GRPO 后的 。综合来看,这些结果表明,基于 TVR 的主动任务只有在优化目标与其闭环、多步结构相匹配时,才能从强化学习中获益。逐步骤的动作匹配在此处不足,且会降低监督策略的性能,而轨迹层面的多轮 GRPO 则在长距离多房间场景中带来了最显著的提升。
6 结论
我们提出了目标视点复现(TVR),这是一种通过具身移动/重定向来复现目标图像的闭环任务,并构建了 TVRBench,覆盖了场景规模与目标视图视觉丰富度。TVRBench 揭示了模型与人类之间的巨大差距:最佳闭源/开源模型达到了 / 的成功率,而人类为 ,失败主要源于将视点差异映射为可靠身体移动的不足。我们进一步构建了一个统一的 TVR 后训练框架,涵盖专家轨迹 SFT、CoT-SFT、单轮 GRPO 以及轨迹级多轮 GRPO。视觉-动作 SFT 结合多轮 GRPO 将 9B 模型从 提升至 ,而 CoT 和单轮 GRPO 则损害了闭环性能。综合来看,TVR、TVRBench 以及后训练框架为改进主动感知并在 3D 空间中行动的基座模型提供了一个紧凑的测试平台。
局限性
TVRBench 完全在仿真环境(AI2-THOR 和 ProcTHOR-10k)中构建,采用离散位姿网格和精确位姿成功判定标准。这些选择使得任务难度可控且成功信号明确,但我们的结果因此仅刻画了该设定下的表现,而非物理世界中基于连续、容差的视点控制。我们的后训练结论也仅基于单个 9B 开源基座模型,尚未验证其在其他模型系列、规模以及其他主动感知任务中的普适性。
伦理考量
TVRBench 基于 AI2-THOR 和 ProcTHOR 模拟器,以及 MiMo-V2.5、GPT-4o、GPT-5 和 Gemini-3.1-Pro(通过 API 访问),所有这些均在规定的条款内使用;人类表现数据来自五名志愿者。我们将在宽松的开源许可下发布 TVRBench、轨迹流程、我们的后训练检查点以及支持代码。TVR 完全在室内模拟环境中进行评估;能够主动控制视角的智能体原则上可能被用于侵入性用途,因此任何实际部署都应结合特定领域的安全评估。
参考文献
- Anderson 等人 (2018) Peter Anderson, Qi Wu, Damien Teney, Jake Bruce, Mark Johnson, Niko Sünderhauf, Ian Reid, Stephen Gould, 和 Anton Van Den Hengel. 2018. 视觉与语言导航:在真实环境中解读基于视觉的导航指令. 载于《IEEE 计算机视觉与模式识别会议论文集》,第 3674–3683 页。
- Batra 等人 (2020) Dhruv Batra, Aaron Gokaslan, Aniruddha Kembhavi, Oleksandr Maksymets, Roozbeh Mottaghi, Manolis Savva, Alexander Toshev, 和 Erik Wijmans. 2020. 重新审视 Objectnav:对具身智能体导航至物体的评估. arXiv 预印本 arXiv:2006.13171。
- Black 等人 (2024) Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, Lachy Groom, Karol Hausman, Brian Ichter, 及其他 1 位作者. 2024. :一种用于通用机器人控制的视觉-语言-动作流模型. arXiv 预印本 arXiv:2410.24164。
- Chen 等人 (2024) Boyuan Chen, Zhuo Xu, Sean Kirmani, Brain Ichter, Dorsa Sadigh, Leonidas Guibas, 和 Fei Xia. 2024. Spatialvlm:赋予视觉语言模型空间推理能力. 载于《IEEE/CVF 计算机视觉与模式识别会议论文集》,第 14455–14465 页。
- Cheng 等人 (2024) An-Chieh Cheng, Hongxu Yin, Yang Fu, Qiushan Guo, Ruihan Yang, Jan Kautz, Xiaolong Wang, 和 Sifei Liu. 2024. Spatialrgpt:视觉语言模型中的具象空间推理. 《神经信息处理系统进展》,37:135062–135093。
- Deitke 等人 (2022) Matt Deitke、Eli VanderBilt、Alvaro Herrasti、Luca Weihs、Jordi Salvador、Kiana Ehsani、Winson Han、Eric Kolve、Ali Farhadi、Aniruddha Kembhavi 和 Roozbeh Mottaghi。2022 年。ProcTHOR:利用程序化生成的大规模具身 AI。发表于 NeurIPS。杰出论文奖。
- Google DeepMind (2026) Google DeepMind。2026 年。Gemini 3.1 Pro。模型卡。
- Hong 等人 (2023) Yining Hong、Chunru Lin、Yilun Du、Zhenfang Chen、Joshua B Tenenbaum 和 Chuang Gan。2023 年。基于多视图图像的 3D 概念学习与推理。发表于 IEEE/CVF 计算机视觉与模式识别会议论文集,第 9202–9212 页。
- Hong 等人 (2026) Yining Hong、Jiageng Liu、Han Yin、Manling Li、Leonidas Guibas、Li Fei-Fei、Jiajun Wu 和 Yejin Choi。2026 年。Esi-bench:迈向闭合感知-动作循环的具身空间智能。预印本,arXiv:2605.18746。
- Hurst 等人 (2024) Aaron Hurst、Adam Lerer、Adam P Goucher、Adam Perelman、Aditya Ramesh、Aidan Clark、AJ Ostrow、Akila Welihinda、Alan Hayes、Alec Radford 等 1 人。2024 年。Gpt-4o 系统卡。arXiv 预印本 arXiv:2410.21276。
- Johnson 等人 (2017) Justin Johnson、Bharath Hariharan、Laurens van der Maaten、Li Fei-Fei、C. Lawrence Zitnick 和 Ross Girshick。2017 年。Clevr:用于组合语言和基础视觉推理的诊断性数据集。发表于 IEEE 计算机视觉与模式识别会议 (CVPR) 论文集。
- Kim 等人 (2024) Moo Jin Kim、Karl Pertsch、Siddharth Karamcheti、Ted Xiao、Ashwin Balakrishna、Suraj Nair、Rafael Rafailov、Ethan Foster、Grace Lam、Pannag Sanketi 等 1 人。2024 年。Openvla:一个开源的视觉-语言-动作模型。arXiv 预印本 arXiv:2406.09246。
- Kolve 等人 (2017) Eric Kolve、Roozbeh Mottaghi、Winson Han、Eli VanderBilt、Luca Weihs、Alvaro Herrasti、Daniel Gordon、Yuke Zhu、Abhinav Gupta 和 Ali Farhadi。2017 年。AI2-THOR:用于视觉 AI 的交互式 3D 环境。arXiv。
- Koo 等人 (2025) Juil Koo、Daehyeon Choi、Sangwoo Youn、Phillip Y Lee 和 Minhyuk Sung。2025 年。迈向动态视觉:学习基于视觉的主动视角选择。arXiv 预印本 arXiv:2512.13250。
- Krantz 等人(2022)Jacob Krantz、Stefan Lee、Jitendra Malik、Dhruv Batra 和 Devendra Singh Chaplot。2022 年。实例特定图像目标导航:训练具身智能体寻找物体实例。arXiv 预印本 arXiv:2211.15876。
- Li 等人(2025)Rong Li、Shijie Li、Lingdong Kong、Xulei Yang 和 Junwei Liang。2025 年。Seeground:面向零样本开放词汇 3D 视觉定位的“看与定位”方法。收录于《计算机视觉与模式识别会议论文集》,第 3707–3717 页。
- Liao 等人(2025)Zhenyi Liao、Qingsong Xie、Yanhao Zhang、Zijian Kong、Haonan Lu、Zhenyu Yang 和 Zhijie Deng。2025 年。通过类 R1-zero 训练改进视觉空间推理。arXiv 预印本 arXiv:2504.00883。
- Liu 等人(2023)Fangyu Liu、Guy Emerson 和 Nigel Collier。2023 年。视觉空间推理。《计算语言学协会汇刊》,第 11 卷,第 635–651 页。
- Ma 等人(2022)Xiaojian Ma、Silong Yong、Zilong Zheng、Qing Li、Yitao Liang、Song-Chun Zhu 和 Siyuan Huang。2022 年。Sqa3d:3D 场景中的情境化问答。arXiv 预印本 arXiv:2210.07474。
- Majumdar 等人(2024)Arjun Majumdar、Anurag Ajay、Xiaohan Zhang、Pranav Putta、Sriram Yenamandra、Mikael Henaff、Sneha Silwal、Paul Mcvay、Oleksandr Maksymets、Sergio Arnaud 等。2024 年。Openeqa:基础模型时代的具身问答。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》,第 16488–16498 页。
- Qwen 团队(2026a)Qwen 团队。2026a。Qwen3.5:迈向原生多模态智能体。
- Qwen 团队(2026b)Qwen 团队。2026b。Qwen3.6-27B:27B 稠密模型中的旗舰级编程能力。
- Qwen 团队(2026c)Qwen 团队。2026c。Qwen3.6-35B-A3B:智能体编程能力,现已全面开放。
- Ray 等人(2024)Arijit Ray、Jiafei Duan、Ellis Brown、Reuben Tan、Dina Bashkirova、Rose Hendrix、Kiana Ehsani、Aniruddha Kembhavi、Bryan A Plummer、Ranjay Krishna 等。2024 年。SAT:面向多模态语言模型的动态空间能力训练。arXiv 预印本 arXiv:2412.07755。
- Sakamoto 等人(2026)Koya Sakamoto、Taiki Miyanishi、Daichi Azuma、Shuhei Kurita、Shu Morikuni、Naoya Chiba、Motoaki Kawanabe、Yusuke Iwasawa 和 Yutaka Matsuo。2026 年。《E3vs-bench:面向 3D 高斯泼溅场景中视角依赖型主动感知的基准测试》。arXiv 预印本 arXiv:2604.17969。
- Shao 等人(2024)Zhihong Shao、Peiyi Wang、Qihao Zhu、Runxin Xu、Junxiao Song、Xiao Bi、Haowei Zhang、Mingchuan Zhang、YK Li、Yang Wu 及其他 1 位作者。2024 年。《Deepseekmath:突破开放语言模型数学推理的极限》。arXiv 预印本 arXiv:2402.03300。
- Singh 等人(2025)Aaditya Singh、Adam Fry、Adam Perelman、Adam Tart、Adi Ganesh、Ahmed El-Kishky、Aidan McLaughlin、Aiden Low、AJ Ostrow、Akhila Ananthram 及其他 1 位作者。2025 年。《OpenAI GPT-5 系统卡》。arXiv 预印本 arXiv:2601.03267。
- Wang 等人(2024)Jiayu Wang、Yifei Ming、Zhenmei Shi、Vibhav Vineet、Xin Wang、Yixuan Li 和 Neel Joshi。2024 年。《一图胜千言?探究视觉语言模型的空间推理能力》。Advances in Neural Information Processing Systems,37:75392–75421。
- Wu 等人(2026)Diankun Wu、Fangfu Liu、Yi-Hsin Hung 和 Yueqi Duan。2026 年。《Spatial-MLLM:提升多模态大语言模型在基于视觉的空间智能中的能力》。Advances in Neural Information Processing Systems,38:13569–13597。
- 小米 MiMo 团队(2026)小米 MiMo 团队。2026 年。《MiMo-V2.5-Pro》。https://huggingface.co/collections/XiaomiMiMo/mimo-v25。
- Xu 等人(2025)Runsen Xu、Weiyao Wang、Hao Tang、Xingyu Chen、Xiaodong Wang、Fu-Jen Chu、Dahua Lin、Matt Feiszli 和 Kevin J Liang。2025 年。《Multi-SpatialMLLM:基于多模态大语言模型的多帧空间理解》。arXiv 预印本 arXiv:2505.17015。
- Yang 等人(2025a)Jihan Yang、Shusheng Yang、Anjali W Gupta、Rilyn Han、Li Fei-Fei 和 Saining Xie。2025a 年。《在空间中思考:多模态大语言模型如何观察、记忆和回忆空间》。载于《计算机视觉与模式识别会议论文集》,第 10632–10643 页。
- Yang 等人 (2025b) Sihan Yang, Runsen Xu, Yiman Xie, Sizhe Yang, Mo Li, Jingli Lin, Chenming Zhu, Xiaochen Chen, Haodong Duan, Xiangyu Yue 等。2025b。MMSI-Bench:多图像空间智能基准。arXiv 预印本 arXiv:2505.23764。
- Yeh 等人 (2026) Chun-Hsiao Yeh, Chenyu Wang, Shengbang Tong, Ta-Ying Cheng, Ruoyu Wang, Tianzhe Chu, Yuexiang Zhai, Yubei Chen, Shenghua Gao, Yi Ma。2026。从另一个视角看问题:评估多模态大语言模型的多视角理解能力。载于《AAAI 人工智能会议论文集》,第 40 卷,第 12000–12008 页。
- Yin 等人 (2025) Baiqiao Yin, Qineng Wang, Pingyue Zhang, Jianshu Zhang, Kangrui Wang, Zihan Wang, Jieyu Zhang, Keshigeyan Chandrasegaran, Han Liu, Ranjay Krishna 等。2025。基于有限视角的空间心智建模。载于 ICCV'25 视觉结构先验研讨会。
- Yu 等人 (2025) Heyang Yu, Yinan Han, Xiangyu Zhang, Baiqiao Yin, Bowen Chang, Xiangyu Han, Xinhao Liu, Jing Zhang, Marco Pavone, Chen Feng 等。2025。360 度思考:野外场景下的人形机器人视觉搜索。arXiv 预印本 arXiv:2511.20351。
- Yuan 等人 (2024) Wentao Yuan, Jiafei Duan, Valts Blukis, Wilbert Pumacay, Ranjay Krishna, Adithyavairavan Murali, Arsalan Mousavian, Dieter Fox。2024。RoboPoint:面向机器人空间可供性预测的视觉语言模型。arXiv 预印本 arXiv:2406.10721。
- Zeng 等人 (2024) Kuo-Hao Zeng, Zichen Zhang, Kiana Ehsani, Rose Hendrix, Jordi Salvador, Alvaro Herrasti, Ross Girshick, Aniruddha Kembhavi, Luca Weihs。2024。Poliformer:基于 Transformer 架构扩展在线强化学习可造就卓越导航智能体。arXiv 预印本 arXiv:2406.20083。
- Zhang 等人 (2026) Pingyue Zhang, Zihan Huang, Yue Wang, Jieyu Zhang, Letian Xue, Zihan Wang, Qineng Wang, Keshigeyan Chandrasegaran, Ruohan Zhang, Yejin Choi 等。2026。空间理论:基础模型能否通过主动探索构建空间信念?载于第十四届国际学习表征会议。
- Zhou 等人 (2024) Gengze Zhou, Yicong Hong, 和 Qi Wu. 2024. Navgpt: 基于大语言模型的视觉与语言导航中的显式推理. 载于《AAAI 人工智能会议论文集》,第 38 卷,页码 7641–7649.
- Zhou 等人 (2025) Shijie Zhou, Alexander Vilesov, Xuehai He, Ziyu Wan, Shuwang Zhang, Aditya Nagachandra, Di Chang, Dongdong Chen, Xin Eric Wang, 和 Achuta Kadambi. 2025. Vlm4d: 迈向视觉语言模型中的时空感知. 载于《IEEE/CVF 国际计算机视觉会议论文集》,页码 8600–8612.
- Zhu 等人 (2025a) Muzhi Zhu, Hao Zhong, Canyu Zhao, Zongze Du, Zheng Huang, Mingyu Liu, Hao Chen, Cheng Zou, Jingdong Chen, Ming Yang, 及其他 1 人. 2025a. Active-o3: 通过 GRPO 赋予多模态大语言模型主动感知能力. arXiv 预印本 arXiv:2505.21457.
- Zhu 等人 (2017) Yuke Zhu, Roozbeh Mottaghi, Eric Kolve, Joseph J Lim, Abhinav Gupta, Li Fei-Fei, 和 Ali Farhadi. 2017. 基于深度强化学习的室内场景目标驱动视觉导航. 载于《2017 年 IEEE 国际机器人与自动化大会 (ICRA)》,页码 3357–3364. ieee.
- Zhu 等人 (2025b) Ziyu Zhu, Xilin Wang, Yixuan Li, Zhuofan Zhang, Xiaojian Ma, Yixin Chen, Baoxiong Jia, Wei Liang, Qian Yu, Zhidong Deng, 及其他 1 人. 2025b. 移动以理解 3D 场景:连接视觉定位与探索以实现高效且通用的具身导航. 载于《IEEE/CVF 国际计算机视觉会议论文集》,页码 8120–8132.
附录 A 附录概述
本附录从五个方面对主论文进行扩展:
- •
附录 B:TVRBench 构建。场景划分为 SFT、评估和 RL 池,各类别任务生成流程,九动作空间,全文使用的四项诊断指标,以及人工参考行背后的人工评估协议。
- •
附录 C:SFT 数据流水线。基于规则的模拟专家轨迹,使用 MiMo-V2.5 的思维链标注,以及 SFT 消融实验所交叉对比的两种记忆格式——仅动作记忆与视觉-动作记忆。
- •
附录 D:后训练配置。监督微调、单轮 GRPO 和多轮 GRPO 的超参数与数据构建,包括多轮 rollout 中使用的启发式奖励和动作掩码。
- •
附录 E:额外定量结果。单轮 GRPO 的 KL 消融实验、基于基础模型的强化学习自举实验,以及逐步骤匹配准确率与闭环任务成功率之间的对比。
- •
附录 F:定性示例。TVRBench 上的四条代表性轨迹——未经训练的 9B 模型的两种失败模式(旋转循环和行走循环),以及我们的 VA-SFT + 多轮 GRPO 策略的两种成功案例(一个单房间 iTHOR,一个多房间 ProcTHOR)。
附录 B TVRBench 构建细节
B.1 场景划分
TVRBench 使用了 240 个不同的室内场景,这些场景被划分为后训练(SFT)、评估和强化学习(RL)三个池,划分比例对每个场景族独立应用,以保持各池之间场景族的平衡。单房间部分从 AI2-THOR 中选取了 120 个场景,其四个脚本化房间类别——厨房、客厅、卧室和浴室——各占 30 个,最终得到 20 个 SFT / 40 个评估 / 60 个 RL 场景。多房间部分从 ProcTHOR-10k 的训练集划分中均匀随机抽取了 120 个场景(每个场景都是程序化生成的 2-3 个房间布局,房间之间有物理墙壁分隔),并按照相同的划分比例进行分配。三个池之间没有任何场景重复,确保留出的评估任务来自 SFT 和 RL 训练期间均未见过的环境,因此报告的结果反映的是真正的泛化能力,而非对场景的记忆。
B.2 任务生成
每个 TVRBench 任务都是在单个场景内采样的一组(起始点,目标点)位姿对,并由两个独立维度来刻画:(i) 智能体位姿离散图上起始点与目标点之间的最短路径长度——即基于规则的专家从一点导航至另一点所需的最小单位动作数,它代表了所需导航的空间范围;以及 (ii) 目标视点处的片段数量,计算方式为可见物体数量(排除结构几何体、智能体自身以及内部排除列表标记的网格),该值代表了目标视点的视觉丰富程度。将这两个维度交叉,便得到了本文通篇使用的四类任务:单房间简单(路径长度 –)和单房间困难(路径长度 –),两者均来自 AI2-THOR 场景;多房间简单(路径长度 –)和多房间困难(路径长度 –),两者均来自 ProcTHOR-10k 场景。中间区间被保留作为间隔,以确保简单与困难层级清晰区分。生成的任务总数为:SFT 1,600 个(40 个 SFT 场景,每个场景 40 个),评估 500 个(每个类别 125 个),RL 4,800 个(120 个 RL 场景,每个场景 40 个)。
B.3 动作空间
每一步,智能体在 AI2-THOR 的离散位姿网格上选择九个离散动作之一:四个智能体坐标系平移(MoveAhead、MoveBack、MoveLeft、MoveRight),步长为 米;两个身体旋转(RotateLeft、RotateRight),绕垂直轴旋转 (相较于模拟器默认值做了优化,以实现更精细的视点控制);两个头部俯仰(LookUp、LookDown),在模拟器水平视角范围内旋转 ;以及一个终止动作(Stop)。模拟器会拒绝任何导致与场景几何体碰撞的动作;在此类情况下,位姿保持不变,但该步骤仍计入每个任务的预算步数,这有助于避免盲目向障碍物移动。回合在智能体发出 Stop 动作时结束(成功要求此时智能体位姿与目标位姿匹配),或在步数预算耗尽时结束,后者视为失败。
B.4 诊断指标
设有一组评估片段,每个片段包含以下逐片段量:(根据 B.3 节标准衡量的成功与否)、(是否发出停止指令)、姿态匹配指示符(即,使得)、(采取的动作数量),以及第 3.2 节定义的最终步骤姿态误差、、。我们报告:
各类别比率 S-e、S-h、M-e、M-h 是通过将求和限制在相应类别(评估拆分中每个类别各有 个片段)的片段上得到的,从而隔离了每个难度层级的性能。,即误停率,是以发出停止指令的片段为条件计算的:它衡量在这些片段中,在非目标姿态下发出停止指令的频率,因此一个很少停止的模型,如果其少数几次停止是错误的,其 仍可能很高;而较低的 值应与停止率结合来看。
B.5 人类评估协议
为了建立人类参考基准,五名志愿者各自完成了评估拆分中一个包含 100 个任务的平衡子集,其中从四个类别中各抽取 25 个任务,以确保场景规模和视觉丰富度得到均衡体现。参与者通过一个单用户网页界面操控智能体,该界面并排显示当前第一人称视角观察图像和目标图像,并通过固定的键盘映射发出与模型可用的相同的九种离散动作:W/S/A/D 对应四种平移,Q/E 对应身体旋转,R/F 对应头部俯仰,空格键对应停止。他们被指示尽可能精确地复现目标视角,然后按下停止键宣布完成。每次运行使用的图像分辨率、动作空间、每个任务步数预算(单房间 iTHOR 任务为 个动作,多房间 ProcTHOR 任务为 个动作)以及姿态匹配成功标准( 米、 、 )均与模型评估完全相同,因此人类与模型的数据行可直接比较。参与为自愿且无偿,参与者被告知其匿名任务表现将仅作为本文报告的人类参考基准使用。该任务仅涉及在室内模拟器中导航,对参与者不构成可预见的风险,因此无需风险免责声明。
附录 C SFT 数据流水线
C.1 基于规则的轨迹生成
监督微调(SFT)池中的专家轨迹由离线运行的 oracle 规划器生成,该规划器拥有对模拟器内部状态的特权访问权限:智能体的精确位姿、每个场景中预先计算的可达位置图以及目标位姿。这些信息对我们评估的任何学习模型都是不可用的。对于每个任务,规划器会生成一个包含三个阶段的行为序列:
- 1.
视角对齐。使用最少数量的“向左/向右旋转”和“向上/向下看”动作,将身体旋转并将头部俯仰角从初始值调整到目标值。
- 2.
导航。在离散状态空间上,从起始位置到目标位置运行 Dijkstra 最短路径算法,其中六个身体运动动作(向前/向后/向左/向右移动,向左/向右旋转)均被视为单位成本边。智能体在导航过程中允许偏离目标方向旋转,但最终必须到达目标位置,这避免了针对非轴向目标进行低效的锯齿形运动。
- 3.
终止。发出停止指令。
该规划器是确定性的,每个任务恰好生成一条最小动作数的轨迹,总共产生 1,600 条 SFT 轨迹,其长度等于用于定义任务难度的最短路径长度(见 B.2 节),因此每条示范在构造上都是动作最优的。这些轨迹仅作为 SFT 的监督目标;学习到的策略严格基于第一人称观测进行操作,且永远不会接收到规划器所使用的特权状态信息。
C.2 使用 MiMo-V2.5 进行思维链标注
对于思维链变体(AO-CoT-SFT 和 VA-CoT-SFT),我们用中间思维链推理来增强基于规则的轨迹。对于规划器生成的每个(当前观察,目标图像,专家动作)三元组,我们提示 MiMo-V2.5 模型(通过 API 访问)写一段简短的、基于观察的论证,说明为什么该动作是正确的,并确保每条推理都与最优动作标签一致。提示词(图 5)指示模型:(i) 在当前视角中引用 1–2 个可见地标,(ii) 将它们与目标进行比较并识别出未对齐的维度(朝向、距离或位置),以及 (iii) 解释给定动作如何缩小该差距,而不提及任何替代动作。1–3 句的长度限制是刻意收紧的:SFT 轨迹保留了完整的多轮观察和推理历史,跨越最多 – 步,因此每一步的推理长度在上下文中累积时会乘以轨迹长度。只有当返回的推理能解析为所请求的 JSON 对象时,我们才接受,丢弃任何格式错误的响应。
C.3 两种记忆格式
两种记忆表征产生了结构上不同的 SFT 样本。在仅动作记忆下,轨迹中的每一步都成为一个独立的单轮样本,其用户消息包含当前观测、目标图像以及一段简短的动作历史文本;在视觉-动作记忆下,整条轨迹被打包成一个多轮样本,各轮次从头到尾依次累积,每一步的上下文中都暴露了所有过去的观测。因此,仅动作记忆保持了较短的序列长度,而视觉-动作记忆则保留了完整的视觉记忆。对于 CoT 变体,每个模型响应可选地在前面加上一段用 `<think>…</think>` 标签包裹的思维链推理过程。图 6 和图 7 给出了每种格式的具体示意图。
附录 D 后训练配置
计算预算。
单次监督微调运行使用 NVIDIA H100 GPU 约数小时;多轮(在线)GRPO 使用 NVIDIA H200 GPU 约数小时;单轮(离线)GRPO 使用 H200 GPU 约数小时。
D.1 监督微调
所有四种 SFT 变体都对 Qwen3.5-9B 进行全参数更新微调,并冻结视觉编码器以保留其预训练的视觉表征。我们使用 AdamW 优化器,采用 bf16 精度,学习率采用带线性预热的余弦调度,图像分辨率上限为像素,每设备批次大小结合跨 GPU 梯度累积(有效批次),并使用 DeepSpeed ZeRO-2 与梯度检查点。AO 变体(AO-SFT、AO-CoT-SFT)训练轮次为轮,VA 变体(VA-SFT、VA-CoT-SFT)训练轮次为轮,后者的样本数量远少,因此需要额外的训练轮次。
D.2 单轮 GRPO
单轮 GRPO 在一个由提示词组成的 parquet 数据集上优化每步动作策略,该数据集通过将 SFT 轨迹展平为独立的(状态,专家动作)元组构建而成,因此每个动作的训练都与其轨迹上下文相隔离。策略从 AO-SFT 检查点初始化,我们继承了来自 verl Shao 等人(2024)的 GRPO 实现。
GRPO 目标。
对于每个提示词,我们从当前策略采样一组回复,并用标量奖励对每个回复进行评分。组相对优势以组均值为中心,并按组标准差进行归一化,
然后广播到每个 token。GRPO 目标函数在此优势上采用 PPO 风格的截断替代目标,同时结合针对 SFT 参考模型的 KL 锚点,
其中使用无偏低方差 K3 形式进行估计。
奖励。
每条回复的奖励是格式有效性和动作正确性的门控组合,
因此,缺少所需“Action: <name>”格式的回复获得,格式正确但动作错误的回复获得,格式正确且动作匹配的回复获得;即使所选动作错误,下限仍会奖励有效格式。
超参数。
组大小在温度和 top- 下进行 rollout。AdamW 优化器,学习率,梯度裁剪,无熵奖励。GRPO 裁剪阈值(verl 默认值);KL 系数为,表 2 中报告为默认行,并包含在 KL 消融实验中(附录 E.1)。
D.3 多轮 GRPO
多轮 GRPO 通过在实时 TVRBench 模拟器中 rollout 轨迹来优化回合级策略,从闭环交互中进行在线学习。对于每个任务(从专用的任务 RL 划分中抽取的姿态对),策略针对模拟器 rollout 次;每次 rollout 生成一个轨迹
并附带如下给出的每步奖励。我们从 VA-SFT 检查点初始化,继承来自 verl Shao 等人 (2024) 的 GRPO 核心,并使用一个自定义智能体循环,将模型生成的动作与模拟器观察结果交错进行。
每步奖励。
第步的奖励可加性分解为四个组成部分,
包括:(i) 一个恒定的步数惩罚以鼓励效率;(ii) 一个格式项,如果模型输出解析为有效动作则为,否则为;(iii) 一个非对称进度项,仅奖励运行中最小姿态距离的严格改进,
其中,`d_target` 追踪当前所见的最佳距离,因此回溯到已访问过的位姿不会获得奖励;(iv) 一个终止项,当智能体在目标位姿处发出停止指令时、在非目标位姿处发出停止指令时,以及其他情况下分别取值,因此过早或错误的停止会受到主动惩罚,而不仅仅是得不到奖励。位姿距离是一个加权测地线距离。
其中 `n_rot` 和 `n_pitch` 分别是与目标对齐所需的旋转和俯仰动作的整数数量,经过加权使得一个此类动作与一个平移步长的贡献相同。
轨迹级优势。
分配给每条 rollout 的标量奖励是其各步奖励之和,
并且组相对优势在轨迹级别计算,并广播给 `π_θ` 的每个助手 token,
Token 掩码目标。
由于每条轨迹将环境观测与模型生成的动作交织在一起,只有助手 token 携带梯度,因此策略从未被训练去预测模拟器的观测值。我们相应地掩码了 GRPO 损失,
其中 `L_GRPO` 为损失函数,`π_ref` 是 VA-SFT 初始化。
超参数。
每组大小 `G` 为每个任务 8 条轨迹,最大轨迹长度 `T` 为 20 轮,每个 rollout worker 有 4 个并行环境实例。使用 AdamW 优化器,学习率为 `1e-6`——比单轮情况小一个数量级,以保留更强的 VA-SFT 初始化——梯度裁剪为 `1.0`。GRPO 裁剪参数 `ε` 为 0.2,KL 系数 `β` 为 0.01,两者均继承自单轮配置(附录 D.2)。
附录 E 额外定量结果
E.1 单轮 GRPO 的 KL 消融实验
我们使用表 3 中的按类别细分数据,扩展了第 5 节中“即使是最保守的 KL 设置,性能仍会退步至低于其 SFT 初始化”这一论断。从 AO-CoT-SFT 开始,单轮 GRPO 在 `β=0.01` 时下降了 3.1 个百分点,在更宽松的 `β=0.001` 时下降了 4.5 个百分点。两种设置也都降低了停止校准能力:F-stop 从 SFT 初始化时的 0.0% 上升到 `β=0.01` 时的 1.4%(±0.4%)和 `β=0.001` 时的 2.1%(±0.5%),因此随着 KL 约束的放松,成功率和停止校准能力都单调恶化。
| 配置 | 总体 | S-e | S-h | M-e | M-h |
|---|---|---|---|---|---|
| AO-CoT-SFT(初始化) | |||||
E.2 从基础初始化进行强化学习
我们还评估了两种 GRPO 变体在没有任何 SFT 预热的情况下,直接从未经训练的 Qwen3.5-9B 开始的表现(表 4)。单轮 GRPO 仅能略微提升 AO 基线(, pp);相比之下,多轮 GRPO 将 VA 基线从 提升至 总体水平,并实现了完美的停止校准(F-stop )。仅靠轨迹层面的在策略强化学习就能从零开始产生一个可用的策略,而逐步骤强化学习则不行,这是因为塑形进度奖励即使对近乎随机的初始策略也能提供学习信号。
| 配置 | 总体 | S-e | S-h | M-e | M-h |
|---|---|---|---|---|---|
| Qwen3.5-9B 基础模型(AO) | |||||
| 单轮 GRPO | |||||
| Qwen3.5-9B 基础模型(VA) | |||||
| 多轮 GRPO |
E.3 逐步骤精度与闭环精度
我们检查了单轮 GRPO 闭环回归是否被逐步骤的增益所掩盖。将逐步骤提示数据集( 提示词 展开)的验证集分割部分,通过 AO-CoT-SFT 单轮 GRPO 检查点(, 步骤 )进行重放,得到的逐步骤动作匹配精度为 ,格式有效性为 ,平均逐步骤奖励为 ;在 处的并行运行产生了可比的逐步骤精度 。然而,同一个检查点在闭环基准测试(表 2)上仅达到 ,逐步骤匹配与回合成功率之间存在超过 个百分点的差距。这一差距反映了复合误差:在每回合大约 个决策中,微小的逐步骤不准确性会累积起来,并且策略从未学习过恢复,因为它仅在专家条件状态上训练,而非在测试时遇到的偏离专家状态上训练。因此,逐步骤匹配目标并不能转化为端到端的轨迹成功。
附录 F 定性示例
我们用四个端到端的 TVRBench 轨迹来补充第 4-5 节的汇总数据:两个是未经训练的 Qwen3.5-9B 的失败案例(一个原地旋转,一个短循环行走),两个是我们的 VA-SFT + 多轮 GRPO 策略的成功案例(单房间 iTHOR 和多房间 ProcTHOR)。每个轨迹都显示了一个正交平面图,包含起点(黄色)、目标(红色)和最终姿态(蓝色)、完整路径,以及沿轨迹采样的第一人称视角帧。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org