跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-05-31精选AI 评分70

τ_0-WM:用于机器人操控的统一视频-动作世界模型

τ_0-WM: A Unified Video-Action World Model for Robotic Manipulation

AI 导读

τ_0-World Model (τ_0-WM) 是一个统一的视频-动作世界模型,旨在机器人执行动作前预测并评估其未来后果。模型基于共享的视频扩散主干网络构建,提供两个接口:一个联合预测未来视觉潜在表示与连续动作块的视频动作模型,以及一个能将动作序列展开为多视角未来并预测任务进度分数的动作条件视频模拟器。τ_0-WM 使用约27,300小时的多元数据训练,包括真实机器人遥操作、UMI风格交互、自我中心人类视频等。推理时,模型通过测试时计算采样动作候选,并利用去噪一致性和基于模拟器的修正来筛选低质量动作,在长时程和精细机器人操控任务上表现出优于相关基准的性能。

推荐理由

机器人操作领域的大一统尝试,把视频预测和动作生成放在一个扩散模型里,还用27万小时数据训练,做具身智能的可以看看这个架构。

正文 · AI 翻译

周鹏飞

陈圣聪

陈迪

王嘉旭

金荣俊

朱炳文

潘一可

顾松恩

王宽宁

南树峰

邱星宇

邱晨浩

杨浦

蔡云诺

高建雄

李一凡

傅衍伟

岳翔宇

陈智

罗剑兰

上海创新研究院

AGIBOT Finch

摘要

机器人操作需要能够生成可执行动作的模型,这些模型能在物理执行之前预测并评估其未来后果。我们提出了世界模型(-WM),这是一个统一的视频-动作世界模型,它将策略学习、视频预测和动作评估整合在同一个未来预测框架中。基于共享的视频扩散主干网络,-WM 提供了两个互补的接口。首先,一个视频动作模型从多视角观测、语言指令和机器人状态中联合预测未来的视觉隐变量和连续动作片段。其次,一个以动作为条件的视频模拟器将候选动作片段展开为多视角的未来画面,并预测密集的任务进度分数。该模型在大约数小时的真实机器人遥操作、UMI 风格交互、第一人称人类视频以及展开或失败轨迹上,使用模态特定的监督掩码进行训练。在推理时,-WM 利用测试时计算来采样候选动作,通过重新去噪一致性对其进行排序,并对低质量候选动作调用基于模拟器的修正。在具有挑战性的长时域和细粒度机器人操作任务中,-WM 表现出优于其他相关基线的性能。

一、引言

Refer to caption
图 1:-WM 框架概览。来自真实机器人、UMI 风格采集和第一人称人类视频的异构交互数据被用于训练视频动作模型和以动作为条件的视频模拟器。在部署时,系统提出候选动作,通过测试时计算和基于模拟器的评分来评估想象出的未来场景,并选择或修正动作,以实现跨任务和跨本体的稳健操作。

机器人操作本质上是一个在不确定物理后果下采取行动的问题。机器人不仅需要推断哪个动作可能满足语言指令,还必须预测该动作将如何通过接触、物体运动和多步交互来改变场景。这一视角将操作策略与预测控制及世界模型这一长期研究脉络联系起来:一个有用的模型应能关联观测、动作和未来结果,从而在物理执行之前改进决策制定 [22, 17, 40, 41, 3]。然而,对于真实机器人而言,这种预测能力必须与可由特定实体、控制器和传感堆栈执行的动作接口相结合。

学习这两种能力所需的数据以截然不同的形式存在。第一人称视角视频和人类交互轨迹提供了关于物体如何运动、接触如何展开以及长周期任务如何按时间组织的广泛证据。这类数据捕捉了跨不同物体、场景和行为的丰富视觉动态,但并未指定可部署机器人控制空间中的动作。机器人演示则恰好提供了这种基础:它们将观测与使用特定实体、控制器、传感器套件和动作表示收集的连续动作耦合起来。然而,机器人数据采集成本高昂,且所涵盖的物体、环境和任务子集显然要狭窄得多。仅靠机器人演示进行训练会产生有基础但狭窄的策略;仅靠广泛视频数据进行训练则会产生有预测能力但缺乏动作基础的模型。因此,一个通用的操作系统必须利用广泛的交互数据,同时不丢失部署所需的可执行动作基础。

本文研究了一种面向机器人操作的统一视频-动作世界建模框架。其核心思想是将未来观测、机器人动作和任务进度置于一个共享的预测模型中,同时允许每个数据源仅监督其实际包含的信号。纯视频数据可训练视觉动力学;机器人轨迹可训练可执行动作生成;进度与失败轨迹可训练基于动作条件的评估。通过这种方式,数据异质性不再被视为噪声或预处理障碍,而是一种结构化的互补监督来源。由此产生的表征不仅旨在作为策略学习的辅助特征,更作为一种接口,使机器人能够提出动作、想象其后果,并在执行前进行修正。

我们提出 -世界模型(-WM),这是一个统一的视频-动作框架,集成了动作生成、视频预测以及基于动作条件的未来评估。与将策略学习与动力学建模分离的做法不同,-WM 围绕一个共享的视频扩散骨干网络构建两者。该骨干网络提供两个互补接口。第一个是视频动作模型(VAM),它将多视角观测、语言指令和机器人状态映射为未来视觉潜变量以及一段连续动作块。第二个是基于动作条件的视频模拟器(ACVS),它接收当前观测、指令和候选动作块,预测多视角未来展开结果以及密集的任务进度轨迹。这两个接口的区别至关重要:VAM 回答机器人应该做什么,而 ACVS 则估计如果执行某个提议动作将会发生什么。

共享的预测表征使 -WM 能够从约数小时的异构语料库中学习。该语料库包括真实机器人遥操作数据、UMI 风格演示、第一人称人类视频以及执行轨迹或失败轨迹。这些来源提供了不同程度的监督和动作保真度。真实机器人演示提供了与部署对齐的连续动作;UMI 风格演示通过较弱的类动作信号拓宽了操作行为和环境的范围;第一人称视频提供了大规模视觉交互动态,但不包含与机器人兼容的动作;而执行轨迹或失败轨迹则为任务进展和低质量结果提供了监督。我们使用模态特定的监督掩码联合训练这些来源,使得每个样本仅对其观测、视角、状态、动作和进度标签所支持的损失项做出贡献。

在推理时,这种统一接口允许 -WM 将额外计算分配给动作选择,而非执行第一次前馈预测。该模型首先从 VAM 中采样多个动作块,并使用重新去噪一致性分数对其进行排序,该分数衡量候选动作是否与学习到的条件动作分布一致。当所选候选动作看起来不可靠时,-WM 会调用 ACVS 来模拟候选动作所引发的未来状态,并估计其任务进展。然后,最有希望的想象未来被用于条件化第二次 VAM 查询,从而生成一个精炼的动作块。这产生了一个提议-评估-修正流程,其中未来预测被直接用作在执行前改进机器人动作的机制。

我们评估了 -WM 作为一个面向机器人的系统,在多种具身形态下执行细粒度、长时程操作任务的表现。在当前评估中,-WM 在四项操作任务上取得了所有基线方法中的最佳平均成功率。消融实验进一步表明,异构预训练同时提升了零样本和微调性能,而测试时计算通过重去噪一致性选择和模拟器辅助修正,提高了单次执行的成功率。这些结果支持了本工作的核心论点:当视频预测与可执行动作生成联合训练,并在部署时作为想象、评分和优化未来结果的机制时,它对机器人操作最为有用。

我们的贡献有三方面。首先,我们引入了 -WM,一个统一的视频-动作世界模型,它在策略学习和动作条件模拟之间共享预测性表征。其次,我们展示了如何将异构机器人数据、UMI 风格数据、自我中心数据以及 rollout/失败数据,通过模态特定的监督掩码进行整合。第三,我们提出了一种测试时的提案-评估-修正流程,利用学习到的世界模型在执行前选择和修正动作,从而提升了在具有挑战性的真实世界操作任务上的性能。

二、相关工作

-WM 建立在两个相关的工作方向上:机器人视频动作模型和动作条件视频模拟器,并将它们统一在一个单一的视频-动作世界建模框架中。因此,我们对这两个领域及其交叉领域的工作进行了综述。

二-A 机器人视频动作模型

视频动作模型(VAMs)通过联合预测视频和动作,将未来预测引入机器人控制 [29, 5, 24, 26, 45, 43, 27, 46, 28, 44]。最新的大多数方法都基于预训练的视频生成扩散模型 [39, 16, 42],并采用联合去噪范式,即未来视觉潜在表示和动作片段被一同生成 [1, 29, 5, 24, 26]。这些研究表明,未来预测能为操作任务提供有用的、具有动力学意识的表征。一些近期系统进一步提升了可扩展性或效率,例如 Motus [5] 整合了理解、视频生成、世界建模和控制,而 Fast-WAM [45] 则研究了在策略推理过程中移除未来预测以降低延迟。

与以往主要将未来预测作为辅助策略学习目标或可选视觉输出的 VAMs 不同,-WM 将视频-动作建模视为操作任务的统一基础。其 VAM 联合预测多视角的未来潜在表示和可执行的动作片段,同时与一个以动作为条件的模拟器共享相同的预测表征。这使得未来预测不仅能用于表征学习,还能用于测试时的动作评估和修正。此外,-WM 在异构机器人数据、UMI 数据和以自我为中心交互数据 [38, 23, 9, 31, 19] 上进行训练,利用每种数据源来监督其提供的信号。

II-B 面向机器人的动作条件视频模拟器

另一类工作将视频模型用作决策制定的动作条件模拟器。早期的视觉预见方法学习了以动作为条件的视频预测器,并使用模型预测控制来选择其预测未来与目标相匹配的动作 [11, 10]。随着大规模视频生成 [7, 14, 34, 37, 25, 39] 的最新进展,近期的机器人系统将视频模型以机器人动作、末端执行器轨迹或可控 token 为条件,用于预测操作展开、评估策略或支持强化学习 [1, 2, 29, 15, 21, 12, 8]。

相比之下,-WM 并不将模拟器作为独立模块使用。其动作条件视频模拟器(ACVS)与 VAM 共享动作接口和主干配置,在相同的异构数据混合集上训练,并同时预测多视角未来展开结果和任务进度分数。在测试时,这使得 -WM 能够超越前馈式动作预测:它对候选动作进行采样,根据去噪一致性对其进行排序,并调用 ACVS 在执行前评估和修正低质量候选动作。

III 预测性机器人学习的数据来源

通用型视频动作模型不仅应从单一机器人形态或数据采集流程中学习,还应从提供互补监督形式的异构交互数据中学习。因此,我们从三个来源构建了一个 27,300 小时的训练语料库:在 AGIBOT-G01、ARX 机械臂和双臂 Franka 系统上采集的 17,800 小时真实机器人遥操作数据;使用 Gen-DAS 夹爪 [13] 采集的 6,500 小时经过筛选的开源 UMI 风格演示数据;以及 3,000 小时的开源第一人称人类交互视频 [19, 35, 36]。这些来源在形态、视角、动作保真度、采集成本和行为多样性方面各不相同,因此天然适用于不同的训练目标。

真实机器人遥操作

真实机器人演示提供了最可靠的动作监督。在我们的数据集中,轨迹是在 AGIBOT-G01、ARX 和双臂 Franka 平台上,于家庭、零售和工业环境中采集的,通常配备头部视角摄像头和腕部摄像头。由于这些演示直接在机器人系统上生成,其动作与机器人运动学、控制器接口、传感堆栈和部署条件保持一致。因此,它们对于将模型锚定于可执行的机器人行为至关重要。同时,真实机器人数据采集成本高昂,且受限于可用的平台、工作空间、物体和任务设置,这使得仅靠它自身不足以实现广泛的泛化。

UMI 风格演示

UMI 风格的数据提供了一种更具可扩展性的操作经验来源。通过使用手持式夹爪类设备,人类操作员可以在多样化的环境中收集演示数据,其基础设施成本远低于完整的机器人遥操作。这些演示提供了丰富的视觉交互数据以及源自设备运动的类动作信号,其中编码了关于操作意图和物体交互的有用信息。然而,由于收集设备与目标机器人在具身形态、运动学、驱动方式及控制接口上存在差异,这些信号仅与可部署的机器人动作存在弱对齐。因此,我们将 UMI 风格的演示视为可扩展但监督信号较弱的视频-动作数据。

第一人称视角的人类交互视频

第一人称视角的人类视频提供了最广泛的日常操作行为覆盖。它们让模型接触到多样化的物体、环境、接触模式、状态变化以及长周期任务结构。然而,与机器人或 UMI 数据不同,第一人称视频不包含与机器人兼容的动作标签,并且在具身形态和视角上存在显著差异。因此,我们仅将其用于视频预测:它们监督视觉动态,但不参与动作损失的计算。

统一监督

这三种来源形成了一种监督层级结构。真实机器人数据提供与部署对齐的动作标签;UMI 风格的数据提供多样化的交互轨迹,并带有较弱的类动作信号;第一人称视频则提供大规模视觉动态,但无动作监督。为了联合训练所有来源的数据,我们采用了一种统一的视频-动作表示,并配合模态特定的监督掩码。对于每个样本,掩码指定了哪些输入被观测、哪些目标被预测以及哪些损失被激活。这使得异构数据能够贡献于单一端到端目标,同时尊重其监督信号在可靠性和可用性上的差异。

第四章 视频动作模型

Refer to caption
图 2:-WM 的架构。视频动作模型(VAM)作为策略接口,通过共享的视频主干网络和通过交叉注意力耦合的动作 DiT 分支,联合预测未来的视觉潜变量和可执行的动作片段。动作条件视频模拟器(ACVS)作为评估接口,复用视频生成主干网络来展开 VAM 提出的动作片段,并为测试时的动作选择预测密集奖励分数。

IV-A 模型接口与问题形式化

视频动作模型(VAM)作为 -WM 的策略面向接口。它利用共享的预测表示,联合学习未来的视觉动态和可执行的机器人动作。给定当前的多视角观测、语言指令和机器人状态,VAM 预测一条未来的潜变量轨迹以及一个可执行的动作片段:

(1)

其中 表示时间范围 内的未来视频潜变量, 表示时间范围 内的连续动作片段。未来视觉预测不仅作为辅助目标,也作为一种从异构数据源(包括无动作标注的视频)中学习可迁移交互动态的机制,而动作预测则将学习到的表示锚定到可执行的机器人控制中。

IV-B 架构

如图 2 (a) 所示,VAM 由两个紧密耦合的组件构成:用于未来视觉预测的视频分支和用于可执行动作生成的动作分支。这两个分支共享一个共同的预测表示,并通过特征层面的交叉注意力进行交互,使得未来的视觉动态能够直接支持动作生成。

VAM 基于 Wan2.2-TI2V-5B [39] 实例化。Wan VAE 首先将每个相机视角编码为潜在张量。对于同步的多视角输入,视角潜在表示沿空间宽度维度拼接,形成时间对齐的潜在画布。当前观测的潜在表示保持干净作为视觉上下文,而未来的潜在槽位则由视频分支进行加噪和去噪。视频分支使用原始的 Wan 视频 DiT 主干网络(5B 参数)实现,并通过条件去噪预测未来的潜在轨迹。动作分支是一个 0.5B 参数的 DiT 风格动作解码器 [33],与视频 Transformer 耦合。两者共同构成一个 5.5B 参数的视频动作模型。

在匹配的 Transformer 阶段,动作 token 首先对动作时间范围内的时序依赖关系进行建模,然后与中间视频特征进行交叉注意力。这些视频特征以干净的视觉上下文和语言指令为条件,从而为动作分支提供感知指令且与动力学相关的视觉表示。这种特征级耦合遵循了近期动作专家设计 [29, 20] 的思路,同时保留了视频主干网络作为共享的预测基础。

IV-C 联合流匹配目标

VAM 将流匹配 [30] 同时应用于未来视频潜在表示和动作片段。设 和 表示训练目标,设 表示干净的编码视觉上下文。给定噪声水平 和 ,标准流匹配构造会生成带噪输入以及速度目标 。我们优化

(2)

其中 和 分别表示视频和动作向量场头, 表示动作分支所使用的中间视频特征。

该期望值是在具有不同监督水平的异构训练样本上计算的。机器人轨迹同时提供视觉预测和动作监督,而第一人称人类视频仅提供视觉动力学项。缺失的模态通过监督掩码来处理,从而允许所有数据源参与统一的训练过程。在所有实验中,我们简单地设置 。

IV-D 推理与部署

在推理时,VAM 将最新的多视角观测、语言指令和机器人状态作为输入,并预测一个可执行的动作块。当需要显式的视觉展开时,未来潜变量可解码为视频帧;当仅用于支持动作生成时,则可保留为潜变量表示。这实现了两种部署模式。在纯动作部署模式下,仅生成并执行预测的动作块,采用滚动时域方式,提供高效的实时控制。在支持展开的部署模式下,VAM 额外预测未来视觉潜变量,这些潜变量可解码为多视角视频,从而在需要时显式可视化未来场景演变。

V 动作条件视频模拟器

V-A 模拟器接口与问题形式化

动作条件视频模拟器(ACVS)作为 -WM 的评估接口,如图 2 (b) 所示。VAM 提出可执行的动作块,而 ACVS 则估计候选动作所引发的未来后果。ACVS 并非在机器人上物理执行每个候选动作,而是预测未来的视觉展开和密集奖励轨迹,为部署时的评估提供动作条件的代理。

给定记忆观测、语言指令和候选动作块,ACVS 预测未来视频潜变量以及密集奖励分数:

(3)

其中 表示想象的未来潜变量展开, 表示预测的奖励轨迹。ACVS 并非动作策略;它将候选动作块视为一个干净条件,并评估其引发的未来结果。

V-B 架构

ACVS 复用了 Wan VAE 和视频 Transformer 骨干网络 [39],但移除了 Action DiT 策略分支。记忆和当前观测被编码为干净的潜变量上下文,而未来潜变量槽则用噪声初始化,并由视频骨干网络进行去噪。

为了将未来预测以候选动作为条件,我们遵循 Cosmos [2] 的动作条件设计。对于每个未来潜变量槽,时间对齐的动作被分组为一个动作块,并通过轻量级 MLP 进行投影:

(4)

这些条件分别注入到扩散时间步嵌入和 AdaLN 调制嵌入中。由此产生的动作条件会广播到对应未来时间步的空间 token 和相机视角上,而观测时间步则保持无条件状态。

与 VAM 不同,ACVS 不生成动作。其唯一目的是估计场景在给定动作序列下将如何演变,从而允许不同的候选动作在同一观测和指令下引发不同的想象未来。

V-C 奖励与进度评分

除了预测未来的视觉展开外,ACVS 还为每个候选动作块预测一条密集的奖励轨迹。我们将每个操作任务分解为子任务,并在子任务层面分配进度标签。然后,通过在每个子任务片段内进行蒙特卡洛传播来估计帧级奖励,从而产生密集的监督信号,而非单一的最终成功标签。

失败数据被有意纳入奖励构建中。对于失败的子任务片段,其对应轨迹上的奖励被赋值为负值。这些失败示例教会 ACVS 识别那些会导致接触失败、物体运动错误或任务倒退的、以动作为条件的未来状态。因此,ACVS 学会了区分那些能推动任务取得实质性进展的动作,与那些仅仅产生视觉上合理运动的动作。

为了进一步提高模拟器的保真度,我们使用包含大量失败和恢复轨迹的数据来增强模拟器训练。虽然此类数据作为直接的策略监督信号可能并非最优,但它们对模拟器学习尤其有价值,因为这能让模型接触到仅从成功演示中难以观察到的分布外动作、失败交互以及恢复行为。

V-D 训练目标

ACVS 采用与 VAM 相同的流匹配公式,并联合监督未来视频潜在表示和密集奖励轨迹。设 表示干净的视觉上下文, 表示由候选动作 生成的未来潜在展开轨迹, 表示目标奖励轨迹。给定噪声水平 和 ,标准流匹配构造会产生带噪声的输入以及速度目标 。我们优化

(5)

其中 和 分别表示视频和奖励速度预测器, 表示奖励头所使用的、以动作为条件的视频特征。在所有实验中,我们简单设置 。

VI. 测试时计算

在大规模异构交互数据上进行预训练,使得条件动作分布天然具有多模态性:对于相同的指令和场景,机器人可以通过多个可行的动作序列来完成任务。这些解决方案在精度、鲁棒性和成功可能性上可能各不相同。因此,选择高质量的动作成为一个重要的部署阶段问题。

为了解决这一挑战,-WM 采用了一种从粗到细的测试时计算策略。它首先从 VAM 中采样多个候选动作,并应用一个轻量级的自一致性过滤器来识别可靠的候选。只有当采样的候选看起来不可靠时,系统才会调用 ACVS 进行更昂贵的展开评估和动作修正。这种设计在大多数情况下保持了实时性能,同时保留了从困难状态中恢复的能力。整个过程总结在算法 1 中。

媒体内容 · 前往原文查看
算法 1 测试时计算

1:VAM , ACVS

2:当前上下文

3:候选预算 , 阈值

4:采样候选动作

5:对于 执行

6: 计算

7:结束循环

8:

9:如果 则

10: 返回

11:结束条件判断

12:对于 执行

13: 使用 ACVS 评估候选

14: 计算展开值

15:结束循环

16:

17:返回

媒体内容 · 前往原文查看
算法 2 低质量动作修正

1:选定的展开潜在表示

2:将 转换为未来条件

3:使用 和选定的未来条件重新查询 VAM

4:生成修正后的动作块

5:返回

VI-A 重新去噪一致性分数

给定当前上下文 ,VAM 采样候选动作块 。

对于每个候选动作,我们随机采样流程时间步长,并按照训练时使用的相同流程匹配过程对动作进行重新加噪。然后,通过 VAM 的动作向量场评估重新加噪后的动作,产生一个平均重新去噪误差。

我们将重新去噪一致性分数(RCS)定义为

(6)

并选择

(7)

RCS 作为一种轻量级分布过滤器。它倾向于选择那些与学习到的条件动作流形更一致的候选动作,同时与基于展开的评估相比,引入的计算开销可以忽略不计。

VI-B 低质量动作修正

尽管 RCS 能在采样的动作中识别出最自洽的候选动作,但在具有挑战性的状态下,所有候选动作可能仍然表现不佳。因此,我们引入了低质量动作修正(LAR)。

当所选候选动作满足

(8)

其中 表示一个可靠性阈值,此时会调用 ACVS 来评估所有候选动作。对于每个候选动作块,ACVS 会预测一个想象展开轨迹和一个密集奖励轨迹

(9)

展开值计算为

(10)

其中 衡量了想象展开轨迹所实现的最大任务进度。具有最高值的展开轨迹

(11)

被选为最有前景的未来轨迹。

Refer to caption
图 3:我们评估任务的示意图。(a) 将桌上的不同工具放入工具箱中对应的位置(工具箱)。(b) 拉开书包拉链,将物品放入其中,然后拉上拉链(书包)。(c) 将软管连接到水龙头并固定好(水龙头)。(d) 将羽毛球放入并盖上盖子(羽毛球)。

我们并非直接执行相应的动作,而是根据所选定的未来展开轨迹进行第二次策略查询。具体来说,将展开轨迹的潜在表示转换为一个额外的未来条件,并注入到 VAM 中,从而使策略能够生成一个明确朝向所选高价值未来轨迹的精细化动作块。修正过程总结在算法 2 中。

VII 实验评估

我们在长时程、细粒度的真实机器人操作任务上评估了 -WM。实验旨在回答三个问题:(i) 所提出的 VAM 是否能在具有挑战性的多阶段操作任务中实现强大的策略性能,(ii) 使用机器人、UMI 风格和以自我为中心的交互数据进行异构预训练是否能提升下游性能,以及 (iii) 部署时的计算是否通过动作选择和修正进一步改善闭环执行。我们与代表性的策略和视频动作基线进行了比较,并对数据组成和测试时计算进行了消融实验。

实验设置。实验涵盖三种机器人实体——AGIBOT-G01、ARX 机械臂以及双臂 Franka 系统——并包括语言条件化的多视角包装和组装任务。主要评估指标是任务成功率。我们将 -WM 与代表性的策略和视频动作基线进行了比较,包括 [6] 和 Fast-WAM [45]。对于部署时推理,我们还将我们的测试时计算策略与标准执行、无分类器引导 (CFG) [18] 和动作一致性引导 (ACG) [32] 进行了额外比较。其他实现细节,包括训练超参数、部署延迟和推理设置,均在附录中提供。

VII-A 主要结果

Refer to caption
图 4:不同模型在成功率和任务完成进度方面的比较。考虑到长时程任务的复杂性,我们使用任务成功率和分步任务完成进度来评估不同模型。
媒体内容 · 前往原文查看
表 I:自我中心数据与 UMI 预训练的效果。不同预训练方案在零样本和 SFT 评估上的成功率。
零样本:笔入座
数据 整洁 杂乱 平均
机器人 0.22 0.06 0.14
机器人+UMI+自我中心 0.56 0.53 0.55
SFT:物体擦拭-放置
数据 整洁 杂乱 平均
机器人 0.85 0.55 0.70
机器人+UMI+自我中心 0.90 0.75 0.83

我们在图3所示的四项对精度敏感的操控任务上评估了闭环执行能力,所有这些任务均未包含在预训练语料中。这些任务需要长程推理、多阶段物体交互以及精确的几何对齐。例如,"书包"任务需要顺序拉链操作和物体放置,而"水龙头"任务则要求精确的软管对齐和牢固连接。为评估具身多样性,"羽毛球"任务在ARX机械臂上执行,"水龙头"任务在双臂Franka平台上执行,其余任务则在AGIBOT-G01平台上完成。

图4显示,-WM 取得了最高的平均成功率,并在大多数任务上表现最佳。尽管基线方法在"工具箱"任务上具有竞争力,但在需要更长程协调和精细操控的任务上性能有所下降。相比之下,-WM 在所有四项任务上均保持稳定的强劲表现。值得注意的是,"水龙头"任务对所有方法而言仍具挑战性,表明该任务远未达到饱和状态;然而,-WM 在这些严格的对齐约束条件下仍取得了最高成功率。我们将这一优势归因于对未来视觉动态与可执行动作的联合建模,这比仅基于动作的策略学习提供了更丰富的预测监督信号。总体而言,这些结果表明 VAM 能够在多种机器人具身形态上有效扩展,同时保持强大的长程操控能力。

有趣的是,我们还观察到了二元成功指标未能捕捉到的定性差异。在"工具箱"任务中,基线策略常常在工具插入正确槽位后立即停止,即使插入不完整或工具仍处于松动状态。相比之下,-WM 在终止回合前通常会执行额外的修正动作,例如将工具进一步推入或压紧。我们推测,这种行为源于对未来视觉结果的显式建模,这促使策略优化最终场景配置的质量,而非仅仅达到一个中间任务完成状态。

媒体内容 · 前往原文查看
表二:测试时计算变体对比。报告了每项任务的成功率及跨任务平均成功率。仅限单次完成,不允许重试。
变体 纸巾盒 笔盒 平均
无 TTC 0.55 0.30 0.43
带 CFG [18] 0.25 0.15 0.20
带 ACG [32] 0.40 0.35 0.38
带 RCS 0.65 0.35 0.50
带 RCS + LAR 0.70 0.50 0.60

VII-B 消融实验

预训练数据组成。为验证所提出的预训练数据混合策略的有效性,我们训练了两个 -WM 模型:一个仅在机器人遥操作数据上训练,另一个在完整预训练语料上训练。我们在零样本执行和监督微调两种设置下进行了对比。零样本任务要求拿起一支笔并放入笔筒,微调任务要求拿起一个物体、擦掉污渍并放回桌面。两项任务均在整洁和杂乱的桌面变体下进行评估。

表一显示,加入 UMI 和以自我为中心的数据在两种设置下均提升了性能。在零样本设置下提升最为显著,平均成功率从 0.14 提高到 0.55。这表明 UMI 和以自我为中心的交互数据主要改善通用操作先验和视觉理解,这些能力能有效迁移到之前未见过的任务上。在 SFT 之后,这种优势仍然可见,尤其是在杂乱条件下,表明模型鲁棒性得到提升,而不仅仅是适应速度更快。

测试时计算。我们基于预训练的 VAM 在两个任务上对所提出的测试时计算策略进行了消融实验:从纸巾盒中抽出一张纸巾并放入盒子(TissueBox),以及拿起一支笔并放入盒子(PenBox)。为隔离 TTC 的效果,我们采用了更严格的协议,仅允许单次尝试,不允许重试。每个实验重复 20 次。

除非另有说明,TTC 在每个决策步骤使用四个动作提案。它包含两个阶段:RCS,执行基于轻量级自一致性的候选选择;以及 LAR,当所选动作被认为不可靠时,调用 ACVS 进行基于 rollout 的动作修正。

表 II 显示,所提出的测试时计算的两个阶段在单次尝试设置下均能提升执行性能。仅使用轻量级 RCS 过滤器,平均成功率便从 0.43 提升至 0.50,这表明相当一部分失败源于选择了次优的动作样本,而非策略能力不足。进一步启用 LAR,通过利用基于动作条件的未来轨迹进行动作修正,将平均成功率提升至 0.60。

表 II 还将我们的方法与现有的生成时引导方法进行了比较。虽然 CFG [18] 和 ACG [32] 修改了生成过程本身,但我们的方法在执行前明确评估候选动作及其引发的未来状态。因此,RCS+LAR 在所有任务上均一致取得了最佳性能。在 PenBox 任务上更大的改进进一步表明,对于需要精确物体放置与对齐的操作任务,基于未来状态的修正尤其有益。

第八部分 结论与未来工作

我们提出了 -WM,一个统一的视频-动作世界模型,它将动作生成、未来预测和部署时推理整合在同一个预测框架内。

-WM 的一个关键特性是其能够从异构交互数据中学习,包括真实机器人遥操作、UMI 风格演示、第一人称人类视频以及模拟器生成的轨迹数据。这种统一的训练范式使得视频预测和动作生成能够在单一框架内学习,同时支持部署时推理。在长时域、细粒度操作任务上的实验表明,该模型在多种机器人形态上均展现出强大的策略性能,异构预训练带来了一致的性能提升,并且测试时计算带来了显著的改进。

展望未来,有几个方向仍颇具前景。首先,许多灵巧操作任务需要的信息远不止视觉。融入额外的感知模态,特别是触觉反馈,可能有助于更可靠地对插入、紧固和可变形物体操作等接触密集的交互进行建模。其次,虽然我们提出的测试时计算策略已经提升了执行性能,但开发更可靠的部署时推理机制仍然是一个重要挑战。更好的不确定性估计、更长周期的评估以及更有效的搜索策略,可能会进一步改善在困难状态下的动作选择。最后,将预测建模扩展到更长的时间跨度和更复杂的操作场景,可能会实现更丰富的未来想象和更强的决策能力。

总体而言,我们相信预测性机器人学习为构建能力更强、更可靠的机器人基础模型提供了一条有前景的路径,而 -WM 则是朝着这个方向迈出的切实一步。

第九章 致谢

我们要感谢张金宇、王森、彭友伦、任新林、潘明杰、宋建恒、冯思远、刘中原、李栋、蔡晓伟、魏大峰、蒋涵、鞠润坤、李少伟、王丽波、聂步青、唐克峰在整个项目过程中做出的宝贵贡献和支持。他们在数据采集、系统开发、实验部署、基础设施维护和工程实现方面的努力,对完成这项工作至关重要。

-A 训练与部署细节

-A1 训练配置

-WM 分两个阶段进行训练。预训练阶段使用了 27.3K 小时的异构交互数据,包括真实机器人遥操作、UMI 风格的交互数据、第一人称人类视频以及回滚或失败轨迹。后训练阶段则进一步使模型适应下游的机器人操作任务。

预训练和后训练阶段分别使用 12,288 和 384 的全局批次大小。两个阶段均采用 AdamW 优化器,学习率为 。除非另有说明,所有实验在不同具身形态和任务中使用相同的优化超参数。

-A2 部署细节

所有真实机器人实验均在语言条件约束下的多视角观测中进行。除非另有说明,动作以固定长度为 30 的动作块,采用后退时域闭环方式执行。

真实机器人推理部署在单张 RTX 5090 GPU 上。在标准部署配置下,端到端动作生成延迟约为每次查询 220 毫秒。通过缓存可复用的文本表征,延迟可降至约 180 毫秒,且不改变模型输出。

-B 推理加速

为提升部署效率,我们采用了若干实现层面的优化措施。

-B1 交叉注意力 KV 缓存

在仅动作推理过程中,视频分支通过交叉注意力为动作分支提供条件特征。由于视觉上下文在去噪过程中保持不变,对应的键张量和值张量仅计算一次,并在所有采样步骤中复用。

设 为 Transformer 层 的视频特征。我们缓存

(12)

并在整个推理过程中复用,从而消除冗余的投影运算。

-B2 融合 QKV 投影

我们将查询、键和值的投影融合为单个矩阵乘法,

(13)

与三个独立的投影层相比,这减少了内核启动开销并提高了内存吞吐量。

-B3 简化旋转位置嵌入

动作 token 构成一维时间序列。因此,我们预计算一维旋转位置嵌入并在整个部署过程中复用,避免了重复的频率构建,并减少了位置编码开销。

-B4 Torch 编译优化

我们还额外采用了 torch.compile [4] 并配合逐块编译。结合上述优化,部署延迟可从约 180 毫秒进一步降低至 140 毫秒。尽管 torch.compile 通常能保持模型功能,但与即时执行模式相比,编译器级别的图变换和内核融合可能会引入微小的数值差异。对于基于扩散模型的模型,这种差异有时会在采样过程中传播,导致输出略有不同。因此,除非另有说明,主论文中报告的所有结果均在不使用 torch.compile 的情况下获得,以确保实验之间的一致性和可复现性。

参考文献

  • [1] N. Agarwal, A. Ali, M. Bala, Y. Balaji, E. Barker, T. Cai, P. Chattopadhyay, Y. Chen, Y. Cui, Y. Ding, 等. (2025) Cosmos 世界基础模型平台,用于物理 AI. arXiv 预印本 arXiv:2501.03575. 引用自:§II-A, §II-B.
  • [2] A. Ali, J. Bai, M. Bala, Y. Balaji, A. Blakeman, T. Cai, J. Cao, T. Cao, E. Cha, Y. Chao, 等. (2025) 基于视频基础模型的物理 AI 世界模拟. arXiv 预印本 arXiv:2511.00062. 引用自:§II-B, §V-B.
  • [3] E. Alonso, A. Jelley, V. Micheli, A. Kanervisto, A. Storkey, T. Pearce, 和 F. Fleuret (2024) 用于世界建模的扩散模型:Atari 游戏中的视觉细节至关重要. 神经信息处理系统进展 37, 第 58757–58791 页. 引用自:§I.
  • [4] J. Ansel, E. Yang, H. He, O. K. Ulyanov, 等. (2024) PyTorch 2:通过动态 Python 字节码转换和图编译实现更快的机器学习. 载于第 29 届 ACM 编程语言与操作系统架构支持国际会议 (ASPLOS) 论文集. 引用自:§-B4.
  • [5] H. Bi, H. Tan, S. Xie, Z. Wang, S. Huang, H. Liu, R. Zhao, Y. Feng, C. Xiang, Y. Rong, 等. (2025) Motus:一个统一的潜在动作世界模型. arXiv 预印本 arXiv:2512.13030. 引用自:§II-A.
  • [6] K. Black, N. Brown, J. Darpinian, K. Dhabalia, D. Driess, A. Esmail, M. R. Equi, C. Finn, N. Fusai, M. Y. Galliker, 等. (2025) :一个具备开放世界泛化能力的视觉-语言-动作模型. 载于第 9 届机器人学习年度会议. 引用自:§VII.
  • [7] T. Brooks, B. Peebles, C. Holmes, W. DePue, Y. Guo, L. Jing, D. Schnurr, J. Taylor, T. Luhman, E. Luhman, C. W. Y. Ng, R. Wang, 和 A. Ramesh (2024) 视频生成模型作为世界模拟器。注:https://openai.com/research/video-generation-models-as-world-simulators OpenAI 研究博客 引用自:§II-B。
  • [8] C. Chen, Y. Wu, J. Yoon, 和 S. Ahn (2022) Transdreamer:基于 Transformer 世界模型的强化学习。arXiv 预印本 arXiv:2202.09481。引用自:§II-B。
  • [9] C. Chi, Z. Xu, C. Pan, E. Cousineau, B. Burchfiel, S. Feng, R. Tedrake, 和 S. Song (2024) 通用操作接口:无需真实机器人的野外机器人教学。arXiv 预印本 arXiv:2402.10329。引用自:§II-A。
  • [10] F. Ebert, C. Finn, S. Dasari, A. Xie, A. Lee, 和 S. Levine (2018) 视觉预见:基于模型的深度强化学习在视觉机器人控制中的应用。arXiv 预印本 arXiv:1812.00568。引用自:§II-B。
  • [11] C. Finn 和 S. Levine (2017) 用于规划机器人运动的深度视觉预见。载于 2017 年 IEEE 国际机器人与自动化大会 (ICRA),第 2786–2793 页。引用自:§II-B。
  • [12] S. Gao, W. Liang, K. Zheng, A. Malik, S. Ye, S. Yu, W. Tseng, Y. Dong, K. Mo, C. Lin, 等 (2026) DreamDojo:基于大规模人类视频的通才机器人世界模型。arXiv 预印本 arXiv:2602.06949。引用自:§II-B。
  • [13] GenRobot (2025) 10Kh realomni-open 数据集。注:https://www.genrobot.ai/data/open-dataset 超过 100 万条来自真实世界和全场景机器人操作的视频片段。引用自:§III。
  • [14] Google DeepMind (2024) Veo:一个视频生成系统。注:https://deepmind.google/technologies/veo/ 引用自:§II-B。
  • [15] Y. Guo, L. X. Shi, J. Chen, 和 C. Finn (2025) Ctrl-world:用于机器人操作的可控生成式世界模型。arXiv 预印本 arXiv:2510.10125。引用自:§II-B。
  • [16] Y. HaCohen, N. Chiprut, B. Brazowski, D. Shalem, D. Moshe, E. Richardson, E. Levin, G. Shiran, N. Zabari, O. Gordon, 等 (2024) Ltx-video:实时视频潜在扩散模型。arXiv 预印本 arXiv:2501.00103。引用自:§II-A。
  • [17] D. Hafner, T. Lillicrap, J. Ba, 和 M. Norouzi (2019) 《通过梦境控制:利用潜在想象学习行为》。arXiv 预印本 arXiv:1912.01603。引用于:§I。
  • [18] J. Ho 和 T. Salimans (2022) 《无分类器扩散引导》。arXiv 预印本 arXiv:2207.12598。引用于:§VII-B,表 II,§VII。
  • [19] R. Hoque, P. Huang, D. J. Yoon, M. Sivapurapu, 和 J. Zhang (2025) 《Egodex:从大规模自我中心视频学习灵巧操作》。arXiv 预印本 arXiv:2505.11709。引用于:§II-A,§III。
  • [20] S. Huang, L. Chen, P. Zhou, S. Chen, Y. Liao, Z. Jiang, Y. Hu, P. Gao, H. Li, M. Yao, 等人 (2026) 《Enerverse:构想具身未来机器人操作空间》。神经信息处理系统进展 38,第 37693–37720 页。引用于:§IV-B。
  • [21] Y. Jiang, S. Chen, S. Huang, L. Chen, P. Zhou, Y. Liao, X. He, C. Liu, H. Li, M. Yao, 等人 (2025) 《Enerverse-AC:构想带动作条件的具身环境》。arXiv 预印本 arXiv:2505.09723。引用于:§II-B。
  • [22] R.E. Kalman (1960) 《线性滤波与预测问题的新方法》。基础工程杂志 82 (1),第 35–45 页。引用于:§I。
  • [23] A. Khazatsky, K. Pertsch, S. Nair, A. Balakrishna, S. Dasari, S. Karamcheti, S. Nasiriany, M. K. Srirama, L. Y. Chen, K. Ellis, 等人 (2024) 《Droid:一个大规模野外机器人操作数据集》。arXiv 预印本 arXiv:2403.12945。引用于:§II-A。
  • [24] M. J. Kim, Y. Gao, T. Lin, Y. Lin, Y. Ge, G. Lam, P. Liang, S. Song, M. Liu, C. Finn, 等人 (2026) 《Cosmos Policy:微调视频模型以实现视觉运动控制与规划》。arXiv 预印本 arXiv:2601.16163。引用于:§II-A。
  • [25] W. Kong, Q. Tian, Z. Zhang, R. Min, Z. Dai, J. Zhou, J. Xiong, X. Li, B. Wu, J. Zhang, 等人 (2024) 《混元视频:大型视频生成模型的系统框架》。arXiv 预印本 arXiv:2412.03603。引用于:§II-B。
  • [26] L. Li, Q. Zhang, Y. Luo, S. Yang, R. Wang, F. Han, M. Yu, Z. Gao, N. Xue, X. Zhu, 等人 (2026) 《用于机器人控制的因果世界建模》。arXiv 预印本 arXiv:2601.21998。引用于:§II-A。
  • [27] S. Li, Y. Gao, D. Sadigh, 和 S. Song (2025) 《统一视频动作模型》。arXiv 预印本 arXiv:2503.00200。引用于:§II-A。
  • [28] J. Liang, P. Tokmakov, R. Liu, S. Sudhakar, P. Shah, R. Ambrus 和 C. Vondrick (2025) 视频生成器即机器人策略。arXiv 预印本 arXiv:2508.00795。引用于:§II-A。
  • [29] Y. Liao, P. Zhou, S. Huang, D. Yang, S. Chen, Y. Jiang, Y. Hu, J. Cai, S. Liu, J. Luo 等 (2025) Genie Envisioner:面向机器人操作的一个统一世界基础平台。arXiv 预印本 arXiv:2508.05635。引用于:§II-A、§II-B、§IV-B。
  • [30] Y. Lipman, R. T. Chen, H. Ben-Hamu, M. Nickel 和 M. Le (2023) 用于生成式建模的流匹配。载于第11届国际学习表征会议,ICLR 2023。引用于:§IV-C。
  • [31] A. O’Neill, A. Rehman, A. Maddukuri, A. Gupta, A. Padalkar, A. Lee, A. Pooley, A. Gupta, A. Mandlekar, A. Jain 等 (2024) Open X-Embodiment:机器人学习数据集与 RT-X 模型:Open X-Embodiment 协作 0。载于2024年IEEE国际机器人与自动化大会(ICRA),第6892–6903页。引用于:§II-A。
  • [32] M. Park, K. Kim, J. Hyung, H. Jang, H. Jin, J. Yun, H. Lee 和 J. Choo (2025) ACG:面向基于流的 VLA 模型的动作一致性引导。arXiv 预印本 arXiv:2510.22201。引用于:§VII-B、表 II、§VII。
  • [33] W. Peebles 和 S. Xie (2023) 基于 Transformer 的可扩展扩散模型。载于《IEEE/CVF 国际计算机视觉会议论文集》,第4195–4205页。引用于:§IV-B。
  • [34] A. Polyak, A. Zohar, A. Brown, A. Tjandra, A. Sinha, A. Lee, A. Vyas, B. Shi, C. Ma, C. Chuang 等 (2024) Movie Gen:一组媒体基础模型。arXiv 预印本 arXiv:2410.13720。引用于:§II-B。
  • [35] R. Punamiya, S. Kareer, Z. Liu, J. Citron, R. Qiu, X. Cai, A. Gavryushin, J. Chen, D. Liconti, L. Y. Zhu 等 (2026) EgoVerse:一个面向全球机器人学习的以自我为中心的人类数据集。arXiv 预印本 arXiv:2604.07607。引用于:§III。
  • [36] Ropedia (2026) Xperience-10M:一个大规模以自我为中心的多模态数据集,包含结构化3D/4D标注。Hugging Face。注:数据集。引用于:§III。
  • [37] Runway (2025) Runway Gen-4:具有世界一致性的 AI 视频生成。注:https://runwayml.com/research/introducing-runway-gen-4。引用于:§II-B。
  • [38] H. R. Walke, K. Black, T. Z. Zhao, Q. Vuong, C. Zheng, P. Hansen-Estruch, A. W. He, V. Myers, M. J. Kim, M. Du 等人 (2023) Bridgedata v2:面向大规模机器人学习的数据集。收录于《机器人学习会议》,第 1723–1736 页。引用自:§II-A。
  • [39] T. Wan, A. Wang, B. Ai, B. Wen, C. Mao, C. Xie, D. Chen, F. Yu, H. Zhao, J. Yang 等人 (2025) Wan:开放且先进的大规模视频生成模型。arXiv 预印本,编号:arXiv:2503.20314。引用自:§II-A、§II-B、§IV-B、§V-B。
  • [40] P. Wu, A. Escontrela, D. Hafner, P. Abbeel 和 K. Goldberg (2023) Daydreamer:面向物理机器人学习的世界模型。收录于《机器人学习会议》,第 2226–2240 页。引用自:§I。
  • [41] S. Yang, Y. Du, K. Ghasemipour, J. Tompson, L. P. Kaelbling, D. Schuurmans 和 P. Abbeel (2023) 学习交互式真实世界模拟器。arXiv 预印本,编号:arXiv:2310.06114。引用自:§I。
  • [42] Z. Yang, J. Teng, W. Zheng, M. Ding, S. Huang, J. Xu, Y. Yang, W. Hong, X. Zhang, G. Feng 等人 (2025) Cogvideox:基于专家 Transformer 架构的文本到视频扩散模型。收录于《国际学习表征会议》,第 2025 卷,第 83048–83077 页。引用自:§II-A。
  • [43] A. Ye, B. Wang, C. Ni, G. Huang, G. Zhao, H. Li, H. Li, J. Li, J. Lv, J. Liu 等人 (2026) GigaWorld-policy:一种高效的以动作为中心的世界-动作模型。arXiv 预印本,编号:arXiv:2603.17240。引用自:§II-A。
  • [44] S. Ye, Y. Ge, K. Zheng, S. Gao, S. Yu, G. Kurian, S. Indupuru, Y. L. Tan, C. Zhu, J. Xiang 等人 (2026) 世界动作模型即零样本策略。arXiv 预印本,编号:arXiv:2602.15922。引用自:§II-A。
  • [45] T. Yuan, Z. Dong, Y. Liu 和 H. Zhao (2026) Fast-WAM:世界动作模型是否需要测试时的未来想象?arXiv 预印本,编号:arXiv:2603.16666。引用自:§II-A、§VII。
  • [46] C. Zhu, R. Yu, S. Feng, B. Burchfiel, P. Shah 和 A. Gupta (2025) 统一世界模型:耦合视频与动作扩散以在大型机器人数据集上进行预训练。arXiv 预印本,编号:arXiv:2504.02792。引用自:§II-A。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org