跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-05-26精选AI 评分72

GE-Sim 2.0:面向机器人操作的全面闭环视频世界模拟器路线图

GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation

AI 导读

GE-Sim 2.0是一个用于机器人操作的闭环视频世界模拟器。它基于动作条件视频生成框架,并使用数千小时涵盖遥操作与接触交互等真实世界数据进行重新训练,提升了动作跟随与轨迹覆盖能力。其核心新增三个模块:从视频潜变量解码本体感受状态的“状态专家”;为生成轨迹评分并提供成功信号与奖励的“世界评判”;以及能实现快速轨迹生成的加速框架。该模型仅2B参数,在WorldArena排行榜上位列第一,优于专用模型与闭源生成器,其训练出的策略能转化为实际世界性能提升。

推荐理由

过去机器人策略训练卡在仿真到真机的鸿沟上,GE-Sim 2.0 把视频生成、状态提取和自动评估闭环了,策略迭代效率可能翻倍,搞具身智能的很值得蹲一下。

正文 · AI 翻译

邱柏翔

陈立亮

廖悦

王楠

王林涛

罗嘉怡

赵文智

陈圣聪

陈迪

李晔

高晨

颜水成

刘思

姚茂卿

任光辉

智元机器人

北京航空航天大学

LV-NUS 实验室

天津大学

摘要

我们推出 GE-Sim 2.0(Genie Envisioner 世界模拟器 2.0),这是一个用于机器人操作的闭环视频世界模拟器。GE-Sim 2.0 基于 Genie Envisioner 的动作条件视频生成框架构建,在数千小时的真实机器人数据上重新训练,涵盖遥操作、接触丰富的交互以及机载机器人策略部署,显著提升了动作跟随保真度和轨迹覆盖范围。在此基础之上,三个新模块实现了从视频模拟到策略学习的闭环:一个状态专家,从视频隐空间中解码本体感知状态,以支持下游策略模型的下一个片段预测;一个世界裁判,根据任务指令对生成的 rollout 进行评分,提供机器可验证的成功信号和奖励,取代人工检查;以及一个加速框架,在单个 H100 上仅需 2.3 秒即可生成 25 帧的 rollout,并在推理时支持最多帧跳过以实现长时域评估。GE-Sim 2.0 以仅 2B 参数登顶公开的 WorldArena 排行榜,超越了专用机器人世界模型和闭源通用视频生成器,并且基于其 rollout 和奖励训练的策略可转化为可衡量的真实世界收益,使 GE-Sim 2.0 成为用于操作策略可扩展评估和闭环学习的实用平台。


图 1:GE-Sim 2.0 概览。GE-Sim 2.0 是一个面向机器人操作的闭环视频世界模拟器,基于数百万个真实世界片段训练而成,涵盖遥操作、机载策略部署以及丰富的物体交互场景。给定长时域多视角历史帧以及从末端执行器标定中嵌入的动作轨迹,该模型可生成以动作为条件的多视角展开画面,展示机器人执行指定行为的过程(上图)。在视觉模拟基础上,两个互补模块构成闭环(下图):本体感知状态专家从视频隐空间中解码出双臂关节角度和夹爪状态,为下游策略模型提供下一片段预测所需的状态信息;基于 VLM 的世界裁判则根据任务指令对生成的展开画面进行评分。

引言

机器人学习正进入规模化时代。更大的模型、互联网规模的演示数据,以及日益强大的视觉-语言-动作(VLA)策略 [brohan2022rt, brohan2024rt, driess2023palm, zhu2023vima, team2024octo, black2024pi0, intelligence2025pi05, kim2024openvla, generalist2025gen0, generalist2026gen1],正推动操作任务从刚体拾放向长时域、高接触、可变形物体任务演进。然而,随着策略规模不断扩大,评估已成为瓶颈:真实机器人基准测试速度慢且难以复现,而现有的机器人基准和模拟器 [james2020rlbench, mees2022calvin, liu2023libero, todorov2012mujoco, Makoviychuk2021IsaacGH, Xiang2020SAPIENAS, Gu2023ManiSkill2AU, Lin2020SoftGymBD] 在接触动力学、可变形物体、精细视觉外观乃至机器人自身驱动(如谐波减速器柔顺效应通常被简化处理)方面仍存在困难。我们能够训练的内容与能够可靠评估的内容之间的差距正在不断扩大。

生成式视频建模的最新进展 [Singer2022MakeAVideoTG, Villegas2022PhenakiVL, Blattmann2023AlignYL, BarTal2024LumiereAS, openai2024sora] 提供了一条不同的路径。经过网络规模视频训练的现代生成器,能够合成出涵盖广泛场景、物体和交互的照片级真实感画面,这是手工构建的模拟器难以轻易复现的。这催生了一种新的范式——用于操控的神经世界模拟器:给定初始观测以及来自策略、人类或遥操作的动作轨迹,该模型会在一个学习到的视觉世界中,滚动生成机器人执行该行为的视频。通过用数据驱动的生成过程取代手工构建的物理引擎和渲染器,这种模拟器有望覆盖经典引擎所遗漏的真实世界外观与交互的长尾分布,从而为现代操控策略的可扩展评估和闭环策略学习(包括强化学习)开辟一条道路。

一系列日益增多的研究工作 [ho20251x, wang2026interactive, jiang2025enerverseac, liao2025genie, guo2025ctrl, zhu2024irasim, nvidia2025cosmos, gao2026dreamdojo] 已开始探索基于视频的操作世界模拟器,其中包括我们自己的 GE-Sim [liao2025genie]。这些工作遵循一个共同的思路:将预训练的文本-图像到视频(TI2V)生成器重新改造为动作-图像到视频模拟器,具体做法是用动作条件替换文本条件,而迄今为止的大部分技术努力都集中在如何注入这一动作信号,以使生成的视频忠实地遵循给定的轨迹。尽管此类系统已能生成视觉上合理的动作条件展开序列,但它们在可变形物体以及分布外或失败轨迹上的保真度仍然有限。更根本的是,即使是一个完美逼真的、遵循动作的视频,其本身也并不能构成一个可供策略闭环运行的模拟器。三个关键差距尤为突出:(i)现有模拟器仅预测未来的视觉状态,未能对现代策略模型所需的本体感受状态进行建模,而指令动作被用作一个会偏离机械臂实际运动的噪声代理;(ii)它们生成展开序列但不进行评分,从而缺失了可扩展评估和奖励驱动学习所需的可验证信号;(iii)它们的渲染吞吐量远低于跨多个任务和种子的分块并行展开所需的要求。这三个差距共同标示了从当今的动作条件视频模型通向我们所称的用于操作的闭环世界模拟器的路径。

为弥补这些差距,我们推出了 GE-Sim 2.0(Genie Envisioner 世界模拟器 2.0),如图 1 所示。GE-Sim 2.0 保留了 GE-Sim [liao2025genie] 的动作条件视频生成主干,并在数千小时的真实世界机器人数据上重新训练,这些数据结合了大规模遥操作片段、富含接触的机械臂-物体交互序列,以及在物理机器人上部署策略时收集的 rollout 数据。以长程多视角历史帧和动作轨迹为条件,该模型会生成机器人执行指定行为的、跟随动作的多视角视频。这种数据规模和多样性显著提升了动作跟随精度、物体变形与接触的视觉保真度,以及涵盖成功执行、失败案例以及多样化任务和场景的轨迹覆盖范围。在这一强化基础之上,我们引入了三个模块,直接针对上述三个差距。首先,一个状态专家从视频隐空间中解码本体感受状态,即双臂关节角度和夹爪状态,为下游策略模型提供与视觉观测相伴的可靠状态,用于下一片段预测。其次,一个基于 VLM 的世界评判器根据任务指令对生成的 rollout 进行评分,将模拟器输出转化为机器可验证的成功信号和奖励,用于策略评估和奖励驱动学习。第三,一个加速框架在不牺牲保真度的情况下提升 rollout 吞吐量,使得分块、大规模 rollout 变得可行。这些组件共同将 GE-Sim 2.0 从一个视觉模拟器推进为一个闭环、机器可验证的平台,用于可扩展的操控策略训练与评估。

我们按照上述设计维度对 GE-Sim 2.0 进行了验证。作为一款基础视频模拟器,它仅凭 2B 参数便登顶公开的 WorldArena 排行榜 [shang2026worldarena],性能超越了 Ctrl-World [guo2025ctrl]、DreamDojo [gao2026dreamdojo]、GigaWorld [gigaworld2025] 和 ABot [chen2026abot] 等专用机器人世界模型,以及包括 Sora [openai2024sora] 和 Veo [deepmind2025veo3] 在内的闭源通用视频生成器。在更细粒度上,针对六项代表性操作任务的逐任务回放指标(PSNR、SSIM、LPIPS、FID、FVD)显示,这一优势在各项任务中均成立;闭环评估表明,模拟器内的策略结果在总体和逐回合层面均与真实机器人一致。状态专家能以高保真度恢复本体感受状态,并改善下游的下一块预测;而世界评判器则能提供与人类判断高度一致的奖励信号。在加速框架的驱动下,GE-Sim 2.0 在单张 H100 上仅需 2.3 秒即可生成 25 帧的展开序列;随机步长训练方案支持在推理时进行跳帧,从而在不显著影响评估一致性的前提下延长模拟时域。关键在于,基于 GE-Sim 2.0 展开序列和奖励训练的策略,能够转化为可衡量的真实世界增益,使其从被动的视频生成器跃升为策略学习的主动驱动力。

预备知识

GE-Sim 2.0 基于 Genie Envisioner 平台 [liao2025genie] 构建,特别是其世界基础模型 GE-Base 和动作条件模拟器 GE-Sim。我们在此简要回顾两者以固定符号表示;熟悉 Genie Envisioner 的读者可跳过本节。

GE-Base:多视角视频世界基础模型

GE-Base 将机器人世界建模表述为一个多视角文本到视频的生成问题。给定一条语言指令和初始的多视角观测,该模型自回归地预测未来的视频块,以捕捉场景在指令下如何演变。

自回归分块生成。设 \( C \) 为车载摄像头集合(头部、左腕、右腕),\( I_t^v \) 为视角 \( v \) 在时间 \( t \) 的帧。在自回归步骤 \( k \) 处,世界模型基于初始观测 \( I_0 \)、长期稀疏记忆 \( M \) 以及编码后的指令 \( e \) 预测下一块多视角帧:

(1)

其中 \( M \) 通过从先前生成的块 \( \hat{X}_{<k} \) 中稀疏采样关键帧构建,\( \tau \) 为冻结的 T5 文本编码器。这种稀疏记忆机制将模型的时间上下文扩展至远超当前块的范围,同时保持输入长度可控。

多视角编码。每个视角的输入由共享视频编码器 \( \phi \) 独立处理,生成初始 token 和记忆 token。每个 token 都附加了 3D 旋转位置编码和可学习的视角嵌入:

(2)

结合视角特定的噪声图 \( \epsilon^v \),各视角的输入序列为 \( z^v \)。所有视角的 token 被拼接后由视频扩散 Transformer (DiT) 处理。为强制跨视角一致性,部分 DiT 块对合并后的多视角序列执行跨视角注意力,其余块则独立处理各视角以提升效率。

骨干网络与训练。我们采用 Cosmos-Predict2-2B-Video2World DiT [nvidia2025cosmos] 作为骨干网络,该模型为高保真仿真提供了强大的视觉先验。训练遵循潜在流匹配目标:给定目标块的 VAE 潜变量 \( x \) 和带噪潜变量 \( z_t = \alpha_t x + \sigma_t \epsilon \),模型 \( \theta \) 预测去噪速度 \( v_\theta(z_t, c, t) \),通过条件掩码 \( m \) 对未来帧进行监督:

(3)

Genie Envisioner 世界模拟器 (GE-Sim)

GE-Sim 将 GE-Base 从文本与图像到视频的生成器改造为动作条件视频模拟器:生成过程不再由语言指令驱动,而是由底层机器人动作轨迹驱动,从而使合成视频忠实反映机器人如何在场景中执行该轨迹。

动作表示。对于双臂系统,每个控制步骤编码为一个 14 维向量,由双臂的 7 维末端执行器状态拼接而成:

(4)

其中末端执行器的位置、其横滚-俯仰-偏航姿态以及夹爪开合度。在步长范围内,完整轨迹记为。

空间动作条件化。为了桥接底层控制信号与的高维潜在空间,需要一个空间对齐的条件信号,该信号既要指定末端执行器在图像平面中的出现位置,也要指定每一帧是从哪个视角观察的。因此,GE-Sim 将 Pose2Image 渲染与显式的相机射线图相结合,两者都位于目标视图的像素网格中。

姿态图像。在每一步,位置通过标定后的相机内参和外参投影到像素坐标,姿态轴投影为方向单位向量,夹爪开合度渲染在一个单位圆上,其明暗反映。不同的颜色编码用于区分两个机械臂。这生成了一幅与场景空间对齐的姿态图像。

相机射线图。为了使多视角相机几何结构显式化,我们进一步根据内参和相机到世界的外参构建逐像素射线图。对于每个像素,我们构成射线原点(世界坐标系中的相机中心)和单位法向视图方向,该方向通过反向投影并经由中的相机到世界旋转矩阵旋转得到。将和沿通道维度堆叠,得到一个6通道的射线图,该图在每个像素处暴露相机姿态,因此模拟器无需仅从外观推断视角几何结构。

潜在融合。和均被双线性下采样至潜在空间分辨率,并沿通道维度与带噪视频潜在变量拼接,因此模拟器接收一个单一的融合输入。

(5)

这种通道级融合在 DiT 骨干网络的每一层都保持了动作条件、相机几何结构与潜在视频 token 之间的空间对齐。

从 TI2V 到动作条件化模拟。借助这一条件化机制,公式(1)中语言条件的作用被动作轨迹所取代,而 GE-Base 的多视角、自回归、稀疏记忆骨干网络保持不变。因此,模拟器预测。

(6)

其中,动作子轨迹与数据块对齐,而 表示通过将上述层级动作条件替换为 所得到的动作条件模拟器。这一公式构成了 GE-Sim 2.0 的构建基础。

Genie Envisioner 世界模拟器 2.0

在本节中,我们介绍 GE-Sim 2.0,这是对 GE-Sim 的全面升级。GE-Sim 2.0 将“仅可观看”的视频世界模拟器,升级为能与策略模型精确交互并提供交互反馈的闭环世界模拟器。

概述

如图 2 所示,在每个自回归步骤中,GE-Sim 2.0 接收初始观测 、稀疏记忆 和动作序列 作为输入。在典型部署场景中, 由被评估的策略模型生成,但该模拟器对动作来源不敏感,同样可接受来自遥操作日志、运动规划器或手动编写轨迹的动作。遵循第 2.2 节中的 Pose2Image 公式,每个动作都利用相机内参和外参被渲染为视觉对齐的 EE 姿态图,从而将每个夹爪的位置、方向和开合状态显式编码为像素级条件。这一单一动作表示在 GE-Sim 2.0 的所有组件间共享。

GE-Sim 2.0 由两个共享相同条件输入的并行专家模块构成。视觉专家是一个基于动作条件的扩散 Transformer,遵循第 2.1 节所述的逐块自回归与稀疏记忆框架,生成未来的视频片段,预测机器人在给定动作序列下将观察到的场景,充当模拟器的视觉主干。本体感知状态专家与视觉专家并行运行,通过将视觉专家的中间特征作为视觉上下文来预测相应的关节空间状态序列,还原真实机器人会返回的本体感知观测结果。当策略与 GE-Sim 2.0 耦合形成闭环系统时,两个专家模块的输出会反馈给策略,作为其下一块动作预测的输入,从而将模拟器从纯粹的视觉渲染扩展为策略交互所需完整观测的来源,并形成与真实机器人一致的交互循环。

在此循环之上,我们附加了一个世界评判器——一个视觉语言奖励模型,它对世界模拟器生成的展开序列进行逐帧评分,并输出一个机器可验证的成功信号。该信号既可作为策略评估的自动裁判,也可作为下游奖励驱动学习(如过滤式行为克隆和强化学习)的稀疏反馈,为 GE-Sim 2.0 赋予内置的评判能力。

GE-Sim 2.0 采用分阶段构建。我们首先在数千小时的真实机器人数据上训练视觉专家(第 3.2 节)。随后冻结视觉专家,训练本体感知状态专家,使其能够从视觉专家的视觉上下文中解码出关节空间状态(第 3.3 节)。世界评判器作为外部模块独立训练(第 3.4 节)。主要训练完成后,我们对世界模拟器应用基于知识蒸馏的训练后加速(第 3.5 节),将多步扩散压缩为少步推理。以下四个小节将依次介绍这些组件。

Refer to caption
图 2:视觉专家与本体感知状态专家概览。视觉专家处理历史帧和动作条件以生成未来视觉状态,随后由本体感知状态专家利用这些状态来预测双臂的关节角度和夹爪开合度。

动作条件视频生成

GE-Sim 2.0 的视觉专家是一个以动作为条件的多视角扩散模型,充当模拟器的视觉主干。它继承了第 2.1 节所述 GE-Base 的分块自回归生成、稀疏记忆和多视角扩散 Transformer。在此基础上,为使视觉专家成为适用于闭环策略交互的高保真模拟器,我们描述了其条件接口、动作表示和训练方法。

条件接口。视觉专家在视频 VAE 的潜在空间中运行,其所有条件均通过通道级拼接输入网络。在每个自回归步骤中,网络输入为

(7)

其中 是 16 通道的含噪视频潜在表示, 是 6 通道的逐像素光线图, 是 3 通道的末端执行器位姿图, 是 1 通道的二进制掩码,用于区分记忆帧和待预测帧。光线图和末端执行器位姿图共同构成接下来介绍的动作表示。所有视觉输入在编码前均从 归一化到 ,两个条件图遵循相同约定,从而使视频通道与条件通道在数值上对齐,扩散训练不会因尺度不匹配而不稳定。

动作表示。GE-Sim 2.0 通过两个视觉对齐的通道——光线图 和末端执行器位姿图 ——将双臂动作传递给视觉专家。两者共同编码了相机所观察到的动作:光线图捕捉视点随机器人移动的方式,而末端执行器位姿图则捕捉末端执行器在该视点内的移动方式。在我们的设置中,解耦这两个因素至关重要,因为头部和腕部相机本身安装在移动机器人上,尤其是腕部视角会随手臂大幅移动。

射线图。对于每个像素,我们根据每帧的相机内参和外参在世界坐标系中构建一条射线,该射线由其起点和单位方向共同表示(共六个通道)。随着相机随机器人移动,射线图也会相应变化,为视觉专家提供明确的相机几何先验,使其能够将由视角运动引起的外观变化与场景中物体运动引起的外观变化区分开来。这对于腕部相机尤为重要,因为在该场景下,末端执行器相对于相机几乎是静止的,而射线图承载了手臂的大部分运动学信号。

末端执行器位姿图。按照第2.2节中GE-Sim的Pose2Image公式,我们将双臂的未来末端执行器轨迹渲染到每个相机视角的图像空间中,生成一个与场景空间对齐的3通道末端执行器位姿图。对于每个时间步和每个视角,渲染过程分三步进行。(i) 位姿投影。我们将每只手臂的夹爪位姿表示为世界坐标系中的变换,通过固定的腕部到末端执行器校正将其转换到相机坐标系,并将末端执行器原点以及沿三个坐标轴各一个关键点投影到图像平面上,从而获得末端执行器位置及其方向的像素坐标。(ii) 深度感知渲染。在画布上,我们在末端执行器原点处绘制一个实心圆,其半径随相机到末端执行器的距离单调递减,

(8)

因此,末端执行器(EE)离摄像头越近,圆圈就越大。末端执行器的朝向通过连接原点与三个投影轴关键点的彩色线段来绘制,左臂和右臂使用不同的配色方案。(iii) 夹爪开合度编码。圆圈的填充颜色通过一个连续的色图来编码夹爪的开合度:随着夹爪从闭合到张开,颜色从深变浅,左臂和右臂使用不同的色系。这在一个单一、连续且稳定的通道中,共同编码了本质上是二值但具有连续程度的夹爪状态。训练和推理时使用相同的渲染器,以保持两个输入分布的对齐。末端执行器姿态图作为统一的姿态级动作条件,由视觉专家、本体感觉状态专家和世界评判器共享。

训练。我们在数千小时的真实世界机器人数据上训练视觉专家。训练数据涵盖遥操作记录、机器人策略部署的 rollout 以及大量物体交互轨迹,并且同时包含成功和失败的轨迹,从而提升模型模拟多样化动作和复杂交互的能力。训练遵循第 2.1 节中 GE-Base 的流匹配目标,损失仅在需要预测的帧上计算,而记忆帧则通过掩码忽略。在闭环推理过程中,视觉专家逐块(chunk)进行 rollout,每个块的记忆帧从先前生成的内容中稀疏采样。由于这些记忆帧来自视觉专家自身的生成,它们不可避免地包含生成伪影以及连续 rollout 产生的累积误差,因此与训练时使用的干净记忆帧并非来自同一分布。为了缓解这种分布偏移,我们在训练过程中为记忆帧引入了一种随机误差模拟机制,通过预编码扰动、局部退化以及多视角同步外观变化来近似自生成记忆帧的误差模式。

本体感觉状态专家

闭环交互不仅需要未来的视觉观测,还需要机器人的本体感知状态,这是现代策略模型在进行下一段动作预测时所依赖的关键输入之一。视觉专家仅生成未来视频,并不会在渲染帧中直接暴露手臂的本体感知状态。为弥补这一不足,我们引入了本体感知状态专家,这是一个轻量级 Transformer 分支,与视觉专家并行运行,并根据视觉专家生成的视觉上下文,预测对应时间区间内的本体感知状态序列。

本体感知状态表示。本体感知状态专家在关节空间中对本体感知状态进行表示和回归。每一帧的本体感知状态是一个 16 维向量,由双臂的关节角度和夹爪开合度拼接而成,

(9)

其中, 是左右臂的七个关节角度, 是对应的夹爪开合度值。夹爪开合度被线性归一化到 ,这与第 3.2 节中末端执行器位姿图所使用的夹爪坐标约定一致。除了需要预测的、跨越未来帧的当前区间外,本体感知状态专家的输入序列还包含历史帧的本体感知状态,以及与之对齐的历史和未来动作,总共产生 个 token,其中只有未来的本体感知状态 token 被添加了噪声。这种关节空间的本体感知状态是对视觉预测的补充,两者共同构成了下游闭环策略交互所需的完整观测信息。

来自视觉专家的视觉上下文。本体感知状态专家预测本体感知状态所需的视觉信息来自视觉专家,但本体感知状态专家并非与视觉专家逐层对齐。视觉专家首先在其所有 Transformer 模块上完成一次完整的前向传播,然后我们通过一组可学习的标量权重(初始化为 1)将每一层的输出聚合为一个融合后的单一视觉特征,随后经过一个 LayerNorm 层,

(10)

本体感知状态专家模块的所有块共享相同的交叉注意力键和值。在多视角设置下,该模块被重新排列为沿序列维度拼接所有相机视角的 token,从而使本体感知状态专家能够同时关注所有视角的视觉特征。

架构。本体感知状态专家由一组轻量级 Transformer 块堆叠而成,其隐藏维度远小于视觉专家模块。每个块包含三个部分:沿本体感知状态时间轴使用旋转位置编码的自注意力、对视觉专家视觉特征的交叉注意力,以及前馈层;扩散时间步通过 AdaLN-single 注入,其缩放-平移参数与视觉专家使用相同的扩散时间步。本体感知状态序列首先通过线性层投影到本体感知状态专家的隐藏空间,最后通过另一个线性层投影回维度状态空间,其中 表示本体感知状态表示的维度。

训练与损失。本体感知状态专家在冻结的视觉专家基础上进行训练:我们使用训练好的视觉专家作为视觉上下文提供者,仅更新本体感知状态专家。训练采用与视觉专家相同的流匹配目标,应用于本体感知状态序列。给定干净的本体感知状态序列 和噪声 ,我们构建加噪序列 ,本体感知状态专家预测去噪速度,损失仅针对未来本体感知状态计算,

(11)

历史状态增强。本体感知状态专家的核心输入是历史本体感知状态、历史动作和未来动作,且仅对未来本体感知状态添加噪声。然而,在真实数据中,历史本体感知状态几乎总是无噪声的精确读数,而在闭环推理过程中,部分历史本体感知状态来自本体感知状态专家在上一数据块中的自身预测,因而会携带误差。若不加以干预,本体感知状态专家将过度依赖“完美历史”,在闭环条件下鲁棒性不足。因此,我们在训练过程中对历史片段施加两种针对性扰动:时间索引扰动,用于模拟策略与视觉专家之间的短程错位;以及历史轨迹重采样,用于模拟异步闭环执行下的轻微时间拉伸或压缩。详细的扰动概率和参数设置见附录。

(12)

这相当于注入一种低通失真,在保留长期趋势的同时去除单帧高频细节,模拟历史信息由网络反馈而非取自真实值的情况。

世界评判器

GE-Sim 2.0 的一个核心目标是支持大规模策略评估。世界模拟器可以生成轨迹,但无法判断轨迹的好坏。为了让模拟器真正服务于评估和奖励驱动的学习,我们需要一个能将生成结果转化为机器可验证信号的组件。为此,我们引入了世界评判器,这是一个视觉语言奖励模型,在闭环推理过程中逐帧对 GE-Sim 2.0 生成的轨迹进行评分,并输出任务完成成功信号。世界评判器的设计基于 Robometer [liang2026robometer](一个通用视觉语言奖励模型);我们将其公式适配到闭环场景,并在真实机器人数据上训练单一的成功目标。

骨干网络与逐帧表示。世界裁判采用视觉语言模型作为其骨干网络。我们冻结其视觉编码器,仅训练语言模型和下游预测头。轨迹展开中的每一帧均作为独立图像单独输入,不沿时间轴进行平均,以保留逐帧的判别粒度。在每个帧图像之后,我们附加一个专用的逐帧 token,并将该 token 的隐藏状态作为该帧的表示。长度为 L 的轨迹展开由此被编码为一组逐帧表示。世界裁判的文本条件并非完整的任务指令,而是与当前片段匹配的子任务描述,从而使判断基于该片段预期完成的特定子任务。

成功预测头与监督。虽然 Robometer 采用进度与偏好双重目标进行训练,但我们的世界裁判刻意专注于单一的逐帧成功预测。这一设计基于两点考虑。首先,稀疏的成功信号足以用于闭环评估和下游强化学习,并已在机器人操作基准测试和离线强化学习设置中被广泛采用作为主要指标或奖励信号 [Andrychowicz2017HindsightER, Lu2025VLARLTM]。其次,在我们的设定中,进度监督的可靠性明显不足。在真实机器人数据采集过程中,轨迹常常包含有意或无意的错误恢复行为,例如绕路、重试以及在最终成功之前的暂时性倒退。在这种非单调的执行过程中,标量进度标签会变得嘈杂,且可能不再对应真实的任务完成进程。因此,我们放弃进度预测,并将世界裁判问题形式化为一个类别平衡的逐帧二值成功分类问题。

世界评判器在每个逐帧表示之上附加一个成功头(一个轻量级 MLP),为该帧生成一个成功 logit。其监督信号来自每条轨迹的手动成功标注:每条轨迹都关联一个成功帧,该帧及其之后的所有帧被标注为成功,之前的帧标注为失败;对于完全失败或没有成功标注的轨迹,所有帧均标注为失败。

(13)

由于轨迹内的成功帧与失败帧高度不平衡,我们采用类别平衡的二元交叉熵作为训练目标。在每个批次内,我们统计正样本帧和负样本帧的数量,并通过其频率的倒数对少数类进行加权,使得两类对损失的贡献大致相当。

(14)

其中 是上述类别平衡权重, 是一个有效帧掩码。

与世界模型的闭环集成。训练完成后,世界评判器作为奖励信号被集成到闭环中。在闭环 rollout 过程中,策略模型输出的分块动作通过统一动作映射进行渲染,并驱动世界模型逐块生成内容;世界模型生成的视频和本体感知状态被返回给策略模型用于后续预测,同时世界评判器为生成的帧输出成功信号,从而在 rollout 过程中生成一条成功曲线。该曲线既可作为策略评估的自动化决策依据,也可作为奖励驱动学习的密集反馈,将策略评估从依赖人工检查转变为机器可验证的过程。

Refer to caption
图 3:世界评判器。世界评判器根据任务指令对生成的 rollout 帧进行评分,为闭环策略评估提供持续信号和成功信号。视觉编码器处理帧,文本编码器编码指令,两者输出被合并用于逐帧成功评估。

加速

可扩展的策略评估需要将轨迹逐块展开,并在多个任务上并行执行,而世界模型的多步扩散推理在此场景下成为吞吐瓶颈。我们从两个方向进行加速:通过步骤蒸馏减少每次生成所需的去噪步数,以及通过随机步长训练让单次生成覆盖更长的时间跨度。

步骤蒸馏。我们利用 DMD2 [yin2024improved] 的分布匹配框架,将多步扩散世界模型蒸馏为少步学生模型。该蒸馏过程包含一个冻结的教师模型(即主训练阶段的世界模型)、一个待蒸馏的少步学生模型,以及一个可训练的伪分数判别器,用于估计学生模型输出分布的分数。在每一步中,学生模型生成一个样本,该样本经教师模型和判别器重新加噪并去噪,得到两个估计值;两者的差值构成驱动学生模型优化的分布匹配梯度。

(15)

其中分母对每个样本的梯度幅度进行归一化。学生模型和判别器交替优化,使判别器持续跟踪当前学生模型的输出分布。为适配 GE-Sim 2.0 中基于动作条件与记忆的设置,教师模型、学生模型和判别器均接收相同的动作图条件,记忆帧在整个过程中保持为干净的潜在真实值;学生模型的去噪步数在训练时随机化,使其在推理时支持灵活的一步到少步配置。其余细节见附录。

通过随机步长训练实现时间加速。加速的另一个方向来自时间跨度。在世界模型训练过程中,我们以随机时间步长对每个片段中的帧进行采样。这使得模型在训练时能够接触到不同时间密度的轨迹,从而在推理时能够执行跳帧操作,用相同数量的帧覆盖长达四倍的时间跨度。对于长周期任务的评估,这显著减少了覆盖给定任务片段所需的自回归片段数量,且时空一致性没有明显损失。

结合这两个方向,GE-Sim 2.0 的世界模型在单个 H100 上仅需四次推理步骤,即可在大约 2.3 秒内生成 100 帧的展开结果,达到了适用于大规模并行评估的吞吐量。

Refer to caption
图 4:在“拔出插头”任务上的定性比较。我们在一个要求机器人拔掉台灯插头的片段中,比较了真实情况(GT)、GE-Sim 2.0(我们的方法)、Ctrl-World 和 DreamDojo。GE-Sim 2.0 成功跟随动作,拔下插头,并正确渲染了灯熄灭的效果。相比之下,Ctrl-World 和 DreamDojo 均表现出动作跟随失败,且两者都未能再现拔插头后灯熄灭的状态。
Refer to caption
图 5:在“倒水”任务上的定性比较。我们在一个要求机器人拿起水壶并向杯子中倒水的片段中,比较了真实情况(GT)、GE-Sim 2.0(我们的方法)和 Ctrl-World。每个帧包含一个俯视图,左下角为左视图,右下角为右视图。GE-Sim 2.0 成功跟随动作,提起水壶,并正确渲染了倒水过程。相比之下,Ctrl-World 表现出动作跟随失败,并未忠实地再现目标倒水行为。
媒体内容 · 前往原文查看
表 1:机器人世界模拟器对比。GE-Sim 2.0 支持长周期多视角模拟,具备本体感知状态预测、伪实时展开、泛化能力和奖励估计功能。
IRASim 1XWM GE-Sim 1.0 Ctrl-World DreamDojo 交互式世界模型 ABot-PhysWorld WorldScape MotuBrain GE-Sim 2.0
长周期 ✓ ✗ ✓ ✗ ✓ ✓ ✓ ✓ ✓ ✓
多视角 ✗ ✗ ✓ ✓ ✗ ✗ ✗ ✗ ✓ ✓
本体感知状态 ✗ ✗ ✗ ✗ ✗ ✗ ✗ ✗ ✗ ✓
伪实时 ✗ ✗ ✗ ✗ ✓ ✓ ✗ ✓ ✓ ✓
奖励 ✗ ✓ ✗ ✗ ✗ ✗ ✗ ✗ ✗ ✓
开源 ✓ ✗ ✓ ✓ ✓ ✓ ✓ ✗ ✓ ✓

实验

我们的实验旨在检验 GE-Sim 2.0 的核心主张:一个以动作为条件的视频模型可以充当操作策略的闭环模拟器,而不仅仅是一个高质量的视频生成器。具体来说,我们提出了五个问题。Q1(视觉保真度):GE-Sim 2.0 生成的操控视频质量是否优于先前的机器人世界模型,无论是在广泛的 WorldArena 基准测试上,还是在细粒度的每任务回放指标上(§4.1)?Q2(闭环忠实度):当策略模型在 GE-Sim 2.0 上运行而非真实机器人时,模拟结果是否与物理世界中发生的情况一致(§4.2)?Q3(可验证奖励):世界评判器产生的成功信号是否足够准确,以取代人工检查(§4.3)?Q4(策略改进):世界模型及其奖励信号能否用于生成经过筛选的训练数据,从而改进下游策略(§4.4)?Q5(组件贡献):本体感知状态专家和专门的奖励模型分别如何影响闭环模拟和奖励预测(§4.5)?

任务。我们评估了六个长时程双臂操控任务,这些任务旨在涵盖视频世界模型历来最难处理的失败模式:液体处理(倒水)、可变形物体操作(叠毛巾)、精细力交互(拔插头)、明火点火(借火)、基于语言的选择(指令抓取与释放),以及外观变化下的表面接触(清洁镜面污渍)。这些任务共同考验了动作跟随精度、接触与变形渲染能力,以及忠实再现策略成功与失败的能力。

基线方法。在视频质量方面,我们与 Ctrl-World [guo2025ctrl] 和 DreamDojo [gao2026dreamdojo] 进行了对比,这是两个领先的开源机器人世界模型,它们发布了模型权重和推理代码,从而能够在匹配的动作条件下进行评估。此外,我们将 GE-Sim 2.0 提交至 WorldArena 排行榜 [shang2026worldarena],该排行榜收录了最新的机器人世界模型,例如 GigaWorld [gigaworld2025]、ABot [chen2026abot](包括文本驱动和动作驱动两种变体)以及 MotuBrain [Team2026MotuBrainAA],同时也包含闭源的通用视频生成器,如 Sora [openai2024sora] 和 Veo [deepmind2025veo3]。对于世界评判器,我们将我们的专用奖励模型与一个强大的通用多模态大语言模型 Qwen3.5-122B [qwen35blog] 进行了对比,这是一个拥有 122B 参数的混合专家视觉语言模型,我们通过提示词让其根据视频判断任务是否成功。

评估协议。对于每个任务,我们准备了 20 个评估片段,这些片段来自真实机器人上运行的 [intelligence2025pi05] 策略。我们采用两种互补的评估模式。回放模式固定了真实机器人上记录的动作轨迹,并将其输入世界模型,然后测量模拟视频与真实视频之间的逐帧相似度和分布相似度;这可以将渲染质量与策略行为分离开来。闭环评估模式则通过分块推演的方式,让相同的策略在 GE-Sim 2.0 中重新运行:策略每一步都根据模拟观测生成动作,而非接收预先记录的动作,我们报告模拟结果与真实结果之间的一致性;这衡量的是模拟器是否忠实地追踪策略决策,而不仅仅是回放一个固定的序列。奖励评估报告二分类准确率(acc:模型是否正确识别任务成功)以及模型预测的成功帧与人工标注参考帧之间的帧索引距离(dist),评估分别在世界模型推演(WM)和真实视频(GT)上进行。

视频模拟质量

Refer to caption
图6:不同时间范围内的时序回放质量。我们将每个回放视频划分为五个连续的10秒时间片段,并分别评估每个片段的PSNR。这些结果表明,我们的方法在长时间跨度 rollout 中能够保持更逼真的视觉回放,且随时间推移的质量退化幅度更小。

WorldArena 排行榜。尽管仅使用2B参数量的骨干网络,GE-Sim 2.0 在公开的 WorldArena 排行榜上仍取得了总体最高分,超越了专门的机器人世界模型(Ctrl-World、DreamDojo、GigaWorld、ABot 的文本和动作变体),以及规模大得多的闭源通用视频生成器(包括 Sora 和 Veo)。这表明,对于操作仿真而言,基于多样化、以动作为基础的机器人数据进行领域特定训练,比单纯的原始模型规模更为重要。

各任务回放指标。表2报告了六个任务的平均回放质量,分别针对头部摄像头和联合多视角配置。GE-Sim 2.0 在两个视角的所有五项指标上均占据主导地位。在头部视角上,其 PSNR 相比 Ctrl-World 提升了 dB,相比 DreamDojo 提升了 dB;FID 减半(32.3 对比 62.7);FVD 降低超过一半(481 对比 1084)。在难度显著更高的多视角设置中(时序一致性必须在头部、左手腕和右手腕摄像头之间同时保持),改进幅度更为显著:FID 和 FVD 均优于 Ctrl-World,而 DreamDojo 未能生成可比较的多视角输出。逐任务来看,排序结果一致:GE-Sim 2.0 在全部五个指标上都是每个单独任务的最佳模拟器。跨基准测试和所有任务子集的一致改进表明,质量提升是广泛性的,而非针对特定伪影。

长时域鲁棒性。我们进一步将 GE-Sim 2.0 与 Ctrl-World 和 DreamDojo 在长时域推演中的视觉稳定性进行了比较。上述汇总重放指标是对整个 50 秒推演过程的平均,可能会掩盖视觉质量随自回归块数量增加是否保持稳定这一情况。为了探究这一点,我们将每个重放视频划分为五个连续的 10 秒片段,并报告每个片段的 PSNR(图 6)。两种视角得出了相同的结论。在头部视角下,GE-Sim 2.0 从 dB 衰减到 dB,在整个推演过程中波动幅度低于 dB,而 Ctrl-World 和 DreamDojo 在第一个片段后急剧下降,最终分别达到 dB 和 dB,比我们的结果低了近 dB。在难度更高的多视角设置下,GE-Sim 2.0 全程保持在 dB 以上,而 Ctrl-World 在第二个片段时就下降到 dB 范围并持续下降。曲线的形状与绝对差距同样重要:GE-Sim 2.0 在第一个片段后趋于平缓,而基线模型则持续退化,因此随着推演时间变长,优势进一步扩大。这种长时域稳定性正是模拟器进行闭环评估所需要的,我们将其归功于大规模真实机器人重训练、记忆帧增强以及第 3.5 节中描述的随机步长训练。

媒体内容 · 前往原文查看
表 2:六项操作任务的平均重放视觉质量。GE-Sim 2.0 在单视角和多视角设置下的所有五项指标上均优于两个机器人世界模型基线。最佳结果以粗体显示;“—”表示无可比较的多视角输出。
头部视角 多视角
方法 PSNR SSIM LPIPS FID FVD PSNR SSIM LPIPS FID FVD
Ctrl-World [guo2025ctrl] 19.09 0.786 0.296 062.70 1083.7 16.65 0.735 0.407 056.85 1527.5
DreamDojo [gao2026dreamdojo] 17.38 0.728 0.353 079.82 1155.0 — — — — —
GE-Sim 2.0(我们的方法) 23.05 0.846 0.145 032.28 0481.3 20.80 0.796 0.217 024.92 0613.5
Refer to caption
图 7:WorldArena 排行榜。GE-Sim 2.0 在 WorldArena 基准测试中取得了最高总分,优于先前的机器人世界模型和闭源通用视频生成器。

闭环策略一致性

回放保真度本身并不意味着世界模型可以作为策略模拟器使用。在闭环使用中,视觉状态、本体感觉状态或接触演化的微小误差都可能改变策略后续的动作,并导致不同的任务结果。因此,我们在每个世界模型内部运行相同的策略,并将由此产生的模拟结果与在匹配任务设置下的实体机器人结果进行比较。

任务级成功率对齐。图 8 比较了在六项任务中,实体机器人的成功率与在每个世界模型内部测量的成功率。每个标记代表一项任务,对角线表示完全一致。带有状态条件化的 GE-Sim 2.0 显示出最接近的任务级对齐:其拟合趋势的斜率接近 1,且带有较小的负偏移,表明它更好地保留了在实体机器人上观察到的相对任务难度。相比之下,移除状态条件化会削弱这种对应关系,产生更平缓的趋势和正偏移。Ctrl-World 显示出最大的偏差,具有同样平缓的斜率但带有负偏移,表明它倾向于低估各项任务中的策略成功率。

这一结果表明,状态感知模拟改善了整体的闭环校准。剩余的差距在接触敏感型任务(如“拔插头”和“指令抓取与释放”)中最为明显,在这些任务中,抓取状态、接触时机或物体交互的微小误差都可能改变后续的策略展开过程。因此,任务级成功率对齐提供了一个粗略但重要的衡量标准,用以判断模拟器是否保留了真实世界的策略性能趋势。

Refer to caption
图 8:世界模型成功率与真实机器人结果的对齐情况。我们比较了在真实世界中测量的任务成功率,以及不同世界模型在闭环策略 rollout 下预测的成功率。每个标记代表一个操作任务,不同的虚线分别对应 Ctrl-World、我们不带状态条件的模型,以及我们带状态条件的完整模型。灰色虚线表示世界模型与真实世界成功率之间的完美一致性。与 Ctrl-World 相比,我们的模型与真实世界策略表现的对齐程度更强,而状态条件进一步提升了模拟结果与物理结果之间的一致性。

回合级结果一致性。任务级成功率仍可能掩盖个案级的不匹配:两个模拟器可能具有相似的边际成功率,但在不同初始条件下预测成功。因此,我们还将闭环一致性作为回合级二元预测问题来评估,即将模拟的成功或失败与对应的物理机器人结果进行比较。

图 10 报告了三种世界模型在每个任务上的混淆矩阵,并总结了准确率、精确率和召回率。准确率衡量模拟结果与真实结果匹配的比例,精确率衡量模拟成功中真实成功的比例,召回率衡量模拟器成功恢复的真实成功数量。带状态条件的 GE-Sim 2.0 获得了最佳的平均准确率和召回率:准确率从 Ctrl-World 和不带状态条件的水平提升至,召回率从和提升至。召回率的大幅提升表明,带状态条件的模拟器在保留真实策略成功的回合方面表现显著更好,而不仅仅是匹配边际成功频率。

按任务划分的混淆矩阵揭示了其优势与局限性。GE-Sim 2.0 在“叠毛巾”、“借火焰”和“清洁镜子污渍”等任务上恢复了更多真正例结果,但在接触密集型任务上仍存在假正例和假负例。这些错误表明,细粒度接触状态和长程状态累积仍是挑战。总体而言,任务级和回合级结果共同支持 GE-Sim 2.0 作为比对比基线更可靠的闭环评估环境。

世界裁判:奖励质量

除了生成 rollout 之外,GE-Sim 2.0 还必须对其进行评分:闭环策略评估和奖励驱动学习需要机器可验证的成功信号。我们基于两种互补输入,将我们的世界裁判与强大的通用 VLM 基线 Qwen3.5-122B 进行了评估:模拟 rollout(WM),这是策略评估时使用的运行模式;以及真实视频(GT),用于探测无模拟器伪影的奖励准确率上限。为公平比较,两个模型接收相同的逐帧多图像输入。

表 3 总结了结果。在世界模型(WM)推演中,我们的世界评判器相对于 Qwen 达到了更高的准确率(提升了 pp),并将事件距离从 帧减少到 帧。这一优势延续到了真实视频(GT)上:准确率对比为 对 (提升了 pp),事件距离从 帧减少到 帧。准确率排名在六项任务中的五项上保持一致;唯一的例外是“指令抓取与释放”任务,该任务主要由离散的物体抓取事件构成,通用视觉语言模型(VLM)相对更适合识别这类事件。Qwen 在“清洁镜子污渍”任务上完全无法估算成功帧,该任务的成功标准涉及细微的外观变化而非离散的物体事件。在“倒水”和“借火”任务上的剩余差距,指出了检测液面高度和火焰传递等小尺度视觉信号的难度,这仍然是任务感知奖励模型面临的一个开放挑战。世界模型模式与真实视频模式之间的准确率差距(提升了 pp)反映了可归因于模拟器伪影而非任务固有歧义的误差比例,且该差距足够小,使得来自 GE-Sim 2.0 的奖励信号对于策略评估而言仍然可靠。

媒体内容 · 前往原文查看
表 3:世界评判器质量:在世界模型推演(WM)和真实视频(GT)上的成功分类准确率(acc)和以帧为单位的事件距离(dist)。我们的世界评判器输出共识预测;Qwen 对每个视频输出单一预测。“—”表示模型未能识别出成功帧。在大多数任务上,我们的世界评判器以较大优势优于通用视觉语言模型基线。
我们的 Qwen3.5-122B-A10B
世界模型(WM) 真实视频(GT) 世界模型(WM) 真实视频(GT)
任务 准确率 距离 准确率 距离 准确率 距离 准确率 距离
借火 .96 37.0 .95 24.4 .71 096.5 .70 115.3
清洁镜子污渍 .82 09.3 .90 12.4 .50 — .50 —
指令抓取与释放 .72 07.8 .80 04.0 .81 038.7 .85 43.4
折叠毛巾 .65 13.0 .60 09.5 .63 038.0 .50 30.5
倒水 .90 61.4 1.00 26.2 .55 022.0 .35 13.0
拔插头 .80 24.2 .95 07.5 .55 034.0 .60 17.0
平均值 .79 28.2 .87 15.7 .60 57.8 .58 64.7
Refer to caption
图 9:基于世界模型过滤的行为克隆策略改进。展示了在使用 GE-Sim 2.0 生成的过滤合成轨迹扩充原始训练数据前后,策略的成功率。对于每个任务,我们在世界模型内运行策略,用奖励模型对生成的轨迹进行评分,保留高奖励轨迹,并将其与原始行为克隆数据混合用于策略训练。基于世界模型过滤的行为克隆在所有评估的密集接触操作任务中均持续提升了策略成功率。

基于世界模型过滤的行为克隆

除了评估之外,GE-Sim 2.0 还可作为策略改进的数据生成引擎。作为概念验证,我们在 GE-Sim 2.0 内部运行策略,用世界评判器对生成的轨迹进行评分,保留奖励超过每个任务阈值的轨迹,并将保留的轨迹与原始行为克隆数据混合。由于实体机器人评估成本较高,我们在三个代表性任务上评估了这一流程,涵盖液体处理、可变形物体操作和精细力交互。

图 9 报告了在添加过滤后的世界模型数据前后,实体机器人的成功率。基于世界模型过滤的行为克隆将倒水任务的成功率从 [原文缺失] 提升至 [原文缺失],将叠毛巾任务从 [原文缺失] 提升至 [原文缺失],将拔插头任务从 [原文缺失] 提升至 [原文缺失]。平均成功率从 [原文缺失] 提升至 [原文缺失],绝对提升为 [原文缺失]。这些结果表明,GE-Sim 2.0 能够生成合成轨迹,这些轨迹不仅对评估有用,而且在基于奖励的过滤后,对改进下游策略学习也有帮助。

Refer to caption
图 10:评估闭环世界模型模拟与实体机器人结果在二元任务成功/失败上一致性的混淆矩阵。与 Ctrl-World 相比,我们的模型实现了更高的真阳性率,表明其更好地保留了真实世界的任务成功模式,尤其是在密集接触场景中。

消融研究

我们分别评估了 GE-Sim 2.0 两个关键组件的贡献。本体感知状态专家通过闭环模拟与真实世界的一致性进行评估,而专家世界评判器则通过奖励预测准确性和事件定位能力进行评估。

本体感觉状态专家。我们通过将带与不带本体感觉状态专家的闭环世界模型推演结果与真实机器人实际结果进行对比,并使用二元任务成功/失败指标进行评估。如图10所示,移除状态专家后,平均回合级准确率从[原文未提供具体数值]降至[原文未提供具体数值],召回率从[原文未提供具体数值]降至[原文未提供具体数值],而精确率基本保持不变。混淆矩阵突出显示,加入状态专家显著提升了模型正确恢复真阳性结果的能力,尤其是在接触密集型任务中,例如折叠毛巾和拔插头。

这种提升在需要跨多个动作块进行精确状态跟踪的任务中最为显著,例如折叠毛巾、借火和清洁镜子污渍。这些任务涉及精细的手臂运动、接触维持或长期累积过程,在这些过程中,由于柔顺性和接触力的影响,机器人的实际关节状态可能会偏离指令动作。反馈解码后的本体感觉状态有助于防止这种偏差在自回归推演过程中不断累积。

在指令抓取与释放任务上出现了一个小的反转,未使用状态调节的模型获得了略高的准确率,这表明该任务对精确关节状态恢复的依赖较小,而更多由粗略的视觉进展主导。总体而言,消融实验证实,本体感觉状态专家通过提供超越仅基于动作条件的视频预测的策略相关状态反馈,改善了闭环一致性。

专用型与通用型奖励模型。用 Qwen3.5-122B VLM 替换我们的世界评判器(表3)后,世界模型模式准确率降低了[原文未提供具体数值]个百分点,事件距离增加了[原文未提供具体数值]帧,在真实视频上存在类似的差距。Qwen 在清洁镜子污渍任务上未能识别出成功帧,这表明提示通用 VLM 并不能稳健地替代任务感知的专用评判器。综合来看,这些结果证明了小型专用奖励头作为闭环模拟器核心组件的合理性。

结论

我们提出了 GE-Sim 2.0,这是从“仅可观看”的视频世界模拟器向面向机器人操作的通用世界模拟器迈出的一步。在基于 Genie Envisioner 的动作条件视频生成框架之上(该框架已在数千小时的真实机器人数据上重新训练),三个协同组件形成了闭环:一个本体感知状态专家,从视频潜在表示中解码关节空间状态;一个世界裁判,将推演结果转化为机器可验证的成功信号;以及一个基于 DMD 的加速框架,将多步扩散压缩为少步推理。三者共同将视觉模拟、本体感知状态预测和奖励评估整合到一个高效的统一框架中。在六项长时域双臂任务上,GE-Sim 2.0 在 WorldArena 排行榜和多视角回放指标上均领先,其闭环成功率与真实机器人的差异在 1 个百分点以内,世界裁判明显优于强大的通用视觉语言模型,而基于其推演结果和奖励进行过滤后的行为克隆,在真实机器人策略上平均提升了 15 个百分点。这些成果将视频世界模拟器从正向预测器推进为具备内置评估能力的闭环平台,为操作策略的可扩展评估与闭环学习提供了可用的起点。

展望未来

GE-Sim 2.0 探索了通用世界模拟器的一种可行实例,定义了此类系统应包含的组件,并在机器人操作上展示了具有竞争力的模拟效果。迈向通用具身智能的世界模拟器,仍有多个方向有待探索。

数据与模型扩展。我们目前的工作重点在于方法论,基础模型是在固定具身形态的双臂遥操作和机器人本体回放数据上训练的。一个通用的具身世界模拟器需要扩展到大规模跨具身形态、第一人称视角和 UMI 风格的数据,同时涵盖更广泛的操作视频,并对数据与模型扩展行为进行系统性研究。推动基础骨干模型的进步,是实现通用具身模拟的核心瓶颈。

从外部评判器到统一模型。当前的世界评判器是一个外部模块,足以完成对任务成功与否的评估。一种更长远的形式是将状态解码与成功判断统一到单个世界模型中,其前向传播过程能同时生成未来帧、本体感知状态和任务完成信号,从而移除独立的奖励网络,让奖励信号继承世界模型在大规模训练中习得的先验知识。

从离线过滤行为克隆到在线闭环学习。我们的实验表明,GE-Sim 2.0 的展开轨迹和奖励已经能够通过过滤行为克隆来改进真实机器人策略。一个自然的延续是在模拟器内进行在线策略学习和强化学习,将系统从评估器和数据过滤器升级为策略训练的环境。本文中的闭环研究和消融实验均基于单一 VLA 策略族进行;在更广泛的策略范围内验证 GE-Sim 2.0 是下一步有价值的工作。

致谢

我们感谢阿不力克木·尼亚孜、徐伟、王闻昊、牛若飞、王静远、蔡雄峰、曹浩宇、景程、周鹏飞、杨东林、张丽艳、胡晓云、韩峰、韩传康、王苏凯、闫宇翔、曾佳、牛悦涵、胡璇和吴静对本项目的宝贵支持与贡献。

参考文献

附录

记忆帧增强细节

本节提供了第 3.2 节中引用的数据增强设置。在推理时,记忆帧来自模型自身的展开轨迹,会偏离训练期间看到的干净记忆帧。我们在训练时对记忆帧潜变量施加三种扰动,所有扰动均由一个外层激活概率 \( p_{\text{act}} \) 控制。渐进噪声混合沿时间轴将高斯噪声混入记忆潜变量中,其逐帧激活概率为 \( p_{\text{noise}} \),逐帧扰动尺度为 \( \sigma_{\text{noise}} \);另外,首帧扰动以概率 \( p_{\text{first}} \) 激活,尺度为 \( \sigma_{\text{first}} \)。局部高斯模糊以概率 \( p_{\text{blur}} \) 应用,核大小从 \( \{3,5,7\} \) 中抽取,\( \sigma_{\text{blur}} \) 从 \( [0.5, 2.0] \) 中抽取,并限制在一个覆盖约 30% 帧区域的连通分量掩码内。多视角同步颜色抖动以概率 \( p_{\text{jitter}} \) 应用,所有相机视角共享相同的抖动参数,以保持头部和手腕视角之间的光照与颜色统计一致性。

本体感觉状态专家详情

历史状态增强。第 3.3 节中引用的两种扰动独立应用,每种概率均为 \( p_{\text{hist}} \)。增量索引偏移将整个历史增量索引偏移一个整数 \( \delta \in \{1,2,3\} \),并裁剪至有效范围,模拟策略与模拟器之间一到三帧的时间错位。时间重采样将历史片段从 \( T_{\text{hist}} \) 帧下采样至 \( T_{\text{hist}}/2 \) 帧,再线性插值回 \( T_{\text{hist}} \) 帧,作为一种低通失真,保留长期趋势的同时去除单帧细节。两种扰动在验证时均被禁用。

DMD2 加速详情

本节提供了第 3.5 节中引用的实现细节。教师模型是来自主训练阶段的视觉专家,并在整个过程中保持冻结。学生模型和伪评分判别器均从教师模型初始化。学生模型以 4 个推理步为目标,训练期间实际去噪步数在 1 到 4 之间随机化,以支持一步到少步推理。

我们每 5 步更新一次学生模型,在其余 4 步更新评判模型,并在首次学生模型更新前进行单步预热。评判模型损失按权重加权。学生模型采用固定的 sigma 调度进行训练,该调度集中在接近全噪声的区域。在生成器更新期间,我们将 sigma 分布向中高噪声区域偏移(偏移量 = 3),以避免浪费接近零噪声的批次;在评判模型更新期间,我们将其进一步偏移(偏移量 = 5)。学生模型使用 AdamW 优化器(),权重衰减 ,以及 100 步预热进行优化;评判模型使用较小的学习率 ,参数为 ,,权重衰减 。学生模型未添加辅助流匹配损失。

额外定性结果

我们提供了所有六项操作任务的额外定性比较。图 11、12、13、14 和 15 展示了多视角展开(头部视角与左右腕部摄像头视角),比较了 GE-Sim 2.0 与 Ctrl-World 在“指令抓取与释放”、“清洁镜子污渍”、“借用火焰”、“折叠毛巾”和“拔插头”任务上的表现。图 16、17、18 和 19 展示了“倒水”、“指令抓取与释放”、“借用火焰”和“清洁镜子”这四项任务的头部视角比较,DreamDojo 在这四项任务上也生成了可比的单视角输出。

[Uncaptioned image]

媒体内容 · 前往原文查看
图 11:指令抓取与释放(多视角)。

[Uncaptioned image]

媒体内容 · 前往原文查看
图 12:清洁镜子污渍(多视角)。

[Uncaptioned image]

媒体内容 · 前往原文查看
图 13:借用火焰(多视角)。

[Uncaptioned image]

媒体内容 · 前往原文查看
图 14:折叠毛巾(多视角)。

[Uncaptioned image]

媒体内容 · 前往原文查看
图 15:拔插头(多视角)。

[Uncaptioned image]

媒体内容 · 前往原文查看
图 16:倒水(头部视角)。

[Uncaptioned image]

媒体内容 · 前往原文查看
图 17:指令抓取与释放(头部视角)。

[Uncaptioned image]

媒体内容 · 前往原文查看
图 18:借用火焰(头部视角)。

[Uncaptioned image]

媒体内容 · 前往原文查看
图 19:清洁镜子(头部视角)。

[Uncaptioned image]

媒体内容 · 前往原文查看
图 20:更多结果 - GE-Sim 2.0。

[Uncaptioned image]

媒体内容 · 前往原文查看
图 21:更多结果 - GE-Sim 2.0。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org