MolmoMotion:语言引导的3D运动预测模型
MolmoMotion: Language-guided 3D motion forecasting
MolmoMotion基于Molmo 2骨干网络,输入视频帧、物体上的3D点标记及文字动作指令(如“移动并旋转桌上放水果的木碗”),预测未来数秒内这些点的3D轨迹。提供两个变体:自回归的MolmoMotion-AR逐步预测坐标,流匹配的MolmoMotion-FM通过连续空间变换处理多可能性运动。同时发布MolmoMotion-1M数据集(含116万视频的3D点轨迹及动作描述)和PointMotionBench基准测试(2700个人工验证视频片段)。模型权重、数据集和基准测试均已开源。
MolmoMotion把3D运动预测从模板化推到任意物体,百万级数据集和基准让研究门槛大降,做机器人和视频生成的值得认真看,但目前仍是研究阶段,离落地还有距离。
机器在感知运动方面已经变得非常出色。给定一段视频,现代模型能够以极高的置信度追踪物体和点在场景中的运动方式。但感知本质上是回溯性的:它解释的是已经发生的运动。而我们想要构建的许多系统和应用,需要的却是向前看。一个伸手去拿杯子的机器人,必须在触碰杯子之前预判杯子将如何移动。一个视频生成器如果要生成物理上合理的画面,就必须知道接下来会出现什么样的真实运动。
预测运动比观察运动更难,但在许多场景中也远为有用。
这一理念正是MolmoMotion背后的动机,这是我们今天发布的一款全新运动预测模型。给定一帧视频画面、标注在物体上的 3D 点,以及描述预期动作的文字指令(例如“移动并旋转桌上装有水果的木碗”),MolmoMotion 会预测这些点在接下来几秒内在 3D 空间中的移动位置——其表现大幅超越现有的预测方法。
给定一个 RGB 观测、物体上的一组查询点以及一段动作描述,MolmoMotion 会预测该物体未来的 3D 点轨迹。这些预测出的轨迹随后可以驱动下游应用,例如机器人规划和以轨迹为条件的视频生成。
除了模型之外,我们还发布了 MolmoMotion-1M,这是目前最大的 3D 点轨迹与动作描述配对数据集,取自 116 万段视频。我们还发布了 PointMotionBench,这是一个经过人工验证的基准,用于衡量以物体为中心的 3D 运动预测准确率,包含 2.7K 段视频片段。
我们发现,像 MolmoMotion 这样的运动预测器在一系列下游任务中都很有用,从机器人规划到可控视频生成。我们将公开模型权重、MolmoMotion-1M 数据集以及我们的 PointMotionBench 基准,供社区研究、改进和定制。
MolmoMotion:技术内幕
MolmoMotion 以一种精心设计且极为高效的方式来表示运动:将其表示为世界空间中附着于物体的 3D 点,从而在无需渲染完整视频的情况下捕捉运动。我们选择这种方式,是因为我们需要一种具有三个特性的通用运动表示:
- 类别无关:不依赖于人体、手部、刚性物体或任何其他固定类别的模板。
- 视角稳定:同一物理运动在不同相机和视角下应被一致地表示。
- 可被需要对物理运动进行推理的下游系统直接使用。
在我们考虑过的各种表示方式中,它是唯一同时满足全部三项要求的。一组稀疏的表面点即可描述刚性、关节式以及(在一定限度内)可变形运动,而无需假设被移动物体的类型。由于这些点位于共享的世界坐标系中,其轨迹在相机运动和视角变化下保持稳定。又因为它们是 3D 空间中紧凑的显式轨迹,可以直接传递给机器人策略或视频生成模型等系统。
为了预测这些轨迹,MolmoMotion 以 Molmo 2 作为其骨干,使其能够将语言指令与图像中的物体和点关联起来。给定一段简短的视频历史、一段动作描述,以及一组带有初始 3D 位置的查询点,模型首先识别出所指向的物体、查询点以及指令所描述的运动。随后,它预测每个点的未来 3D 轨迹。
我们训练了 MolmoMotion 的两个变体:
- 自回归变体(MolmoMotion-AR)逐步预测未来坐标。它将 3D 坐标表示为结构化文本,沿用 VLM 所使用的坐标式预测方式,并按时间顺序写出未来轨迹。由于每个新坐标都以已生成的轨迹为条件,这有助于实现平滑的推演,并在未来路径明确时给出最高的准确度。
- 流匹配变体(MolmoMotion-FM)通过将噪声变换为运动,在连续 3D 空间中预测轨迹,这使其更适合在一条指令存在多种可能未来时表示不确定性。
MolmoMotion 架构。Molmo 2 主干网络的共享输入由 RGB 观测的图像 token、动作描述的文本 token,以及从 Molmo 2 视觉编码器采样的 2D 查询点特征 token 组成。MolmoMotion-AR 对初始 3D 查询坐标进行编码,并将未来轨迹解码为量化坐标文本,而 MolmoMotion-FM 则直接在连续 3D 坐标空间中表示这些轨迹。
推出 MolmoMotion-1M 和 PointMotionBench
为了训练 MolmoMotion,我们需要当时尚不存在的数据:带有与特定物体关联的 3D 点轨迹、并配有动作描述的大规模视频。现有的 3D 轨迹数据集规模小且领域受限,而互联网视频虽然具备我们想要的、适合 MolmoMotion 这类预测器所需的规模和多样性,却不包含 3D 标注。因此,我们构建了一条自动流水线,从无约束视频中提取以物体为锚点的 3D 轨迹。
给定一段输入视频及其动作描述,我们的标注流水线会以度量世界坐标生成以物体为锚点的 3D 点轨迹。(下图展示了每个阶段。)难点在于,来自无约束视频的原始轨迹含有噪声——深度和跟踪误差导致点抖动和漂移——而且物体在视频的大部分时间里往往保持静止。为了让数据更可靠,我们会滤除那些与物体其余部分运动不一致的点,对剩余轨迹进行平滑处理,并将每个片段裁剪到物体实际运动的窗口。
大规模运行我们的流水线产出了 MolmoMotion-1M——据我们所知,这是迄今为止组装的最大规模的动作描述、物体锚定的 3D 点轨迹语料库,涵盖 736 种运动类型和 5.6K 个不同物体。
我们的数据标注流水线概览。给定一段动作事件的视频及其描述,我们首先锚定运动物体并在其上采样查询点。随后我们跟踪该物体上的稠密 2D 点,将这些轨迹提升到共享的度量 3D 坐标系中,并利用物体级空间与时间一致性先验来过滤不可靠的轨迹。最后,我们围绕锚定物体发生有意义运动的区间对视频进行裁剪。
顶部指令:“移动并旋转桌上装有水果的木碗。” 底部指令:“在蓝色布料上滚动粘毛滚筒。”
顶部指令:“一辆银色汽车沿道路行驶,缓缓向右转弯。” 底部指令:“一只火烈鸟一边向右行走,一边将喙浸入水中。”
为了评估 MolmoMotion 的预测性能,我们还构建了 PointMotionBench,这是一个经过人工验证的留出 3D 轨迹基准。它涵盖 2.7K 个片段,跨越 111 个物体类别和 61 种运动类型,包括室内操作、第一人称手-物交互以及户外动态场景。对于每个片段,模型会获得当前观测、物体查询点和动作描述,并评估其预测的 3D 点轨迹与物体实际未来运动的匹配准确程度。这为我们提供了一种对 3D 运动预测的直接定量测试,而不是依赖于生成的轨迹点是否仅仅看起来合理。
实验与性能
我们从三个方面评估 MolmoMotion。第一,我们测试它是否比现有方法更准确地预测未来 3D 运动。第二,我们测试它学到的关于运动的知识是否有助于机器人执行操作任务。第三,我们测试同样的知识是否能够帮助引导生成视频中的运动。
3D 运动预测
在 PointMotionBench 上,MolmoMotion 在我们测试的所有现有 3D 运动预测方法中表现最佳——包括像素空间视频生成器、参数化 3D 方法以及一个简单的匀速基线——涵盖多种物体、场景和动作。
MolmoMotion 能够预测多种物体和场景的运动,例如粘毛滚筒如何在布料上来回移动、碗如何在桌面上滑动并旋转、火烈鸟如何一边向右行走一边把喙探入水中,或者汽车如何沿着转弯的道路行驶。在每一种情况下,预测出的路径都遵循 MolmoMotion 所接收的指令,并且在我们基准测试中与真实运动极为接近。
下游评估:机器人规划
MolmoMotion 学到的关于运动的知识应当能够从一个场景迁移到另一个场景——用人手举起杯子和用机器人夹爪举起杯子是非常不同的动作,但杯子本身在 3D 空间中遵循相似的路径。这使得 MolmoMotion 天然适合机器人领域,因为机器人必须先规划物体应当如何移动,然后才能移动它们。
在 DROID 上微调之后——这是一个包含真实世界机器人操作视频的大型开放数据集——我们发现 MolmoMotion 能够在各种机器人规划场景中,针对不同的物体、相机视角、场景和任务预测出合理的物体路径。
顶部指令:“把布料从容器中取出。” 底部指令:“移动锅盖。”
在仿真中,基于 MolmoMotion 构建的控制策略在 76.3% 的抓取放置任务中取得成功,而基于 Molmo 2 构建的同一策略成功率为 56.0%——而且它学习更快,在 10K 训练步后达到 51%,而 Molmo 2 版本最高只到 19%。在真实机器人上(经过微调后),MolmoMotion 仅用约 2K 步就达到了 Molmo 2 基线在 12K 训练步后才达到的相同测试 L2 误差。
下游评估:视频生成
指令:“一只火烈鸟向右行走时把喙探入水中。”从上到下:DaS + MolmoMotion、CogVideoX-5B 和 WAN-14B。
指令:“从桌上拿起那个圆形的浅棕色盘子。”从上到下:DaS + MolmoMotion、CogVideoX-5B 和 WAN-14B。
MolmoMotion 预测的路径还可以引导视频生成。与其让图像到视频模型仅凭文本指令去猜测运动,你可以输入 MolmoMotion 的预测结果。这样生成的视频能更贴近所要求的动作,尤其是对于提示词只能模糊描述的小幅精确运动。
指标也印证了这一点。在用于引导视频生成器时,MolmoMotion 在我们测量的全部五项运动相关指标上都比基础模型提升了运动质量,并在其中四项上击败了一个规模大得多的图像到视频模型。
局限性与下一步计划
MolmoMotion 是一个能力出色的模型,但仍有一些局限值得注意。它在训练时对每个物体使用八个查询点——足以预测一条有用的轨迹,但不足以密集地表示表面几何结构。这限制了模型处理复杂可变形运动的能力。
我们认为,预测——即在物体移动之前就预判世界中的物体将如何移动——对于机器智能而言,与感知已经存在的事物同样根本。MolmoMotion 是朝这一方向迈出的一步:它无需按类别定制的模板即可跨物体类别泛化,从普通视频中学习,并且是我们在 PointMotionBench 上测量过的最准确的 3D 运动预测器。我们预计,机器人、视频及其他领域将涌现出许多应用。
我们鼓励你尝试 MolmoMotion:下载权重、查看训练数据,并在 PointMotionBench 上评估我们的方法。
来源:Hugging Face:Blog(RSS) · huggingface.co