NVIDIA 发布 Cosmos 3 Edge:4B 参数开源世界模型,为机器人及边缘 AI 提供实时推理与动作生成
Introducing Cosmos 3 Edge
NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理并生成动作。
NVIDIA 把世界模型的能力压进 4B 参数,直接在 Jetson 上实时推理并生成机器人动作,对做具身智能的人来说是个标志性信号,边缘部署终于可以摆脱云端依赖了。
现实世界广袤无垠,要在其中运作,物理 AI 系统需要理解场景如何变化、预判接下来可能发生什么,并判断某个动作将如何影响世界。机器在工厂、仓库、医院等场所的边缘端运行。要在这些环境中理解并行动,它们需要能在内存受限的系统上提供数据中心级性能的模型。
今天,我们在 Hugging Face 的 Cosmos 3 仓库中发布 NVIDIA Cosmos 3 Edge。这是一个 40 亿参数的开源世界模型,帮助机器人和视觉 AI 智能体理解周围环境、实时推理,并在边缘设备上生成机器人动作。
下载模型:https://huggingface.co/nvidia/Cosmos3-Edge
该模型在 NVIDIA 边缘计算机上实现内存高效、高吞吐量的推理,包括 NVIDIA RTX PRO GPU、NVIDIA DGX、NVIDIA GeForce RTX™ GPU、NVIDIA Jetson,包括新发布的 Jetson T2000 和 T3000 模块。
它被设计为一个紧凑的开源模型,可作为小型视觉语言模型(VLM),具备同类最佳的吞吐量和准确率,并支持实时推理。
作为一个经过后训练的世界动作模型(WAM),Cosmos 3 Edge 以机器人控制分辨率(640×360 观测)运行,在 NVIDIA Jetson Thor 上提供实时推理,每次推理生成 32 个动作——同时以 15 Hz 实现实时控制。
在同类规模(4B 参数)的模型中,Cosmos 3 Edge 在 VANTAGE-Bench 的视觉分析任务上排名第一,在机器人策略学习上达到最先进水平,为智能基础设施和机器人领域树立了最先进水平。
什么是世界建模?
世界模型学习环境如何随时间变化。它表示物体、运动、空间关系以及动作的影响。
设想一个机器人伸手去抓取物体。识别物体只是第一步。机器人还必须理解物体在哪里、它的夹爪如何移动、接触发生时可能发生什么,以及哪个动作最有可能成功完成任务。
世界模型帮助机器人推理这些关系。它可以预测某个动作的视觉结果,推断导致变化的是哪个动作,或者生成一个能产生期望结果的动作。
Cosmos 3 Edge 将这些能力汇聚于一个模型中,并在设备端运行。其共享表示使物理 AI 系统能够理解当前世界状态、模拟可能的未来,并将这些未来与动作连接起来。
两个 Transformer 塔,一个共享表示
Cosmos 3 结合了两个 Transformer 塔:
- 自回归塔:处理视觉和文本 token,用于理解和推理。
- 扩散塔:处理视觉、音频和动作 token,用于预测、生成和神经模拟。
这两个塔各自维护独立的归一化层和多层感知机。它们共享多模态注意力层,从而在语言、视频、音频和动作之间对齐信息。
这一设计使模型能够在生成输出之前对场景进行推理。根据任务的不同,Cosmos 3 可以从自回归塔生成推理 token,或从扩散塔生成去噪后的视频和动作 token。
注意力模式也针对每类信息做了适配。语言使用因果注意力,即每个 token 只关注它之前的 token。扩散 token 则更广泛地关注可用上下文,从而支持连贯的预测与生成。
这些组件共同赋予模型一种统一的表征,涵盖正在发生什么、接下来可能发生什么,以及某个动作会如何影响结果。
动作的统一表征
物理系统对动作的描述方式各不相同。车辆可能通过自车姿态和运动来表示动作。摄像头使用相机运动。机械臂使用其末端执行器的姿态,而手或夹爪还需要表示抓取状态。
Cosmos 3 将这些不同的具身形态映射为统一的动作表征。
动作被编码为紧凑的几何向量,用以捕捉:
- 平移
- 旋转
- 操作状态
这在控制与世界的视觉结构之间建立了直接联系。模型可以将像素的变化与物理运动、空间关系和控制输入关联起来。
因此,生成的视频不再只是视觉预测。它可以表示世界预期会如何响应某个动作而变化。这为开发者提供了扎根于运动、控制和因果关系的训练数据。
策略模式
作为策略,Cosmos 3 会预测一个动作及其预期的视觉后果。
该模型可以生成系统应当做什么,并模拟接下来可能发生什么。这将世界建模直接与机器人策略的训练和评估连接起来。
输入当前状态,输出动作与视觉后果。
这些模式使单个模型能够学习原因、结果和策略。动作可以在模型中双向流动,使 Cosmos 3 Edge 能够预测某个动作的效果,或从效果推断出动作。
提示词:拿起香蕉,把它放进盘子里。
我们还发布了 Cosmos 3 Edge Policy(DROID):一个在 DROID 数据集上后训练得到的机器人操作策略,用于抓取放置任务,并附带后训练脚本。
开发者可以使用一个小型 H100 集群或 NVIDIA DGX Station,高效地针对其目标任务微调 Cosmos 3 Edge,然后再部署到 NVIDIA 边缘和加速计算平台。
经过后训练的样本可带来更佳性能
除了基础模型之外,我们还发布了参考后训练检查点和训练配方,帮助开发者针对自己的应用适配和优化 Cosmos 3。
Cosmos 3 是一个开放世界基础模型平台。随着模型使用高质量、特定领域数据进行后训练,其在专业应用中的准确率会持续提升。Cosmos 是使用开放框架构建领域适配世界模型的起点。后训练使开发者能够提升模型性能,同时保持输出质量。为了演示这一工作流程,我们还发布了 Cosmos 3 Super 4-Step Distillation 检查点以及一个后训练脚本,为 64B 模型提供了一个更快的参考实现,帮助开发者将 Cosmos 适配到自己的领域,并取得更好的下游性能。
Cosmos 3 Super 4-Step(文生图与图生视频):这些是分布匹配蒸馏检查点和脚本,可将扩散模型的 35–50 步去噪减少到仅 4 步,实现最高 25 倍的推理加速,同时保持图像和视频的质量与保真度。
这些示例可作为参考实现,供开发者在此基础上进行构建。使用开放的训练脚本,你可以对 Cosmos 3 Edge 进行后训练以适配自定义机器人策略,或对 Cosmos 3 Super 进行蒸馏,以实现针对你的应用量身定制的更快速图像和视频生成。
试用 Cosmos 3 Edge
下载模型:https://huggingface.co/nvidia/Cosmos3-Edge
Cosmos 3 Edge 通过共享的世界表征将理解、预测、仿真和行动连接起来。开发者可以将其部署在更靠近传感器的设备端。该模型既可用作推理器,也可用作动作生成器。
使用开放的 Cosmos Frameworks 对模型进行定制和专门化。
查看 Cosmos 3:https://huggingface.co/collections/nvidia/cosmos3
未来展望
我们将继续推进面向 Physical AI 的 Cosmos 3,即将在交互式世界生成、驾驶场景仿真和机器人策略方面带来改进。
我们还在更广泛的硬件范围内投入更快的推理和更高效的后训练,从而减少构建下游模型所需的时间和算力。
这包括使用 vLLM 等开放推理和优化框架来优化 Cosmos 3 检查点,更多优化和开发者工具即将推出。
来源:Hugging Face:Blog(RSS) · huggingface.co