跳到正文
北京时间
原文
Hacker News 热门(buzzing.cc 中文翻译)· tosh·· 2026-06-02精选AI 评分75

英伟达 Cosmos 3

AI 导读

英伟达发布了 Cosmos 3,这是一个用于物理 AI 推理的世界和行动模型。该信息来源于英伟达开发者博客,发布日期为 2026 年 6 月 1 日。

推荐理由

Cosmos 3 把物理推理、世界生成和行动生成塞进一个开源模型,从机器人到自动驾驶都能用,英伟达这次是真的想定义物理 AI 的训练范式。

正文 · AI 翻译


Physical AI
系统必须先理解真实世界,才能在其中行动。机器人、自动驾驶汽车和智能空间需要理解其所在世界中正在发生的事情,预测接下来可能发生什么,并针对特定环境、具身形态和任务生成动作。

NVIDIA Cosmos 3 是面向 Physical AI 的前沿基础模型,在单一开放模型中融合了物理推理、世界生成和动作生成。

NVIDIA 正在开源 Cosmos 3 模型、训练脚本、部署工具和数据集,让 Physical AI 开发更加开放、更可复现。本篇博客介绍了 Cosmos 3 的基础知识,重点阐述了技术报告中的关键概念,讲解了技术工作流程,并展示了构建机器人操作系统的团队、自动驾驶汽车以及仓库监控解决方案如何上手使用。

A video clip generated by Cosmos 3 for the autonomous driving domain. The video is from a vehicle’s point-of-view at an intersection. Another car crosses the intersection in front of this vehicle, and then the vehicle takes a left turn. The video looks realistic and shows houses, trees, and cars in the surroundings.
图 1. Cosmos 3 为自动驾驶领域生成的一段视频片段
A video shows a corridor with shelves of boxes on either side and a pile of boxes on the ground. Three people are standing next to the pile of boxes. There’s a small explosion from one of the boxes on the floor, and it starts smoking.
图 2. 使用 Cosmos 3 为仓库安全数据生成的视频。

本次发布的主要亮点包括:

  • NVIDIA Cosmos 3 Nano 和 NVIDIA Cosmos 3 Super 模型 checkpoint 已在 Hugging Face 上发布,代码在 GitHub 上。
  • 面向机器人、自动驾驶等物理 AI 应用的开源数据集。
  • 用于将 Cosmos 3 适配到你的领域的开源后训练脚本。
  • Cosmos NIM 微服务,可在 NVIDIA GPU 上轻松、优化地部署。

Cosmos 3 的新特性

此前的 Cosmos 版本将世界生成、物理理解和受控场景生成拆分到不同的模型和工作流中。本次发布通过一种围绕两个塔构建的 Mixture-of-Transformers(MoT)架构,将这些能力统一起来。

  • 推理塔:一个视觉语言模型(VLM),用于解读图像、视频和文本等多模态观测。该塔采用自回归架构来解读输入,并理解运动、物体交互及其他物理上下文。它充当“大脑”,在任何生成发生之前对世界进行推理。
  • 生成塔:生成未来的观测和动作序列。该塔采用基于扩散的过程,生成以推理塔的理解为条件的、具备物理感知的视频和动作输出。推理塔可以独立调用,但生成塔始终会激活两个塔以进行引导式生成。
Cosmos 3 architecture diagram: an autoregressive reasoner tower that takes in text, image, video, audio, and action inputs is connected to a diffusion-based generator tower that outputs text, image, video, audio, and action. Information from the reasoner tower feeds unidirectionally into the generator tower, which enables coherent generation.
图 3. Cosmos 3 架构

该架构使单一模型即可完成推理与生成任务,无需在多个模型和推理流水线之间进行编排,从而简化了开发流程。

选择合适的模型规模

目前有两款 Cosmos 3 模型可供选择:

  • Cosmos 3 Nano 是紧凑版本,拥有 16B 参数,并针对高效推理进行了优化。它专为工作站级算力而设计,例如 NVIDIA RTX PRO 6000 GPU,可用于实时机器人推理和物理 AI 应用。
  • Cosmos 3 Super 是一款 64B 参数模型,专为追求最高质量和能力而设计。它取得了最高的基准测试分数,面向 NVIDIA Hopper 和 NVIDIA Blackwell GPU 的数据中心部署,适合大规模合成数据生成和高级物理推理工作负载。

支持的模态

Cosmos 3 通过其统一架构支持以下输入和输出模态:

媒体内容 · 前往原文查看
输入输出应用
文本图像物理上合理的图像生成
文本 | 视频视频用于罕见边缘案例视频数据生成的世界模型
文本 | 图像视频用于预测的世界模型
文本 | 图像 | 视频文本用于推理的 VLM
动作 | 视频 | 文本视频动作条件世界模型
视频 | 文本视频 | 动作世界动作模型、视频动作模型、视觉语言动作模型、用于机器人学习的策略模型
表 1. Cosmos 3 针对不同应用所支持的输入与输出模态

面向物理 AI 的开放数据集

随着 Cosmos 3 的发布,NVIDIA 正在 Hugging Face 上开源合成数据生成(SDG)数据集。这些数据集涵盖机器人、物理仿真、人体运动、驾驶和仓库环境,可用于对 Cosmos 3 及其他模型进行后训练:

物理 AI 世界模型合成数据集包括:

A collection of videos in the Embodied Robot Scenes dataset. The videos show different humanoid robots doing manipulation tasks in different environments.
图 4. 具身机器人场景数据集中的操作示例
A collection of videos in the Physical Interaction Scenes dataset. The videos show simulated scenes like a wrecking ball hitting objects, a toy tower collapsing, and dominoes falling. For each scene, the dataset has corresponding ground-truth physics annotations like per-object velocity, center-of-mass displacement, and per-frame semantic segmentation.
图 5. 物理交互场景数据集中的示例
A collection of videos in the Digital Human Scenes dataset. The videos show some simulated indoor and outdoor environments with digital people standing and moving. These videos provide diverse human appearance, motion, scene context, lighting, and camera motion.
图 6. 数字人场景数据集示例
A collection of videos from the Autonomous Driving Scenarios dataset. The videos are from the ego point of view of an autonomous vehicle and show the vehicle driving on roads in different scenarios. The videos show diverse weather and lighting conditions and driving behaviors like lane changing and pedestrian interactions.
图 7. 自动驾驶场景数据集示例
A collection of videos from the Warehouse Operations Scenes dataset. The videos show simulated warehouse scenes from different camera angles. Some videos show a forklift moving and colliding with people or objects. In another video, a person drops a cardboard box on the floor.
图 8. 仓储运营场景数据集示例

NVIDIA Cosmos 人工评估基准

NVIDIA Cosmos 人工评估(HUE)框架用于评估 Cosmos 3 生成器在各类代表性领域任务中的质量。

随着 SOTA 视频生成模型使现有自动化排行榜趋于饱和,各版本之间的分数差异往往过于微小,难以进行有意义的比较。HUE 将评估从主观打分转向客观事实核验,从而实现对顶级模型之间的细粒度比较。其成果是为快速迭代和严谨的发布决策提供了更可靠的质量信号,并以完整的人工评估作为支撑。

HUE 通过原子化二元核验来评估视频生成质量。每个生成的视频都会被分解为单一事实的是/否问题,涵盖四个维度——语义对齐、物理规律、几何推理和视觉完整性——并横跨七个 Physical AI 领域,包括机器人、自动驾驶和物理学。这些问题由 VLM 流水线生成,经人类专家精炼,并以开源形式发布在 Hugging Face 上。

基准测试结果

Cosmos 3 已在多个基准测试套件上进行了评估,涵盖物理 AI 推理、生成质量和特定领域性能。

推理基准

Cosmos 3 Super 和 Cosmos 3 Nano 分别在 32B 层级和 8B 层级上领跑 VANTAGE-Bench:

  • VANTAGE-Bench:首个公开基准,用于评估视觉语言模型在仓库、交通运输和智能空间等真实场景固定摄像头 footage 上的表现。
  • 交通异常推理(TAR):一个用于检测和推理交通 footage 中异常事件的新排行榜,也是 AI City Challenge 2026 Track 3 的官方排行榜。

生成器基准

Cosmos 3 是开源 SOTA,目前在 PAI-Bench、R-Bench Physics-IQ 和 RoboLab 的公开排行榜上均处于领先地位:

  • Artificial Analysis:一个对文本、图像和视频生成 AI 模型进行排名的基准测试平台。Cosmos 3 是文本到图像排行榜和图像到视频(无音频)排行榜上领先的开源模型。
  • R-Bench:一个用于评估机器人视频生成中基于视频的世界模型的基准。它通过结构一致性、物理合理性和执行完整性等子指标来评估任务完成度和视觉质量。
  • PAI-Bench:一个统一的基准,用于评估视频理解和视频生成中的物理 AI,涵盖机器人、自动驾驶汽车和物理常识等领域。
  • Physics-IQ:一个由真实世界视频组成的基准,用于测试生成式视频模型是否真正理解物理原理,而不仅仅是实现视觉上的逼真。
  • RoboLab:一个用于评估任务通用型机器人策略的仿真基准。

训练配方

Cosmos 3 发布的一个核心组成部分是一套完全开放的训练配方。除了模型 checkpoint 之外,本次发布还提供了代码、配置和工作流,用于将 Cosmos 3 适配到新的领域、具身形态和数据集。

监督微调 后训练

监督微调(SFT)使开发者能够将 Cosmos 3 模型适配到自己的数据上。发布的配方包括针对自定义视频数据集的视觉生成后训练,以及面向机器人技术和物理 AI 工作流的动作导向配方。开发者可以针对机器人技术、自动驾驶和仓储自动化等目标领域定制 Cosmos 3。

后训练代码和配置已在 GitHub 上发布。

动作后训练

动作后训练将 Cosmos 3 适配到具备动作感知能力的物理 AI 应用中,包括前向动力学、逆向动力学和策略生成。开发者可以在带有动作标注的数据上对 Cosmos 3 进行后训练。对于机器人技术应用,这包括几个重要的工作流:以机器人动作为条件生成未来观测、推断观测到的演示背后的动作,以及根据当前观测和任务提示词预测动作序列。这使得 Cosmos 3 成为世界动作建模和策略学习的强大基础。

媒体内容 · 前往原文查看
视频 1. 展示如何对 Cosmos 3 进行后训练的教程视频

使用 NVIDIA NIM 微服务进行部署

Cosmos 3 模型也以 NVIDIA NIM 微服务的形式提供,用于经过优化、可直接投入生产的部署。NIM 微服务将模型与优化后的推理运行时打包在一起,无需手动调优服务基础设施即可提供高性能。与 GitHub 上的 Cosmos 3 仓库相比,NIM 微服务在推理工作流中更易于使用,而后者则更适合后训练工作流。

Cosmos 3 Reasoner NIM 今日已可用,提供 Cosmos 3 模型的推理能力。敬请期待 Cosmos 3 Generator NIM,它将提供 Cosmos 3 模型的完整生成能力。

为加速推理所做的优化

  • 量化:Cosmos 3 NIM 支持选择 BF16、FP8 或 NVFP4 量化检查点。NVFP4 量化将模型的数值精度从 BF16 降至 4 位浮点,实现最高 2 倍的推理加速。
  • vLLM:是一个开源推理引擎,使用连续批处理、分页注意力和张量并行等技术来高效地服务 LLM。Cosmos 3 Reasoner NIM 的服务栈构建在 vLLM 之上,相比传统服务方式具有更高的吞吐量。Cosmos 3 Nano 已准备好通过 vLLM-omni 和 NVIDIA Dynamo 运行,以实现顶级性能。
  • 高效视频采样(EVS):这项技术减少了推理过程中输入 VLM 的视频 token 数量,从而加速 Cosmos Reason NIM。EVS 在 chunk 级别工作,保留每一帧中最独特的 chunk,并剪除其余部分。较小的 GPU 往往能从这项技术中获得更多收益。

如何运行 NIM

需要 NVIDIA NGC API key 才能拉取容器并从 NGC 下载 Cosmos 3 模型。

拉取并运行 Cosmos 3 Nano Reasoner NIM。对于 Cosmos 3 Super Reasoner NIM,请指定 NIM_MODEL_SIZE=super。

docker run --gpus=all \
  -e NGC_API_KEY=$NGC_API_KEY \
  -e NIM_MODEL_SIZE=nano \
  -p 8000:8000 \
  nvcr.io/nim/nvidia/cosmos3-reasoner:latest

在文档中查找有关 API 用法及更多内容的详细信息。

媒体内容 · 前往原文查看
视频 2. 展示如何使用 Cosmos Reasoner NIM 的教程视频

致谢

Cosmos 3 是 NVIDIA 内部众多团队与人员出色协作的成果,其中包括 Aditi、Niket Agarwal、Arslan Ali、Jon Allen、Martin Antolini、Adeline Aubame、Alisson Azzolini、Junjie Bai、Maciej Bala、Yogesh Balaji、Josh Bapst、Aarti Basant、Mukesh Beladiya、Mohammad Qazim Bhat、Zaid Pervaiz Bhat、Dan Blick、Vanni Brighella、Han Cai、Tiffany Cai、Eric Cameracci、Jiaxin Cao、Yulong Cao、Mark Carlson、Carlos Casanova、Ting-Yun Chang、Yan Chang、Yu-Wei Chao、Prithvijit Chattopadhyay、Roshan Chaudhari、Chieh-Yun Chen、Junyu Chen、Ke Chen、Qizhi Chen、Wenkai Chen、Xiaotong Chen、Yu Chen、An-Chieh Cheng、Click Cheng、Xiu Chia、Jeana Choi、Chaeyeon Chung、Wenyan Cong、Yin Cui、Magdalena Dadela、Nalin Dadhich、Wenliang Dai、Joyjit Daw、Alperen Degirmenci、Rodrigo Vieira Del Monte、Robert Denomme、Sameer Dharur、Marco Di Lucca、Ke Ding、Wenhao Ding、Yifan Ding、Yuzhu Dong、Nicole Drumheller、Yilun Du、Aigul Dzhumamuratova、Aleksandr Efitorov、Hamid Eghbalzadeh、Naomi Eigbe、Imad El Hanafi、Hassan Eslami、Benedikt Falk、Jiaojiao Fan、Jim Fan、Amol Fasale、Sergiy Fefilatyev、Liang Feng、Francesco Ferroni、Sanja Fidler、Xiao Fu、Vikram Fugro、Prashant Gaikwad、TJ Galda、Katelyn Gao、Yihuai Gao、Wenhang Ge、Sreyan Ghosh、Arushi Goel、Vivek Goel、Akash Gokul、Rama Govindaraju、Jinwei Gu、Miguel Guerrero、Elfie Guo、Aryaman Gupta、Siddharth Gururani、Hugo Hadfield、Song Han、Ankur Handa、Zekun Hao、Mohammad Harrim、Ali Hassani、Nathan Hayes-Roth、Yufan He、Chris Helvig、Cyrus Hogg、Madison Huang、Michael Huang、Sophia Huang、Yufan Huang、Jacob Huffman、DeLesley Hutchins、Suneel Indupuru、Boris Ivanovic、Arihant Jain、Joel Jang、Ryan Ji、Yanan Jian、Dongfu Jiang、Jingyi Jin、Atharva Joshi、Nikhilesh Joshi、Pranjali Joshi、Jaehun Jung、Weiwei Kang、Scott Kassekert、Jan Kautz、Ashna Khetan、Julia Kiczka、Slawek Kierat、Gwanghyun Kim、Kuno Kim、Sunny Kim、Kezhi Kong、Xin Kong、Zhifeng Kong、Tomasz Kornuta、Egor Krivov、Hui Kuang、Saurav Kumar、Chia-Wen Kuo、George Kurian、Wojciech Kutak、JF Lafleche、Himangshu Lahkar、Omar Laymoun、Jayjun Lee、Sanggil Lee、Gabriele Leone、Boyi Li、Freya Li、Jiajun Li、Jinfeng Li、Ling Li、Pengcheng Li、Shangru Li、Tingle Li、Xiaolong Li、Xuan Li、Zhaoshuo Li、Zhiqi Li、Hao Liang、Maosheng Liao、Chen-Hsuan Lin、Tsung-Yi Lin、Ming-Yu Liu、Sifei Liu、Zihan Liu、Hai Loc Lu、Xiangyu Lu、Alice Luo、Ruipu Luo、Wenjie Luo、Jiangran Lyu、Martin Ding Ma、Nic Ma、Qianli Ma、Dawid Majchrowski、Louis Marcoux、Miguel Martin、Qing Miao、Ashkan Mirzaei、Shreyas Misra、Kaichun Mo、Durra Mohsin、Hyejin Moon、Pawel Morkisz、Saeid Motiian、Kirill Motkov、Seungjun Nah、Yashraj Narang、Deepak Narayanan、Thabang Ngazimbi、Julian Ouyang、David Page、Yatian Pang、Sehwi Park、Mahesh Patekar、Mostofa Patwary、Marco Pavone、Trung Pham、Wei Ping、Soha Pouya、Shrimai Prabhumoye、Varun Praveen、Delin Qu、Hesam Rabeti、Morteza Ramezanali、Marilyn Reeb、Xuanchi Ren、Kristen Rumley、Wojciech Rymer、Jun Saito、Yeongho Seol、John Shao、Piyush Shekdar、Tianwei Shen、Humphrey Shi、Min Shi、Stella Shi、Kevin Shih、Mohammad Shoeybi、Mateusz Sieniawski、Shuran Song、Alexander Sotelo、Amir Sotoodeh、Sunil Srinivasa、Vignesh Srinivasakumar、Bartosz Stefaniak、Rahul Heinrich Steiger、Shangkun Sun、Jiaxiang Tang、Shitao Tang、Yangyang Tang、Yue Tang、Tolou Tavakkoli、Kayley Ting、Krzysztof Tomala、Wei-Cheng Tseng、Jibin Varghese、Sergei Vasilev、Thomas Volk、Raju Wagwani、Roger Waleffe、Andrew Z. Wang、Boxiang Wang、Haoxiang Wang、Qiao Wang、Shihao Wang、Shijie Wang、Ting-Chun Wang、Yan Wang、Yu Wang、David Wehr、Fangyin Wei、Xinshuo Weng、Jay Zhangjie Wu、Kedi Wu、Hongchi Xia、Summer Xiao、Tianjun Xiao、Kevin Xie、Daguang Xu、Jiashu Xu、Mengyao Xu、Ruqing Xu、Xingqian Xu、Yao Xu、Dinghao Yang、Dong Yang、Hans Yang、Xiaodong Yang、Xuning Yang、Yichu Yang、Yurong You、Zhiding Yu、Hao Yuan、Simon Yuen、Xiaohui Zeng、Pengcuo Zeren、Cindy Zha、Haotian Zhang、Jenny Zhang、Jing Zhang、Liangkai Zhang、Paris Zhang、Shun Zhang、Xuanmeng Zhang、Zhizheng Zhang、Ann Zhao、Yilin Zhao、Yuliya Zhautouskaya、Charles Zhou、Fengzhe Zhou、Shilin Zhu、Yuke Zhu、Dima Zhylko 以及 Artur Zolkowski。

来源:Hacker News 热门(buzzing.cc 中文翻译) · developer.nvidia.com