📢当前的世界模型并没有真正在建模世界;它们建模的是某一个智能体对世界的视角。部分观测 ≠ 世界状态。 未来的世界模型将独立于任何单个智能体的视角。你将能够在任意时间点“放入”任意数量的智能体,而一个持久的世界状态将随着它们的交互而演化。想象一个神经 MMORPG 服务器。🧵[1/10]
推荐理由:从单视角到共享全局状态,开源多智能体世界模型或改变AI训练范式
AI 走进物理世界:人形机器人、具身基础模型与真实环境操作能力的进展追踪。
📢当前的世界模型并没有真正在建模世界;它们建模的是某一个智能体对世界的视角。部分观测 ≠ 世界状态。 未来的世界模型将独立于任何单个智能体的视角。你将能够在任意时间点“放入”任意数量的智能体,而一个持久的世界状态将随着它们的交互而演化。想象一个神经 MMORPG 服务器。🧵[1/10]
推荐理由:从单视角到共享全局状态,开源多智能体世界模型或改变AI训练范式
推荐理由:人类视频学习呈现完美缩放定律,机器人仅需单演示即可掌握新技能,具身智能迎来数据革命
推荐理由:42M小模型实现人形机器人全身控制,零样本迁移真实硬件且完全开源,开发者可复现
推荐理由:Jim Fan 把世界模型定义为第二次预训练范式转移,核心论点是视觉优先而非语言优先,这个框架对做机器人和多模态的人是真正的路线判断,不是又一篇水文。
NVIDIA在Hugging Face上发布了Cosmos Reason 2模型,旨在提升物理AI系统的推理能力。该模型通过改进的推理架构,使AI能更准确地理解和预测物理世界的动态与交互,核心升级包括对复杂场景的多步推理、不确定性量化及时间序列数据的深度理解。这一进展将推动机器人、自动驾驶等领域的发展,使AI在现实环境中的决策更可靠、更符合物理规律。
推荐理由:物理AI推理能力升级,机器人和具身智能落地的关键拼图
推荐理由:NVIDIA科学家揭示机器人学三大痛点:硬件拖累迭代、基准混乱、VLA路线存在根本缺陷
参与无监督 FSD 测试的随行体验 https://t.co/AsyBHnndj8
推荐理由:当AI驾驶让你无法区分人机时,出行方式的底层信任逻辑将被重写
如果机器人能在视频生成模型内部做梦会怎样?我们推出 DreamGen,这是一种全新引擎,它不依赖成群的人类操作员,而是借助以像素为单位的数字梦境来规模化机器人学习。DreamGen 生成海量的神经轨迹——即与电机动作标签配对的逼真机器人视频——并解锁了对新名词、新动词和新环境强大的泛化能力。无论你是人形机器人(GR1)、工业机械臂(Franka),还是一个可爱的小机器人(HuggingFace SO-100),DreamGen 都能让你做梦。 像 Sora 和 Veo 这样的视频生成模型本质上是神经物理引擎。通过压缩数十亿条互联网视频,它们学习到了一个包含无数可能的未来的多重宇宙——即从任意初始图像帧出发,世界可能如何展开的叠加态。DreamGen 通过一个简单的四步方案利用了这种能力: 1. 在目标机器人上微调一个 SOTA 视频模型; 2. 用多样化的语言提示词提示模型,模拟平行世界:你的机器人在新场景中会如何行动。过滤掉那些不遵循指令的坏梦(哈!); 3. 利用逆动力学或潜在动作模型恢复伪动作; 4. 在經過大规模增强的神经轨迹数据集上训练机器人基础模型。 就这么简单。只是更多的数据,以及纯粹的旧式监督学习。很简单,对吧? 令人惊叹的是它的效果能走多远。仅从一个单任务的“拾取-放置”数据集出发,我们的人形机器人学会了 22 种新行为,例如倒水、折叠、舀取、熨烫和锤击,尽管它从未见过这些动词。更棒的是,我们可以把机器人从实验室带出来,放到 NVIDIA 总部咖啡馆里,让 DreamGen 施展它的魔法。我们展示了真正的从零到一的泛化:新动词的成功率从 0% 提升到超过 43%,在未见过的环境中从 0% 提升到 28%。 与传统的图形引擎相比,DreamGen 并不在乎场景是否涉及可变形物体、流体、半透明材质、高接触交互或疯狂的光照。手工构建这些场景可不容易。对于 DreamGen,每个世界都只是通过扩散神经网络的一次前向传播。无论梦境多复杂,展开它所需的计算时间都是恒定的。 立即阅读我们的博客和论文!我们计划在未来几周内完全开源整个管道。链接在帖子中。
推荐理由:NVIDIA提出用视频生成模型为机器人“造梦”合成训练数据,实现零样本技能泛化
@DrJimFan 特斯拉已经拥有这个功能好几年了。用于创建不寻常的训练样本(例如近乎正面碰撞),即使现场有800万辆车也需要补充数据,尤其是随着我们的汽车变得越来越安全,危险情况变得非常罕见。
推荐理由:Jim Fan 指出物理 AI 评估难题,提出神经网络驱动的 Sim 2.0 数据飞轮方案
推荐理由:Jim Fan 揭示机器人'炫技易做家务难'的莫拉维克悖论成因
AGI 的门槛不是赢得诺贝尔奖,而是能去任何人家中烹饪任意菜系。物理图灵测试远比学术理论困难,Moravec 悖论将在未来十年持续困扰 AI 发展。
我对 AGI 的标准是:一个 AI 凭借它自己提出的新理论赢得诺贝尔奖。
推荐理由:Jim Fan 提出 AGI 的物理图灵测试标准:能烹饪任意晚餐比获诺奖更难
推荐理由:Jim Fan 称机器人领域处 GPT-1 时刻,具身智能是 AGI 必要条件
Gemini Robotics On-Device 推出高效端侧机器人模型,具备通用灵巧操作与快速任务适应能力,支持本地设备直接部署运行。
推荐理由:DeepMind 发布端侧机器人模型,支持本地部署与快速任务适应
推荐理由:NVIDIA 提出 DreamGen:让机器人在视频生成模型中「做梦」合成训练数据,实现强零样本泛化,将开源
推荐理由:NVIDIA Jim Fan 提出「物理图灵测试」,定义通用机器人终极标准
激动地宣布 GR00T N1,全球首个面向人形机器人的开放基础模型!我们的使命是让物理 AI 走向大众。通用机器人大脑的力量,尽在掌中——仅有 2B 参数,N1 从迄今汇编的最多样化物理动作数据集中学习,以小博大: - 真实人形遥操作数据。 - 大规模仿真数据:我们开源 300K+ 轨迹! - 神经轨迹:我们应用 SOTA 视频生成模型来“幻觉”出新的合成数据,其像素级特征具备准确的物理特性。用 Jensen 的话说,“系统性地无限数据”! - 潜在动作:我们开发新颖算法,从野外人类视频和神经生成视频中提取动作 token。 GR00T N1 是一个单一的端到端神经网络,从光子到动作: - 视觉-语言模型(系统 2)通过视觉和语言指令解读物理世界,使机器人能够对其环境和指令进行推理,并规划正确的动作。 - 扩散 Transformer(系统 1)以 120 Hz“渲染”平滑而精确的运动动作,执行系统 2 制定的潜在计划。 我们将 N1 部署在 GR1 机器人、1X Neo 机器人以及大量仿真基准上。N1 在家庭和工业环境中的多样化操作任务上实现了高达 +30% 的提升。 虽然人形机器人是 N1 的主要焦点,但我们的模型也支持跨具身。我们对其微调,使其能在价值 $110 的 HuggingFace LeRobot SO100 机械臂上工作!开放机器人大脑运行在开放硬件上。听起来正合适。 让我们一起解决机器人技术,一次一个 token。 我们的白皮书、Github 仓库、HuggingFace 模型和开放数据集页面的链接在帖子串中:🧵
推荐理由:NVIDIA开源首个通用人形机器人基础模型GR00T N1,2B参数可部署于百元级机械臂