跳到正文
北京时间

具身智能

AI 走进物理世界:人形机器人、具身基础模型与真实环境操作能力的进展追踪。

最新精选

第 101–117 条 · 共 117 条
2月27日周五
  1. Saining Xie

    Project Solaris提出世界建模的本质在于全局共享状态而非局部像素渲染,推出基于Minecraft的多人在线视频世界模型。该系统突破单智能体视角局限,支持任意数量智能体随时介入交互,实现持久化世界状态演化。核心包含三大组件:Solaris Engine多人数据收集系统、基于DiT架构的Solaris Model(采用新型内存高效自强制设计,训练于1260万帧协调游戏数据)、以及使用VLM评判的Solaris Eval评估体系。这一范式转变为构建神经MMORPG服务器奠定基础。

    引用Oscar Michel@ojmichel4

    📢当前的世界模型并没有真正在建模世界;它们建模的是某一个智能体对世界的视角。部分观测 ≠ 世界状态。 未来的世界模型将独立于任何单个智能体的视角。你将能够在任意时间点“放入”任意数量的智能体,而一个持久的世界状态将随着它们的交互而演化。想象一个神经 MMORPG 服务器。🧵[1/10]

    推荐理由:从单视角到共享全局状态,开源多智能体世界模型或改变AI训练范式

2月26日周四
  1. Jim Fan

    研究团队提出EgoScale方法,基于20,000小时第一人称人类视频预训练GR00T N1.5,仅用4小时机器人数据即可掌握组装模型车、操作注射器等高灵巧度任务,性能较从头训练提升54%。研究发现人类视频量与动作预测损失呈对数线性缩放关系(R²=0.998)。该方法利用22-DoF手部与人类的运动学相似性,无需复杂迁移算法即可重定向动作。策略可跨硬件迁移至Unitree G1(7-DoF),性能提升30%以上,且仅需单个示教即可学习新任务。

    推荐理由:人类视频学习呈现完美缩放定律,机器人仅需单演示即可掌握新技能,具身智能迎来数据革命

2月25日周三
  1. Jim Fan

    SONIC是一个4200万参数的Transformer模型(规模仅半个GPT-1),通过1亿+动作捕捉帧和50万+并行机器人在NVIDIA Isaac Lab中训练,以密集帧级监督替代手工奖励函数。训练3天后零样本迁移至真实G1机器人,在50种动作序列上达100%成功率。单一策略支持VR遥操作、视频动捕、文本指令、音乐响应及VLA模型控制。项目已完全开源。

    推荐理由:42M小模型实现人形机器人全身控制,零样本迁移真实硬件且完全开源,开发者可复现

2月5日周四
  1. Jim Fan

    团队发布DreamZero,首个基于世界模型骨干的World Action Model (WAM)。该模型突破传统Vision-Language-Action范式,通过像素级世界模型实现零样本开放世界提示能力,可执行未训练过的新任务。研究发现WAM依赖多样化数据而非重复演示,并以像素作为跨具身的通用桥梁,实现robot2robot和human2robot知识迁移。仅需55条轨迹(约30分钟遥操作)即可适应全新硬件,验证世界模型作为Physical AI下一代基础的可行性。

    推荐理由:世界模型成为物理AI新底座,机器人零样本泛化能力逼近GPT-2时刻

2月4日周三
  1. Jim Fan72

    作者指出,AI预训练正经历从“下一个词预测”到“世界建模”的根本性范式转变。世界模型的核心是预测给定行动后的下一个物理状态序列,本质上是可学习的物理模拟器,并将视觉置于首位。相比之下,当前主流的视觉语言模型本质是语言优先,视觉是次要输入。生物智能中视觉处理占据皮层计算的主导地位,是连接大脑、动作与物理世界的高带宽通道。作者以猿类为例,证明强大的物理智能可独立于高级语言存在。他预测,2026年大型世界模型将为机器人技术和多模态AI奠定真正基础,而YouTube等平台的海量视觉数据将远超文本规模,推动这一新范式发展。

    推荐理由:Jim Fan 把世界模型定义为第二次预训练范式转移,核心论点是视觉优先而非语言优先,这个框架对做机器人和多模态的人是真正的路线判断,不是又一篇水文。

1月6日周二
  1. Hugging Face:Blog(RSS)80

    NVIDIA发布Cosmos Reason 2模型,增强物理AI推理能力

    NVIDIA在Hugging Face上发布了Cosmos Reason 2模型,旨在提升物理AI系统的推理能力。该模型通过改进的推理架构,使AI能更准确地理解和预测物理世界的动态与交互,核心升级包括对复杂场景的多步推理、不确定性量化及时间序列数据的深度理解。这一进展将推动机器人、自动驾驶等领域的发展,使AI在现实环境中的决策更可靠、更符合物理规律。

    推荐理由:物理AI推理能力升级,机器人和具身智能落地的关键拼图

12月29日周一
  1. Jim Fan

    硬件方面,Optimus等虽工程精湛,但可靠性不足严重限制软件迭代,且维护成本高昂。基准测试领域仍处混乱,缺乏统一的硬件平台、任务定义和评分标准,cherry-picking现象普遍,可复现性堪忧。VLA(Vision-Language-Action)方法基于VLM存在本质缺陷:VLM为视觉问答优化,参数侧重语言知识而非物理理解,且视觉编码器丢弃低层细节,不利于精细操作。作者认为视频世界模型是更优的预训练目标。

    推荐理由:NVIDIA科学家揭示机器人学三大痛点:硬件拖累迭代、基准混乱、VLA路线存在根本缺陷

12月24日周三
  1. Jim Fan

    作者虽晚购特斯拉却率先体验FSD v14,认为这是首个通过"物理图灵测试"的AI系统:疲惫下班后只需按下按钮放松休息,已无法分辨是神经网络还是人类在驾驶。尽管深知机器人学习原理,方向盘自动转动时的流畅表现仍令人震撼。这项技术正从超现实体验转变为日常习惯,最终如智能手机般不可或缺。这种对"神级技术"的深度依赖,正在从根本上重塑人类行为模式。

    引用Phil Duan@pduan

    参与无监督 FSD 测试的随行体验 https://t.co/AsyBHnndj8

    推荐理由:当AI驾驶让你无法区分人机时,出行方式的底层信任逻辑将被重写

8月5日周二
  1. Jim Fan

    NVIDIA发布DreamGen引擎(GR00T Dreams),将Sora/Veo等视频生成模型用作神经物理引擎,通过微调模型、模拟并行世界、恢复伪动作、训练基础模型四步流程,为机器人生成大规模合成训练数据。人形机器人仅凭单一拾放任务即可学会倾倒、折叠等22种新行为,在新动词和陌生环境中实现零样本泛化(成功率分别达43%和28%)。相比传统图形引擎,该方法以恒定计算成本处理可变形物体、流体等复杂交互,团队计划数周内完全开源。

    引用Jim Fan@DrJimFan

    如果机器人能在视频生成模型内部做梦会怎样?我们推出 DreamGen,这是一种全新引擎,它不依赖成群的人类操作员,而是借助以像素为单位的数字梦境来规模化机器人学习。DreamGen 生成海量的神经轨迹——即与电机动作标签配对的逼真机器人视频——并解锁了对新名词、新动词和新环境强大的泛化能力。无论你是人形机器人(GR1)、工业机械臂(Franka),还是一个可爱的小机器人(HuggingFace SO-100),DreamGen 都能让你做梦。 像 Sora 和 Veo 这样的视频生成模型本质上是神经物理引擎。通过压缩数十亿条互联网视频,它们学习到了一个包含无数可能的未来的多重宇宙——即从任意初始图像帧出发,世界可能如何展开的叠加态。DreamGen 通过一个简单的四步方案利用了这种能力: 1. 在目标机器人上微调一个 SOTA 视频模型; 2. 用多样化的语言提示词提示模型,模拟平行世界:你的机器人在新场景中会如何行动。过滤掉那些不遵循指令的坏梦(哈!); 3. 利用逆动力学或潜在动作模型恢复伪动作; 4. 在經過大规模增强的神经轨迹数据集上训练机器人基础模型。 就这么简单。只是更多的数据,以及纯粹的旧式监督学习。很简单,对吧? 令人惊叹的是它的效果能走多远。仅从一个单任务的“拾取-放置”数据集出发,我们的人形机器人学会了 22 种新行为,例如倒水、折叠、舀取、熨烫和锤击,尽管它从未见过这些动词。更棒的是,我们可以把机器人从实验室带出来,放到 NVIDIA 总部咖啡馆里,让 DreamGen 施展它的魔法。我们展示了真正的从零到一的泛化:新动词的成功率从 0% 提升到超过 43%,在未见过的环境中从 0% 提升到 28%。 与传统的图形引擎相比,DreamGen 并不在乎场景是否涉及可变形物体、流体、半透明材质、高接触交互或疯狂的光照。手工构建这些场景可不容易。对于 DreamGen,每个世界都只是通过扩散神经网络的一次前向传播。无论梦境多复杂,展开它所需的计算时间都是恒定的。 立即阅读我们的博客和论文!我们计划在未来几周内完全开源整个管道。链接在帖子中。

    推荐理由:NVIDIA提出用视频生成模型为机器人“造梦”合成训练数据,实现零样本技能泛化

  2. Jim Fan

    物理AI评估无法靠实车碰撞测试完成,传统游戏引擎(sim 1.0)也难以覆盖所有边缘情况。基于神经网络的sim 2.0由数据驱动,随车队规模扩展。Tesla已应用多年,用于生成近正面碰撞等罕见危险场景的训练数据,补充800万辆实车难以采集的极端案例。

    引用Elon Musk@elonmusk

    @DrJimFan 特斯拉已经拥有这个功能好几年了。用于创建不寻常的训练样本(例如近乎正面碰撞),即使现场有800万辆车也需要补充数据,尤其是随着我们的汽车变得越来越安全,危险情况变得非常罕见。

    推荐理由:Jim Fan 指出物理 AI 评估难题,提出神经网络驱动的 Sim 2.0 数据飞轮方案

7月26日周六
7月19日周六
7月14日周一
6月24日周二
5月20日周二
  1. Jim Fan

    DreamGen让机器人在视频生成模型中"做梦"合成训练数据。通过微调Sora等模型生成海量神经轨迹(逼真视频+动作标签),机器人从单一拾取放置任务泛化到倾倒、折叠等22种新行为。在NVIDIA总部咖啡厅测试中,人形机器人对新动词零样本成功率从0%提升至43%,新环境达28%。相比传统图形引擎,无需手工建模即可处理流体、可变形物体等复杂场景,整个pipeline将于近期完全开源。

    推荐理由:NVIDIA 提出 DreamGen:让机器人在视频生成模型中「做梦」合成训练数据,实现强零样本泛化,将开源

5月8日周四
3月21日周五
  1. Jim Fan

    NVIDIA 发布世界首个开源人形机器人基础模型 GR00T N1,仅 2B 参数,采用 VLM 加 Diffusion Transformer 架构实现端到端控制。模型基于真实遥操作、30 万+仿真轨迹及合成神经轨迹训练,在 GR1、1X Neo 等机器人上任务性能提升 30%,并可跨具身部署至百元级开源机械臂。

    引用Jim Fan@DrJimFan

    激动地宣布 GR00T N1,全球首个面向人形机器人的开放基础模型!我们的使命是让物理 AI 走向大众。通用机器人大脑的力量,尽在掌中——仅有 2B 参数,N1 从迄今汇编的最多样化物理动作数据集中学习,以小博大: - 真实人形遥操作数据。 - 大规模仿真数据:我们开源 300K+ 轨迹! - 神经轨迹:我们应用 SOTA 视频生成模型来“幻觉”出新的合成数据,其像素级特征具备准确的物理特性。用 Jensen 的话说,“系统性地无限数据”! - 潜在动作:我们开发新颖算法,从野外人类视频和神经生成视频中提取动作 token。 GR00T N1 是一个单一的端到端神经网络,从光子到动作: - 视觉-语言模型(系统 2)通过视觉和语言指令解读物理世界,使机器人能够对其环境和指令进行推理,并规划正确的动作。 - 扩散 Transformer(系统 1)以 120 Hz“渲染”平滑而精确的运动动作,执行系统 2 制定的潜在计划。 我们将 N1 部署在 GR1 机器人、1X Neo 机器人以及大量仿真基准上。N1 在家庭和工业环境中的多样化操作任务上实现了高达 +30% 的提升。 虽然人形机器人是 N1 的主要焦点,但我们的模型也支持跨具身。我们对其微调,使其能在价值 $110 的 HuggingFace LeRobot SO100 机械臂上工作!开放机器人大脑运行在开放硬件上。听起来正合适。 让我们一起解决机器人技术,一次一个 token。 我们的白皮书、Github 仓库、HuggingFace 模型和开放数据集页面的链接在帖子串中:🧵

    推荐理由:NVIDIA开源首个通用人形机器人基础模型GR00T N1,2B参数可部署于百元级机械臂