NVIDIA 发布 Cosmos 3 Edge:4B 参数开源世界模型,为机器人及边缘 AI 提供实时推理与动作生成
NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理并生成动作。
推荐理由:NVIDIA 把世界模型的能力压进 4B 参数,直接在 Jetson 上实时推理并生成机器人动作,对做具身智能的人来说是个标志性信号,边缘部署终于可以摆脱云端依赖了。
AI 走进物理世界:人形机器人、具身基础模型与真实环境操作能力的进展追踪。
NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理并生成动作。
推荐理由:NVIDIA 把世界模型的能力压进 4B 参数,直接在 Jetson 上实时推理并生成机器人动作,对做具身智能的人来说是个标志性信号,边缘部署终于可以摆脱云端依赖了。
面壁智能联合 OpenBMB 在世界人工智能大会上发布并开源首个具身智能成果 MiniCPM-Robot 系列,包括 1.5B 通用 VLA 模型 MiniCPM-RobotManip 与 0.9B 跟踪模型 MiniCPM-RobotTrack。
推荐理由:1.5B VLA模型通过视觉token压缩将带记忆推理成本降至与单帧反应式相近,使得需要持续上下文理解的机器人操作任务不再受算力约束。
Nvidia CEO 黄仁勋在 7 月 15-16 日访日期间,宣布为日本建设“Vera Rubin AI 工厂”,配备 13,750 颗 Vera CPU 和 27,500 颗 Rubin GPU,预计 2028 年投运。
推荐理由:黄仁勋这次东京行程把 Nvidia 和日本制造业绑在了一起,Noetra 和 Cosmos 3 Edge 是物理 AI 落地的关键信号,做机器人的应该认真看。虽说是合作公告,但真金白银的投入和路线图比多数 PR 实在。
推荐理由:面壁智能把1.5B的VLA模型完整开源,让个人开发者也能在真实机器人上跑操作和跟踪,这个开放程度在具身领域很罕见,做机器人的可以直接 clone 跑一下。
昆仑万维董事长方汉在WAIC上宣布2026年为“世界模型元年”,并发布Matrix-Game 3.5世界模型、Mureka v9.5与O3音乐模型。Matrix-Game 3.5实现Patch级记忆注入,5B模型在720p分辨率下单卡可达20FPS实时生成,核心架构已开源。
推荐理由:Matrix-Game 3.5 用 Patch 记忆把世界模型推到单卡实时交互,还开源了,做游戏和具身智能的值得试。Mureka v9.5 和 O3 把 AI 音乐做成版本化创作,工具感很强。
昆仑万维在WAIC论坛宣布2026年为“世界模型元年”,并发布Matrix-Game 3.5世界模型与Mureka v9.5、O3音乐模型。Matrix-Game 3.5实现Patch级记忆注入,5B模型在720p下可单卡20FPS实时生成,核心架构开源。Mureka v9.5指令精准度从6.92提升至7.62。
推荐理由:Matrix-Game 3.5 用 Patch 级记忆实现长时一致性与实时交互,为具身智能数据生成与游戏环境演化提供了可参考的架构;Mureka 将音乐生成转向「版本化制作」,结合 Agent 控制多维度调整,让非专业创作者也能迭代作品。
小米推出Xiaomi-Robotics-U0,一个380亿参数的多模态自回归模型,用于统一具身合成。该模型将具身生成视为基础图像与视频生成的延伸,联合优化文生图、图像编辑、具身场景生成、具身迁移及具身视频生成。它是首个支持跨多种机器人形态的高质量多视角场景生成模型,并引入结构化可控具身迁移。该模型在单步与序列生成任务上达到SOTA,在具身场景生成与迁移的人类评估中超越GPT-Image-2.0,在World Arena具身视频生成排名第一,并将pi_0.5在真实世界操控任务上的分布外成功率从36.9%提升至63.2%。代码与检查点已开源。
推荐理由:小米这个 38B 的统一具身生成模型,把图像、编辑、场景生成等全塞进一个框架,并在真实机器人操作任务上把 pi_0.5 的成功率从 36.9% 拉到 63.2%,做具身智能的值得认真看。
阿里巴巴旗下高德发布通用世界模型工坊 ABot-WorldStudio,并开放测试。该产品将交互式视频生成与 3DGS 场景生成统一,用户输入文字或图片即可生成可实时交互、可分享的 AI 世界。工坊内置“时空任意门”,穿越后可跃迁至另一完整 3D 世界。官方实测单次连续推理稳定运行超1小时,无崩溃、无质量衰减。底层模型 ABot-World0 与 ABot-3DWorld0 均可在单张 5090 上本地部署,已全面开源。
推荐理由:把世界模型从一分钟短片推进到小时级稳定探索,还支持本地一张消费级显卡跑,这对做具身智能和边界探索的团队是个值得上手的信号。
蚂蚁集团旗下具身智能团队 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型。该模型采用因果 DiT 架构,视频专家约 13.0B 参数(约 1.9B 激活),训练规模约 15.3B 参数,推理时每 token 约 2.5B 激活。模型引入多块预测(MCP)实现 2.3 倍训练加速,并通过前瞻推理将推理延迟降至 142 ms/chunk。在 RoboTwin 2.0 的 50 个任务上,干净与随机演示数据平均成功率分别达 93.8% 和 93.4%。
推荐理由:具身智能领域第一个从零预训练的因果视频-动作模型,将世界状态和动作统一在一个隐空间,异步推理优化到 225Hz,做机器人的值得仔细研究。


推荐理由:人形机器人首次在活体动物上完成标准微创手术,成本仅为达芬奇零头,虽然离临床还很远,但信号明确,手术机器人可能被重新定义。
据晚点LatePost报道,特斯拉Optimus Gen 3经马斯克评审通过,即将量产。供应链要求供应商9月产能达1000台/周,年底升至2000-2500台/周,届时年产能可达10万台。马斯克六月底高管会上要求年底前实现产能目标,否则开除整个Optimus采购团队。弗里蒙特工厂已改造为Optimus生产线,Model S/X于5月停产。马斯克表示初期生产极其缓慢,低产量夏季启动,高产量2027年展开。
推荐理由:Optimus从实验室走进产线,量产启动本身就是具身智能的一个重要信号,马斯克拿采购团队开刀的表态比订单数字更能稳定产业链预期,不过初期产能极慢,别指望今年就能满大街都是机器人。
蚂蚁灵波开源新一代实时交互世界模型 LingBot-World 2.0(14B 参数),支持施法、攻击、跳跃等丰富角色动作及文本驱动事件(如切换场景、召唤风暴),内置 Pilot Agent 与 Director Agent 实现世界持续演化,并支持多人同时交互。模型采用因果预训练范式和混合双向自回归注意力掩码(MoBA),可稳定输出 720p/60fps 实时画面,长达一小时测试画质不衰减。通过一致性蒸馏与 DMD 降低采样成本,结合注意力 kernel 优化、混合并行推理、动态 KV 缓存调度和异步流媒体传输实现低延迟交互。模型权重及推理代码以非商用协议开源,SGLang 已适配,并提供 Reactor PC 端和灵光 APP 在线体验。
推荐理由:蚂蚁灵波这个开源世界模型把实时世界生成推到了小时级还不崩,720p/60fps实时交互,做开放世界游戏或自动驾驶仿真的团队值得上手测。
蚂蚁灵波科技正式开源LingBot-Video,这是全球首个基于MoE架构、面向具身智能的视频生成基础模型。总参数30B,推理时仅激活约3B,效率较同规模Dense架构提升约3倍。模型引入7万小时VLA、VLN、Ego等机器人数据,并通过多维强化学习奖励系统对齐物理合理性与任务完成度。在RBench上总分0.620,超越Wan2.6等模型;在Physics-IQ Verified评测中排名第一。可用于机器人动作预测、仿真数据生成等方向。
推荐理由:蚂蚁灵波开源了首个面向具身智能的视频基模,用MoE控制推理成本,对机器人仿真和世界模型研究是个真工具,做具身的可以跑起来了。
Robbyant 推出 LingBot-VLA 2.0,一个 6B 参数的开源视觉-语言-动作(VLA)基础模型。它以 Qwen3-VL-4B-Instruct 为骨干,采用 MoE 动作专家架构,通过 55 维规范向量统一表示不同机器人的状态和动作。训练数据涵盖约 60,000 小时高质量数据(50,000 小时机器人轨迹 + 10,000 小时第一人称人类视频),覆盖 20 种机器人配置。在 GM-100 双机械臂基准测试中,模型在多个平台上超越 π0.5 和之前版本。模型权重、代码和技术报告已以 Apache-2.0 许可开源。
推荐理由:蚂蚁Robbyant放出的开源VLA 2.0把通用机器人策略往前推了一步,60,000小时跨具身数据、统一动作空间和MoE设计对做机器人的团队是实打实的参考,不是又一个lab-only的demo。
蚂蚁集团旗下具身智能公司Robbyant开源LingBot-Vision,一套自监督视觉Transformer家族,专为密集空间感知设计。旗舰ViT-g/16参数约1.1B,采用掩膜边界建模训练,将边界作为原生预训练信号。在密集空间任务中,该1B模型匹配或超越参数规模高达7倍的大模型(如7B DINOv3)。模型以Apache-2.0许可证在Hugging Face开源,提供ViT-g、ViT-L(300M)、ViT-B(86M)、ViT-S四个规模。
推荐理由:在视觉基础模型里把边界当作核心信号,这个思路很反常识,1B模型在深度估计上超过7B的DINOv3,做机器人的可以认真看看。
AlayaWorld 是一个全栈开源框架,用于构建交互式生成世界。该框架支持开放式实时交互,用户可自由导航并执行战斗、施法、召唤怪物等多种动作。AlayaWorld 将数据准备、模型架构、训练、推理加速和部署统一在模块化可扩展的架构中,并发布了可复现流程、参考实现、评估工具和完整文档,为生成世界模型的未来研究与实时应用奠定基础。
推荐理由:AlayaWorld 把生成世界从 demo 变成了可交互的全栈开源框架,放出了完整 pipeline,对做游戏和具身智能的团队来说是一套可以立刻跑起来的工具链,值得落地尝试。
美国自动驾驶车辆公司 Forterra 宣布,过去九个月已向乌克兰战场部署超过 100 辆基于 Polaris ATV 的 Lancer 自主地面车辆。这些汽油动力车辆可携带 750 公斤货物,加装 Starlink 天线实现远程操控,已执行 1100 多次任务,行驶 2500 英里,运送 777,440 磅物资,完成 52 次伤员撤离。目前车辆主要采用远程操作,因自主系统尚无法实时识别并应对敌方威胁。Forterra 已融资超 5 亿美元,正将经典机器人方法与生成式 AI 结合以提升自主能力。美军专家认为地面自主技术已具实战价值。
推荐理由:这是首次有美国自主地面车辆在实战中长期部署的详细报道,做军事 AI 的人可以认真读,但对多数从业者来说只是猎奇。
原文正文仅包含网站 Cookie 设置说明,未提供关于巴黎办公室的部门、规模、职能或开业时间等具体信息。
推荐理由:Runway在巴黎设立研究办公室,聚焦世界模型和物理AI,30M投资不算大,但选在AI人才密集的法国是明智的长期布局,短期产品无变化。
NVIDIA 联合密歇根大学、UIUC、UC Berkeley 等提出 ASPIRE,一个持续学习机器人框架。它通过协调器-执行器架构、闭环执行引擎、技能库和进化搜索,编写并优化机器人控制程序。编程智能体使用 Claude Code(Claude Opus 4.6,1M token 上下文窗口)。在 LIBERO-Pro 上最高比最强基线提升 77 分;Robosuite 双手交接成功率从 20% 提升至 92%;BEHAVIOR-1K 收音机拾取任务从 56% 提升至 88%。利用 LIBERO-90 积累的技能,ASPIRE 在零样本条件下对 LIBERO-Pro Long 任务达到约 31% 成功率,此前方法饱和在 4% 附近。
推荐理由:ASPIRE让机器人编程从单次尝试变成持续学习,把失败调试沉淀成可复用技能库,长任务零样本直接从4%拉到31%,这条思路比具体数字更有启发性。
7月2日,证监会同意宇树科技股份有限公司首次公开发行股票并在科创板上市的注册申请。宇树科技是国内头部民用足式、人形机器人研发企业,全球四足机器人销量领先,2016年由王兴兴在杭州创立,截至2025年6月员工总数超1000人。公司核心优势在于实现关节电机、减速器、控制器等核心零部件全栈自研,关键部件成本仅为进口产品的约1/3。批复自同意注册之日起12个月内有效。
推荐理由:宇树是国内人形机器人头部,IPO 获批意味资本正式为具身智能赛道打开通道,接下来硬件和量产能力会成为竞争焦点,关注王兴兴下一步怎么花钱。