跳到正文
北京时间

具身智能

AI 走进物理世界:人形机器人、具身基础模型与真实环境操作能力的进展追踪。

最新精选

第 81–100 条 · 共 117 条
5月22日周五
  1. IT之家(RSS)74

    国家发改委:加快具身智能训练基础设施建设,让机器人不仅能上赛场,还能“进工厂、进商场、进家庭”

    国家发改委在5月22日新闻发布会上表示,人形机器人在半程马拉松比赛中表现显著提升,速度更快、更灵活、更自主,参赛队伍从20余支增至百余支,完赛队伍从6支增至40余支,反映具身智能创新活力增强和产业规模扩大。下一步,发改委将加快具身智能训练基础设施建设,推动机器人融入工厂、商场、家庭等场景,并建设应用中试基地以加速技术落地。

    推荐理由:国家发改委首次明确加快具身智能训练基建,机器人从「上赛场」到「进工厂、进商场、进家庭」,这是给具身智能行业打了一针强心剂。

5月19日周二
  1. IT之家(RSS)75

    现代汽车集团计划部署 2.5 万台波士顿动力 Atlas 人形机器人

    现代汽车集团公布计划,将在现代汽车和起亚的制造工厂部署超过 2.5 万台子公司波士顿动力开发的 Atlas 人形机器人,并将在美国工厂制造核心机器人零部件。该集团目标到 2028 年实现年产 3 万台 Atlas 机器人,同时计划在美国工厂每年生产超过 30 万个执行器单元。该计划是在摩根大通主办的投资者关系会议上提出的,未提供详细推广时间表或指明具体工厂。

    推荐理由:2.5万台Atlas进工厂,这规模把具身智能从炫技视频直接推进了流水线,2028年产能30万台执行器才是真正的信号,供应链的人该紧张了。

  2. IT之家(RSS)74

    地平线开源 HoloMotion-1 4 亿参数机器人小脑大模型,可实现舞蹈、健身、搬箱子等动作

    地平线机器人实验室发布了其开源的人形机器人全身控制模型 HoloMotion-1。这是一个拥有 4 亿参数的“小脑”大模型,通过 MoE 稀疏激活与 KV-cache 推理机制,在端侧实现了约 300FPS 的实时推理能力。该模型利用互联网视频、光学动捕、VR 遥操作等多种来源的动作数据进行训练,并在真实机器人上成功展示了舞蹈、爬行、健身、搬箱子等复杂动作的零样本迁移能力。相关代码与技术报告已公开。

    推荐理由:地平线开源的这个4亿参数模型,把机器人“小脑”拉到一个小模型级别,300FPS实时跑在端侧,零样本跳舞搬箱子,搞具身智能的该跟进看看了。

  3. HuggingFace Daily Papers(社区热门论文)73

    StableVLA:无需额外数据的鲁棒视觉-语言-动作模型

    视觉-语言-动作模型在面对训练数据未涵盖的视觉干扰时性能显著下降。为此,本文提出一种基于信息论的轻量级适配器模块(IB-Adapter),能从视觉输入中选择性过滤噪声,且无需额外数据或增强策略。该适配器以少于1000万的额外参数,平均提升性能30%。实验表明,即使骨干网络参数仅为0.5B(较现有7B模型小14倍),StableVLA在合成与真实视觉损坏场景下的长时程任务中,仍能达到与大模型相当的鲁棒性,并超越OpenPi基线。

    推荐理由:VLA 模型在真实世界一遇到光照遮挡就崩,这篇用信息瓶颈原理做的轻量适配器,不加数据就拉回 30% 性能,还用 0.5B 小模型打平 7B,做机器人落地的团队值得看看。

  4. Hugging Face:Blog(RSS)67

    NVIDIA Cosmos Predict 2.5 微调:使用 LoRA/DoRA 生成机器人视频

    NVIDIA Cosmos Predict 2.5 是一个 2B 参数的世界模型,可根据文本、图像或视频片段生成物理合理的视频。通过 LoRA 或 DoRA 在 DiT 的注意力层(to_q, to_k, to_v, to_out.0)和前馈层注入可训练适配器,冻结全部基座权重,在单个 80GB GPU 上即可完成参数高效微调,避免了全量微调的高成本与灾难性遗忘。该流程使用 diffusers 和 accelerate 库,利用 92 个机器人操作视频训练集与 50 个 (prompt, image) 测试对进行微调,并展示如何用微调模型生成合成机器人轨迹以支持下游机器人学习任务。支持单 GPU 与多 GPU 训练,切换不同领域适配器无需重训。

    推荐理由:这篇教程把微调Cosmos Predict 2.5的方法从头到尾讲清楚了,做机器人合成数据的同行可以直接抄作业,LoRA/DoRA切换也很方便,值得收藏。

5月16日周六
  1. IT之家(RSS)70

    杭州基地启用,机器人有了国家级职业技能训练场

    国家人工智能应用中试基地(具身智能)5月16日在浙江杭州挂牌启用,为机器人提供国家级职业技能训练场。该基地是集场景体验、技术展示、研发合作、产业赋能于一体的综合性平台,旨在推动具身智能技术从实验室迈向现实应用。杭州市于5月1日施行首部具身智能机器人地方性法规,支持核心研发、平台建设和场景开放。目前杭州已集聚机器人产业相关企业700余家,2025年具身智能产业集群产值达1068亿元。

    推荐理由:杭州这个国家级具身智能训练场不是「又一个基地」,它是把散点技术拢成产业链标准化的关键一步,做机器人的可以盯着政策红利和开放场景了。

5月8日周五
  1. Jim Fan79

    演讲者以“Robotics: Endgame”为题,提出解决物理AGI的路线图,直接类比LLM的成功路径。核心观点包括视频世界模型作为第二预训练范式、世界行动模型(WAM)、机器人数据收集策略(类似FSD的物理数据飞轮)、EgoScale和灵巧性缩放定律、物理强化学习 bridging the last mile,以及DreamDojo端到端神经物理引擎。预测物理AGI的实现比预期更近,并提及2016年参与OpenAI DGX-1签署与Jensen和Elon的个人经历。

    推荐理由:Jim Fan 这 20 分钟把机器人做成了 LLM 的平行故事,从 World Action Models 到 Dexterity Scaling Law,信息密度大到建议 0.5 倍速,做硬件的该换地图了。

5月5日周二
  1. HuggingFace Daily Papers(社区热门论文)75

    MolmoAct2:面向真实世界部署的动作推理模型

    MolmoAct2 是一个为实际部署设计的全开放动作推理模型,在五个方面取得进展。其核心是专为空间与具身推理训练的 VLM 骨干 MolmoER,基于 330 万样本语料库训练。团队发布了三个新数据集,包括迄今最大开放双手数据集 MolmoAct2-BimanualYAM(720 小时遥操作轨迹),并开源了动作分词器 OpenFAST。模型采用层间 KV 缓存条件化架构,嫁接连续动作专家,还引入自适应深度推理变体 MolmoThink,以极低延迟保持几何基础。在广泛实证研究中,MolmoAct2 在 7 个仿真与真实世界基准上超越 Pi-05 等基线,MolmoER 在 13 个具身推理基准上超过 GPT-5 和 Gemini Robotics ER-1.5。模型权重、训练代码与数据均已公开。

    推荐理由:开源具身动作推理模型首次全面超越 GPT-5 和 Gemini Robotics,还附赠最大的双手操作数据集和全套训练代码,做机器人的同学本周必读。

  2. HuggingFace Daily Papers(社区热门论文)73

    RLDX-1技术报告

    为提升视觉-语言-动作模型在复杂现实任务中的功能覆盖,研究团队推出通用机器人策略RLDX-1。该模型基于多流动作变换器架构,整合运动感知、记忆决策与物理传感等异构模态,并辅以合成罕见场景数据、仿人操作学习流程及实时推理优化等系统设计。在仿真与真实测试中,RLDX-1全面超越前沿模型π_{0.5}和GR00T N1.6,尤其在ALLEX人形机器人任务上取得86.8%的成功率,显著高于对照模型的约40%,标志着其在接触密集型动态灵巧操作领域取得关键进展。

    推荐理由:在 ALLEX 人形任务上把成功率从 40% 拉到 86.8%,RLDX-1 证明了多模态流架构对灵巧操作的价值,做机器人的同学可以重点关注一下。

4月30日周四
  1. The Decoder:AI News(RSS)70

    Softbank 计划将估值高达1000亿美元的新AI与机器人公司Roze上市

    软银集团计划在美国启动并推动其新成立的人工智能与机器人公司Roze进行首次公开募股。据《金融时报》报道,这家新公司的估值可能高达1000亿美元。此举标志着软银在AI和机器人领域的重大战略布局,旨在将相关业务整合并独立上市以获取市场资源与更高估值。

    推荐理由:软银千亿美元估值的AI机器人公司Roze计划IPO,是今年AI领域最大的资本动作。如果成功,将重塑整个具身智能赛道的投资逻辑,值得持续关注。

4月28日周二
  1. IT之家(RSS)71

    新增具身智能、脑机科学与技术等 38 种专业,教育部发布 2026 年本科专业目录

    教育部发布《普通高等学校本科专业目录(2026年)》,新增38种本科专业,目录现涵盖13个门类、883种专业。为适应新兴交叉学科发展,目录在“交叉学科”门类中首批列入未来机器人、具身智能、脑机科学与技术等15种专业。新增专业精准对接国家战略与产业需求,包括能源科学与工程、深地科学与工程、农业机器人、生物制造、数字文旅、商业人工智能等。其中,具身智能专业获哈尔滨工业大学等9所高校增设。“十四五”期间全国高校专业调整幅度超30%,今年调整比例首次突破10%。

    推荐理由:教育部把具身智能列为本科专业,9所高校首批开设,这是AI人才供给端的结构性信号。做具身智能的团队,未来几年招人会容易很多。

  2. Hugging Face:Blog(RSS)58

    Adaptive Ultrasound Imaging with Physics-Informed NV-Raw2Insights-US AI

    NVIDIA 在 Hugging Face 上发布了一款名为 NV-Raw2Insights-US 的物理信息人工智能模型,专门用于自适应超声成像。该模型能够直接处理原始超声射频数据,实时生成高质量的诊断图像。它通过结合物理定律与深度学习,显著提升了图像分辨率和对比度,同时将传统处理流程中的多个步骤整合为单一前向传播,大幅提高了计算效率。这一进展有望推动超声设备向更便携、智能和精准的方向发展。

    推荐理由:NVIDIA 把物理先验塞进超声成像管线,从原始射频数据直接出诊断结果,跳过传统重建步骤。做医疗 AI 的值得拆一下这个端到端思路,但离通用场景太远。

4月23日周四
  1. IT之家(RSS)72

    Model S/X 产线将为特斯拉 Optimus 机器人让路,最早 7 月投产

    特斯拉CEO马斯克确认,Optimus人形机器人将于7月下旬或8月在弗里蒙特工厂投产。为此,Model S和X的生产线将在5月上旬停产后被彻底拆除,并在4个月内切换为Optimus生产线,马斯克称此速度“快得惊人”。Optimus涉及超10000个独特零部件,初期产量将“相当缓慢”,难以预测。此外,得州超级工厂的第二座Optimus工厂预计2027年夏季投产,将生产第四代机型。原定2026年第一季度亮相的第三代Optimus可能推迟至今年年中发布。

    推荐理由:Optimus 在弗里蒙特投产是具身智能从 demo 走向真量产的关键一步,产线 4 个月切换的工程魄力比产量数字更值得关注。

  2. 字节 Seed:Research Feed(网页内嵌数据)61

    字节 Seed 发布 Seed3D 2.0,几何与 PBR 材质生成达 SOTA

    字节 Seed 正式发布 3D 生成大模型 Seed3D 2.0,在几何生成、纹理材质生成两项核心指标对比中均取得 SOTA 结果。模型采用 Coarse-to-Fine 两阶段 DiT 提升几何精度,统一 PBR 生成架构并引入 MoE 与 VLM 先验,还支持部件级生成、关节化建模与场景组合,输出可兼容 Isaac Sim 等仿真引擎;技术报告已公开,API 已上线火山引擎。

    推荐理由:官方博客给出两阶段 DiT、统一 PBR 等架构细节与人类盲评结果,读者可了解 3D 生成走向生产可用的具体路径。

4月14日周二
  1. Google DeepMind:Blog(RSS)68

    Gemini Robotics-ER 1.6:通过增强具身推理赋能真实世界机器人任务

    Gemini Robotics-ER 1.6 正式发布,通过增强具身推理能力为真实世界机器人任务提供底层支持。该版本重点升级空间推理与多视角理解功能,使自主机器人能够更精准地解析三维环境、理解物体间空间关系,并在复杂场景中实现高效决策与操作执行,显著提升机器人在物理世界中的感知与交互性能。

    推荐理由:Gemini Robotics-ER 1.6 在机器人推理上迈了一大步,仪器读取和多视角成功检测是真需求,尤其是波士顿动力集成后,做具身智能的团队值得第一时间测试。

4月1日周三
  1. Jim Fan

    CaP-X开源具身智能系统,让大模型智能体通过机械臂与人形机器人进入物理世界。系统整合SAM3、Molmo等感知API与IK求解器、抓取规划等控制接口,可自动合成技能库。研究发布CaP-Gym基准(187项操作任务)与CaP-Bench(评测12个前沿模型),提出零样本框架CaP-Agent0及强化学习方案CaP-RL,后者仅用50次迭代即将7B模型成功率从20%提升至72%。该技术由曾开发Minecraft智能体Voyager的团队推出。

    推荐理由:NVIDIA Jim Fan 开源 CaP-X,让 Vibe Agent 真正进入物理世界操作机器人

3月10日周二
  1. Yann LeCun

    AMI Labs 宣布获 10.3 亿美元种子轮融资,由 Cathay Innovation、Bezos Expeditions 等领投,创欧洲公司种子轮纪录。公司致力于开发基于世界模型的新型 AI 系统,具备理解世界、持久记忆、推理规划及可控安全能力,团队分布于巴黎、纽约、蒙特利尔和新加坡。

    引用AMI Labs@amilabs

    Advanced Machine Intelligence (AMI) 正在打造新一代 AI 系统,它们能够理解世界、拥有持久记忆、可以推理和规划,并且可控且安全。 我们从相信我们以世界模型为核心的通用智能系统愿景的全球投资者那里筹集了 10.3 亿美元(约 8.9 亿欧元)的一轮融资。本轮融资由 Cathay Innovation、Greycroft、Hiro Capital、HV Capital 和 Bezos Expeditions 共同领投,并有来自世界各地的其他投资者和天使投资人参与。 我们是一支不断壮大的研究者和构建者团队,从第一天起就在巴黎、纽约、蒙特利尔和新加坡运营。 阅读更多:https://amilabs.xyz/ AMI - Real world. Real intelligence.

    推荐理由:图灵奖得主LeCun创立AMI Labs,获10亿美元种子轮融资押注世界模型

  2. Saining Xie

    我与 @ylecun 和一群杰出人士联手创立 AMI Labs @amilabs。

    引用AMI Labs@amilabs

    Advanced Machine Intelligence (AMI) 正在打造新一代 AI 系统,它们能够理解世界、拥有持久记忆、可以推理和规划,并且可控且安全。 我们从相信我们以世界模型为核心的通用智能系统愿景的全球投资者那里筹集了 10.3 亿美元(约 8.9 亿欧元)的一轮融资。本轮融资由 Cathay Innovation、Greycroft、Hiro Capital、HV Capital 和 Bezos Expeditions 共同领投,并有来自世界各地的其他投资者和天使投资人参与。 我们是一支不断壮大的研究者和构建者团队,从第一天起就在巴黎、纽约、蒙特利尔和新加坡运营。 阅读更多:https://amilabs.xyz/ AMI - Real world. Real intelligence.

    推荐理由:LeCun联手谢赛宁获贝佐斯投资10亿美元押注世界模型,AGI路线之争再添变数

3月9日周一
  1. Hugging Face:Blog(RSS)71

    LeRobot v0.5.0: 扩展每一个维度

    Hugging Face 发布了 LeRobot v0.5.0 版本。该版本在数据集、模型、任务和社区四个维度上进行了全面扩展。具体包括:引入了新的现实世界和模拟数据集,推出了支持多任务学习的模型,并扩展了任务范围至移动操作和双臂协调。社区方面,提供了更易用的库、演示应用和教学资源。此次更新的核心目标是降低机器人技术的应用门槛,推动其民主化发展。

    推荐理由:开源机器人AI框架大版本更新,降低具身智能研发门槛,值得关注落地进展

3月5日周四
  1. Hugging Face:Blog(RSS)73

    将机器人AI引入嵌入式平台:数据集记录、VLA微调与设备端优化

    NXP在Hugging Face发布技术博客,详细介绍了将视觉语言动作模型应用于嵌入式机器人系统的完整流程。核心工作包括构建真实世界的机器人交互数据集,对VLA模型进行针对性微调,以及实施一系列设备端优化以实现高效部署。该方案旨在解决大型模型在资源受限的嵌入式硬件上运行的挑战,推动机器人AI在边缘端的实际应用。

    推荐理由:嵌入式AI开发者可掌握从数据集记录到设备端优化的全流程实践。