跳到正文
北京时间

具身智能

AI 走进物理世界:人形机器人、具身基础模型与真实环境操作能力的进展追踪。

最新精选

第 41–60 条 · 共 117 条
6月30日周二
  1. IT之家(RSS)79

    特斯拉Cybercab量产版在奥斯汀启动公开道路工程测试

    2026年6月30日,特斯拉在奥斯汀公共道路启动首批量产版Cybercab工程测试。车辆无方向盘与脚踏板,配有安全监督员,马斯克发布实拍视频。从2024年10月概念车首秀到实车上路约20个月。目前不对外开放乘客,投入34台Cybercab在市中心验证硬件可靠性。Cybercab为双座车型,完全围绕无人驾驶打造,无后期改装。此前奥斯汀已有无安全员Model Y无人驾驶出租于1月启用、6月22日开放付费服务。

    推荐理由:特斯拉把无方向盘无踏板的 Cybercab 量产版开上奥斯汀公路,得州交通局批准了设计,从概念到测试仅 20 个月,进度远超预期,这是自动驾驶商业化的关键一步。

  2. 公众号:数字生命卡兹克67

    具身智能数据采集员:日薪200元起,给机器人当老师

    具身智能数据采集员以日薪200-250元招兼职,无需学历经验。面试先测量身高体重以适配采集手套,并询问是否晕VR。工作分两种:遥操作采集——穿戴设备控制双臂机器人完成分拣积木、叠纸杯等动作;无机器人示教采集——徒手重复动作(如叠衣服),设备记录轨迹。全球高质量物理交互数据截至2026年初仅约50万小时,不足大语言模型训练数据的两万分之一,需大量人力从零采集。

    推荐理由:具身智能的数据采集正在催生一种日结兼职,这篇文章把镜头对准了那些教会机器人叠纸杯的普通人,给我一种强烈的割裂感——最前沿的技术和最传统的用工方式在这里合体了。

  3. Ars Technica:AI(RSS)75

    韩国将投入1万亿美元扩大存储芯片生产和发展人形机器人

    韩国政府与三星、SK海力士等承诺1万亿美元实施三大旗舰项目。三星和SK海力士投资5850亿美元新建芯片工厂,目标五年内将DRAM产量翻倍;SK集团、GS集团和Naver投资3570亿美元在偏远省份建设AI数据中心;物理AI被指定为国家战略产业,现代汽车投资58亿美元建设机器人工厂和AI数据中心,计划到2028年每年生产3万台Atlas人形机器人,并在10大行业实现商业化。但现代汽车工会已批准罢工谈判,要求利润分享和岗位保护。

    推荐理由:韩国砸 1 万亿美元砸向内存芯片和机器人,不只是产能竞赛,更是试图锁住 AI 硬件供应链的关键位置。但工会抗议和芯片暴利税收争议也浮现,值得追踪。

6月26日周五
  1. IT之家(RSS)70

    小鹏 CEO 何小鹏:2026 年底自动驾驶可以合法进入全球

    小鹏汽车 CEO 何小鹏微博透露,VLA 2.0 走向全球进入确定模式。联合国 WP29 缔约国会议批准了 DCAS UNR 171 series 02(对应城区 NGP 法规)与 UNR ADS(对应 L3-L5 自动驾驶法规)。DCAS 将在六个月后成为欧盟强制法规,即 2026 年底自动驾驶可合法进入全球;UNR ADS 为框架性法规,加速 L4 级 Robotaxi 落地。何小鹏称 2027 年海外小鹏汽车将搭载 VLA 和 VLM,支持中英文混合语音对话。

    推荐理由:联合国层面批准自动驾驶核心法规,L3以上合法上路进入倒计时,这对小鹏等中国车企出海是实质利好,自动驾驶全球化终于有了法律基础。

  2. TechCrunch:AI(RSS)71

    General Intuition 完成 3.2 亿美元融资,用游戏数据训练通用 AI 智能体

    General Intuition 以 23 亿美元估值完成 3.2 亿美元融资,累计披露融资 4.54 亿美元。公司从旗下游戏剪辑平台 Medal 获取数亿小时含精确按键动作标签的游戏操作数据,训练单一模型同时驾驭 Fortnite 等虚拟环境和四足机器人。演示中,AI 智能体在游戏中连续运行 100 小时,机器人仅靠 8 分钟真实街道数据微调即可自主探索办公室。本轮由 Khosla Ventures 领投,General Catalyst、Jeff Bezos、Eric Schmidt 等参投。资金将用于通过 CoreWeave 扩大计算规模、预训练下一代模型,计划夏末前开放 API。

    推荐理由:用游戏按键数据训练世界模型,并在真机上八分钟完成适配,这个思路让具身智能看到了一条可规模化的路径。投资人押注的其实是 Medial 独有的动作标注数据飞轮。

6月23日周二
  1. IT之家(RSS)85

    开辟新赛道:小米 YU7 GT 创全球首个纽北自动驾驶圈速纪录,官方圈速榜新增“自动驾驶”分类

    小米 YU7 GT(选配赛道专业套装)在纽博格林北环赛道以自动驾驶系统完成全程无人计时圈,成绩 10 分 29 秒 483,成为全球首个纽北自动驾驶圈速纪录。纽北官方圈速榜因此新增“自动驾驶”分类。小米汽车表示,在极限赛道中锤炼的动态模型、高频扭矩分配和毫秒级救车能力,将逐步下放至量产车,以提升用户在暴雨、冰雪等极端工况下的底盘与智驾安全。

    推荐理由:小米YU7 GT用自动驾驶跑完纽北,还让官方新增了分类,这不是刷一个圈速,而是自动驾驶在极限场景里的一次实弹演习。央视背书,从追赶到开创,这句话分量很重。

6月20日周六
  1. MarkTechPost(RSS)77

    NVIDIA Research 发布 SpatialClaw:免训练空间推理框架

    NVIDIA Research 发布 SpatialClaw,一个免训练的空间推理框架。它通过将代码作为动作接口,让智能体调用感知工具(Depth Anything 3、SAM 3)并自由组合输出,解决视觉语言模型在 3D 空间判断上的弱点。在 20 项基准测试中平均准确率达 59.9%,比近期智能体 SpaceTools 高 11.2 个百分点,比无工具基线高 6.5 点,比结构化工具调用高 3.2 点。框架无需重新训练,同一提示词和工具集可跨所有基准和骨干网络运行,支持 Qwen3.5/3.6 及 Gemma4 等 26B 至 397B 参数的模型。

    推荐理由:NVIDIA 把空间推理的动作接口从工具调用换成代码,这个思路很巧,20 个基准平均拉升到 59.9%,无训练即插即用,做机器人和视频理解的人该直接跑一下 repo。

6月19日周五
  1. HuggingFace Daily Papers(社区热门论文)75

    HumanScale:自我中心人类视频在具身预训练中可超越真实机器人数据

    HumanScale项目比较了自我中心人类视频与遥操作真实机器人轨迹作为具身基础模型预训练数据源。经精心设计的过滤与标注流程后,基于自我中心数据预训练的模型在真实机器人动作预测上验证损失降低24%,分布内任务成功率高52.5%,分布外任务成功率高90%。研究验证了一种可扩展范式:先以人类视频预训练学习多样世界表征,再以少量标注机器人数据微调对齐动作空间。

    推荐理由:让机器人看人类干活视频,预训练效果居然比直接用真实机器人数据更好,这个反直觉发现可能彻底改变具身智能的数据策略,做机器人的值得认真读一读。

  2. Anthropic:Research(发表成果 · 网页)77

    Anthropic Project Fetch 第二阶段:Claude Opus 4.7 自主完成任务,速度比人类团队快约20倍

    Anthropic 发布 Project Fetch 实验第二阶段结果。在2024年8月原始实验中,配备 Claude Opus 4.1 的人类团队在操控四足机器人时显著超越无 AI 团队。新实验中,Claude Opus 4.7 无需人类协助即完成所有任务,速度比最快人类团队快约20倍,比无 Claude 团队快37倍以上,编码量减少近10倍。模型在传感器连接、路径规划等环节表现出色,但在精确移动沙滩球等闭环控制任务上仍存在困难。这些进展源于通用模型规模化,而非针对机器人领域的专项优化。

    推荐理由:Anthropic 用 Claude Opus 4.7 自主操作机器狗,比当初的人类志愿者快 18-37 倍,代码量却少了十倍。这让「语言模型上手物理工具」从假想变成了可视的进度条,做具身智能和 agent 的人都该看一眼。

6月18日周四
  1. IT之家(RSS)76

    我国首部L3/L4自动驾驶强制性国标公示:2027年7月起实施

    工信部6月16日就《智能网联汽车自动驾驶系统安全要求》等2项强制性国标公开征求意见,公示至6月24日,建议2027年7月1日起实施。该标准系我国首部针对L3/L4的强制性国标,要求系统安全水平至少达到“合格且专注驾驶人”,引入Safety Case机制。L3重点规范人机交接,L4强调自身风险处置、不得依赖远程协助。新申请车型实施日起执行,已获批车型有约一年过渡期。

    推荐理由:首部 L3/L4 强制国标公示,意味着自动驾驶从推荐性标准升级为强制性安全底线,车企靠模糊宣传抢市场的阶段正式结束,行业竞争逻辑从此由功能展示转向安全实证。

  2. IT之家(RSS)82

    八部门:用好个人消费贷款财政贴息政策,支持消费者购买 AI 相关产品

    商务部等八部门6月18日发布关于加快“人工智能+消费”发展的实施意见。其中提到加大财政资金支持,落实数码和智能产品购新政策,鼓励地方在消费品以旧换新框架内自主制定补贴,重点支持新一代智能终端消费。增加AI手机、智能电脑、智能电视、智能家居、AI眼镜、智能网联汽车、人形机器人等产品供给,培育智能穿戴消费市场。同时加快AI在居家服务、养老服务、文化旅游、住宿餐饮、教育教学等领域的应用,建设AI商品首发平台,举办“人工智能进万家”活动。

    推荐理由:八部门联合推AI消费补贴,从手机、机器人到养老教育全覆盖,这是国家层面推动AI产品普及的强烈信号,终端厂商和消费者都将迎来实质利好。

  3. Jim Fan81

    NVIDIA GEAR实验室推出ENPIRE系统,首次实现物理世界自主研究。系统让8个Codex智能体控制8台机器人,配备GPU和token预算。安全方面采用硬运动极限切断和扭矩受限夹爪两层硬件保障,支持通宵无人运行。奖励函数通过视觉分类器离线固定并冻结,防止智能体作弊。实时监测机器人利用率(MRU)、token利用率(MTU)和GPU利用率,以Tokens-to-Success和Time-to-Success评估效率。ENPIRE自主完成扎带、整理细针、安装GPU等高精度任务,发现8机器人并行探索显著更快。系统将开源。

    引用Jim Fan@DrJimFan

    今天,我们首次在物理世界中实现了 AutoResearch!隆重推出 ENPIRE:我们为 8 个 Codex 智能体配备了一支机器人舰队、一批 GPU 以及充足的模型 token 预算。我们让它们自由行动,目标只有一个:尽可能快地完成任务,让机器人保持忙碌但确保安全,不浪费宝贵的算力。这一点毋庸置疑。 随后人类退居幕后,我们的观察开始了。机器人舰队开始苏醒:它们学会寻找视觉线索、重置场景、练习新技能、调整控制栈、在线阅读论文、进行辩论、反思、陷入困境,然后直接在硬件上重新尝试。我们所做的只是为 Codex 提供了一个通往原子世界的 API,剩下的便是涌现。 ENPIRE 能够自主完成高精度任务,例如绑扎带、整理精细的插针以及安装 GPU。我们还发现了一种新型的“物理规模扩展”:8 个机器人并行探索的效率显著高于数量更少的机器人。 我们 NVIDIA GEAR 实验室的一部分现在可以彻夜不休地自我改进。我们只需在早上阅读报告即可。 /目标:我们都去度假,而 Jensen 甚至不会察觉 ;) 我们将开源所有内容,这样你也可以在家中托管一个自主运行的机器人实验室!详情请见下方帖子:

    推荐理由:Jim Fan团队让8个机器人在真实世界自主研究,从安装GPU到发现物理扩展定律,这是具身智能第一次真正脱离人类监督探索物理任务,比任何虚拟环境的Agent实验都更接近AGI的物理锚点,做机器人的必须关注。

6月17日周三
  1. Hugging Face:Blog(RSS)69

    MolmoMotion:语言引导的3D运动预测模型

    MolmoMotion基于Molmo 2骨干网络,输入视频帧、物体上的3D点标记及文字动作指令(如“移动并旋转桌上放水果的木碗”),预测未来数秒内这些点的3D轨迹。提供两个变体:自回归的MolmoMotion-AR逐步预测坐标,流匹配的MolmoMotion-FM通过连续空间变换处理多可能性运动。同时发布MolmoMotion-1M数据集(含116万视频的3D点轨迹及动作描述)和PointMotionBench基准测试(2700个人工验证视频片段)。模型权重、数据集和基准测试均已开源。

    推荐理由:MolmoMotion把3D运动预测从模板化推到任意物体,百万级数据集和基准让研究门槛大降,做机器人和视频生成的值得认真看,但目前仍是研究阶段,离落地还有距离。

  2. Hugging Face:Blog(RSS)66

    Strands Robots SDK:用单一智能体打通 Hugging Face Hub 到物理机器人

    AWS(Apache 2.0)开源的 Strands Robots SDK 将 LeRobot 栈封装为 AgentTools,构建统一智能体。默认用 MuJoCo 模拟(无需硬件),mode="real" 切换至真实机器人。可记录演示数据为 LeRobotDataset 并推送 Hugging Face Hub,运行 GR00T 或 LerobotLocal 策略推理,经 Zenoh mesh 广播命令到多台机器人。模拟与硬件代码完全一致,只需改一个关键字参数。示例可在笔记本(Python 3.12+,Linux/macOS)无硬件、无 GPU 运行。

    推荐理由:AWS 的 Strands Robots 把 LeRobot 仿真和硬件部署装进同一个 Agent 里,代码几乎不变就能从模拟切到物理机器人,对具身智能开发者是省掉胶水代码的实用工具。

6月16日周二
  1. 公众号:通义实验室(千问)75

    Qwen-Robot 发布:通义实验室用三模型打通大模型到物理世界

    通义实验室发布 Qwen-Robot 套件,以 Qwen-RobotNav、Qwen-RobotManip、Qwen-RobotWorld 三个模型分别覆盖导航、操作与世界预测,统一采用语言优先接口。

    推荐理由:将视觉语言模型与物理行动对齐,统一跨本体表示和数据协同,为具身智能规模化提供了一种可行路径。

  2. Qwen:Blog Retrieval(API)72

    Qwen-RobotManip:对齐解锁机器人操作基础模型的规模化能力

    Qwen-RobotManip 是通义千问基于 Qwen-VL 的视觉-语言-动作(VLA)基础模型,引入覆盖表示、运动和行为三维度的统一对齐框架。仅使用开源机器人数据集和人演示视频,构建约 38,100 小时预训练语料,涵盖 15 种机器人形态。在 LIBERO-Plus 达 91.4%,RoboTwin-C2R Hard 达 69.4%,RoboCasa365 Composite-Unseen 达 14.9%,EBench 达 45.6%,RoboTwin-IF 达 72.0%,并在 RoboChallenge Table30 v1 generalist track 夺冠。模型采用 80 维状态-动作表示、人-机器人数据合成管道(1,933 小时第一人称视频转 24,808 小时数据)及上下文策略适配。

    推荐理由:Qwen 这次发布的机器人模型,用统一对齐框架把跨实体数据规模化训练跑通了,OOD 泛化大幅领先,做具身智能的值得认真看一下。

  3. Qwen:Blog Retrieval(API)72

    Qwen-RobotWorld:具身智能体的无界世界

    Qwen-RobotWorld以语言为统一动作接口,采用双流Multimodal Diffusion Transformer(MMDiT)架构,将Qwen2.5-VL作为动作编码器。在4个基准测试中取得顶尖成绩,统一20余种机器人形态,基于860万跨场景训练对和1300多项操作技能。语言接口标准化500多种动作类别,支持操作、自动驾驶、室内导航的联合训练。还支持Scene2Robot人类到机器人转移及2–4路多视角几何一致视频生成。

    推荐理由:具身智能的世界模型长期受限于单一形态,Qwen-RobotWorld用语言统一动作接口,把操作、驾驶、导航合训,多视角几何一致性和人类演示迁移是过去一年最扎实的落地信号,做机器人的别错过。

  4. Qwen:Blog Retrieval(API)73

    Qwen-Robot Suite:面向物理世界智能的基础模型套件

    Qwen 发布三款基础模型——Qwen-RobotNav、Qwen-RobotManip 和 Qwen-RobotWorld。Nav 通过可控观测协议统一指令跟随、点/物体目标导航、目标追踪和自动驾驶五类任务,在 VLN-CE RxR 上达 76.5% SR,HM3Dv2 物体目标导航(仅 RGB)75.6% SR,EVT-Bench 追踪率 90.0%,NAVSIM 91.4 PDMS。Manip 利用规范状态-动作空间对超 38,100 小时异构开源机器人数据进行跨本体训练。World 通过自然语言动作接口协同训练 20 余种本体,预测操控、驾驶和导航的物理未来。三者共同将通用智能转化为物理行动。

    推荐理由:Qwen把导航、操作和世界模型打包成机器人基础套件,用统一语言接口串起来,这是具身智能从单点突破走向系统化的信号,虽然离真实世界还有距离,但方向很清晰。

6月15日周一
  1. The Verge:AI(RSS)70

    Skydio CEO Adam Bry:硅谷不应为无人机使用画红线

    Skydio是美国最大的无人机制造商,主攻公共安全、军事、能源、基建巡检等企业市场。CEO Adam Bry表示,特朗普政府去年底禁止中国产无人机后,廉价消费级无人机几乎消失,Skydio产品成为主要替代方案。公司认为无人机正从工具转向自主基础设施——通过机库、远程操控和软件整合实现规模化应用,AI在其中扮演关键角色。访谈还涉及Skydio与军方合作的态度,以及自主技术如何带动公司扩张。

    推荐理由:Adam Bry 的立场很鲜明,硅谷不该替前线士兵做决定。这是军工 AI 伦理争议中的一个不避讳声音,做相关产品的人值得听。