跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-06-09精选AI 评分78

Embodied-R1.5:通过具身基础模型演化物理智能

Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models

AI 导读

Embodied-R1.5是一个统一具身基础模型,将具身认知、任务规划、纠错与指向能力整合在单一架构中。基于三条自动化数据构建流水线,团队搭建超过150亿模型token的数据系统,并设计多任务平衡强化学习方案以缓解异构任务冲突。其Planner-Grounder-Corrector闭环框架使模型能在长周期任务中自主执行并自我纠正。仅8B参数的Embodied-R1.5在24个具身VLM基准中的16个上达到SOTA,超越Gemini-Robotics-ER-1.5与GPT-5.4,并可微调为VLA,在4个操作任务基准上领先π_{0.5}等模型。零样本真实机器人实验验证了其指令遵循、可操作物体判别、铰接物体操控与长周期复杂任务中的泛化能力。模型权重、数据集、训练代码及评估框架EmbodiedEvalKit已开源。

推荐理由

仅8B参数就在24项具身视觉语言基准上赢过GPT-5.4和Gemini-Robotics,还把模型权重、训练代码全开源了,做具身智能的团队不跟进就是犯罪。

正文 · AI 翻译

我们提出 Embodied-R1.5,这是一种统一的具身基础模型(EFM),它将涵盖具身认知、任务规划、纠错与指代等全面的具身推理能力,集成在单一架构中,以迈向通用物理智能。通过利用三条自动化数据构建流水线,大幅扩展关键能力的数据覆盖范围,我们构建了一个超过 150 亿 token 的大规模数据系统,并设计了一种多任务平衡的强化学习方案,以缓解异构任务间的冲突。我们进一步引入了一种规划器-落地器-纠错器(PGC)闭环框架,使单一模型能够自主执行并在长周期任务中自我纠错。仅凭 80 亿参数,Embodied-R1.5 在 24 个具身视觉语言模型基准测试中的 16 项上达到了最先进水平,超越了 Gemini-Robotics-ER-1.5 和 GPT-5.4 等领先模型。得益于内化的具身能力,Embodied-R1.5 只需少量数据即可微调为视觉-语言-动作模型(VLA),在 4 个主流操作基准测试套件上超越了 $π_{0.5}$ 等领先的 VLA 模型。我们还进行了广泛的零样本真实机器人实验,验证了其在指令跟随、可供性落地、铰接物体操作以及长周期复杂任务中的性能,展现了对物理世界的强大泛化能力。我们开源了模型权重、数据集、训练代码以及 EmbodiedEvalKit(一个专为具身任务定制的评估框架),以促进未来对 EFM 的研究。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org