LeRobot v0.4.0 发布:升级数据集 v3.0 并集成 PI0.5 与 GR00T N1.5
LeRobot v0.4.0: Supercharging OSS Robot Learning
Hugging Face 发布 LeRobot v0.4.0,带来 LeRobotDataset v3.0(分块 episode 格式,支持 OXE 级 >400GB 数据集)、数据集编辑 CLI、LIBERO 与 Meta-World 仿真支持、基于 Accelerate 的多 GPU 训练,以及新插件系统简化第三方硬件接入。
官方发布全文列出 LeRobot v0.4.0 的数据集、VLA 模型、仿真基准与硬件插件等更新,读者可按需挑用对应能力。
我们非常激动地宣布 LeRobot 迎来了一系列重大进展,旨在让开源机器人学习比以往更强大、更具可扩展性且更易于使用!从焕然一新的数据集到多功能的编辑工具、新的仿真环境,以及开创性的硬件插件系统,LeRobot 正在持续演进,以满足前沿具身 AI 的需求。
简要概述
LeRobot v0.4.0 为开源机器人领域带来了重大升级,引入了可扩展的 Datasets v3.0、强大的新 VLA 模型如 PI0.5 和 GR00T N1.5,以及更易于硬件集成的新插件系统。此版本还增加了对 LIBERO 和 Meta-World 仿真的支持、简化的多 GPU 训练,以及新的 Hugging Face 机器人学习课程。
目录
- LeRobot v0.4.0: Supercharging OSS Robot Learning
- 简要概述
- 目录
- Datasets: Ready for the Next Wave of Large-Scale Robot Learning
- Simulation Environments: Expanding Your Training Grounds
- Codebase: Powerful Tools For Everyone
- Policies: Unleashing Open-World Generalization
- Robots: A New Era of Hardware Integration with the Plugin System
- The Hugging Face Robot Learning Course
- 团队的最后思考
数据集:为下一波大规模机器人学习做好准备
我们通过 LeRobotDataset v3.0 彻底改造了数据集基础设施,采用了新的分块回合格式和流式传输能力。这对于处理像 OXE(Open X Embodiment)和 Droid 这样的大规模数据集而言是颠覆性的,带来了无与伦比的效率和可扩展性。
Datasets v3.0 有哪些新内容?
- 面向大规模规模的分块回合:我们的新格式支持 OXE 级别(> 400GB)的数据集,实现了前所未有的可扩展性。
- 高效的视频存储 + 流式传输:享受更快的加载时间和无缝的视频数据流式传输。
- 统一的 Parquet 元数据:告别分散的 JSON 文件!所有回合元数据现在都存储在统一、结构化的 Parquet 文件中,便于管理和访问。
- 更快的加载与更佳的性能:体验显著缩短的数据集初始化时间和更高效的内存使用。
我们还提供了一个转换脚本,可轻松将您现有的 v2.1 数据集迁移到新的 v3.0 格式,确保平稳过渡。更多详情请阅读我们之前的博客文章。开源机器人技术不断升级!
新功能:数据集编辑工具!
使用 LeRobot 数据集现在变得简单多了!我们引入了一套强大的实用工具,用于灵活地编辑数据集。
借助我们新的 lerobot-edit-dataset CLI,您现在可以:
- 从现有数据集中删除特定的回合。
- 按比例或回合索引拆分数据集。
- 轻松添加或移除特征。
- 将多个数据集合并为一个统一的集合。
# Merge multiple datasets into a single dataset.
lerobot-edit-dataset \
--repo_id lerobot/pusht_merged \
--operation.type merge \
--operation.repo_ids "['lerobot/pusht_train', 'lerobot/pusht_val']"
# Delete episodes and save to a new dataset (preserves original dataset)
lerobot-edit-dataset \
--repo_id lerobot/pusht \
--new_repo_id lerobot/pusht_after_deletion \
--operation.type delete_episodes \
--operation.episode_indices "[0, 2, 5]"
这些工具简化了您的工作流程,让您能够以前所未有的方式整理和优化机器人数据集。查看文档了解更多详情!
仿真环境:扩展您的训练场地
我们正在不断扩展 LeRobot 的仿真能力,为您的机器人策略提供更丰富、更多样化的训练环境。
LIBERO 支持
LeRobot 现已正式支持 LIBERO,这是 Vision-Language-Action(VLA)策略最大的开放基准之一,拥有超过 130 个任务!这是朝着构建 VLA 首选评估中心迈出的巨大一步,能够轻松集成并统一评估任何 VLA 策略。
查看 LIBERO 数据集和我们的文档以开始使用!
Meta-World 集成
我们已集成 Meta-World,这是一个用于测试机器人操作中多任务和泛化能力的顶级基准,包含超过 50 个多样化的操作任务。此次集成,加上我们对 gymnasium ≥ 1.0.0 和 mujoco ≥ 3.0.0 的标准化使用,确保了确定性种子和稳健的仿真基础。
立即使用 Meta-World 数据集训练你的策略!
代码库:为所有人提供的强大工具
我们正在让机器人控制更加灵活和易于使用,为数据收集和模型训练开辟新的可能性。
新的数据处理流水线
将数据从机器人传输到模型(再传回来!)并非易事。原始传感器数据、关节位置和语言指令与 AI 模型的期望并不匹配。模型需要在正确设备上的归一化、批处理张量,而你的机器人硬件则需要特定的动作命令。
我们很高兴推出 Processors:一个全新的模块化流水线,充当数据的通用翻译器。可以把它想象成一条装配线,每个 ProcessorStep 负责一项特定工作——比如归一化、文本分词或将数据移动到 GPU。
你可以将这些步骤串联成一个强大的流水线,完美管理你的数据流。我们甚至创建了两种不同的类型来让事情更简单:
PolicyProcessorPipeline:为模型构建。它专业地处理批处理张量,以实现高性能训练和推理。RobotProcessorPipeline:为硬件构建。它处理单个数据点(如单个观察或动作),用于实时机器人控制。
# Get environment state
obs = robot.get_observation()
# Rename, Batch, Normalize, Tokenize, Move Device ...
obs_processed = preprocess(obs)
# Run inference
action = model.select_action(obs_processed)
# Unnormalize, Move Device ...
action_processed = postprocess(action)
# Execute action
robot.send_action(action_processed)
该系统可以轻松地将任何策略连接到任何机器人,确保你的数据在每一步都始终以完美的格式呈现。在我们的Processors 介绍文档中了解更多信息。
多 GPU 训练变得简单
训练大型机器人策略的速度大大提升!我们已将 Accelerate 直接集成到我们的训练流水线中,只需一条命令即可轻松将实验扩展到多个 GPU:
accelerate launch \
--multi_gpu \
--num_processes=$NUM_GPUs \
$(which lerobot-train) \
--dataset.repo_id=${HF_USER}/my_dataset \
--policy.repo_id=${HF_USER}/my_trained_policy \
--policy.type=$POLICY_TYPE \
# ... More training configuration flags
无论你是在微调策略还是运行大规模实验,LeRobot 现在都会为你处理分布式训练的所有复杂性。这意味着你可以大幅减少训练时间,使用 2 个 GPU 时减半,使用 3 个 GPU 时降至三分之一,甚至更多。
查看文档以加速你的机器人学习!
策略:释放开放世界泛化能力
PI0 和 PI0.5
作为开源机器人领域的一个重要里程碑,我们已将 Physical Intelligence 的 pi0 和 pi0.5 策略集成到 LeRobot 中!这些 Vision-Language-Action(VLA)模型代表着在解决机器人开放世界泛化方面迈出的重要一步。但 π₀.₅ 为何具有革命性?
- 开放世界泛化:旨在适应全新的环境和情况,在物理、语义和环境层面进行泛化。
- 异构数据协同训练:从多模态网络数据、语言指令、子任务命令和多环境机器人数据的多样化混合中学习。
- Physical Intelligence 合作:非常感谢 Physical Intelligence 团队 的开创性工作!
你可以在 Hugging Face Hub 上找到这些模型:pi0.5_base、pi0_base,以及它们经过 Libero 调优的对应版本。更多详情,请查看 Physical Intelligence Reasearch
GR00T N1.5
在另一项令人兴奋的进展中,得益于与 NVIDIA 机器人团队的出色合作,我们已将 NVIDIA 的 GR00T N1.5 集成到 LeRobot 中!这个开放基础模型是通用机器人推理与技能的强大引擎。作为一个跨具身模型,它接收多模态输入(如语言和图像),以在不同环境中执行复杂的操作任务,标志着通用机器人技术的又一次重大飞跃。但是什么让 GR00T N1.5 成为颠覆者?
- 通用推理与技能:作为一个跨具身基础模型,GR00T N1.5 擅长通用推理和操作任务,并具备更强的语言跟随能力。
- 大规模异构训练:它从海量数据集中学习,这些数据结合了真实采集的人形机器人数据、由 NVIDIA Isaac GR00T Blueprint 生成的合成数据,以及互联网规模的视频数据。
- NVIDIA 合作:我们非常高兴能与 NVIDIA 团队 合作,将这一最先进的模型带给开源 LeRobot 社区!
你可以在 Hugging Face Hub 上找到该模型:GR00T-N1.5-3B。更多详情,请查看 NVIDIA 研究页面 和 官方 GitHub 仓库。
这些策略在 lerobot 中的原生集成是向前迈出的一大步,使机器人学习尽可能开放和可复现。今天就试用它们,分享你的运行结果,让我们一起推动具身 AI 的前沿!
机器人:借助插件系统开启硬件集成新时代
硬件爱好者的重大消息!我们推出了全新的插件系统,彻底改变你将第三方硬件与 LeRobot 集成的方式。现在,连接任何机器人、摄像头或遥操作设备都只需一个 pip install,无需修改核心库。
主要优势
- 可扩展性:在独立的 Python 包中开发和集成自定义硬件。
- 可伸缩性:支持不断增长的设备生态系统,而不会使核心库变得臃肿。
- 社区友好:降低了社区贡献的门槛,营造更协作的环境。
在我们的文档中了解如何创建你自己的插件。
pip install lerobot_teleoperator_my_awesome_teleop
lerobot-teleoperate --teleop.type=my_awesome_teleop
Reachy 2 集成
得益于我们新的插件系统,我们还将 Pollen Robotics 的 Reachy 2 添加到了 LeRobot 中!Reachy 2 可用于真实机器人控制和仿真,让你能够立即体验遥操作和自主演示。
手机集成
得益于我们强大的新流水线系统,你现在可以直接从手机(iOS/Android)遥操作你的从动臂。手机充当遥操作设备,我们的 RobotProcessor 流水线处理所有变换,让你能够轻松地在不同的动作空间(如末端执行器空间)中驱动机器人。查看示例!
Hugging Face 机器人学习课程
我们正在推出一门全面、自定进度且完全开源的课程,旨在让每个人都能轻松学习机器人学习!如果你对现实世界中的机器人如何学习感到好奇,这里就是完美的起点。
在本课程中,你将学习如何:
- 理解经典机器人学的基础知识。
- 使用生成模型进行模仿学习(VAE、扩散模型等)。
- 将强化学习应用于现实世界中的机器人。
- 探索最新的通用机器人策略,如 PI0 和 SmolVLA。
加入 Hugging Face 机器人组织,跟随学习并开启你的旅程!
深入探索:现代机器人学习教程
对于那些想要更深入学习的人,我们还发布了一份关于机器人学最新进展的实践教程。本指南提供了自包含的讲解,从第一性原理重新推导现代技术,并包含使用 LeRobot 和 Hugging Face 的即用代码示例。
教程本身托管在一个 Space 中,其中包含使用 LeRobot 的实用示例,所有模型和数据集都在 Hugging Hub 上。你也可以查看我们的论文以获取详细概述。
团队寄语
除了这些主要功能之外,本次发布还包含大量错误修复、文档改进、依赖项更新、更多示例以及更好的基础设施,让你使用 LeRobot 的体验更顺畅、更可靠。
我们要向社区中的每一位成员致以最诚挚的感谢,感谢你们宝贵的贡献、反馈和支持。我们对开源机器人学的未来感到无比兴奋,并期待与你们一起共创未来!
敬请期待更多内容 🤗 从这里开始吧! – LeRobot 团队 ❤️
来源:Hugging Face:Blog · huggingface.co

