RLDX-1技术报告
RLDX-1 Technical Report
为提升视觉-语言-动作模型在复杂现实任务中的功能覆盖,研究团队推出通用机器人策略RLDX-1。该模型基于多流动作变换器架构,整合运动感知、记忆决策与物理传感等异构模态,并辅以合成罕见场景数据、仿人操作学习流程及实时推理优化等系统设计。在仿真与真实测试中,RLDX-1全面超越前沿模型π_{0.5}和GR00T N1.6,尤其在ALLEX人形机器人任务上取得86.8%的成功率,显著高于对照模型的约40%,标志着其在接触密集型动态灵巧操作领域取得关键进展。
在 ALLEX 人形任务上把成功率从 40% 拉到 86.8%,RLDX-1 证明了多模态流架构对灵巧操作的价值,做机器人的同学可以重点关注一下。
金东永
张辉元
具明圭
张秀赫
金泰永
金范俊
尹炳俊
张昌成
崔大元
韩东洙
李东旭
权熙胜
全浩镇
姜在贤
裴在庆
李智赫
李智敏
约翰·元
安俊宇
朴俊亨
成俊永
李京民
韩民成
尹敏成
朱世俊
孙善一
朴承哲
赵承根
文承俊
金承九
董容勋
赵容镇
金永灿
申镇宇
RLWRLD
韩国科学技术院
项目负责人
研究负责人
摘要
尽管视觉-语言-动作模型(VLA)凭借从预训练视觉-语言模型继承而来的通用智能(即广泛的场景理解能力和基于语言条件的泛化能力),在实现类人通用机器人策略方面取得了显著进展,但它们仍然难以应对需要更广泛功能能力(如运动感知、长期记忆和物理感知)的复杂现实世界任务。为解决这一问题,我们推出了RLDX-1,这是一种面向灵巧操作的通用机器人策略,基于多流动作Transformer架构(MSAT)构建。该架构通过模态特定流与跨模态联合自注意力机制,将异构模态统一起来,从而整合了上述各项能力。RLDX-1进一步将该架构与系统级设计选择相结合,包括针对罕见操作场景的数据合成、专为类人操作设计的学习流程,以及面向实时部署的推理优化。通过实证评估,我们证明RLDX-1在模拟基准测试和需要超越通用性的广泛功能能力的现实世界任务中,均持续优于近期前沿的VLA模型(例如GR00T N1.6)。特别是在ALLEX人形机器人任务中,RLDX-1展现出卓越性能,成功率达到86.8%,而GR00T N1.6的成功率约为40%,这突显了RLDX-1在多样化功能需求下控制高自由度人形机器人的能力。综合来看,这些结果使RLDX-1成为迈向可靠VLA模型、以应对复杂、高接触且动态的现实世界灵巧操作任务的有希望的一步。
目录
1. 引言
学习能够在真实世界环境中实现类人灵巧操作的通用机器人策略,仍然是机器人领域的核心目标。现有工作主要聚焦于通用智能,广义上定义为理解多样化视觉场景和语言指令、跨任务与环境泛化、以及对意外干扰保持鲁棒性的能力。视觉-语言-动作模型(VLA)是实现这一方法的代表性框架(zitkovich2023rt; kim2024openvla; black2024pi_0; bjorck2025gr00t; team2025gemini; pertsch2025fast),因为它们基于具有强大世界理解和常识推理能力的视觉-语言模型(VLM;beyer2024paligemma; chen2025eagle; yang2025qwen3)构建机器人策略。然而,对于许多真实世界的操作任务而言,仅靠通用性是不够的,这些任务反而需要更广泛的功能能力(见图 1)。例如,在动态环境(如移动传送带上的操作)中,现有的 VLA 难以做出恰当的动作,因为静态的视觉观测无法捕捉物体的轨迹或时间动态。类似的局限性不仅存在于动态环境,还扩展到那些需要物理感知来推断遮挡或细微视觉变化下的接触力、以及需要基于先前交互进行决策的记忆的任务。这些观察表明,类人灵巧操作不仅需要通用智能,还需要明确的运动感知、长期记忆和物理感知能力。
为应对这些挑战,RLDX-1 整合了四个关键组件:一个统一神经架构,集成了多种功能能力;一个合成数据生成流水线,通过运动一致性过滤来增强稀有的操作场景;一个三阶段训练流程,将互联网规模的预训练先验知识与具身化部署相衔接;以及一个推理优化流水线,通过静态图转换和算子融合实现实时控制。这些组件共同使 RLDX-1 能够超越通用智能,在真实世界环境中实现类人灵巧操作。
神经架构
真实世界的灵巧操作需要多种功能能力,而不仅仅是预训练 VLM 所提供的通用智能。我们专注于三种此类能力,包括运动感知、长期记忆和物理感知,并针对每种能力,在标准流匹配 VLA 架构(black2024pi_0; bjorck2025gr00t)之上构建了专门的架构模块:
- •
运动感知。为了在动态环境中运行,RLDX-1 使用集成了运动学习模块的视觉编码器处理视频,以有效捕捉时间动态(kim2026exploring)。我们进一步将过去的视频帧压缩为 VLM 中间层内的单个 token,使模型能够高效地从先前的观测中捕捉时间上下文(jang2025contextvla)。
- •
长期记忆。为了捕捉超出短期多帧观测范围的长期历史信息,我们采用了一个显式记忆模块用于长期时间推理(koo2025hamlet),该模块维护一个过去观测特征的队列,并将其与当前特征整合,为解码器生成记忆特征。
- •
物理感知。为了捕捉仅凭视觉观测无法获得的接触丰富信息(例如触觉和扭矩),我们将物理信号输入馈送到动作模块中(lee2026modular)。我们训练该模块以预测未来的物理感知信号。
为了处理这些能力所带来的多样化模态,我们提出了多流动作 Transformer(MSAT),这是将多模态扩散 Transformer(MM-DiT;esser2024scaling;black2024flux)扩展到动作建模的一种方案。MSAT 为每种模态分配一个专用流,并通过联合自注意力机制将它们耦合,使得每种模态既能保留自身的表征,又能同时为动作生成做出贡献。这些架构组件共同在那些能力起决定性作用的任务上取得了强劲性能:例如,在传送带操作中抓取快速移动的物体时,RLDX-1 的成功率超过 87.5%,而对比方法则低于 29.2%(详见第 6.3 节)。
训练数据
我们使用三种互补的数据源来训练 RLDX-1:(a)涵盖单臂、双臂和人形机器人的大规模公共机器人数据集;(b)在 ALLEX 人形机器人¹¹¹https://wi-robotics.vercel.app/allex 和配备传感器的 Franka Research 3 平台(FR3)²²²https://franka.de/franka-research-3 上收集的内部演示数据,这些数据提供了公共数据所缺失的触觉和力矩监督信息;以及(c)由视频生成模型生成的合成数据。我们的合成数据流程增强了难以规模化扩展的稀有灵巧操作场景:它通过使用现成的图像编辑模型(black2024flux)生成场景增强帧,并使用视觉语言模型(VLM)生成新的任务指令,从而增加了场景和任务的多样性。随后,它利用图像到视频模型(nvidia2025cosmospredict2;ali2025world)生成视频,可选地通过视频到视频转换来增加多样性,并使用逆动力学模型(baker2022video)为生成的轨迹标注机器人动作。为了提高生成样本的质量,我们进一步引入了视频质量过滤和运动一致性过滤(kim2026robocurate):前者关注生成视频的质量,而后者则通过在模拟器中回放预测的动作,并使用学习到的一致性分类器将回放结果与生成的视频进行比较,从而关注标注动作的质量。因此,所提出的合成数据方法,例如,在 GR-1 桌面任务上,相较于仅使用真实数据训练,成功率提升了 9.1%(详见第 6.5 节)。
训练流程
我们的训练数据围绕三种不同的模式构建,即广泛的多具身先验、特定具身的功能监督以及任务特定的部署数据,每种模式都需要不同的优化信号。相应地,我们开发了一个三阶段训练流程,将策略从通用基础模型逐步专门化为任务特定的部署模型。我们首先在涵盖单臂、双臂和人形机器人的多样化基于视觉的具身数据上预训练基础模型,为其配备跨具身共享的时间建模能力和广泛的具身动作先验。然后,我们通过结合内部演示与合成轨迹,在特定具身数据上对模型进行中期训练。这一阶段注入了公共预训练数据中缺失的功能性能力,包括运动感知、长期记忆和物理感知,并为 ALLEX 人形机器人和 FR3 生成了专门的变体。最后,我们在任务特定数据上对每个变体进行后训练,并在需要时可选地集成 RECAP 风格的强化学习,以进一步提高在具有挑战性任务上的成功率。我们的训练流程产出了一个通用的预训练模型,以及通过中期训练获得的特定具身变体。
推理策略
在实际机器人部署中,高推理延迟会导致场景在观测与动作执行之间发生变化,从而造成观测状态与动作时刻之间的不匹配。现成的推理栈在计算图层面和内核层面都存在未优化的开销。在 PyTorch Eager 模式下,RLDX-1 在 NVIDIA RTX 5090 上的单步延迟达到了 71.2 毫秒。在计算图层面,我们通过将模型转换为静态图、预计算常量张量并将整个前向传播过程捕获为单个 CUDA Graph,从而消除了启动开销。在内核层面,Torch Compile 在短预填充执行模式下未能充分利用跨算子融合。受最先进的张量优化技术的启发,我们为 RLDX-1 设计了定制内核,融合了关键的算子组并减少了不必要的内存流量。这两个阶段共同将全模态 RLDX-1 的单步延迟降低至 43.7 毫秒,实现了 1.63 倍的加速。
评估与分析
在评估方面,我们结合了多种仿真基准测试与涉及人形和单臂形态的真实世界操作任务。仿真基准测试评估广泛的视觉-语言-动作(VLA)能力,而真实世界任务则评估通用智能和功能能力。作为强基线,我们纳入了近期最先进的VLA模型,例如GR00T N1.6和。在基于仿真的评估中,我们考虑了一套广泛的基准测试,包括LIBERO和SIMPLER等传统基准测试、LIBERO-Plus等鲁棒性基准测试,以及RoboCasa Kitchen、GR-1 Tabletop和RoboCasa365等更具挑战性的评估套件。在所有基准测试中,RLDX-1均以显著优势持续优于基线模型(见表1(b))。值得注意的是,在GR-1 Tabletop上,RLDX-1达到了58.7%,优于达到47.6%的GR00T N1.6,在人形操作任务中展现出尤为强劲的性能。在真实机器人实验中,我们首先在配备Inspire Hands的OpenArm人形机器人上评估了RLDX-1的通用智能,RLDX-1持续优于主要基线模型。具体而言,在通用智能任务中,RLDX-1在未见物体(从37.5%提升至54.2%)和未见任务(从45.8%提升至54.2%)上表现大幅领先。之后,我们在ALLEX人形机器人和Franka Research 3平台(FR3)上评估了功能能力,包括需要运动感知、长期记忆和物理感知的任务,性能差距变得更加显著。例如,在需要长期记忆的ALLEX Object-in-Box Selection任务中,GR00T N1.6和的成功率均在30%左右,而RLDX-1的成功率则显著更高,达到了91.7%。这些结果表明,现有的VLA模型在需要细粒度功能能力的真实世界任务上仍然存在局限,而RLDX-1则有效应对了这些挑战。
1.1. RLDX-1 概述
RLDX-1 是一个视觉-语言-动作模型(VLA),它集成了多种功能能力,用于实际部署中的灵巧操作。RLDX-1 涵盖多种形态,包括单臂、双臂和人形机器人,支持运动感知、长期记忆以及对物理感知信号(例如触觉和力矩)的感知。具体来说,在时间步 给定多模态输入,包括语言指令 、 帧视频观测 、本体感知状态 和物理感知信号 ,RLDX-1 会生成一系列未来动作 ,即一个动作块(action chunk)(zhao2023learning; chi2023diffusionpolicy)。为了整合这些能力,RLDX-1 提供了一个统一的框架,涵盖架构、数据、训练和推理优化。我们在图 2 中提供了 RLDX-1 模型的概览,并在下方提供了框架的相应章节。
- •
在第 2 节中,我们介绍 RLDX-1 架构,该架构由一个视觉-语言模型(VLM)和一个流匹配动作模型组成。VLM 通过一个记忆模块增强,该模块将视频和语言编码为具有历史感知能力的认知特征(第 2.1 节);流匹配动作模型则将这些特征与本体感知状态和物理信号整合,以生成动作(第 2.2 节)。
- •
在第 3 节中,我们描述 RLDX-1 的训练数据,包括涵盖多种形态的公开真实世界机器人数据集(第 3.1 节),以及 ALLEX 人形机器人和传感器增强型 Franka Research 3 平台的内部数据集(第 3.2 节)。我们进一步介绍了通过我们的生成流程生成的合成机器人数据集(第 3.3 节)。
- •
在第 4 节中,我们描述了 RLDX-1 的三阶段训练流程。我们首先在一个大规模多具身数据集上对 RLDX-1 进行预训练,以学习通用操作和时间理解能力(第 4.1 节)。然后,我们在特定具身数据集上对模型进行中期训练,以增强运动感知、长期记忆和物理感知能力(第 4.2 节)。最后,我们对 RLDX-1 进行后训练以用于下游任务,并在需要时可选地结合自适应数据收集或强化学习(第 4.3 节)。
- •
在第 5 节中,我们描述了 RLDX-1 用于实时控制的推理优化流程。我们介绍了一个基于图捕获(第 5.1 节)和内核优化(第 5.2 节)的推理优化流程。
2. 神经架构
在本节中,我们描述 RLDX-1 架构,该架构旨在通过有效处理异构输入来支持多样化的功能。我们描述了这两个主要组成部分:第 2.1 节中具有时间感知能力的视觉语言模型(VLM)和第 2.2 节中的多模态动作模型。我们在图 3 中展示了该架构的概览。
2.1. 视觉语言模型
视觉语言模型(VLM)将视觉观测和语言指令编码为与动作相关的特征,用于生成动作。通过利用丰富的场景理解能力和常识推理,它为RLDX-1赋予了多功能的智能能力。为了使这些表征对机器人操作更有用,我们通过额外的机器人相关VQA训练对VLM进行了适配,并引入了认知token,以有效提取与动作相关的信息供动作解码器使用。然后,我们进一步扩展了VLM,以支持真实世界操作中的额外功能能力。具体来说,VLM处理多帧观测以更好地捕捉时间动态,并且我们引入了一个记忆模块,用于对过去的观测进行长期推理。
RLDX-1-VLM
RLDX-1 利用一个预训练的视觉-语言模型(VLM)来编码视频观测和语言指令。我们基于 Qwen3-VL 8B(bai2025qwen3)构建了 RLDX-1-VLM,这是一个强大的开源模型,具备出色的视觉感知和多模态推理能力。然而,尽管该模型在通用视觉推理上表现强劲,但在机器人操作方面往往缺乏具身基础,包括目标完成的子任务推理(chen2025training)、场景中物体之间的空间关系(yuan2025seeing; kim2025robot; jeon2026spatialboost),以及与底层控制动作的关联(kim2025contrastive; kim2026roboalign)。为解决这一问题,我们构建了一个针对机器人场景定制的视觉问答(VQA)数据集,并在此数据集上对 Qwen3-VL 8B 进行微调。具体来说,我们从机器人轨迹观测中提取 VQA 样本,这些样本涵盖了三个互补的方面:(1)机器人末端执行器与目标物体之间的空间关系,以提升空间推理能力;(2)中间子任务,以增强任务理解;(3)与当前机器人帧相关的底层动作,以更好地将 VLM 的理解与动作执行对齐。由此得到的模型被用作 RLDX-1-VLM。在动作解码方面,我们使用模型中间层的隐藏状态,而非最终的大语言模型层,因为更高层通常更专注于语言生成(bjorck2025gr00t)。
认知模型 token
为了从视觉语言模型中提取与动作相关的表征,我们引入了认知token,这是一种可学习的查询token,被附加到输入token序列中。形式上,给定时间步的视频观测和语言指令,我们首先通过视觉编码器处理视频观测以获得视频特征。然后,我们使用(即、、的拼接)作为视觉语言模型主干的输入token。与认知token对应的输出特征被保留为认知特征,而其余输出则被丢弃。这种设计使得认知token能够同时关注视觉和语言上下文,聚合与下游动作预测最相关的信息(li2024cogact; pan2025transfer)。在实践中,我们使用了64个认知token。
功能一:运动感知
在现实场景中,感知各种动态情况至关重要,包括与移动物体的交互或自我中心相机运动(kaelbling1998planning; zheng2024tracevla; torne2025learning)。为了实现这一点,我们将多帧观测整合到我们的视觉语言模型中,并引入了一个运动模块,该模块显式地对帧间的时间动态进行建模。然后,我们扩展了RLDX-1-VLM的视觉编码器和大语言模型主干,以支持基于多帧观测的时间推理。
首先,对于视觉编码器,我们通过残差连接将一个模块(kim2026exploring)集成到其中间层。该模块通过计算视频特征的时空自相似性(STSS;kwon2021learning)来显式捕捉时间动态。具体来说,令 \( f \) 表示视频观测经过视觉编码器前若干层处理后得到的视频特征。随后,该模块计算 \( f \) 中每个时空特征与其局部邻域之间的相关性,从而得到一个时空自相似性张量 \( S \)。接着,我们通过 STSS 编码器处理 \( S \) 得到运动特征 \( m \),并利用这些特征以残差方式更新视频特征,即 \( f \leftarrow f + m \)。通过集成运动特征,视觉编码器在后续层中生成具有运动感知能力的视觉表征,从而有效建模帧间的动态变化。在实际应用中,我们将该模块集成在视觉编码器的第 9 层之后(共 27 层),这一选择基于以下观察:物理相关的线索在大约 30% 深度处表征最为丰富(joseph2026interpreting)。
其次,对于大语言模型骨干网络,我们在将多帧观测压缩为紧凑表示以提高效率的同时,利用了其时序推理能力(jang2025contextvla)。具体而言,在早期层中,我们按时间顺序输入多帧观测 token,并利用大语言模型的因果结构在当前帧和认知 token 中累积时序上下文。此后,我们保留当前帧,同时通过平均池化将过去的观测压缩为单个上下文 token,从而显著降低计算复杂度。在剩余模块中,我们用平均池化后的上下文 token 替换过去观测的隐藏状态,该 token 与当前观测、语言指令和认知 token 的隐藏状态一起,通过各模块进行处理。这些改进使我们的模型能够在动态环境中高效且有效地运行。在实际应用中,我们在第 4 层之后(而非 jang2025contextvla 中的第 2 层之后)应用压缩,以便在不压缩的情况下使用 Qwen3-VL(bai2025qwen3)的 DeepStack 设计,其中多级视觉编码器特征被融合到前 4 个大语言模型层中。
功能二:长期记忆
虽然几秒内发生的事件可以通过多帧观测来处理,但序列性和长周期任务通常需要长期记忆才能成功执行动作(sridhar2025memer; koo2025hamlet; shi2025memoryvla)。当仅凭短期视觉观测不足以揭示任务状态或进度时,可能无法实现可靠执行(例如猜杯游戏)。为此,我们采用显式记忆模块来实现长期时序推理(koo2025hamlet)。
记忆模块直接插入在 RLDX-1-VLM 之后。为了高效管理历史观测数据,我们维护一个缓存,以时间步长间隔存储最近的认知特征,其中 表示动作块范围。形式上,给定当前时间步的认知特征 ,我们维护一个记忆队列,存储最近缓存的认知 token,即 。然后,我们通过将记忆队列与当前认知特征 拼接,得到特征序列 ,并通过 Transformer 处理得到记忆特征 ,即 。具体来说,我们使用因果注意力机制,使得后续时间步的认知 token 仅关注自身及更早的 token,从而保持时间顺序。我们将记忆特征和原始认知 token 都输入动作模型,从而在序列决策中实现长期上下文与当前观测的融合。实际应用中,我们使用一个轻量级 Transformer 模块和一个大小为 的记忆队列。
2.2. 动作模型
动作模型基于历史感知认知特征(及其记忆增强版本 )、本体感知状态 ,以及(在可用时)物理传感信号 ,生成未来动作块 。我们将动作模型实现为流匹配扩散 Transformer(DiT;peebles2023scalable),该模型学习动作轨迹上的去噪速度场。形式上,在训练过程中,我们采样一个去噪时间步 和噪声 ,并构建一个带噪动作块 。给定该带噪动作块和条件输入 ,我们通过神经向量场 参数化动作模型,该模型被训练用于预测将带噪样本移向干净动作块 的速度,即 ,使用以下流匹配目标函数(lipman2022flow):
| (1) |
在推理过程中,我们使用 采样 个去噪时间步,并采用欧拉方法在 个去噪步骤中生成动作块:
| (2) |
其中是随机噪声。然而,输入在语义和数据规模上都是异构的:认知特征总结了高维的视觉-语言上下文,本体感觉状态提供了低维但高保真的运动学信息,而触觉和力矩信号虽然数据稀缺,但对于接触丰富的控制至关重要。
多流动作 Transformer(MSAT)
为了处理用于动作生成的异构模态输入,我们引入了多流动作 Transformer(MSAT),这是一种架构,它通过专用流处理每种模态,同时通过联合自注意力实现跨模态交互。MSAT 将多模态扩散 Transformer(MM-DiT;esser2024scaling;black2024flux)的两阶段(先双流后单流)架构扩展到动作建模。在早期的双流块中,我们通过认知流处理认知特征,并通过动作流处理与带噪动作配对的本体感觉状态。在后续的单流块中,我们将认知流和动作流合并为单个序列进行联合处理。当物理信号可用时,MSAT 通过一个额外的物理流来增强此架构。具体来说,我们将早期的双流块扩展为覆盖认知流、动作流和物理流的三流块,并将后期的单流块扩展为覆盖合并后的认知-动作流和物理流的双流块。在每个多流块内,每个流都应用其自身的归一化和注意力输入(QKV)投影。生成的查询、键和值随后沿 token 维度拼接,并由联合自注意力处理,之后输出被拆分回各自的流,接着进行逐流的残差更新。这种可扩展的设计实现了跨模态信息交换,同时保留了模态特定的参数。遵循 bjorck2025gr00t 的做法,我们在不同具身形态之间共享 MSAT 的参数,并在 MSAT 的输入和输出端使用轻量级的具身形态特定投影层。
功能 3:物理感知
虽然基于视觉的观测对于许多操作任务来说已经足够,但对于接触密集型的任务,它们往往是不够的。这类任务经常涉及遮挡或细微的、与任务相关的视觉变化,例如抓取可变形物体、调节抓取力、检测初始滑动以及插入插头(zhang2025ta; su2024roformer; lee2026modular)。然而,物理传感信号比视觉观测和动作标签要稀缺得多,例如,配备 AnySkin 触觉传感器(bhirangi2025anyskin)的 Franka Research 3 机械臂仅限于一小部分内部数据(见图 7)。因此,为了仅在可用时纳入此类信号,RLDX-1 引入了一个物理模块,该模块带有一个解耦的物理(physics)流,其灵感来源于流式物理信号建模(lee2026modular)。
该流将物理传感信号与认知(cognition)流和动作(action)流分开处理,同时通过联合自注意力机制实现跨模态交互。这使得我们可以在物理信号不可用时,通过屏蔽该流的注意力操作来禁用它。此外,受 zhang2025ta 和 lee2026modular 的启发,我们在训练过程中加入了一个用于预测未来物理信号的辅助目标。具体来说,给定当前的物理信号和未来的物理信号,我们首先采样噪声,并构建一个插值后的含噪未来物理信号。然后,我们使用物理流来预测一个速度场,该速度场将含噪样本移向干净的未来物理信号,即使用流匹配目标。总之,动作模型联合去噪两个序列:(a)动作流中加噪的未来动作块,以及(b)物理流中加噪的未来物理信号。这鼓励模型内化物理交互动力学,并利用物理反馈来生成动作。
MSAT 的进一步设计选择
我们针对动作生成任务,通过三项设计选择对 MSAT 架构进行了改进。首先,我们将旋转位置编码(RoPE;su2024roformer)应用于动作流,以更好地捕捉动作块内部的相对时间结构。其次,我们将流匹配时间步长作为上下文 token 注入,而非通过特征级调制(例如 adaLN;peebles2023scalable)。具体来说,时间步长通过正弦嵌入和 MLP 进行编码,并作为单个 token 添加到序列开头,像其他 token 一样参与注意力计算,这使得时间步长信号能够通过联合自注意力传播到所有模态,而无需逐块的仿射调制。最后,我们采用了 RMSNorm(包括对查询和键的归一化;zhang2019root)以及使用 SwiGLU 激活函数(shazeer2020glu)的前馈网络,这遵循了现代 Transformer 架构的常见做法(touvron2023llama;liu2024deepseek;yang2025qwen3;bai2025qwen3)。
3. 训练数据
在本节中,我们描述用于开发 RLDX-1 的训练数据,该数据由两个互补来源组成:真实世界机器人数据和合成机器人数据。第 3.1 节描述了真实世界数据,其中包括涵盖多种形态的公开机器人数据集;第 3.2 节介绍了在 ALLEX 人形机器人和触觉增强型 Franka Research 3 平台(FR3)上收集的内部数据集。为了进一步覆盖那些难以通过直接采集进行扩展的特殊场景,第 3.3 节介绍了由我们的生成和过滤流程产生的合成机器人数据,我们使用这些数据来扩充训练集。
数据预处理
我们对所有训练数据应用统一的视觉预处理流程。为了提高训练效率,我们调整每张图像的尺寸,使得每帧在保持原始宽高比的同时,最多产生固定数量的视觉 token。这得益于 RLDX-1 继承自 Qwen3-VL(bai2025qwen3)的原生分辨率视觉编码器,该编码器能够处理任意宽高比和分辨率的图像,无需裁剪或填充(更多细节见第 B.1 节)。
3.1. 公开真实世界数据
为了让 RLDX-1 在多种不同形态上具备强大的动作先验,我们整理了公开的机器人操作数据集,涵盖单臂夹爪、双臂以及人形机器人平台。下面我们给出详细的分解说明。
- •
Open-X-Embodiment(OXE;o2024open)是一个被广泛采用的数据集,它汇总了来自 20 种不同形态的超过 100 万条真实机器人轨迹。我们沿用了 team2024octo 和 kim2024openvla 所采用的精选混合数据集,其中包含 BridgeV2、Fractal、Kuka 等(详细组成见表˜5)。
- •
DROID(khazatsky2024droid)提供了 92K 条野外环境下的操作轨迹,这些数据是在配备 Robotiq 夹爪的 Franka Research 3 平台(FR3)上采集的,覆盖了 564 个场景和 86 个任务中的 1,417 个经过立体校准的第三人称摄像头视角。
- •
Galaxea Open-World(jiang2025galaxea)提供了 10 万条双臂操作轨迹,这些数据是在 50 个真实世界场景中的 150 个任务类别下,使用具有 23 个自由度的双臂移动机器人 Galaxea R1 Lite 采集的,并带有子任务级别的语言标注。
- •
Agibot World(bu2025agibot)贡献了来自同构的 AgiBot G1 移动基座人形机器人的超过 100 万条轨迹,这些机器人配备了平行夹爪或 6 自由度灵巧手,覆盖 217 个任务和 106 个场景。我们从该数据集中采样了 275K 条片段,其中包括所有涉及手部操作的片段。
- •
Fourier ActionNet(fourier2025actionnet)提供了 3 万条(140 小时)双臂操作轨迹,这些数据是在配备 6 自由度或 12 自由度灵巧手的 Fourier GR-1 和 GR-2 人形机器人上采集的,涵盖了基于 VR 第一人称遥操作的桌面任务,例如抓取放置、倒水和插入。
- •
Humanoid Everyday(zhao2025humanoid)提供了 10.3K 条轨迹,涵盖 7 个类别中的 260 个任务,涉及灵巧操作、人机交互以及移动操作,这些数据是在宇树 H1 和 G1 人形机器人上采集的。
3.2. 内部真实世界数据
针对具身化集成与物理模态扩展,我们在两个真实世界机器人平台上收集了内部数据集:一个配备了触觉和扭矩传感器的内部 Franka Research 3 平台(FR3)装置,以及为高自由度灵巧操作而增强扭矩反馈的 ALLEX 人形机器人平台。我们在图 12 中详细描述了这两个平台的硬件规格。
- •
内部 Franka 我们的 FR3 装置遵循 DROID 配置(khazatsky2024droid),包含一个 FR3 机械臂、一个平行爪夹持器、一个腕部摄像头以及多个第三人称摄像头。我们进一步为夹持器增加了 AnySkin 触觉传感器(bhirangi2025anyskin),并额外记录了关节扭矩测量值。我们通过 Meta Quest VR 控制器进行遥操作来收集数据,该控制器用于指令末端执行器的位姿。
- •
内部 ALLEX ALLEX 是一款上半身人形机器人,专为类人灵巧操作而设计。它配备了 7 自由度手臂和 15 自由度五指手。一个 2 自由度腰部扩展了机器人的工作空间,而一个 2 自由度颈部和立体第一人称摄像头提供了宽广的感知范围。我们进一步利用了通过电流-扭矩常数从电机电流估算出的关节扭矩(zhang2025ta)。我们使用了一个多设备遥操作系统,将不同的控制接口分配给机器人的不同部分:Meta Quest VR 设备控制头部和腰部,Vive 追踪器捕捉手腕位姿,逆运动学计算手臂关节角度。我们还使用 Manus Pro 手套捕捉指尖位置,并通过逆运动学计算出手指关节角度。
3.3. 合成数据
通用型机器人策略需要应对专门化的操作场景,然而由于需要专用硬件(例如 ALLEX)或灵巧的遥操作,扩展此类数据颇具挑战。我们通过使用视频生成模型(yang2024cogvideox; wan2025wan)来增强专门的机器人数据集,从而解决这一问题,该增强同时应用于公开的 GR-1 人形机器人数据集(fourier2025actionnet)和我们内部的 ALLEX 人形机器人数据集。给定一个源机器人视频,我们利用其初始帧和任务指令,通过图像到视频(I2V)模型生成一个新的机器人视频。然后,我们使用逆动力学模型(IDM)(baker2022video)来标注动作,该模型根据当前和未来的观测预测动作序列(详见第 B.3 节)。我们在图 4 中展示了所提出流程的概览。
由于直接从源帧和指令生成的视频与源轨迹仍然过于相似,我们沿着两个互补的维度对数据进行增强:(1)任务指令,通过 VLM 使预期的操作行为多样化;(2)场景视觉,通过图像到图像(I2I)编辑和视频到视频(V2V)变换,使初始帧或生成的视频多样化。我们进一步应用了一个两阶段过滤流程,包括在视频层面的视频质量过滤,以及在动作层面的运动一致性过滤,以去除噪声样本并提高合成数据的可靠性。
任务增强
任务增强利用视觉语言模型(VLM),基于初始场景帧合成可执行的任务指令(bjorck2025gr00t)。为提升生成质量,我们向VLM提供从训练数据中抽取的少量示例作为提示,并附加描述操作上下文的系统提示。我们采用两种互补策略:(1)分解式指令组合与(2)技能基元条件化指令变体。分解式指令组合将任务指令拆解为行为、目标物体、放置位置和手部类型四个要素,并重新组合以合成合理但未见过的指令。然而,当场景仅支持有限的操作方案时,这种分解式组合可能产生不可行的行为。因此,我们引入技能基元条件化指令变体——即首先从源指令中提取底层技能(如抓取、倾倒或推拉),并以此作为任务生成的条件。为此,我们利用提取的技能,要么保留原始行为同时替换目标物体或位置,要么将其替换为从预定义技能集(覆盖整个数据集)中选取的另一可执行技能。这些策略共同系统性地提升了指令多样性,同时保持了场景层面的可行性(示例见图5(b))。
场景增强
为了增加场景多样性,我们在图像和视频两个层面注入视觉变化。在图像层面,我们使用 FLUX.2-dev(black2025flux2)对初始帧进行 I2I 编辑,改变四个因素:桌面外观、目标物体的身份和外观、光照以及背景。我们还额外以 Canny 边缘图为条件进行编辑,以保留底层场景结构,并为视频生成维持一个合理的起始状态(ali2025world)。这些场景变化随后会传播到后续的 I2V 生成过程中(示例见图 5(c))。在视频层面,我们进一步使用 Cosmos-Transfer2.5-2B(ali2025world)对合成数据进行 V2V 迁移,以在保留运动动态的同时多样化外观,从而保持已标注动作的有效性。具体来说,我们再次以 Canny 边缘图为条件,在仅修改纹理和颜色的同时,保持物体身份和形状不变。
视频质量过滤
视频质量过滤使用 VLM 从两个维度评估生成的视频:指令遵循度和轨迹合理性。对于指令遵循度,我们验证生成的视频中机器人运动是否与用于生成的指令一致。我们首先使用 VLM 判断生成的运动是否偏离了原始指令,然后根据 VLM 观察到的行为对偏离指令的视频重新标注描述(bjorck2025gr00t)。对于轨迹合理性,我们重点关注深度感知和空间方向,因为常见的操作失败包括机器人手部接近距离不正确以及物体交互不合理。具体来说,我们提示 VLM 给出 1 到 5 分的合理性评分,仅保留高于预设阈值的视频。
运动一致性过滤
虽然视频质量过滤可以去除视觉上不合理或与指令不一致的视频,但 IDM 预测的动作标签仍可能与生成视频中的运动不对齐。为了检测这类情况,我们将动作验证重新定义为生成视频与模拟器 rollout(提供与动作一致的参考运动)之间的运动匹配问题(kim2026robocurate)。具体来说,给定一个合成数据样本,我们在模拟器中重放 IDM 预测的动作,渲染出一个 rollout 视频,并将其与合成视频进行比较。为了进行这种比较,我们在冻结的 V-JEPA2(assran2025v)视频编码器之上训练了一个轻量级的注意力探针(详见第 B.3 节)。该探针由一个单层交叉注意力模块组成,其中包含一个可学习的查询 token,该 token 关注两个视频片段拼接后的嵌入向量,随后是一个预测对齐 logit 的线性头。我们利用来自真实世界演示的正负样本对来训练该探针,以捕捉细粒度的运动差异。具体来说,正样本对由一个真实片段及其真实动作对应的模拟器 rollout 组成,而负样本对则通过在同一 episode 内移动时间窗口,或配对来自不同 episode 但共享相同任务指令的片段来获得。在推理时,该探针通过保留对齐概率超过预设阈值的合成样本来进行过滤,从而生成一个既视觉合理又动作一致的精选合成数据集。
4. 训练流程
RLDX-1 分三个阶段进行训练。第 4.1 节描述了第一阶段,在此阶段中,我们在大规模多形态数据上预训练模型,以学习通用的动作预测能力。第 4.2 节随后介绍了特定形态的中期训练,该阶段旨在发展专家技能,并引入超越预训练阶段的新能力,例如长期记忆和物理感知。最后,第 4.3 节详细介绍了任务特定的后期训练,该阶段进一步优化模型以实现最先进的性能。
| 数据集 | 形态 | 末端执行器 | Episodes |
| Open-X-Embodiment | 单臂 | 夹爪 | 0,870K |
| DROID | 单臂 | 夹爪 | 0.092K |
| Galaxea 开放世界 | 双臂 | 夹爪 | 0.114K |
| AgiBot World (G) | 人形机器人 | 夹爪 | 0.239K |
| AgiBot World (H) | 人形机器人 | 灵巧手 | 0.036K |
| Fourier ActionNet | 人形机器人 | 灵巧手 | 0.030K |
| 人形机器人日常 | 人形机器人 | 灵巧手 | 0.009K |
| 合成数据 | 人形机器人 | 灵巧手 | 0.150K |
| 总计 | 1.5M |
4.1. 预训练
我们首先在大规模、多形态数据集上预训练 RLDX-1,以学习通用操作策略。该模型以多帧视频观测作为输入,并使用流匹配目标进行训练。
数据集组成
预训练语料涵盖三种形态类别:带夹爪的单臂机器人、带夹爪的双臂机器人以及带灵巧手的人形机器人。这种异构混合数据涵盖了多样的形态结构、场景环境和任务语义,促使模型学习与形态无关的表征。为缓解人形机器人形态数据稀缺的问题,我们进一步纳入了由我们的流水线生成的 15 万条合成 GR-1 人形机器人数据(第 3.3 节)。我们在图 6 中总结了整体组成,各数据集的详细信息见第 3 节。
对新形态的泛化
RLDX-1 使用特定于形态的投影层,将每种形态的输入和输出映射到共享的潜在空间,以适应异构的状态和动作空间。为便于适应未见过的形态,我们还维护了一个与形态无关的投影层,该层应用于每个批次中的一小部分样本(无论其来源形态如何),为下游微调提供了良好的初始化。该共享模块的输入在前导维度上被零填充至固定大小。
实现细节
我们使用多帧视频观测,包含当前观测时刻相对时间偏移下的四帧图像。我们基于每个数据集的第 和 百分位数对本体感知状态和动作进行归一化处理。我们冻结视觉语言模型(VLM)主干网络,仅对其顶部四层进行微调。我们使用 AdamW 优化器(loshchilov2017decoupled)以 的学习率、全局批次大小 对 RLDX-1 进行 K 步预训练,采用线性预热后恒定学习率的调度策略。对于每个批次,我们随机采样轨迹,并将其路由至共享的、与具身形态无关的编码器-解码器。预训练在 NVIDIA H200 GPU 上耗时约 小时。
4.2. 中期训练
中期训练有两个目标:具身形态专业化,即将通用预训练策略适配为具身形态专家策略;以及功能扩展,即通过三种新能力扩展策略,分别对应增强的运动感知、长期记忆和物理感知。我们在两个目标平台上进行中期训练:ALLEX(一款 48 自由度人形机器人)和 Franka Research 3 平台(FR3,一款单臂夹爪机器人)。
数据集组成
对于 ALLEX,我们将内部遥操作片段与 K 个合成片段结合,训练时按 : 比例采样,以平衡两个来源因规模差异带来的影响。对于 FR3,我们将来自 DROID(khazatsky2024droid)的 K 个片段与使用目标模态收集的内部遥操作片段结合,按 : 比例采样。在这两种情况下,内部数据是新添加的记忆、力矩以及(对于 FR3)触觉输入的唯一监督来源,而规模更大的数据源则保留了预训练阶段继承的广泛操作覆盖范围。我们在图 7 中总结了用于中期训练 RLDX-1 的整体数据组成。
功能扩展
我们通过在视觉编码器中集成时空自相似性(STSS)模块来增强运动感知能力。同时,我们在视觉语言模型(VLM)之后附加记忆模块以提供长期记忆,该模块维护一个队列,存储按时间步长间隔采样的最新认知特征,其中时间步长间隔与动作块范围相匹配。我们对 ALLEX 使用块范围,对 FR3 使用块范围,记忆模块分别覆盖过去时间步长的时间窗口。我们通过预测动作块范围内的未来传感器轨迹(即 )来融入物理感知。ALLEX 使用关节扭矩反馈,而 FR3 同时使用关节扭矩反馈和安装在夹爪上的 AnySkin 传感器提供的触觉信号。
实现细节
我们使用 AdamW 优化器,以全局批次大小 和学习率 对 RLDX-1 进行 K 步中期训练,训练计划与预训练阶段相同。为稳定新引入模态的集成,我们对每个扩展模态输入独立应用 的丢弃率,并预先加入 K 步对齐预热阶段,在此期间所有预训练参数被冻结,仅更新新添加的模态特定参数;之后,所有参数进行联合训练。物理流参数(包括其投影层和注意力机制)使用接近零的输出权重进行初始化。中期训练在 NVIDIA H200 GPU 上耗时 小时。
4.3. 后训练
在具身化和任务特定的演示数据上进行模仿学习是现实世界部署中的常见做法,我们在本文的几乎所有实验中都采用了这种方法。然而,将模型适配到现实世界任务仍然需要收集特定任务的数据,这对于涉及复杂具身化的任务来说尤其具有挑战性。例如,人形机器人操作需要控制众多自由度,导致动作空间巨大,使得从有限的演示中学习有效策略变得困难。精细操作,例如操作复杂物体,进一步要求精确的接触和准确的物体交互,这使得获取高质量的演示数据变得困难。为了解决这个问题,我们开发了一种自适应数据收集协议,并进一步利用强化学习来提升超越模仿学习的部署性能。
自适应数据收集
为了使模型专注于目标真实世界任务,我们采用了一种自适应数据收集方案,该方案包含两个阶段:基础数据收集和精炼数据收集。基础数据收集阶段构建了一个初始示范数据集,该数据集在任务一致性与多样性之间取得了平衡。具体来说,我们首先通过将完整任务分解为按时间顺序排列的原子运动基元(例如,到达、抓取、移动、放置和等待)来定义遥操作场景。对于每个场景,我们指定一致性因素(这些因素在示范过程中保持不变,以保持连贯的状态-动作模式)和方差因素(这些因素被有意多样化以提高泛化能力)。例如,一致性因素可以包括抓取姿态、运动轨迹和执行顺序,而方差因素则包括物体姿态、物体位置、初始配置以及人机交互过程中的等待时间。在定义了这些场景级因素后,我们通过沿指定的方差轴进行采样来收集初始示范。此过程使基础数据集能够覆盖与任务相关的各种变化,同时保持一致的策略结构,从而提高了从有限真实世界数据中学习的可行性。
精炼数据收集阶段通过针对在基础数据集上训练后观察到的失败案例来改进策略。我们使用基础示范来训练模型,将生成的策略部署到目标任务上,并识别策略失败的条件。针对此类情况,我们扩展场景定义或方差因素,并收集针对所观察到弱点的额外示范。例如,如果策略无法处理放置在不同位置的物体,我们会在精炼数据集中增加物体放置的空间覆盖范围。重复此过程,直到策略达到所需的性能水平。通过迭代地将数据收集集中在失败模式上,所提出的方案能够高效地获取特定任务的示范,并提升真实世界部署的性能。
强化学习(RL)
为了在具有挑战性的灵巧操作任务上改进 RLDX-1,我们引入了一个基于强化学习的策略精炼阶段,作为模仿学习的补充。我们的框架建立在 RECAP(intelligence2025pi)之上,该方法将评论家训练与策略优化解耦,以避免昂贵的联合优化并缓解强化学习的不稳定性。具体来说,我们首先训练一个基于 VLM 的评论家,使其能够根据离线数据预测价值,然后利用该评论家提供的优势条件监督信号来训练策略。之后,我们迭代地改进这两个组件:在每次迭代中,我们让当前策略执行 rollout 以收集额外的轨迹,将其合并到训练数据集中,并利用扩充后的数据集进一步改进它们。
虽然 RECAP 为灵巧操作场景下的策略优化提供了一个高效的框架,但学习一个可靠的评论家仍然具有挑战性。为了解决这个问题,我们引入了一种基于文本的 VLM 评论家,它利用 VLM 原生的数字 token 以自回归方式预测价值。先前的 VLM 评论家通常依赖新初始化的预测头来进行价值预测(tan2025robo; intelligence2025pi; liang2026robometer),这需要大规模训练才能适应,并且由于分布不匹配,在目标域任务上的迁移能力可能有限。相比之下,我们的评论家避免了引入新的预测头,而是复用 VLM 原生的文本预测接口来进行价值预测。具体来说,VLM 根据当前观测、任务指令和离散化状态,预测一个未经归一化的整数值作为文本输出。这种设计使得评论家能够直接利用 VLM 的内部知识,从而在有限数据下实现可靠的价值估计,并高效地适应新的目标域任务(见图 8)。我们在附录 C 中描述了更多实现细节,包括 RECAP 的详细流程。
5. 推理策略
在实际机器人上部署时,推理延迟至关重要。机器人运行在感知、推理和执行构成的闭环中。每一步都会在捕捉观测结果与在电机上执行相应动作之间引入延迟。尤其在动态环境中,场景在延迟期间持续变化,针对观测状态的动作在执行时已经过时。这种不匹配会随着延迟增加而加剧。为降低单步延迟,我们提出了一套专为 RLDX-1 定制的推理优化流程。我们在图捕获和内核层面进行优化。第 5.1 节在图捕获层面消除了内核启动开销。第 5.2 节进一步减少了内核层面的低效问题。
5.1. 图捕获优化
我们通过静态图转换解决图碎片化问题,从而消除了制约 RLDX-1 前向传播的内核启动开销。PyTorch eager(paszke2019pytorch)和 torch.compile(ansel2024pytorch)等现成执行栈无法充分利用 CUDA Graphs,因此无法完全消除内核启动开销。原因在于这些执行栈常常将前向传播分割成多个子图,阻碍了端到端的图捕获。通过将模型转换为静态图,我们消除了这种碎片化及其导致的内核启动开销。
内核启动开销
在 PyTorch eager 和 Torch Compile 下,内核启动开销是 RLDX-1 推理延迟的主要来源。PyTorch eager 逐个启动每个算子,开销在前向传播的数百个算子中不断累积。Torch Compile 通过使用 CUDA Graphs 捕获 RLDX-1 前向传播的部分内容,减少了部分内核启动开销,但并未完全消除。因此,前向传播被分割成多个子图,而非作为一个单一的 CUDA Graph 被捕获(图 9,顶部)。
图碎片化
剩余的启动开销是由 CUDA Graph 捕获过程中的图碎片化导致的。在 RLDX-1 前向传播中,旋转位置编码和注意力掩码构建的某些部分仍然依赖于运行时配置。在固定的部署设置下,这些值在多次推理运行中不会发生变化。然而,Torch Compile 在编译时并未完全解析这些依赖于配置的部分。因此,前向传播被分割成多个子图,而不是被捕获为单个 CUDA Graph。
静态图转换
静态图转换通过将依赖于配置的计算移出前向传播来减少这种碎片化。我们预先计算所需的旋转位置编码和注意力掩码,并在执行过程中重复使用它们。因此,前向传播不再被分割成多个子图,而是可以被捕获为单个 CUDA Graph。随后,前向传播在每个推理步骤中启动一次(图 9,底部)。
5.2. 内核优化
我们使用针对其工作负载定制的手工设计内核来优化 RLDX-1 推理。每次 RLDX-1 迭代都作为一次短预填充运行,其延迟不仅取决于矩阵乘法,还取决于周围算子如何分组和执行。Torch Compile 并未完全优化此工作负载,因为其固定的优化路径在此设置中遗漏了一些有用的算子分组。受最先进的张量优化技术(park2026trinity)的启发,我们手工设计了关键内核,共同决定了哪些算子应该融合以及每个计算应如何执行。
短预填充工作负载
RLDX-1 将每一次推理迭代都作为一次短预填充来运行。完整的前向传播一次性执行完毕,无需自回归式逐 token 生成。在视觉语言模型主干网络和 MSAT 中,序列长度对于注意力类工作负载而言相对较短。在这种短序列预填充场景下,视觉语言模型主干网络和 MSAT 中计算受限的矩阵乘法与内存受限的算子(例如 RMSNorm、RoPE 和残差更新)交错执行。因此,端到端延迟不仅取决于单个算子的开销,还取决于整个算子块中数据移动与计算之间的协调方式。
固定融合路径
Torch Compile 采用图驱动的融合策略,融合决策由算子图和编译器遍序决定。虽然这种方法适用于通用工作负载,但在 RLDX-1 的短预填充执行模式下,它限制了融合空间——因为该模式的性能取决于跨算子的数据移动协调。这种限制源于两个因素。首先,图驱动的融合策略仅暴露一组由计算图结构决定的固定融合模式。其次,某些算子(如注意力机制)以外部融合内核(例如 FlashAttention)的形式实现,编译器将其视为黑盒。这些内核在图结构中引入了硬边界,阻止了周围算子跨边界融合。因此,Torch Compile 无法形成对此类工作负载有益的跨算子融合模式。图 10(a) 展示了这样一个错失的机会。当 RMSNorm、RoPE 和注意力机制作为独立内核执行时,中间的 Q/K 张量会被反复写入和读取全局内存,导致数据移动与计算脱钩。
工作负载感知的内核设计
为了解决这些局限性,我们针对 RLDX-1 工作负载设计了定制化内核。基于这一原则,我们的设计将算子融合与片上内存重用及计算顺序的执行级决策相结合,而非仅仅依赖 Torch Compile。我们使用 NVIDIA Nsight Compute (nvidia_nsight_compute) 对 Torch Compile 生成的实现进行性能分析,以识别低效的算子组。我们用人工设计的融合内核替换这些组,其余部分则保留在 Torch Compile 下处理。图 10 (b) 展示了一个具有代表性的融合实现。融合这些算子可将中间张量保留在片上,使得数据移动和计算能够在单个内核内协调进行,从而减少内存流量并提高执行效率。我们手动实现了所选的内核,并在附录 F 中汇总了完整列表。
6. 评估与分析
在本节中,我们评估了 RLDX-1 在各种操作场景中的有效性。第 6.1 节首先评估了预训练的 RLDX-1 模型作为视觉-语言-动作模型(VLA)在多个涵盖不同形态的模拟机器人操作基准测试中的广泛能力,第 6.2 节则将这一评估扩展到真实世界的 OpenArm 人形机器人基准测试。随后,第 6.3 节和第 6.4 节评估了中期训练的 RLDX-1 模型在使用 ALLEX 人形机器人和 Franka Research 3 平台(FR3)的真实世界基准测试中的功能能力,重点关注需要运动感知、长期记忆和物理感知的任务。最后,第 6.5 节展示了消融与分析研究,考察了关键系统组件的贡献,包括架构、后训练流程和推理优化。
基线方法
为了全面评估 RLDX-1 的性能,我们将 RLDX-1 与近期前沿的 VLA 进行了比较,具体描述如下:
- •
-FAST(pertsch2025fast)是一个自回归 VLA,基于 PaliGemma 3B VLM(beyer2024paligemma)初始化,利用离散余弦变换进行机器人动作 token 化。
- •
(black2024pi_0)是一个基于扩散模型的 VLA,它将 PaliGemma 3B VLM 与一个 3 亿参数的动作专家通过共享的自注意力层配对,通过流匹配联合处理多模态观测和动作。
- •
(intelligence2025pi_)通过知识隔离(driess2025knowledge)扩展了上述方法,该方法通过流匹配在连续动作上联合训练动作模型,并通过下一个 token 预测在骨干 VLM 上联合训练离散化动作 token。
- •
GR00T N1.5(nvidia2025gr00t)是一个基于扩散模型的 VLA,以 Eagle 2.5 2B VLM(chen2025eagle)为骨干,其中中间 VLM 隐藏状态通过交叉注意力层注入到动作模型中,并有一个可学习的适配器桥接 VLM 和动作模型。
- •
GR00T N1.6(nvidia2025gr00t16)沿用了 GR00T N1.5 的交叉注意力设计,但在源自视觉观测的隐藏状态和源自语言指令的隐藏状态之间交替。
6.1. 仿真实验
为了探究 RLDX-1 作为视觉-语言-动作模型(VLA)的通用能力,我们在多种模拟机器人操作基准上对预训练的 RLDX-1 模型进行了评估。我们首先考虑了已有的基准及其变体,包括:用于单臂机器人终身任务执行的 LIBERO(liu2023libero);用于评估单臂机器人在仿真到现实视觉域迁移下零样本策略迁移的 SIMPLER(li2024evaluating),其使用了 Google Robot 和 WidowX 平台;以及用于评估扰动和变化下鲁棒性的 LIBERO-Plus(fei2025libero)和 SIMPLER Google-VA。此外,为了对模型能力进行更严格的评估,我们还在更具挑战性的基准上测试了 RLDX-1,包括:用于复杂单臂终身操作的 RoboCasa Kitchen(nasiriany2024robocasa);用于人形机器人终身操作的 GR-1 Tabletop(bjorck2025gr00t);以及用于单臂机器人长时域组合操作的 RoboCasa365(nasiriany2026robocasa365)。我们在图 11 中展示了每个基准的可视化效果,并在第 G.1 节中描述了每个基准的详细信息。完整结果见第 G.6 节。
实现细节
我们通过在各个基准上对预训练的 RLDX-1 进行微调来评估其性能。遵循预训练的实现方式,我们冻结了视觉编码器和大语言模型(LLM)主干网络,仅对 LLM 主干网络的顶部四层进行微调。除非另有说明,我们使用 AdamW 优化器(loshchilov2017decoupled)训练模型 60K 步,全局批量大小为 1024,学习率采用余弦退火调度,并在训练的前 5% 步数内进行线性预热。在三种情况下使用了基准特定的设置:LIBERO(及 LIBERO-Plus)使用全局批量大小 256;SIMPLER Google-VM/VA 训练 20K 步;RoboCasa365 遵循官方实现,训练 250K 步,全局批量大小为 196。更多细节见第 G.1 节。
| LIBERO | SIMPLER | ||||||
| 方法 | Short | Long | 平均 | LIBERO-Plus | Google-VM | Google-VA | WidowX |
| -FAST | 93.9 | 60.2 | 85.5 | 64.2 | 61.9 | 59.0 | 48.3 |
| 97.1 | 85.2 | 94.1 | 54.6 | 58.8 | 54.8 | 27.1 | |
| 98.0 | 92.0 | 96.9 | 86.5 | 72.7 | 68.4 | 46.9 | |
| GR00T N1.5 | 90.0 | 76.0 | 86.5 | 66.3 | 52.4 | 43.7 | 62.0 |
| GR00T N1.6 | 97.4 | 94.4 | 96.7 | 72.6 | 76.1 | 57.1 | 57.1 |
| RLDX-1 (Ours) | 98.6 | 95.3 | 97.8 | 86.7 | 81.5 | 77.4 | 71.9 |
| RoboCasa365 | ||||||
| 方法 | RoboCasa Kitchen | GR-1 Tabletop | Atomic-S | Comp.-S | Comp.-U | 平均 |
| -FAST | 63.6 | - | 51.7 | 08.0 | 01.8 | 21.7 |
| 62.5 | 13.6 | 34.6 | 06.1 | 01.1 | 14.8 | |
| 62.1 | 15.4 | 39.6 | 07.1 | 01.2 | 16.9 | |
| GR00T N1.5 | 65.7 | 48.0 | 43.0 | 09.6 | 04.4 | 20.0 |
| GR00T N1.6 | 66.2 | 47.6 | 61.1 | 12.6 | 02.6 | 26.9 |
| RLDX-1 (Ours) | 70.6 | 58.7 | 67.3 | 19.0 | 05.6 | 32.1 |
结果
在表 1(b) 中,我们发现 RLDX-1 在所有仿真机器人操作基准测试中持续优于近期前沿模型。在 LIBERO 上,RLDX-1 取得了 97.8% 的最高成功率,展示了在单臂操作任务上的强劲性能。RLDX-1 在 SIMPLER Google-VM 和 WidowX 上也取得了出色结果,成功率分别为 81.5% 和 71.9%,证明了向真实世界视觉条件的成功迁移。值得注意的是,这些增益在鲁棒性基准测试中保持一致。RLDX-1 在 LIBERO-Plus 和 SIMPLER Google-VA 上取得了最佳性能,成功率分别为 86.7% 和 77.4%。相比之下,GR00T N1.6 在鲁棒性变化下性能大幅下降,从 LIBERO 上的 96.7% 降至 LIBERO-Plus 上的 72.6%,从 SIMPLER Google-VM 上的 76.1% 降至 SIMPLER Google-VA 上的 57.1%。这凸显了 RLDX-1 更强的鲁棒性。
RLDX-1 的优势在具有挑战性的基准测试中愈发明显。在 RoboCasa Kitchen 上,所有基线方法的成功率均在 62% 到 67% 之间,而 RLDX-1 则超过了 70%。在 GR-1 Tabletop 上,差距更为显著,RLDX-1 达到了 58.7%,而大多数基线方法仍低于 50%,这表明其在人形机器人操作任务中具有明显优势。另一个值得注意的结果出现在 RoboCasa365 上。基线方法的平均得分在 14.8% 到 26.9% 之间,而 RLDX-1 则达到了 32.1%。这种提升在复合任务中尤为突出,此前的最先进模型 GR00T N1.6 在已见任务上的得分仍低于 12.6%,在未见任务上约为 2.6%。相比之下,RLDX-1 在已见和未见的复合任务上分别达到了 19.0% 和 5.6%。这些结果表明,随着任务从单一原子技能转向复杂的长期行为,性能差距变得更加明显。重要的是,这一对比凸显了 RLDX-1 的优势,因为 GR00T N1.6 使用了 RoboCasa 模拟数据进行预训练(nvidia2025gr00t16),而 RLDX-1 在预训练过程中未使用任何模拟数据就取得了更强的性能。
6.2. 真实世界实验:OpenArm 人形机器人
我们使用配备6自由度Inspire RH56F1灵巧手的全上半身人形机器人OpenArm(硬件详情见图12(a)),评估了RLDX-1在真实世界人形操作中的通用性。该基准测试包含简单且带有空间指令的抓取放置任务,旨在评估模型在物体实例、任务指令和物体定位方面的泛化能力。这一设置使我们能够评估基础操作能力以及通用智能的关键方面,包括指令遵循、物体与任务理解,以及对未见变化的泛化能力。下文将描述任务细节(可视化效果见图14),更多详情见第G.2节。


- •
基础抓取放置。该任务评估基础人形操作能力:机器人需从三个物体中识别出玩偶,并将其放入机器人右侧的盒子中。该任务要求目标类别识别、单手操作,以及当物体和目标位置位于工作空间两侧时的双手协调能力。
- •
定向抓取放置(置物架/碗架)。该任务评估指令引导的人形操作能力。机器人需从干扰物中识别目标物体,并将其放入多个目标位置之一:在置物架变体中,机器人抓取零食或瓶子,放入四个置物架位置之一(右上、左上、右下、左下);在碗架变体中,机器人抓取杯子,放入三个碗架槽位之一(左、中、右)。除基础抓取放置所需能力外,两种变体均要求空间指令理解能力。
- •
未见物体(实例)。该任务评估人形机器人操作中对未见物体实例的泛化能力。机器人需执行定向抓取与放置任务,操作对象为训练中未曾见过的新型瓶子和杯子,这要求其在具备定向抓取与放置所需能力的基础上,额外具备物体实例层面的泛化能力。
- •
未见任务(放置)。该任务评估人形机器人操作中对未见任务配置的泛化能力。机器人需对瓶子和杯子执行基础抓取与放置操作,尽管训练演示仅包含玩偶。该任务还使用了一个训练演示中未包含的新型目标容器。这要求其在具备基础抓取与放置所需能力的基础上,额外具备对新物体和放置位置的任务泛化能力。
- •
物体定位。该任务评估人形机器人操作中的细粒度物体定位能力。机器人必须从同一类别的三个物体中,识别并抓取语言指令所指定的正确物体实例。由于该任务未出现在训练演示中,因此既需要实例级别的物体定位能力,也需要任务泛化能力。
评估方案
我们在一个包含三个物体的桌面场景中进行每次评估试验,场景中有一个目标物体和两个干扰物体,并按照三种预定义的初始布局改变物体摆放位置。对于除物体定位之外的所有任务,如果机器人能够识别并抓取正确的目标物体,并将其放置到语言指令指定的目标位置,则判定该次试验成功。对于物体定位任务,一旦机器人识别并抓取到语言指令中指定的物体实例,即判定该次试验成功。
结果
如图 14 所示,RLDX-1 在所有基准测试设置中均取得了最佳整体性能。在基础拾放任务中,尽管面临训练数据有限且需抓取可变形物体的挑战,RLDX-1 仍达到了 50% 的成功率,优于(41.7%)和 GR00T N1.6(37.5%)。当需要遵循指令时,差距进一步拉大:在定向拾放(货架)任务中,RLDX-1 超越最强基线 14.6%,在(碗架)任务中超越 12.5%,这表明除了基础操作能力外,其指令遵循能力也更强。在未见物体、未见任务和物体定位任务上,RLDX-1 同样保持优势,显示出其泛化能力超越了训练数据分布。我们还识别出两个基线模型各自不同的失败模式。在未见设置下性能显著下降(例如,在未见物体任务上为 37.5%,而 RLDX-1 为 54.2%),并且是唯一在未见任务中频繁陷入卡顿的基线模型,这可能是由于其较弱的 VLM 骨干网络以及全 VLM 微调方式容易导致过拟合。相比之下,GR00T N1.6 能够识别物体类别,但在实例级定位上表现挣扎,在物体定位任务中仅得 33.3%(相当于随机选择),而 RLDX-1 达到 87.5%。RLDX-1 避免了这两种失败模式,并在所有设置中持续改进,展现出更强的真实世界人形机器人操作泛化能力。
6.3. 真实世界实验:ALLEX 人形机器人
为了评估RLDX-1在真实世界灵巧操作中的功能能力,我们为ALLEX人形机器人策划了一组现实、实用的任务场景。作为配备高自由度双手的全身人形机器人,ALLEX为评估类人功能能力提供了合适的平台(硬件细节见图˜12(b))。该基准测试包含需要运动感知、长期记忆和物理感知的任务,使我们能够评估RLDX-1是否能够处理超越通用视觉语言理解的灵巧操作场景。下面我们描述任务细节(可视化见图˜15),并在第G.3节提供更多细节。
- •
传送带拾取与放置。该任务通过机器人与运动物体的交互,评估其在动态环境中的行为。机器人被指示从以不同速度移动的传送带上拾取一个盒子,并将其放置在前方的架子上。传送带速度的变化引入了时间动态特性,使得仅凭静态观测难以预测下一个物体的位置。策略需要预测物体运动并相应调整其动作。
- •
盒中物体选择。该任务要求利用长期观测历史,而非仅依赖当前观测。一个人拿起放置在机器人前方的三个盒子中的一个,将一个物体放入其中,然后将盒子放回原位。在收到开始信号后,机器人被指示选择装有物体的那个盒子。该策略需要对过去的观测进行长期推理,以生成准确的动作。
- •
卡片滑动与拾取。该任务评估在接触密集场景中对接触力的精确控制。一张卡片被放置在前方的桌子上,机器人将其滑动到桌子边缘,拾起卡片,然后交给前方的人。该策略需要对接触力进行精细控制,以对卡片施加适当的压力。我们略微改变桌子的高度,使得仅凭视觉观测难以确定合适的接触深度,因此需要物理信号来检测接触并调节施加的力。
- •
壶倒杯接。该任务通过物理信号评估对操作物体重量的理解。一个装有球的壶和一个杯子放在前方的桌子上,机器人抓取两者并倾斜壶,将球倒入杯中。当杯子达到目标重量时,机器人将壶放回原位,并将杯子向前伸出。在倾倒过程中,视觉线索变化很小,这使得策略难以仅凭视觉判断何时停止倾倒。相反,它应该通过手臂的关节扭矩来估计杯子的重量。
评估方案
我们采用针对具体任务的评估标准。对于传送带拾取与放置任务,我们在 4 种不同的传送带速度下评估性能,分别记为 S1 到 S4。S1 和 S4 在训练中出现过,而 S2 和 S3 是介于两者之间的未见速度,用于评估策略在运动条件之间进行插值的能力。我们测量每种速度下的拾取与放置成功率。对于盒中物体选择任务,我们测量三个盒子位置下每个位置的选择成功率。对于卡片滑动与拾取任务,我们使用一个三阶段进度得分来评估性能,分别对应滑动卡片、拾起卡片和递出卡片,得分分别为 0.33、0.66 和 1.0。对于壶倒杯接任务,我们使用一个四阶段进度得分,分别对应抓取两个物体、倾倒、放回壶以及将杯子向前伸出,得分分别为 0.25、0.5、0.75 和 1.0。
结果
如图 16 所示,RLDX-1 在所有任务上均以显著优势取得了最佳性能。在传送带拾取与放置任务中,基线模型几乎都坍缩为与某一种已见过速度对齐的固定传送带速度动作,而不考虑实际传送带的运动,这表明其缺乏运动感知能力。GR00T N1.6 仅在较低速度 S1 和 S2 上成功(平均 50.0%),在已见过的较快速度 S4 上也能成功,但在未见过的速度 S3 上基本失败(平均 29.2%)。相比之下,RLDX-1 在已见过速度(100%)和未见过速度(75%)上均保持了强劲性能,验证了运动模块的有效性。在未见过速度下,RLDX-1 能自适应地调整其动作节奏以匹配传送带,从而成功完成拾取与放置操作。在物体入盒选择任务中,仅依赖当前观测的基线模型无法做出准确选择。GR00T N1.6 无论先前的人类演示如何,都会随机选择一个盒子(29.2%),或者在整轮评估中反复选择同一个盒子(33.3%)。相比之下,RLDX-1 以 91.7% 的成功率选择了正确的目标盒子,证明了记忆模块的有效性。在卡片滑动与拾取任务中,GR00T N1.6 均表现出多种失败模式,例如滑动不准确、无法抓取薄卡片,或在交接过程中掉落卡片,这表明其精细控制能力有限。而 RLDX-1 则取得了近乎完美的进度得分 97.2,表明关节力矩反馈对于接触密集的精细操作是有益的。在壶到杯倒水任务中,两个基线模型均未能在任何一次试验中完成完整任务。两者都难以准确地将水倒入杯中,即使倒水成功,由于缺乏对杯中重量变化的感知,它们也会卡在倒水姿势上。相比之下,RLDX-1 取得了 70.8 的进度得分,比基线模型高出 30 多分。一旦倒水完成,RLDX-1 能感知到杯子的重量变化,并顺利继续完成任务,这突显了物理信息流(physics stream)的有效性。总体而言,这些结果展示了 RLDX-1 在灵巧人形机器人操作方面的功能能力,涵盖了运动感知、长期记忆和物理感知,而这些正是现有 VLA 模型所欠缺的。
6.4. 真实世界实验:Franka Research 3
为了在另一种不同的真实机器人形态上进一步评估相同的功能能力,我们在 Franka Research 3 平台(FR3)上进行了实验。FR3 是一款配备 AnySkin 触觉传感器(bhirangi2025anyskin)的单臂夹爪机器人,能够评估视觉运动能力和富含接触的操作能力(硬件细节见图 12 (c))。该基准测试包含对视频和记忆要求较高的任务(其中短视距运动理解或过去状态记忆至关重要),以及富含接触的操作任务(其中物理反馈对成功执行至关重要)。我们在下方描述任务细节(可视化见图 17),并在 G.4 节中提供更多细节。
- •
旋转追踪。该任务评估对简单运动模式的感知能力。基于摄像头视角,当显示器上的物体顺时针移动时,机器人应指向“顺时针”,否则指向“逆时针”。由于初始位置不同,策略不能依赖位置线索,而应估计运动模式。
- •
乒乓球游戏。该任务评估对更复杂运动模式的预测能力。机器人充当显示器上乒乓球游戏中的玩家。右侧墙壁被划分为红色、绿色和蓝色区域,机器人应在球到达墙壁前指向对应的杯子。由于球的轨迹频繁变化,策略需要精确捕捉运动动态。
- •
换杯游戏。该任务要求利用长期观测历史,而非仅依赖当前观测。机器人应先将咖啡机上现有的杯子移至空杯垫,再将另一个杯垫上的杯子放到咖啡机上。因此,在将咖啡机上的杯子移至空杯垫后,机器人需要记住哪个杯子原本在杯垫上。
- •
猜杯游戏。该任务同样要求利用长期观测历史,而非仅依赖当前观测。机器人需要识别出三个杯子中哪个杯子下面藏有方块。方块最初会展示给策略模型,随后一个杯子被扣在方块上将其隐藏。由于方块被遮盖后不再可见,策略模型必须记住哪个杯子中藏有方块。
- •
插头插入。该任务评估在接触密集场景中对接触力的精确控制能力,机器人需将插头插入插座,而插座完全被摄像头视野遮挡。因此,机器人需要依赖扭矩和力反馈信号来检测接触并引导对准。
- •
鸡蛋拾放。该任务同样评估在接触密集场景中对接触力的精确控制能力,机器人需拾取易碎的鸡蛋并将其放入碗中而不打破。因此,力反馈信号对于小心抓取物体至关重要。
评估协议
我们采用任务特定的评估标准,除非另有说明,否则对每个策略在每个任务上进行 24 次试验评估。对于旋转追踪任务,我们在 4 个不同的初始位置上进行评估,并测量对旋转运动的响应成功率。对于乒乓球游戏,我们根据球到达墙壁前正确指向的成功率进行测量。对于杯子交换任务,我们在 2 个不同的初始位置上评估性能,每个位置都包含在没有记忆的情况下容易混淆的冗余轨迹。对于猜球游戏,我们测量每个位置在 3 个壳位置下的选择成功率。对于插头插入任务,我们在 3 个不同的插入目标位置上评估性能,并测量插入成功率。对于鸡蛋拾取与放置任务,我们在 3 个不同的初始位置上评估性能,并测量拾取与放置成功率(且不弄破鸡蛋)。
结果
在图18中,我们发现RLDX-1在所有任务上的性能均显著高于基线模型。在旋转追踪任务中,GR00T N1.6甚至难以检测到运动起始,分别仅获得32.3%和26.0%的成功率。然而,RLDX-1达到了97.9%,验证了其运动模块的运动感知能力。在乒乓球游戏中,RLDX-1能够预测并响应来自不同方向的运动,实现了81.5%的成功率,展示了运动理解的实际应用潜力。在换杯任务中,GR00T N1.6的成功率均低于25%,而RLDX-1达到了45.8%,显示出巨大的性能提升。这一优势在猜球游戏中更为显著。值得注意的是,GR00T N1.6的成功率约为50.0%,而RLDX-1达到了91.7%,证明了其具备基于历史信息的决策能力。在插头插入任务中也观察到了类似趋势。GR00T N1.6分别仅达到20.8%和16.7%,表明基线模型难以处理涉及细微视觉变化的任务。从定性角度看,两个基线模型常常无法判断插头是否正确插入目标位置,并持续在插座周围施加力直至失败。相比之下,RLDX-1实现了33.3%的成功率,并且与没有物理感知输入的变体不同,它能在插头到达插入位置后定性施加向下的力。这些结果表明,触觉和力/力矩信息有效提升了接触密集型操作任务的性能。RLDX-1在鸡蛋拾取与放置任务中也表现出色,达到了61.1%的成功率,而GR00T N1.6分别为45.8%和37.5%。从定性角度看,没有触觉感知的模型即使在夹爪到达正确抓取位置时也常常失败,因为抓取力不足以稳固地握住物体。相比之下,当使用触觉感知时,一旦夹爪到达正确的抓取位置,机器人就能以高概率成功。这些观察结果表明,RLDX-1通过融入物理感知,有效改进了接触密集型操作。
6.5. 消融实验与分析
视觉语言模型分析
我们首先分析视觉语言模型(VLM)特征提取和机器人专用视觉问答(VQA)适配如何影响下游操作性能。具体而言,我们通过定量消融实验评估了VLM特征提取层和机器人专用VQA训练的影响,并辅以定性注意力图可视化。在消融研究中,我们采用预训练设置下的基础架构,其中动作模型以从第18层提取的VLM隐藏状态作为输入。每个变体均从头开始训练(无预训练),并在RoboCasa Kitchen基准上进行评估。如图19(a)所示,我们发现VLM特征提取层对性能影响最大。使用较早层(如第8层)的特征会使成功率从60.9%降至51.1%,而使用较晚层(如第28层)的特征也会使性能降至56.3%。我们将此归因于中间层VLM表示为动作生成提供了视觉基础与语义抽象之间更有效的平衡,而较早层缺乏足够的语义信息,较晚层则可能与操作所需的细粒度视觉细节对齐程度降低。与此同时,机器人专用VQA训练在将VLM表示适配到下游操作任务中也发挥着重要作用。如图19(b)所示,我们发现移除该训练阶段会使成功率从60.9%降至57.5%,这表明机器人专用VQA监督有助于将VLM特征优化为更具动作相关性的表示(见图20)。为进一步验证这一效果,我们可视化了VQA训练前后的注意力图。在给定机器人观测和任务指令的情况下,未经机器人专用VQA训练的VLM对机器人本体和目标物体的关注有限。而经过VQA训练后,注意力更加集中于机器人本体和待操作物体。这些定性结果支持了定量发现,表明机器人专用VQA训练有助于使VLM专门化以适用于机器人任务。
| 预训练数据 | 成功率(%) | |
| 真实数据 | 合成数据 | |
| ✓ | 000% | 41.0 |
| ✓ | 025% | 45.6 |
| ✓ | 050% | 46.6 |
| ✓ | 100% | 50.1 |
合成数据的影响
为了探究合成数据的有效性,我们比较了使用不同比例合成数据进行预训练的 RLDX-1 模型。具体来说,我们以 1024 的全局批次大小和 60K 梯度步数预训练 RLDX-1,并将其限制在 GR-1 人形机器人具身上以进行受控比较。我们固定了真实的 GR-1 人形机器人数据集(fourier2025actionnet),并逐步将合成 GR-1 人形机器人数据的规模扩大到其完整数据量的 25%、50% 和 100%,同时保持真实数据与合成数据的采样比例固定为 1:1。然后,我们在 GR-1 桌面基准测试(bjorck2025gr00t)上评估每个模型,并将结果报告在表 3 中。结果显示,随着合成数据比例的增加,成功率持续提升,从仅使用真实数据时的 41.0% 上升到使用全部合成数据时的 50.1%。这一缩放趋势表明,我们的任务和场景增强策略(见第 3.3 节)有效地使合成数据多样化,并带来了下游策略性能的持续提升,从而使 RLDX-1 能够覆盖更广泛的操作场景,而这些是仅靠真实数据无法充分提供的。此外,我们的合成数据还进一步提升了特定任务上的空间泛化能力(见第 G.5 节),这推动了其在 ALLEX 人形机器人中期训练中的应用(见图 7)。总体而言,这些结果表明,我们的合成数据为真实机器人数据提供了可扩展且有效的补充,从而提升了下游策略性能。
强化学习应用的效果
为了验证强化学习训练的有效性,我们使用强化学习训练了RLDX-1,并在灯泡拧动任务上对其进行了评估。在该任务中,ALLEX人形机器人必须用右手的食指和拇指拧动固定在灯座中的塑料灯泡,直至灯泡亮起,如图22所示。我们报告了(a)完成任务所需的帧数(即回合长度),以及(b)拧动灯泡使其发光的尝试次数,这两个指标的值越低越好。我们将遥操作专家的演示(Teleop)、使用预训练RLDX-1进行的行为克隆性能(BC),以及使用我们的任务预测评判器进行的三轮连续RECAP训练(即RECAP1至RECAP3)进行了比较。如图22所示,我们发现RECAP在每一轮迭代中,在速度和鲁棒性方面都比BC取得了持续的提升。最值得注意的是,RECAP3仅用少量帧数和尝试次数就完成了任务,与BC(帧数、尝试次数)相比,回合长度和尝试次数均大幅减少约XX%,甚至超越了人类遥操作基线。RECAP2和RECAP3显著更小的标准差进一步表明,其试验间的一致性得到了改善。这些结果表明,在仅靠模仿学习不足以应对的具有挑战性的真实世界操作任务中,基于强化学习的优化可以显著提升性能。
| 推理栈 | 无物理与记忆 | 全模态 |
| PyTorch Eager | 67.0 毫秒 | 71.2 毫秒 |
| 优化级别 | ||
| CUDA Graph + Torch.Compile | 56.9 毫秒 (1.18倍) | 59.6 毫秒 (1.19倍) |
| + 静态图转换 | 46.2 毫秒 (1.45倍) | 48.9 毫秒 (1.46倍) |
| + 内核优化 | 41.6 毫秒 (1.61倍) | 43.7 毫秒 (1.63倍) |
推理优化对比
我们在配备 NVIDIA RTX 5090 和 Intel Core Ultra 7 265K 的桌面设备上分析了推理优化流程。所有测量均在 ALLEX 配置下进行(双视角 192256 图像,4 帧,动作范围 40,4 步欧拉去噪),报告了 100 次预热前向传播后 300 次迭代的中位数。以 PyTorch 即时执行(paszke2019pytorch)和 Torch Compile(ansel2024pytorch)作为基线,我们的方法分两个阶段逐步应用:静态图转换,随后在静态图基础上进行算子融合。我们评估了两种 RLDX-1 变体。第一种变体排除了物理感知和记忆模块,第二种则是完整的多模态模型。如表 4 所示,Torch Compile 相比即时执行带来的加速效果并不理想,两种变体的加速比分别为 1.18 和 1.19。这是因为 Torch Compile 捕获的是碎片化的子图而非单个完整图,并且仅应用了部分算子融合。因此,主要的启动和内存搬运开销仍然存在。静态图转换通过将前向传播捕获为单个 CUDA 图,消除了动态执行开销,相比即时执行实现了 1.45 和 1.46 的加速比。在此基础上的算子融合进一步减少了内核边界和 HBM 往返次数,将累计加速比提升至 1.61 和 1.63。由此产生的每步延迟,不含物理和记忆模块的变体为 41.6 毫秒,完整多模态模型为 43.7 毫秒。我们还观察到,两种变体的加速比几乎相同。这表明我们的优化对于完整模型引入的额外记忆模块和物理流具有鲁棒性。总体而言,消融实验证实,首先在图级别、然后在内核级别减少运行时碎片化,对于满足 RLDX-1 实时策略服务所需的每步延迟预算至关重要。
7. 相关工作
机器人学中的基础模型
构建能够像人类一样在多样化任务和环境中进行感知、推理和行动的通用机器人策略,一直是机器人领域的长期目标。为此,一条研究路线探索了模块化方法(brohan2022rt; liang2023code; driess2023palm; huang2023voxposer; singh2022progprompt; team2025gemini),这些方法利用视觉语言模型(VLM;touvron2023llama; beyer2024paligemma; bai2025qwen3; team2025gemma)作为高层任务规划器,并使用额外的专用模型(例如视觉追踪模型)和底层策略来生成动作。然而,近期端到端的视觉-语言-动作模型(VLA;zitkovich2023rt; wu2023unleashing; team2024octo; kim2024openvla; black2024pi_0; bjorck2025gr00t; bu2025univla; intelligence2025pi_; nvidia2025gr00t; zheng2025x; nvidia2025gr00t16; community2026starvla)作为一种有前景的范式出现,它将视觉感知、语言条件推理和动作生成统一在单个模型中,而非仅利用VLM的高层语义信息。这些模型要么微调VLM,使其在VLM词表内自回归地生成离散化的动作token(kim2024openvla; pertsch2025fast),要么使用带有流匹配Transformer的专用动作解码器,基于VLM内部表示(如隐藏状态或KV-cache特征)来生成条件化动作(black2024pi_0; bjorck2025gr00t)。更近期的工作探索了通过增加未来视频/状态预测目标来扩展VLA,以提升物理泛化能力(won2025dual; kim2026cosmos; ye2026world)。虽然这些工作主要通过关注多功能性来推进通用机器人策略的发展,但我们强调,多功能性仅代表了通用智能的一个方面。对于现实世界的操作任务而言,通用机器人策略还必须具备功能性能力,包括运动感知、长期记忆和物理传感。为此,我们提出一个统一的端到端VLA系统,它将这些功能性能力与多功能性的语言条件动作生成相结合,推动VLA向实用的现实世界机器人操作迈进。
用于机器人学习的合成数据
尽管大规模数据是大模型训练的核心,但机器人领域缺乏像视觉和语言领域那样可获取的互联网规模数据(brown2020language; radford2021learning)。为解决这一局限,先前的工作探索了在仿真环境中生成合成数据(li2023behavior; tao2024maniskill3; nasiriany2024robocasa),其方法是通过在多样化的仿真环境中,利用模仿学习(mandlekar2023mimicgen; jiang2025dexmimicgen)或强化学习(laskin2020reinforcement)训练得到的策略进行 rollout,从而获取机器人轨迹。然而,仿真环境与真实世界之间的视觉和物理差异带来了“仿真到现实”的差距(zhao2020sim),限制了仿真生成数据在真实世界策略学习中的有效性。近期视频生成模型的进展提供了一种替代方案,即通过合成视觉上逼真的机器人视频(jang2025dreamgen; team2025gigaworld; kim2026robocurate),然后利用逆动力学模型(baker2022video)为其标注动作。虽然这种基于视频的合成数据为扩充机器人数据集提供了一种可扩展的方式,但先前的工作大多局限于桌面级的抓取放置任务,尚不清楚这种范式是否能迁移到针对现实任务场景的专用人形机器人硬件上。相比之下,我们提出了一种针对 ALLEX 人形机器人上实用灵巧操作的合成数据框架,面向诸如倒水、拧灯泡等真实世界场景,并进一步发现,即使与包含力矩标注的真实数据结合使用时,这类数据(尽管其本身不包含力矩信号)仍然是有益的。
机器人操作的功能性
现实世界中的机器人操作需要在动态、长时域且接触密集的环境中具备多样化的功能能力。这要求具备运动感知能力以推理时间变化,需要长期记忆以在长时间交互中保留任务上下文,以及物理感知能力以捕捉视觉之外的接触与力信息。先前的研究已从不同角度探讨了这些能力。在运动感知方面,许多研究利用多帧输入,通过使用完整的时间上下文来生成动作(wu2023unleashing; team2024octo; cheang2024gr; huang2025otter; wang2025unified; torne2025learning; li2025cronusvla)。此外,一些研究通过选择关键帧(wen2021keyframe)、将整个序列总结为高级可视化(sundaresan2024rt; zheng2024tracevla)或压缩过去的观测(wen2020fighting; seo2023regularized; jang2025contextvla)来高效利用这些信息。在长期记忆方面,一些方法使用 VLM 处理过去的观测,然后利用生成的特征向量来产生动作(sridhar2025memer; intelligence2026pi)。与我们的方法更相关的是,另一条研究路线引入了一个记忆模块,将过去的观测存储在记忆队列中(fang2025sam2act; shi2025memoryvla; koo2025hamlet)。在物理感知方面,大多数先前的研究侧重于利用单一的物理信号来提升接触密集任务的性能(yu2025forcevla; zhang2025ta; huang2025tactile; bi2025vla; cheng2025omnivtla; zhang2025vtla)。最近的一些方法通过整合多种物理信号扩展了这一方向(lee2026modular)。然而,这些方法旨在解决单一功能,而现实世界中的操作往往要求机器人联合使用多种功能。相比之下,我们的工作将这三项能力整合到一个统一的端到端策略中,使得单一模型能够结合互补的功能能力,用于现实世界的机器人操作。
8. 结论
在本文中,我们提出了 RLDX-1,这是一个通用型的视觉-语言-动作模型(VLA),用于在真实世界环境中实现类人灵巧操作。RLDX-1 超越了通用智能,通过将关键功能能力集成到一个统一的架构中,实现了真实世界的操作,这些能力包括运动感知、长期记忆和物理感知。为了使这些能力在真实世界部署中切实可行,RLDX-1 进一步结合了用于灵巧机器人数据的合成数据增强、三阶段训练以及用于响应式控制的推理优化。我们的实验表明,RLDX-1 显著提升了特定功能能力和通用操作性能。特别是在需要多样化功能能力的 ALLEX 人形机器人任务上,RLDX-1 实现了约 90% 的成功率,而前沿 VLA 模型则维持在 40% 左右。RLDX-1 在每一个需要通用智能的模拟基准测试和真实人形机器人基准测试中也持续优于这些基线模型,表明所提出的设计能够泛化到特定能力任务之外。我们希望这些结果能使 RLDX-1 成为迈向能够在复杂真实世界环境中实现类人灵巧操作的通用机器人策略的有意义一步。
参考文献
附录 A 贡献者与致谢
在每个角色内,姓名按名字字母顺序排列,然后按姓氏字母顺序排列。所有项目负责人贡献均等。
A.1. 主要贡献者
项目负责人
- •
Dongyoung Kim:子负责人,数据与模型训练。
- •
Huiwon Jang:子负责人,数据与架构。
- •
Myungkyu Koo:负责模型架构。
- •
Suhyeok Jang:负责合成数据。
- •
Taeyoung Kim:负责模型训练。
研究负责人
- •
Dongyoung Kim、Huiwon Jang、Jinwoo Shin:负责整体研究方向,并协调跨领域贡献者之间的协作。
A.2. 核心贡献者
按贡献领域分组。每组内的姓名按名字字母顺序排列。担任多角色的成员会出现在多个组中,并在每组中附带针对该角色的描述。
模型架构
- •
Daewon Choi:参与了 MSAT 的早期设计。
- •
Heeseung Kwon:设计并实现了运动模块。
- •
Jimin Lee:设计并实现了物理感知信号集成。
- •
Kyungmin Lee:参与了 MSAT 的早期设计。
- •
Seungcheol Park:支持了物理感知信号集成的验证。
合成数据
- •
Byungjun Yoon:在合成数据流程中设计了任务增强和视频质量过滤。
- •
Changsung Jang:通过训练逆动力学模型、生成合成数据以及在 ALLEX 上实现基于运动一致性的过滤,支持了合成数据生成。
- •
John Won:支持了场景增强和 GR-1 合成数据生成。
- •
Junyoung Sung(KAIST 附属实习生):支持了 ALLEX 合成数据生成。
- •
Minseong Han:支持了 ALLEX 合成数据生成与评估,并处理了用于 ALLEX 视频模型微调的内部数据集。
- •
Sejune Joo:设计了用于验证 ALLEX 合成数据的真实世界实验,并参与了 ALLEX 合成数据生成的早期设计。
- •
Seungku Kim:在合成数据流程中设计了基于运动一致性的过滤。
模型训练流程
- •
Byungjun Yoon:通过优化多节点训练流程,支持了 VLM/VLA 训练。
- •
Jaehyun Kang:主导了代码库的重构与维护。
- •
Sejune Joo:通过训练基线模型支持了 ALLEX 演示;实现了训练和异步推理流程,以便在 ALLEX 上部署基线模型。
- •
Seungjun Moon:将基线模型集成到真实的 ALLEX 评估流程中,并实现了 ALLEX 演示评估的自动化。
真实世界机器人评估与演示
- •
Beomjun Kim:支持了 OpenArm 评估。
- •
Heeseung Kwon:设计了真实世界中的特定运动实验。
- •
Jaehyun Kang:在 ALLEX 上设计了与记忆相关的实验。
- •
Jaekyoung Bae:主导了 ALLEX 的生产级研究方向以及真实世界演示任务的设计与评估。
- •
Jimin Lee:在 FR3 上设计了用于物理感知评估的真实世界实验。
- •
Joonwoo Ahn:为 ALLEX 演示任务设计了基于遥操作的数据采集场景,定义了考虑一致性与差异性的任务特定数据分布策略,并通过有针对性的数据优化提升了任务性能。
- •
朴俊亨444KAIST 附属实习生:为 OpenArm 评估提供了支持。
- •
朴承哲:设计了用于在 ALLEX 上验证物理感知信号的真实世界实验。
强化学习
- •
李东旭:开发了 RECAP 训练与推理功能;构建了真实世界强化学习评估流程;在真实的 ALLEX 机器人上进行了评估。
- •
孙善一:设计并开发了 RECAP 的价值模型;生成并分析了 ALLEX 的实验结果。
- •
董勇勋:为 RECAP 训练提供了支持。
- •
赵龙镇:设计了强化学习任务并领导了团队在该方向上的工作;开发了 RECAP 训练与推理功能。
推理优化与部署
- •
韩东洙:领导了推理优化流程的研究方向。
- •
全浩镇:为推理优化的集成与评估提供了支持。
- •
姜在贤:构建了异步推理流程。
- •
李智赫:为 RLDX-1 架构构建并设计了推理优化流程,包括静态图转换、CUDA Graph 集成以及 Triton 内核优化。
- •
尹敏成:为内核优化和实时分块评估提供了支持。
- •
赵承根:为推理优化流程的内核评估提供了支持。
- •
金永灿:为 RLDX-1 推理流程设计并实现了融合注意力内核,通过分析图断裂来源设计了 GraphSafe 静态图转换,并实现和分析了静态图转换与 Triton 内核优化。
A.3. 贡献者
按贡献领域分组。每组内的姓名按名字的字母顺序排列。身兼多职的成员会出现在多个组中,并在各组中附有对应角色的描述。除非另有说明,所有贡献者均隶属于 RLWRLD。
训练基础设施
- •
郑在宪:构建了端到端的训练基础设施;构建了基于遥操作的数据采集系统,该系统在真实与仿真环境中均使用主控设备;构建了针对多种 VLA 模型的推理与评估系统,同时支持真实与仿真环境。
- •
张柱哲:管理了用于训练和实验的 GPU 基础设施;构建了数据集管理系统和流程自动化。
机器人控制系统
- •
Jaewoo Kim:负责整体机器人系统,包括遥操作、人类数据以及系统级代码重构。
- •
Junhyeok Park:构建了底层机器人控制接口;设计并实现了遥操作控制栈;构建了用于微调的数据采集流水线,特别是针对 RB-Y1。
- •
Seunghyun Kim:构建了底层机器人控制接口;设计并实现了遥操作控制栈;构建了用于微调的数据采集流水线,特别是针对 OpenArm。
机器人硬件研究与原型设计
- •
Chang Hwan Kim:采购/改造了用于数据采集的上半身机器人平台;维护了包括 ALLEX 在内的硬件系统;分析/集成了各种上半身、手臂、灵巧手和传感器,特别是针对 OpenArm。
- •
Sungryol Yang:构建了 OpenArm 数据采集硬件平台;维护了 ALLEX;制作了基准测试任务对象。
遥操作系统
- •
Jaeheon Jung:构建了支持机器人数据采集的遥操作系统。
- •
Kwanghoon Kim:构建了遥操作系统的摄像头处理、视频流传输和 VR 集成组件;排查了性能问题;构建了 ALLEX 的运行环境;支持研究人员操作 ALLEX。
- •
Seungyup Ka:为 ALLEX 开发了遥操作、数据采集和推理主干代码库;构建了 ALLEX 的运行环境;支持研究人员操作 ALLEX。
遥操作数据采集
- •
Hyunsoo Choi、Hyunsoo Shin、Jinwook Kim、Sangjun Kim、Seungjun Lee、Yeonwoo Bae:为 ALLEX 采集了遥操作数据。
- •
Dohyeon Kim、Jungwoo Park、Seunghoon Shim、Wook Jung:为 OpenArm 和 Franka 采集了遥操作数据。555Dohyeon Kim、Jungwoo Park 和 Seunghoon Shim 是 KAIST 附属实习生;Wook Jung 隶属于 KAIST。
- •
Yashu Shukla:为 ALLEX 仿真建立了自动化的训练-推理-评估流水线。
人类数据流水线
- •
Joochul Chang:构建了人类数据采集流水线。
- •
Kyoungwhan Choe:开展了人类数据处理和重定向的早期研究;为整合人类演示奠定了基础。
- •
Sangwoo Kim:构建了人类数据采集流程,为将人类示范数据纳入系统奠定了基础。
- •
Sejune Joo:设计并部署了人类数据训练流程;为人类数据采集流程的早期开发做出了贡献。
现场演示制作
- •
Heecheol Kim、Heewon Lee、Junghun Park、Manoj Bhadu、Nayoung Oh、Yeonjae Lee:收集了现场演示任务数据,并对 RLDX-1 进行了微调,用于现场演示。
- •
Joonsoo Kim:领导了现场演示任务数据的收集以及用于现场演示的 RLDX-1 微调工作。
面向产业转化的灵巧性基准
- •
Hensen Ahn:设计并策划了 DexBench,这是一个面向产业的灵巧性基准,用于在产业转化场景中评估 RLDX-1。
- •
Junho Cho:为 DexBench 的叙述和图表方向做出了贡献;协调跨团队产出与灵巧性基准团队保持一致。
- •
Kangwook Lee:定义了产业转化的灵巧性标准。
项目协调与公开发布
- •
Hyungkyu Ryu:领导了整体项目的协调与管理。
- •
Junho Cho:撰写了技术叙述;编写并润色了技术博客内容;制作并编写了演示视频脚本;指导了图表和信息图的设计;协调了跨团队产出。
- •
Junwon Lee:协调了端到端的发布规划;管理了许可事宜,包括数据、代码和模型权重的公开分发。
A.4. 致谢
我们感谢 RLWRLD 的所有成员,他们的支持使 RLDX-1 的开发和发布成为可能。虽然本报告记录了直接的研究和产品贡献,但如果没有整个公司对我们使命的共同信念,这项工作是不可能完成的。
执行赞助
- •
Junghee Ryu(首席执行官)
运营支持
我们感谢运营支持团队提供的日常支持,使项目得以顺利进行:
- •
Changhyun Hong、Jeeye Lee、Jeongwan Choi、Jihye Song、Jiyeon Olivia Chun、Junsang Yoo、Sara Jang、Sunjeong Kim、Sunyoung Jeon、Youngwoong Cho
业务与合作伙伴关系
我们感谢业务与合作伙伴关系团队——战略、销售合作、机器人部署、分支运营和业务研究——在合作伙伴关系、市场对齐以及围绕 RLDX-1 发布的现场协调方面所做的工作。
- •
Amine Benari, Beopryong Kim, Carl Choi, Donghyun Kim, Eunkyu Ko, Hahyun Park, Hajin Kim, Hayeon Kim, Hayoung Jin, Hina Koizumi, Hoon Lee, Hyunji Song, Ilgyu Shin, Inseok Lee, Iris Cho, Jaewon Lee, Jehoon Kim, Jihoon Lee, Maako Hori, Mark Lee, Namho Kim, Seeun Sung, Seonggyeong Kim, Seungbeen Jeon, Seungwoo Choi, Shogo Koda, Suhwan Choi, Suyeon So, Taehyun Jung, Yiroom Yum, Yongjae Byeon, Younghoon Shin, Younseo Kim
学术顾问
我们感谢学术顾问及其实验室的研究人员,他们在RLDX-1的成型过程中提供了宝贵的指导与讨论:
- •
Hanbyul Joo(首尔大学)、Jongwoo Lim(首尔大学)、Minsu Cho(浦项工业大学)、Sungjoon Choi(高丽大学)
硬件合作伙伴
我们感谢WIRobotics(包括Yong-Jae Kim)在RLDX-1的整个开发过程中提供ALLEX机器人平台及持续的硬件支持。
结语
我们同样感谢RLWRLD的每一位成员,以及Jinwoo Shin教授领导的ALIN-Lab(韩国科学技术院算法智能实验室)的研究人员——无论是否在此列名——他们的工作、讨论与支持使本次发布成为可能。
附录B 数据集详情
在此,我们描述预训练和中期训练过程中所用数据集的细节,涵盖图像预处理(第B.1节)、公开真实世界数据(第B.2节)以及合成数据(第B.3节)。
B.1. 图像预处理
为降低训练期间的视觉token预算,我们遵循Qwen3-VL的smart_resize流程[bai2025qwen3],对所有输入帧进行离线缩放。给定分辨率为 的源图像,我们计算目标尺寸,使得在尽可能保持原始宽高比的同时, 和 均被约束为 的整数倍。具体而言,如果保持宽高比后的取整分辨率已满足像素预算,则将每个维度四舍五入到最接近的 的倍数。这样每帧最多产生 个视觉token。
B.2. 公开真实世界数据详情
在表5中,我们描述了用于RLDX-1预训练的Open-X-Embodiment(OXE;o2024open)数据混合的详细数据集比例。我们遵循Octo[team2024octo]和OpenVLA[kim2024openvla]中使用的、通常被称为OXE Magic Soup的OXE数据集混合方案。
| 数据集 | 比例 (%) | 数据集 | 比例 (%) |
| Fractal | 16.00 | DobbE | 2.00 |
| Kuka | 16.00 | TOTO | 2.00 |
| BridgeV2 | 16.00 | VIOLA | 1.20 |
| BC-Z | 08.00 | Berkeley Autolab UR5 | 1.20 |
| FMB | 08.00 | IAMLab CMU Pickup-Insert | 1.00 |
| Language Table | 05.00 | NYU Franka Play | 0.80 |
| Stanford HYDRA | 05.00 | Berkeley Fanuc Manipulation | 0.80 |
| TACO Play | 03.36 | Jaco Play | 0.60 |
| FurnitureBench | 02.80 | Berkeley Cable Routing | 0.32 |
| RoboTurk | 02.60 | Austin BUDS | 0.24 |
| Austin Sailor | 02.40 | CMU Stretch | 0.16 |
| UT Austin MUTEX | 02.40 | DLR EDAN Shared Control | 0.08 |
| Austin Sirius | 02.00 | UCSD Kitchen | 0.04 |
B.3. 合成数据细节
为了针对特定真实世界场景生成多样化的合成数据,我们使用预训练的视频生成模型 [nvidia2025cosmospredict2, ali2025world] 从现有数据集中未见过的初始图像生成新的轨迹。由于现成的视频扩散模型不足以捕捉以自我为中心的机器人视角和操作动态,我们在机器人演示数据上对它们进行微调,为 GR-1 和 ALLEX 人形机器人训练专用模型。
GR-1 视频微调
我们在 Cosmos-Predict2-14B [nvidia2025cosmospredict2] 的基础上构建 GR-1 视频模型,并在两个公开来源上进行微调:来自 ActionNet [fourier2025actionnet] 的 3,027 个视频和来自公开 NVIDIA GR-1 数据集 [jang2025dreamgen] 的 92 个视频。我们使用 Qwen3-VL 8B Instruct [bai2025qwen3] 对所有视频重新生成字幕,分为短、中、长三种变体,在训练过程中随机采样其中一种。我们应用秩为 32 的 LoRA [hu2022lora] 微调,在 432x768 分辨率下以 93 帧片段进行训练,共训练 10K 步,批量大小为 4。
ALLEX 视频微调
我们在 Cosmos-Predict2.5-2B [ali2025world] 的基础上构建了 ALLEX 视频模型。由于仅靠 ALLEX 数据可能任务覆盖范围有限,我们混合了来自其他具身形态的演示数据,使模型能够接触到更广泛的操作动作:我们将内部 ALLEX 数据和 OpenArm 数据与上述 3,027 个 ActionNet 片段以 2:1:1 的比例进行组合。为了提供更详细的任务描述,我们使用 Qwen3-VL 8B Instruct 或 Qwen3-VL 30B-A3B Instruct [bai2025qwen3] 对所有视频重新生成字幕,分为短、中、长三种变体,并在训练过程中随机采样一种。在训练阶段,我们采用两种互补策略采样 93 帧片段:均匀采样以等间隔选取 93 帧以覆盖整个片段,而随机采样则以 16 FPS 从随机起始时间点连续采样 93 帧,以获得细粒度的时间连续性。我们在 432×768 分辨率下以 8 的批量大小对模型进行 20K 步的完全微调。
动作标注
由于生成的视频缺乏真实动作标签,我们使用逆动力学模型(IDM)对其进行标注,该模型可预测两个观测值之间的动作。遵循 jang2025dreamgen 和 kim2026robocurate 的方法,我们使用一个带有 SigLIP-2 [tschannen2025siglip] 视觉编码器的 0.1B 扩散 Transformer 作为我们的 IDM,并采用流匹配目标进行训练,该目标以一对输入帧为条件对中间动作序列进行去噪。对于 GR-1,我们使用公开可用的预训练检查点666https://huggingface.co/seonghyeonye/IDM_gr1;而对于 ALLEX,我们在内部遥操作数据(见第 3.2 节)上从头训练 IDM,动作视界为 ,批量大小为 ,梯度步数为 K。这产生了将生成的视频与伪动作标签配对用于下游策略训练的合成数据。
视频质量过滤
我们使用 Gemini API [googleGeminiAPI] 根据两个标准评估每个生成的视频,输入 16 帧均匀采样的帧用于评估指令遵循能力,输入 8 帧用于评估轨迹合理性。
运动一致性过滤
我们使用二元交叉熵损失函数,在分辨率为、时间步长为 4 的 16 帧片段上训练注意力探针。我们采用 AdamW 优化器 [loshchilov2017decoupled],批次大小为 32,学习率为 。
附录 C 强化学习 (RL) 细节
评论家训练
我们使用 gemma3-4b-it [team2025gemma] 作为进度估计(评论家)的 VLM 骨干网络。我们对所有可训练组件(完整目标,包括视觉编码器)应用 LoRA [hu2022lora],秩为 。我们仅在目标任务的成功演示上训练模型 1 个周期,学习率为 。
策略训练
我们使用 AdamW 优化器 [loshchilov2017decoupled] 对预训练的 RLDX-1 进行最多 30K 步(约 3 个周期)的训练,学习率为 ,全局批次大小为 128,并采用余弦调度,前 5% 的训练步数为线性预热。我们在整个策略训练过程中冻结视觉编码器。我们训练策略以生成大小为 40 的动作块。
1:演示数据集 ,迭代次数
2:预训练策略 ,VLM 评论家
3:在初始值训练上训练
4:标注优势值
5:使用优势标签在 上训练
6:对于 执行
7:收集轨迹
8:
9:在成功案例上训练以优化值
10:重新标注轨迹
11:使用优化策略在 上训练
12:结束循环
策略推理
在推理时,我们仅执行每个块中的前 20 个预测动作,然后重新查询策略以生成一个动作块。我们通过实时分块(RTC;black2025real)进行重新规划,其配置与本工作中所有其他实验相同。
附录 D 参数高效微调
我们研究了如何通过参数高效微调方法,以更少的计算量将 RLDX-1 适配到下游任务。表 6 报告了在 Robocasa Kitchen 数据集上,全量微调与三种 PEFT 变体的成功率、可训练参数量和峰值显存占用,其中“Full FT”指对骨干 VLM 的顶部 4 层进行全量微调(与主论文设定一致)。首先,仅对动作模型应用 LoRA,同时对骨干顶部 4 层进行全量微调,即可恢复全量微调的性能:在 rank=64 时达到 62.67% 的成功率,同时可训练参数量减半(1,150.5M vs. 2,376.0M)。其次,冻结骨干网络会严重限制适配能力:最佳冻结配置仅达到 36.42%,与全量微调相差 26.25 个百分点,这表明当下游任务分布偏离预训练分布时,骨干网络的更新至关重要。第三,同时对骨干顶部 4 层和动作模型应用 LoRA 实现了最佳效率与性能权衡:在 rank=64 时,仅训练总参数的 5.72%,使用全量微调 batch=32 时 41.3% 的显存(35.93 GiB vs. 87.10 GiB),即可达到 55.33% 的成功率。在 batch size=1 时,同一配置可适配在 24 GiB 显存内,使得在消费级硬件上进行单 GPU 适配成为可能。
| 骨干 VLM | 动作模型 | 成功率 | 可训练参数量 () | 显存 (batch 32) | 显存 (batch 1) |
| 全量微调 | 全量微调 | 62.67% | 2,376.0 | 87.10 GiB | 56.77 GiB |
| 冻结 | LoRA, rank=8 | 21.25% | 0,361.7 | 27.22 GiB | 22.94 GiB |
| 冻结 | LoRA, rank=64 | 36.42% | 0,378.4 | 27.48 GiB | 23.31 GiB |
| 全量微调 | LoRA, rank=8 | 60.17% | 1,133.7 | 76.33 GiB | 36.83 GiB |
| 全量微调 | LoRA, rank=64 | 62.67% | 1,150.5 | 76.60 GiB | 37.20 GiB |
| LoRA, rank=8 | LoRA,rank=8 | 45.75% | 0,364.1 | 35.39 GiB | 23.11 GiB |
| LoRA,rank=64 | LoRA,rank=64 | 55.33% | 0,397.8 | 35.93 GiB | 23.71 GiB |
附录 E 测试时采样
E.1. 测试时采样技术
除了通过 RL 训练来提升最终性能之外,一个自然的互补方向是通过推理时推理(即 Best-of- (BoN) 采样)来实现:从策略中抽取多个动作块候选,并执行由评判器评分最高的那个 [chen2023offline, nakamoto2024steering]。DEAS [kim2025deas] 通过在视觉-语言-动作模型(VLA)特征上离线训练一个块级评判器,实例化了这一模式。我们研究这种测试时评判器是否能在 RL 后训练的基础上提供正交的性能提升。由于我们不进行额外的在策略微调,评判器必须在其离线训练数据与后 RL 策略的在策略样本之间的分布不匹配下保持稳定。为此,我们采用了一种隐式 Q 学习(IQL;kostrikov2022offline)风格的目标函数,该函数使评判器偏向于保守的、分布内的值,而无需覆盖整个动作空间。我们进一步扩展了评判器,通过条件化 VLA 视觉-语言特征,并对动作块(而非单步动作)进行评分 [zhao2023learning]。我们根据 [li2025qchunking] 的时间扩展评判器公式,同时使用了块内折扣和块级折扣。
在推理时,我们将 RLDX-1 的噪声采样温度提高到 1.5–2.0,以增加候选块的多样性,并执行样本中 Q 值最高的那个。对于 VLA 实验,我们将 expectile 设置为 ,并使用折扣(块内)和(块级),为分布性评判器头部采用通用支持类型,动作块长度与 GR00T N1.6 块大小匹配。我们使用 AdamW 优化器进行优化,学习率为 ,批大小为 ,在 RoboCasa 上训练 K 步,在真实机器人设置上训练 K 步。
E.2. 实现细节
架构
我们在冻结的、基于 RECAP1 后训练的 RLDX-1 骨干模型之上实例化价值函数和 Q 函数。对于每个观测,我们沿序列维度对骨干模型最后一层的 token 状态进行平均池化,以获得单一的视觉-语言(VL)表示。然后,我们使用一个基于具身条件控制的 4 层 MLP,将其投影到一个共享的 64 维 VL 嵌入向量中。得到的表示与本体感受状态拼接,形成价值网络的输入。价值函数使用一个由 4 个宽度为 256 的预归一化残差块组成的 BRONet 来处理这个拼接后的向量。Q 函数额外接收一个动作块,从而能够评估时间上扩展的动作。我们采用双评论家设置,并聚合 TD 目标和 BoN 评分的预测结果。关键在于,它使用相同的归一化动作表示,确保了训练和推理之间的一致性,无需额外的编码或解码。基于具身条件控制的 VL 编码器支持最多 36 个具身槽位,这些槽位在任务间共享。
优化
骨干模型的特征从经过 RECAP1 后训练的 RLDX-1 检查点中提取一次,并缓存到磁盘上,因此评论家训练从不通过 VLM 进行反向传播。我们使用 AdamW 优化器进行优化,学习率为(从 范围内的搜索中选取),权重衰减为 ,批次大小为 64,梯度步数为 ,采用线性预热,梯度裁剪阈值为 1.0。
强化学习超参数
我们遵循 DEAS 方法:块内折扣因子 ,块级折扣因子 ,期望分位数 ,以及目标评论家 Polyak 更新率 。奖励被平移至 ,以便 HL-Gaussian 评论家头覆盖 个原子,并采用高斯平滑的箱宽;分类 logits 通过对箱中心取期望值,解码为标量 和 值。
BoN 推理
对于 BoN 推理,策略的流匹配初始噪声通过一个温度参数(最佳点 )进行乘法重新缩放;骨干模型和动作头在 平铺的观测批次上运行一次,以便所有候选块共享一次骨干模型的前向传播。具体来说,遵循 SAC 风格的动作采样,我们从 中抽取流匹配初始噪声,而不是标准的 。
E.3. 实验结果
我们研究了是否可以通过将 RLDX-1 策略与一个经过学习的 Q 值评判器配对,并执行最佳动作选择,从而用测试时计算来换取任务性能:在每个决策步骤,我们以特定温度从策略中采样候选动作片段,用评判器对每个片段进行评分,然后执行排名最高的那个。为了校准采样超参数,我们首先在 RECAP3 策略上进行了离线分析,测量了样本间的动作多样性以及由此产生的 Q 值分布范围(作为温度的函数)。在图 23 中,我们发现动作多样性随温度稳步增长,但最佳动作片段与平均动作片段之间的 Q 值差距仅在特定温度下才变得清晰可辨,而逐回合的轨迹证实,这种改进在帧之间分布得相当均匀,并非由少数异常步骤驱动。然而,在如此高的温度下操作物理机器人并不安全,因为偶尔会出现分布外的动作,因此我们将温度固定为某个值,作为可开发多样性与安全执行之间的实际折衷方案。
我们在灯泡旋拧任务上,对 RECAP1 到 RECAP3 阶段的 BoN 采样进行了评估。如图 24(a) 所示,其效果在很大程度上取决于策略的收敛程度。对于 RECAP1,测试时采样将平均尝试次数从 [原文缺失] 降低到 [原文缺失],表现优于 RECAP2。相比之下,对 RECAP2 和 RECAP3 应用同样的流程会降低性能,尝试次数分别增加了 [原文缺失] 和 [原文缺失]。此外,如图 24(b) 所示,在 RECAP1 上将采样数量从 [原文缺失] 扩展到 [原文缺失] 并未带来进一步的收益([原文缺失] 次尝试),这表明收益会迅速饱和,而不仅仅是搜索范围更广的问题。综合来看,这些结果表明测试时采样主要起到一种探索机制的作用。它通过恢复批评模型可以利用的缺失模式来改善收敛程度较低的策略的性能,但也会通过引入随机性使动作偏离最优值,从而降低收敛良好的策略的性能。这种行为与其他领域的类似观察结果一致 [yue2025does]。因此,BoN 是对额外 RL 训练的补充,而非替代。
附录 F 内核优化
在表 7 中,我们描述了详细的内核优化结果。
| 内核 | 未融合操作 | 融合操作 |
| fused_vision_attention | ||
| fused_llm_attention | ||
| fused_add2_layernorm | ||
| fused_add2_rmsnorm | ||
| fused_add3_rmsnorm | ||
| fused_memory_attention | ||
| grouped_swiglu | ||
| fused_mlp_swiglu |
附录 G 评估与分析
G.1. 模拟基准测试详情
我们在以下仿真基准上评估了我们的方法。
- •
LIBERO [liu2023libero] 是一个基于 Franka Research 3 机械臂(配备平行夹爪)的单臂桌面操作基准。它包含 40 个任务,分为四个子基准(空间、物体、目标和长时)。我们使用一个固定的前视摄像头和一个分辨率为 256×256 的手腕摄像头。我们在每个子基准的拼接训练数据集上训练 RLDX-1,对每个任务评估模型 50 次,并报告平均成功率。对于基线方法,我们在与 RLDX-1 相同的设置下,按照 GR00T N1.6 的官方实现进行复现;其他结果取自各自的官方代码库。
- •
LIBERO-Plus [fei2025libero] 是一个基于 LIBERO 构建的基准,用于衡量在多种扰动下的鲁棒性。具体来说,它评估了在物体布局、摄像头视角、机器人初始状态、语言指令、光照条件、背景纹理和传感器噪声发生变化时的鲁棒性。 和 -FAST 的结果取自原始论文 fei2025libero;其余方法(包括 RLDX-1)均使用与 LIBERO 中相同的检查点,在所有 10,300 个扰动任务上进行评估。
- •
SIMPLER Google-VM/VA [li2024evaluating] 是一个基于 Google 机器人(配备自我中心视角摄像头)的单臂夹爪基准。它包括 4 个任务(靠近、拿起可乐罐、打开抽屉和关闭抽屉)。我们遵循 li2024evaluating 中的常见设置,在 Fractal 数据集 [brohan2022rt] 上训练 RLDX-1,并在每个任务上进行评估。对于视觉匹配(VM),我们通过改变基准的随机种子,对每个任务评估模型 200 次,并报告平均成功率。对于变体聚合(VA),我们对每个任务扰动评估 RLDX-1 100 次,并报告平均成功率。基线分数引用自 community2026starvla、yang2025vlaser、nvidia2025gr00t16。
- •
SIMPLER WidowX [li2024evaluating] 是一个基于 WidowX 机器人、采用单个第三人称摄像头视角的单臂夹爪基准测试。它包含 4 个任务(勺子放在毛巾上、胡萝卜放在盘子里、叠方块、把茄子放进篮子里)。我们遵循 li2024evaluating 中的常见设置,在 BridgeV2 数据集 [walke2023bridgedata] 上训练 RLDX-1,通过改变基准测试的随机种子对每个任务评估模型 200 次,并报告平均成功率。基线分数取自 community2026starvla、chen2025villa、nvidia2025gr00t16。
- •
RoboCasa Kitchen [nasiriany2024robocasa] 是一个基于配备夹爪的移动 Panda 机械臂(PandaOmron)构建的单臂厨房操作基准测试。它包含 24 个任务,涉及拾取与放置、开关门和抽屉、以及电器控制等厨房技能。我们使用两个固定的外部摄像头视角(左侧和右侧),以及一个腕部摄像头,所有分辨率均为 256×256。我们在由每个任务 300 个机器生成的演示数据拼接而成的数据集上训练 RLDX-1,并报告每个任务 50 个回合的平均成功率。基线方面,GR00T N1.6 的结果取自官方仓库,其他分数取自 kim2025contrastive、jang2025contextvla。
- •
GR-1 Tabletop [bjorck2025gr00t] 是一个 GR-1 人形机器人桌面操作基准测试。该基准测试包含 24 个桌面任务,包括 18 个物体重新排列任务和 6 个铰接物体操作任务。我们按照 bjorck2025gr00t 的做法,使用分辨率为 256×256 的自我中心摄像头。我们在由每个任务 1000 个机器生成的演示数据拼接而成的数据集上训练 RLDX-1,并报告每个任务 50 个回合的平均成功率。基线方面,GR00T 变体的结果取自官方仓库,而其他变体的结果则严格按照其官方实现,在与 RLDX-1 相同的设置下复现得出。
- •
RoboCasa365 [nasiriany2026robocasa365] 是一个大规模的家居操作基准测试,它将 RoboCasa Kitchen 扩展到了更广泛的日常厨房任务和环境中。遵循官方 RoboCasa365 排行榜协议,我们在包含 300 个任务的人类预训练数据集上训练了 RLDX-1,该数据集为每个任务提供了 100 次演示。然后,我们在包含 50 个任务的多任务基准测试上评估模型,这些任务分为原子-已见、组合-已见和组合-未见三个子集,并报告平均成功率。对于基线方法,-FAST 的结果是通过在 RLDX-1 相同的设置下严格遵循其官方实现复现的,其他分数则引用自 RoboCasa365 排行榜 [nasiriany2026robocasa365]。
实现细节
我们通过在各项基准上对预训练的 RLDX-1 进行微调来评估其性能。遵循预训练的实现方式,我们冻结了视觉编码器和大语言模型(LLM)主干网络,仅对 LLM 主干网络最顶部的四层进行解冻。除非另有说明,我们使用 AdamW 优化器 [loshchilov2017decoupled] 对模型进行 60K 步的训练,全局批大小为 1024,学习率采用余弦调度,并在训练的前 5% 步数内进行线性预热。由于单一的超参数设置可能无法在具有不同数据集规模、轨迹长度、任务分布和机器人形态的仿真基准上达到最优,我们遵循 intelligence2025pi_ 和 nvidia2025gr00t16 的做法,针对每个基准进行特定的超参数调优。对于每个基准,我们报告其最佳性能配置。具体而言,在迭代次数和批大小方面,我们对三种情况采用了基准特定的设置:LIBERO(以及 LIBERO-Plus)使用全局批大小 256,SIMPLER Google-VM/VA 训练 20K 步,RoboCasa365 则遵循官方实现,训练 250K 步且全局批大小为 196。我们还观察到,本体感觉状态丢弃对 SIMPLER Google-VM/VA 和 GR-1 Tabletop 有益。因此,我们将这些基准的状态丢弃率设置为 0.5。在评估方面,我们发现使用更多去噪步数对 SIMPLER WidowX 和 RoboCasa Kitchen 有帮助,因此对动作生成使用了 10 步去噪。此外,除 GR-1 Tabletop 外,我们对所有基准都使用了固定间隔的去噪时间步。对于 GR-1 Tabletop,我们发现从训练时使用的相同时间步分布中采样时间步,即 ,能带来更好的性能(58.7% 对比 58.0%),而在其他基准上性能相当或略有下降(差异在 1% 以内)。我们还仅使用了从生成的 16 个动作块中提取的部分动作范围:SIMPLER 使用 2 个块,LIBERO、LIBERO-PLUS 和 GR-1 Tabletop 使用 8 个块。我们在表 8 中总结了每个仿真基准的特定超参数配置。
| LIBERO 与 LIBERO-Plus | SIMPLER Google-VM 与 VA | SIMPLER WidowX | RoboCasa Kitchen | GR-1 Tabletop | RoboCasa365 | |
| 训练 | ||||||
| 迭代次数 | 60,000 | 20,000 | 60,000 | 60,000 | 60,000 | 250,000 |
| 批次大小 | 256 | 1024 | 1024 | 1024 | 1024 | 192 |
| 状态丢弃率 | 0.0 | 0.5 | 0.0 | 0.0 | 0.5 | 0.0 |
| 推理 | ||||||
| 去噪步数 | 4 | 4 | 10 | 10 | 4 | 4 |
| 去噪时间步采样 | 固定 | 固定 | 固定 | 固定 | Beta(1.5, 1.0) | 固定 |
| 动作执行范围 | 8 | 2 | 2 | 16 | 8 | 16 |
G.2. OpenArm 实验细节
任务与评估细节
所有任务均被设定为在包含三个物体的桌面场景中,以语言为条件的抓取与放置任务。在训练阶段,我们从四个物体类别(包括瓶子、零食、杯子和玩偶)中收集抓取与放置的演示数据,每个类别包含四个物体实例。在每个回合中,一个目标物体和两个来自不同类别的干扰物被放置在三个可能的初始位置上,机器人被指令将目标物体移动到一个指定的目标位置。某些配置需要双臂协调,特别是当目标物体和目标位置位于工作空间相对两侧时。在评估阶段,我们对每个任务进行 24 次试验。对于定向抓取与放置(货架),我们评估两个不同的目标物体类别,每个类别进行 24 次试验,总共产生 48 次评估试验。
训练演示
我们为四个任务族收集了演示数据,每个任务族对应一个目标物体类别:瓶子到架子、零食到架子、杯子到碗架以及玩偶到盒子。前两个任务族对应定向拾放(架子),而杯子到碗架和玩偶到盒子分别对应定向拾放(碗架)和基础拾放。对于瓶子到架子任务,我们使用了四个瓶子实例、三个初始桌面位置、四个目标架子位置,以及每种配置两次试验,共获得96个演示。零食到架子任务遵循相同的数据收集协议,使用四个零食实例,同样获得96个演示。对于杯子到碗架任务,我们使用了四个杯子实例、三个初始桌面位置、三个目标碗架槽位,以及每种配置三次试验,共获得108个演示。对于玩偶到盒子任务,我们使用了四个玩偶实例、三个初始桌面位置,以及每种配置四次试验,共获得48个演示。总计,训练集包含四个任务族的348个演示。
硬件设置
我们使用OpenArm人形机器人,它由两个7自由度手臂组成。每个手臂配备一个6自由度Inspire RH56F1手部,机器人头部安装在一个支持俯仰和偏航运动的2自由度颈部上。颈部装有一个ZED 2i立体摄像头,其左右第一人称视角在所有实验中用作视觉输入。在数据收集过程中,我们使用与OpenArm兼容的可穿戴外骨骼ExoArm-7来控制机器人的两个手臂,并使用Manus Pro手套捕捉指尖位置,通过逆运动学计算手指关节角度。在整个数据收集过程中,颈部关节保持固定。
实现细节
我们通过在领域内任务的拼接训练数据集上对预训练的 RLDX-1 进行微调来评估其性能。遵循预训练的实现方式,我们冻结了视觉编码器和大语言模型(LLM)主干网络,仅对 LLM 主干网络的顶部四层进行训练。我们使用 AdamW 优化器 [loshchilov2017decoupled] 对模型进行 30K 步的训练,全局批次大小为 64,学习率采用余弦调度,并在训练的前 5% 进行线性预热。我们将状态丢弃率设置为 0.3。对于基线模型,我们严格遵循官方实现,并以全局批次大小 64 训练 30K 步,与 RLDX-1 的训练步数和批次大小保持一致。
G.3. ALLEX 实验细节
任务与评估细节
所有任务均被设定为语言条件化的操控任务,包含目标物体和特定任务环境。在训练中,我们排除了与每个任务所评估的功能能力不直接相关的因素,例如空间泛化或语言理解能力。在评估中,我们对每个任务进行 24 次试验。对于传送带拾取与放置任务,我们在四种传送带速度下各进行 6 次试验。对于物体入盒选择任务,我们在三个位置各进行 8 次试验。对于卡片滑动拾取任务,所有试验均在两个训练位置中较低的位置进行,以确保硬件安全。
训练演示数据
我们在特定任务条件下为每个任务收集演示数据。对于传送带拾取与放置任务,我们使用两种不同的速度设置(S1, S4)收集了 40 个演示。对于物体入盒选择任务,我们收集了 90 个演示,每个盒子对应 30 个演示。对于卡片滑动拾取任务,我们使用两种不同的桌面高度设置(80cm, 75cm)收集了 72 个演示。对于壶到杯倾倒任务,我们收集了 62 个演示。出于安全考虑,在倾倒任务中使用小塑料球代替液体(例如咖啡)。
硬件设置
对于 ALLEX 这款高自由度上半身人形机器人,我们总共使用 48 个关节进行操控,包括双 7 自由度手臂、两个 15 自由度五指手、一个 2 自由度腰部以及一个 2 自由度颈部。该基准测试中唯一使用的摄像头是安装在头部的立体摄像头,用于提供第一人称视角,不配备腕部或侧面摄像头。从电机电流估算出的关节扭矩被用作物理信号,使用了全部 48 个自由度的数值。
实现细节
我们以中间训练阶段初始化的 RLDX-1 模型为基础进行微调,每个任务训练 30K 步,全局批次大小为 128,使用 AdamW 优化器,学习率为 。采用余弦学习率调度,并包含 5% 的预热步数。对于每个任务,在微调和评估期间仅启用与目标功能相关的模块,其余模块均被禁用。我们将状态丢弃率设置为 0.8。为了促进 ALLEX 人形机器人动作的平滑执行,采用实时分块 [black2025real] 作为默认推理策略。对于基线模型,我们遵循官方实现的训练方案,并在与 RLDX-1 相同的训练设置下对模型进行 30K 步的微调。
G.4. Franka Research 3 实验细节
任务与评估细节
所有任务均被设定为语言条件化的操控任务,包含目标物体和特定任务环境。评估时,除旋转追踪和乒乓球游戏外,每个任务进行 24 次试验。对于旋转追踪,我们评估了 96 次交互中的表现,这些交互涉及对顺时针或逆时针运动的响应,针对 4 个初始位置各进行 24 次试验,并测量成功率。对于乒乓球游戏,我们评估了 54 次交互中的表现,每次交互涉及对球到达右墙的响应,并测量成功率;所有评估交互在训练期间均未见过。对于杯子交换,我们针对每个初始位置进行 12 次试验,测量完全成功率。对于猜球游戏,我们针对 3 个球壳位置,每个位置进行 8 次试验,测量选择成功率。对于插头插入和鸡蛋拾取与放置任务,我们在 3 个不同位置进行评估,每个位置进行 8 次试验,测量成功率。
训练演示
我们针对每个任务在特定任务条件下收集演示数据。对于旋转追踪任务,我们收集了64个演示。每个演示包含三次交互序列,运动方向为顺时针或逆时针。训练过程中,我们使用了四种不同的初始物体位置。对于乒乓球游戏任务,我们收集了50个演示。每个演示包含5个交互序列,其中球会到达右侧墙壁。对于杯子交换任务,我们针对2种不同的初始位置收集了60个演示。每个演示都涉及重叠轨迹,如果没有记忆功能则容易混淆。对于猜杯游戏任务,我们收集了60个演示,每个目标杯子对应20个演示。对于插头插入任务,我们收集了100个演示,插头的拾取位置各不相同。对于鸡蛋拾放任务,我们收集了60个演示,物体位置各不相同。
硬件配置
我们遵循 DROID [khazatsky2024droid] 的配置,使用一台配备 Robotiq 2F-85 夹爪的 7 自由度 Franka Research 3 机械臂。在此配置中,我们在夹爪上安装了一个 AnySkin 触觉传感器 [bhirangi2025anyskin],同时机械臂本身支持每个关节的力矩传感。具体来说,对于触觉信号,我们使用左侧夹爪提供的信号,该信号包含一个 15 维特征向量,由五个传感单元获取,每个单元测量一个 3 维力向量(即 )。对于力矩信号,机械臂提供一个 7 维向量(每个关节一个标量力矩值),单位为牛顿米。我们在图 12 中展示了硬件配置。
实现细节
我们对中期训练的 RLDX-1 进行后训练,每个任务训练 30K 步,全局批量大小为 64,使用 AdamW 优化器,学习率为 。采用余弦学习率调度,并包含 5% 的预热阶段。对于每个任务,在微调和评估期间仅启用与目标功能相关的模块,其余模块被禁用。我们将状态丢弃率设置为 0.3。对于基线方法,我们严格遵循官方实现,并以全局批量大小 64 训练 30K 步,使其训练步数和批量大小与 RLDX-1 保持一致。
G.5. 额外的 ALLEX 实验
任务与评估细节
我们在“杯壶倒水”任务的抓取子任务上进行评估,这是一个双臂操作任务,ALLEX 人形机器人需要从桌面上依次抓取一个纸杯和一个咖啡壶。为了评估对空间变化的鲁棒性,我们在 3 个杯位(间距 5 厘米)和 4 个咖啡壶位(间距 9 厘米)上进行评估,每个配置进行 2 次试验,共计 24 次试验。如果机器人成功抓取杯子和咖啡壶,则每次试验记为完全成功(1.0 分);如果仅抓取杯子,则记为部分成功(0.5 分);否则记为失败(0.0 分)。
训练数据
我们首先通过遥操作收集真实的“杯壶倒水”演示数据,杯子和咖啡壶放置在围绕标称位置的高斯分布(10 厘米)采样点上。此外,我们还通过 ALLEX 视频生成模型的多轮 rollout 生成合成数据(训练细节见 B.3 节),其中每一轮都复用前一轮的最终帧作为条件。我们使用两轮生成,并采用子任务特定的提示词(先抓取并倾斜,再倒水并归位),以缩小与真实演示的长度差距,同时保持逼真的运动速度。需要说明的是,我们仅对此合成数据应用了视频质量过滤,未进行任务或场景增强。
实现细节
我们对预训练的 RLDX-1 模型进行微调,训练 30K 步,全局批次大小为 128,使用 AdamW 优化器,学习率为 ,并采用余弦学习率调度,预热比例为 5%。我们将状态丢弃率设为 0.4,动作视界设为 40。在协同微调配置中,我们以 50/50 的比例混合真实数据和合成数据,并通过每个数据集的具身标签将各数据集路由到对应的具身槽位。
结果
如表 9 所示,我们发现使用合成数据进行联合微调可将整体成功率从 66.7% 提升至 83.3%。这一提升主要源于失败案例的大幅减少(从 7 降至 2),同时完全成功的案例也有所增加(从 9 增至 14)。这表明,我们的合成数据通过扩充成功轨迹,增强了策略的空间泛化能力,使其能够在杯子和咖啡壶的不同位置上实现稳定的抓取。
| 微调数据 | 完全成功 | 部分成功 | 失败 | 得分 | 成功率 |
| 真实数据 | 9 | 8 | 7 | 16.0 / 24 | 66.7% |
| 真实数据 + 合成数据 | 14 | 8 | 2 | 20.0 / 24 | 83.3% |
G.6. 更多仿真结果 / 完整结果
批量大小的影响
我们在此研究训练批量大小如何影响仿真基准的性能。如表 10 所示,我们发现使用更大的批量大小训练 RLDX-1 可以提升性能。
| 批量大小 | LIBERO | Robocasa Kitchen | GR-1 Tabletop |
| 64 | 97.4 | 66.9 | 36.8 |
| 256 | 97.8 | 69.6 | 53.2 |
| 1024 | - | 70.6 | 58.7 |
完整结果
在表 11、12、13、14 和 15 中,我们提供了 RLDX-1 在仿真基准上的完整结果。
| LIBERO | LIBERO-Plus | ||||||||||||
| 模型 | 长序列 | 空间 | 物体 | 目标 | 平均 | 相机 | 机器人 | 语言 | 光照 | 背景 | 噪声 | 布局 | 总计 |
| RLDX-1(我们的方法) | 95.3 | 98.0 | 99.3 | 98.4 | 97.8 | 75.0 | 91.8 | 92.2 | 97.1 | 95.5 | 80.3 | 80.7 | 86.7 |
| Google-VM | Google-VA | WidowX | |||||||||||||
| 模型 | 移近 | 关闭抽屉 | 打开抽屉 | 拿起可乐罐 | 平均 | 移近 | 关闭抽屉 | 打开抽屉 | 拿起可乐罐 | 平均 | 胡萝卜放盘子 | 茄子放篮子 | 勺子放毛巾 | 叠方块 | 平均 |
| RLDX-1(我们的方法) | 92.0 | 78.5 | 58.5 | 97.0 | 81.5 | 90.9 | 93.2 | 32.3 | 93.4 | 77.4 | 83.0 | 52.0 | 88.5 | 64.0 | 71.9 |
| 任务 | RLDX-1(我们的方法) |
| 抓取与放置(8 个任务) | |
| 从橱柜到台面 | 044.0 |
| 从台面到橱柜 | 064.0 |
| 从台面到微波炉 | 038.0 |
| 从台面到水槽 | 072.0 |
| 从台面到炉灶 | 066.0 |
| 从微波炉到台面 | 026.0 |
| 从水槽到台面 | 076.0 |
| 从炉灶到台面 | 056.0 |
| 打开或关闭(6项任务) | |
| 关闭双开门 | 094.0 |
| 关闭抽屉 | 098.0 |
| 关闭单开门 | 100.0 |
| 打开双开门 | 062.0 |
| 打开抽屉 | 080.0 |
| 打开单开门 | 080.0 |
| 其他(10项任务) | |
| 按下咖啡机按钮 | 098.0 |
| 咖啡杯盛放 | 082.0 |
| 咖啡杯放置 | 044.0 |
| 关闭微波炉 | 096.0 |
| 关闭水槽龙头 | 096.0 |
| 关闭炉灶 | 022.0 |
| 打开微波炉 | 086.0 |
| 打开水槽龙头 | 100.0 |
| 打开炉灶 | 024.0 |
| 转动水槽出水口 | 090.0 |
| 总计(24项任务) | 070.6 |
| 任务 | RLDX-1(我们的方法) |
| 物体重新排列(18项任务) | |
| 砧板放入锅 | 60.0 |
| 砧板放入篮子 | 66.0 |
| 砧板放入分层篮子 | 46.0 |
| 砧板放入平底锅 | 72.0 |
| 砧板放入纸板箱 | 64.0 |
| 餐垫放入碗 | 72.0 |
| 餐垫放入盘子 | 70.0 |
| 餐垫放入篮子 | 56.0 |
| 餐垫放入分层架子 | 24.0 |
| 盘子放入平底锅 | 48.0 |
| 盘子放入纸板箱 | 64.0 |
| 盘子放入碗 | 56.0 |
| 盘子放入盘子 | 74.0 |
| 托盘放入分层架子 | 36.0 |
| 托盘放入分层篮子 | 54.0 |
| 托盘放入盘子 | 64.0 |
| 托盘放入纸板箱 | 62.0 |
| 托盘放入锅 | 74.0 |
| 铰接物体操作(6项任务) | |
| 酒瓶放入橱柜 | 56.0 |
| 瓶子放入橱柜 | 64.0 |
| 牛奶放入微波炉 | 48.0 |
| 土豆放入微波炉 | 44.0 |
| 杯子放入抽屉 | 60.0 |
| 罐子放入抽屉 | 74.0 |
| 总计(24项任务) | 58.7 |
| 任务 | RLDX-1(我们的方法) |
| 关闭搅拌机盖子 | 22.0 |
| 关闭冰箱 | 88.0 |
| 关闭烤面包机烤箱门 | 60.0 |
| 咖啡杯放置 | 40.0 |
| 导航厨房 | 72.0 |
| 打开橱柜 | 54.0 |
| 打开抽屉 | 74.0 |
| 打开立式搅拌机机头 | 92.2 |
| 拾放:台面到橱柜 | 68.0 |
| 拾放:台面到炉灶 | 74.0 |
| 拾放:抽屉到台面 | 76.0 |
| 拾放:水槽到台面 | 86.0 |
| 拾放:烤面包机到台面 | 92.0 |
| 滑动洗碗机搁架 | 76.0 |
| 关闭炉灶 | 30.0 |
| 打开电热水壶 | 80.0 |
| 打开微波炉 | 54.0 |
| 打开水槽龙头 | 72.5 |
| 总计(18项任务) | 67.3 |
| 任务 | RLDX-1(我们的方法) |
| 递送吸管 | 10.0 |
| 取出烤面包 | 00.0 |
| 烧开水壶 | 18.0 |
| 装载洗碗机 | 50.0 |
| 打包相同午餐 | 04.0 |
| 准备咖啡 | 00.0 |
| 预浸泡平底锅 | 34.0 |
| 冲洗水槽盆 | 28.0 |
| 擦洗砧板 | 48.0 |
| 煎肉 | 02.0 |
| 设置切割台 | 24.0 |
| 碗叠放入橱柜 | 30.0 |
| 微波炉蒸制 | 14.0 |
| 翻炒蔬菜 | 18.0 |
| 将剩菜存入碗中 | 04.0 |
| 清洗生菜 | 20.0 |
| 总计(16项任务) | 19.0 |
| 任务 | RLDX-1(我们的方法) |
| 摆放面包篮 | 06.0 |
| 摆放茶具 | 02.0 |
| 面包选择 | 14.0 |
| 调味品分类 | 00.0 |
| 刀具选择 | 09.8 |
| 装饰煎饼 | 16.0 |
| 收集餐具 | 00.0 |
| 加热烤肉串三明治 | 00.0 |
| 制作冰柠檬水 | 08.0 |
| 平底锅转移 | 00.0 |
| 分配热狗份量 | 02.0 |
| 按类型回收瓶子 | 06.0 |
| 分离冷冻架 | 00.0 |
| 华夫饼复热 | 08.0 |
| 清洗水果滤盆 | 14.0 |
| 称量食材 | 04.0 |
| 总计(16项任务) | 05.6 |
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org