跳到正文
北京时间
原文
Black Forest Labs:Blog·· 11 天前精选AI 评分67

Black Forest Labs 发布 FLUX 3 Action 开源机器人动作模型

Introducing FLUX 3 Action

AI 导读

Black Forest Labs 发布开源 World Action Model FLUX 3 Action(F3A),单步 7B 检查点在 RoboLab 上达到 38.3%±0.38 成功率。

推荐理由

原文来自模型发布方,完整公开了预训练、微调配方与消融细节,读者可以对照复现或迁移到自己的机器人任务。

正文 · AI 翻译

图像、视频和音频代表了底层现实的不同方面。跨这些模态进行训练,使我们能够建立在比仅靠动作演示更广泛的数据来源之上,从而实现更强的泛化能力。随后,我们通过联合视频-动作训练以及针对目标具身及其对应动作空间的微调,来适配这一基础模型。

在机器人领域,微调方案与权重同样重要。我们发布这份报告以及权重,以使这一过程透明化;从预训练和中期训练阶段,到针对动作预测的微调和推理优化——其中效率尤其是本地部署的关键且必要的能力。此外,我们分析了将快速动作预测与前沿推理模型的规划能力相结合的混合系统——并发现快速控制使具身推理在成本和时间的效率上更高——每美元成功率提升高达 53.64%。

本报告的重点是应用于机器人领域的动作预测——但动作预测也延伸到数字环境。我们探索将游戏作为导航的试验台,展望由视觉信息驱动的计算机使用及其他延迟敏感的智能体和规划能力。

动作策略

当前开放的动作策略迫使你做出选择:世界动作模型(WAMs)在预测未来动作的同时联合预测视频,在诸如 RoboLab⁠1 等基准测试中领先。Cosmos 3 Nano2 在 36.8% 的任务上成功,而 Pi0.53,最强的开放视觉语言动作(VLA)模型,在 28.0% 的任务上成功。但预测视频和动作使 WAMs 变得昂贵。在 B200 GPU 上,FP8 精度的 Cosmos 3 Nano 每秒钟机器人运动所需的处理时间约为 BF16 精度 Pi0.5 的 4.7 倍。当你选择 WAM 时,你付出的是延迟和硬件成本;当你选择 VLA 时,你放弃了近四分之一的成功 rollout。

在视频和动作上联合运行预测,使 WAMs 能够将其通过大规模视频预训练获得的世界理解迁移到动作预测中,而只需有限的额外动作数据监督。但这也导致序列长度变长,从而增加其计算成本。此外,它们通常依赖引导技术,使每次前向传播的成本翻倍,并运行在参数更多的骨干网络上,例如 Cosmos 3 的参数比 Pi0.5 多 4.85 倍。现有解决方案试图限制视频和动作之间的交互,但这样做从根本上改变了 WAMs 的架构和能力。其他方法依赖引导的并行化,但导致硬件成本增加,即便如此,由于其更大架构的计算足迹,也无法达到与 VLAs 相同的速度。

FLUX 3 Action(F3A)简化了这一选择。我们的单步 7B checkpoint 在 RoboLab 上以 38.3% ± 0.38 的成绩超越了所有其他开放策略,而 Cosmos 3 Nano 为 36.8%,同时在工作站和数据中心 GPU 上,相比 Pi0.5,其每秒钟机器人运动的速度提升了 1.34 倍至 2.28 倍,尽管它仍然联合预测视频和动作。请注意,这一速度优势体现在实时因子而非每次调用的延迟上:作为 WAM,它可以预测长达 2.13 秒的运动时域,而 Pi0.5 为 1.0 秒。当延迟不那么重要时,我们的 guidance-distilled checkpoint 将 RoboLab 上的最先进成功率提升至 42.2% ± 0.36。我们的 base 和 guidance-distilled checkpoint 在 FP8 下,在消费级、工作站和数据中心 GPU 上相比 Cosmos 3 Nano 的 FP8 版本提供了 1.52 倍至 3.95 倍的加速。

图 1:跨 GPU 和服务精度的交互式 RoboLab 成功率与推理速度权衡。误差条显示 F3A 的 ±1 SEM;虚线显示新的帕累托前沿,阴影带显示其 ±1 SEM 范围。细灰线显示由 Cosmos 3 和 π0.5 构成的先前帕累托前沿。FP8 视图在 BF16 更快或 FP8 不可用时,对单个模型使用 BF16。标记面积与参数量成正比。底层测量和服务设置见 Inference Efficiency。
模型闭源类型SR%参数量
FLUX 3 Action否WAM42.92%7B
OASIS WAM是VLM + WAM39.0%–
Cosmos3-Nano-Policy否WAM36.8%16B
Phoenix是TAMP+FM34.4%–
BiMind v0.1是VLA33.3%–
π0.5否VLA28.0%3.3B
DreamZero否WAM25.7%14B
Cosmos3-Edge-Policy否WAM22.9%4B
π0-FAST否VLA15.5%3B
GR00T N1.6否VLA7.2%3B
π0否VLA5.0%3.3B
paligemma-binning否VLA3.4%3B
表 1:RoboLab-120 总体成功率。类型和权重可用性遵循 RoboLab leaderboard⁠。

两个主要变化带来了这些结果:第一,骨干网络不到 Cosmos 3 Nano 的一半大小,这得益于我们的多模态 Self-Flow4 预训练,它产生了强大的表征。第二,蒸馏消除了对 guidance pass 的需求,并将采样步数减少到单步,同时不将视频与动作分离。

尽管这推动了动作策略在速度和准确性上的帕累托前沿,但仍有一些任务所有策略,包括我们的策略,都无法独立解决。另一方面,GPT 6 Astra 在使用最大推理努力时,可以解决 Su et al. (2026)5 基准中的所有任务。但单次推理调用每秒钟机器人运动增加约 35.77 秒,且每次成功平均花费 $13.47 和 16 分钟。相比之下,F3A 单独运行每秒钟机器人运动仅需 21.08 毫秒,在 H200 GPU 上以每小时 $3 运行,每次成功平均花费 $0.09 且不到两分钟。在这两分钟的大部分时间里,F3A 处于空闲状态,等待机器人移动。在这种情况下,F3A 甚至可以同时服务另外 47 个 rollout 而不增加成本。主要问题是它无法解决每一个单独任务。

一个有前景的解决方案是让推理器 GPT 6 Astra 将控制权委托给高效策略,如 F3A 或 Pi0.5,仅在需要时介入。在 Su et al. (2026) 的设置中,使用 Pi0.5 时这种混合策略几乎无法改善情况。最佳混合策略每次成功花费 $12.28,而纯推理为 $13.47,且耗时 13.5 分钟而非 14 分钟。

不过,以 F3A 作为策略时,这种委派策略就奏效了。混合策略仍能解决 90% 的所有回合,包括任何纯动作策略都无法独立解决的复杂任务,并将每次成功的成本降至 8.77 美元和 8 分钟,比最佳替代配置便宜 29%、快 40%。最大努力下的纯推理仍能达到最高准确率,因此可靠性与成本之间的权衡依然存在,但 F3A 等改进策略改变了这一权衡所处的位置。

图 2:F3A 与 π0.5 混合策略以及三个推理努力级别下的纯推理策略每 100 美元和每 10 分钟的预期成功次数。

快速策略越好,系统需要推理的就越少。这些探索只是对推理与快速动作预测系统更深层集成的初步一瞥,我们预计在“按需推理、尽可能少推理”方面还有很大的改进空间。下文我们将介绍 FLUX 3 Action 的开发过程以及我们一路上的发现。

从视频预测到动作预测

使用未来观测的预测模型进行决策的想法由来已久1,包括早期的机器人控制演示2,其将动作条件视频预测与模型预测控制相结合。UniPi 则不同3,它使用文本条件视频生成器生成任务执行过程的视频,并通过逆动力学模型(IDM)从生成的帧中恢复可执行动作。UniPi 的一个关键论点是,在大规模非机器人数据上预训练视频模型可以迁移到机器人策略,并提升对未见任务的泛化能力。

后续工作保留了这种大规模视频预训练的使用方式,但将视频与动作预测的结合比“先生成视频再经 IDM”的两阶段流水线更紧密。GR-1、GR-2、WorldVLA、Cosmos Policy 和 LingBot-VA 探索了在单一生成模型中联合预测未来帧与动作4;DreamZero 为这种方法引入了5“世界动作模型”(WAM)这一术语,后续系统如 GigaWorld-Policy 以及 Cosmos 3 的策略变体也采用了该术语6。mimic-video 则保留了逆动力学模型,但将其条件建立在视频模型的潜在特征而非解码帧上,从而在推理时避免了完整的视频合成,作者称之为视频-动作模型(VAM)7。还有一条路线将视频预测视为辅助协同训练任务,并在推理时完全跳过视频生成8。

此前,我们在 FLUX-mimic 设计研究中探索了 FLUX 3 作为带独立动作解码器的 VAM 的性能。另见 mimic 关于 flux-mimic 数据效率的后续研究⁠。在这里,我们研究 FLUX 3 作为联合视频-动作预测的 WAM 的性能,如图 3 所示。

图 3:FLUX 3 Action 联合预测未来视频与机器人动作。

试用控制回路

给定诸如“把红色方块放进左边的箱子”这样的指令,模型利用摄像头图像和关节位置,同时预测电机指令及其视觉结果。机器人执行一定数量的这些动作,然后再次观察,并根据新的观察进行规划。

启动一个任务,丢下一个方块,看着机械臂恢复。改变它再次观察的频率,看看这如何影响它的响应。

控制回路、其摄像头和预测帧的脚本化图示。并非实时模型输出。

发现

预训练与中期训练

预训练紧随 FLUX 3 之后,使用了图像、视频和音频数据的混合,其中视频占训练 token 的 95% 以上。为了评估预训练检查点的动作预测能力,我们遵循与 Cosmos 3 类似的协议:添加随机初始化的动作头,然后在 DROID 上微调。所得检查点在 RoboLab 上进行评估。

对于图 4 中的结果,我们使用了小批量大小和学习率的初步设置。因此,它们并不代表检查点可达到的最大性能。但由于所有运行都使用了可比的设置,我们仍然可以比较它们动作预测的相对能力。

图 4:在可用的随机、预训练和动作中期训练初始化下的 RoboLab 结果。

请注意,在没有预训练的情况下,性能保持在 1% 以下。经过预训练后,这一数字跃升至 11.6%,并继续缓慢但稳定地提升至 12.4%。未预训练检查点的低性能表明,纯 DROID 动作训练受到严重的数据限制,并且表明视频密集的多模态预训练确实可以克服这种限制。

接下来,我们考虑一个以动作为重点的中期训练阶段,在此阶段我们继续在预训练数据与新引入的动作数据的混合上进行训练。我们将 36.95% 的训练样本分配给来自预训练数据的带音频视频,其余 63.05% 分配给带有对齐动作的视频数据。在所有训练样本中,19.55% 来自游戏录制,13.54% 来自带手部姿态标注的自我中心视频,14.03% 来自手持夹爪,15.93% 来自跨 14 种具身的遥操作。由于分辨率和时长不同,相应的 token 比例略有差异;见表 2。

类别样本比例 (%)Token 比例 (%)
联合视频/音频36.9539.00
游戏19.5521.85
自我中心人手13.5413.78
手持14.0313.99
遥操作15.9311.37
表 2:按样本和 token 划分的动作中期训练数据混合。

游戏动作以 102 个维度表示。鼠标移动被离散化为多个区间:前 23 个维度编码沿 x 轴的移动,接下来 17 个维度编码沿 y 轴的移动,每个轴上都有一个专门表示零移动的区间。接下来的两个维度编码鼠标左键和右键,其余 60 个维度编码键盘按键。所有二值通道,包括鼠标区间,在训练期间都会被去量化。

大多数基于姿态的自我中心、手持和遥操作数据集使用 50 维动作空间 EE50。前 25 维用于左侧或主末端执行器,后 25 维用于右侧或次末端执行器。在这 25 维中,前三维编码平移,接下来六维编码旋转,如 Zhou et al. 20191 所述,但使用旋转矩阵的前两行而非前两列。其余 16 维编码手部姿态的角度或夹爪的状态,其中 0 表示夹爪闭合,1 表示夹爪张开。对某一实施例未使用的维度以零填充。

请注意,一些机器人数据集依赖单独的 14 维动作空间,分为左/主臂 7 维和右/次臂 7 维。在这里,我们直接基于 6 个关节状态和一个夹爪状态进行训练,因为我们没有该实施例的前向动力学模型。在所有动作数据集中,动作频率范围为 5 Hz 到 30 Hz。

对于 EE50 动作空间,末端执行器姿态相对于锚定帧表示,锚定帧即最后一个条件帧。我们选择最接近该锚定帧的动作状态作为锚定状态,并将所有其他末端执行器姿态相对于该状态表示。手部关节运动和夹爪值保持绝对值。最后,我们使用实施例特定的 z 分数对每个 EE50 维度进行归一化,如 Punamiya et al. 20252 所述,以相对于锚定状态的带符号位置偏移为索引。

借助 EE50 动作头,我们现在还可以直接评估中期训练检查点的 RoboLab 性能,而无需额外微调。这些评估的结果在图 4 中以阴影线显示。最初,我们观察到 EE50 性能从 0% 快速提升,经过 7.2% 达到 14.7%,而 Joint 微调获得的结果提升有限——仅比其在最后一个预训练检查点中的性能提高了 2.3%。在后续步骤中,我们看到 EE50 和 Joint 微调的性能持续提升,分别达到 17.3% 和 18.6%。我们尚未看到中期训练中性能饱和。

视频和动作的噪声到信号过渡

扩散模型和流模型学习逆转一个按时间索引的前向过程 zt = (1−t)x₀ + tε,该过程将数据 x₀ 与噪声 ε ∼ N(0,1) 混合。根据数据的尺度和结构,该前向过程在噪声与信号之间过渡的 t 区域可能不同。在训练期间,t 从时间步分布中采样,其选择会显著影响模型性能1。

当联合预测视频和动作这两种模态时,我们还必须考虑两种模态之间的相互作用。为了了解这两种模态的信号到噪声过渡区域,我们分别计算两者的 x₀ 重建损失。我们对使用各种时间步分布训练的多个检查点执行此操作,然后对这些检查点取逐点最小值,以获得最小包络 x₀ 损失,作为视频和动作信噪比分布的近似。我们在图 5 中绘制了这些包络,并将其归一化为最大损失 1。

图5:归一化最小 x₀ 损失包络,并拟合了 sigmoid 和高斯 CDF 曲线。浅色线条显示所有贡献的损失曲线。

我们观察到一条 S 形曲线,其过渡点大约在 σ(t) = 3.3 或 t ≃ 0.964 处。假设模型容量在信号过渡高的区域能得到最佳利用,那么一种合理的方法是使用概率密度函数(pdf)与 S 形曲线导数成比例的时间步分布。根据我们用来近似 S 形的函数不同,我们会得到不同的时间步分布。当使用如图5所示的 sigmoid 函数进行近似时,我们在 logit 空间中得到逻辑分布,即图6所示的 logit-logistic 分布。类似地,当使用高斯 CDF 时,我们在 logit 空间中得到高斯分布,即 logit-normal 分布。

图6:与拟合的 sigmoid 和高斯 CDF 曲线对应的 logit-logistic 和 logit-normal 提议密度。

我们将这些估计作为在网格搜索中选择时间步分布的指导。除了 logit-normal 和 logit-logistic 分布外,我们还加入了“mode-sampler”或“Waver”2 时间步分布,因为这是 NVIDIA et al. 20263 中的选择。我们通过一个零中心基础分布,随后应用平移函数 t ↦ αt / (1 + (α−1)t)(参数为 α)来构造所有三个候选分布的位置参数。对于 logit-normal 和 logit-logistic 分布,这导致其众数偏移到 logit(t) = log α。我们选择 α ∈ {24, 33, 42},对应图6中视频和动作估计的众数,再加上一个介于两者之间的值。我们对 logit-normal 分布使用单位方差,并考虑尺度为 0.5 和 0.75 的 logit-logistic 分布。对于 Waver 分布,我们遵循 NVIDIA et al. 2026,使用 α = 5 的偏移,并扫描一个更高值(10)和一个更低值(2.5)。

除了时间步分布本身之外,我们还考虑了一个额外的参数:动作表示的尺度(不要与时间步分布的尺度混淆)。当我们将动作乘以 s 而不对视频这样做时,我们会改变图 5 中两者之间相对的信噪转换。当 s > 1 时,需要更多的噪声才能破坏信号,动作曲线会向右移动。这使我们能够控制不同模态之间相互建模的方式。考虑两个模态 m₁, m₂。假设它们的信噪分布大致匹配,那么在联合流匹配模型下,对于 m₁, s·m₂ 且 s ≫ 1 的模型将有效地近似于 p(m₁, s·m₂) = p(m₁ | s·m₂) p(s·m₂) 这样的因式分解,因为在 s·m₂ 从噪声到信号的转换过程中,m₁ 仍将主要处于噪声状态,但当我们到达 m₁ 的转换点时,s·m₂ 已经主要是信号了。类似地,s ≪ 1 将实现 p(m₁, s·m₂) = p(s·m₂ | m₁) p(m₁) 的近似。为了探索这一效应,我们考虑对动作模态使用缩放因子 s ∈ {1, 2}。为了控制对损失权重的影响,我们按 1/s² 重新加权动作模态上的损失。

我们训练了不同的变体,并在图 7 中报告了在 RoboLab 简单任务套件上多个随机种子的结果。总体而言,我们未能从这些结果中识别出明确的趋势,但我们一致地观察到,对于 logit-logistic 分布,当动作缩放为 s = 2 且偏移量 α = 42 较高时,性能表现优异。在 logit-logistic 分布的两种尺度中,尺度为 0.75 的较宽分布表现最佳,我们继续采用这一设置。

图 7:不同时间步分布、偏移量和尺度下的 RoboLab 成功率。越高越好。

DROID 配方

在 DROID 上微调时,我们向中间训练检查点添加随机初始化的动作头。因此,微调将以非常嘈杂的梯度信号开始,这可能对模型产生负面影响。为了确保中间训练权重在这个初始适应阶段不被退化,我们在前 1k 步保持中间训练权重冻结,然后在 2k 步内将其学习率从 0 线性增加到 2e-4。动作头本身的学习率在前 1k 步内从 0 线性预热到 1e-3。我们将这一策略与另一种运行进行比较,后者使用适配到我们 EE50 动作空间的末端执行器位姿来微调 DROID(参见预训练和中间训练)。对于这个变体,动作头已经从中间训练初始化,我们对所有参数使用简单学习率预热,在前 1k 步内从 0 增加到 2e-4。我们以两种批量大小 512 和 2048 训练这两种配置,共 20k 步。

图 8:左:跨中间训练检查点的 EE50 头性能(Midtrain)。右:在相对末端执行器动作空间中使用来自中间训练的 EE50 动作头(EE50 FT),以及在绝对关节动作空间中使用随机初始化动作头(Joint FT)对 724k 中间训练检查点进行 DROID 微调时,在两种批量大小下的性能。

对于小批量配置,EE50 的性能仍然高于联合微调的性能。性能随批量大小良好扩展,在匹配 FLOPs 的情况下仅带来很小的代价:与经过 20k 步的较小批量运行相比,批量大 4 倍的 EE50 和联合运行在 5k 步时的性能分别仅下降 2.25 个百分点和 4.25 个百分点。然而,在使用较大批量训练 10k 步后,联合微调优于 EE50 微调,最终性能为 40.13% 对 37.88%。我们继续采用联合微调运行,但注意到 EE50 微调对于数据或训练步数非常少的微调来说可能是一个有吸引力的选择——尤其是考虑到时间步分布是基于其在联合微调中的性能而选择的。

为了解性能是否已饱和,我们使用以下协议来选择最佳检查点:我们将联合运行继续训练总共 30k 步,并在最后 5k 步使用线性学习率冷却。然后我们在冷却期间每 1k 步评估一次,并从中选择性能最佳的检查点。

图 9:联合 FT 运行及随后 5k 冷却步的 DROID 训练损失和 RoboLab 成功率。训练损失持续下降,但成功率趋于平稳。

尽管训练损失显示出持续改善,尤其是在冷却阶段,但我们在微调超过 20k 步后未观察到额外改善。冷却阶段中表现最佳的一次在 26k 步时达到 40%。

在较高的学习率下,接近 2e-4 基础学习率及以上时,我们观察到零星的损失尖峰。如图 10 所示,受损失尖峰影响的训练相比从先前干净检查点恢复的训练具有更低的 RoboLab 成功率。尽管此处成功率最终恢复,但我们观察到某些情况下运行需要更长时间才能恢复,导致在训练周期内性能欠佳。因此,我们在观察到损失尖峰后总是回滚,以保持可比较的检查点并避免对最终性能产生不利影响。

图 10:沿共享主干随后分叉为有尖峰和无尖峰分支的 DROID 训练损失和 RoboLab 成功率。成功率点显示两个种子的均值,误差条跨越两个种子结果。阴影区域标记 5K–6K 的分叉区间。

视频与动作的分离引导

鉴于动作块的推理同时预测未来视频和未来动作,我们可以对每种模态独立进行无分类器引导1。我们通过在 {视频 CFG, 动作 CFG} 超参数上运行网格搜索并在完整的 120 任务套件上评估成功率来分析 CFG 行为。

我们观察到一种梯度趋势,偏好较高的视频 CFG 和较低的动作 CFG,其中视频 CFG = 4.0 和动作 CFG = 1.0 表现最佳,得分为 42.00%。我们选择此设置作为生产环境的首选推理配置。

图 11:按视频和动作 CFG 划分的成功率。

EMA 分析

我们观察到 EMA 对性能和可靠地比较消融扫描都至关重要。因此,我们选择同时跟踪传统 EMA 和 Power EMA1(σrel = 0.05 和 0.10)。

对于传统 EMA,更新步骤为

θˆβ(t)=βθˆβ(t−1)+(1−β)θ(t),θˆβ(0)=θ(0),

(1)

其中 θ(t) 是训练步骤 t 处的原始参数。

在我们的实验中,我们选择 β = 0.9990。由于我们每 K = 1000 步记录一次检查点,我们还评估了其他 β 值的“离线”EMA 变体。平均值是在记录的有限快照窗口上计算的,并由窗口内实际累积的权重归一化,

α=βK,θˆβoff(N)=∑n=1N(1−α)αN−nθ(nK)1−αN,

(2)

其中 n 索引 N 个记录的检查点。将 β 提升到 K 次幂使得每个检查点的递归与公式 1 的每步分布相匹配,代价是丢失了区间内的细节,而分母则消除了有限窗口的启动偏差。

对于 Power EMA,更新步骤为

θˆγ(t)=∫0tτγθ(τ)dτ∫0tτγdτ=γ+1tγ+1∫0tτγθ(τ)dτ,

(3)

其增量计算方式为

θˆγ(t)=βγ(t)θˆγ(t−1)+(1−βγ(t))θ(t),βγ(t)=(1−1t)γ+1.

(4)

其中 t 是从 1 开始的更新计数。遵循 Karras 等人(2024)的方法,我们通过其相对宽度 σrel = (γ+1)1/2(γ+2)−1(γ+3)−1/2 来参数化该分布。

我们在训练期间跟踪两个变体:一个使用 σrel = 0.05,另一个使用 σrel = 0.10(等价于 γ = 16.9722 和 γ = 6.9372)。利用这两个分布,我们可以针对新的 σrel 值进行更准确的事后重建,

𝐱˜=arg min𝐱∫0tN(∑i,nxi,npγi,tn(τ)−pγ⋆,tN(τ))2dτ,

(5)

𝐱=𝐱˜𝟏𝖳𝐱˜,

(6)

θˆγ⋆≈∑i,nxi,nθˆγi(tn),

(7)

其中 pγ,t(τ) 表示公式 3 在平均到时间 t 时赋予 θ(τ) 的权重分布。基由每个记录的检查点处的两个被跟踪分布组成,即 2N 个存储的快照 {θ̂γᵢ(tn)}。拟合是无约束的,因此系数可能为负,并且 x̃ 被归一化为总和为 1,使得重建成为快照的仿射组合。

各种 EMA 设置的结果总结在图 12 中。传统的在线 EMA 和两种 Power EMA 模型都健康地优于原始模型,展示了 EMA 的重要性。我们还观察到 Power EMA 略胜传统 EMA。

对于事后 Power EMA 和离线 EMA 候选,我们观察到钟形趋势,成功率分别在 σrel = 0.150 和 β = 0.9997 处达到峰值。然而,在这两种情况下,每步进行更新的在线平均都强于事后近似。

综合考虑,我们观察到使用 σrel = 0.10 的在线 Power EMA 始终表现最佳,我们选择它作为 DROID 配方推荐的 EMA 设置。

图 12:原始、在线、事后和离线变体的 EMA 检查点结果。在有两个种子的情况下,点显示其均值。

推理效率

WAMs 在数据效率和性能方面已展现出令人鼓舞的结果。然而,与 VLA 相比,它们不仅要预测动作还要预测视频,由于序列长度更大,因此相对较慢。这限制了它们在延迟关键场景或本地部署等硬件受限条件下的应用。此前的方法大多依赖系统级优化,或通过独立解码器或注意力掩码将动作与视频解耦。在这里,我们考虑一个正交方向,探索在保留动作与视频联合预测的同时,通过蒸馏能多接近 VLA 的效率。

我们的第一种方法是引导蒸馏。正如我们在《视频与动作的分割引导》中所见,引导显著提升了性能。然而,它为每个采样步骤引入了第二次无引导的前向传播。如果单次前向传播已经充分利用了硬件的并行能力,这会使延迟大约增加 2 倍。系统级优化通过将两次前向传播分配到两个独立的 GPU 上来隐藏这一额外延迟,但这会使硬件成本增加 2 倍。我们没有并行化两次前向传播,而是将模型的引导预测蒸馏到一个引导蒸馏学生模型 F3A DROID GD 中:我们从 F3A DROID 检查点初始化学生和教师。教师保持冻结,并在 DROID 示例上提供其引导预测,作为学生训练的目标。训练后,我们在无引导的情况下运行学生推理,可获得 1.8 倍至 2 倍的加速。性能不仅得以保持,实际上还提升了 0.6 至 1.08 个百分点。

进一步改进的下一个目标是步数蒸馏。在这里,我们从引导蒸馏检查点初始化学生和教师,并在教师的引导下训练学生进行单步预测。通过将采样步数减少 4 倍,我们获得了 3.15 至 4 倍的预期加速。虽然这代表了大幅度的速度提升,但确实伴随着成功率下降 3.51 至 4.32 个百分点,尽管这仍比 Cosmos 3 的性能高出 1.12 至 1.88 个百分点,同时速度快 9.19 至 13.22 倍。与 pi0.5 相比,F3A SD 将性能提升了 9.92 至 10.68 个百分点,而实时因子 RTF = 处理时间 / 块时长 的比较取决于硬件。在 FP8 下,F3A SD 在工作站和数据中心 GPU 上相比 BF16 的 Pi0.5 提供了 1.34 倍至 2.28 倍的加速,而在 RTX 5090 等消费级 GPU 上,在 FP8 和 BF16 下分别差 1.15 至 2.42 倍。

在推理阶段,我们通过剪除不必要的计算、以 FP8 运行,并利用 torch.compile 降低开销以实现最低延迟来进行优化。我们观察到,使用逐行动态 FP8 对任务成功率影响甚微,从引导蒸馏检查点的小幅 +0.05 个百分点提升,到步数蒸馏检查点的 -0.76 个百分点下降不等,同时在本地 GPU(RTX Pro、5090)上提供超过 1.4 倍的加速。此外,在推理过程中,提示词 token 在架构的模式块中不会改变,因此每当提示词变化时,后者只需缓存一次。同样,即使观测发生变化,给定画布的形状也是静态的。这使得高效编译并降低开销成为可能。最后一部分是高效计算,将步数不变和共享的计算移出块,放入联合准备步骤中。所有结果也可在图 1 和下面的表格中找到。

策略每次预测的动作数控制频率(Hz)完整块时长(s)
Pi0.515151.00
F3 + C332152.13
表 3:策略输出与控制设置。

GPU

工作负载BF16(ms)FP8(ms)
F3 · 4 步 · 引导开启246.42182.00
F3 · 4 步 · 引导关闭136.25101.71
F3 · 1 步 · 引导关闭41.0632.29
Cosmos 3 Nano · 4 步 · 引导开启387.71320.40
π0.5 · 10 步 · 引导关闭31.99未评估
表 4:按 GPU 和服务精度划分的每个预测动作块的中位端到端延迟(毫秒)。提示词文本被缓存,相机编码对每个请求重新计算。π0.5 仅在 BF16 下评估;两个精度视图均显示其 BF16 结果。
设置种子均值 ± 标准误(%)
基础 BF16641.60± 0.46种子42.6740.2540.4242.9241.4241.92
基础 FP8841.16± 0.30种子41.4240.3341.5840.8342.4241.4239.6741.58
引导蒸馏 BF16642.19± 0.39种子40.6741.5042.7542.3342.6743.25
引导蒸馏 FP8642.24± 0.36种子43.0841.6743.0042.1742.6740.83
步数蒸馏 BF16638.68± 0.29种子37.9238.2538.0039.2539.5039.17
步数蒸馏 FP8637.92± 0.31种子38.0036.9239.0838.2537.9237.33
表 5:F3 基础、引导蒸馏和步数蒸馏策略在 BF16 和 FP8 服务下的 RoboLab 成功率。

真实机器人评估

我们对我们的动作策略进行了独立的第三方评估。Positronic Robotics⁠在其实验室的 Franka 机械臂上运行了我们的动作策略,测试了十项 DROID 任务,每项任务尝试三次,并与 Cosmos3-Nano、DreamZero 和 pi0.5 一同对比。每个模型都使用相同的任务、相同的设置、每次尝试相同的 240 秒时间窗口以及相同的评分标准。操作员不知道每次尝试由哪个模型驱动,且每次尝试都录制了视频。我们的策略在 30 次尝试中成功完成了 28 次。指标概览见表 6。一些成功的 rollout 展示在图 13、图 14、图 15 和图 16 中。

我们还在 SO-101 实体上应用了相同的微调方案。我们通过遥操作收集了一个小型数据集,并在此基础上对模型进行了微调。我们在图 17 中展示了模型在分布内任务上的 rollout,并在图 18、图 19 和图 20 中分别展示了其对物体、容器和相机变化等分布外情况的泛化能力。

任务F3ACosmos 3 NanoDreamZeroπ0.5
海绵放入碗中
方块放入碗中
黄色积木放入蓝色杯子
叉子放在盘子上
香蕉放在左侧盘子上
记号笔放入碗中
杯子放入碗中
黄色积木放入杯子
将杯子向左移动
关上抽屉
总体93.3% 28/3090.0% 27/3066.7% 20/3043.3% 13/30
表 6:单项真实机器人任务成功率。
图 13:任务“将方块放入碗中”的视频。
图 14:任务“将杯子向左移动”的视频。
图 15:任务“将海绵放入碗中”的视频。
图 16:任务“将叉子放在盘子上”的视频。
图 17:SO-101 在分布内任务上的 rollout。
图 18:SO-101 在分布外物体变化下的 rollout。
图 19:SO-101 在分布外容器变化下的 rollout。
图 20:SO-101 在分布外相机变化下的 rollout。

混合策略

F3A 提供了一个用于具身动作预测的快速系统,在消费级硬件上仅需单次前向传播即可生成机器人轨迹。它能够解决广泛的操控任务,并较之前的系统提升了性能。但有些任务需要超越直觉控制的能力,例如分解长时程的复杂任务或制定多步计划。诸如 GPT 6 Astra 之类的推理智能体提供了这种能力,并且最近展示了令人印象深刻的控制行为1。然而,直接将其作为策略运行仍然不切实际,推理调用平均耗时约 16 秒。尽管如此,Su 等人(2026)2展示了将 GPT 6 Astra 与 Pi0.5 结合的首批有前景的结果。在此,我们探究这种结合是否能提高具身推理的效率,以及动作策略的改进——如我们通过 F3A 所获得的——是否能转化为这种效率的提升。

为了回答这个问题,我们复现了 Su 等人(2026)的实验设置:对于每个回合,GPT 6 Astra 作为智能体运行,持续跟踪该回合的历史记录。在每一轮中,动作策略——在我们的实验中为 F3A 或 pi0.5——基于当前观测和状态做出预测。由此产生的联合预测通过正向运动学转换为末端执行器位姿。该结果连同观测和本体感受状态一起提供给 Astra。随后,它可以在四个选项之间做出决定:执行策略预测动作的一个子集、修改策略的 1-5 个动作、提出自己的动作或停止。生成的动作通过 RoboLab 中的逆向运动学执行,然后循环重复。我们还加入了一个纯变体,其中 Astra 不从其他策略接收动作预测,而是始终必须自行做出预测。请注意,我们尽可能贴近 Su 等人(2026)的设置,并成功复现了他们报告的结果。我们收集了所有 Astra 调用的耗时和 token 数量以估算效率,并通过加入 F3A 以及在 Astra 的三种不同推理强度(low、medium、xhigh)下运行所有变体来扩展他们的结果。

基于这些数据,我们可以更具体地说明纯动作策略(如 F3A)与纯具身推理智能体(如 GPT 6 Astra)之间巨大的效率差异:从表 7 中我们发现,最具成本效益的 Astra 变体使用 xhigh 推理强度,每次成功成本为 13.47 美元。该变体每次成功平均需要 16 分 23 秒,而低推理强度将其改善至 14 分 21 秒。现在,为了获得 F3A 的可比估计,我们的 FP8 SD 检查点在两个随机种子下共执行了 147802 步,通过 4741 次策略调用完成,取得 96 次成功。因此,在 H200 上,我们得到每次成功调用总耗时 104.8 秒,尽管大部分时间策略处于空闲状态,等待动作执行。在 H200 上延迟为 43.81 毫秒的情况下,理论上它可以同时运行 48.62 个 rollout,从而将每次成功的有效时间降至 2.16 秒。总结来说,在策略大部分时间空闲的单次 rollout 场景中,在每小时价格为 3.00 美元/GPU-h 的 H200 上运行时,每次成功大约需要 1.75 分钟和 0.087 美元,这使得它比最具成本效益的纯 Astra 变体在时间效率上高 8.57 倍,在成本效益上高 155 倍。当并行服务多个环境时,每次成功的时间降至 2.16 秒,成本为每次成功 0.0018 美元——时间效率提升近 400 倍,成本效率提升 7843 倍。然而,必须指出的是,纯 Astra 变体以及混合变体显著提高了成功率,尤其是对于更复杂的任务,例如“杂乱环境中的南瓜”,目前没有任何纯动作策略能够独立解决。

对于混合策略,我们看到 Pi0.5 只能带来适度的效率提升,在中等推理强度下将成本降至 12.28 美元,在低推理强度下将时间降至 13 分 33 秒。另一方面,F3A 在所有推理级别上都提升了效率,在低设置下将每次成功的成本降至 8.77 美元、时间降至 8 分 08 秒,这相当于 2 倍和 1.54 倍的改进,同时保持了 90% 的高成功率,并能解决所有复杂度的任务。

纯动作策略难以完成的任务之一是“按照从下到上的顺序堆叠积木:红色、蓝色、绿色、黄色”。在下面的视频中,我们总共展示了三次 rollout:前两次是 F3A 在没有 Astra 参与的情况下单独运行,底部是 F3 + Astra(低)混合策略的一次 rollout,其中叠加层指示了在任意时刻是 F3A 还是 Astra 在控制。我们看到 F3A 确实具备堆叠积木所需的视觉运动技能——然而它似乎忽略了所要求的顺序。在底部的混合策略中,我们看到 Astra 进行了短时间的干预,当时 F3A 正要拿起黄色积木,将其堆叠在已经堆好的红色和蓝色积木之上。将末端执行器移近绿色积木的短暂纠正就足以让 F3A 再次自行继续。

F3A 单独运行(前两次)和 F3 + Astra(低)混合策略(底部)在有序积木堆叠任务上的表现。
配置成功率每次成功成本($)每次成功时间每次成功 Token 数
F3 + Astra(极高)94% 47/5011.0011分53秒7.83M
Pi0.5 + Astra(极高)92% 46/5014.4117分09秒10.12M
F3 + Astra(中)84% 42/5010.4110分05秒7.69M
Pi0.5 + Astra(中)86% 43/5012.2814分26秒8.86M
F3 + Astra(低)90% 45/508.778分08秒6.60M
Pi0.5 + Astra(低)86% 43/5015.5713分33秒12.38M
纯 Astra(极高)100% 50/5013.4716分23秒10.00M
纯 Astra(中)94% 47/5015.5014分48秒12.11M
纯 Astra(低)84% 42/5017.7714分21秒14.13M
表 7:不同策略和 Astra 推理配置下的混合策略效率。

完整结果

配置每次成功成本($)每次成功时间成功次数时间Token 数成本($)每次成功 Token 数
F3 + Astra(低)8.778分08秒45/506:05:45296.95M394.696.60M
F3 + Astra(中)10.4110分05秒42/507:03:30323.17M437.287.69M
F3 + Astra(极高)11.0011分53秒47/509:18:16368.00M517.087.83M
Pi0.5 + Astra(中)12.2814分26秒43/5010:20:58380.82M528.008.86M
纯 Astra(极高)13.4716分23秒50/5013:39:13500.15M673.6610.00M
Pi0.5 + Astra(极高)14.4117分09秒46/5013:08:42465.70M662.8710.12M
纯 Astra(中)15.5014分48秒47/5011:35:57569.20M728.5512.11M
Pi0.5 + Astra(低)15.5713分33秒43/509:42:45532.30M669.4612.38M
纯 Astra(低)17.7714分21秒42/5010:02:34593.64M746.3214.13M
F3 + AstraPi0.5 + Astra纯 Astra已报告
任务低中极高低中极高低中极高Pi0.5 + AstraF3Pi0.5Cosmos 3DreamZero
积木放入箱中3/20
杂乱环境中的南瓜0/20
葡萄干盒上的黄油19/20
按顺序堆叠积木0/20
重新定向红色杯子16/20
较大葡萄干盒放入箱中2/20
酱料瓶放入板条箱20/20
罐头食品放入箱中15/20
酸奶放入碗中1/20
魔方放入碗中20/20
总体90% 45/5084% 42/5094% 47/5086% 43/5086% 43/5092% 46/5084% 42/5094% 47/50100% 50/5092% 46/5048% 96/20036% 18/5036% 18/5034% 17/50
表 8:混合策略、纯推理策略和已报告单一策略的每任务成功率。

展望

动作预测为智能体提供了一种与世界直接交互的方式。要把这种能力转化为物理世界中的生产力提升,动作策略必须变得更容易、更高效地部署——只需少量演示就能学会新任务,并且随后能够实时可靠地解决这些任务。然而,如果只考虑工业自动化的机会,我们能在物理机器人上大规模评估的挑战——受控环境中的操作任务——只是视觉智能的一小部分。诸如在陌生地域中朝目标导航、分辨与背景几乎融为一体的物体、预判其他智能体将如何行动并做出调整、在信息不完整的情况下制定策略并提前规划等能力,都无法在真实世界中安全地或大规模地评估。而游戏则不同,它们经过数百万工时设计,正是为了挑战这些以及更多能力。与物理机器人相比,游戏可以并行运行、快于实时,而且没有风险。因此,它们为动作预测研究及其与推理能力的更深层整合提供了理想的试验平台——而一个会玩游戏的智能体,距离操作其他软件只有一步之遥。我们希望我们的开放权重发布能让更多人探索这一方向。

该模型目前还不能实时玩这些游戏。游戏在 Firecracker 虚拟机中运行,视频素材是事后加速的。

感谢 mimic⁠ 提供的许多有益讨论和知识分享,感谢 Positronic Robotics⁠ 在其平台上对我们的策略进行了快速评估,感谢 NVIDIA 帮助我们将模型集成到 NVIDIA Jetson 上,感谢 HuggingFace 和 LeRobot 以及在 SO-101 上测试参数高效微调,感谢 NVIDIA Isaac Lab 和 RoboLab 团队,它们为我们的大部分评估提供了基础。该模型在 NVIDIA GB200 系统上训练,使用了以 NVIDIA 的 CuTe DSL 编写的自定义内核。

参考文献

  1. Cen, Jun, Chaohui Yu, Hangjie Yuan, et al. 2025. WorldVLA: Towards Autoregressive Action World Model. arxiv.org/abs/2506.21539
  2. Cheang, Chi-Lam, Guangzeng Chen, Ya Jing, et al. 2024. GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation. arxiv.org/abs/2410.06158
  3. Chefer, Hila, Patrick Esser, Dominik Lorenz, et al. 2026. Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis. arxiv.org/abs/2603.06507
  4. Chen, Xiao. 2026. Awesome Astra Embodied AI. GitHub repository. github.com/zjwzcx/Awesome-Astra-Embodied-AI
  5. Du, Yilun, Mengjiao Yang, Bo Dai, et al. 2023. Learning Universal Policies via Text-Guided Video Generation. arxiv.org/abs/2302.00111
  6. Ebert, Frederik, Chelsea Finn, Sudeep Dasari, Annie Xie, Alex Lee, and Sergey Levine. 2018. Visual Foresight: Model-Based Deep Reinforcement Learning for Vision-Based Robotic Control. arxiv.org/abs/1812.00568
  7. Esser, Patrick, Sumith Kulal, Andreas Blattmann, et al. 2024. Scaling Rectified Flow Transformers for High-Resolution Image Synthesis. arxiv.org/abs/2403.03206
  8. Finn, Chelsea, Ian Goodfellow, and Sergey Levine. 2016. Unsupervised Learning for Physical Interaction Through Video Prediction. arxiv.org/abs/1605.07157
  9. Finn, Chelsea, and Sergey Levine. 2016. Deep Visual Foresight for Planning Robot Motion. arxiv.org/abs/1610.00696
  10. Fragkiadaki, Katerina, Pulkit Agrawal, Sergey Levine, and Jitendra Malik. 2015. Learning Visual Predictive Models of Physics for Playing Billiards. arxiv.org/abs/1511.07404
  11. Hang, Tiankai, Shuyang Gu, Chen Li, et al. 2024. Efficient Diffusion Training via Min-SNR Weighting Strategy. arxiv.org/abs/2303.09556
  12. Ho, Jonathan, and Tim Salimans. 2022. Classifier-Free Diffusion Guidance. arxiv.org/abs/2207.12598
  13. Hoogeboom, Emiel, Jonathan Heek, and Tim Salimans. 2023. Simple Diffusion: End-to-End Diffusion for High Resolution Images. arxiv.org/abs/2301.11093
  14. Intelligence, Physical, Kevin Black, Noah Brown, et al. 2025. π0.5: A Vision-Language-Action Model with Open-World Generalization. arxiv.org/abs/2504.16054
  15. Karras, Tero, Miika Aittala, Timo Aila, and Samuli Laine. 2022. Elucidating the Design Space of Diffusion-Based Generative Models. arxiv.org/abs/2206.00364
  16. Karras, Tero, Miika Aittala, Jaakko Lehtinen, Janne Hellsten, Timo Aila, and Samuli Laine. 2024. Analyzing and Improving the Training Dynamics of Diffusion Models. arxiv.org/abs/2312.02696
  17. Kim, Moo Jin, Yihuai Gao, Tsung-Yi Lin, et al. 2026. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning. arxiv.org/abs/2601.16163
  18. Kingma, Diederik P., Tim Salimans, Ben Poole, and Jonathan Ho. 2023. Variational Diffusion Models. arxiv.org/abs/2107.00630
  19. Li, Lin, Qihang Zhang, Yiming Luo, et al. 2026. Causal World Modeling for Robot Control. arxiv.org/abs/2601.21998
  20. Li, Shuang, Yihuai Gao, Dorsa Sadigh, and Shuran Song. 2025. Unified Video Action Model. arxiv.org/abs/2503.00200
  21. Nichol, Alex, and Prafulla Dhariwal. 2021. Improved Denoising Diffusion Probabilistic Models. arxiv.org/abs/2102.09672
  22. NVIDIA. 2026. Cosmos 3: Omnimodal World Models for Physical AI. arxiv.org/abs/2606.02800
  23. Oh, Junhyuk, Xiaoxiao Guo, Honglak Lee, Richard Lewis, and Satinder Singh. 2015. Action-Conditional Video Prediction Using Deep Networks in Atari Games. arxiv.org/abs/1507.08750
  24. Pai, Jonas, Liam Achenbach, Victoriano Montesinos, Benedek Forrai, Oier Mees, and Elvis Nava. 2025. Mimic-Video: Video-Action Models for Generalizable Robot Control Beyond VLAs. arxiv.org/abs/2512.15692
  25. Punamiya, Ryan, Dhruv Patel, Patcharapong Aphiwetsa, et al. 2025. EgoBridge: Domain Adaptation for Generalizable Imitation from Egocentric Human Data. arxiv.org/abs/2509.19626
  26. Raya, Gabriel, Bac Nguyen, Georgios Batzolis, et al. 2026. Noise Scheduling as Information-Guided Allocation in Diffusion Training. arxiv.org/abs/2602.18647
  27. Schmidhuber, Jürgen. 1990. Making the World Differentiable: On Using Self-Supervised Fully Recurrent Neural Networks for Dynamic Reinforcement Learning and Planning in Non-Stationary Environments. Technical Report FKI-126-90, Institut für Informatik, Technische Universität München.
  28. Su, Jiayi, Yixin Zheng, Mi Yan, Li Yi, Zhizheng Zhang, and He Wang. 2026. GPT 6 Astra as an Embodied Policy. Technical report and code. github.com/anonymous-report-421/GPT-as-Policy
  29. Wu, Hongtao, Ya Jing, Chilam Cheang, et al. 2023. Unleashing Large-Scale Video Generative Pre-Training for Visual Robot Manipulation. arxiv.org/abs/2312.13139
  30. Yang, Jenai Xuning, Rishit Dagli, Alex Zook, et al. 2026. RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies. arxiv.org/abs/2604.09860
  31. Ye, Angen, Boyuan Wang, Chaojun Ni, et al. 2026. GigaWorld-Policy: An Efficient Action-Centered World-Action Model. arxiv.org/abs/2603.17240
  32. Ye, Seonghyeon, Yunhao Ge, Kaiyuan Zheng, et al. 2026. World Action Models Are Zero-Shot Policies. arxiv.org/abs/2602.15922
  33. Yuan, Tianyuan, Zibin Dong, Yicheng Liu, and Hang Zhao. 2026. Fast-WAM: Do World Action Models Need Test-Time Future Imagination? arxiv.org/abs/2603.16666
  34. Zhang, Yifu, Hao Yang, Yuqi Zhang, et al. 2025. Waver: Wave Your Way to Lifelike Video Generation. arxiv.org/abs/2508.15761
  35. Zhou, Yi, Connelly Barnes, Jingwan Lu, Jimei Yang, and Hao Li. 2019. On the Continuity of Rotation Representations in Neural Networks.
  36. Zhu, Chuning, Raymond Yu, Siyuan Feng, Benjamin Burchfiel, Paarth Shah, and Abhishek Gupta. 2025. Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets. arxiv.org/abs/2504.02792

来源:Black Forest Labs:Blog · bfl.ai