Black Forest Labs 发布 FLUX 3 多模态基础模型,与 mimic 合作推出 FLUX-mimic 机器人模型
FLUX 3 x mimic: The Next Generation of Video-Action Models
Black Forest Labs 发布 FLUX 3 多模态基础模型,联合训练图像、视频与音频,其中视频预测占总计算成本超 95%,并与 mimic 合作推出基于 FLUX 3 骨干的视频动作模型 FLUX-mimic。
原文解释了同一骨干为何能同时支撑内容生成与机器人控制,并给出真实产线部署和延迟数字。
FLUX 3 x mimic:下一代视频-动作模型

FLUX 3 的早期版本,我们的全新多模态基础模型,现已在机器人上运行。我们让 mimic robotics 提前获得了 FLUX.3 的使用权限。他们在机器人学习与部署方面的实力,结合该模型的世界知识与 BFL 的基础模型专长,共同打造出了 FLUX-mimic:下一代视频-动作模型。
FLUX
FLUX 1 和 FLUX 2 生成图像。FLUX 3 扩展到多模态并联合生成音视频内容——同时,它为 FLUX-mimic 提供了基础:这是一个与 mimic 合作开发的视频-动作模型,运行着已在 Audi 经过测试和部署的机器人。
乍一看,生成逼真的视觉内容与控制机器人似乎没什么共同之处。一个需要生成像素,另一个需要理解当你触碰和操控物理世界时它会如何响应。如果一个模型能同时做到这两点,那它从来就不只是一个内容创作模型。它是一个关于世界如何运作的模型,而内容创作只是人们可以用它做的一件事。
这就是 FLUX 3。
视频才是难点
FLUX 3 是一个模型,从一开始就跨图像、视频和音频联合训练。该训练中要求最高的部分——占总计算成本的 95% 以上——是视频预测。要生成逼真的视频,模型别无选择,只能学习接触、运动、重量、因果;任何一项出错,看起来就不对。学会准确地渲染世界,就意味着学会世界如何运作。
相对而言,音频是容易的模态。它维度低,细节远少于视频,在带音频的 720p 视频中占不到 0.5% 的 token。一旦模型完成了学习视频理解的艰巨工作,它就会学习视频与音频之间的因果关系,从而预测与嘴唇运动同步的语音,以及与引发它们的物理事件同步的音效。
动作也遵循同样的形态:机器人状态的低维表示,与视觉观测紧密耦合。动作、音频和视频帧都是单一底层物理现实的部分表示。在模型学习了视频和音频背后的物理过程之后,动作预测并不是一个新的方向——而是它已经建模的现实的又一个视角。
单一主干
如果这个框架是正确的,那么教 FLUX 3 预测动作就不应带来持久的代价:我们预计会出现一个短暂的扰动阶段,因为模型必须学习动作空间的结构,并将其内部的世界表示与之对齐,然后恢复到完整性能。这正是我们观察到的结果。
在一次大规模训练中,我们将动作预测加入课程,并观察其对视频生成质量的影响。随着模型开始纳入新的动作模态,人类对文本到视频和图像到视频的评分最初下降了多达 10%。经过 3500 步后,模型在视频生成任务上恢复了此前的完整质量,同时还能预测动作。

每个系列在加入动作预测之前都按其自身质量进行了归一化。越高越好。
模型必须将动作整合到其输入和输出中——但这样做并不会永久消耗它的能力。它只需学习这种新模态如何与其已有的世界模型相关联。一旦弄清楚这一点,对其现有能力的性能损失就消失了。视频生成和动作预测不需要各自独立的基础。同一个主干可以同时承载两者。
这使得 Physical AI 成为我们在 Black Forest Labs 路线图的自然延伸,而非方向的改变。内容创作是我们的多模态 FLUX 3 主干用图像、视频和音频所做的事。Physical AI 是它用动作所做的事。一个基础模型,以视觉智能为核心,支撑两大应用家族。我们并没有构建一个单独的基础模型。我们专注于那件难事:构建一个理解世界的模型。在其中行动,正是这种理解所使之成为可能的事。
从实验室到现实:FLUX-mimic
当我们将 FLUX 3 主干指向真实生产线上的真实自动化任务时,会发生什么?
这正是 mimic 和 BFL 创建 FLUX-mimic 所要回答的问题。mimic 制造自己的机器人,并带来机器人学习、灵巧操作和生产部署方面的专业知识;BFL 构建视觉基础模型,并带来多模态训练和建模方面的专业知识。我们共同构建了一个用于通用操作的下一代模型——适配行业需求,并集成到 mimic 的全栈部署系统中。FLUX-mimic 是一个基于 FLUX 3 主干构建的视频-动作模型。
解码所学到的世界模型
我们的论点是,FLUX 3 必须学习世界的内部表示,才能生成视频。FLUX-mimic 延续了这一论点,从 FLUX 主干所学到的世界表示中解码出动作。这种方法在 mimic-video 中率先提出,在从 FLUX 视频预测路径提取的中间特征之上训练一个轻量级动作解码器。

架构概览:FLUX-mimic 如何构建在 FLUX 3 之上
这种方法的成功取决于两个相关但不同的方面:FLUX 所学到的世界模型的质量,以及该世界模型特征表示的质量。世界模型的质量与生成质量直接相关:如果一个模型不理解世界如何运作,它就无法模拟世界。然而,即使是最好的世界模型,如果无法访问,对动作解码器也毫无帮助:如果特征空间使模态之间的因果关系以非线性方式纠缠在一起,那么从特征表示中理解这些关系,仍然与从原始输入中理解它们一样困难——表示质量至关重要。
生成质量和表示质量长期以来一直被孤立地研究和处理。生成式方法产生高质量的世界模型,能够实现模拟,并展现出可预测计算投资回报的缩放定律。然而,与更专门的表示学习方法相比,它们产生的表示解缠程度较低,这为其在需要世界理解的任务中的实用性设定了上限。
由于生成模型本身依赖其自身的特征,这种表示质量上的差异似乎有悖直觉。生成模型内部表示的改进应当提升其世界模型的质量,并使其更适用于下游任务。在我们的工作 Self-Flow 中,我们展示了如何在单一框架中统一生成与表示学习,并观察到了正是这种相互促进的改进:世界模型得到了提升——以视频、图像和音频的生成质量衡量——其表示质量也得到了提升——以仿真中机器人控制任务的成功率衡量。

Self-Flow 与 Flow Matching(FM)对比。左:各模态的生成误差(Fréchet 距离),均以 FM = 100 归一化(越低越好)。右:通过微调后在四个任务组上平均的操作任务成功率(越高越好)。
扩展世界模型
缩放定律在 Self-Flow 中依然成立,而 FLUX 3 正是这一点的应用:Self-Flow 的放大版本。它基于数千万小时的通用视频内容进行训练,从第一天起就尽可能广泛地学习世界动态,并基于数十万小时聚焦于人类和机器人操作任务的视频内容进行训练,以作为视觉智能的骨干网络。正是这种扩展将 Self-Flow 的成功从实验室带到了现实。mimic 在真实工厂用例中部署了 FLUX-mimic,涵盖生产与物流工作的日常现实:将零件配套装入结构化托盘、将电子控制单元插入紧密贴合的固定装置、将组件组装在一起,以及处理密封件和线缆等传统自动化从未能够触及的柔软、柔性材料。
基准测试表明,即使完全冻结 FLUX 骨干网络——这是此前的视觉-语言-动作模型无法成功的设定——动作解码器仍优于先前的视觉-语言-动作模型。这凸显了扩展如何赋予我们的骨干网络关于世界以及如何在其中行动的强大知识,以及 Self-Flow 如何使这些知识能够从骨干网络的特征表示中轻松解码。当将骨干网络与动作解码器一起微调时,FLUX-mimic 达到了最先进的成功率。

虚线标记每个模型在 20 次自主试验中的中位成功率。越高越好。
从世界知识到可工作的任务
一个以可解码表示暴露世界知识的骨干网络,改变了教机器人学习新任务所需的条件。如果物理规律已经在表示中并且易于获取,那么适应一项任务就不再是教模型世界如何运作的问题——它只需学习这项特定任务如何映射到它已经知道的东西上。昂贵的部分在机器人移动之前就已经完成了。
这直接体现在一项新任务需要多少演示数据上。在我们的 Self-Flow 实验中,与没有 Self-Flow 的视频模型相比,动作预测以一半的训练步数达到了给定的成功率——更好的表示使世界知识更容易提取,因此达到相同能力所需的数据更少。mimic-video 论文报告称,视频-动作模型相比视觉-语言-动作模型具有高达 10 倍的样本效率;FLUX-mimic 结合了这两种效应。
同样的优势也体现在行为上。FLUX-mimic 能自然地从失败中恢复:一次抓取失败的机器人会自我纠正,再次抓取,并完成任务。没有任何演示数据集能覆盖任务可能出错的所有方式。从未被演示过的恢复能力必须来自别处——来自一个已经了解世界如何运作的模型。
骨干网络预测的未来(上),以及机器人根据解码动作产生的实际推演(下)。
快到足以行动
真实世界的部署设定了一个硬性约束:模型必须像世界运转一样快速地行动。FLUX-mimic 的主要计算成本集中在骨干网络上。它是模型中最大的组成部分,而在 mimic 的优化部署栈中,其延迟实际上决定了整个系统的上限。
这正是我们的方法论第二次发挥作用的地方。更好的表征意味着每个参数拥有更强的能力:一个已经学到结构良好的世界模型的模型,达到给定性能水平所需的容量比没有学到的模型更少。对于部署而言,这直接意味着能够运行更小的骨干网络——而更小的骨干网络就是更快的骨干网络。

训练 100 万步时的 CLIP 分数;越高越好。骨干网络深度是部署延迟的主要驱动因素,因此层数越少意味着模型越快。
因此,FLUX-mimic 的骨干网络经过优化,可以在单块 NVIDIA RTX 5090 GPU 上以不到 80ms 的时间从输入运行到世界表征——这使其与人类视觉反应时间处于同一数量级。
真实世界的部署需要对整个部署栈进行额外优化,以避免增加任何额外延迟:mimic 的优化范围从动作解码器,到削减传感器、模型与执行器之间的进程间延迟,再到实时分块,使预测与执行重叠,让机器人平稳运行而不抖动。最终结果是一个自包含的机器人系统,反应时间为 101ms。
在工厂车间
所有这些都回到了自动化真正重要的地方:工厂。奥迪运营着汽车行业中最自动化的生产网络之一——这使它能够精确地看到传统自动化仍然止步于何处。尽管在机器人领域投入了数十年,涉及柔性部件和精细操作的任务仍然依赖人工,这主要是出于经济原因:高端生产的变体多样性使得传统编程的机器人单元为每种情况重新设计工程的成本过高。基于学习的系统改变了这笔账。
“在与 mimic 的合作中,奥迪一直在测试和部署 FLUX-mimic。我们看到这些机器人解决了传统机器人技术根本不可能完成的复杂软体操作工作。这可以在协助我们的员工、提高效率以及将柔性自动化扩展到生产和物流运营方面产生重大影响。对我们来说,与 mimic 和 Black Forest Labs 这样的先驱公司合作,对于推动物理 AI 的前沿并在真实生产环境中验证这些创新至关重要。”——Christoph Schneider,奥迪生产实验室
结语
FLUX-mimic 是一款专为机器人打造的模型——也是未来发展的一个有力证明。其样本效率和鲁棒性源自 FLUX 3 主干网络及其所呈现表征的质量,而非特定任务的工程化设计。这正是该方法能够跨任务、跨行业、跨硬件迁移的原因。通过 mimic 了解更多。
一个以视觉智能为核心的模型,生成图像、视频和音频——并驱动生产线上的机器人。内容创作与物理 AI 是同一基础模型的两大应用。
来源:Black Forest Labs:Blog · bfl.ai