跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-07-02精选AI 评分74

表示分布匹配(RDM)用于一步视觉生成

Representation Distribution Matching for One-Step Visual Generation

AI 导读

表示分布匹配(RDM)通过匹配冻结预训练编码器下的生成与参考特征分布来训练一步图像生成器。三个发现:经典MMD正确估计后成为可扩展目标;生成批次大小最优超过2048;单一表示可被欺骗,需匹配平衡编码器组合并采用独立于训练损失的SW_r14评估。改进的iRDM在ImageNet上以SW_r14 1.30达一步生成SOTA,PickScore在71.2%样本上偏好iRDM。该方法将四步FLUX.2后训练为一步生成器,在GenEval(0.826对0.794)和PickScore(22.76对22.58)上超越原版,仅需90 H200 GPU小时。

推荐理由

这篇论文把MMD重新变成了一流的一步生成目标,用多编码器匹配防止作弊,并把FLUX.2四步模型浓缩成一步,性能不降反升,90 GPU小时就能复现,做视觉生成的人应该仔细看。

正文 · AI 翻译

蓝峰

李武阳

埃洛伊·扎布洛基

马蒂厄·科德

亚历山大·阿拉希

瑞士洛桑联邦理工学院(EPFL)

法国Valeo.ai

法国索邦大学

摘要

我们阐明了表征分布匹配(RDM)的设计空间——这是我们为一种训练单步图像生成器范式所起的名称,该范式通过在冻结的预训练编码器下匹配生成特征分布与参考特征分布来工作。我们确定了两个设计轴:分布的比较方式以及进行比较的表征空间,并沿着这两个轴进行了受控研究,得出了三项发现。首先,经典的MMD(最大均值差异)在十年前无法训练出令人信服的生成器,但一旦正确估计,它便成为一个强大且可扩展的目标函数。其次,生成的批次大小成为关键操作变量,其最优值超过2048,远高于常规的批次大小。第三,任何单一表征都可能被利用,其得分可能被压低至真实分数以下,而生成的图像却仍然明显是假的,因此我们针对一组平衡的编码器进行匹配,并使用一种基于14个编码器的切片Wasserstein距离(该距离独立于训练损失且能抵抗操纵)进行评估。结合优选方案得到了改进型RDM(iRDM):它在ImageNet上以1.30的FID分数确立了单步生成器的最新技术水平,这一结果得到了PickScore(一个我们目标函数从未优化过的人类偏好代理指标)的证实,在71.2%的匹配样本中,该指标更倾向于iRDM而非先前最优的单步生成器。同样的方案将四步FLUX.2 [klein]后训练为单步生成器,在GenEval上以0.826对0.794超越四步版本,在PickScore上以22.76对22.58超越,仅耗时90个H200 GPU小时。项目页面:https://alan-lanfeng.github.io/rdm/。

Refer to caption
图1:iRDM将四步FLUX.2 [klein]后训练为质量相当的单步生成器。(a) 四步FLUX.2 [klein]。(b) 使用联合图像-文本目标进行后训练后的单步iRDM。(c) 随后训练计算量变化的GenEval和PickScore,单步模型在大约90个H200 GPU小时内在这两项指标上均超越了四步版本(灰色虚线)。

1 引言

生成式建模从根本上说就是分布匹配:我们希望生成器的输出分布与数据分布相匹配,而判断这种匹配程度的依据,正是两者表征分布之间的距离——这也是 FID(Heusel 等人,2017)的基础。扩散模型和流模型只是隐式地追求这一分布目标,它们学习逆转一个加噪过程,从而在推理时通过模拟多个去噪步骤,将噪声转化为数据(Ho 等人,2020;Song 等人,2021;Lipman 等人,2023)。最近出现的一种替代方案则显式且直接地追求这一目标:在冻结的预训练编码器的特征空间中匹配两个分布,并通过单次网络评估生成图像,无需在线教师模型、对抗网络或模拟轨迹。我们将这一范式称为表征分布匹配(RDM)。

近期出现的几种单步生成器(Deng 等人,2026;Yang 等人,2026)均可视为这一范式,它们仅沿两个维度有所不同。第一个维度是比较方式:采用哪种差异度量来评估生成特征与真实特征之间的差距,如何从有限样本中估计该度量,以及每一侧使用什么参考分布。漂移场方法测量每个批次内部的成对核力,并从同一批次中读取其真实参考分布(Deng 等人,2026);而 Fréchet 距离损失则仅保留前两个矩,并在整个数据集上预先计算(Yang 等人,2026)。第二个维度是表征,即用于比较两个分布的冻结编码器特征空间;在此维度上,所有方法都采用了相同的默认设置——在固定权重下使用少数几个编码器。

现有方法将这些选择固定在一起,因此不清楚其中哪一个对生成质量负责。我们每次只改变一个维度,由此进行的受控研究推翻了当前实践中隐含的若干假设。

先从对比说起。十年前,最大均值差异被认为过于薄弱,无法训练出有竞争力的生成器(Li 等人,2015;Dziugaite 等人,2015);但它从未真正薄弱过,只是估算方式糟糕。良好的估算需要结构化的特征空间和两侧足够的样本量,而这两侧是不同的。参考侧是预先固定且永不移动的,因此我们充分利用它:将整个 128 万张图像的训练集一次性压缩为冻结的 Nyström 参考(Chatalic 等人,2022),用 4096 个地标以极低的成本代表其吸引力(图 3)。生成侧每一步都在移动且每次重新采样,更大的批次能改善估算但会减少更新次数;最优值在 2048 以上,比常规做法高出一个数量级,同时借助梯度缓存(Gao 等人,2021)来吸收内存开销。最后,在条件任务上,我们匹配的是描述与图像特征的联合分布,而非仅图像边缘分布,从而将提示词忠实度纳入目标函数,这使得四步 FLUX.2 在 GenEval 上以更高分数后训练为一步模型。

接下来是表征。现代预训练编码器已经提供了良好的空间来测量距离,因此问题在于:哪个空间,或哪些空间的组合,能使低 MMD 仅能由真正逼真的样本实现。单一编码器是不够的:生成器会过拟合它所对抗的那个编码器,在该编码器自身的评分上超越真实数据,而其样本却明显是假的。解决办法是不依赖任何一个编码器。我们在多样化的编码器组合上进行匹配,并且不是均匀加权,而是通过约束优化来保持平衡:一个比例拉格朗日控制器(Stooke 等人,2020)会提高最难满足的编码器的权重,降低生成器开始过拟合的编码器的权重。其直觉是最短板法则:正如木桶只能装到最短那块木板的高度,观看者也是根据最明显的伪影来判断图像(Larson 和 Chandler,2010;Wang 和 Shang,2006),因此仍然提出异议的那个编码器才是值得关注的。

将两个轴结合后,便得到了改进版 RDM(iRDM),这是一种简单而有效的方案,能够以单步生成更高质量的结果。我们使用新提出的指标来衡量它——该指标是 14 个预训练编码器上相对 Sliced-Wasserstein 距离的平均值,其中真实数据被缩放为 1。作为评估指标,Sliced-Wasserstein 距离比 Fréchet 距离或 MMD(Berthet 等人,2026)更难被操纵,并且由于我们从未针对该指标进行训练,因此性能提升可以排除奖励作弊的可能性。在训练后,pMF-H FD-SIM(Lu 等人,2026;Yang 等人,2026)此前以 2.05 的成绩保持最先进水平,而 iRDM 则达到了单步生成的新最先进水平 1.30,这一结果得到了 PickScore(Kirstain 等人,2023)胜率的佐证——PickScore 是一种学习到的人类偏好代理指标,我们的目标函数从未对其进行过优化。该方案同样适用于文生图任务:应用于 FLUX.2 [klein](Black Forest Labs,2026)——一个 4B 参数、四步生成的模型——iRDM 将其后训练为单步模型,在 GenEval 上以 0.826 对 0.794 超越四步版本,在 PickScore 上以 22.76 对 22.58 胜出,仅耗时 90 个 H200 GPU 小时。我们将贡献总结如下。

  • •

    一个统一的框架。我们将分布匹配形式化为一个统一的范式——RDM,它不需要在线教师模型,并识别出支配该范式的两个设计轴:分布的比较方式以及进行比较的表示空间。这使我们能够将某个方法的性能上限追溯到具体的设计选择,而非其核心概念。

  • •

    一个达到最先进水平的简单方案。通过分别改变每个轴,我们确定了驱动质量的关键因素:估计 MMD 的正确方法——即精确的批内排斥与基于 Nyström 方法对冻结全数据参考点的吸引相结合;大量新生成的批次;文生图任务上的联合图像-文本目标;以及保持多样化编码器组平衡的约束优化。这些选择组合成 iRDM,在 ImageNet 上以 1.30 的成绩(真实数据为 1)达到了单步生成的最先进水平,且无需在线教师模型、对抗网络或奖励模型;同样的方案将四步生成的 FLUX.2 [klein] 后训练为单步模型,其 GenEval 得分高于四步基础模型。

  • •

    一种抗操纵的度量指标。我们采用基于14个编码器平均的切片瓦瑟斯坦距离进行评估,并通过构造将真实数据得分设为1。这是一种与训练损失无关的最优传输度量,相比任何单一编码器评分都更难被操纵。

Refer to caption
图2:iRDM仅通过表征分布匹配来训练单步生成器——无需在线教师模型、无需对抗训练、无需轨迹约束。每一步抽取一批新样本,将其嵌入到由十个预训练编码器构成的评估体系中,同时使用预先计算并冻结的参考表征。在每个特征空间中,生成样本通过Nyström吸引机制被拉向参考流形,并通过精确的批内排斥机制保持分离(公式3)。

2 相关工作

单步与少步生成

扩散模型与流模型(Ho等人,2020;Song等人,2021;Lipman等人,2023;Karras等人,2022;Rombach等人,2022;Peebles和Xie,2023)每次去噪步骤都需要推理成本。减少步骤的方法要么是对预训练教师模型进行知识蒸馏,要么完全移除教师模型。蒸馏方法会匹配教师模型的轨迹、评分或矩(Salimans和Ho,2022;Liu等人,2023;Luo等人,2023;Yin等人,2024b;Zhou等人,2024;Salimans等人,2024),或通过对抗训练实现(Sauer等人,2024;Yin等人,2024a);无教师方法则基于模型自身输出或轨迹施加约束(Song等人,2023;Song和Dhariwal,2024;Geng等人,2025b;Lu和Song,2025;Frans等人,2025;Geng等人,2025a;Lu等人,2026;Geng等人,2026;Zhou等人,2025)。RDM无需在线教师模型,也不约束轨迹:它直接将生成样本与冻结的参考表征进行比较。

在固定特征空间中进行分布匹配

将生成过程视为分布匹配,这是生成对抗网络(GAN)的研究范式(Goodfellow 等人,2014;Salimans 等人,2016);在固定核函数的情况下,它衍生出矩匹配网络(Li 等人,2015;Dziugaite 等人,2015)、对抗核方法(Li 等人,2017;Bińkowski 等人,2018)以及切片 Wasserstein 生成器(Deshpande 等人,2018;Wu 等人,2019)。此后发生变化的在于特征空间:冻结的预训练编码器——曾用于感知损失(Johnson 等人,2016;Zhang 等人,2018)、判别器特征(Sauer 等人,2021;Kumari 等人,2022)和对齐目标(Yu 等人,2025)——如今支持直接的特征分布匹配,正如漂移场(Deng 等人,2026)、Fréchet 距离损失(Yang 等人,2026)以及并行的 Sinkhorn 流(Han 等人,2026)所展示的那样。这一原理隐含地贯穿于上述发展脉络;我们的贡献在于为其命名、绘制其两个设计轴,并将先前的方法定位其中。

3 表征分布匹配及其设计空间

单步生成器通过一次评估将先验分布映射为图像,其输出分布记为 。给定一个将图像映射到特征的冻结编码器,RDM 对齐生成数据与真实数据的特征分布(图 2),

(1)

其中 表示推前分布, 表示分布之间的距离。约束输出分布而非逐样本轨迹,使得生成器天然成为单步模型;同样的目标函数通过将多步采样器的最终输出视为 ,也可用于对其后训练。

公式 (1) 的每个实例均由两个选择确定,这也是本文的两个轴:比较方式——由何种散度对特征分布进行评分、用何种估计器从有限样本中计算该散度、每侧以何种参考分布作为代表、以及在条件设定下匹配何种联合分布(第 3.1 节和第 3.2 节)——以及表征方式——哪些编码器定义了特征空间,以及多个编码器如何加权(第 3.3 节)。

我们的分解方法将先前的方法定位在这些轴上,并将每种方法的性能上限归因于特定的选择。弗雷歇距离损失冻结了一个全局数据侧参考,这是正确的做法,但将其压缩为两个矩,因此匹配可能在图像仍有缺陷时饱和。漂移场具有尖锐的成对估计器,但它从每个批次重建其参考,代价是将其限制在小批次上,而正是在小批次上分布估计的噪声最大。两者都在固定权重下针对少数编码器进行训练,第3.3节表明这是可被利用的。iRDM 是在每个轴上选择最优选项的组合。

3.1 比较轴:选择与估计差异

特征空间上的正定核定义了

(2)

对于如高斯核这样的特征核,该值恰好为零(Gretton 等人,2012;Sriperumbudur 等人,2010)。我们在原始编码器嵌入上采用带有该高斯核的平方 MMD;带宽通过中位数启发式为每个编码器固定,并保持单一尺度。生成器优化的是有限样本估计,而估计器决定了其成本、方差以及可被利用的盲区。

记 为生成批次大小为 的特征。在公式 (2) 的三个项中,数据项是常数且被省略;交叉项将生成特征吸引向数据;生成器项则使它们相互排斥,这是防止坍缩到最密集模式的唯一力量。这两个需求是相反的,因此我们对这些项进行不同的估计,

(3)

其中 是 Nyström 特征映射, 是它在整个训练集上诱导的冻结参考均值嵌入,两者均在下方精确说明。每个批次都由电池中的所有编码器评分,我们在每一步使用第3.3节的自适应权重对它们求和。

精确的排斥,冻结的吸引。

这两项分别对不同集合求和,我们采用不同的估计方式。排斥项仅在批次内运行,其精确核求和计算成本低廉,因此我们保留其精确形式,每个编码器对应一个矩阵。而吸引项则需要与整个训练集进行比较:如果像标准双样本估计器那样每一步都重新采样,那么随着带宽缩小,引入的参考噪声会不断增大。因此,我们只计算一次吸引项,并通过 Nyström 核均值嵌入(Chatalic 等人,2022)将其冻结。通过在数据特征和核矩阵上使用 k 均值算法放置地标点,可以构建 的 Nyström 近似,该近似在所有 M 张训练图像上预先计算一次并冻结。每一步都将批次拉向这个零方差汇总,其计算成本为 ,与编码器前向传播相比微不足道。

为什么选择 MMD,又为什么选择 Nyström。

其他每种差异度量都会放弃这些优势中的某一个:Fréchet 距离将两侧压缩为两个矩,在样本仍有缺陷时可能饱和;切片 Wasserstein 距离依赖于每个投影内的排序,因此它只将批次与重新采样的批次进行比较,而非与完整的真实分布进行比较(Deshpande 等人,2018);而漂移场是同一 MMD 梯度的逐粒子归一化形式,在小批次下更稳定,但随着批次增大退化为普通 MMD,其逐批次重新采样的参考使其保持小批次特性(Deng 等人,2026)。对于吸引项,Nyström 地标点优于随机傅里叶特征(Rahimi 和 Recht,2007):地标基是数据相关的,以真实数据点为中心,在生成发生的区域精确,而全局余弦函数则将能力分散在流形几乎未占据的周围空间,并留下未解决的方向,生成器在优化压力下会利用这些方向。理论也支持这一点,一旦核谱快速衰减,数据相关基占据主导地位,且数量级为 的地标点能保留精确嵌入的速率(Yang 等人,2012;Chatalic 等人,2022)。一项受控研究使这两种选择具体化。

关于该估计器的受控研究。

真实编码器将数据置于高维空间中的一个薄流形上,我们通过一个已知目标来隔离这一机制:遵循 Li 和 He (2025) 的方法,一个两圈螺旋被一个固定的标准正交映射嵌入,同一个 MLP 生成器在匹配的预算下按每种目标进行训练,同时批量大小进行扫描,并通过锚点召回率和 medDist(即到曲线的中位距离)进行评分,真实数据在该指标上的得分为 0.033(设置见图 3)。

Refer to caption
图 3:环境维度下的螺旋诊断。各行扫描训练批量大小,各列为不同方法。Fréchet 是冻结全局均值和协方差上的高斯 2-Wasserstein 距离;sliced-Wasserstein 使用重采样投影;drifting 是忠实耦合场,使用 128 个参考样本的参考库进行最佳调优;MMD 族使用多尺度高斯核,每个尺度带有特征或地标,其中随机特征和 Nyström 匹配一个冻结的全局参考均值,而精确估计器每步看到参考样本。角落数字为锚点召回率 / medDist(到曲线的中位距离),真实数据在该指标上的下限为 0.033。Fréchet 对批量不敏感,且从未追踪到曲线,其两个矩无法编码流形;其他距离则因采样而失败——sliced-Wasserstein 在小批量时崩溃,drifting 在大批量时崩溃,随机特征则随维度增加而失效。Nyström 在每一行中都是最锐利的,并且是唯一在所有机制下都表现强劲的距离。

在最大批量下,两个 MMD 估计器(MMD exact 和 MMD Nyström)都锁定到了螺旋上,而随机特征仍然弥散,sliced-Wasserstein 仍然松散,drifting 则崩溃。随着批量缩小,MMD exact 因其每批参考样本变薄而性能下降,而 MMD Nyström 在每个批量大小下都拉向同一个冻结参考,并在每一行中保持最锐利;sliced-Wasserstein 在最小批量下失去召回率,drifting 在最大批量下崩溃。MMD Nyström 是唯一在所有情况下都不失败的方法。

3.2 比较轴:批量与条件设置

生成器侧:大量、新鲜的批次。

一旦在整个训练集上固定了数据侧,生成的分布就成为唯一仍在变化的量,并且它在每一步都会变化,因此必须重新采样;如果像 Yang 等人(2026)的 EMA 队列那样从过时的缓冲区中估计它,就会使梯度产生离策略偏差。使用新批次使得批次大小成为操作变量:更大的批次会降低估计的方差,但在固定的计算预算下,会减少优化器步数,从而在估计精度与更新次数之间进行权衡。大的新批次通常因内存限制而被排除,而梯度缓存(Gao 等人,2021)通过以一块为代价,分块累积精确的全批次梯度,从而消除了这一限制。我们在匹配的挂钟时间预算下进行扫描,按照 Malladi 等人(2022)的方法缩放学习率,使得每个分支大约经历一个 epoch,并将其分割成或多或少的更新(图 4)。质量随批次大小提升:训练的编码器变得更锐利,而由保留集主导的面板几乎不动;最小的批次受噪声主导,尽管优化器步数多得多,但性能反而倒退;随后曲线趋于平坦,进入一个宽广的最优区域。我们对 ImageNet 采用较小的批次大小,对 FLUX 后训练采用较大的批次大小;具体数值见附录 C。

Refer to caption
图 4:在匹配的挂钟时间预算下,微调单编码器 DINOv2 Nyström-MMD 分支时的生成批次大小;质量随批次大小提升,直至一个宽广的最优区域(阴影部分)。

条件任务:匹配联合分布,而非边缘分布。

一个带提示的生成器可以满足图像边缘分布,同时偏离其提示词:用对齐换取逼真度。我们转而匹配联合分布。使用冻结的文本编码器和耦合特征,

(4)

其中,参考对将每张图像与其标题配对,生成对则将每个输出与生成它的提示词配对;估计器保持不变,地标现在参考的是图像-文本对。在该核函数作用下,生成的图像会被拉向那些标题与其提示词相似的参考图像,因此提示词保真度成为匹配过程的一部分。训练后,使用该目标将四步的 FLUX.2 [klein](Black Forest Labs,2026)压缩为一步模型,其在 GenEval(Ghosh 等人,2023)上超越了四步版本,同时也在 PickScore(第 4.2 节)上实现了超越;而边际替代方案则牺牲了对齐性,且没有带来补偿性的质量提升(表 2)。

3.3 表征轴:一个编码器永远不够

特征距离也是衡量真实感的方式:FID 及其衍生指标(Heusel 等人,2017;Bińkowski 等人,2018;Jayasumana 等人,2024;Stein 等人,2023)将其简化为在单个预训练编码器下的分布差距,并将其视为人类判断的代理指标。这个代理指标是脆弱的。FID 会在边缘的 ImageNet 类别特征下下降,但感知质量并无提升(Kynkäänniemi 等人,2023),而且这种距离是可以直接优化的:生成器可以被驱动到低于真实验证数据得分,同时仍然明显是伪造的(Yang 等人,2026)。这个轴所围绕的核心问题是:是否存在某个特征空间,一旦将其距离最小化,就能生成人类无法与真实图像区分的图像?

过拟合单个编码器。

低于真实水平的分数迄今为止仅在较弱的代理模型(Inception 和 ConvNeXt)上得到验证,这引发了一种反对意见:一旦一个足够丰富的编码器得到满足,就会迫使生成结果趋于真实。我们测试了所能构建的最困难情况:语义结构远为丰富的 DINOv2,其基础检查点距离真实状态还很远。仅匹配该编码器,经过若干步数,将距离驱动至 ,本质上达到了 的真实验证下限:根据 DINOv2 的评估,生成器与真实数据一样接近真实。但图 5 显示并非如此。该目标修复了某些类别——蜥蜴变得难以与照片区分,却对其他类别毫无作用——打字机在同样的分数下限上仍保持着不合理的按键布局。这一局限性在于单编码器匹配本身,而非编码器的选择,解决方案并非寻找更好的编码器,而是采用多样化的集成方法。

Refer to caption
图 5:仅匹配 DINOv2 特征可将其距离驱动至真实下限 ,但质量提升并不均衡:蜥蜴(左)变得与真实难以区分,打字机(右)仍保留明显的伪影。饱和的单编码器距离并不意味着真实感。

针对多个编码器的约束优化。

单一编码器仅能给出伪度量,但多样化编码器面板的组合核函数具有特征性,且仅当面对真实分布时才会归零(Gretton 等人,2012;Sriperumbudur 等人,2010;Schrab 等人,2023);因此,我们针对十四个面板编码器中的十个进行对抗训练(附录 B),这些编码器采用冻结的骨干网络,且被特意选择为以不同方式失效。权重分配决定了这种多样性能否保留:在固定权重下,优化器会通过选择最容易拟合的编码器来降低聚合值。我们转而将权重分配视为一个约束优化问题:要求每个编码器达到其在真实验证集上的下限,其权重作为拉格朗日乘子,通过满足门控下的比例控制来设定,即采用 Stooke 等人(2020)提出的 PID-拉格朗日方案中的比例项。编码器的超出量决定了其权重:达到或低于下限的编码器权重归零,而违反约束的编码器则通过 softmax 共享一个固定预算,因此距离真实分布最远的表征获得最大权重;当所有编码器均满足约束时,权重消失,这便是一个自然的防过拟合终止状态。

扩展多表征度量。

评估同样需要保护,且不能坍缩为训练损失。Yang 等人(2026)在面板上聚合了每个编码器的比率,即 Fréchet 形式;我们保留该构造,但将 Fréchet 距离替换为切片-瓦瑟斯坦距离(Deshpande 等人,2018;Wu 等人,2019),这是一种恰当的最优传输距离,且与我们对抗训练的 MMD 不共享任何估计器(Berthet 等人,2026)。我们的度量指标对所有编码器上的每个编码器比率取平均,

(5)

通过该构造,真实验证数据得分自然达到下限,这是任何已发布的生成器都无法接近的(表 1);其中四个编码器被保留不参与训练,作为泛化性检验。附录 D 给出了对应的核-MMD 版本 MMDr14,第 4.1 节则使用 PickScore 进行了验证。

整合起来:iRDM。

这些选择共同定义了 iRDM:一种精确的批内排斥机制,结合基于 Nyström 近似的吸引力,该吸引力指向一个在整个数据上冻结一次的参考;使用大规模的新鲜生成批次;在条件任务上采用联合图像-文本损失;以及通过约束优化平衡的多样化编码器组。该参考针对每个编码器预先计算一次;每一步都会抽取一个新鲜批次,通过单次评估生成结果,在训练编码器下利用梯度缓存对其进行编码,并在比例拉格朗日权重下对公式 3 中每个编码器的损失求和。目标函数中不包含其他任何内容:没有在线教师模型,没有对抗网络,也没有轨迹。

4 实验

第 3.1 至 3.3 节通过受控研究确定了每一项设计选择。实验报告了剩余内容:主要结果、单步 ImageNet 生成和文生图后训练,以及这些研究未涵盖的消融实验。

4.1 单步 ImageNet 生成

实验设置。

在 ImageNet-256(Deng 等人,2009)上,我们对已发布的 pMF-H FD-SIM 检查点(Lu 等人,2026;Yang 等人,2026)进行后训练,训练步数、学习率和批次大小如附录 B 中所述,使用十个训练编码器,每个编码器都是一个高斯核,其带宽由中位数启发式确定,该编码器的吸引力针对包含 M 张图像的完整 ImageNet 训练集,该训练集被压缩成一个包含 N 个地标的 Nyström 参考。这十个编码器通过第 3.3 节中的比例拉格朗日控制器保持平衡,该控制器在固定预算 上设有满意度门限,每个编码器的实际下限在 ImageNet 验证集上计算得出。评估使用两种非目标度量。 是切片-瓦瑟斯坦比率,在包含 个编码器的面板上取平均,其中四个编码器在训练中被保留,基于每组 个样本和 个投影进行估计。PickScore(Kirstain 等人,2023)是一个学习到的人类偏好模型,针对类别提示词进行评分;相对于 pMF-H FD-SIM 起点,我们在匹配噪声条件下使用两个模型渲染类别条件潜变量,并报告配对均值和胜率。

分布质量。

表1列出了已发布的ImageNet-256生成器;没有一个接近真实数据的下限,最强的也只达到约某个值。iRDM将当前最优水平设定为低于所有已发布生成器的某个值,并且在十四个编码器中的九个以及整体汇总上都是最佳表现。它在五个方面有所不及:Inception、ConvNeXt和MAE输给了FD-loss模型,该模型通过利用单一空间在那些指标上低于真实数据;DreamSim以微弱差距输给了同一模型;而保留的FLUX VAE则输给了MAR-H。附录D在MMDr14(一种核MMD评估面板)下报告了相同领域的结果,该结果大体一致,只是中游模型之间的排序有所变化。

媒体内容 · 前往原文查看
表1:我们的主要指标,针对已发布的ImageNet-256生成器。每个编码器的下限归一化比率(即切片Wasserstein距离;匹配新的真实数据采样,数值越低越好)。这是一种最优传输距离,与训练损失的核MMD没有任何共同机制,因此无法通过匹配损失来操纵。该指标是14个编码器上的算术平均值(与mmdr14的汇总值一致)。灰色行是单步(单NFE)模型;⋆标记了训练中使用的外部表示编码器。†标记了训练中保留的四个编码器,即DINOv2、SigLIP(v1)、RADIO和FLUX;是仅针对这四个编码器的相同下限归一化均值,作为泛化性检查。
模型

Inception

ConvNeXt

DINOv2†

MAE

SigLIP2

CLIP

DINOv3

SigLIP (v1)†

PE-Core

RADIO†

WebSSL

AIMv2

DreamSim

FLUX†

验证基线 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00
\rowcolorgray!15Drifting-L⋆ 0.97 1.61 6.12 3.20 8.84 5.83 18.2 7.12 7.89 5.31 5.70 8.45 2.69 1.07 5.93 4.91
\rowcolorgray!15iMF-XL 0.96 1.22 5.07 2.96 6.89 5.04 15.2 6.01 7.26 4.19 4.75 7.06 2.62 1.03 5.02 4.08
Open-MAGVIT2-L 1.57 1.39 4.87 2.93 6.33 4.94 6.59 5.33 5.95 4.50 4.66 7.05 2.70 1.41 4.30 4.03
SiT-XL/2 1.29 1.12 4.53 2.68 6.24 4.75 9.94 5.21 6.36 3.87 4.09 6.43 2.32 0.91 4.27 3.63
\rowcolorgray!15pMF-H (base) 1.25 0.88 3.91 3.15 6.43 3.93 6.62 4.88 6.69 4.00 4.25 6.87 2.63 1.71 4.09 3.63
DiT-XL/2 1.38 0.99 4.12 2.51 5.50 4.72 8.92 4.91 5.98 3.50 3.82 6.01 2.35 1.03 3.98 3.39
VAR-d30 1.08 1.12 4.18 3.18 5.71 4.51 6.37 5.19 6.52 3.77 3.88 6.28 2.63 0.88 3.95 3.51
JiT-H 1.07 1.46 3.73 2.78 5.52 6.17 5.34 4.84 6.59 3.85 3.75 6.11 2.81 1.13 3.94 3.39
MDTv2-XL/2 0.86 0.98 3.76 2.44 5.53 4.71 9.78 4.94 6.33 3.08 3.59 5.48 2.30 0.79 3.90 3.14
MAR-H 1.00 1.04 4.16 2.39 5.25 4.34 9.05 4.86 6.21 3.23 4.01 6.04 2.20 0.48 3.87 3.18
DDT-XL/2⋆ 0.83 0.96 3.74 2.36 5.29 4.60 9.07 4.68 6.18 3.06 3.49 5.44 2.15 0.97 3.77 3.11
SiT-XL/2+REPA⋆ 0.85 1.01 3.63 2.35 5.13 4.33 8.15 4.58 5.99 3.02 3.34 5.29 2.12 0.72 3.61 2.99
REG-XL⋆ 0.79 0.91 3.13 2.03 4.68 3.92 7.09 4.02 5.74 2.60 2.88 4.65 1.83 0.71 3.21 2.62
LightningDiT-XL⋆ 0.89 0.90 3.25 2.04 4.44 3.76 4.90 3.92 5.22 2.80 3.29 5.18 1.99 0.78 3.10 2.69
RAE-XL⋆ 0.75 1.30 2.38 2.11 2.74 3.52 2.76 2.80 4.51 2.39 2.31 3.88 1.51 1.13 2.43 2.18
REPA-E SiT-XL/1⋆ 0.75 1.00 2.79 1.86 3.41 2.83 3.30 3.07 3.89 2.04 2.41 4.13 1.47 0.66 2.40 2.14
\rowcolorgray!15pMF-H (FD-SIM)⋆ 0.67 0.67 1.81 0.60 1.86 2.69 2.33 2.63 4.76 2.14 2.31 3.68 1.24 1.35 2.05 1.98
\rowcolorgray!15iRDM (ours)⋆ 1.27 0.98 1.35 0.83 1.30 1.02 1.11 1.90 1.22 1.56 1.55 1.44 1.32 1.36 1.30 1.54
Refer to caption
图 6:PickScore 偏好,iRDM(橙色)与先前生成器及真实照片参考的对比;每个条形图显示胜率,下方为平均 PickScore。FD-SIM 条形图为匹配噪声配对,其余为按类别均值。iRDM 优于所有先前生成器,并且据我们所知,是首个在 PickScore 上也超越保留真实照片参考的单步模型。PickScore 排序与排名(表 1)一致,表明它也反映了人类偏好。

人类偏好。

一项非目标检查也证实了这一点。PickScore(Kirstain 等人,2023)是一个我们从未针对其进行训练的学习型人类偏好模型,它在匹配对中(即配对)偏好我们收敛后的检查点,而非其 pMF-H FD-SIM 起点,并且在 和 类别上偏好它而非最近的 RAE-XL(Zheng 等人,2025)和 REPA-E SiT-XL(Leng 等人,2025)(图 6);它甚至在 类别上偏好我们的样本而非保留的真实照片,据我们所知,这是首个在 PickScore 上超越真实图像的单步生成器。

4.2 文生图后训练

实验设置。

我们对 FLUX.2 [klein](Black Forest Labs,2026)进行了后训练,从其四步检查点出发,采用第 3.2 节所述的图文联合目标,以指定的批次大小和学习率训练若干步,耗时约 H200 GPU 小时,并应用第 4.1 节的编码器组合与约束优化权重,将其转化为单步模型。匹配参考数据从四步教师模型一次性收集后冻结,因此后训练查询不再依赖在线教师:一组约 K 条教师生成结果、经 PickScore 排序的 COCO 渲染图(Lin 等人,2014 年),以及经检测器验证的 GenEval 正确样本,这些数据被一次性压缩为 Nyström 参考,详见附录 E.1。我们使用 GenEval(Ghosh 等人,2023 年)的标准协议和 COCO 验证提示词上的 PickScore(Kirstain 等人,2023 年)进行评估,并与同一四步教师模型的 DMD2(Yin 等人,2024a)单步蒸馏结果进行对比(附录 E.2)。

结果。

该单步模型在 GenEval 整体指标上超越了其四步起点,对比结果为 ,各类别细分数据见表 2:在单目标提示词上匹配四步版本,在双目标、颜色、位置和属性绑定上超越四步版本,仅在计数上落后。在 PickScore 上达到 22.76,同样高于四步版本的 。DMD2 基线在整体 GenEval 和 PickScore 上分别达到 ,也列于表 2;图 1(c) 展示了两个指标在后训练计算量下的变化轨迹。

联合目标与边缘目标。

联合耦合带来了性能提升。一种边缘变体从特征中移除描述文本,仅匹配图像边缘分布而不拼接 SigLIP 文本,其在表 2 中的整体指标落后于联合模型,对比结果为 ,差距集中在需要图文对齐的类别上:双目标( 对比 )和属性绑定( 对比 ),而几乎不依赖耦合的单目标则基本不变。匹配联合分布而非图像边缘分布,正是将提示词保真度纳入优化目标的关键。

媒体内容 · 前往原文查看
表 2:一步式 FLUX.2 [klein] 后训练的 GenEval 和 PickScore 结果。展示了四步式 FLUX.2 [klein]、未经训练的一步式起点、DMD2(Yin 等人,2024a)基线、图像边缘消融实验以及联合一步式 iRDM 的逐类别 GenEval 和 PickScore;每列最佳结果以粗体标出。PickScore 基于 COCO 验证集提示词进行评分,分数越高越好。联合图像-文本目标将整体 GenEval 从(边缘)提升至,超越了四步式版本的整体表现。
方法 单个物体 两个物体 计数 颜色 位置 颜色属性 总体 PickScore
FLUX.2 [klein](4 步) 0.994 0.904 0.791 0.880 0.575 0.623 0.794 22.58
未经训练(1 步) 0.894 0.323 0.603 0.673 0.225 0.128 0.474 19.95
DMD2(1 步) 0.997 0.894 0.806 0.864 0.603 0.660 0.804 22.36
iRDM(1 步,边缘) 0.991 0.899 0.763 0.910 0.638 0.608 0.801 22.70
iRDM(1 步) 0.994 0.924 0.756 0.923 0.650 0.708 0.826 22.76

4.3 约束优化与均匀加权

实验设置。

媒体内容 · 前往原文查看
表 3:按编码器加权:门控比例拉格朗日法与均匀加权法对比,步数基于面板上的 pMF-H(数值越低越好,实际下限为 )。门控控制器在均值上略优于均匀加权,并显著改善了最差编码器(即控制器所针对的情况)。较优项以粗体标出。
聚合值 pMF-H 门控 均匀
2.09 1.88 1.90
最大值 4.83 3.49 4.06

我们将第 3.3 节的门控比例拉格朗日控制器与均匀加权进行隔离对比:两者均从 pMF-H 进行热启动,并在同一方案下训练若干步数,仅按编码器的分配方式不同。初始状态呈双峰分布,经典编码器已达到或低于其下限,而现代编码器距离实际值尚远,因此 的聚合值由违规者决定。

结果。

门控控制器将预算集中投入到最差的编码器 PE-Core 上,同时将三个已达到下限的编码器排除在外:它在均值上略优于均匀加权( 对比 ),同时显著改善了最差情况( 对比 ,起始值为 ),改善幅度几乎是均匀加权所能达到的两倍(表 3)。将资源重新分配给违规最严重的编码器正是该控制器的目标;我们在此不对感知质量做任何断言,因为该聚合指标并不直接衡量感知质量。

4.4 训练距离

实验设置。

在保持配方其余部分不变的情况下,我们仅翻转六种微调损失函数中每一步的距离度量,所有损失函数均从相同的 pMF-H 检查点进行热启动,并针对单个 DINOv2 cls 编码器进行优化器步数的微调,共享学习率为 的 AdamW 优化器以及生成批次大小为 。三个核方法分支使用带宽为 的 RBF 核:mmdx 是有偏的,包含精确的批次内项和基于地标的 Nyström 交叉项;mmd_exact 用精确的完整生成-真实逐对均值替换该交叉项;mmd_rff 匹配一个冻结的 维随机傅里叶特征均值;fd 是 Fréchet(高斯矩)距离,sw 是具有 个投影的切片 Wasserstein 损失。漂移分支是已发表论文中跨半径 的耦合力场的忠实移植,使用相同特征上的批次内生成负样本和真实正样本,运行时间与其他分支匹配(在其生成批次大小为 时约为 步);我们对其学习率进行扫描,并报告最温和的值 ,因为其原生学习率 是为从头训练调优的,在热启动下会出现回归。我们使用两个中立的第三方距离,在相同特征上对每个分支以及未训练的基线进行评分:一个是基于每组 个样本、具有 个投影的切片 Wasserstein 比率,另一个是基于 个样本、使用随机傅里叶特征的 RFF-MMD 比率。这样,每个分支至少在一个其未训练过的距离上进行评估;sw 和 mmd_rff 分支各自优化了两种评估距离中的一种,因此使用另一种距离进行评判(表 4)。

结果。

在所有指标(mmdx、mmd_rff、mmd_exact、fd、sw、drifting)上,排序结果保持一致,且均远高于未训练的基线:三种核MMD估计器占据前三,矩匹配紧随其后,切片Wasserstein损失再往后,而忠实移植的漂移力场即使在学习率扫描的最佳点上也是最弱的。作为目标函数,Nyström MMD使特征分布最接近真实分布,而最优传输虽然是一个优秀的评判标准,却是效果最差的损失之一。两个对照实验验证了这一解读:精确的全配对MMD并未击败其Nyström近似(因为低秩交叉项提供了更平滑的梯度),并且基于某种距离进行训练在该距离本身上并无优势——切片Wasserstein分支在切片Wasserstein评估中被所有核MMD分支甚至矩匹配所击败。这就是iRDM使用MMD-Nyström信号进行训练,却用独立的切片Wasserstein距离进行评估的原因。

媒体内容 · 前往原文查看
表4:DINOv2(cls)上的训练距离消融实验。六种微调损失从相同的pMF-H检查点开始热启动,并针对单个DINOv2编码器进行微调,仅翻转每步的距离;基线是第步的pMF-H。每个条目是在两种中性距离下的地板归一化比率(数值越低越接近真实分布,与新的真实采样匹配):切片Wasserstein比率(每个编码器的模拟量)和RFF-MMD比率(MMDr14的模拟量)。mmdx、mmd_rff、mmd_exact、fd、sw、drifting的顺序在两者上完全相同;精确MMD并未击败Nyström,并且经过SW训练的分支并未赢得SW评估。drifting是漂移力场的忠实移植,显示在学习率扫描的最佳点上,其原生速率对热启动进行回归。
DINOv2 cls 比率 () 基线 mmdx mmd_rff mmd_exact fd sw drifting
SW 1.927 1.420 1.466 1.492 1.547 1.583 1.746
RFF-MMD 10.393 4.495 4.839 5.438 5.798 6.413 8.258

5 结论

我们将表征分布匹配——近期一系列免教师单步生成器背后的原理——视为一个设计空间,而非一组方法的集合。两个轴固定了每个实例:生成特征分布与真实特征分布如何比较,以及它们在哪些表征空间中进行比较;每次只改变一个轴,就能将每个实例转化为一种具有内在机制的优选设计。在比较轴上,经典的最大均值差异(MMD)一旦被正确估计,就会成为一个强大的目标函数——它结合了精确的批内排斥力,以及通过 Nyström 方法向一个预先冻结的参考分布施加的吸引力,该参考分布由大量新鲜生成批次提供,并且在条件任务中,通过匹配联合图像-文本分布而非图像边缘分布来实现。在表征轴上,单一编码器是不够的,因为任何单个编码器都可能被驱动到低于真实分数,而样本在视觉上仍然明显是假的,因此我们通过约束优化来平衡一组多样化的编码器,并与之进行匹配。将这些选择结合起来便得到了 iRDM,它在 ImageNet 上树立了单步生成的最新水平,并将四步 FLUX.2 [klein] 后训练成一个单步模型,该模型在 GenEval 和 PickScore 上超越了原版,我们报告了与 之间的剩余差距,这是一个基于编码器面板的切片 Wasserstein 距离,与训练损失没有任何共同机制。

与真实数据之间仍存在差距:在 对 的基准下,最佳单步生成器在可测量范围内仍不及一次全新的真实采样,缩小这一差距是顺理成章的下一步目标。该设计空间为此留有余地——通过多尺度核、学习型或任务特定的编码器面板,以及更丰富的条件耦合——同样的方案,即通过单次网络评估来匹配一个冻结的参考分布,应该能够迁移到图像之外的模态,只要预训练编码器能提供相应的特征空间。

致谢

我们感谢贾伟阳(Jiawei Yang)的有益讨论。本项目部分由法雷奥(Valeo)资助。

参考文献

  • Q. Berthet, Y. Wu, C. Crepy, R. Elie, K. Greff, 和 M. E. Sander (2026) MIND: 用于生成模型评估的蒙日初始距离(monge inception distance for generative models evaluation)。CoRR 摘要 2605.06797。引用自:第1节,第3.3节。
  • M. Bińkowski、D. J. Sutherland、M. Arbel 和 A. Gretton(2018)《揭秘 MMD GAN》。发表于国际学习表征会议,引用自:附录 A、第 2 节、第 3.3 节。
  • Black Forest Labs(2024)FLUX.1。注:https://github.com/black-forest-labs/flux 官方 FLUX.1 模型推理仓库,引用自:表 5。
  • Black Forest Labs(2026)FLUX.2 [klein]:迈向交互式视觉智能。注:https://bfl.ai/blog/flux2-klein-towards-interactive-visual-intelligence 模型权重:https://huggingface.co/collections/black-forest-labs/flux2 引用自:附录 A、第 1 节、第 3.2 节、第 4.2 节。
  • K. Black、M. Janner、Y. Du、I. Kostrikov 和 S. Levine(2024)《使用强化学习训练扩散模型》。发表于国际学习表征会议,引用自:附录 A。
  • D. Bolya、P. Huang、P. Sun、J. H. Cho、A. Madotto、C. Wei、T. Ma、J. Zhi、J. Rajasegaran、H. Rasheed、J. Wang、M. Monteiro、H. Xu、S. Dong、N. Ravi、D. Li、P. Dollár 和 C. Feichtenhofer(2025)《感知编码器:最佳视觉嵌入向量不在网络输出端》。发表于神经信息处理系统进展大会,引用自:表 5。
  • A. Chatalic、N. Schreuder、L. Rosasco 和 A. Rudi(2022)《Nyström 核均值嵌入》。发表于国际机器学习大会,引用自:附录 A、第 1 节、第 3.1 节、第 3.1 节。
  • T. Coste、U. Anwar、R. Kirk 和 D. Krueger(2024)《奖励模型集成有助于缓解过度优化》。发表于国际学习表征会议,引用自:附录 A。
  • J. Deng、W. Dong、R. Socher、L. Li、K. Li 和 L. Fei-Fei(2009)《ImageNet:一个大规模分层图像数据库》。发表于 IEEE 计算机视觉与模式识别会议,引用自:第 4.1 节。
  • M. Deng、H. Li、T. Li、Y. Du 和 K. He(2026)《基于漂移的生成式建模》。注:arXiv 预印本 arXiv:2602.04770,引用自:附录 A、表 7、第 1 节、第 2 节、第 3.1 节。
  • I. Deshpande、Z. Zhang 和 A. G. Schwing(2018)《使用切片 Wasserstein 距离进行生成式建模》。发表于 IEEE 计算机视觉与模式识别会议论文集,引用自:第 2 节、第 3.1 节、第 3.3 节。
  • G. K. Dziugaite、D. M. Roy 和 Z. Ghahramani(2015)《通过最大均值差异优化训练生成式神经网络》。载于《第三十一届人工智能不确定性会议论文集》,第 258–267 页。引用于:§1、§2。
  • A. Falahati、E. Creager、G. Kamath 和 S. Mohapatra(2026)《DriftXpress:通过投影 RKHS 场实现更快的漂移模型》。说明:arXiv 预印本 arXiv:2605.12183。引用于:附录 A。
  • D. Fan、S. Tong、J. Zhu、K. Sinha、Z. Liu、X. Chen、M. Rabbat、N. Ballas、Y. LeCun、A. Bar 和 S. Xie(2025)《扩展无语言视觉表示学习》。载于《IEEE/CVF 国际计算机视觉大会论文集》。引用于:表 5。
  • E. Fini、M. Shukor、X. Li、P. Dufter、M. Klein、D. Haldimann、S. Aitharaju、V. G. Turrisi da Costa、L. Béthune、Z. Gan、A. T. Toshev、M. Eichner、M. Nabi、Y. Yang、J. M. Susskind 和 A. El-Nouby(2025)《大型视觉编码器的多模态自回归预训练》。载于《IEEE/CVF 计算机视觉与模式识别大会论文集》。引用于:表 5。
  • K. Frans、D. Hafner、S. Levine 和 P. Abbeel(2025)《通过捷径模型实现单步扩散》。载于《国际学习表征大会》。引用于:§2。
  • S. Fu、N. Tamir、S. Sundaram、L. Chai、R. Zhang、T. Dekel 和 P. Isola(2023)《DreamSim:利用合成数据学习人类视觉相似性的新维度》。载于《神经信息处理系统进展》。引用于:表 5。
  • L. Gao、J. Schulman 和 J. Hilton(2023a)《奖励模型过度优化的缩放定律》。载于《国际机器学习大会》。引用于:附录 A。
  • L. Gao、Y. Zhang、J. Han 和 J. Callan(2021)《在内存受限条件下扩展深度对比学习的批次大小》。载于《第六届自然语言处理表示学习研讨会(RepL4NLP-2021)论文集》,第 316–321 页。外部链接:文档、链接。引用于:§1、§3.2。
  • S. Gao、P. Zhou、M. Cheng 和 S. Yan(2023b)《MDTv2:掩码扩散 Transformer 是一种强大的图像合成器》。载于《IEEE/CVF 国际计算机视觉大会论文集》。引用于:附录 A、表 7。
  • Z. Geng, M. Deng, X. Bai, J. Z. Kolter 与 K. He (2025a) 均值流:面向单步生成建模。收录于《神经信息处理系统进展》,引用自:§2。
  • Z. Geng, Y. Lu, Z. Wu, E. Shechtman, J. Z. Kolter 与 K. He (2026) 改进的均值流:论前馈生成模型的挑战。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》,引用自:附录 A、表 7、§2。
  • Z. Geng, A. Pokle, W. Luo, J. Lin 与 Z. Kolter (2025b) 让一致性模型变得简单。收录于《国际学习表征会议》,引用自:§2。
  • D. Ghosh, H. Hajishirzi 与 L. Schmidt (2023) GenEval:一个面向对象的文本到图像对齐评估框架。收录于《神经信息处理系统进展》,引用自:附录 A、§E.1、§3.2、§4.2。
  • I. J. Goodfellow, J. Pouget-Abadie, M. Mirza, B. Xu, D. Warde-Farley, S. Ozair, A. C. Courville 与 Y. Bengio (2014) 生成对抗网络。收录于《神经信息处理系统进展》,引用自:§2。
  • A. Gretton, K. M. Borgwardt, M. J. Rasch, B. Schölkopf 与 A. Smola (2012) 核双样本检验。《机器学习研究期刊》13 卷,第 723–773 页。引用自:§3.1、§3.3。
  • J. Han, P. Li, Q. Guo, R. Xu, S. Ermon 与 E. J. Candès (2026) 基于 Wasserstein 梯度流的单步生成建模。注:arXiv 预印本 arXiv:2605.11755。引用自:§2。
  • K. He, X. Chen, S. Xie, Y. Li, P. Dollár 与 R. Girshick (2022) 掩码自编码器是可扩展的视觉学习器。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》,引用自:表 5。
  • G. Heinrich, M. Ranzinger, H. Yin, Y. Lu, J. Kautz, A. Tao, B. Catanzaro 与 P. Molchanov (2025) RADIOv2.5:聚合视觉基础模型的改进基线。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》,引用自:表 5。
  • M. Heusel, H. Ramsauer, T. Unterthiner, B. Nessler 与 S. Hochreiter (2017) 采用双时间尺度更新规则训练的 GAN 收敛于局部纳什均衡。收录于《神经信息处理系统进展》,引用自:附录 A、§1、§3.3。
  • J. Ho、A. Jain 和 P. Abbeel(2020)《去噪扩散概率模型》。收录于《神经信息处理系统进展》,引用章节:第1节、第2节。
  • S. Jayasumana、S. Ramalingam、A. Veit、D. Glasner、A. Chakrabarti 和 S. Kumar(2024)《重新思考 FID:为图像生成寻找更优评估指标》。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》,第 9307–9315 页。引用章节:附录 A、第3.3节。
  • J. Johnson、A. Alahi 和 L. Fei-Fei(2016)《用于实时风格迁移与超分辨率的感知损失》。收录于《欧洲计算机视觉会议》,引用章节:第2节。
  • T. Karras、M. Aittala、T. Aila 和 S. Laine(2022)《阐明基于扩散的生成模型的设计空间》。收录于《神经信息处理系统进展》,引用章节:第2节。
  • Y. Kirstain、A. Polyak、U. Singer、S. Matiana、J. Penna 和 O. Levy(2023)《Pick-a-Pic:一个面向文本到图像生成的用户偏好开放数据集》。收录于《神经信息处理系统进展》,引用章节:附录 A、第E.1节、第1节、第4.1节、第4.1节、第4.2节。
  • N. Kumari、R. Zhang、E. Shechtman 和 J. Zhu(2022)《集成现成模型用于 GAN 训练》。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》,引用章节:第2节。
  • T. Kynkäänniemi、T. Karras、M. Aittala、T. Aila 和 J. Lehtinen(2023)《ImageNet 类别在 Fréchet 初始距离中的作用》。收录于《国际学习表征会议》,引用章节:附录 A、第3.3节。
  • T. Kynkäänniemi、T. Karras、S. Laine、J. Lehtinen 和 T. Aila(2019)《用于评估生成模型的改进精确率与召回率指标》。收录于《神经信息处理系统进展》,引用章节:附录 A。
  • E. C. Larson 和 D. M. Chandler(2010)《最明显失真:全参考图像质量评估及策略的作用》。《电子成像期刊》第19卷第1期,第011006页。引用章节:第1节。
  • X. Leng、J. Singh、Y. Hou、Z. Xing、S. Xie 和 L. Zheng(2025)《REPA-E:解锁 VAE 用于潜在扩散 Transformer 的端到端调优》。收录于《IEEE/CVF 国际计算机视觉会议论文集》,引用章节:表7、第4.1节。
  • C. Li, W. Chang, Y. Cheng, Y. Yang, 和 B. Póczos (2017) MMD GAN:迈向对矩匹配网络更深层次的理解。收录于《神经信息处理系统进展》,引用自第2节。
  • T. Li 和 K. He (2025) 回归基础:让去噪生成模型去噪。注:arXiv 预印本 arXiv:2511.13720,引用自附录 A、表 7、第 3.1 节。
  • T. Li, Y. Tian, H. Li, M. Deng, 和 K. He (2024) 无需向量量化的自回归图像生成。收录于《神经信息处理系统进展》,引用自附录 A、表 7。
  • Y. Li, K. Swersky, 和 R. Zemel (2015) 生成式矩匹配网络。收录于《国际机器学习大会》,引用自第1节、第2节。
  • T. Lin, M. Maire, S. Belongie, J. Hays, P. Perona, D. Ramanan, P. Dollár, 和 C. L. Zitnick (2014) Microsoft COCO:上下文中的常见物体。收录于《欧洲计算机视觉会议》,引用自第 E.1 节、第 4.2 节。
  • Y. Lipman, R. T. Q. Chen, H. Ben-Hamu, M. Nickel, 和 M. Le (2023) 用于生成式建模的流匹配。收录于《国际学习表征会议》,引用自第1节、第2节。
  • X. Liu, C. Gong, 和 Q. Liu (2023) 流直且快:学习使用修正流生成和传输数据。收录于《国际学习表征会议》,引用自第2节。
  • Z. Liu, H. Mao, C. Wu, C. Feichtenhofer, T. Darrell, 和 S. Xie (2022) 面向2020年代的卷积网络。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》,引用自表5。
  • C. Lu 和 Y. Song (2025) 简化、稳定并扩展连续时间一致性模型。收录于《国际学习表征会议》,引用自第2节。
  • Y. Lu, S. Lu, Q. Sun, H. Zhao, Z. Jiang, X. Wang, T. Li, Z. Geng, 和 K. He (2026) 基于像素均值流的一步式无潜在空间图像生成。注:arXiv 预印本 arXiv:2601.22158,引用自附录 A、表 7、第1节、第2节、第 4.1 节。
  • W. Luo, T. Hu, S. Zhang, J. Sun, Z. Li, 和 Z. Zhang (2023) Diff-Instruct:一种从预训练扩散模型迁移知识的通用方法。收录于《神经信息处理系统进展》,引用自第2节。
  • Z. Luo、F. Shi、Y. Ge、Y. Yang、L. Wang 和 Y. Shan(2024)《Open-MAGVIT2:推动自回归视觉生成民主化的开源项目》。注:arXiv 预印本 arXiv:2409.04410,被附录 A、表 7 引用。
  • N. Ma、M. Goldstein、M. S. Albergo、N. M. Boffi、E. Vanden-Eijnden 和 S. Xie(2024)《SiT:利用可扩展插值变换器探索基于流和扩散的生成模型》。载于《欧洲计算机视觉会议》,被附录 A、表 7 引用。
  • S. Malladi、K. Lyu、A. Panigrahi 和 S. Arora(2022)《论自适应梯度算法的随机微分方程与缩放规则》。载于《神经信息处理系统进展》,被第 3.2 节引用。
  • K. Muandet、K. Fukumizu、B. Sriperumbudur 和 B. Schölkopf(2017)《分布的核均值嵌入:综述与展望》。《机器学习基础与趋势》第 10 卷第 1–2 期,第 1–141 页。被附录 A 引用。
  • M. Oquab、T. Darcet、T. Moutakanni、H. Vo、M. Szafraniec、V. Khalidov、P. Fernandez、D. Haziza、F. Massa、A. El-Nouby、M. Assran、N. Ballas、W. Galuba、R. Howes、P. Huang、S. Li、I. Misra、M. Rabbat、V. Sharma、G. Synnaeve、H. Xu、H. Jégou、J. Mairal、P. Labatut、A. Joulin 和 P. Bojanowski(2024)《DINOv2:无需监督学习鲁棒视觉特征》。载于《机器学习交易》,被表 5 引用。
  • G. Parmar、R. Zhang 和 J. Zhu(2022)《论 GAN 评估中的混叠缩放与令人惊讶的细微之处》。载于《IEEE/CVF 计算机视觉与模式识别会议论文集》,被附录 A 引用。
  • W. Peebles 和 S. Xie(2023)《基于变换器的可扩展扩散模型》。载于《IEEE/CVF 国际计算机视觉会议论文集》,被附录 A、表 7、第 2 节引用。
  • A. Radford、J. W. Kim、C. Hallacy、A. Ramesh、G. Goh、S. Agarwal、G. Sastry、A. Askell、P. Mishkin、J. Clark、G. Krueger 和 I. Sutskever(2021)《从自然语言监督中学习可迁移的视觉模型》。载于《国际机器学习会议》,被表 5 引用。
  • A. Rahimi 和 B. Recht(2007)《大规模核机器的随机特征》。载于《神经信息处理系统进展》,被附录 A、第 3.1 节引用。
  • M. Ranzinger、G. Heinrich、J. Kautz 和 P. Molchanov(2024)《AM-RADIO:聚合式视觉基础模型将所有领域归为一体》。收录于 IEEE/CVF 计算机视觉与模式识别会议论文集,引用自:表 5。
  • R. Rombach、A. Blattmann、D. Lorenz、P. Esser 和 B. Ommer(2022)《基于潜在扩散模型的高分辨率图像合成》。收录于 IEEE/CVF 计算机视觉与模式识别会议论文集,引用自:§2。
  • T. Salimans、I. Goodfellow、W. Zaremba、V. Cheung、A. Radford 和 X. Chen(2016)《改进的 GAN 训练技术》。收录于神经信息处理系统进展,引用自:§2。
  • T. Salimans 和 J. Ho(2022)《用于扩散模型快速采样的渐进式蒸馏》。收录于国际学习表征会议,引用自:§2。
  • T. Salimans、T. Mensink、J. Heek 和 E. Hoogeboom(2024)《通过矩匹配实现扩散模型的多步蒸馏》。收录于神经信息处理系统进展,引用自:§2。
  • A. Sauer、K. Chitta、J. Müller 和 A. Geiger(2021)《投影 GAN 收敛更快》。收录于神经信息处理系统进展,引用自:§2。
  • A. Sauer、D. Lorenz、A. Blattmann 和 R. Rombach(2024)《对抗性扩散蒸馏》。收录于欧洲计算机视觉会议,引用自:附录 A、§2。
  • A. Schrab、I. Kim、M. Albert、B. Laurent、B. Guedj 和 A. Gretton(2023)《MMD 聚合双样本检验》。机器学习研究期刊 24 (194),第 1–81 页。引用自:§3.3。
  • O. Siméoni、H. V. Vo、M. Seitzer、F. Baldassarre、M. Oquab、C. Jose、V. Khalidov、M. Szafraniec、S. E. Yi、M. Ramamonjisoa、F. Massa、D. Haziza、L. Wehrstedt、J. Wang、T. Darcet、T. Moutakanni、L. Sentana、C. Roberts、A. Vedaldi、J. Tolan、J. Brandt、C. Couprie、J. Mairal、H. Jégou、P. Labatut 和 P. Bojanowski(2026)《DINOv3》。机器学习研究汇刊。引用自:表 5。
  • J. Skalse、N. Howe、D. Krasheninnikov 和 D. Krueger(2022)《定义与刻画奖励作弊行为》。收录于神经信息处理系统进展,引用自:附录 A。
  • Y. Song, P. Dhariwal, M. Chen, and I. Sutskever (2023) 一致性模型。收录于《国际机器学习大会》,引用自:第2节。
  • Y. Song and P. Dhariwal (2024) 改进的一致性模型训练技术。收录于《国际学习表征大会》,引用自:第2节。
  • Y. Song, J. Sohl-Dickstein, D. P. Kingma, A. Kumar, S. Ermon, and B. Poole (2021) 基于随机微分方程的分数生成建模。收录于《国际学习表征大会》,引用自:第1节、第2节。
  • B. K. Sriperumbudur, A. Gretton, K. Fukumizu, B. Schölkopf, and G. R. G. Lanckriet (2010) 希尔伯特空间嵌入与概率测度上的度量。《机器学习研究期刊》第11卷,第1517–1561页。引用自:第3.1节、第3.3节。
  • G. Stein, J. C. Cresswell, R. Hosseinzadeh, Y. Sui, B. Ross, V. Villecroze, Z. Liu, A. L. Caterini, E. Taylor, and G. Loaiza-Ganem (2023) 揭示生成模型评估指标的缺陷及其对扩散模型的不公平对待。收录于《神经信息处理系统进展》第36卷。引用自:附录A、第3.3节。
  • A. Stooke, J. Achiam, and P. Abbeel (2020) 基于PID拉格朗日方法的强化学习响应式安全。收录于《国际机器学习大会》,引用自:附录A、第1节、第3.3节。
  • M. Strathern (1997) ‘提升评级’:英国大学体系中的审计。《欧洲评论》第5卷第3期,第305–321页。引用自:附录A。
  • C. Szegedy, V. Vanhoucke, S. Ioffe, J. Shlens, and Z. Wojna (2016) 重新思考计算机视觉的Inception架构。收录于《IEEE计算机视觉与模式识别大会论文集》,引用自:表5。
  • K. Tian, Y. Jiang, Z. Yuan, B. Peng, and L. Wang (2024) 视觉自回归建模:通过下一尺度预测实现可扩展图像生成。收录于《神经信息处理系统进展》,引用自:附录A、表7。
  • M. Tschannen、A. Gritsenko、X. Wang、M. F. Naeem、I. Alabdulmohsin、N. Parthasarathy、T. Evans、L. Beyer、Y. Xia、B. Mustafa、O. Hénaff、J. Harmsen、A. Steiner 和 X. Zhai(2025)《SigLIP 2:具有改进语义理解、定位和密集特征的多语言视觉语言编码器》。arXiv 预印本 arXiv:2502.14786。引用自:表 5,§E.1。
  • B. Wallace、M. Dang、R. Rafailov、L. Zhou、A. Lou、S. Purushwalkam、S. Ermon、C. Xiong、S. Joty 和 N. Naik(2024)《使用直接偏好优化的扩散模型对齐》。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》。引用自:附录 A。
  • S. Wang、Z. Tian、W. Huang 和 L. Wang(2026)《DDT:解耦扩散 Transformer》。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》。引用自:附录 A,表 7。
  • Z. Wang 和 X. Shang(2006)《用于感知图像质量评估的空间池化策略》。收录于《IEEE 国际图像处理会议》,第 2945–2948 页。引用自:§1。
  • G. Wu、S. Zhang、R. Shi、S. Gao、Z. Chen、L. Wang、Z. Chen、H. Gao、Y. Tang、J. Yang、M. Cheng 和 X. Li(2025)《用于生成的表示纠缠:训练扩散 Transformer 比你想象的要容易得多》。收录于《神经信息处理系统进展》。引用自:附录 A,表 7。
  • J. Wu、Z. Huang、D. Acharya、W. Li、J. Thoma、D. P. Paudel 和 L. Van Gool(2019)《切片 Wasserstein 生成模型》。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》。引用自:§2,§3.3。
  • J. Xu、X. Liu、Y. Wu、Y. Tong、Q. Li、M. Ding、J. Tang 和 Y. Dong(2023)《ImageReward:学习并评估文本到图像生成中的人类偏好》。收录于《神经信息处理系统进展》。引用自:附录 A。
  • J. Yang、Z. Geng、X. Ju、Y. Tian 和 Y. Wang(2026)《用于视觉生成的表示 Fréchet 损失》。注:arXiv 预印本 arXiv:2604.28190。引用自:附录 A、附录 A、表 7、图 8、附录 G、§1、§1、§2、§3.2、§3.3、§3.3、§4.1。
  • T. Yang, Y. Li, M. Mahdavi, R. Jin, 和 Z. Zhou (2012) Nyström 方法与随机傅里叶特征:理论与实证比较。收录于《神经信息处理系统进展》,引用自:附录 A,§3.1。
  • J. Yao, B. Yang, 和 X. Wang (2025) 重建 vs. 生成:驯服潜在扩散模型中的优化困境。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》,引用自:附录 A,表 7。
  • T. Yin, M. Gharbi, T. Park, R. Zhang, E. Shechtman, F. Durand, 和 W. T. Freeman (2024a) 改进的分布匹配蒸馏以实现快速图像合成。收录于《神经信息处理系统进展》,引用自:附录 A,§E.2,表 8,§2,§4.2,表 2。
  • T. Yin, M. Gharbi, R. Zhang, E. Shechtman, F. Durand, W. T. Freeman, 和 T. Park (2024b) 基于分布匹配蒸馏的单步扩散。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》,引用自:§2。
  • S. Yu, S. Kwak, H. Jang, J. Jeong, J. Huang, J. Shin, 和 S. Xie (2025) 面向生成的表征对齐:训练扩散 Transformer 比你想象的更简单。收录于《国际学习表征会议》,引用自:附录 A,表 7,§2。
  • X. Zhai, B. Mustafa, A. Kolesnikov, 和 L. Beyer (2023) 用于语言-图像预训练的 Sigmoid 损失。收录于《IEEE/CVF 国际计算机视觉会议论文集》,引用自:表 5。
  • R. Zhang, P. Isola, A. A. Efros, E. Shechtman, 和 O. Wang (2018) 深度特征作为感知度量的惊人有效性。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》,引用自:§2。
  • B. Zheng, N. Ma, S. Tong, 和 S. Xie (2025) 基于表征自编码器的扩散 Transformer。arXiv 预印本 arXiv:2510.11690。引用自:附录 A,表 7,§4.1。
  • L. Zhou, S. Ermon, 和 J. Song (2025) 归纳矩匹配。收录于《国际机器学习会议》,引用自:§2。
  • M. Zhou、H. Zheng、Z. Wang、M. Yin 和 H. Huang(2024)《分数恒等蒸馏:预训练扩散模型指数级快速蒸馏实现单步生成》。发表于国际机器学习大会,引用自第2节。

附录A 扩展相关工作

可扩展核估计器。

随机傅里叶特征利用数据无关基对核求和进行线性化 [Rahimi and Recht, 2007];Nyström 方法则使用数据相关的地标点,在核谱快速衰减时表现更优 [Yang et al., 2012]。对于核均值嵌入(RKHS 中用于概括分布的单一点 [Muandet et al., 2017]),Nyström 压缩能以远少于数据点的地标点数量,保持与精确嵌入相同的完整估计速率 [Chatalic et al., 2022]。与此同时,DriftXpress 通过将核场投影到具有地标近似的低秩 RKHS 上来加速漂移模型 [Falahati et al., 2026]。我们的应用在目标和对称性上有所不同:DriftXpress 近似完整的逐批次漂移更新以提升速度,而我们仅压缩静态数据侧,将其冻结为覆盖 128 万张图像的全局吸引目标,以消除参考噪声,并保持动态的批次内排斥项精确不变。

指标操纵与多编码器评估。

单编码器距离指标,例如 FID [Heusel et al., 2017]、KID [Bińkowski et al., 2018]、CMMD [Jayasumana et al., 2024] 以及特征空间中的精确率和召回率 [Kynkäänniemi et al., 2019],都继承了其编码器的盲点:分数会随调整大小的细节而变化 [Parmar et al., 2022],会因那些没有质量提升的边缘 ImageNet 类别特征而失效 [Kynkäänniemi et al., 2023],并且在更换编码器时会重新对模型进行排序 [Stein et al., 2023]。Yang 等人 [2026] 将这一点推向了极致,使得一个经过训练的生成器得分低于真实验证集的得分;我们证明了这种失败源于单编码器匹配本身,而非任何弱编码器。当使用学习得到的代理时,同样的现象被称为奖励破解 [Strathern, 1997, Skalse et al., 2022, Gao et al., 2023a],对代理进行集成可以缓解该问题 [Coste et al., 2024],而拉格朗日方法则在约束强化学习中对其进行控制 [Stooke et al., 2020]。在我们的设定中,每个代理都是冻结的,因此博弈压力集中在编码器权重上,而这正是比例拉格朗日控制器所调节的内容;评估将 14 个编码器(其中 4 个在训练中保留未用)聚合为一个与损失无关的切片 Wasserstein 距离。

后训练文本到图像模型。

少步文本到图像系统通常是从一个多步教师模型中通过对抗方式 [Sauer et al., 2024] 或基于分数的分布匹配 [Yin et al., 2024a] 蒸馏而来,然后通过优化学习到的偏好奖励来引导其符合人类品味。这些奖励模型基于人类选择进行训练 [Xu et al., 2023, Kirstain et al., 2023],并通过策略梯度 [Black et al., 2024] 或直接偏好目标 [Wallace et al., 2024] 进行优化;所有这些方法都继承了单个学习评分器可被博弈的特性,而这正是我们的多编码器组合针对冻结代理所要解决的同一问题。对于我们的文本到图像结果,四步 FLUX.2 [klein] [Black Forest Labs, 2026] 预先生成一个参考集,而第 3.2 节的联合图像-文本目标则使单步模型与之匹配,无需在线教师模型和奖励模型,并通过 GenEval [Ghosh et al., 2023] 和 PickScore 进行评估。

评估格局。

表1中列出的生成器涵盖了当前的主流模型家族:潜在扩散Transformer [Peebles and Xie, 2023, Ma et al., 2024, Gao et al., 2023b, Wang et al., 2026, Yao et al., 2025]、在训练过程中注入外部编码器特征的表示对齐变体 [Yu et al., 2025, Wu et al., 2025, Zheng et al., 2025]、自回归和掩码token模型 [Tian et al., 2024, Li et al., 2024, Luo et al., 2024]、像素空间Transformer [Li and He, 2025],以及单步MeanFlow、drifting和FD-loss系列 [Lu et al., 2026, Geng et al., 2026, Deng et al., 2026, Yang et al., 2026]。在训练中使用外部表示编码器的模型(表中带星号的行)占据了最强性能的条目,这与“表示监督是起作用的要素”这一前提一致;RDM将这一要素显式化,并对其进行了隔离研究。

附录B 编码器面板

MMDr14对表5中编码器的算术平均值进行计算,每个编码器均冻结在其发布权重下,并以列出的输入分辨率提取为单个池化图像嵌入,不进行特征归一化。该面板有意涵盖了多种训练范式:监督分类、自监督蒸馏与掩码重建、语言监督、多教师聚合、多模态自回归、人类相似性调优以及生成式自编码器,因此这些表示会在不同方面失效。其中十个编码器用于监督训练;另外四个仅用于评估,分别是DINOv2、SigLIP (v1)、C-RADIOv3-L和FLUX VAE。

媒体内容 · 前往原文查看
表5:十四个编码器面板。每个骨干网络均冻结在其发布权重下,其池化图像嵌入以列出的输入分辨率提取。池化方式:cls表示类别token,avg表示对patch或空间token取均值,attn表示注意力池化头。十个编码器用于监督训练;四个仅用于评估。
编码器 检查点 架构 输入 池化方式
训练面板(10个)
Inception-v3 [Szegedy et al., 2016] FID Inception-v3 CNN avg
ConvNeXt V2-B [Liu et al., 2022] convnextv2_base.fcmae_ft_in22k_in1k CNN avg
MAE [He et al., 2022] vit_large_patch16_224.mae ViT-L/16 avg
CLIP [Radford et al., 2021] vit_large_patch14_clip_224.openai ViT-L/14 cls
DINOv3-L [Siméoni 等人,2026] vit_large_patch16_dinov3.lvd1689m ViT-L/16 cls
PE-Core-L [Bolya 等人,2025] vit_pe_core_large_patch14_336.fb ViT-L/14 attn
SigLIP2-So400m [Tschannen 等人,2025] vit_so400m_patch16_siglip_256.v2_webli ViT-So400m/16 attn
AIMv2-H [Fini 等人,2025] aimv2_huge_patch14_224.apple_pt ViT-H/14 avg
Web-SSL DINO 1B [Fan 等人,2025] webssl-dino1b-full2b-224 ViT-1B cls
DreamSim [Fu 等人,2023] DINO + CLIP + OpenCLIP 集成 ViT 集成 cls
保留集 (4)
DINOv2 [Oquab 等人,2024] vit_large_patch14_dinov2.lvd142m ViT-L/14 cls
SigLIP (v1) [Zhai 等人,2023] vit_so400m_patch14_siglip_384.webli ViT-So400m/14 attn
C-RADIOv3-L [Ranzinger 等人,2024,Heinrich 等人,2025] NVIDIA C-RADIOv3-L ViT-L,多教师 summary
FLUX VAE [Black Forest Labs,2024] FLUX.1 VAE,patch-mean VAE patch-mean

附录 C 批量大小扫描

表 6 列出了图 4 中绘制的扫描结果。

媒体内容 · 前往原文查看
表 6:在匹配的挂钟时间预算(各 秒)下,微调单编码器 DINOv2 Nyström-MMD 分支时的生成批量大小;条目为切片-瓦瑟斯坦比值(越低越接近真实数据)。最小批量尽管优化器步数最多,但其回归结果仍高于未训练基线;最优值范围较宽,仅比 略差。
批量 学习率 DINOv2
未训练基线 不适用

附录 D 核-MMD 评估

表 7 报告了 MMDr14,即我们主要指标的训练对齐核-MMD 交叉验证结果,覆盖 -编码器面板上的完整已发布字段。每个条目是单个编码器相对于真实训练数据的 RFF-MMD 比值,真实验证集按构造方式得分为 ,MMDr14 是这 14 个编码器的算术平均值。排序与(表 1)大致一致,中间场模型间存在一些重排;由于损失函数本身就是一个核 MMD,单个编码器可能被推至真实下限以下,例如 FD-SIM 模型中的 Inception 得分为 ,而最优传输和保留集分割对此具有抵抗性。

媒体内容 · 前往原文查看
表 7:已发布的 ImageNet-256 生成器与我们的 iRDM 在 14 个视觉编码器上的 MMD-RFF 距离比(mmdr;数值越低越接近真实数据)。 是 14 个编码器的算术平均值。验证基线按定义为 mmdr 1(真实保留数据);括号内给出原始归一化值。灰色行是单步(单 NFE)模型。⋆ 标记训练中使用外部表示编码器(REPA/RAE 风格对齐、FD 损失或编码器特征上的漂移损失)。底部为最强结果。
模型

Inception

ConvNeXt

DINOv2

MAE

SigLIP2

CLIP

DINOv3

SigLIP

PE-Core

RADIO

WebSSL

AIMv2

DreamSim

FLUX

验证基线 1.00 (0.321) 1.00 (0.535) 1.00 (0.0455) 1.00 (0.787) 1.00 (0.103) 1.00 (0.600) 1.00 (0.0805) 1.00 (0.420) 1.00 (0.565) 1.00 (0.156) 1.00 (0.0363) 1.00 (0.181) 1.00 (0.209) 1.00 (0.346) 1.00 (0.313)
\rowcolorgray!15Drifting-L⋆ [Deng 等人,2026] 0.80 3.61 136 21.1 157 53.0 845 64.2 92.0 52.5 133 128 11.8 3.98 122
\rowcolorgray!15iMF-XL [Geng 等人,2026] 0.87 2.08 91.0 17.7 98.1 40.2 594 46.4 79.0 35.0 92.9 93.1 10.8 3.20 86.1
SiT-XL/2 [Ma 等人,2024] 1.73 1.77 75.3 14.3 79.0 35.1 258 35.3 60.9 29.5 68.0 76.7 7.56 2.08 53.2
Open-MAGVIT2-L [Luo 等人,2024] 2.79 2.72 85.9 16.5 84.0 36.1 114 37.6 52.9 38.4 90.6 96.0 11.3 5.55 48.2
MDTv2-XL/2 [Gao 等人,2023b] 0.63 1.23 50.0 11.8 60.5 34.8 254 31.9 59.9 19.0 51.3 56.8 7.82 1.69 45.8
MAR-H [Li 等人,2024] 0.79 1.19 61.5 11.0 56.5 28.7 219 30.1 57.4 20.7 65.0 68.1 7.18 0.37 44.8
DiT-XL/2 [Peebles 和 Xie,2023] 2.11 1.35 59.9 12.7 62.2 34.5 204 31.9 53.4 24.1 57.4 67.9 8.00 1.96 44.4
\rowcolorgray!15pMF-H (base) [Lu 等人,2026] 1.78 0.91 54.6 17.8 87.5 22.4 115 30.5 65.7 31.5 70.6 94.4 10.9 8.91 43.7
DDT-XL/2⋆ [Wang 等人,2026] 0.46 1.20 49.6 11.1 57.1 33.0 213 28.5 57.2 18.3 48.8 55.2 6.61 1.55 41.5
VAR-d30 [Tian 等人,2024] 1.13 1.73 63.8 18.7 67.4 30.3 108 34.7 61.1 29.7 62.4 75.9 11.4 1.34 40.6
JiT-H [Li 和 He,2025] 1.26 3.06 48.1 14.2 66.0 51.1 74.4 31.6 64.1 30.4 60.7 73.3 12.3 2.56 38.1
SiT-XL/2+REPA⋆ [Yu 等人,2025] 0.56 1.37 47.2 11.1 55.4 29.3 171 27.7 54.1 18.4 45.3 52.5 6.40 1.37 37.3
REG-XL⋆ [Wu 等人,2025] 0.44 1.06 33.9 8.02 46.4 24.0 127 21.3 49.5 13.3 31.8 39.2 4.74 1.44 28.7
LightningDiT-XL⋆ [Yao 等人,2025] 0.67 0.92 36.8 8.12 41.5 21.3 61.7 19.9 39.9 14.1 41.6 50.3 5.93 1.63 24.6
REPA-E SiT-XL/1⋆ [Leng 等人,2025] 0.34 1.26 26.1 6.19 24.0 11.9 26.9 12.9 21.9 7.97 21.6 31.8 2.64 0.87 14.0
RAE-XL⋆ [Zheng 等人,2025] 0.36 2.34 19.0 7.36 14.9 16.6 18.4 10.4 28.8 11.1 18.5 26.7 3.32 4.12 13.0
\rowcolorgray!15pMF-H (FD-SIM)⋆ [Yang et al., 2026] 0.22 0.36 10.3 0.37 6.34 10.5 12.5 9.39 33.2 8.72 18.5 24.5 2.28 6.56 10.3
\rowcolorgray!15iRDM (ours)⋆ 1.54 0.98 3.52 0.69 4.76 1.17 1.39 2.69 1.62 3.16 5.31 3.12 1.80 5.83 2.69

附录E 文生图后训练细节

E.1 参考集整理

第4.2节的文生图目标是将单步模型与一个参考集进行匹配,该参考集是从四步FLUX.2 [klein]教师模型中一次性收集并随后冻结的,因此在后训练过程中不再查询教师模型。该参考集拼接了两个独立整理的教师生成块:一个感知块和一个组合块,总共约K个图像-文本对,每张图像都保留其生成时所使用的文本描述,用于联合核函数。

感知块。

对于COCO train2014数据集 [Lin et al., 2014] 中的每张图像,各配一条文本描述,四步教师模型生成候选图像,由PickScore [Kirstain et al., 2023] 进行排序;我们为每条描述保留得分最高的三张图像,从而在全覆盖范围内形成图像-文本对。从24次过采样生成中选取三张,将参考集锚定在自然描述的高质量渲染结果上,为匹配提供感知方面的支撑。

组合块。

为了使模型偏向于经验证正确的组合,而非教师模型在较难的组合提示词上大部分失败的平庸表现,我们只保留经检测器验证为正确的教师生成结果。对于GenEval [Ghosh et al., 2023] 的提示词,教师模型按每个提示词采样若干种子,若某个提示词的正确样本数少于要求则进行补充,每张生成图像均由标准的GenEval Mask2Former检测器评分:只有当提示词中所有物体均以要求的数量、颜色和空间关系出现时,该样本才算通过。将每个提示词的正确样本数上限设为K,从而得到覆盖了部分提示词的经验证图像;有两个位置提示词即使在大量种子下也无法获得任何正确的教师样本。在此池中按种子统计,教师模型的正确率从单物体提示词上的较高水平,下降到属性绑定和位置提示词上的较低水平,因此过滤操作最有效地重塑了那些单步模型后续得以改进的绑定和空间提示词。

联合参考集与提示词池。

这两个模块嵌入在附录 B 的十个训练编码器之下,每个图像特征与其对应标题的冻结 SigLIP2 文本嵌入 [Tschannen 等人,2025] 拼接,并在一个采用中位数启发式带宽的高斯核下与文本分量(权重为 )进行比较;该堆叠被压缩一次,为每个编码器生成一个包含 个地标的 Nyström 参考。生成器的条件池与参考池镜像对齐:COCO 标题与 GenEval 提示词复制后,使 GenEval 在池中的占比与参考池一致,约为 。对齐生成分布与参考提示分布可保持匹配的适定性,当两者重合时达到最优。

E.2 DMD2 基线

DMD2 [Yin 等人,2024a] 基线将相同的四步 FLUX.2 [klein] 教师模型蒸馏为一步学生模型。已发布的 DMD2 针对采用 预测的 SD-UNet;我们为 klein 的流匹配参数化重新实现了该方法,保持原样:三个网络,即训练中的一步生成器、一个用于估计学生分布分数的可训练判别器,以及冻结的四步教师模型,DMD 梯度为教师分数减去判别器分数之差,判别器每一步更新,生成器每五步更新。学生模型通过将教师模型沿其采样 ODE 回归到单步进行初始化,之后进行蒸馏。我们在四块 H200 GPU 上以全局批次大小 进行训练,使用 AdamW 优化器,不采用 EMA。

时间步调度。

klein 参数化强制要求的一个变化是蒸馏时间步分布。klein 经过引导蒸馏,其速度仅在噪声较高时可靠,即四个原生采样节点;均匀抽取时间步会进入低噪声区域,此时教师模型坍缩为模式平均后验均值,并将生成器驱动至其初始化水平以下。通过 klein 的信噪比偏移映射均匀抽取,并使用与原生节点间距匹配的经验值 ,学习率为 ,经过短时间预热,这种发散转化为一个在 GenEval 上超越教师模型的学生模型。

配置与结果。

蒸馏质量主要由提示词分布决定。在更广泛的 LAION 描述池上训练,而非仅使用 COCO 描述,能在每个检查点提升 GenEval 分数,并缓和分布匹配蒸馏的“先升后降”曲线,使原本的 -点骤降变为 -点平台期。所报告的基线是最佳配置,即使用 LAION 提示词并在其 -步峰值时的运行结果,GenEval 和 PickScore(表 8);一个在真实潜变量上添加 GAN 项的变体在指标上表现中性,其判别器区分真实与生成潜变量的速度过快,导致对抗梯度在分布匹配梯度面前消失,因此未予报告。学生模型约在 H200 GPU 小时达到峰值。

媒体内容 · 前往原文查看
表 8:DMD2 [Yin et al., 2024a] 单步学生模型在不同蒸馏步骤下的表现,最佳 LAION 提示词配置,与四步 FLUX.2 [klein] 教师模型对比。GenEval 采用标准协议,PickScore 基于 COCO 验证集提示词;-步峰值即为表 2 中报告的基线。
步骤 GenEval PickScore
教师模型(4 步) 0.794 22.58
0.778 22.17
(已报告) 0.804 22.36
0.792 22.36
0.793 22.27

附录 F 单步文生图样本

图 7 展示了来自后训练的四步 FLUX.2 [klein] 的额外单步 iRDM 生成结果,每张图像均通过一次网络评估生成。

Refer to caption

Refer to caption

Refer to caption

Refer to caption

Refer to caption

Refer to caption

Refer to caption

Refer to caption

Refer to caption

Refer to caption

Refer to caption

Refer to caption

图 7:iRDM 的单步文生图样本。来自后训练的单步 FLUX.2 [klein] 的单步生成结果,每次均为一次网络评估。

附录 G 定性比较

图 8 将未经筛选的 iRDM 样本与 pMF-H FD-SIM [Yang et al., 2026](目前最强的外部单步基线)进行对比,覆盖了 ImageNet-256 中的五个类别,包括一种鸟类、一种动物皮毛、一种可变形衣物、一种刚性人造物体和一种自然景观。在每个方法中,放大的图像为一个样本,相邻的网格中展示了同一类别标签下的另外十次生成结果,这些结果取自首次发布的生成样本,未经挑选。就每个样本而言,两种模型肉眼难以区分,都能生成清晰且符合类别的图像;这正是需要分布度量指标的原因,因为表 1 中 与 的差异在任何单一行中都不可见。

iRDM(我们的方法)pMF-H FD-SIM 河乌 斑马 学士服 交通灯 羊驼Refer to captionRefer to captionRefer to captionRefer to captionRefer to caption

图 8:iRDM 与 pMF-H FD-SIM [Yang 等人,2026] 在五个 ImageNet-256 类别上未经筛选的单步采样结果;列标题标注了对应方法。尽管表 1 中存在差距,但两者在肉眼观察下非常接近。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org