彩色噪声扩散采样
Colored Noise Diffusion Sampling
扩散模型的生成轨迹具有频谱偏差,早期处理低频全局结构,后期处理高频细节。传统随机微分方程求解器在整个过程中均匀注入白噪声,能量分配效率低。本研究提出彩色噪声采样(CNS),一种免训练的即插即用采样器。它通过动态、随时间和频率调整的噪声调度,更高效地将能量分配给尚未解析的频段。在SiT、JiT、FLUX等架构上的实验表明,CNS作为推理时的替换采样器显著提升了生成质量:在ImageNet-256上,无引导FID在SiT-XL/2上从8.26降至6.27,在JiT-B/16上从32.39降至26.69,在JiT-H/16上从11.88降至8.31,并且在使用无分类器引导时带来一致改进。
扩散模型采样时的白噪声注入一直很粗糙,这篇论文用动态调制的有色噪声把能量怼到未解析的频段,在多个模型上 FID 直接骨折,而且完全训练无关,拿来就能用。
摘要
扩散模型实现了最先进的图像合成效果,其生成轨迹从根本上表现出一种频谱偏好,即早期解析低频全局结构,后期填充高频精细细节。传统的随机微分方程求解器未能考虑这一动态特性,在整个过程中盲目注入均匀白噪声,从而浪费了有限的能量预算。在这项工作中,我们建立了一个数学框架,将随机微分方程推理重新理解为一种有针对性的、频率解耦的能量传递。利用这一框架,我们提出了有色噪声采样(CNS),一种新颖的、无需训练的随机求解器。CNS 并非注入均匀白噪声,而是采用一种动态的、依赖于时间步长和频率的调度策略,将注入能量更高效地分配给结构尚未解析的频段。通过主动利用模型固有的频谱偏好,CNS 系统性地将生成分布引导至真实数据流形。大量实验表明,作为一种严格的即插即用型推理时采样器替代方案,CNS 在多种架构(SiT、JiT、FLUX)上均显著优于标准的 ODE 和 SDE 基线。与 ImageNet-256 上的标准采样相比,CNS 实现了显著的无引导 FID 降低:SiT-XL/2 从 8.26 降至 6.27,JiT-B/16 从 32.39 降至 26.69,JiT-H/16 从 11.88 降至 8.31,同时在无分类器引导下也取得了一致的相对 FID 改进。项目页面请访问 https://hadardavidson.github.io/CNS/。
1 引言
扩散模型已在逼真图像合成领域树立了新标准,定义了高保真生成任务的最先进水平 [15, 57, 25]。关键在于,这些模型的采样轨迹表现出一种频谱偏好 [60, 19]。这一归纳特性决定了扩散模型在早期采样步骤中会固有地解析低频全局结构,而在后期步骤中填充高频精细细节。
当前的采样算法 [56, 57, 55] 未能解释这一现象。基于随机微分方程(SDE)的标准随机方法会朴素地注入均匀白噪声,完全忽略了生成图像的频谱随时间动态演化的特性。为了从根本上解决这一低效问题,我们引入了一类新型随机求解器,它能够主动利用这种频谱偏差。通过将注入的噪声与特定的去噪时间步相匹配,我们在无需任何额外训练的情况下提升了生成保真度。
认识到频谱偏差的重要性后,近期有几项工作尝试利用它。一条研究路线是改变训练框架,从频谱非均匀或随时间演化的噪声分布中进行插值 [8, 53, 17]。其他方法则在推理阶段运作,引入了诸如频率解耦操作 [43, 66]、内部激活重加权 [54] 或步长调度调整 [27] 等临时性修改。尽管这些方法带来了可衡量的改进,但它们仍然从根本上受限于其底层使用的频谱均匀求解器。这自然引出了我们的指导性问题:我们如何能够主动利用扩散模型的频谱偏差,来设计一种全新的、通用的采样器,从而提升生成保真度?
ODE SDE CNS(我们的方法)
为了回答这个问题,我们首先建立了一个数学框架,通过频率感知的噪声注入来控制生成分布。从几何角度看,采样轨迹类似于朝向数据流形的非正交旋转[60]。这意味着扩散模型并非随意丢弃初始噪声;相反,该信号中相当一部分结构成分被保留下来,并映射到最终图像特征中[63, 35]。
我们工作的一个关键发现是,这种信号保留的传递同样适用于SDE求解器在整个轨迹中注入的连续噪声。此外,这一过程是频率解耦的:特定频段注入的噪声直接映射到同一频段的空间特征。通过确保我们的频率感知调整严格保持方差不变(仅要求每一步注入的总能量保持归一化),我们证明了经典朗之万方程对均匀白噪声的要求[39]可以安全地放宽,而不会将中间状态推出分布范围。
基于这一框架,我们构建了一个与时间步和频率相关的噪声调度方案。通过分析生成过程中不同频段的演进速率,我们提出:网络将注入噪声转化为连贯图像特征的能力,在很大程度上取决于该特定频段在给定时间步的结构“解析”程度。这一洞见使我们能够将SDE采样重新理解为一种定向能量注入过程。我们的方法并非均匀分配有限的注入噪声预算,而是根据轨迹的预期演化采用动态调度,将能量分配到最需要的频段。这种原则性的分配方式引导输出朝向真实数据流形,从而产生严格更高保真度的生成结果。
为验证我们的方法,我们在多种架构和模态上进行了广泛实验,包括潜空间生成(SiT [34])、像素空间生成(JiT [28])以及最先进的文生图合成(FLUX [24, 25])。主要通过弗雷歇初始距离(FID)[14] 进行评估,实证结果表明,我们的方法显著优于标准 ODE 和 SDE 基线。在 ImageNet-256 [49] 上,我们在无引导和无分类器引导(CFG)[16] 两种设置下均实现了 FID 的大幅降低,同时在不同离散化步数下保持了稳健的稳定性。我们在图 1 中直观展示了我们的方法相较于标准基线的优越性。此外,我们的采样器在集成到 FLUX 等文生图流水线中时被证明是有效的,能够提升自动人类偏好评分。
综上所述,我们的主要贡献如下:
- •
我们建立了一个数学框架,将 SDE 噪声注入重新定义为一种定向能量转移,并证明了标准朗之万动力学对频谱均匀白噪声的要求可以安全地放宽,以解决频谱间隙问题。
- •
我们提出了有色噪声采样(CNS),这是一种新颖的、无需训练的随机求解器,通过动态地将注入的噪声能量分配到结构上未解析的频带,主动利用了频谱偏差。
- •
我们在多种架构(SiT、JiT、FLUX)上验证了 CNS 作为一种稳健的通用采样器的有效性。在 ImageNet-256 上,CNS 实现了显著的无引导 FID 降低(例如,SiT-XL/2 从 8.26 降至 6.27,JiT-B/16 从 32.39 降至 26.69),并且在 CFG 设置下,相较于标准 ODE 和 SDE 基线,相对改进幅度在 8% 到 50% 之间。
2 相关工作
扩散模型的采样器。扩散模型中的采样是一个研究深入的领域,主要侧重于从数值上减轻离散化误差。显著的进展包括高阶求解器[61, 64, 33](能在低步数下保持保真度)、动态求解器交替[31, 71],以及平滑积分路径的状态重参数化[69, 68, 5]。虽然这些方法成功减少了截断误差并加速了生成,但它们对状态不断变化的空间结构并不敏感。我们的方法在根本上是正交的:并非严格优化数值精度,而是通过显式利用模型的频谱偏差来优化随机能量的分配。
利用扩散模型中的频谱偏差。一条显著的研究路线通过在训练过程中改变噪声分布来利用扩散模型的频谱偏差。这些方法依赖于经验启发式方法来修改初始[53]或随时间演变的噪声分布[17],或引入像EqualSNR[8]这样有正式理论基础的频率相关过程。然而,从根本上改变学习目标需要代价高昂的模型重新训练。与此形成鲜明对比的是,我们的方法通过引入一个纯粹的即插即用采样器来克服这一障碍,该采样器仅在推理时利用频谱偏差。为了规避重新训练成本,另一条研究路线通过仅推理时的修改来利用频谱偏差。这些方法对生成流程引入了临时性调整,例如对预测状态应用频率解耦操作[43, 66]、动态重新加权内部网络激活[54]、调整步长调度[27],或将频谱偏差与位置编码耦合[19]。虽然有效,但这些技术将底层随机求解器视为一个静态黑盒。我们的工作针对这个未被探索的组件:我们并非事后修改网络或其输出,而是直接将频谱偏差嵌入到核心采样机制本身。
3 方法
现在我们介绍我们的方法。第3.1节概述了标准扩散模型的背景。第3.2节和第3.3节形式化描述了构建我们框架所利用的特定生成现象、推理时频谱偏差和噪声能量保持。基于这些原理,第3.4节分析了标准随机微分方程所引发的频谱间隙。最后,第3.5节详细说明了有色噪声调度(CNS)如何动态地为注入的噪声着色,以主动将生成的频谱引导至真实数据流形。
3.1 背景:扩散模型与采样动力学
扩散模型[15, 57]和流匹配[30, 32]可以在随机插值[3]的连续时间框架下统一起来。给定一个目标数据分布和一个易于处理的噪声先验,这些模型通过时间相关的状态构建一条概率路径:
| (1) |
边界条件的设定使得严格代表干净数据(),并近似于纯噪声先验()。无论是采用方差保持(VP)扩散这样的三角函数调度,还是采用流匹配()这样的线性路径,其目标仍然是学习逆转这一连续时间概率流。
为了学习这种逆向流,这些模型近似了条件插值速度:
| (2) |
由于中间状态是数据和噪声的简单仿射组合,预测速度在代数上等价于预测干净数据、噪声或边际分数。为简洁起见省略显式依赖关系,这些参数化方式通过以下关系确定性关联:
| (3) |
在推理过程中,通过将这些学习到的预测代入逆向时间微分方程,并使用确定性或随机求解器进行积分,即可从先验中生成新样本。
采样动力学。确定性采样将轨迹表述为概率流常微分方程(PF-ODE),直接对预测的速度进行积分:
| (4) |
尽管计算效率高且近似可逆,但这种严格的确定性缺乏内在的修正机制。因此,离散数值近似和网络误差不可避免地会累积,导致中间状态逐渐偏离真实数据流形,并降低最终图像的保真度[55]。
随机求解器通过将生成过程模拟为反向时间随机微分方程来解决这种漂移问题。引入一个与时间相关的扩散系数和一个反向时间维纳过程后,动力学方程扩展为:
| (5) |
这一过程从根本上改变了轨迹:它通过持续地用白高斯噪声注入与沿预测分数的恢复性梯度步长相平衡。注入的噪声探索了局部潜在邻域,而基于分数的去噪则主动将状态拉回高密度区域。通过在每一步原生地修正累积的离散化误差,随机微分方程求解器使轨迹牢固地锚定在真实数据分布上,从而产生更优的视觉质量[56, 57]。
功率谱密度与噪声颜色。注入噪声的频率成分由其功率谱密度表征。设其傅里叶变换为,则功率谱密度评估了频率处的期望能量:
| (6) |
的形状定义了噪声的“颜色”[40],如图2所示。标准高斯噪声具有恒定的,在所有频率上注入相等的能量(白噪声)。相反,非均匀频谱会产生有色噪声,例如高频主导的蓝噪声。由于傅里叶正交性,帕塞瓦尔定理确保对功率谱密度进行积分可得到总空间能量:。因此,标准随机微分方程从根本上是在每个生成步骤盲目地注入一个固定的、与频率无关的白噪声能量预算。
3.2 扩散模型的频谱偏差
频谱偏差是一种有充分文献记载的归纳属性,它不仅影响训练优化,更从根本上主导了扩散模型的推理动态[44, 45, 60]。生成过程并非均匀地解析图像,而是遵循一种错开的频率演化规律。
为了形式化这种分频带推进过程,我们评估了模型在每个中间时间步对干净数据的预测。在线性调度下,该预测由下式给出:
| (7) |
设 和 分别表示最终生成的潜变量和中间预测结果在频带 上的频谱分量。参照[19],我们通过衡量该中间预测相对于最终结果的解析能量,为每个频带 定义有界进度指标:
| (8) |
该指标精确地分离出网络在任意给定时间步已解析的特定频带最终结构的比例(详见算法2和附录C.1)。将此 -矩阵可视化(图3)可直接揭示这些生成动态:低频结构在生成过程早期就已解析完成。相比之下,高频细节则以渐进速率演化,直到采样轨迹的末尾才完全成形。最终,这提供了一张精确的时间图谱,指明了网络在何时主动“构建”特定的频带。
3.3 扩散模型中的结构保持与能量传递
从先验分布到数据分布的映射并非两个空间之间的任意耦合。经验证据表明,推理过程保留了初始噪声实现中的大量信息[65, 63, 58],自然地沿着最小距离轨迹进行[18]。
为了从几何角度解释这一点,Wang 和 Vastola [60] 证明,采样轨迹的维度低得惊人。这些轨迹并非在潜空间中无约束地游走,而是实际上类似于从初始噪声状态向目标数据流形进行的弧度二维旋转。在高维空间中,独立随机向量近乎正交,因此该旋转角度产生了极高的预期余弦相似度。这在数学上证实,扩散模型并非从零开始生成全新结构,而是保留了初始结构信号的很大一部分——我们在图5中通过空间频率对此现象进行了经验性可视化。
这种旋转视角对采样动态具有深远影响。由于旋转保持范数(即向量的能量)不变,推理过程充当了一种信号传递机制,保留了初始噪声能量的很大一部分。模型将这种被保留的噪声确定性地映射到最终图像的结构化空间特征上,近期一些优化初始噪声选择的研究工作[70, 2, 35]已隐式利用了该特性。这种非破坏性特性构成了我们方法的基本前提:它意味着,通过策略性地控制经由噪声注入到过程中的能量,我们就能直接控制最终图像的结构特征。
3.4 生成图像分布谱
正如近期研究[8, 1, 67]所确立的,生成图像的功率谱密度与真实数据流形之间存在显著差异——即所谓的谱间隙。令 和 分别表示真实分布和生成分布的功率谱密度。如图4所示,无论是确定性采样还是随机性采样,都无法完美恢复真实分布。关键在于,解决这一间隙需要的不仅仅是简单的后处理谱匹配;要实现真正的分布匹配,恢复的能量必须与目标流形的连贯空间结构对齐。
幸运的是,正如第 3.3 节所确立的,扩散推理从根本上来说是一种部分能量守恒的信号传递过程。除了保留初始噪声实现之外,我们发现扩散过程还将 SDE 求解器注入的随机增量直接映射到最终生成结构的相应空间频率上。我们通过傅里叶空间带通投影算子隔离空间频带,从而形式化了这种非破坏性的、频率耦合的映射关系。这使得我们能够量化累积注入噪声与最终生成图像之间的结构对齐程度。通过在图 5 中计算它们的期望余弦相似度,我们观察到了一个显著的正相关关系:
| (9) |
这种强对齐揭示了一条强大的理论路径:策略性地塑造注入噪声的频谱轮廓,为将生成分布的 PSD 引导至目标数据流形提供了一种直接机制。
随机性的影响。为了重构这些动态过程,我们使用符号对数误差来量化谱偏差:。如图4所示,比较确定性与随机性求解器可以发现,连续噪声注入从根本上改变了最终的能量分布。我们认为,这种谱发散源于学习到的评分函数中固有的不完美性。在标准朗之万动力学过程中,注入的噪声无法被去噪漂移完美抵消。因此,评分近似误差会在轨迹上导致非预期的能量累积或亏损(附录B.1)。
关键在于,生成轨迹上注入的总随机能量是严格有界的,并且在数学上与时间离散化无关(附录A.1)。由于我们无法简单地通过放大全局噪声注入来弥补亏损而不违反底层随机微分方程(附录A.2),因此随机噪声充当了一个严格固定的注入能量预算:
| (10) |
标准随机微分方程会以朴素的方式分配这一预算:均匀白噪声将能量均等地分配到整个频谱上()。通过转向目标性的有色噪声,我们将其视为一个零和博弈:我们动态减少结构已解析频段的能量分配,从而释放预算,将能量注入到滞后的频段。这种有原则的重新分配将生成输出引导向真实数据流形,同时不会将中间潜变量推离分布范围(附录A.3)。
\phantomcaption
\phantomcaption
3.5 有色噪声采样(CNS)
CNS 通过重新利用 SDE 的随机能量泄漏来引导生成轮廓,从而主动缓解频谱间隙。如附录 B.1 所推导,生成样本从噪声注入中吸收的有效能量高度依赖于状态。具体而言,频带能量吸收率严格取决于当前频谱状态与局部分数误差之间的相关性。由于这种吸收效率存在差异,均匀的白噪声注入是高度次优的——它把有限的能量预算分配给了已经充分解析的频率模式。因此,最优策略必须根据时间步和频带动态调整噪声频谱。
为了形式化这种主动重分配,我们在标准 SDE 噪声增量中引入了一个频率相关的缩放权重。这种有色噪声修改将给定频率的随机伊藤能量项从 调整为 (附录 B.2)。为了保持生成过程的整体稳定性,我们施加了严格的全局方差守恒约束,确保所有维度上注入的平均能量保持恒定:。在附录 B.2 中,我们证明了一个频带将注入的随机噪声吸收为永久结构的能力严格受其进展比率的控制,该比率由 -矩阵(第 3.2 节)跟踪。当一个频带接近完全解析状态()时,分数误差相关性会衰减。网络会将多余的注入方差主要视为需要耗散的瞬态能量,从而严重降低永久能量转换的速率。
⬇
x=torch.randn(x_shape)
fori,tinenumerate(torch.linspace(0,1,T)):
w=torch.randn_like(x)
scale=torch.sqrt(1-gamma[i])
W=torch.fft2(w)*scale[freq_bins]
w_c=torch.real(ifft2(W))
w_c=w_c/torch.std(w_c)
v=model(x,t)
s=(t*v-x)/(1-t)
D=diffusion(x,t)
x+=(v+D*s)*dt+torch.sqrt(2*D)*w_c*torch.sqrt(dt)
为了最大化有限能量预算的效用,CNS 会动态地将能量从这些已解决的频带中转移出去,并主动将其引导至结构赤字较高的滞后频率。我们制定的 CNS 分配方案使得方差乘数严格与该结构赤字成正比(更多细节见附录 B.2.3)。为了满足全局能量约束,我们通过各频率上的均方根(RMS)对该分布进行归一化:
| (11) |
这种动态着色系统地提高了注入能量的效率,使得生成分布的光谱更接近真实数据流形(图 4)。该方案在标准 SDE 求解器中的精确集成方法详见算法 1。
| 模型 | 采样器 | FID | sFID | IS | 精确率 | 召回率 |
|---|---|---|---|---|---|---|
| SiT-XL/2 | ODE | 14.39 | 10.54 | 99.32 | 0.59 | 0.67 |
| SDE | 8.26 | 6.32 | 131.65 | 0.68 | 0.67 | |
| CNS(我们的方法) | 6.27 | 4.73 | 147.33 | 0.71 | 0.65 | |
| JiT-H/16 | ODE | 12.41 | 9.35 | 43.61 | 0.63 | 0.62 |
| SDE | 11.88 | 8.64 | 44.30 | 0.64 | 0.63 | |
| CNS(我们的方法) | 8.31 | 7.48 | 45.97 | 0.66 | 0.65 | |
| JiT-B/16 | ODE | 32.39 | 11.81 | 26.60 | 0.47 | 0.61 |
| SDE | 36.24 | 14.32 | 25.86 | 0.46 | 0.63 | |
| CNS(我们的方法) | 26.69 | 9.67 | 27.95 | 0.51 | 0.63 |
4 实验
我们在三个关键领域评估了 CNS 的性能和鲁棒性:(1)类别条件生成(第 4.1 节),展示了在像素空间和潜空间、不同求解器阶数以及 CFG 设置下,相对于 ODE/SDE 基线的优越性;(2)文生图(第 4.2 节),将 CNS 集成到最先进的流匹配架构中,在保持严格语义对齐的同时提升视觉保真度;(3)消融实验与正交性分析,验证了我们的方案设计选择,并证明 CNS 为使用替代噪声分布训练的模型提供了正交增益。
| 求解器 | 方法 | FID | sFID | IS | 精确率 | 召回率 |
| Euler-Maruyama [36](一阶弱收敛) | ODE | 14.39 | 10.54 | 99.32 | 0.59 | 0.67 |
| SDE | 8.26 | 6.32 | 131.65 | 0.68 | 0.67 | |
| CNS(我们的方法) | 6.27 | 4.73 | 147.33 | 0.71 | 0.65 | |
| Heun [13, 21](二阶弱格式) | 常微分方程 | 9.35 | 6.38 | 126.06 | 0.67 | 0.68 |
| 随机微分方程 | 8.00 | 5.49 | 132.72 | 0.69 | 0.67 | |
| CNS(我们的方法) | 5.99 | 4.78 | 149.78 | 0.71 | 0.65 | |
| 随机龙格-库塔 [47, 48](二阶弱格式) | 随机微分方程(SRK2) | 8.14 | 5.69 | 132.53 | 0.69 | 0.67 |
| 随机微分方程(SRK2S) | 8.77 | 6.36 | 129.68 | 0.68 | 0.67 | |
| CNS(我们的方法,SRK2) | 5.91 | 4.77 | 149.41 | 0.71 | 0.65 | |
| CNS(我们的方法,SRK2S) | 5.97 | 4.73 | 148.55 | 0.70 | 0.66 | |
| 确定性龙格-库塔 [10](五阶) | 常微分方程(dopri5) | 9.04 | 6.04 | 126.49 | 0.67 | 0.67 |
| 模型 | 采样器 | CFG 尺度 | FID | sFID | IS | 精确率 | 召回率 |
|---|---|---|---|---|---|---|---|
| SiT-XL/2 | 常微分方程 | 1.5 | 2.15 | 4.60 | 258.09 | 0.81 | 0.60 |
| 随机微分方程 | 1.5 | 2.06 | 4.49 | 277.50 | 0.83 | 0.59 | |
| CNS(我们的方法) | 1.5 | 1.98 | 4.46 | 257.68 | 0.81 | 0.60 | |
| JiT-H/16 | 常微分方程 | 2.2 | 3.92 | 7.72 | 62.86 | 0.76 | 0.59 |
| 随机微分方程 | 2.2 | 2.08 | 7.59 | 65.88 | 0.79 | 0.61 | |
| CNS(我们的方法) | 2.2 | 2.03 | 6.98 | 65.89 | 0.79 | 0.62 | |
| JiT-B/16 | 常微分方程 | 3.0 | 5.83 | 8.71 | 61.47 | 0.81 | 0.43 |
| 随机微分方程 | 3.0 | 4.54 | 11.30 | 63.02 | 0.82 | 0.45 | |
| CNS(我们的方法) | 3.0 | 4.39 | 9.48 | 63.22 | 0.83 | 0.45 | |
| CNS(我们的方法) | 2.6 | 4.19 | 9.01 | 60.27 | 0.81 | 0.47 |
4.1 类别到图像生成
我们在类别条件图像生成任务(ImageNet-256 [49])上评估了 CNS,并将其与标准 ODE 和 SDE 基线 [57, 55] 进行了比较。我们使用官方预训练权重(表 1),评估了像素空间预测模型(JiT-H/16, JiT-B/16 [28])和潜在空间预测模型(SiT-XL/2 [34])。我们使用成熟的指标来衡量生成质量、多样性和流形覆盖度:Fréchet Inception Distance(FID)[14]、用于高频结构评估的空间 FID(sFID)[37]、Inception Score(IS)[51] 以及精确率和召回率 [23]。为了与已报告的基线进行公平比较,我们尽可能使用原始发表的指标值。为了在复现的方法之间保持相同的评估条件,我们固定了所有方法的初始随机种子。我们匹配了原始研究中的采样步数:SiT-XL/2 为 250 步,JiT 模型为 50 步。所有定量指标均使用 50,000 个生成样本与标准 10,000 张参考图像计算得出。CNS 与 SDE 和 ODE 基线的定性视觉比较见附录 D.6。
此外,图 6 评估了我们的采样器在不同时间离散化下的表现。一旦达到足够步数以实现恰当的随机模拟,CNS 始终优于标准采样方法。更多细节见附录 D.3。
求解器阶数。确定性常微分方程依赖标准泰勒展开,而随机微分方程求解器需要伊藤-泰勒展开,并按强收敛(路径收敛)和弱收敛(分布收敛)阶数进行分类。由于生成式评估指标衡量的是分布对齐程度,弱收敛是我们的主要关注点。如表2所示,我们在不同弱收敛阶数的求解器(一阶欧拉-丸山法;二阶休恩法、SRK2、SRK2S)上评估了CNS。在SiT-XL/2上,CNS优于所有测试的求解器。这些求解器的数学概述见附录D.2。
无分类器引导(CFG)。CFG [16] 通过将条件预测外推至远离无条件基线的位置,显著提升了样本保真度。在表3中,我们证明,在SiT-XL/2、JiT-H/16和JiT-B/16上(使用欧拉法,SiT为250步,JiT为50步),CNS在CFG条件下始终优于标准ODE和SDE采样器。当不同方法之间的最优CFG缩放比例存在差异时,我们报告基线方法和CNS各自的最佳表现缩放比例。CFG增强生成的定性比较见图1。
与替代噪声训练方法的正交性。近期方法 [53, 8, 17] 改变了训练框架以显式利用频谱偏差。为确认CNS不会因这类修改而变得多余,我们将我们的采样器集成到扩散模型蓝噪声(BNDM)[17] 中,该方法使用随时间演变的从白噪声到蓝噪声的分布来训练U-Net [46]。如表4所示,将CNS应用于BNDM预训练的迭代(去)混合(IADB)[11] 模型,仍然显著提升了生成质量。在两个数据集上进行的评估证实,即使对于天生设计为利用频谱偏差的模型,CNS也能提供正交的推理时收益。更多细节见附录D.5。
| 先前方法 | BNDM框架 | ||||||
|---|---|---|---|---|---|---|---|
| 数据集 | IHDM | DDPM | DDIM | IADB | ODE | SDE | CNS(我们的方法) |
| AFHQ Cat | 11.02 | 9.75 | 9.82 | 9.19 | 7.95 | 18.80 | 7.49 |
| LSUN Church | 17.76 | 13.07 | 16.46 | 13.12 | 10.16 | 66.71 | 8.70 |
4.2 文本到图像生成
超越类别条件合成,我们展示了该方法通过无缝集成到复杂的下游生成任务中的广泛适用性。具体而言,我们将 CNS 作为即插即用的采样器替代方案,应用于最先进的文本到图像(T2I)流匹配架构:FLUX.1-dev [24] 和 FLUX.2-klein [25]。
| 采样器 | ImageReward | CLIPScore | 美学评分 |
|---|---|---|---|
| FLUX.1-dev | |||
| ODE | 0.965 | 0.681 | 5.787 |
| SDE | 0.990 | 0.689 | 5.804 |
| CNS(我们的方法) | 1.012 | 0.693 | 5.812 |
| FLUX2.klein | |||
| ODE | 0.984 | 0.735 | 5.233 |
| SDE | 0.924 | 0.733 | 5.291 |
| CNS(我们的方法) | 1.005 | 0.735 | 5.295 |
我们通过将 CNS 与标准的白噪声 SDE 以及作为这些模型默认求解器的确定性 ODE 进行比较来评估这种集成。我们在两个全面的提示词基准上评估生成质量和文本对齐程度。DrawBench [50] 探测特定的 T2I 失败模式,例如复杂的文本渲染(表 5),而 GenEval [9] 测试精确的组合属性,例如物体计数和空间定位(表 9)。性能使用 ImageReward [62] 衡量人类偏好,CLIPScore [12] 衡量语义一致性,以及美学评分 [52] 衡量视觉吸引力。至关重要的是,这些评估证实了 CNS 引入的动态随机修改增强了整体视觉保真度,而不会降低底层模型的文本理解能力或破坏复杂的组合指令。
4.3 消融研究
| 场景 | FID | sFID | IS |
|---|---|---|---|
| CNS(我们的方法) | 9.61 | 18.17 | 143.20 |
| 白噪声 SDE | 11.82 | 19.15 | 107.75 |
| 确定性 ODE | 17.05 | 23.57 | 98.43 |
| 50% 白噪声 | 10.64 | 19.08 | 136.36 |
| 打乱调度 | 10.46 | 19.03 | 138.02 |
| 恒定频谱 | 10.53 | 19.14 | 137.63 |
| 缩放 0.90 能量 | 16.17 | 42.03 | 111.29 |
| 缩放 1.05 能量 | 20.46 | 29.73 | 96.17 |
| mBm | 11.88 | 19.62 | 130.22 |
我们对 SiT-XL/2(Euler,250 步)进行了消融研究,结果总结于表 6。尽管有几种替代配置优于标准白噪声 SDE,但我们推导出的 CNS 公式在整体保真度上始终表现最佳。具体而言,我们证明,若不遵循归一化约束而缩放注入方差,会显著降低质量,这从实证角度验证了严格有限能量预算的必要性。此外,通过部分白噪声破坏、静态有色频谱或时间混洗来扰动 CNS 调度,结果始终较差,这证实了我们动态、状态相关分配方案的最优性。最后,我们确定,用多分形布朗运动(mBm)[41](一种通过变化 Hurst 参数生成时变有色噪声的过程)替代我们的调度,其性能也不及 CNS。所有消融实验的进一步数学细节见附录 D.4。
5 结论
在这项工作中,我们解决了标准扩散 SDE 求解器中的一个根本性低效问题:均匀注入白噪声,这忽略了模型固有的频谱偏差,并浪费了有限的生成能量预算。通过将 SDE 推理重新概念化为一种定向能量转移,我们引入了有色噪声采样(CNS),这是一种新颖的随机采样器。CNS 通过将注入噪声动态重新分配到结构上未解析的频段,主动利用了频谱偏差。作为一种在推理时严格即插即用的采样器替代方案,CNS 系统性地将生成分布引导至真实数据流形。大量实验验证,CNS 在多种架构上显著优于标准基线,在不需任何模型重新训练的情况下,实现了大幅 FID 降低和视觉保真度提升。
局限性与未来工作
CNS 的主要局限性在于其依赖 SDE 框架,因此无法与确定性 ODE 求解器兼容。由于随机采样本质上需要较高的步数预算以防止离散化误差累积,标准 ODE 在超快速推理场景中仍然更受青睐。未来工作将探索将频率依赖能量路由扩展到确定性范式以实现低步数采样,并将 CNS 应用于视频生成以利用时间频率维度。
参考文献
- [1] K. Adamkiewicz, B. Moser, S. Frolov, T. C. Nauen, F. Raue, and A. Dengel (2026) 当美观不再实用:探究现代文生图模型为何无法成为可靠的训练数据生成器。arXiv 预印本 arXiv:2602.19946。引用位置:§3.4。
- [2] D. Ahn, J. Kang, S. Lee, J. Min, M. Kim, W. Jang, H. Cho, S. Paul, S. Kim, E. Cha, 等 (2024) 噪声即扩散引导。arXiv 预印本 arXiv:2412.03895。引用位置:§3.3。
- [3] M. S. Albergo 和 E. Vanden-Eijnden (2022) 利用随机插值构建归一化流。arXiv 预印本 arXiv:2209.15571。引用位置:§3.1。
- [4] B. D. Anderson (1982) 逆向时间扩散方程模型。随机过程及其应用 12 (3), 第 313–326 页。引用位置:§A.1, §A.2。
- [5] T. Chen, H. Zheng, D. Berthelot, J. Gu, J. Susskind, 和 S. Zhai (2025) TADA:基于免训练增强动力学的改进扩散采样。arXiv 预印本 arXiv:2506.21757。引用位置:§2。
- [6] H. Chung, J. Kim, M. T. Mccann, M. L. Klasky, 和 J. C. Ye (2022) 面向一般含噪逆问题的扩散后验采样。arXiv 预印本 arXiv:2209.14687。引用位置:§B.1.2。
- [7] B. Efron (2011) Tweedie 公式与选择偏差。美国统计协会杂志 106 (496), 第 1602–1614 页。引用位置:§B.1.2, §B.2.3。
- [8] F. Falck, T. Pandeva, K. Zahirnia, R. Lawrence, R. Turner, E. Meeds, J. Zazo, 和 S. Karmalkar (2025) 扩散模型的傅里叶空间视角。arXiv 预印本 arXiv:2505.11278。引用位置:§A.3, §1, §2, §3.4, §4.1。
- [9] D. Ghosh、H. Hajishirzi 和 L. Schmidt (2023) Geneval:一个面向对象的文本到图像对齐评估框架。《神经信息处理系统进展》第36卷,第52132–52152页。引用于:§D.1、§4.2。
- [10] E. Hairer、S.P. Nørsett 和 G. Wanner (2008)《求解常微分方程 I:非刚性问题》。Springer 计算数学丛书,Springer Berlin Heidelberg。外部链接:ISBN 9783540566700,LCCN 86031456,链接。引用于:表 2。
- [11] E. Heitz、L. Belcour 和 T. Chambon (2023) 迭代 -(去)混合:一种极简确定性扩散模型。收录于《ACM SIGGRAPH 2023 会议论文集》,第1–8页。引用于:§4.1。
- [12] J. Hessel、A. Holtzman、M. Forbes、R. Le Bras 和 Y. Choi (2021) CLIPScore:一种用于图像描述的无参考评估指标。收录于《2021年自然语言处理经验方法会议论文集》,第7514–7528页。引用于:§4.2。
- [13] K. Heun 等人 (1900) 独立变量微分方程近似积分的新方法。《Z. Math. Phys》第45卷(23-38),第7页。引用于:第2项、表 2。
- [14] M. Heusel、H. Ramsauer、T. Unterthiner、B. Nessler 和 S. Hochreiter (2017) 采用双时间尺度更新规则训练的生成对抗网络收敛于局部纳什均衡。《神经信息处理系统进展》第30卷。引用于:§D.2、§1、§4.1。
- [15] J. Ho、A. Jain 和 P. Abbeel (2020) 去噪扩散概率模型。《神经信息处理系统进展》第33卷,第6840–6851页。引用于:§1、§3.1。
- [16] J. Ho 和 T. Salimans (2022) 无分类器扩散引导。arXiv 预印本 arXiv:2207.12598。引用于:§1、§4.1。
- [17] X. Huang、C. Salaun、C. Vasconcelos、C. Theobalt、C. Oztireli 和 G. Singh (2024) 扩散模型的蓝噪声。收录于《ACM SIGGRAPH 2024 会议论文集》,第1–11页。引用于:§D.5、§1、§2、§4.1。
- [18] N. Issachar、M. Salama、R. Fattal 和 S. Benaim (2025) 为基于流的生成模型设计条件先验分布。arXiv 预印本 arXiv:2502.09611。引用于:§3.3。
- [19] N. Issachar、G. Yariv、S. Benaim、Y. Adi、D. Lischinski 和 R. Fattal(2025)《DyPE:面向超高分辨率扩散模型的动态位置外推》。arXiv 预印本 arXiv:2510.20766。引用于:§1、§2、§3.2。
- [20] M.I. Kamien 和 N.L. Schwartz(2013)《动态优化,第二版:经济学与管理学中的变分法与最优控制》。Dover 数学丛书,Dover 出版社。外部链接:ISBN 9780486310282,链接。引用于:§B.2.3。
- [21] T. Karras、M. Aittala、T. Aila 和 S. Laine(2022)《阐明基于扩散的生成模型的设计空间》。Advances in Neural Information Processing Systems 35,第 26565–26577 页。引用于:第 2 项、表 2。
- [22] P.E. Kloeden 和 E. Platen(2011)《随机微分方程的数值解法》。随机建模与应用概率,Springer Berlin Heidelberg。外部链接:ISBN 9783540540625,LCCN 92015916,链接。引用于:§A.1、§D.2。
- [23] T. Kynkäänniemi、T. Karras、S. Laine、J. Lehtinen 和 T. Aila(2019)《用于评估生成模型的改进精确率与召回率指标》。Advances in Neural Information Processing Systems 32。引用于:§4.1。
- [24] B. F. Labs(2024)《FLUX》。注释:https://github.com/black-forest-labs/flux。引用于:§1、§4.2。
- [25] B. F. Labs(2025)《FLUX.2:前沿视觉智能》。注释:https://bfl.ai/blog/flux-2。引用于:§1、§1、§4.2。
- [26] A. B. L. Larsen、S. K. Sønderby、H. Larochelle 和 O. Winther(2016 年 6 月 20–22 日)《利用学习到的相似度度量实现超越像素的自编码》。载于《第 33 届国际机器学习大会论文集》,M. F. Balcan 和 K. Q. Weinberger 编,机器学习研究论文集,第 48 卷,美国纽约州纽约市,第 1558–1566 页。外部链接:链接。引用于:§B.1.2。
- [27] H. Lee、H. Lee、S. Gye 和 J. Kim(2025)《Beta 采样即一切:利用逐步频谱分析实现扩散模型的高效图像生成策略》。载于《2025 年 IEEE/CVF 计算机视觉应用冬季会议(WACV)》,第 4215–4224 页。引用于:§1、§2。
- [28] T. Li 和 K. He(2025)《回归本源:让去噪生成模型去噪》。arXiv 预印本 arXiv:2511.13720。引用于:§1、§4.1。
- [29] D. Liberzon (2011) 变分法与最优控制理论:简明导论. 普林斯顿大学出版社. 外部链接:ISBN 9781400842643, 链接 引用自:§B.2.3.
- [30] Y. Lipman, R. T. Chen, H. Ben-Hamu, M. Nickel, 和 M. Le (2022) 生成式建模的流匹配. arXiv 预印本 arXiv:2210.02747. 引用自:§3.1.
- [31] E. Liu, X. Ning, H. Yang, 和 Y. Wang (2024) 扩散概率模型求解器搜索的统一采样框架. 载于第十二届国际学习表征会议. 引用自:§2.
- [32] X. Liu, C. Gong, 和 Q. Liu (2022) 流直且快:学习使用整流流生成和传输数据. arXiv 预印本 arXiv:2209.03003. 引用自:§3.1.
- [33] C. Lu, Y. Zhou, F. Bao, J. Chen, C. Li, 和 J. Zhu (2022) Dpm-solver:一种用于扩散概率模型在大约10步内采样的快速ODE求解器. 神经信息处理系统进展 35, 页码 5775–5787. 引用自:§2.
- [34] N. Ma, M. Goldstein, M. S. Albergo, N. M. Boffi, E. Vanden-Eijnden, 和 S. Xie (2024) Sit:使用可扩展插值Transformer探索基于流和扩散的生成式模型. 载于欧洲计算机视觉会议, 页码 23–40. 引用自:§1, §4.1.
- [35] J. Mao, X. Wang, 和 K. Aizawa (2023) 通过扩散模型中的初始图像编辑实现引导图像合成. 载于第31届ACM国际多媒体会议论文集, 页码 5321–5329. 引用自:§1, §3.3.
- [36] G. Maruyama (1955) 连续马尔可夫过程与随机方程. 巴勒莫数学界报告 4 (1), 页码 48–90. 引用自:项目1, 表2.
- [37] C. Nash, J. Menick, S. Dieleman, 和 P. W. Battaglia (2021) 使用稀疏表示生成图像. arXiv 预印本 arXiv:2103.03841. 引用自:§4.1.
- [38] M. Ning, M. Li, L. Zhang, L. Liu, M. B. Blaschko, A. A. Salah, 和 I. O. Ertugrul (2026) 频谱匹配:潜扩散中卓越扩散性的统一视角. arXiv 预印本 arXiv:2603.14645. 引用自:§B.1.2.
- [39] B. Øksendal (2003) 随机微分方程. 载于《随机微分方程:导论与应用》, 页码 38–50. 引用自:§1.
- [40] A.V. Oppenheim、R.W. Schafer 和 J.R. Buck (1999) 《离散时间信号处理》。Prentice Hall 国际版系列,Prentice Hall。外部链接:ISBN 9780130834430,LCCN 98050398,链接。引用自:§3.1。
- [41] R. Peltier 和 J. L. Véhel (1995) 《多重分形布朗运动:定义与初步结果》。博士论文,INRIA。引用自:§D.4.4,§4.3。
- [42] M. Plancherel 和 M. Leffler (1910) 《关于任意函数通过定积分表示的研究贡献》。巴勒莫数学界报告 (1884-1940) 第 30 卷 (1),第 289–335 页。引用自:§B.1.2。
- [43] Y. Qian、Q. Cai、Y. Pan、Y. Li、T. Yao、Q. Sun 和 T. Mei (2024) 《在频域中利用移动平均采样提升扩散模型》。收录于:IEEE/CVF 计算机视觉与模式识别会议论文集,第 8911–8920 页。引用自:§1,§2。
- [44] N. Rahaman、A. Baratin、D. Arpit、F. Draxler、M. Lin、F. Hamprecht、Y. Bengio 和 A. Courville (2019) 《论神经网络的谱偏差》。收录于:国际机器学习大会,第 5301–5310 页。引用自:§3.2。
- [45] B. Ronen、D. Jacobs、Y. Kasten 和 S. Kritchman (2019) 《神经网络对不同频率学习函数的收敛速度》。神经信息处理系统进展 第 32 卷。引用自:§3.2。
- [46] O. Ronneberger、P. Fischer 和 T. Brox (2015) 《U-net:用于生物医学图像分割的卷积网络》。收录于:国际医学图像计算与计算机辅助介入会议,第 234–241 页。引用自:§4.1。
- [47] A. Rößler (2009) 《伊藤随机微分方程的二阶龙格-库塔方法》。SIAM 数值分析杂志 第 47 卷 (3),第 1713–1738 页。引用自:第 3 项,表 2。
- [48] A. Rößler (2010) 《随机微分方程解的强逼近龙格-库塔方法》。SIAM 数值分析杂志 第 48 卷 (3),第 922–952 页。引用自:第 3 项,表 2。
- [49] O. Russakovsky, J. Deng, H. Su, J. Krause, S. Satheesh, S. Ma, Z. Huang, A. Karpathy, A. Khosla, M. Bernstein 等 (2015) ImageNet 大规模视觉识别挑战赛。《国际计算机视觉杂志》115 (3), 第 211–252 页。引用章节:§1, §4.1。
- [50] C. Saharia, W. Chan, S. Saxena, L. Li, J. Whang, E. L. Denton, K. Ghasemipour, R. Gontijo Lopes, B. Karagol Ayan, T. Salimans 等 (2022) 基于深度语言理解的逼真文本到图像扩散模型。《神经信息处理系统进展》35, 第 36479–36494 页。引用章节:§4.2。
- [51] T. Salimans, I. Goodfellow, W. Zaremba, V. Cheung, A. Radford 和 X. Chen (2016) 训练生成对抗网络的改进技术。《神经信息处理系统进展》29。引用章节:§4.1。
- [52] C. Schuhmann (2022) 改进的美学预测器。URL https://github.com/christophschuhmann/improved-aesthetic-predictor。引用章节:§4.2。
- [53] L. Scimeca, T. Jiralerspong, B. Earnshaw, J. Hartford 和 Y. Bengio (2025) 学习重要之事:通过谱各向异性前向噪声引导扩散。arXiv 预印本 arXiv:2510.09660。引用章节:§1, §2, §4.1。
- [54] C. Si, Z. Huang, Y. Jiang 和 Z. Liu (2024) FreeU:扩散 U-Net 中的免费午餐。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》,第 4733–4743 页。引用章节:§1, §2。
- [55] J. Song, C. Meng 和 S. Ermon (2020) 去噪扩散隐式模型。arXiv 预印本 arXiv:2010.02502。引用章节:§1, §3.1, §4.1。
- [56] Y. Song 和 S. Ermon (2019) 通过估计数据分布梯度进行生成式建模。《神经信息处理系统进展》32。引用章节:§1, §3.1。
- [57] Y. Song, J. Sohl-Dickstein, D. P. Kingma, A. Kumar, S. Ermon 和 B. Poole (2020) 基于随机微分方程的分数生成式建模。arXiv 预印本 arXiv:2011.13456。引用章节:§A.1, §A.1, §A.2, §D.2, §1, §1, §3.1, §3.1, §4.1。
- [58] Ł. Staniszewski, Ł. Kuciński 和 K. Deja (2024) 去而复返:论扩散模型中噪声与图像反转的关系。arXiv 预印本 arXiv:2410.23530。引用章节:§3.3。
- [59] A. van der Schaaf 与 J.H. van Hateren(1996)《自然图像功率谱建模:统计与信息》,《视觉研究》第36卷第17期,第2759–2770页。外部链接:ISSN 0042-6989,文献标识符,链接。被 §B.1.2 引用。
- [60] B. Wang 与 J. J. Vastola(2023)《扩散模型像画家一样生成图像:先轮廓后细节的分析理论》,arXiv 预印本 arXiv:2303.02490。被 §1、§1、§3.2、§3.3 引用。
- [61] Y. Wu、Y. Chen 与 Y. Wei(2024)《随机龙格-库塔方法:扩散模型的可证明加速》,arXiv 预印本 arXiv:2410.04760。被 §2 引用。
- [62] J. Xu、X. Liu、Y. Wu、Y. Tong、Q. Li、M. Ding、J. Tang 与 Y. Dong(2023)《ImageReward:学习与评估文本到图像生成中的人类偏好》,《神经信息处理系统进展》第36卷,第15903–15935页。被 §4.2 引用。
- [63] K. Xu、L. Zhang 与 J. Shi(2025)《好种子结好果实:在文本到图像扩散模型中发现秘密种子》,载于《2025年IEEE/CVF冬季计算机视觉应用会议(WACV)》,第3024–3034页。被 §1、§3.3 引用。
- [64] S. Xue、M. Yi、W. Luo、S. Zhang、J. Sun、Z. Li 与 Z. Ma(2023)《SA-Solver:用于扩散模型快速采样的随机亚当斯求解器》,《神经信息处理系统进展》第36卷,第77632–77674页。被 §2 引用。
- [65] S. Yan、M. Li、B. Xinliang、J. Yang、Y. Zhang、G. Xiong、Y. Lan、T. Zhang、W. Zhai 与 Z. Zha(2025)《超越随机性:理解扩散中噪声的顺序》,arXiv 预印本 arXiv:2511.07756。被 §3.3 引用。
- [66] M. Yu、L. Sun、J. Zeng、X. Chu 与 K. Zhan(2026)《阐明扩散概率模型的信噪比时间偏差》,arXiv 预印本 arXiv:2604.16044。被 §1、§2 引用。
- [67] D. Zhang、T. Zhang、S. Ge 与 S. Süsstrunk(2025)《增强频率伪造线索用于扩散生成图像检测》,arXiv 预印本 arXiv:2511.00429。被 §3.4 引用。
- [68] Q. Zhang 与 Y. Chen(2022)《利用指数积分器快速采样扩散模型》,arXiv 预印本 arXiv:2204.13902。被 §2 引用。
- [69] K. Zheng、C. Lu、J. Chen 和 J. Zhu(2023)《Dpm-solver-v3:基于经验模型统计的改进扩散 ODE 求解器》。《神经信息处理系统进展》第 36 卷,第 55502–55542 页。引用于:§2。
- [70] Z. Zhou、S. Shao、L. Bai、S. Zhang、Z. Xu、B. Han 和 Z. Xie(2025)《扩散模型的黄金噪声:一种学习框架》。载于《IEEE/CVF 国际计算机视觉会议论文集》,第 17688–17697 页。引用于:§3.3。
- [71] D. Zou、E. Liu、X. Ning、H. Yang 和 Y. Wang(2025)《USF++:扩散概率模型求解器搜索的统一采样框架》。《IEEE 模式分析与机器智能汇刊》。引用于:§2。
附录 A 随机能量注入的理论约束
在主文中,我们确立了生成过程中注入的随机噪声充当严格固定的注入能量预算。本附录提供了支撑这一核心前提的形式化推导。首先,在附录 A.1 中,我们证明了注入的总随机能量在数学上是有限的,并且严格不依赖于求解器的时间离散化。在此基础上,在附录 A.2 中,我们展示了这一有限能量预算无法在不违反底层 SDE 且不破坏向目标数据流形确定性收敛的前提下,通过全局缩放来弥补频谱缺陷。这些理论约束共同要求我们采用零和、频带重分配的方法。
A.1 总注入能量对时间步离散化的不变性
在本节中,我们证明,对于生成区间上的给定连续扩散调度,噪声过程注入的总随机能量是有限的,并且严格不依赖于用于积分反向 SDE 的离散化步数。这形式化了我们将 SDE 的随机性视为严格固定的全局注入能量预算这一概念。
考虑连续反向时间 SDE [4, 57]:
| (12) |
其中确定性漂移定义为 , 是标准反向时间维纳过程, 是一个连续且有界的扩散系数。
让我们在均匀积分步长上,使用标准欧拉-丸山数值积分方法 [22] 来评估我们的离散采样器:
| (13) |
为清晰起见,我们隔离单个空间维度,定义在第 步注入的随机增量如下:
| (14) |
以及在整个轨迹上每个维度的总期望注入方差如下:
| (15) |
收敛性证明。
由于扩散系数在第 步是确定性的,该增量的期望方差为:
| (16) |
因此,总期望方差为:
| (17) |
该公式正是 在区间 上的左黎曼和。根据 的连续性,我们可以取连续时间极限:
| (18) |
由于标准扩散调度在有限区间 [57] 上严格有界,该积分计算为一个有限常数。
有限 离散化误差。
令 表示离散求解器的方差差异。如果 ,左黎曼和的有界误差保证了:
| (19) |
这表明收敛速度为 。因此,除了一个微小且严格有界的数值积分误差外,任意选择的步数都从完全相同的有限总注入能量池中采样。
A.2 注入噪声方差守恒的理论要求
在本节中,我们证明,即使假设存在精确的预言机分数,一种注入全局噪声方差与真实分数函数不一致的朗之万动力学公式,会产生一个从根本上无法收敛到目标数据分布 的采样过程。
修正的反向随机微分方程及其等效流。
在连续时间扩散框架中,反向生成过程由随机微分方程 [57] 控制:
| (20) |
其中 是确定性漂移项, 是扩散系数, 是反向时间维纳过程。
让我们向随机增量引入一个恒定的全局方差乘子 。修正后的随机微分方程变为:
| (21) |
为了分析由该修正随机微分方程生成的精确边际分布(记为 ),我们依赖于随机微分方程与常微分方程之间的连续时间等价性。对于任何形式为 的反向时间随机微分方程,都存在一个确定性概率流常微分方程,该方程在所有时刻共享相同的边际密度 [4]:
| (22) |
将我们修改后的漂移项和扩散项代入该关系式,即可得到扰动系统的等效 PF-ODE:
| (23) |
如果我们强制要求这个修改后的过程能够沿着真实边际轨迹成功到达目标数据流形,则必须对所有 成立。在此条件下,等效流简化为:
| (24) |
然而,对应于未扰动前向过程的真实目标 PF-ODE 已知为:
| (25) |
该恒等式可直接从原始反向 SDE () 的 SDE 到 PF-ODE 关系推导得出:显式的分数减法恰好被扩散项所贡献的隐式福克-普朗克修正抵消,最终仅剩下 。
将我们修改后过程的漂移项与该目标相等,需要满足:
| (26) |
由于 且分数在生成轨迹上通常非零,该约束严格成立当且仅当:
| (27) |
这在数学上证实了,对注入随机噪声的任何全局缩放都会破坏指向 的确定性流。
传输与几何的刚性耦合。
为了严格论证为何不匹配 () 会导致过程失败,我们考察控制系统质量传输的连续性方程。设 为精确的 PF-ODE 向量场。由该静态向量场驱动的失配密度的时序演化为:
| (28) |
这一展开揭示了一个根本性的结构不兼容问题:
平流 ():
质量的平移作用于失配分布 的空间梯度上。
压缩/膨胀 ():
概率质量的局部膨胀与压缩由分数场控制,而该分数场是专门针对真实数据分布 的几何结构定制的。
由于 具有与 不同的空间梯度,静态局部流会导致质量路由错误。潜在空间中的某个区域可能会接收到由 的几何结构所决定的概率质量涌入,但实际遇到的却是 的密度,这不可避免地会形成人为瓶颈或过冲。分数场并非充当全局吸引子;相反,它作为一种刚性耦合的传输机制,仅在状态分布严格遵循其对应的边际轨迹时才有效。
的实践意义。
虽然 是实现完美分布匹配的必要条件,但实际失效模式会因缩放误差的方向不同而有所差异:
- •
过度注入():过度的随机探索超出了基于分数的漂移的恢复能力。状态迅速从真实流形上扩散开来,导致样本保真度严重下降。
- •
注入不足():恢复性梯度步长压倒了减弱的随机探索。虽然这在理论上违反了完美的边际匹配,但样本可能不会立即偏离流形。相反,生成分布会围绕局部高密度模态剧烈收缩。这保留了单个样本的视觉连贯性,但会导致模态集中和生成多样性的可测量损失。
在附录A.3和附录B.2中,我们证明在扩散模型中,将密度锚定到真实概率路径需要放宽严格的逐维度方差约束。相反,模型在所有维度上强制执行平均方差,满足以下条件:
| (29) |
A.3 模型对分布外频谱状态的鲁棒性
我们的有色噪声采样(CNS)框架中的一个基本假设是:通过缩放向量主动调节每频率信噪比(SNR)不会将中间生成状态推至网络无法处理的严重分布外(OOD)区域。在本节中,我们证明这种鲁棒性是扩散模型的内在属性。具体而言,由于网络的归纳频谱偏差,标准推理轨迹本质上运行在高度分布外的频谱状态上,但模型能够可靠地将这些状态解析为真实数据分布。
理论训练范式。
在标准连续时间训练过程中(例如,为简化起见,采用线性流匹配调度),模型针对精确边际分布进行优化。给定一个干净数据样本和一个噪声样本,中间状态从纯噪声(在 时刻)流向干净数据(在 时刻),其过程如下:
| (30) |
应用傅里叶变换可得到训练边际分布的频谱组成:
| (31) |
后续在附录 B.1.2 中确立,期望的干净数据频谱呈现幂律分布,而噪声先验在频谱上是平坦的。
如果生成过程完美地遵循这一理论训练路径,那么任何频段上已解析图像信号的比例将随时间严格线性变化。通过分离数据项并进行归一化,期望的目标进展比率定义为:
| (32) |
在这一理想化范式下,每个频段均匀地累积图像信息,保持训练边际分布所规定的精确信噪比平衡。
推理时的频谱偏差。
然而,在标准推理过程中,模型并非均匀地生成图像。正如通过 -矩阵(第 3.2 节)所量化的那样,神经网络表现出显著的频谱偏差。
无论是从完美纯噪声出发并以高精度积分,还是给定插值分布的某个中间状态,频带的经验演化进程都严重偏离了线性目标。低频带的收敛速度远快于训练范式所规定的速度,在生成过程早期就解决了其结构性能量(),而高频带直到轨迹末端仍以噪声为主。
对有色噪声采样的启示。
这种经验性偏差揭示了一个关键的操作现实:在标准推理过程中,中间潜变量相对于训练边际的功率谱密度和信噪比[8]已经严重分布外。
⬇
gamma_sum=torch.zeros(T,F)
forxinODE_batches:
t=torch.linspace(0,1,T)
v=(x[1:]-x[:-1])/ dt
xp=x[:-1]+(1-t[:-1])*v
xp=torch.cat([xp,x[-1:]])
X=torch.fft2(xp)
Xf=torch.fft2(x[-1])
g=1-torch.abs(X-Xf)**2/ torch.abs(Xf)**2
g=torch.clamp(g,0,1).mean(dim=C)
gamma_sum+=bin_radially(g).mean(dim=B)
gamma=gamma_sum/ N
在某个中间时间步,理论训练边际预期低频仅被部分构建()。而实际上,生成状态的低频已高度饱和()。尽管存在这种巨大的频谱失配——特定频带的局部信噪比完全违背了理论训练预期——但网络学习到的得分函数并未崩溃。它继续稳定地处理这种分布外频谱,利用速度/得分联合动力学,可靠地将轨迹推向真实图像分布,而非退回到噪声。
这种固有的频谱鲁棒性直接验证了彩色噪声采样的核心力学假设。由于模型能够原生处理并修正信噪比在频率维度上受到扰动的中间状态,因此通过我们的方差缩放算子有意塑造注入的随机能量,可以在模型已建立的鲁棒性包络内安全运行。通过确保全局方差预算严格守恒,CNS 利用了网络的内在能力,将特定路径的频带能量转化为连贯的图像结构,而不会引发灾难性的分布外(OOD)失败。
附录 B 频谱动力学与彩色噪声的理论分析
在本附录中,我们提出了一个关于生成扩散模型频谱动力学的统一理论分析。首先,在附录 B.1 中,我们研究了 ODE 与 SDE 采样器之间观测到的频谱间隙的机制起源,论证了由于不完美的分数近似,路径能量轨迹是如何产生分歧的。在此基础之上,在附录 B.2 中,我们形式化地阐述了彩色噪声 SDE 如何能够严格按频带策略性地重塑这种连续的能量演化过程。我们证明,虽然理想的分数条件强制要求严格的零和能量再分配,但状态-误差相关性的时间依赖性衰减使得 CNS 能够从根本上规避这一约束。这使得 CNS 能够通过将方差动态路由到结构转换效率最高的频率上,永久且建设性地改变生成的频谱。
B.1 生成分布频谱差异的理论起源
为了识别观测到的生成分布功率谱密度(PSD)差异(见图 4)背后的机制,我们从理论上分析了 ODE 和 SDE 轨迹在采样过程中频带能量的时间演化。目标是确定两种采样器在何处(哪些频带和时间步)以及如何(能量转移的速率和方向)产生分歧。这种比较为解释它们最终生成的频谱为何不同提供了机制层面的解释,进而阐明了它们质量差距的来源。
尽管概率流常微分方程和反向时间随机微分方程在每一时刻被构造为具有相同的边际分布,但由于网络对分数函数的近似不完美,它们的路径能量动态存在显著差异。设时刻的状态能量定义为:
| (33) |
因子 是一个标准归一化项,确保 ,从而使能量漂移表达式整齐对齐。
B.1.1 连续时间采样中的路径能量动态
设 表示 PF-ODE 的确定性漂移。ODE 轨迹为 。应用标准微分法,期望能量演化完全由状态与速度之间的对齐程度决定:
| (34) |
我们回顾一下,反向时间 SDE 的漂移通过分数函数与 ODE 漂移相关联。SDE 轨迹为:
| (35) |
为了评估该随机过程的能量微分,我们应用伊藤引理。由于该过程是从 到 反向时间积分,我们定义反向时间变量 ,使得 。正向时间 SDE 为 。对 应用伊藤引理可得:
| (36) |
其中 是数据维度。回到正向时间导数并取期望以消除维纳噪声,SDE 的期望能量漂移为:
| (37) |
理想分数函数与热量抵消。
为了理解这一动态,假设存在一个理想的神谕分数函数 。通过分部积分,数据与其真实分数函数的期望对齐严格为 。将其代入 SDE 漂移:
| (38) |
这在数学上形式化了理想的生成平衡:由伊藤噪声项()明确注入的随机热量,被真实分数函数()的恢复性径向收缩完美且精确地抵消。
不完美的分数函数。
在实践中,学习到的分数函数包含近似误差:。代入这个不完美的分数函数会破坏完美的热量抵消:
| (39) |
将该漂移差从 (其中 )积分到 ,我们分离出生成分布之间的确切能量差距:
| (40) |
因此,SDE 与 ODE 生成之间的宏观差异严格由状态-误差相关项 控制。如果该项非零,则“热量与收缩”的平衡被打破,路径能量会偏离理想轨迹。
B.1.2 状态-误差相关性及功率谱密度差距
根据帕塞瓦尔-普朗歇尔恒等式[42],这种全局相关性可以分解为独立的频率贡献:
| (41) |
我们针对单一频率 明确表述这一点。将相关性泛函定义为 ,则 处的频带能量差距满足:
| (42) |
由于 , 的符号完全由 的累积符号决定。为了判断网络误差是引起正还是负的状态-误差相关性,我们必须考虑神经网络的学习动态。通过均方误差(MSE)训练的网络表现出向均值回归的特性;当面对不确定性时,它们会输出保守的平滑估计[26]。因此, 系统性地低估了真实分数 的幅度。我们将这种近似误差建模为与真实分数反方向对齐:其中 。
为了确定真实分数 的方向,我们引用特威迪公式[7, 6],该公式指出分数与期望的干净数据和当前含噪状态之间的差值成正比: 。令 表示初始噪声先验的能量, 表示真实数据分布的目标能量。为了从物理角度理解这一点,自然图像具有充分记载的幂律谱[59, hyvärinen2009natural],这是一种结构特性,即使在现代自编码器的压缩潜空间中也会根本性地持续存在[38]。因此,我们可以将真实数据的光谱目标近似为归一化的 (其中 ),而标准高斯先验则保持平坦的白噪声谱 。比较这些依赖于频率的幅度,可以定义三种不同的生成机制:
1. 衰减机制():
在目标数据能量低于初始噪声的频率处(通常是高频),所需的演化是衰减。由于期望的干净信号幅度小于当前含噪状态,向量差指向内部。因此,真实分数的作用是消除噪声: 。由于网络低估了这种向内拉力,产生的误差指向外部()。误差与状态正对齐,意味着它们的内积为正:
| (43) |
结论:SDE 相对于 ODE 会过度分配能量。由于学习到的分数(score)过弱,无法充分衰减状态,因此连续噪声注入并未完全消散。
2. 放大区间():
在目标结构幅度大于初始噪声的频率处(通常为低频),所需的演化是放大。预期的干净数据向量具有显著更大的幅度()。因此,向量差指向外部:。低估误差因此指向内部()。该误差与状态反方向对齐,产生负内积:
| (44) |
结论:SDE 相对于 ODE 会分配不足的能量。SDE 持续的随机扰动,加上无法充分驱动必要放大的弱化分数,导致轨迹未能达到理想的能量水平。
3. 交叉点():
区间转换恰好发生在初始噪声的固有能量与真实数据的目标能量相匹配的频率处。此时,干净数据的预期幅度等于当前含噪状态的幅度。分数提供纯粹的切向(相位旋转)拉力,施加零径向拉力。因此,状态与分数(以及误差)的内积为零:
| (45) |
结论:在精确的交叉频率处,径向近似误差消失,ODE 和 SDE 的能量轨迹完全匹配。
B.2 有色噪声 SDE 的频谱影响与能量动力学
如附录 A.1 所证明,随机过程注入的总能量是有限的,并严格受扩散调度限制。我们现在寻求从数学上形式化有色噪声 SDE 如何在严格的频带基础上重塑这种能量的连续演化。
B.2.1 理想分数函数下的能量动力学
标准 SDE 中的均匀能量分配。
在标准白噪声随机微分方程中,注入的随机功率在每个时间步均匀分布在所有频带上。等价地,每个积分步注入一个平坦的功率谱密度,确保所有空间频率都能获得有限注入能量预算的均等份额。
有色噪声方差算子。
我们通过在不同频带上对标准噪声进行差异化缩放,引入了一个有色噪声过程。在傅里叶域中,设:
| (46) |
其中每个 是一个与时间相关的实值缩放权重,对应频率索引 , 是数据维度。在频域中修改后的噪声增量定义为:
| (47) |
通过逆傅里叶变换映射回空间域,得到线性算子形式:
| (48) |
全局方差守恒约束。
为保持生成过程的全局稳定性(必要性见附录 A.2),我们要求有色噪声过程的总注入能量与标准白噪声随机微分方程精确匹配。对于我们的修改过程,期望方差为:
| (49) |
由于标准随机微分方程注入的总方差为 ,匹配这一全局能量预算施加了一个严格的方差守恒约束(即权重均方根必须为 1):
| (50) |
有色噪声随机微分方程的频带能量漂移。
将此缩放噪声过程代入反向时间随机微分方程动力学,特定频带在傅里叶域的状态演化变为:
| (51) |
对频带能量 应用伊藤引理(推导见附录 B.1),有色噪声过程下期望的频带能量漂移形式为:
| (52) |
作为对比,在标准白噪声随机微分方程()下,相应的频带漂移为:
| (53) |
因此,有色噪声修改仅将注入的伊藤热项从 动态改变为 ,从而在安全保持全局能量预算的同时,实现目标频率的放大()或衰减()。
解释与所需假设。出于理论可处理性的考虑(同时需指出,由于网络的谱偏差,这仅是一种近似),假设理想评分函数对每个频带施加一个恢复性漂移,从而完美抵消标准的伊藤能量注入。详见附录A.3。在这些假设下,完美评分函数在标准单位尺度上抵消了每个频带。因此,将频带中的注入噪声缩放为会引入一种有意的失配:导致该频带出现净能量增加,而则导致净能量耗散。假设模型能够可靠地将这种随机能量变化映射为连贯的空间结构(详见第3.3节),那么更高的注入方差将可靠地在该频带内产生更高的生成结构能量。
B.2.2 理想评分函数下的零和频谱约束
我们通过从CNS漂移中减去标准SDE能量漂移,来分离噪声整形的显式效应,从而得到注入频带的瞬时超额能量:
| (54) |
在采样轨迹上对该式进行积分,即可形式化地得到频率的终端超额能量差:
| (55) |
结论(零和再分配)。如果我们将特定频带缩放至,那么该频带中的生成能量会增加。然而,由于全局守恒约束(),偏离单位基线的偏差之和必须严格为零:
| (56) |
因此,对所有频带的超额能量求和,即可确认全局守恒:
| (57) |
在理想评分函数下,任何频谱调整本质上都是一场零和博弈:特定频带在CNS下可能获得更高能量,但这完全是以牺牲其他频带为代价的。
B.2.3 通过评分近似误差打破零和约束
零和范式依赖于一个关键假设:原始注入噪声转化为永久生成结构能量的转换率在所有频带上都是恒定的。然而,正如附录 B.1 中所推导的,实际成功转化为永久结构散度的原始注入噪声量严格由状态-误差相关项决定。我们现在证明,这种相关性具有高度非平稳性,并且随着图像结构内容的解析而迅速衰减。为了量化结构形成,我们使用归一化有界度量,该度量表示在任意时刻某个特定频带的“构建”程度,该度量源自第 3.2 节,并在图 3 中直观展示。
状态-误差相关性衰减的拟议机制
为了从理论上解释状态-误差相关性的衰减,我们假设了两种互补机制:(1) 真实得分的首阶径向分量随着频带解析而消失;(2) 网络对未解析高频细节的误差,在连续的后期阶段步骤中可能转变为相位随机散射。
我们注意到,这里提出的框架旨在作为一种合理性论证,而非严格的推导。特别是,我们并不要求得分误差的绝对量级消失;我们仅仅表明,终端生成状态不断变化的几何和时间属性,有可能在即使 的情况下,也将累积相关性驱动至接近零。
1. 真实得分的切向主导性。根据 Tweedie 公式 [7],频域中的真实得分与从当前状态到其条件干净估计的位移成正比:
| (58) |
我们在此省略了与调度相关的前置因子,因为只有 相对于 的方向会影响我们即将计算的径向内积。当一个频带接近完全“构建”状态()时,网络已正确解析了该频带的宏观内容,因此条件干净估计在量级和近似方向上均与当前状态紧密对齐。我们将残余失配表征为一个小的相位旋转:
| (59) |
这严格强于仅仅:等幅值本身允许存在一个带有显著径向分量的任意弦式位移,而小角度相位旋转在主导阶上是切向的。展开来说:
| (60) |
在复平面上,主导阶位移在几何上与 正交(乘以 即旋转 ),因此状态与分数的径向内积纯粹是一个二次余项:
| (61) |
将附录 B.1 中的早期相位低估模型向前推进,同样的二次抑制效应会传播到状态误差相关性中:
| (62) |
2. 向未解析细节的相位随机误差过渡。在条带形成的早期阶段(),MSE 训练会诱发一个时间上连贯的径向偏差——具体而言,是沿着状态方向对分数幅度的系统性低估。然而,一旦条带的宏观量级建立起来(),这种连贯性就会被打破。在这个最终阶段,网络的剩余任务转向解析精细的子结构细节,例如锐利边缘和精确的相位对齐。由于这些高频特征难以从压缩的潜在表示中推断出来,网络的误差会放弃任何一致的定向偏差,转而变为不稳定的、相位随机的波动,贯穿连续的后期阶段积分步骤。
要理解这种过渡为何重要,将条带方向的内积写成极坐标形式是有帮助的:
| (63) |
晚期步骤对累积能量间隙的贡献由其轨迹时间平均值决定。在早期阶段,该相对相位很可能在连续多个步骤中集中在 或 附近(与低估模型相关的径向方向),因此每步贡献将以固定符号相干叠加。若在终止阶段,相对相位在最终执行的步骤中发生不规则变化,且大致呈现 均匀分布,则带符号的每步贡献将在时间累积下趋于抵消,晚期阶段对 的贡献可能坍缩至零——即便每个单独步骤仍满足 。我们提出这一推测性机制,结合上述几何论证,或可解释所提出的 衰减现象。
状态依赖效率与零和再分配的失效。
综合来看,这些提出的机制构建了一个理论框架,解释了为何一旦频带在结构上被解析,状态-误差相关性就会崩溃。在该框架下,当频带完全构建时(),SDE 能够恰当平衡随机噪声注入与分数驱动收缩。此时,控制频带级 SDE 与 ODE 间隙(公式 42)的同一 充当转换增益,量化原始注入随机方差转化为相干径向增长(而非耗散为不相干涨落)的速率。当 时,该转换增益消失。因此,任何超额方差()进入瞬时方差预算,但无法物化为相干图像内容;后续去噪步骤将其视为环境噪声并移除。结果,注入方差的全局守恒()并不强制生成能量的零和守恒,从而有效瓦解了零和再分配约束。
最终,有色噪声的真正效能——即其能量吸收效率——取决于方差缩放与衰减结构相关性在时间上的交集。要永久性地改变生成的频谱,需要在某个频带仍处于结构赤字状态时注入方差。这揭示了随机生成的一个基本特性:宏观频谱的差异并非由注入能量的总量决定,而是由其注入时机决定。
所提出的 CNS 分配时间表的推导过程。
在确立了能量转换效率随 衰减之后,我们制定了最优的时间相关注入策略。为了最大化有限方差预算的效用,系统必须避免向已“建成”的频带注入多余能量,因为在那里能量会被浪费性地耗散。相反,它必须动态地将方差路由到尚未建成的滞后频率,这些频率的相关性仍然很高,从而最大化注入热量的结构保留率。虽然一种朴素的优化策略可能建议采用“开关式”控制器——在任意给定时刻将全部方差预算专门分配给单一最不完善的频带——但我们假设能量转换效率从根本上受到注入噪声局部幅度的限制。用过多的随机方差淹没单个频带,会超出评分网络的局部恢复能力,从而降低模型连贯整合或耗散该噪声的能力。因此,最优时间表必须避免贪婪分配。方差缩放因子应平滑地且与频带的结构赤字 成正比。为了在每一步都满足全局能量守恒约束,我们通过其均方根值对频谱上的这一赤字进行归一化处理:
| (64) |
该时间表展现出若干非常理想的理论特性:
- •
初始化为白噪声:在 时刻,所有频带均完全未建成。对所有频率,分配结果均计算为 。生成过程自然地从标准均匀白噪声 SDE 开始。
- •
动态路由:随着生成过程的推进,不同频带会以不同的速率积累结构。该调度方案会自动消耗接近饱和频带的方差预算,并将其主动路由至滞后的频率分量。
- •
避免局部饱和:通过采用比例缩放而非二元的“开关式”注入,该调度方案能防止任何单一频带被随机方差淹没,从而确保噪声始终处于分数网络可操作的恢复能力范围内。
- •
最优保留:通过将数学权重完全转移到状态-误差相关性最强的区域,该调度方案在数学上规避了零和能量游戏的限制,确保注入的每一单位方差都能被最优地转化为永久的宏观结构。
附录C 方法与实验细节
本附录提供了复现彩色噪声采样(CNS)框架所需的全面方法与实验细节。虽然正文确立了频谱能量控制的理论前提,但本节将这些概念转化为一个稳健且易于部署的推理算法。首先,在附录C.1中,我们正式定义了用于隔离和评估各向同性径向频带的多维傅里叶投影算子。接着,在附录C.2中,我们详述了硬件配置以及实用的调度松弛策略——例如进程缩放和动态频谱倾斜——这些策略使CNS能够无缝集成到标准采样流程中,进一步增强算法的鲁棒性,并持续改善合成结果。
C.1 径向空间频带的隔离
设 表示一个连续的、实值的多通道空间张量,例如一个生成的噪声样本或一张图像。为了准确评估扩散过程中与频率耦合的动力学特性,我们必须系统地隔离出对应于特定空间尺度的信号分量。这可以通过多维离散傅里叶变换来实现。
二维离散傅里叶变换与移位网格
我们首先对每个通道独立应用二维离散傅里叶变换(DFT),记作:
| (65) |
为了根据空间尺度而非方向性来分析频率,我们将二维频率索引进行移位,使直流(零频)分量位于原点。设移位后的频率坐标为 ,定义在离散域上:
| (66) |
各向同性径向频率。
由于自然图像和标准扩散噪声先验通常具有各向同性(在期望上具有旋转不变性),我们将二维频率网格压缩为一维空间尺度度量。我们将径向频率定义为与直流分量的欧几里得距离:
| (67) |
最大理论径向频率(对应二维奈奎斯特极限的角落)受限于 。
离散频带划分。
为了对整个频谱进行统计分析,我们将连续范围划分为离散的径向频带。每个离散坐标通过最近整数缩放映射到一个整数频带索引:
| (68) |
该映射定义了一组互斥的二维频率掩码 ,其中每个集合包含属于频带 的所有坐标对:
| (69) |
投影算子与厄米对称性。
利用这些离散集合,我们定义带通投影算子 ,该算子提取仅存在于频带 中的空间信号。这是通过对掩码后的频谱进行逆二维离散傅里叶变换来实现的:
| (70) |
其中 是指示函数, 表示逐元素乘法。
径向距离函数的一个关键几何性质是其关于原点的对称性:若 ,则 。由于输入空间张量是实值,其傅里叶变换天然具有厄米共轭对称性()。掩码的各向同性对称性在掩码操作过程中完美保留了这一厄米特性。因此,逆离散傅里叶变换保证投影后的张量严格保持实值:
| (71) |
这使得我们不再将其视为复杂的傅里叶级数,而是视为低维子空间中的一个标准实向量。由于投影算子返回的是实数值,我们可以直接在投影后的张量上无缝计算标准的空间度量——例如范数和余弦相似度。
C.2 硬件配置与经验性松弛
硬件与环境。
所有生成推理和评估实验均使用 PyTorch 配合分布式数据并行(DDP)进行,计算节点配备四块 NVIDIA L40S(48GB 显存)GPU。
经验性调度松弛。
虽然附录 B.2.3 推导了理论最优的方差分配调度方案,但我们通过实验发现,引入轻微的算法松弛有助于维持最优的生成稳定性。在实践中,我们对推理框架实施了三个参数化调整:
- •
进度缩放:为了防止过早的方差路由,我们通过引入一个常数缩放因子来软化严格计算的结构进度矩阵,使得有效进度变为 。
- •
动态频谱倾斜:在特定实验中,我们对注入的有色噪声频谱应用随时间变化的指数倾斜。这平滑了严格的频带分配,在生成过程中为相邻频带之间提供了更稳定的过渡。
- •
能量均衡调优:尽管附录 A.2 推导了一个严格的约束条件,但经验性的评分网络会系统性地低估恢复梯度(附录 B.2.3),从而扭曲了逆时 SDE 的“热力与收缩”平衡。我们通过对总注入能量预算进行微调来补偿;所使用的值(–,表 C.2)完全位于表 D.4.1 所表征的单位能量稳定区间内。
所有评估架构(SiT、JiT、FLUX)的精确配置值和超参数选择均在表 C.2 中全面报告。
| SiT-XL/2 | JiT-B/16 | JiT-H/16 | |||||
| 参数 | 无 CFG | 有 CFG | 无 CFG | 有 CFG | 有 CFG | 无 CFG | 有 CFG |
| \rowcolor[gray]0.95 架构与数据 | |||||||
| 空间 | 潜空间(VAE) | 像素 | 像素 | ||||
| 数据集 | ImageNet-256 | ImageNet-256 | ImageNet-256 | ||||
| 预测 | -预测 | -预测 | -预测 | ||||
| 频段 | 32 | 32 | 32 | ||||
| 采样步数 | 250 | 50 | 50 | ||||
| \rowcolor[gray]0.95 CNS 采样设置 | |||||||
| 引导尺度 | – | 1.5 | – | 2.6 | 3.0 | – | 2.2 |
| 求解器 | Euler/Heun | Euler | Euler | Euler | Euler | Euler | Euler |
| 幂次 | 0.75 | 0.5 | 0.5 | 0.5 | 0.5 | 0.5 | 0.5 |
| 除数 | 1.73 | 25.0 | 5.0 | 10.0 | 14.0 | 7.5 | 25.0 |
| Alpha 倾斜插值 | - | - | - | - | - | ||
| Alpha 倾斜插值类型 | 指数 () | 线性 | - | - | - | - | - |
| 噪声能量尺度 | 0.98 | 0.998 | 0.995 | - | - | 0.98 | 0.999 |
附录 D 补充结果与扩展评估
本节提供了扩展的经验性评估,以补充正文中的发现。我们首先展示了在不同架构和采样设置下的额外定量基准(附录 D.1)。接着,我们详细介绍了用于随机微分方程高阶求解器的数值积分方案(附录 D.2),并分析了 CNS 在不同离散化步数下的鲁棒性(附录 D.3)。为了严格验证我们的理论约束和设计选择,我们随后提供了一项全面的消融研究,评估了全局能量缩放、频谱扰动和时间调度失配的影响(附录 D.4)。最后,我们详细阐述了证明 CNS 与使用替代噪声分布训练的模型具有正交性和泛化能力的实验(附录 D.5)。最后,我们以扩展的定性视觉比较(无引导)作为结尾,突出了 CNS 相对于标准基线的优越性(附录 D.6)。
D.1 扩展生成基准
为了证明跨模型架构和评估框架的一致性,我们提供了补充性能表格。表 8 报告了使用 100 个采样步数的无引导 JiT-H/16 结果。在这些条件下,CNS 在所有跟踪指标上严格优于 ODE 和标准 SDE 基线。此外,表 9(正文中引用)详细列出了 FLUX 模型在 GenEval [9] 上的广泛基准测试,展示了 CNS 增强复杂文本到图像合成能力。
| 采样器 | FID | sFID | IS | 精确率 | 召回率 |
|---|---|---|---|---|---|
| ODE | 11.46 | 10.49 | 44.71 | 0.63 | 0.64 |
| SDE | 8.95 | 7.98 | 46.38 | 0.65 | 0.65 |
| CNS(我们的方法) | 8.57 | 7.16 | 46.72 | 0.66 | 0.65 |
| 模型与采样器 | 总体 | GenEval 任务细分 | |||||
|---|---|---|---|---|---|---|---|
| 单个物体 | 两个物体 | 计数 | 颜色 | 颜色属性 | 位置 | ||
| FLUX.1-dev | |||||||
| ODE | 0.643 | 0.988 | 0.784 | 0.699 | 0.826 | 0.413 | 0.152 |
| SDE | 0.635 | 0.984 | 0.789 | 0.685 | 0.768 | 0.433 | 0.154 |
| CNS(我们的方法) | 0.647 | 0.988 | 0.794 | 0.714 | 0.803 | 0.420 | 0.164 |
D.2 随机微分方程的数值积分方案
在对生成模型的反向时间随机微分方程进行离散化时 [57],数值求解器的选择决定了近似误差。与依赖标准泰勒级数近似的常微分方程不同,随机微分方程需要 Itô-Taylor 展开 [22]。因此,随机微分方程求解器具有两种不同类型的收敛阶:
- •
强收敛阶(路径精度):如果单个轨迹的期望误差随步长 缩放,定义为 ,则求解器具有强收敛阶。这衡量了求解器跟踪特定噪声实现的准确程度。
- •
弱收敛阶(分布精度):如果平滑测试函数期望值的误差随 缩放,定义为 ,则求解器具有弱收敛阶。
在生成建模的背景下,我们的主要目标是从正确的目标分布中采样,而不是精确跟踪特定的微观噪声路径。由于 Fréchet Inception Distance (FID) [14] 等标准评估指标衡量的是分布距离,因此求解器的弱收敛阶是主要关注的数量。在我们的实验中(第 4.1 节),我们评估了不同弱收敛阶的求解器:
- 1.
Euler-Maruyama [36]:基础的 1 阶弱(和 1/2 阶强)随机微分方程求解器,每步需要 1 次函数评估。
- 2.
Stochastic Heun:一种 2 阶弱预测-校正方法,每步需要 2 次函数评估 [13, 21]。
- 3.
随机龙格-库塔(SRK):我们采用了 Rößler 提出的两种高阶格式。SRK2[47] 每步使用 2 次评估,可实现弱阶 2(对于加性噪声可实现强阶 1)。SRK2S[48] 每步需要 3 次评估,在处理一般对角乘性噪声时仍能保持强阶 1,同时维持弱阶 2。
D.3 对离散步数的鲁棒性
为了评估我们方法的数值鲁棒性,我们进行了一项实验,分析不同离散步数下的性能表现。随着采样步数的增加,CNS 的 FID 呈现单调递减趋势,始终优于标准 SDE 基线。值得注意的是,CNS 在不到标准 SDE 所需步数一半的情况下,就达到了 ODE 采样器的最佳 FID 值。
相反,由于预训练模型底层框架的固有限制,确定性 ODE 采样器在高步数下无法保持单调提升;因此,我们省略了其超过标准 250 步的结果。虽然 CNS 显著加速了随机收敛,但它仍然存在 SDE 求解器的根本局限性,即需要比 ODE 更大的最小离散化步数,才能正确积分底层微分方程。
D.4 全面消融研究
为了实证验证彩色噪声采样(CNS)框架的理论约束和设计选择,我们进行了广泛的消融研究。所有消融实验均在无引导的 SiT-XL/2 架构上,使用 250 步欧拉采样进行,并在 ImageNet-256 数据集上评估(FID-10K、sFID 和 Inception Score)。完整的定量结果详见表格 D.4.1。下面,我们正式阐述每个消融类别的方法论和理论意义。
D.4.1 全局能量缩放(验证方差约束)
| 采样场景 | FID-10K | sFID | IS |
|---|---|---|---|
| CNS(我们的方法) | 9.61 | 18.17 | 143.20 |
| \rowcolor[gray]0.95 基线 | |||
| 确定性 ODE | 17.05 | 23.57 | 98.43 |
| 标准白噪声 SDE | 11.82 | 19.15 | 107.75 |
| \rowcolor[gray]0.95 时间局部破坏 | |||
| 25% 白噪声 | 10.47 | 18.95 | 137.91 |
| 50% 白噪声 | 10.64 | 19.08 | 136.36 |
| 50% 随机单位能量谱 | 11.28 | 19.21 | 134.81 |
| 100% 随机单位能量谱 | 12.26 | 19.80 | 127.09 |
| \rowcolor[gray]0.95 时间调度排列 | |||
| 恒定频谱(时间均值) | 10.53 | 19.14 | 137.63 |
| 打乱调度 | 10.46 | 19.03 | 138.02 |
| 逆序调度(时间反转) | 10.50 | 18.91 | 137.46 |
| \rowcolor[gray]0.95 全局能量缩放(方差约束违反) | |||
| 缩放因子 0.50(半能量) | 106.82 | 278.69 | 9.83 |
| 缩放因子 0.75 | 53.29 | 161.09 | 34.11 |
| 缩放因子 0.90 | 16.17 | 42.03 | 111.29 |
| 缩放因子 1.01 | 11.37 | 20.21 | 133.84 |
| 缩放因子 1.05 | 20.46 | 29.73 | 96.17 |
| 缩放因子 1.10 | 50.63 | 49.70 | 46.96 |
| 缩放因子 1.25 | 171.12 | 91.28 | 5.70 |
| 缩放因子 1.50 | 256.56 | 134.67 | 2.12 |
| 缩放因子 2.00(双倍能量) | 327.45 | 198.37 | 1.55 |
| \rowcolor[gray]0.95 多分式布朗运动(mBm)变体 | |||
| 白蓝 () | 13.46 | 25.16 | 122.49 |
| 白蓝 () | 11.88 | 19.62 | 130.22 |
| 红蓝 () | 266.61 | 224.77 | 2.97 |
在附录 A.2 中,我们从数学上确立了全局方差守恒约束()的必要性。为了通过实验证明这一点,我们将注入的总能量预算统一缩放了从 到 的倍数。结果非常明显:任何偏离单位能量预算紧邻域的行为都会严重降低生成保真度。向下缩放能量(例如 )会使 SDE 缺乏必要的随机探索来纠正数值漂移,从而将性能拉向确定性 ODE 基线。相反,即使将能量向上缩放 ()也会使过程不稳定。过量的注入伊藤热很容易压倒评分网络的恢复梯度,迅速将潜在状态推离分布,并破坏语义连贯性。
D.4.2 频谱扰动与局部破坏
为了验证我们逐频带分配的精确性,我们随机抽取了预设比例(25%、50%、100%)的时间步,注入替代噪声分布,而非采用最优的 CNS 调度。这些注入的分布要么是均匀白噪声,要么是随机单位能量谱(其中每个频带的权重是随机的,但严格保持全局能量预算)。如表 D.4.1 所示,任何对最优映射的破坏都会单调地降低性能。这证实了仅仅确保单位能量预算是不够的;能量必须被明确地引导到那些结构缺陷最严重的特定频带上。
D.4.3 时间调度排列
正如附录 B.2.3 中的理论分析,随着结构逐渐解析,状态误差相关性会衰减,这意味着能量注入的效率具有高度的非平稳性。为了证明能量注入的时间点与注入位置同样关键,我们破坏了 CNS 调度的时间对齐:
- •
恒定频谱:我们将动态 CNS 矩阵在所有时间步上取平均,以生成一个单一的、静态的有色噪声轮廓。
- •
打乱调度:我们随机排列了分配矩阵的时间步。
- •
反转调度:我们相对于生成时间反向应用了该调度。
尽管这三种变体在整个轨迹中保持了与最优 CNS 完全相同的总频率能量注入,但它们完全无法达到相同的 FID 值。由于在错误的时间步注入能量——通常注入到那些结构已经解析完成的频带中——它们将有限的方差预算浪费在了瞬时的旋转噪声上,从而验证了动态的、感知状态的调度的必要性。
D.4.4 替代噪声公式(mBm)
最后,我们探索了一种用于生成非平稳有色噪声的替代数学公式:多重分形布朗运动(mBm)[41]。与标准维纳过程不同,mBm 引入了一个时变的赫斯特参数,使得随机增量能够在不同的噪声颜色之间连续变化(例如,从白噪声到蓝噪声)。从形式上讲,这种频率依赖的转变可以通过 mBm 的可调和表示来理解:
| (72) |
其中 表示频率, 是复维纳测度, 是归一化常数。在这种形式下,指数项直接控制着谱密度,从数学上决定了噪声颜色随时间演化的方式。虽然理论上优雅,但 mBm 规定了整个频谱上一种刚性的、参数化的偏移。它缺乏由 -矩阵提供的细粒度、逐频带的结构感知能力。因此,即使经过精心调优的 mBm 调度(例如 White Blue, )在性能上也达不到所提出的 CNS 框架的水平,尽管优化后的 mBm 配置相比标准 SDE 仍能带来微小的改进。
D.5 对替代噪声训练的泛化
为了证明我们的框架与替代噪声训练范式是正交的,我们在 BNDM [17] 作者提供的官方预训练 IADB 模型上评估了 CNS。由于这些 BNDM 实验依赖于一种独特的、随时间演化的噪声分布,我们首先推导并实现了一个严格针对其特定前向过程定制的自定义 SDE 采样器。尽管训练目标不同,我们观察到这些模型仍然表现出明显的谱偏置。我们通过实验追踪了这种偏置,以计算相应的结构演化 -矩阵,并将我们的 CNS 方法集成到自定义 SDE 求解器之上。通过根据该矩阵动态塑造注入的噪声频谱,CNS 在使用标准提供的测试批次的两个评估数据集上均实现了显著的生成改进。
D.6 额外的视觉对比
在本节中,我们提供了扩展的定性结果,展示了我们提出的彩色噪声采样(CNS)框架相比标准确定性(ODE)和随机(SDE)基线的有效性。图 7 和图 8 展示了在多种 ImageNet 类别上的生成样本。为确保对采样动态进行公平且独立的评估,给定行内的所有图像均使用完全相同的噪声实现和类别提示词生成。
正如先前理论所确立的,标准的均匀白噪声随机微分方程(SDE)常常难以解析高频空间结构,往往生成模糊或结构退化的纹理。相反,确定性常微分方程(ODE)虽能保留结构,却会因累积误差而导致过度平滑、不自然的外观。通过将随机能量动态路由至结构上未解析的频带,CNS 始终弥合了这一差距,生成更锐利的精细细节(例如皮毛、羽毛和树叶)以及整体上更连贯、更符合真实数据流形的输出。
CNS(我们的方法)
SDE
ODE
CNS(我们的方法)
SDE
ODE
CNS(我们的方法)
SDE
ODE
CNS(我们的方法)
SDE
ODE
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org