i1:面向强文生图模型的简单且完全开源配方
i1: A Simple and Fully Open Recipe for Strong Text-to-Image Models
i1 是一个 3B 参数的文本到图像扩散模型,仅使用公开数据集训练。在 GenEval、DPG、PRISM、CVTG-2K 和 LongText 五个基准上,i1 性能与领先模型相当,平均比最佳现有完全开源模型高 29.5 个百分点。研究基于 300 余项控制实验(超 700K TPU v6e 小时),发现等权重混合 curated 数据集是强默认配置、更大文本编码器适配器以极少参数提升性能。i1 的检查点、训练与推理代码及数据处理流程已全部开源。
i1 是第一个用全公开数据、完全开源代码/权重/数据管线打造的 3B 模型,直接把全开放模型的性能拉到可与闭源竞争,对做文生图研究的同行是个扎实起点。
-
扩散模型持续推动着文生图领域的进步。然而,要将近期进展归因于具体的建模与数据选择颇具挑战:最先进的开源权重模型提供的消融研究有限,且不公开其训练数据与完整训练细节。研究社区需要完全开放(权重、数据与代码)的模型作为进一步研究的基础;然而现有完全开放的模型在性能上仍与领先模型存在显著差距。在本项目中,我们通过 300 余次受控实验(总计 70 万以上 TPU v6e 小时)对文生图扩散训练与推理中的建模及数据设计选择进行了系统性研究。我们的实验凸显了若干实证发现(例如,等权重混合是整合精选数据集的强默认方案)以及训练强模型的简单设计决策(例如,更大的文本编码器适配器能以极少的额外参数提升性能)。在这些洞见的指导下,我们训练了 i1——一个仅使用公开数据集的 3B 参数文生图扩散模型。i1 在五个代表性基准(GenEval、DPG、PRISM、CVTG-2K 和 LongText)上与领先模型不相上下,并在平均得分上以 29.5 个绝对百分点超越现有最佳完全开放模型。我们提供 i1 的检查点、训练与推理代码以及数据处理流程。综合来看,我们的发现与 i1 配方为未来文生图扩散模型的开放研究奠定了实践基础。
![]() | ![]() | ![]() |
![]() | ![]() | ![]() |
![]() | ![]() | ![]() |
![]() | ![]() | ![]() |
![]() | ![]() | ![]() |
![]() | ![]() | ![]() |
![]() | ![]() | ![]() |
![]() | ![]() | ![]() |
目录
第 1 节 引言
自 DALL-E 2(ramesh2022hierarchical)、Imagen(saharia2022photorealistic)和 Stable Diffusion(rombach2022high)等早期模型以来,基于扩散的模型凭借其生成具有精细细节的照片级逼真图像的强大能力,推动了文生图领域的重大进展(wu2025qwen; labs2025flux; cai2025z; gao2025seedream)。然而,尽管当今最先进的模型具备卓越能力,但往往很难厘清究竟是哪些建模和数据选择真正推动了性能提升。这种不清晰源于两个因素。
首先,领先模型通常不会公开其训练数据和完整的训练方案(wu2025qwen; cai2025z; qin2025lumina; cai2025hidream),即使它们公开发布了模型检查点。这限制了可复现性,也阻碍了受控分析以及在其设计基础上开展的后续工作。虽然存在完全开源(权重、数据和代码)的模型(chen2025blip3; chen2025blip3o; ma2026deco; wang2026pixnerd),但它们在性能上与领先模型仍有较大差距。
其次,领先模型往往没有对其设计选择进行彻底的消融研究(wu2025qwen; cai2025z; cai2025hidream; gao2025seedream; ryu2025flite; fang2026flux)。在实践中,许多模型将大量的架构、训练和数据决策捆绑在单一配方中,使得难以将性能提升归因于任何特定因素。因此,现代文生图扩散模型在许多重要设计选择上仍缺乏共识(例如,使用单一文本编码器(qin2025lumina; wu2025qwen)与使用多个文本编码器(esser2024scaling; cai2025hidream)之争)。
为了更深入地理解现有及新的架构与数据设计对文生图扩散模型的影响,我们进行了一系列受控实验,主要聚焦于 256x256 低分辨率预训练阶段。从一个简单的基线模型(yao2025reconstruction)出发,我们首先探索了从文本编码器引入文本条件以及噪声/时间步条件(sun2025noise)的策略。接着,我们确定了能带来更强性能的主干架构设计(bao2023all; esser2024scaling)。最后,我们比较了高质量图文数据集策展和推理时提示词增强方面的设计选择,以及图像数据集混合策略。
在建模方面,我们发现:(1)使用带有更大适配器的单一强文本编码器可能比组合多个文本编码器更有效;(2)在我们的设定下,时间步/噪声条件化以及自适应层归一化(peebles2023scalable)对文生图任务的收益甚微;(3)带有长跳跃连接(bao2023all)的双流 DiT(esser2024scaling)是一种强健的主干架构设计。
在数据方面,我们发现:(1)使用长描述训练得到的模型比使用短描述训练的模型更强,但在短提示词上表现不佳,这一问题可以通过推理时的提示词改写来缓解;(2)合成描述生成器的选择对下游性能很重要;(3)在混合精选数据集时,对每个数据集按重复次数计数、训练等量图像(下文简称“跨数据集等权加权”)是一个强默认方案;(4)在数据集多样混合的情况下,重复训练数据只会带来轻微的性能下降;(5)要让低分辨率模型获得强高分辨率生成能力,并不需要广泛的高分辨率数据覆盖。
为了给未来的开放研究提供强基线,我们利用受控实验的洞察,在公开数据集上训练了 i1——一个 3B 参数的文生图扩散模型。在 1024 分辨率下,i1 在完全开放模型中达到了最先进水平,并在多个代表性基准上超越了若干参数量大得多的领先开放权重模型(例如 17B 的 HiDream-I1 (cai2025hidream) 和 12B 的 FLUX.1 [Dev] (labs2025flux))。
i1 表明,仅使用中等规模、公开可用的图像数据集即可实现强劲性能,并凸显了仔细探索设计空间的价值:如图 4 所示,i1 并未引入显著的全新网络模块,而是识别出先前工作中存在但未被充分利用的设计(例如长跳跃连接),并对标准组件进行了简单修改(例如使用更大的文本编码器适配器)。我们提供模型权重、代码、数据集以及详细的模型训练和评估方案。综合来看,我们的发现与 i1 方案为开放文本到图像研究奠定了实践基础,既提供了强大的全开放基线,也为构建更强大模型提供了设计洞见。
第 2 节 预备知识
在本节中,我们提供理解并推动受控实验设置(第 3 节)以及后续建模与数据设计实验(第 4 节和第 5 节)所需的术语和背景,重点关注骨干架构、文本与噪声条件机制,以及现有的开放训练数据方案。
文本到图像骨干架构
尽管存在其他替代范式(chang2023muse;sun2024autoregressive;zhou2024transfusion),但大多数领先的文生图系统仍采用基于流匹配(lipman2022flow)训练的扩散Transformer(DiT)架构(peebles2023scalable)。根据文本特征的融入方式不同,近期的扩散模型大致可分为三类:交叉注意力模型(chen2024pixart;xie2025sana;ryu2025flite)、单流模型(qin2025lumina;cai2025z;chen2025dit)以及双流MMDiT模型(esser2024scaling;wu2025qwen)。交叉注意力模型通过交叉注意力层注入文本嵌入向量,而单流和双流模型则将图像与文本的token序列拼接在一起。双流模型对图像和文本token分别使用模态专属的注意力与MLP参数,而单流模型则在各模态间共享注意力与MLP参数。长跳跃连接是一种在早期层与后期层之间添加捷径的架构改进方式,在早期工作(bao2023all)中已有探索,但并未在现代文生图模型中得到广泛应用。
文本与噪声条件机制
在近期模型中,输入提示词由一个(cai2025z;qin2025lumina;wu2025qwen)或多个(esser2024scaling;cai2025hidream)文本编码器进行编码。得到的文本特征通常会经过一个线性(labs2025flux;cai2025hidream;wu2025qwen;cai2025z)或 MLP(xie2025sana)适配器,将其映射到扩散模型的隐藏维度。在各种骨干架构中,自适应层归一化(AdaLN)(peebles2023scalable)通常用于注入时间步信息。AdaLN 学习从时间步嵌入到注意力与 MLP 输入的缩放因子和偏移因子,以及其输出的门控因子的线性投影。在某些模型中,时间步嵌入会先与池化后的文本嵌入进行逐元素相加,再用于 AdaLN 条件化(esser2024scaling;cai2025hidream;labs2025flux)。
开放的文生图数据方案
许多领先模型(wu2025qwen;cai2025z;qin2025lumina;cai2025hidream;labs2025flux)公开了其权重,但未披露其训练数据方案。除少数模型(qin2025lumina;ryu2025flite)外,即便是训练数据集的来源和规模也仍未公开,这限制了开放研究社区对如何构建高质量文生图训练数据的理解。完全开放的模型(chen2025blip3;chen2025blip3o;sehwag2025stretching;ma2026deco;tong2026scaling;wang2026pixnerd)在整体上仍逊色于领先系统,且其数据集通常来自相似且有限的一组来源(例如 JourneyDB(sun2023journeydb)、SA-1B(kirillov2023segment)和 CC12M(changpinyo2021conceptual))。此外,完全开放的数据方案很少探索数据平衡技术。
第 3 节 受控实验的基线
在扩展第 2 节中介绍的现有设计的基础上,我们在第 4 节和第 5 节中通过 256 分辨率预训练阶段的受控实验来研究文生图扩散模型的设计空间。对于每组实验,我们都从相同的强基线出发,并独立地改变单一设计选择(即,修改不会跨实验累积)。能够提升性能的设计随后会在第 6 节中组合起来,以构建我们的最终模型 i1(见图 21)。我们在下面描述基线设置,在图 5 中提供高层示意图,并在附录 A.2 中绘制详细架构。
模型
。如图 5 所示,我们的骨干架构基于 LightningDiT-XL/2(yao2025reconstruction)。LightningDiT 是一种现代 DiT 架构(peebles2023scalable),融合了常见的性能提升设计(例如 RoPE(su2024roformer)、RMS Norm(zhang2019root)、SwiGLU FFN(shazeer2020glu))。我们添加了 QK-norm(dehghani2023scaling)以稳定训练。为确保后续消融实验能与强基线进行比较,我们还应用了长跳跃连接(bao2023all)(见第 2 节),这是一种不太常用的设计,我们将在第 4.2 节中重新审视它,并发现它对性能有帮助。
默认情况下,我们使用交叉注意力来注入文本嵌入。在部分实验中,我们还在骨干网络的单流和双流变体(见第 2 节)上进行了额外验证,以确保我们研究结论的普适性。我们使用 AdaLN 将模型条件建立在时间步嵌入与池化文本嵌入之和上,其中池化文本嵌入通过对文本嵌入 token 求平均得到。对于单流架构,我们遵循 Lumina-Image 2.0(qin2025lumina)的做法,在骨干网络前添加两个特定模态的精炼器模块。对于单流和双流骨干网络,我们都采用 Multimodal-RoPE(wang2024qwen2)。默认情况下,我们使用 T5Gemma-2B 的编码器部分作为文本编码器,并使用 FLUX.2 VAE。
ImageNet-22K![]() ![]() ![]() | YFCC![]() ![]() ![]() | RedCaps![]() ![]() ![]() | Megalith![]() ![]() ![]() |
Places![]() ![]() ![]() | Pexels![]() ![]() ![]() | iNaturalist![]() ![]() ![]() | FLUX-Reason![]() ![]() ![]() |
Midjourney v6![]() ![]() ![]() | GPT-Edit![]() ![]() ![]() | TextAtlas![]() ![]() ![]() | RenderedText![]() ![]() ![]() |
数据
我们仅使用公开可用的图像数据集,包括 7 个真实图像数据集(ImageNet-22K (deng2009imagenet)、YFCC100M (thomee2016yfcc100m)、RedCaps (desai2021redcaps)、Megalith (BoerBohan2024Megalith10m)、Pexels (Narugo2024PexelsTaggerV0)、iNaturalist 2024 (vendrow2024inquire)、Places365-Challenge 2016 (zhou2017places))、3 个合成数据集(GPT-Image-Edit-1.5M (wang2025gpt)、FLUX-Reason-6M (fang2026flux) 和 Midjourney v6 (CortexLM2024MidjourneyV6)),以及 2 个文本渲染数据集(RenderedText (Wendler2024RenderedText) 和 TextAtlas (wang2025textatlas5m))。默认情况下,我们不加权重地简单合并这些数据集中的 1.68 亿张图像(这一设计选择我们将在第 5.2 节中重新讨论)。在预训练中,所有图像均被中心裁剪为正方形并调整大小至 256×256。我们在图 6 中展示了每个数据集的示例图像。我们使用 Qwen3-VL-30B-A3B (bai2025qwen3) 以 FP8 精度为每张图像生成一条长合成标题,提示词为“用一段话详细描述该图像。”(该视觉语言模型接收的图像会被中心裁剪为正方形,若大于 512×512 则调整大小至 512×512)。更多信息见附录 E。
| 基线变体 | DPG | PRISM | LongText |
| 交叉注意力 | 84.66 | 56.4 | 0.211 |
| 单流 | 85.89 | 55.6 | 0.293 |
| 双流 | 86.82 | 58.3 | 0.439 |
训练与推理
我们使用流匹配(lipman2022flow)目标函数训练模型,共训练 50 万次迭代(即最终 i1 模型 200 万步、256 分辨率预训练阶段的 25%),批大小为 512,学习率为 1e-4。采样时使用 250 步欧拉积分器,无分类器引导(ho2022classifier)尺度为 12。更多细节见附录 A.1。
提示词:在一张反光的金属桌上,有一个色彩鲜艳、带有花卉图案的手提包,旁边是一个刚切开的牛油果……餐具和一个透明的玻璃水瓶整齐地摆放在牛油果旁边……(77 词)

提示词:Lindsey Wixson 自信地站在一片金色麦田中,头戴宽檐草帽,戴着醒目的红色太阳镜,身着饰有红色毛绒镶边的鲜艳上衣,搭配一条闪耀的钻石项链,尽显夏日优雅。

提示词:一款名为“DailyFlow”的生产力与习惯追踪应用的优雅、专业外观移动界面。顶部醒目位置是应用名称,采用粗体圆润字体,配色为舒缓的蓝绿色……(170 词)

评估
我们使用三个广泛采用的基准测试来为我们的受控实验提供信号:DPG-Bench (hu2024ella)、PRISM-Bench (fang2026flux) 和 LongText-Bench (geng2025x)。这三个基准测试均使用 VLM 作为评估器。DPG 和 PRISM 衡量跨多样提示词的细粒度提示词遵循能力,其中 PRISM 还额外评估图像美学。LongText 专门评估文本渲染能力。我们在图 7 中展示了每个基准测试的示例提示词。对于 DPG 和 LongText,我们使用原始提示词,并使用第 5.1 节中的简单元提示词,通过 Qwen3-4B (yang2025qwen3) 重写了 PRISM 的提示词。表 1 报告了我们的基线模型在这些基准测试上的表现。
第 4 节 建模
我们研究了对第 3 节中引入的基线模型进行的建模设计修改。我们首先重新审视文本和噪声条件化机制,包括多个文本编码器和 AdaLN,并识别出更强的替代设计方案。随后,我们探索了主干网络架构的选择。更多结果见附录 C。
4.1 文本与噪声条件化
现有方法已经探索了将文本和噪声条件融入骨干扩散模型的各种方式。有些方法使用单一文本编码器(cai2025z;qin2025lumina;wu2025qwen),而另一些方法则拼接来自多个文本编码器的特征(esser2024scaling;cai2025hidream)。此外,噪声水平的嵌入向量通常通过 AdaLN 注入模型(peebles2023scalable),有时还会与池化文本嵌入一起注入(esser2024scaling;cai2025hidream;labs2025flux)。我们研究了这一广泛的设计空间,并表明,与其组合多个编码器,不如使用一个带有更大适配器的单一强文本编码器更为有利。我们还发现,基于 AdaLN 的噪声水平和池化文本嵌入条件化对于文生图模型可能并非必要。
文本编码器
。早期模型(例如 SD 1.5(rombach2022high))主要使用 CLIP 风格的文本编码器。后来的模型采用了编码器-解码器模型 T5(raffel2020exploring;esser2024scaling;cai2025hidream)。最近,模型通常使用仅解码器的大语言模型或视觉语言模型(wu2025qwen;qin2025lumina),这一趋势通常归因于它们强大的推理能力和复杂指令遵循能力(xie2025sana)。
在此,我们比较了(1)一种现代基于 CLIP 的编码器(FG-CLIP 2 (xie2025fg)),(2)两个现代编码器-解码器模型家族,T5Gemma (zhang2025encoder) 和 T5Gemma2 (zhang2025t5gemma),(3)一个现代仅解码器 LLM 家族(Qwen3 (yang2025qwen3)),以及(4)一个现代仅解码器 VLM 家族(Qwen3-VL (bai2025qwen3))。除非另有说明,我们在可用时使用指令微调检查点,否则使用相应的基础检查点。图 8 报告了使用每个模型作为文本编码器的文生图性能(其他设置下的比较见附录 C.3 和 C.4)。
我们观察到指令微调的影响很小(例如,T5Gemma-2B 与 T5Gemma-2B(基础版)相比),且更大的模型不一定表现更好(例如,T5Gemma-2B 与 T5Gemma-9B 相比)。最重要的是,编码器-解码器模型(T5Gemma 和 T5Gemma2)取得了最佳的整体性能,优于 FG-CLIP 2 以及仅解码器的 LLM 和 VLM。这引出了影响我们设计的第一个发现:
组合文本编码器
许多近期模型(esser2024scaling;cai2025hidream)会结合来自多个编码器(如 CLIP、T5 和大语言模型)的文本特征。在此,我们实验了图 8 中所评估文本编码器的不同组合方式。以往工作采用不同策略来融合不同编码器产生的嵌入向量(例如沿嵌入维度拼接与沿序列维度拼接)。在本工作中,我们沿序列维度拼接文本特征,并为每个编码器使用独立的适配器,以适应它们各自不同的嵌入维度。这避免了将文本特征填充到统一序列长度的需要——而沿嵌入维度拼接特征时,这种填充往往是必需的。
我们将图 8 中最强的文本编码器之一 T5Gemma-2B 与另一个编码器组合。如表 2 所示,将其与 T5Gemma2-1B 或 FG-CLIP 2 组合可获得最佳性能。然而,将三者(T5Gemma-2B、T5Gemma2-1B 和 FG-CLIP 2)同时组合并未带来进一步的显著提升。
| 类型 | T5G-2B | T5G2-1B | T5G2-4B | Qwen3-VL-2B | FG-CLIP 2 | DPG | PRISM | LongText |
| 基线 | ✓ | 84.66 | 56.4 | 0.211 | ||||
| +1 编码器 | ✓ | ✓ | 85.62 | 58.4 | 0.303 | |||
| ✓ | ✓ | 84.86 | 55.8 | 0.270 | ||||
| ✓ | ✓ | 84.80 | 57.4 | 0.264 | ||||
| ✓ | ✓ | 85.72 | 57.7 | 0.285 | ||||
| +2 编码器 | ✓ | ✓ | ✓ | 85.37 | 58.8 | 0.272 | ||
| ✓ | ✓ | ✓ | 85.28 | 58.1 | 0.351 |
尽管组合文本编码器能提升性能,但这种提升究竟是源于不同编码器提供的多样化表征,还是仅仅来自序列长度增加以及适配器引入的额外参数?为探究这一问题,我们构建了两个基线,对 T5Gemma-2B 文本嵌入进行重复:第一个基线对两份相同的嵌入副本使用两个独立的适配器(从而同时增加序列长度和适配器参数),第二个基线则使用共享适配器(从而仅增加序列长度)。如表 3 所示,使用两个独立适配器重复嵌入带来了显著提升,而使用共享适配器得到的结果与不重复的基线相近。这表明,组合多个文本编码器带来的增益可能主要来自额外的适配器,而非多样化的文本编码器特征或更长的序列。
| 文本编码器 | DPG | PRISM | LongText |
| T5Gemma-2B | 84.66 | 56.4 | 0.211 |
| 使用 1 个 MLP 重复 | 84.93 | 55.8 | 0.225 |
| 使用 2 个 MLP 重复 | 85.09 | 56.5 | 0.309 |
我们通过比较两个 MLP 适配器在 DPG-Bench、PRISM 和 LongText 提示词上生成的嵌入向量,来验证这两个适配器确实学习到了不同的特征。我们计算每个 token 在两个嵌入向量之间的余弦相似度,并对每个提示词的所有 token 取平均。如图 9 所示,得到的分布大部分为负值,表明这两个适配器确实捕捉到了不同的表征。
更大的文本编码器适配器
为了进一步验证“组合多个文本编码器带来的性能提升主要源于额外的适配器参数,而非多样化的文本编码器特征”这一假设,我们将默认设置(第 3 节)中使用的小型 MLP 适配器(2.6M 参数)替换为与主干模块同宽度的更大规模 Transformer 适配器(17.2M 参数/模块)。如图 10 所示,尽管参数量仅略有增加,但提升适配器容量在所有主干架构上均持续带来性能改进。不过,将适配器扩展到两个 Transformer 模块以上,只能带来极为有限的额外增益。
此外,如表 4 中“默认”和“+2 编码器”两行所示,当使用更大的适配器时,组合多个文本编码器在所有主干上带来的增益都大幅缩小,尤其是在 DPG 和 PRISM 上。这进一步表明,多个文本编码器的收益可以通过为单个文本编码器增加适配器容量来实现。重要的是,使用多个编码器会增加文本序列长度,从而大幅提高内存和计算成本,而使用更大的适配器则不会带来这些开销。
| MLP 适配器(默认) | Transformer 适配器(1x 模块) | ||||||||
| 参数量 | DPG | PRISM | LongText | #params | DPG | PRISM | LongText | ||
| cross-attn | |||||||||
| 默认 | 0.89B | 84.66 | 56.4 | 0.211 | 0.91B | 86.33 | 58.7 | 0.414 | |
| +2 个编码器 | 0.90B | 85.37 0.71 | 58.8 2.4 | 0.272 0.061 | 0.94B | 86.47 0.14 | 59.5 0.8 | 0.491 0.077 | |
| 无池化嵌入 | 0.89B | 85.98 1.32 | 57.5 1.1 | 0.391 0.180 | 0.91B | 86.37 0.04 | 59.4 0.7 | 0.446 0.032 | |
| 无时间步 | 0.89B | 82.58 2.08 | 54.7 1.7 | 0.185 0.026 | 0.91B | 84.71 1.62 | 58.9 0.2 | 0.418 0.004 | |
| 无 AdaLN | 0.66B | 84.99 0.33 | 57.4 1.0 | 0.351 0.140 | 0.67B | 85.13 1.20 | 59.7 1.0 | 0.413 0.001 | |
| 单流 | |||||||||
| 默认 | 0.82B | 85.89 | 55.6 | 0.293 | 0.83B | 87.64 | 60.0 | 0.472 | |
| +2 个编码器 | 0.83B | 84.89 1.00 | 56.3 0.7 | 0.439 0.146 | 0.87B | 87.29 0.35 | 59.0 1.0 | 0.428 0.044 | |
| 无 AdaLN | 0.57B | 87.38 1.49 | 59.0 3.4 | 0.390 0.097 | 0.58B | 87.39 0.25 | 59.5 0.5 | 0.410 0.062 | |
| 双流 | |||||||||
| 默认 | 1.24B | 86.82 | 58.3 | 0.439 | 1.25B | 87.67 | 60.7 | 0.576 | |
| +2 个编码器 | 1.25B | 87.34 0.52 | 59.6 1.3 | 0.514 0.075 | 1.29B | 87.76 0.09 | 60.8 0.1 | 0.588 0.012 | |
| 无 AdaLN | 1.01B | 87.82 1.00 | 60.3 2.0 | 0.508 0.069 | 1.02B | 87.38 0.29 | 60.7 0.0 | 0.554 0.022 | |
移除 AdaLN 条件化
自适应层归一化(AdaLN)(peebles2023scalable)是现代文生图扩散模型(labs2025flux; wu2025qwen; qin2025lumina; cai2025hidream)中的标准组件。它通常用于将时间步嵌入和池化文本嵌入注入主干网络。近期一项研究(sun2025noise)表明,在类别条件图像生成中,移除噪声条件化对性能的影响极小,尤其是对于流匹配模型。如果移除 AdaLN 而不损害性能,模型将变得更加参数高效。
有趣的是,如表 4 所示,当文本编码器适配器是小型 MLP 时,从默认设置(第 3 节)中移除 AdaLN 能持续提升性能。然而,当使用更大的 Transformer 适配器时,这种影响会变得小得多。为了更好地理解这一行为,我们在交叉注意力主干网络上进行了额外的消融实验,其中 AdaLN 仅以池化后的文本嵌入或仅以时间步嵌入为条件,而非两者的加和。我们使用小型和大型适配器分别评估了这些变体。
我们发现,当适配器较小时,AdaLN 以池化后的文本嵌入为条件会降低性能(DPG 上从 84.99 降至 82.58),但当适配器较大时,其影响要小得多(DPG 上从 85.13 降至 84.71)。这表明,移除 AdaLN 带来的性能提升可能主要源于小型 MLP 适配器下学习到的特征不佳。然而,即使使用更大的适配器,通过 AdaLN 以池化后的文本和时间步嵌入为条件,仍然只能带来边际性的额外收益。
4.2 主干网络架构
在本小节中,我们重新审视了长跳跃连接设计,并基于第 3 节的基线设置,对主流主干网络家族进行了受控对比。我们在附录 C.1 和 C.2 中提供了关于位置嵌入、归一化和 VAE 的额外分析。
长跳跃连接
在早期层与后期层之间添加捷径连接。这类连接最初由 U-Net(ronneberger2015u)推广,后来被应用于 U-ViT(bao2023all)中的扩散模型。尽管已有研究证明它们能提升性能(bao2023all; li2024hunyuan; liu2024playground),但尚未被广泛用于现代文生图模型。在图 11 中,我们重新审视了这一设计,在多种模型宽度(1152、1296、1440、1584 和 1728)下,分别训练了带与不带长跳跃连接的基线(第 3 节)双流变体,同时保持所有其他配置不变。我们发现,长跳跃连接在不同模型规模下均能持续提升性能,这可能归因于模型表达能力的增强。基于 FLOPs 的进一步分析见图 44,其他骨干网络上的结果见附录 C.7。
骨干网络家族
当前领先的模型在骨干网络的选择上各不相同:有的使用交叉注意力,有的使用单流架构,还有的使用双流架构(详见第 2 节)。我们在多种模型宽度(三种骨干网络家族均采用 1152、1296、1440、1584 和 1728)下,保持所有其他模型配置不变,分别测量了交叉注意力、单流和双流骨干网络的模型性能。图 12 绘制了模型性能与参数量的关系。我们观察到,双流骨干网络在性能与参数量的权衡上表现最佳。
第 5 节 数据
除了建模架构之外,高质量的图像-标题数据对于文生图训练也至关重要。在本节中,我们首先研究合成标题的设计方案,并表明在长标题上训练能产生更强的模型,但可能导致在短提示词上表现不佳,我们通过在推理时进行提示词重写来缓解这一问题。随后我们探索数据集混合,并发现跨数据集等权加权是一个稳健的默认选择。
5.1 合成标题与提示词重写
文生图模型的提示词遵循能力从根本上依赖于训练数据中高质量的图像-标题对。早期工作,如 Parti(yu2022scaling)和 DALL-E 3(betker2023improving),表明在由视觉语言模型生成的高描述性合成标题上进行训练可以大幅提升性能。此后,大多数文生图模型(chen2024pixart; esser2024scaling; qin2025lumina; xie2025sana)都在训练中利用了合成标题。
在此,我们探索了合成标题生成中的若干设计选择及其对模型性能的影响(更多结果见附录 D.1)。特别是,我们发现基于长合成标题训练能产生更强的模型,但这些模型在短提示词上可能表现不佳,因此需要在推理时进行提示词重写。为降低标题生成的计算成本,本节所有实验均在 ImageNet-22K 数据集上进行,而非默认基线设置(第 3 节)中使用的完整训练集。
为了探究字幕质量如何影响下游文生图性能,我们使用五个视觉语言模型(VLM)生成字幕:Qwen2-VL 2B、Qwen2.5-VL 3B、Qwen3-VL-2B、Qwen3-VL-4B 和 Qwen3-VL-30B-A3B。如图 13 所示,合成字幕生成器的选择对下游文生图性能有显著影响。我们注意到,LongText 上的微小差异主要归因于在 ImageNet-22K 上训练的模型整体文本渲染性能较差,因为该数据集包含的文本丰富图像较少。因此,这一结果并不意味着字幕生成器质量对于文本渲染不重要。
默认情况下,我们仅使用长合成字幕训练模型(见第 3 节)。虽然我们的模型在原始 DPG 和 LongText 提示词上能取得强劲性能,但在原始 GenEval 提示词上表现不佳。我们发现,这可能是因为 GenEval 中的提示词比 DPG 和 LongText 短得多(见图 35):仅将 GenEval 提示词重复 12 次就能带来性能的大幅提升(0.17 到 0.49)。这一观察结果表明,在原始、较短的 GenEval 提示词上表现不佳,可能源于仅使用长字幕进行训练。
为了进一步理解这一点,我们使用提示词“用一句话描述这张图片”生成了一组额外的短描述。提示词长度的分布如图 14 所示。我们使用不同的采样权重将这些短描述与原始长描述混合,并在表 5 中报告由此得到的 GenEval 分数。我们观察到:(1) 主要使用短描述进行训练(例如,长描述占比为 0% 或 20%)可以提高模型在原始短 GenEval 提示词上的表现;(2) 当 GenEval 提示词被重复时,使用较高比例长描述训练的模型表现更好。
| 训练描述中长描述所占百分比 | 在 GenEval 提示词上的表现 | ||||
| 原始提示词(短) | 重复提示词 | 改写后的提示词(长) | |||
| 4 | 12 | 20 | |||
| 0% | 0.47 | 0.55 | 0.34 | 0.24 | 0.60 |
| 20% | 0.47 | 0.54 | 0.53 | 0.50 | 0.67 |
| 40% | 0.35 | 0.59 | 0.55 | 0.54 | 0.70 |
| 60% | 0.37 | 0.60 | 0.57 | 0.54 | 0.73 |
| 80% | 0.26 | 0.57 | 0.54 | 0.47 | 0.73 |
| 100% | 0.17 | 0.48 | 0.49 | 0.46 | 0.73 |
虽然重复短提示词可以恢复性能,但会引入不自然的提示词结构。为解决这一问题,我们改用 LLM(Qwen3-4B)并采用以下元提示词对 GenEval 提示词进行重写:
“我有一个简短的文生图提示词 {prompt}。请将其扩展为一段描述性文字,同时确保生成的图像仍清晰包含原始提示词中提到的所有物品。请只输出重写后的提示词,不要输出其他内容。”
如表 5 最右列和图 15 所示,改写 GenEval 提示词可显著提升模型性能。值得注意的是,使用长描述进行训练并在改写后的提示词上评估(0.73)明显优于使用短描述训练并在原始、重复或改写后的提示词上评估。这表明,即使推理提示词原本较短(例如 GenEval),也更适合使用长描述进行训练,并通过提示词改写等方式将推理提示词长度提升至与训练分布相匹配,而不是使用短描述训练以匹配原始推理提示词的长度。
| 提示词:一张酒杯和一只熊的照片 | ![]() | ![]() | ![]() | ![]() |
| 提示词:一张停车计时器右侧斑马的照片 | ![]() | ![]() | ![]() | ![]() |
| 训练:短描述,测试:原始(短)提示词 | 训练:长描述,测试:原始(短)提示词 | 训练:长描述,测试:重复 12 次(长)提示词 | 训练:长描述,测试:改写后(长)提示词 |
5.2 数据混合
到目前为止的所有实验都是将所有数据集朴素地组合在一起,没有进行显式的数据集层级加权。由于我们的训练语料库(见第 3 节)高度不均衡(例如,YFCC 在 168M 张图像中贡献了 98M 张),我们隐式地赋予了少数大型数据集更大的权重,这可能会主导训练信号。在本小节中,我们研究数据集组成和数据集层级重新加权如何影响性能。
数据集组成部分的贡献
为了理解每个数据集对性能的贡献,我们在每个数据集上分别训练一个模型。评估结果如图 16(a) 所示。在真实图像数据集中,ImageNet-22K 和 YFCC 取得了最佳的整体性能,而 iNaturalist 的表现则明显较差,这可能是由于其领域较为狭窄。FLUX-Reason 和 GPT-Edit 在 PRISM 上表现尤为出色。除 TextAtlas 外,每个数据集在 LongText 上的得分都很低,这与真实和合成数据集中包含文本的图像稀缺的情况一致。这表明文本渲染能力依赖于专门的高文本含量数据集。为了控制数据集规模的影响,我们进一步在每个数据集的随机 1M 子集上训练模型。如图 16(b) 所示,相对性能趋势与使用完整数据集时大体保持一致。
此外,我们测试了是否可以从基线(第 3 节)中移除真实、合成或文本渲染数据而不会损害性能。如图 17 所示,移除真实图像会损害 DPG,而移除合成图像会损害 PRISM。此外,LongText 性能与文本渲染数据的比例直接相关(“完整”为 10.4%,“移除真实”为 66.7%,“移除合成”为 10.9%,“移除文本”为 0%)。这些结果表明,这三组图像提供了互补的益处。
数据集等权加权
默认情况下(第 3 节),我们朴素地组合所有数据集,没有显式的数据集级加权,因此每个数据集的有效采样权重就是其图像数量。受 VLM 训练中限制单一来源数据点数量的数据平衡策略启发(tong2024cambrian),我们使用四个手工挑选的阈值来限制每个数据集的采样权重。图 18 中的结果表明,1.2M 的阈值(即对所有数据集赋予相同权重)实现了强大的整体性能。
鉴于数据集等权重的有效性(见图 18),我们进一步探索了两种简单变体。首先,我们在保持其余数据集等权重的同时,逐一移除低质量的真实数据集。表 6 显示,移除 iNaturalist 在所有基准测试上都带来了明显提升,而进一步移除其他真实数据集则没有带来实质性的改进。其次,在移除 iNaturalist 之后,我们测试是否应通过将某个数据集的权重提高 3 或 5 倍(同时保持其余数据集等权重)来强调该单一数据集。如图 19 和图 46 所示,提高任何单一数据集的权重都无法超越完全平衡数据集的性能。
| 数据集 | DPG | PRISM | LongText |
| 完整 | 85.14 | 58.2 | 0.335 |
| 移除 iNaturalist | 85.56 | 58.7 | 0.384 |
| 移除 iNaturalist + Megalith | 85.13 | 59.0 | 0.438 |
| 移除 iNaturalist + Megalith + Places | 85.18 | 57.9 | 0.453 |
数据规模
图 16 提供了初步证据,表明对数据集进行子采样通常对模型性能影响甚微。为了探究性能在多大程度上取决于训练集中独特图像的数量,我们还在 ImageNet-22K 的随机子集上进行了训练。如图 20 所示,尤其是在每张图像使用 5 条描述文本时,将子采样规模从 13.7M 缩小到 0.4M 图像仅会造成轻微的性能下降。只有当规模缩小到 0.1M 时,我们才观察到显著的性能下降。由于我们的 500K 步训练方案已经将完整的 ImageNet-22K 数据集重复了 18.7 次,这些结果表明,对于文生图扩散模型而言,使用更少的独特图像并更频繁地重复它们,可能不会显著损害性能。
| 每个数据集的子集规模 | 已见的独特图像数量 | DPG | PRISM | LongText |
| 完整 | 88.1M∗ | 85.56 | 58.7 | 0.384 |
| 1.0M | 11.0M | 85.34 | 57.7 | 0.384 |
| 0.4M | 4.4M | 84.67 | 57.7 | 0.382 |
| 0.1M | 1.1M | 84.71 | 57.4 | 0.349 |
我们进一步将单数据集上的数据子采样实验扩展到数据混合场景。具体而言,我们从一组数据混合开始,该混合对除 iNaturalist 外的 11 个数据集赋予相等权重。对于混合中的每个数据集,我们随机子采样,使其恰好包含 1.0M、0.4M 或 0.1M 张图像,同时保持各数据集之间的采样权重相等。由此得到的模型性能如表 7 所示。即使将每个数据集缩减至 0.4M 张图像(导致实际看到的唯一图像为 4.4M 张,而非 88.1M 张),各基准上的性能下降也微乎其微。这表明,在数据集混合多样的情况下,重复训练数据在文生图扩散模型训练中仅会造成边际性能损失。
第 6 节 i1-3B:全开放模型中的顶尖性能
在前面的章节中,我们探讨了能够提升文生图性能的建模与数据设计。基于这些洞见,我们训练了 i1——一个拥有 3B 参数的模型,它在多个代表性基准测试中与领先模型表现相当。¹¹¹ 我们还在额外训练一个 1B 模型,并将很快发布。在本节中,我们描述最终的预训练、高分辨率训练和推理设置与实验,并展示评估结果。
6.1 低分辨率预训练
模型
。i1 的架构如图 21 所示。它采用带有长跳跃连接的双流 MMDiT 主干、FLUX.2 VAE,并以 T5Gemma-2B 作为文本编码器,同时配备一个由两个 Transformer 块组成的大型适配器。i1 移除了所有 AdaLN 参数,因此不使用噪声条件化。此外,我们同时使用正弦和 RoPE 位置嵌入,并在文本与图像流之间共享三明治归一化(相应的对照实验见附录 C.1)。
数据
。我们使用第 5.2 节中确定的最佳数据混合方案,对 6 个真实图像数据集、3 个合成数据集和 2 个文本渲染数据集赋予相同权重。我们使用 Qwen3-VL-30B-A3B 为每张图像生成多条长合成标题。由于资源限制,我们为 ImageNet-22K、Pexels、RenderedText、GPT-Edit、RedCaps、FLUX-Reason、TextAtlas 和 Midjourney v6 每张图像生成五条合成标题,为 YFCC 每张图像生成两条,为 Places 和 Megalith 每张图像生成一条。
| 提示词:阿根廷足球巨星莱昂内尔·梅西在 2022 年 FIFA 世界杯决赛对阵法国队的激烈比赛中。他……即将用左脚射门……(240 词) | ![]() | ![]() | ![]() | ![]() |
| 提示词:一张引人注目的海报……宣布一场民谣音乐会活动……在顶部居中位置,印有诱人的标语“让原声旋律触动你的灵魂”……(109 词) | ![]() | ![]() | ![]() | ![]() |
| 10 万次迭代 | 20 万次迭代 | 50 万次迭代 | 200 万次迭代 |
训练。
我们将默认训练方案(第 3 节)中的训练迭代次数扩展到 200 万步,同时保持所有其他超参数不变。我们在 256 分辨率下训练 i1,直到性能在约 200 万步时趋于平稳,如图 22 所示。我们还在图 23 中展示了示例生成图像,并观察到基准测试的提升伴随着图像质量的改善。训练设置和计算资源的详细信息见附录 A.1。
6.2 高分辨率训练
数据与建模
为了构建 512 和 1024 分辨率的训练集,我们仅保留较短边分别至少为 512 或 1024 像素的图像。如果某个数据集经过筛选后的图像数量少于 30 万张,我们会完全移除该数据集(每个数据集的分辨率统计见附录 E.2)。基于我们在第 5.2 节中的发现,我们进一步将每个超过 100 万张图像的数据集二次采样至 100 万张,并为每个数据集分配相等的采样权重。在 1024 分辨率下,由于 RenderedText 数据集质量较低,我们将其丢弃(见图 16)。遵循 esser2024scaling 的方法,我们在 512 和 1024 分辨率训练期间执行位置索引插值和时间步调度偏移(详见附录 A.1)。
结果
我们在 512 分辨率下训练模型 0.5M 步,在 1024 分辨率下训练 0.3M 步。训练过程中的基准性能趋势见附录 A.1,最终 1024 分辨率检查点的评估见第 6.3 节。如图 24 所示,512 分辨率训练显著提升了 LongText 得分(0.75 提升至 0.92)。我们还在图 25 中用定性示例进一步展示了文本渲染方面的改进。
我们还研究了不同数据集组成部分对 512 分辨率训练的贡献。从 256 分辨率检查点出发,我们分别使用仅真实图像数据集、仅合成图像数据集或仅文本渲染数据集在 512 分辨率下训练独立模型。如图 24 所示,尽管这两个子集包含的富文本图像有限,但仅使用真实或合成图像数据集进行训练所获得的 LongText 提升与使用完整数据集训练相当。这表明,强大的高分辨率生成能力并不需要高分辨率训练数据来匹配低分辨率预训练数据的全部广度。
![]() | ![]() |
![]() | ![]() |
6.3 推理与评测
推理设置
在推理阶段,我们使用 CFG 缩放系数 12,并采用 Rescale CFG 技术(lin2024common),重缩放强度为 1。与以往针对特定基准采用提示词改写的方法(wang2024emu3; deng2025emerging; pan2025transfer)不同,我们使用单一的元提示词(详见附录 B.3)对所有输入提示词进行改写,以匹配训练时的提示词长度,其动机详见第 5.1 节。
评测基准
我们在近期图像生成模型技术报告中常用的五个代表性基准上对模型进行评估(cai2025z; qin2025lumina; cai2025hidream; cui2025emu3):GenEval(ghosh2023geneval)、DPG-Bench(hu2024ella)、PRISM-Bench(fang2026flux)、CVTG-2K(du2025textcrafter)和 LongText-Bench(geng2025x)。GenEval 聚焦于以物体为中心的图像生成,评估一组固定的物体属性及其关系。DPG-Bench 和 PRISM-Bench 对通用提示词遵循能力进行细粒度评估,其中 PRISM-Bench 还额外评估图像美学质量。CVTG-2K 和 LongText-Bench 则评估模型生成包含可检测文本且与输入提示词描述相符的图像的能力。
我们注意到,先前的研究已指出 GenEval 可能与人类判断不一致(kamath2025geneval),并且与人类感知的模型能力相关性较差(cao2025hunyuanimage)。此外,当前模型普遍采用在 BLIP3o-60K(chen2025blip3)上进行微调的做法(chen2025blip3; ma2026deco; wang2026pixnerd),这可能会虚增 GenEval 分数,因为研究发现 BLIP3o-60K 微调能显著提升 GenEval 分数,但对其他基准测试并无帮助(wu2025openuni)。因此,我们仅出于完整性考虑报告 GenEval 结果,并指出这些结果可能无法准确反映模型能力。
模型 #参数量 GenEval DPG-Bench PRISM CVTG-2K LongText-Bench 仅 API 调用 GPT Image 1 [High] (gptimage1) - 0.84* 85.15* - 0.8569* 0.956* Seedream 3.0 (gao2025seedream) - 0.84* 88.27* - 0.5924* 0.896* 仅开放权重 FLUX.1 [Dev] (labs2025flux) 12B 0.66* 83.84* 65.1 0.4965* 0.607* SD3 Medium (esser2024scaling) 2B 0.62* 84.08* 61.9 0.4037 0.322 Janus-Pro-7B (chen2025janus) 7B 0.80* 84.19* 60.0 0.0667 0.019* BAGEL (deng2025emerging) 14B 0.88* 85.44 61.8 0.3642 0.373* HiDream-I1-Full (cai2025hidream) 17B 0.83* 85.89* 66.1 0.7738 0.543* Lumina-Image 2.0 (qin2025lumina) 3B 0.73* 87.20* 63.5 0.1577 0.088 Z-Image (cai2025z) 6B 0.84* 88.14* 74.2 0.8671* 0.935* Qwen-Image (wu2025qwen) 20B 0.87* 88.32* 73.9 0.8288* 0.943* 开放权重 + 数据 + 训练代码 BLIP3o-4B (chen2025blip3) 4B 0.77 79.73 53.2 0.0353 0.023 PixNerd (wang2026pixnerd) 1B 0.73* 80.9* 53.3 0.0006 0.020 DeCo (ma2026deco) 1B 0.86* 81.4* 53.1 0.0014 0.003 BLIP3o-N-S (chen2025blip3o) 3B 0.87 81.98 56.8 0.2493 0.110 BLIP3o-N-G-G (chen2025blip3o) 3B 0.90 81.93 57.5 0.2442 0.114 BLIP3o-N-G-T (chen2025blip3o) 3B 0.86 79.77 56.8 0.3330 0.153 i1 (Ours) 3B 0.84 86.73 70.1 0.8531 0.922
结果
。我们在表 8 中将 i1 模型与领先的图像生成系统进行了比较。除 GenEval 外,i1 在全部五个基准测试中均达到了完全开放模型中的最先进水平。它还超越了多个仅开放权重的领先模型,包括 Lumina-Image 2.0、HiDream-I1 和 FLUX.1 [Dev]。i1 的强劲性能反映了本研究中识别出的建模与数据选择的综合效果。
第 7 节 讨论与结论
完全开放的配方支持累积式研究
在文生图建模领域。当前文生图研究面临的一个挑战是,强大的模型往往以不透明的接口形式发布,而非可作为科学产物进行检验。因此,进展往往难以归因于各种(可能未公开的)设计因素。我们的研究倡导完全开放的配方,力求理解哪些设计选择确实可靠地起作用。通过发布 i1 背后的模型、代码、数据配方和消融实验,我们旨在不仅提供一个强大的基线,也为更具累积性和可复现性的研究提供参考点。
强劲性能并不需要复杂的设计
近期文生图模型的强劲表现,可能会让人产生一种印象:前沿能力需要越来越专门的架构、专有数据或高度工程化的配方。我们的研究提供了一个反例:使用中等规模(例如 440 万,见 5.2 节)且公开可用的数据集,再加上对当前建模设计空间的细致探索,就能实现强劲性能。我们认为这对开放研究而言是令人鼓舞的,因为具有竞争力的文生图模型不必从无法获取的数据或未公开的训练流程起步。
局限性与未来工作
。这项工作存在若干局限性。首先,我们的评估主要依赖自动化基准测试,这些基准更强调指令遵循能力,而非人类偏好。因此,尽管 i1 在这些基准上接近领先的纯权重模型(例如 Qwen-Image),但其生成的图像在整体视觉质量上仍明显逊色(我们在附录 B.5 中展示了失败案例)。其次,由于资源限制,所有实验均使用约 3B 参数或更小的模型进行。需要进一步实验来确定我们的发现在更大规模下是否依然成立。第三,我们的探索仅覆盖了文生图扩散模型设计空间的一部分:诸如多宽高比训练222我们正在研发多宽高比模型,并将很快发布。、数据过滤(startsev2026alchemist)、用于文本编码的解码器专用 LLM 与扩散 Transformer 的深度融合(liu2024playground; shi2026lmfusion)以及强化学习(wallace2024diffusion; liu2026flow)等设计均未涉及。未来的工作可以将我们的方法扩展到更大规模的模型,并在保持整体流程简洁与开放的同时,进一步探索该设计空间。
致谢
我们衷心感谢 Google TPU 研究云(TRC)项目为本项目提供主要计算资源。此外,普林斯顿大学的普林斯顿研究计算资源也提供了额外支持,这些资源由以普林斯顿计算科学与工程研究所(PICSciE)和研究计算部门为首的多个团体联合管理。我们感谢 Liang-Chieh Chen、Ishan Misra、Kaiming He、Yida Yin、Haozhe Chen、Wenhao Chai、Linrong Cai、Linzhan Mou 和 Xingyu Fu 提供的宝贵讨论与反馈。我们还感谢 Yufeng Xu、Shengbang Tong、Yiyang Lu 和 Hanhong Zhao 在 TPU 方面的有益讨论。我们感谢 Cihang Xie 研究组分享他们的 JAX DiT 代码库,该代码库是我们研究的起点。
参考文献
附录
附录 A 实现细节
在本节中,我们提供关于模型和训练配置的更多细节。
A.1 配置
硬件
我们的模型训练和推理在 TPU v4、v5p 和 v6e 上使用 JAX(jax2018github)进行。基准评估在 NVIDIA A100、H100 和 H200 GPU 上执行。
通用配置
我们的默认基线模型大体沿用了此前扩散模型(peebles2023scalable;yao2025reconstruction)中使用的 XL/2 模型配置,即隐藏层大小为 1152、16 个注意力头、MLP 比例为 4.0、patch 大小为 2。不过与这些模型不同的是,我们使用了 29 层而非 28 层。默认情况下,在训练和推理过程中,我们将文本编码器保持为 bf16,而其余所有参数保持为 fp32。为确保模型能够装入内存,我们使用 JAX pjit/GSPMD(xu2021gspmd)在设备间对模型参数和优化器状态进行分片,采用 ZeRO 风格的全分片数据并行(rajbhandari2020zero)。
| 配置 | 取值 |
| 优化器 | Adam |
| 学习率 | 1e-4 |
| 权重衰减 | 0 |
| 优化器动量 | |
| 批大小 | 512 |
| 学习率调度 | 恒定 |
| 梯度裁剪 | 1 |
| 训练目标 | 流匹配 |
| 训练步数 | 500K |
| 训练时间步分布 | lognorm(0, 1) |
| 推理时间步偏移值(esser2024scaling) | 0.3 |
| 推理步数 | 250 |
| CFG 缩放(ho2022classifier) | 12 |
| CFG 重缩放强度(lin2024common) | 0 |
| CFG 区间(kynkaanniemi2024applying) | [0, 1] |
256 分辨率受控实验
表 9 汇总了第 4 节和第 5 节中所有受控实验的训练配置。所有模型均训练 500K 次迭代,但由于不同实验使用了不同的模型组件,训练时间有所差异。对于交叉注意力基线,在 TPU v6e-64 机器上完成 500K 步需要 31.0 小时。
| 训练阶段 | #图片数 | 训练步数 | 批大小 | 训练时间步偏移值(esser2024scaling) | TPU v5p-128 小时数 |
| 256 分辨率 | 162.9M | 2.0M | 512 | 不适用 | 383.0 |
| 512 分辨率 | 9.7M | 0.5M | 512 | 不适用 | 174.4 |
| 1024 分辨率 | 4.3M | 0.3M | 128 | 3.33 | 150.9 |
i1 训练
在表 10 中,我们详细列出了最终 i1 模型在每个训练阶段的训练配置和计算资源。所有未指定的配置均与表 9 保持一致。高分辨率训练阶段各迭代的基准性能趋势如图 26 所示。我们观察到,512 分辨率训练显著提升了 PRISM 和 LongText 上的性能,而 1024 分辨率训练的效果较小,性能与初始化时所基于的 512 分辨率检查点保持接近。对于 1024 分辨率训练,我们还将时间步偏移值为 3.33 训练的模型与未使用时间步偏移训练的模型进行了对比,发现应用训练时间步偏移能持续提升性能。

(a) 512 分辨率训练

(b) 1024 分辨率训练
A.2 基线架构
如第 3 节所述,我们在第 4 节和第 5 节中的受控实验均基于一个固定的基线架构。我们每次只改变一个设计选择,同时保持所有其他配置与基线一致。虽然我们在基线中默认使用交叉注意力主干,但我们还在单流和双流主干上额外验证了一些设计选择。在本节中,我们提供三种主干架构的图示。
交叉注意力主干
通过插入在自注意力和前馈网络层之间的交叉注意力层,将文本条件信息传递给主干。该架构如图 27 所示。
单流主干
沿序列维度将文本特征和带噪图像特征拼接起来,并使用一组主干权重处理整个序列。该架构如图 28 所示。
双流主干网络
将文本特征与带噪图像特征沿序列维度拼接,但对文本 token 和图像 token 使用各自独立的主干网络参数。该架构如图 29 所示。
A.3 文本编码器细节
模型版本
。对于所有 T5Gemma 模型,我们使用 UL2(tay2023ul)变体,因为它具有更好的编码器表征(zhang2025encoder)。对于 T5Gemma-9B 模型,我们使用带 2B 解码器的变体,而非带 9B 解码器的版本。对于 FG-CLIP 2 模型,我们使用“长”模式。
截断
。参照主流实现(esser2024scaling; blackforestlabs_flux2_2025; cai2025z; wu2025qwen),我们对文本分词器采用右侧截断。除 FG-CLIP 2 外,所有文本编码器均截断至 256 个 token;FG-CLIP 2 因其训练上限为 196 个 token,故截断至 196 个 token。
隐藏状态
。对于编码器-解码器模型(即 T5Gemma 和 T5Gemma2 系列),我们使用编码器最终层的隐藏状态作为文本 token 特征。对于仅解码器模型(即 Qwen3 和 Qwen3-VL 系列),我们使用最终 Transformer 层的最后隐藏状态作为文本 token 特征。默认情况下,我们将文生图提示词直接输入文本编码器以获取特征。此前部分工作(ma2024exploring; xie2025sana; wu2025qwen)对 LLM/VLM 文本编码器应用了系统提示词;我们在附录 C.4 中对系统提示词的效果进行了消融实验。
附录 B 推理与评估补充信息
B.1 与 Stable Diffusion 3 Medium 的定性对比
在图 2 和图 3 中,我们展示了由 i1 模型生成的精选示例图像。在图 30 和图 31 中,我们额外提供了四组精心挑选的模型生成示例,并与 Stable Diffusion 3 Medium 在相同提示词下生成的图像进行对比。
提示词:美国女演员维罗妮卡·莱克(Veronica Lake,1922-1973)坐在扶手椅上,身着白色围裙裙搭配红色衬衫,正专心致志地阅读一本书,营造出约1955年的场景氛围。
提示词:一间明亮、温馨的面包店内部,沐浴在温暖柔和的晨光中,一面质朴的木框黑板菜单醒目地倚靠在白色砖墙上,格外引人注目。黑板中央用大号优雅的手绘字体清晰写着“今日特供:酸面包与肉桂卷”。在这条中央信息正下方,较小的文字工整地标注着“每日清晨新鲜烘焙”。黑板右上角,以俏皮的草书字体轻轻写着“用心手作”。菜单边框周围,略带褪色、风格复古的麦穗与糕点插画若隐若现地环绕着文字,烘托出工匠面包店的氛围。主黑板旁立着一块较小的木牌,上面手写着“欢迎免费试尝!”,并配有一个装饰性箭头,引导顾客走向展示柜台。文字元素清晰、别致,且为自然的手写风格,传递出真实的手工艺质感,与面包店温馨宜人的氛围相得益彰。
提示词:一幅宁静的油画,题为《午夜月光》,作者 David Forks。画面捕捉了一位孤独的身影站在岩石海岸上,头顶是一轮明亮的满月,以戏剧性的光影和深蓝色调呈现,营造出沉思而富有氛围感的意境。
提示词:一张当代风格的艺术电影海报,采用极简而富有冲击力的文字排版。顶部中央,一行粗体、流畅字体的标题写着“The Last Voyage”,下方是一艘古老帆船在汹涌波涛中航行的微妙剪影。剪影正下方,一行稍小的文字呈现出一条引人入胜的标语:“当勇气意味着驶向未知”。海报下半部分中央,以清晰的水平排列整齐排布着多行文字,概述关键亮点:“由获奖导演 Alex Rivers 执导”、“主演 Emily Clarke 与 Jacob Bennett”、“原创音乐 Daniel Harper 倾情打造”。海报最底部,以简洁的大写字母清晰分隔排列,上映信息写着:“2023 年 10 月 6 日全球影院上映”。左下角有一行较小的斜体细线文字:“你敢于踏上这段旅程吗?”
B.2 在不同推理设置下评估其他模型
i1 的推理设置(见第 6.3 节)使用了 12 的 CFG 缩放系数,这高于许多现有文生图扩散模型的默认值。例如,PixArt-(chen2024pixart)使用的默认 CFG 缩放系数为 4.5,Lumina-Image 2.0(qin2025lumina)使用 4,SANA(xie2025sana)使用 4.5,Stable Diffusion 3(esser2024scaling)使用 7。此外,我们使用了一个自定义的元提示词用于推理时的提示词改写。这些选择可能会引发一个问题:我们的推理设置是否让我们的方法相比基线模型获得了不公平的优势。为了检验这一点,我们在替代推理设置下评估了 Lumina-Image 2.0 和 Stable Diffusion 3 Medium,包括更大的 CFG 缩放系数以及使用我们的元提示词改写的提示词(见附录 B.3)。结果如表 11 所示。我们发现,无论是增大 CFG 缩放系数还是使用改写后的提示词,都不能显著提升这两个模型的性能。
| 提示词 | CFG 缩放系数 | DPG | PRISM | LongText |
| 原始 | 4 | 87.20 | 63.5 | 0.088 |
| 8 | 87.39 | 60.7 | 0.100 | |
| 12 | 87.56 | 60.9 | 0.101 | |
| 16 | 87.84 | 58.6 | 0.107 | |
| 重写 | 4 | 85.37 | 63.1 | 0.092 |
(a) Lumina-Image 2.0
| 提示词 | CFG 缩放 | DPG | PRISM | 长文本 |
| 原始 | 7 | 84.08 | 61.9 | 0.322 |
| 8 | 85.49 | 61.2 | 0.341 | |
| 12 | 84.94 | 56.2 | 0.361 | |
| 16 | 82.82 | 50.1 | 0.368 | |
| 改写后 | 7 | 84.43 | 61.0 | 0.313 |
(b) Stable Diffusion 3 Medium
B.3 用于提示词重写的元提示词
在第 5.1 节中,我们发现,在短描述上训练会导致整体模型较弱,而在长描述上训练则能产生更强的模型,但会导致模型在短提示词上表现不佳。提示词重写可以通过扩展较短的推理提示词来缓解这种训练与推理之间的提示词长度不匹配问题,这使得在长描述上训练比在短描述上训练更可取,即使原始推理提示词较短也是如此。对于表 5 中的实验,我们使用了一个简单、极简的元提示词,将较短的 GenEval 提示词扩展为较长的提示词。
然而,始终指示提示词重写大语言模型扩展输入提示词可能并非最优方案,因为推理提示词的长度是可变的,甚至可能比训练描述还要长。因此,我们设计了一个更全面的元提示词,指示模型根据输入提示词的复杂度遵循两套不同的准则。在元提示词的末尾,我们还额外加入了 20 对人工编写的原始提示词与重写提示词作为上下文示例,以引导大语言模型。
元提示词(包括 20 个上下文示例)如下所示。
B.4 推理步数消融实验
在第 4 节和第 5 节的受控实验以及表 8 中对 i1 的评估中,我们将推理步数固定为 250。但我们注意到,模型要达到强性能并不一定需要 250 步。在图 32 中,我们使用 5、10、20 和 50 个推理步数评估了 i1 模型的性能,并在图 33 中展示了一个定性示例。我们观察到,可以将推理步数减少到低至 20 步,而不会显著损害生成质量。
| 10 | 20 | 250 |
![]() | ![]() | ![]() |
B.5 i1 的失败案例
尽管 i1 表现强劲,我们仍注意到 i1 存在若干重要的失败案例,如图 34 所示。如图 34(a) 所示,尤其是在群像场景中生成多个小人物的任务中,i1 有时会生成保真度较差的人脸、不自然的面部表情,以及畸形的手部或肢体。此外,i1 并不总能遵循物理规律,有时会生成物理上不合理的图像。图 34(b) 就提供了这样一个例子:i1 未能捕捉镜子的物理行为,因为倒影显示镜子与车窗平行,这在物理上是不一致的。
B.6 各基准测试的提示词长度分布
在图35中,我们可视化了i1最终评估所用基准的提示词长度分布(见表8)。我们观察到,GenEval的提示词比其他基准短得多。这促使我们在分析仅使用长描述训练模型在短提示词上表现不佳的问题时,将重点放在GenEval上,并研究相应的缓解技术(见第5.1节)。
附录C 建模设计的补充结果
在第4节中,我们通过受控实验得出了关于建模设计的若干结论。在此,我们在附录C.1和C.2中提供了额外的实验结果,这些结果支撑了最终i1模型中所采用的位置嵌入、归一化和VAE。在其余小节中,我们提供了额外的结果和分析,以在替代设置下验证我们在第4节中的发现。
C.1 位置嵌入与归一化
在我们的最终i1模型中,我们同时使用了正弦和RoPE位置嵌入,采用了三明治归一化,并在MMDiT的文本和图像流之间共享归一化层。下面我们描述促成这些设计选择的实验。
位置嵌入
当前文生图扩散模型通常只使用一种位置嵌入(例如正弦嵌入(esser2024scaling)或 RoPE(cai2025z;wu2025qwen;qin2025lumina))。受 LightningDiT(yao2025reconstruction)设计的启发,我们探索了将正弦嵌入与 RoPE 结合使用是否能提升扩散 Transformer 的文生图性能。如图 36 所示,将两者结合能够显著提升交叉注意力与双流模型在基准测试上的表现。因此,在我们最终的 i1 模型中,我们同时使用了正弦与 RoPE 两种位置嵌入。
归一化
尽管预归一化(xiong2020layer)(即对注意力模块和前馈网络模块的输入进行归一化)一直是扩散 Transformer 的主流选择,但更早的一项工作(ding2021cogview)引入了三明治归一化(即同时对注意力模块和前馈网络模块的输入与输出进行归一化)以稳定训练,该方法近期已被 Z-Image(cai2025z)采用。我们将三明治归一化引入基线模型(见图 37),发现它能够在不同主干架构与基准测试上稳定地提升性能。
| 模型 | DPG | PRISM | LongText |
| 共享归一化 | 86.82 | 58.3 | 0.439 |
| 独立归一化 | 86.16 | 57.6 | 0.415 |
此外,虽然为文本和图像模态分别使用独立的归一化层一直是现有 MMDiT 模型的默认做法(esser2024scaling;cai2025hidream;wu2025qwen),我们探索了跨模态共享归一化层所带来的更统一的特征分布是否有利于模型性能。如表 12 所示,共享归一化确实能持续提升性能。
C.2 VAE
| VAE | DPG | PRISM | LongText |
| FLUX.2 | 84.66 | 56.4 | 0.211 |
| Qwen-Image | 83.29 | 54.3 | 0.266 |
| VA-VAE | 85.07 | 55.5 | 0.126 |
我们将 VA-VAE(yao2025reconstruction)与前沿模型 FLUX.2(blackforestlabs_flux2_2025)和 Qwen-Image(wu2025qwen)中使用的 VAE 进行了比较。总体而言,FLUX.2 在所有基准测试中表现最为均衡。VA-VAE 可能因其在训练期间与预训练语义特征的对齐,在 DPG-Bench 上取得了最强性能,该基准强调生成图像与提示词之间的语义对齐。然而,它在评估细粒度文本渲染的 LongText 上表现远逊于其他模型,这可能是由于其较低的重建保真度。
| 原始 | FLUX.2 VAE | Qwen-Image VAE | VA-VAE |
![]() | ![]() | ![]() | ![]() |
![]() | ![]() | ![]() | ![]() |
从量化指标来看,先前的工作(wu2025qwen; yao2025reconstruction)报告称,在 256×256 分辨率的 ImageNet 验证集上,VA-VAE 的重建性能(PSNR 27.96,SSIM 0.79)低于 FLUX.2 VAE(31.46,0.90)和 Qwen-Image VAE(33.42,0.92)。在图 38 中,我们进一步提供了文本丰富图像上的定性重建示例。FLUX.2 VAE 和 Qwen-Image VAE 能够忠实地重建图像,而 VA-VAE 在渲染字符上引入了明显的损坏和畸变。造成这一局限的一个可能原因是 VA-VAE 是在 ImageNet(deng2009imagenet)上训练的,而该数据集缺乏文本丰富的图像。
C.3 在替代设置下比较文本编码器
更大的适配器
在第 4.2 节中,我们在默认基线模型上使用小型 MLP 适配器比较了候选文本编码器。然而,正如我们随后在第 4.1 节中所示,适配器的规模对模型性能有显著影响。因此,在此我们进一步探索,当我们使用与最终 i1 配方中一致的、由两个 Transformer 块组成的更大文本编码器适配器时,我们对文本编码器的比较结论是否仍然成立。如图 39 所示,我们的观察结果在很大程度上仍然成立:T5Gemma 和 T5Gemma2 系列的编码器-解码器模型取得了最强的性能,而 FG-CLIP 2 是最弱的。
移除 AdaLN
在我们的基线设置(第 3 节)中,池化后的文本嵌入与时间步嵌入相结合,并通过 AdaLN 传入主干网络。由于这为注入文本信息提供了额外路径,因此在我们最终的 i1 方案中移除 AdaLN,可能会影响不同文本编码器的相对性能。我们在图 40 中展示了每个文本编码器的基准测试结果。我们观察到,整体趋势与使用 AdaLN 的默认设置(图 8)中的趋势高度相似。
C.4 将系统提示词应用于文本编码器
在默认设置(见附录 A.3)中,我们直接使用每个文本编码器处理原始提示词,并将最后的隐藏状态作为文本特征。虽然这种设置很常见(cai2025z),但先前的工作也针对使用仅解码器语言模型作为文本编码器的情况设计了专门的提示词策略(ma2024exploring;xie2025sana)。在此,我们遵循 Qwen-Image(wu2025qwen)对 Qwen2.5-VL 文本编码器所使用的策略,并将其应用于 Qwen3-VL-2B 和 Qwen3-VL-4B 文本编码器。
具体来说,我们将文生图提示词包裹在一条系统消息中(“通过详细描述物体的颜色、形状、大小、纹理、数量、文字、空间关系以及背景来描述图像:”),并将完整序列输入文本编码器。前向传播之后,我们丢弃与系统前缀对应的隐藏状态,只保留与文生图提示词对应的隐藏状态。由此得到的性能如表 14 所示。我们观察到,使用系统提示词为 Qwen3-VL-2B 带来了小幅改进,但 Qwen3-VL 系列模型的表现仍然不及 T5Gemma 和 T5Gemma2 模型。
| 文本编码器 | 系统提示词 | DPG | PRISM | LongText |
| Qwen3-VL-2B | ✗ | 82.29 | 52.2 | 0.076 |
| ✓ | 82.82 | 52.8 | 0.093 | |
| Qwen3-VL-4B | ✗ | 82.07 | 52.9 | 0.071 |
| ✓ | 82.41 | 52.4 | 0.065 |
C.5 以训练 FLOPs 为基准比较骨干网络家族
在图 12 中,我们通过训练宽度分别为 1152、1296、1440、1584 和 1728 的交叉注意力、单流和双流模型,比较了不同骨干网络家族,并将性能与模型规模进行对比绘图。然而,根据实际的训练和推理设置,以 FLOPs 为基准比较性能可能更具参考价值。因此,在图 41 中,我们将性能与可训练模型的 FLOPs 进行对比绘图。这些 FLOPs 是使用 JAX/XLA 的“cost_analysis”计算的,针对扩散模型中所有可训练模块(例如包括文本编码器适配器)的一次前向和反向传播。我们使用训练张量形状,并将结果按全局批大小和训练步数进行缩放。双流骨干网络仍然实现了最佳的权衡。
C.6 在更大模型上验证建模设计
性能 vs. 模型规模
在第 4 节和附录 C.1 中,除了主干网络家族对比和长跳跃连接(这两项我们跨模型规模进行了验证)之外,我们主要使用 XL/2 尺寸的基线模型来识别建模设计发现。在图 43 中,我们通过在 {1152, 1296, 1440, 1584, 1728} 中为每个宽度训练一个模型,在多种模型规模的双流 MMDiT 模型上进一步验证了这些发现。
在多种模型规模下,更大的文本编码器适配器(第 4.1 节)始终能提供更好的性能-参数权衡。当使用 MLP 文本编码器适配器时,移除 AdaLN(第 4.1 节)也能带来明显的优势。然而,当使用更大的 Transformer 文本编码器适配器时,在参数数量相当的情况下,有无 AdaLN 的模型取得了相近的性能。我们注意到,这仍然表明在文生图扩散模型中,噪声条件化可能并非必要。
最后,虽然附录 C.1 提供的初步结果表明,结合 Sinusoidal 和 RoPE 位置嵌入、使用三明治归一化以及在图像和文本流之间共享归一化可以提升性能,但我们并未在跨模型规模中一致地观察到这些趋势。
性能 vs. 训练 FLOPs
除了在图 11 和图 43 中比较不同模型规模的性能外,我们还在图 44 中比较了可训练模块的性能与估算训练 FLOPs 的关系。我们按照附录 C.5 中的相同流程计算这些 FLOPs。
在基于 FLOPs 的比较下,大多数趋势保持不变。一个例外是,当使用较大的基于 Transformer 的文本编码器适配器时,AdaLN 的效果:在这种设置下,带有 AdaLN 的模型比不带 AdaLN 的模型具有更好的性能-FLOPs 权衡。这是因为 AdaLN 贡献了模型中不可忽视的一部分参数(例如,在双流基线中占参数的 18.9%),但仅极少量地增加了训练 FLOPs,因为其投影是每个样本计算一次,而不是每个 token 计算一次。
C.7 在其他骨干网络上验证长跳跃连接结果
在第 4.2 节中,我们基于双流 MMDiT 骨干网络的实验表明,长跳跃连接在不同模型规模下均能持续提升模型性能。在此,我们通过训练基线模型(XL/2 规模)的其他变体(分别带有和不带长跳跃连接),在其他骨干网络上进一步验证了这一设计。如图 42 所示,移除长跳跃连接在大多数骨干网络和基准测试中都会显著降低性能,尤其是在 DPG 和 LongText 上。这进一步表明,长跳跃连接可以广泛地有益于模型性能。
C.8 文本特征适配器与图像特征适配器
在 4.1 节中,我们发现将文本编码器的小型 MLP 适配器替换为更大的 Transformer 适配器,虽然只增加了少量参数,却能在各基准测试中显著提升性能。我们推测这是因为预训练语言模型提取的文本特征需要针对文生图等下游任务进行适配。在附录 C.6 中,我们展示了更大的 Transformer 适配器相比小型 MLP 适配器能实现更优的性能-参数权衡。
| 主干网络 | 适配器 | DPG | PRISM | LongText |
| 交叉注意力 | 默认 | 84.66 | 56.4 | 0.211 |
| + 用于文本特征的 Transformer 适配器 | 86.33 | 58.7 | 0.414 | |
| + 用于图像特征的 Transformer 适配器 | 85.27 | 55.4 | 0.250 | |
| 单流 | 默认 | 85.89 | 55.6 | 0.293 |
| + 用于文本特征的 Transformer 适配器 | 87.64 | 60.0 | 0.472 | |
| + 用于图像特征的 Transformer 适配器 | 86.10 | 59.7 | 0.345 | |
| 双流 | 默认 | 86.82 | 58.3 | 0.439 |
| + 用于文本特征的 Transformer 适配器 | 87.67 | 60.7 | 0.576 | |
| + 用于图像特征的 Transformer 适配器 | 86.23 | 57.0 | 0.378 |
为了进一步验证这种改进并非仅仅源于参数数量的增加,我们在图像特征经过分块处理之后、施加位置嵌入之前,同样添加了一个Transformer块(参见附录A.2)。如表15所示,将这一适配器应用于图像特征所带来的性能提升,远小于将其应用于文本特征时的效果。这表明,更大规模适配器带来的收益是专门针对预训练文本特征的适配,而非简单地增加模型容量。
C.9 探索长跳跃连接的变体
长跳跃连接由 U-Net(ronneberger2015u)推广开来,用于为来自较浅层的低级特征提供捷径,从而简化像素级预测任务的训练。后来,U-ViT(bao2023all)沿用了这一设计,并将其应用于基于 Transformer 架构的扩散模型。然而,尽管这些连接完全对称的结构(即,最左侧的第 层与最右侧的第 层相连)对于 U-Net 的多分辨率编码器-解码器结构而言是自然的,但对于基于 Transformer 的模型来说却未必是最优的,因为后者的模块通常具有相同的特征维度。因此,在此我们探索 U-ViT 中原始长跳跃连接的不同变体。
层范围
来自较浅层的长跳跃连接跨越的模块更多,而靠近中间层的跳跃连接跨越的模块较少。因此,来自更靠近中间层的特征在到达目标层时可能变化较小,这使得这些跳跃连接可能不那么必要。移除它们或许能保持性能甚至提升性能。为验证这一假设,在图 45 中,我们探索了长跳跃连接可以起始的若干层范围:1-3、1-7、1-11、4-7、4-11、4-14、8-11、8-14 和 12-14。然而,这些变体均未稳定地优于默认设置。
| 跳跃类型 | DPG | PRISM | LongText |
| 默认 | 84.66 | 56.4 | 0.211 |
| 83.70 | 55.2 | 0.134 | |
| 84.78 | 55.8 | 0.180 |
连接模式
我们进一步探索长跳跃连接是否应连接表征差异更大的层。我们没有使用默认的对称模式(即将最左侧第 - 层连接到最右侧第 - 层),而是测试了将第 - 层连接到第 - 层或第 - 层的变体。如表 16 所示,在交叉注意力主干上,该变体略微提升了 DPG,但默认模式在整体上仍然表现最佳,取得了最高的 PRISM 和 LongText 分数。
附录 D 数据设计的更多结果
在第 5 节中,我们展示了为合成字幕生成、提示词改写和数据混合设计提供依据的受控实验。我们在附录 D.1 中提供了关于合成字幕生成设计的更多细节及相应的受控实验,并在附录 D.2 中提供了支持我们关于数据混合结论的更多结果。
D.1 合成字幕生成中的更多设计
在 5.1 节中,我们通过在 ImageNet-22K 图像上使用不同的标题集训练一个基线交叉注意力模型,研究了合成标题的生成。在此,我们提供了额外的结果,这些结果支撑了我们在标题生成流程中的两个选择:在生成标题前对图像进行中心裁剪,以及为每张图像生成多个标题。
| 标题生成器 | DPG | PRISM | LongText |
| Qwen3-VL-30B-A3B | 83.72 | 50.8 | 0.007 |
| + 无中心裁剪 | 83.16 | 51.3 | 0.006 |
| + 每张图像 5 个标题 | 83.56 | 51.9 | 0.010 |
图像裁剪
在我们的实验设置中,我们使用通过中心裁剪较长边以匹配较短边而得到的方形图像进行训练。如果合成字幕生成器接收的是未裁剪的完整图像,生成的字幕可能会描述那些之后被裁剪掉的对象,从而在训练图像和字幕之间造成语义不匹配。podell2023sdxl 提出,这可能是导致文生图模型生成不完整对象这一失败模式的原因之一。此外,默认情况下,在中心裁剪之后,我们会将大于 512×512 的图像缩小到 512×512,以避免在较大图像上进行缓慢的字幕生成。
为了理解我们预处理操作的影响,我们使用由 Qwen3-VL-30B-A3B 生成的两组合成字幕来训练模型:一组由完整图像生成,另一组由裁剪并调整大小后的方形图像生成。如表 17 前两行所示,由裁剪并调整大小后的图像生成的字幕,其下游性能与由完整图像生成的字幕相当。由于中心裁剪和调整大小能够提高字幕生成速度,且不会显著影响下游性能,因此我们在生成所有合成字幕之前都应用这两种操作。
增加每张图像的描述数量,提供了除增加图像数量之外的另一个数据扩展维度。为了探索这一点,我们使用 Qwen3-VL-30B-A3B 为每张图像生成了五条描述。如表 17 所示,这在 PRISM 和 LongText 上带来了适度的改进。此外,如图 20 所示,当唯一训练图像的数量有限时,这种收益变得更加明显。
D.2 数据集权重相等条件下的实验
在第 5.2 节中,在确定对所有数据集采用相等权重可以获得较强性能后,我们进一步探索了在保持其他数据集权重相等的同时,对单个数据集进行上采样是否能进一步提升结果。在图 19 中,我们证明了仅对任何一个数据集进行上采样并不能在所有基准测试上持续提升性能。在此,我们进一步在图 46 中展示了将每个数据集上采样 5 倍的结果,并发现这些结果与图 19 中的观察结果一致。
附录 E 数据集的补充信息
我们在第 3 节中简要介绍了用于模型训练的图像数据集,并在第 5 节中探讨了合成描述和数据混合策略。在此,我们提供关于训练期间所用图像和描述的更多细节。
E.1 图像可视化
在我们的研究中,我们探索了数据混合策略,并在 12 个公开可用的图像数据集上训练了模型,其中包括 7 个真实图像数据集(ImageNet-22K (deng2009imagenet)、YFCC100M (thomee2016yfcc100m)、RedCaps (desai2021redcaps)、Megalith (BoerBohan2024Megalith10m)、Pexels (Narugo2024PexelsTaggerV0)、iNaturalist 2024 (vendrow2024inquire)、Places365-Challenge 2016 (zhou2017places))、3 个合成数据集(GPT-Image-Edit-1.5M (wang2025gpt)、FLUX-Reason-6M (fang2026flux) 和 Midjourney v6 (CortexLM2024MidjourneyV6)),以及 2 个文本渲染数据集(RenderedText (Wendler2024RenderedText) 和 TextAtlas (wang2025textatlas5m))。为了对其分布提供定性的理解,我们从每个数据集中随机采样 9 张图像,将每张图像调整大小使其较短边为 256 像素,然后中心裁剪为 256×256 的正方形,并将生成的图像展示在图 47 中。
E.2 图像分辨率统计
如第 6.2 节所述,我们在 i1 的 256 分辨率训练中使用了除 iNaturalist 之外的所有图像数据集。对于 512/1024 分辨率的高分辨率训练,我们过滤掉了较短边小于 512/1024 像素的图像。我们还移除了过滤后图像数量少于 30 万张的任何数据集。
在此,我们在表 18 中报告了在每个分辨率阈值下保留的图像数量。对于 512 分辨率训练,我们使用除 YFCC 和 iNaturalist 之外的所有数据集。对于 1024 分辨率训练,我们仅使用 FLUX-Reason、TextAtlas、RedCaps、GPT-Edit 和 Midjourney v6(尽管 RenderedText 在基于分辨率的过滤后满足图像数量要求,但由于其质量较低,我们将其排除在外)。
我们使用的 RedCaps 数据集包含 500 万张图像,这与原论文中报告的 1200 万张图像有所不同。这是因为 RedCaps 图像以 URL 形式提供,其中许多 URL 已无法访问。
| 图像类型 | 数据集 | 图像数量 | 较短边≥512 的图像数量 | 较短边≥1024 的图像数量 |
| 真实 | YFCC | 98,121,424 | 0 | 0 |
| ImageNet-22K | 13,673,551 | 719,427 | 0 | |
| Megalith | 9,393,971 | 9,202,294 | 61,701 | |
| Places | 8,026,628 | 7,345,764 | 0 | |
| RedCaps | 4,817,431 | 4,705,536 | 4,134,303 | |
| iNaturalist | 4,813,543 | 0 | 0 | |
| Pexels | 2,810,634 | 2,810,621 | 0 | |
| 合成 | FLUX-Reason | 5,890,279 | 5,890,279 | 5,890,279 |
| GPT-Edit | 1,553,575 | 1,552,821 | 357,482 | |
| Midjourney v6 | 1,240,185 | 1,240,185 | 1,240,185 | |
| 文本渲染 | RenderedText | 11,977,824 | 11,977,824 | 11,977,824 |
| TextAtlas | 5,397,762 | 4,036,973 | 919,913 |
E.3 不同 VLM 描述生成器的描述长度分布
在第 5.1 节中,我们使用相同的元提示词来提示 Qwen2-VL 2B (wang2024qwen2)、Qwen2.5-VL 3B (qwen2.5-vl)、Qwen3-VL-2B、Qwen3-VL-4B 和 Qwen3-VL-30B-A3B (bai2025qwen3),为 ImageNet-22K 生成合成描述。然后,我们在每个生成的图像-描述数据集上训练一个扩散模型。我们发现,用于合成描述的 VLM 选择对下游文生图性能有显著影响。在图 48 中,我们进一步绘制了每个 VLM 生成的描述的序列长度分布。我们观察到,带来更强性能的描述集往往也更长。
E.4 不同数据集的标题长度分布
在此,我们从每个数据集中随机抽取 10K 张图像,并在图 49 中绘制其合成标题的序列长度分布。尽管不同数据集的标题长度分布存在差异,但没有哪个数据集与其他数据集存在显著不同。
E.5 合成标题生成的元提示词
对于大多数图像数据集,我们使用以下极简提示词进行合成标题生成:
然而,对于文本渲染数据集,可以使用真实标注文本。为减少 VLM 生成标题中的模型幻觉,我们将真实文本纳入标题生成提示词中。对于 TextAtlas,我们使用:
RenderedText 包含使用 Blender 在数字 3D 纸张上渲染的手写文本图像。文本的字体大小、颜色和旋转角度各不相同,纸张在随机光照条件下渲染。每条真实标注包含一个字段“text”,它是一个字符串列表,其中 是图像中的文本行数。列表的第 个元素对应第 行文本。因此,对于 RenderedText,我们使用:
E.6 数据泄漏的健全性检查
除 FLUX-Reason 外,所有数据集的描述文本均由视觉语言模型(VLM)合成生成,因此我们的评测基准所用提示词集合与训练文生图模型所用描述文本之间不太可能存在重叠。然而,对于 FLUX-Reason,我们使用了五组描述文本:一组是数据集中自带的原始“caption_detail”字段(因其本身质量已较高),其余四组由我们自行合成生成。根据原论文(fang2026flux),PRISM-Bench 的提示词中有一半是直接从 FLUX-Reason 中选取的,随后已从该数据集中移除。为确保 FLUX-Reason 与 PRISM-Bench 之间不存在重叠,我们对 FLUX-Reason 中的每条“caption_detail”描述文本与 PRISM-Bench 中的每条提示词进行了精确字符串匹配。结果未发现任何重叠。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org

























































































