跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-06-11精选AI 评分73

HYDRA-X: 原生统一多模态模型与整体视觉分词器

HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers

AI 导读

HYDRA-X 是首个在单个 Vision Transformer (ViT) 中统一图像与视频 tokenization 的统一多模态模型。通过帧级因果时间注意力实现视觉重建,并采用层级时间压缩替代单步压缩。轻量级解压器在联合图像-视频教师监督下上采样时间压缩特征。编辑管线中,源-目标交互在分词器内部潜在层面而非 LLM 语义层面进行,提升编辑一致性与收敛速度。7B 密集模型在图像与视频理解及生成任务上表现强劲。

推荐理由

HYDRA-X 第一次把图像和视频标记塞进同一个 ViT,光看设计了帧级时序注意力和分层压缩这两个小 tricks 就值回票价,做多模态模型的该读读。

正文 · AI 翻译

郭振章

邱雪蕊

崔玉涛

宋天慧

李长林

李俊哲

黄涛

张晓

李阳

吴建兵

杨迈尔斯

赵忠

薄列峰

王利民

南京大学

中国科学院自动化研究所

腾讯混元

中关村学院

上海人工智能实验室

zgzaacm@gmail.com

lmwang@nju.edu.cn

摘要

整体性视觉分词器是统一多模态模型(UMM)的基础,因为它们能将多样化的视觉输入映射到统一的表示空间中。在本文中,我们提出了 Hydra-X,这是首个在单一视觉 Transformer(ViT)架构内统一图像和视频分词功能的 UMM。我们的设计由两个核心挑战驱动:一是将时空重建能力高效注入原生 ViT,二是将图像级和视频级语义感知嵌入到潜在空间中。为解决第一个挑战,全面的消融实验揭示了两项关键发现:(1)帧级因果时序注意力足以支持视觉重建,而全时空注意力反而会降低重建效果;(2)分层时序压缩显著优于单步压缩方案。为解决第二个挑战,我们提出了一种轻量化解压缩器,该解压缩器在联合图像-视频教师监督下对时序压缩后的特征进行上采样,从而在紧凑的潜在空间中强制形成互补的语义结构。基于这一整体性分词器,我们进一步提出了一种对编辑流程的原则性改进:源-目标交互应发生在分词器内部的潜在层级,而非大语言模型内部的语义层级,这能显著提升编辑一致性并加速收敛。Hydra-X 以 7B 密集模型实例化,在图像和视频的理解与生成任务上均取得了强劲性能,为未来基于统一分词器的 UMM 铺平了道路。

本工作完成于腾讯混元实习期间。同等贡献。通讯作者。

1 引言

统一多模态模型(UMMs)(Xie 等人,2025a;Liu 等人,2025b;Deng 等人,2025;Qiu 等人,2026;Zhou 等人,2024)近期已成为一种强大的范式,它通过联合训练单一自回归主干网络,同时实现视觉理解与生成。其核心设计选择在于视觉输入的编码方式:现有系统要么采用解耦的视觉编码器,为两项任务分别配备 ViT 编码器和独立的 VAE 编码器(Deng 等人,2025;Ma 等人,2025c;Zhou 等人,2024);要么采用统一的视觉分词器,将多样化的视觉输入映射到两项任务共享的单一表示空间中(Xie 等人,2025a;Liu 等人,2025b;Tong 等人,2026a;Qiu 等人,2026;Wu 等人,2025d;Ma 等人,2025a)。后一种方法具有明显的架构优势:它消除了大语言模型必须协调的异构编码器之间的表示不匹配问题,并为理解与生成之间的相互增强开辟了道路。

Refer to caption
图 1:Hydra-X 是一种原生统一多模态模型,通过一个整体式分词器 Hydra-XTok,统一了图像/视频理解、图像/视频生成以及指令引导的图像编辑功能。

尽管统一分词技术已在静态图像领域得到广泛探索,但能够将图像和视频绑定到单一表示空间中的整体式分词器却鲜少受到关注。现有的支持视频的统一多模态模型通常采用两种临时策略之一。第一种范式依赖于逐帧分词器,即对每一帧独立应用图像语义编码器(Tong 等人,2026a)。由于分词器内部缺乏任何时间交互,由此产生的表示无法捕捉跨帧动态(如运动或短时因果关系),导致下游大语言模型只能处理彼此孤立的逐帧特征,而这些特征本身并不包含任何视频结构信息。第二种范式采用级联设计,在语义编码器之前堆叠一个 3D 因果 VAE(Xie 等人,2025a;Liu 等人,2025b)。尽管这种方式整合了时间轴,但 VAE 是在没有任何语义约束的情况下孤立训练的,可能会无意中丢弃对理解至关重要的信息。

在本文中,我们提出了 Hydra-X,这是首个基于 Hydra-XTok 构建的 UMM 框架。Hydra-XTok 是一个统一的视觉 token 化器,能够在单个 Vision Transformer(ViT)中同时处理图像和视频编码。我们的整体设计遵循纯图像的 UMM 框架 HYDRA(Qiu 等人,2026),该框架将中间层 ViT 特征压缩为紧凑的潜在表示,并从中重建语义特征。然而,将这一范式扩展到同时支持图像和视频,会带来两个核心挑战:(a)高效地将时空重建能力注入原生 ViT,以及(b)将图像级和视频级的语义感知嵌入到共享的潜在空间中。

我们对第一个挑战的研究得出了两个与传统直觉相悖的发现。(1)尽管全时空注意力是视频处理最自然的扩展方式,但它会通过破坏图像预训练期间编码的局部性和结构,反而降低重建质量。令人惊讶的是,仅关注紧邻前一帧的帧级因果时间注意力(具有最小时间感受野)在整体上优于全局注意力。(2)单步分块(patchify)的效果远不如将时间压缩分布到多个阶段的分层分块,这表明时间轴受益于渐进式的多尺度折叠。综合来看,这两个设计选择使 Hydra-XTok 在重建保真度上超越了专用的 3D 卷积视频 VAE(如 Wan2.2-VAE(Wan 等人,2025))。

为应对第二个挑战,我们将已确立的语义蒸馏范式(Qiu et al., 2026; Wu et al., 2025d; Ma et al., 2025a)从图像扩展到视频,并发现了一个根本性的不对称:图像潜在表示可以轻松复用现有的语义教师模型,但没有任何可用的视频编码器能在我们潜在表示所采用的压缩时间分辨率下工作,导致视频流缺乏天然的语义监督来源。我们通过一个极其简单的补充方案解决了这一不对称:一个轻量级的解压缩器,将压缩后的潜在表示恢复至其原始时间长度,从而能够在全帧率下直接从预训练的图像和视频教师模型(Tschannen et al., 2025; Wang et al., 2022)进行蒸馏。在这种双时空监督下,紧凑的潜在表示同时保留了像素级保真度和丰富的时空语义结构,显著推进了统一多模态模型(UMM)的理解与生成能力。

基于这一整体式分词器,Hydra-X 在单个共享编码器内统一了五项 UMM 任务,如图 1 所示:图像/视频生成、图像/视频理解以及图像编辑。然而,编辑任务尤其暴露了 HYDRA 和级联式设计的一个根本缺陷:由于仅向大语言模型(LLM)提供编码器后的语义特征,它们将源图像与目标图像的交互限制在语义层面,从而丢失了存在于潜在表示中的细粒度结构信息。为解决此问题,我们提出了一种原则性的设计反转:Hydra-XTok 通过跨帧交互联合对源图像和目标图像进行分词,在到达大语言模型之前直接将结构细节融合到目标图像中。这种早期的潜在层面交互显著提升了编辑一致性并加速了收敛。

基于 Qwen2.5-7B-Instruct(Yang et al., 2024a)在 7B 规模上实例化后,Hydra-X 在图像和视频的理解与生成任务上均取得了强劲性能。更重要的是,它将视觉分词器从一个专门的图像处理组件提升为一个整体的图像与视频接口,为未来基于统一分词器的 UMM 探索奠定了坚实基础。

2 相关工作

2.1 面向统一多模态模型的视觉分词器

越来越多的工作致力于在单个视觉分词器内统一重建与语义功能。对于图像,RAE(Zheng 等人,2025;Tong 等人,2026b)冻结语义编码器并学习像素解码器,而多种统一分词器设计(Yue 等人,2025;Yao 等人,2025a;Ma 等人,2025a;Qu 等人,2025;Song 等人,2025;Lin 等人,2025b;Tang 等人,2025)则在单个 ViT 内联合训练重建与理解任务。HYDRA(Qiu 等人,2026)引入了一种渐进式 ViT,并采用生成-语义瓶颈来实现先压缩后恢复的语义蒸馏,Hydra-XTok 继承了这一方法。将生成潜变量与语义特征对齐已被进一步证明能够使两项任务相互受益(Wang 等人,2024a;Yu 等人,2024;Yao 等人,2025b;Ma 等人,2025b;Wang 等人,2025b;2023)。然而,图像与视频的联合分词在很大程度上仍未得到充分探索:对于视频,3D 卷积 VAE(Yu 等人,2023;Wan 等人,2025)占据主导地位,但缺乏任何语义结构。近期工作 AToken(Lu 等人,2025)在单个分词器内统一了图像和视频,用于重建与理解,但针对这两个目标会输出特定于任务的特征,因此未能产生统一的表示。据我们所知,Hydra-X 是首个在基于 ViT 的单个分词器内统一图像和视频的 UMM 框架,它在 HYDRA 的理念基础上增加了显式时间因果性、层次化分块以及用于时空语义感知的解压缩器。

2.2 原生统一多模态模型

统一多模态模型(UMM)旨在通过单一骨干网络同时处理视觉理解与生成任务。现有系统大致可分为三大类,其区别在于两个目标在参数与表征共享上的紧密程度。复合型UMM(Tong等人,2025;Chen等人,2025a;Lin等人,2025a;Pan等人,2025;Tang等人,2025)通过轻量级适配器或投影层桥接预训练的理解模型与生成模型;这种方式保留了各专用模型的优势,但两个任务之间的协同作用较浅,因为梯度很少跨越模态边界流动,且两个骨干网络从未共享潜在空间。原生型UMM则从一开始就联合训练两个目标,并根据视觉表征的选择进一步分化。量化token方法(Team,2024;Xie等人,2024;Wang等人,2024c;Zhou等人,2024)将视觉生成转化为基于VQ码本的下一个token预测,这统一了大语言模型的接口,但继承了VQ分词器的重构损失和码本坍缩问题,限制了可实现的视觉保真度。解耦设计(Ma等人,2025c;Wu等人,2025b;Chen等人,2025b;Deng等人,2025;Liao等人,2025;Li等人,2025;Fan等人,2025)通过将理解任务路由至语义编码器、将生成任务路由至单独训练的VAE来规避这一上限;代价是视觉通路被复制,两条流争夺大语言模型的注意力,且其表征必须在下游重新对齐。我们构建的最新路线是统一编码器型UMM,例如TransNext(Tong等人,2026a)、Show-o2(Xie等人,2025a)和TUNA(Liu等人,2025b),它们在两个任务间共享单一视觉分词器,在保留联合优化的同时恢复了复合系统的架构简洁性。我们将这一路线向两个方向扩展:从图像到统一的图像与视频分词器,以及从独立的逐输入编码到专为编辑任务定制的分词器级源-目标交互。

2.3 统一多模态模型中的图像编辑

图像编辑是统一多模态模型必须将目标图像条件化于结构相似的源图像上的典型任务,现有流水线的主要区别在于这种条件化注入的位置。第一类方法依赖专用条件适配器:ControlNet 风格分支(Zhang 等人,2023)附加一个并行编码器,将空间对齐的源特征注入生成器;而 BAGEL(Deng 等人,2025)中使用的参考 token 流则将源图像作为额外上下文前置,供大语言模型进行注意力计算。这两类方法都会增加参数量或上下文长度,且源图像表示是专门为生成头设计的,而非与理解侧共享。更接近我们方案的是统一编码器型统一多模态模型 Show-o2(Xie 等人,2025a)和 TUNA(Liu 等人,2025b),它们对源图像和目标图像复用同一个 tokenizer,但两幅图像仍独立编码;仅在 LLM 输入处将编码后的语义特征拼接起来,因此任何跨图像对齐都必须由 LLM 从两个已经压缩的语义流中重建,而瓶颈前细粒度结构则无法访问。我们则将源图像和目标图像置于 Hydra-XTok 的同一时间窗口内,通过单次前向传播处理,使得源-目标交互能够在 tokenizer 的因果 Sem-ViT 内部从隐层级别开始,并在到达 LLM 之前传播。这复用了已为视频训练好的时间路径,去除了任何额外的跨图像注意力模块,并使 LLM 能够接触到已经吸收了源图像结构的目标表示。

3 预备知识:表示协调的 Token 化

我们的整体设计遵循纯图像 UMM 框架 HYDRA(Qiu 等人,2026)。其核心是一个被拆分为 Gen-ViT 和 Sem-ViT 的单一 ViT,两者通过一个生成-语义瓶颈(Generation–Semantic Bottleneck)连接,该瓶颈支持在同一个主干网络内进行生成和语义感知。给定一张输入图像,Gen-ViT 首先生成一个富含结构基元的特征,瓶颈层将其投影为适合生成的紧凑潜变量。随后,Sem-ViT 将该潜变量反投影回高维语义特征,并通过知识蒸馏与预训练的语义教师模型对齐:

(1)

下游的大语言模型仅基于 Sem-ViT 的输出来执行理解和生成任务,而用于从潜变量重建图像的像素解码器仅在分词器训练期间被调用。我们保留了这一整体设计,并通过显式的时间因果性、层次化分块以及第 4 节中引入的解压缩器(Decompressor),将其从图像扩展到了视频领域。

4 Hydra-XTok:单一 ViT 中的整体式视觉分词

Hydra-XTok 被设计为 Hydra-X 的视觉接口:在任何 token 到达大语言模型之前,它必须足够紧凑以支持生成、足够保真以支持重建、并且足够语义化以支持理解。我们从 SigLIP 2(Tschannen 等人,2025)初始化 Gen-ViT 和 Sem-ViT;所有 UMM 侧的消融实验均使用 Qwen2.5-1.5B(Yang 等人,2024a)。该分词器通过一个重建项和两个语义蒸馏项进行训练:

(2)

其中,项保持紧凑潜变量在像素层面的保真度,项将 Sem-ViT 特征与语义特征对齐。详细配置见附录 A.1。

4.1 ViT 中的时空重建

Refer to caption
图 2:时空重建设计。(上方)Gen-ViT 将一个视频片段折叠为紧凑潜变量。(下方)三种消融实验用的注意力掩码:全注意力(Full)关注所有时空 token,因果掩码(Causal)遮蔽未来帧,管状掩码(Tubelet)将注意力限制在一个 2 帧窗口内。
媒体内容 · 前往原文查看
表1:ImageNet () 和 DAVIS () 上的重建消融实验。所有三种注意力掩码基线均采用单步时间分块;只有“Ours”行使用了分层调度。延迟时间按视频片段单次前向传播测量。进一步的重建对比和可视化结果见附录 H.1 和 H.3。
方法 延迟(秒)() ImageNet DAVIS
PSNR() SSIM() rFID() PSNR() SSIM() rFVD()
全注意力 0.49 31.10 0.8890 0.367 27.40 0.8277 16.20
因果注意力 0.45 31.38 0.8901 0.352 27.62 0.8283 14.05
Tubelet 注意力 0.17 31.42 0.8907 0.347 27.69 0.8287 13.69
我们的方法 0.25 31.73 0.8936 0.329 27.97 0.8307 11.19

现有的基于 ViT 的、能够联合处理图像和视频重建的 tokenizer(例如 AToken(Lu 等人,2025)和 OmniTokenizer(Wang 等人,2024b))共享两种设计选择:跨所有帧的全时空注意力,以及在输入处应用的单步时间分块,该操作会激进地压缩时间轴。这两种选择都有代价。全时空注意力与片段长度呈二次方关系,并且往往会破坏从图像预训练中继承的每帧结构先验;激进的单步时间分块会在任何跨帧推理之前就坍缩掉细粒度的时间细节。这自然引出了一个关键问题:这些设计选择真的有必要吗?

我们通过沿两个相同轴进行受控消融实验来回答这一问题:(i)时间注意力区域,以及(ii)时间分块策略。遵循视频VAE的常见设计,一个视频片段被编码为一个锚帧图像潜变量,同时其余帧以一定因子压缩,生成紧凑的潜变量表示。随后对这两个轴分别进行消融。对于(i),我们比较了三种注意力掩码(图2底部):全注意力(AToken和OmniTokenizer的标准选择);因果注意力,对所有先前帧施加因果掩码;以及Tubelet注意力,其中因果注意力被限制在一个2帧的tubelet内,因此每个token仅关注自身帧和紧邻的前一帧。对于(ii),我们比较了AToken和OmniTokenizer使用的单步时间分块与一种分层策略,后者应用两个连续的分块阶段(图2顶部)。在每个时间分块阶段,锚帧被零填充,使其与其余帧经历相同的操作。

表1揭示了两条与常见选择相悖的原则。首先,将时间感受野扩展到2帧tubelet之外只会降低重建质量:全双向注意力和所有过去帧因果注意力的表现均不如Tubelet注意力。其次,在相同压缩比下,将时间压缩分布到两个分块阶段始终优于单步方案。这些结果回答了我们开篇提出的问题:激进的时空注意力和单步分块不仅不必要,而且实际上是次优的。

4.2 通过解压缩器进行时空语义蒸馏

继 HYDRA 之后,我们通过将 Sem-ViT 输出与预训练教师模型进行知识蒸馏,向潜在空间中注入语义结构。然而,将这一方法扩展到视频领域时,揭示了一个根本性的不对称问题。对于图像而言,Sem-ViT 输出与帧具有相同的空间分辨率,可以与现成的图像教师模型逐 token 对齐。对于视频而言,Sem-ViT 输出在时间维度上被压缩为 token,而现有的视频编码器则以原始帧率运行。因此,在标准蒸馏方案下,视频流无法获得任何视频级别的语义监督。

Refer to caption
图 3:时空蒸馏。未压缩的图像潜在空间直接由图像教师模型进行蒸馏;时间维度压缩后的视频潜在空间首先通过一个轻量级解压缩器恢复到原始长度,然后再由视频教师模型进行蒸馏。
媒体内容 · 前往原文查看
表 2:语义蒸馏消融实验。
设计选择 视频理解 图像理解 图像生成 编辑
图像 解压缩 解压缩 Sem-ViT MVBench VideoMME AI2D MME GenEval ImgEdit
蒸馏 使用图像 使用视频 双向 () () () () () ()
29.8 27.4 45.1 989 67.5 2.35
✓ 42.1 42.5 61.2 1339 70.6 2.72
✓ ✓ 44.7 44.3 62.7 1522 70.7 3.07
✓ ✓ 45.4 45.0 62.5 1501 72.0 3.20
✓ ✓ ✓ 43.1 43.7 62.0 1434 70.1 2.70

我们通过引入一个轻量级解压缩器来解决这种不对称性。解压缩器是一个小型 ViT 模块,它将时间维度压缩后的 Sem-ViT 输出提升回其原始时间长度,生成密集的逐帧语义特征,从而可以与图像和视频教师模型进行对齐(图 3)。解压缩器仅在 tokenizer 训练时使用,之后便被丢弃;LLM 仍然在相同的紧凑型 Sem-ViT 输出上运行。令 表示余弦距离,完整的蒸馏损失结合了图像教师模型在 处的项和视频教师模型在解压缩器输出处的项:

(3)

其中,`leading uncompressed image token` 代表未压缩的图像前置 token,而 `compressed video latents` 代表压缩后的视频潜变量。对于纯图像批次,公式 3 中的视频项会被屏蔽。我们在表 2 中消融了四种设计选择:(i) 是否在 Sem-ViT 输出上应用图像蒸馏(图像蒸馏);(ii) 是否额外对解压缩器输出进行图像教师模型蒸馏(含图像的解压缩器);(iii) 或进行视频教师模型蒸馏(含视频的解压缩器);以及作为对 F1 的交叉验证,(iv) Sem-ViT 是否使用双向注意力而非管状注意力(Sem-ViT 双向)。

表 2 揭示了三条原则。首先,语义蒸馏不可或缺:移除它会同时损害图像和视频理解能力。其次,解压缩器是实现视频级监督的关键:对其使用视频教师模型进行蒸馏,能在保持图像侧性能的同时获得最强的视频理解能力,且同一配置在图像生成和编辑评分上也表现最佳,这与语义更丰富的潜变量能加速大语言模型在生成和编辑任务上收敛的假设一致。第三,将 Sem-ViT 切换为双向注意力会全面降低所有指标,这与 F1 的结果相呼应:即使在理解侧,更少的注意力反而效果更好。

5 Hydra-X:推动统一多模态模型迈向整体化分词器

5.1 整体架构

Hydra-X 遵循标准的原生统一多模态模型模板(Xie 等人,2025a;Liu 等人,2025b;Qiu 等人,2026):由 Hydra-XTok 生成的文本 token 和视觉 token 交错排列成单一序列,并由共享的大语言模型主干网络处理,该主干配备两个专用头部——一个用于下一 token 预测的自回归语言头部,以及一个用于流匹配的视觉头部(Lipman 等人,2022;Esser 等人,2024)。在此模板框架下,Hydra-X 通过一个共享分词器 Hydra-XTok(图 4(a))统一了五项任务:图像生成(文本→图像)、图像理解(图像→文本)、视频生成(文本→视频)、视频理解(视频→文本)以及图像编辑(源图像 + 文本指令→目标图像)。

Refer to caption
图 4:Hydra-X 通过整体式分词器 Hydra-XTok 统一了五项视觉任务。(a) Hydra-XTok 将任意图像或视频编码为紧凑的 Gen-ViT 潜变量,再通过 Sem-ViT 将其转化为语义特征。(b) 以往的编辑流程(左图)使用两个独立分支对源图像和目标图像进行编码;Hydra-X(右图)则保持 Gen-ViT 的独立性以确保忠实重建,但共享了采用管状因果注意力的 Sem-ViT,从而在分词器内部注入结构交互。(c) 一个共享主干网络搭配两个独立解码头,驱动全部五项任务。

如图 4(c) 所示,同一个 Gen-ViT 服务于所有五项任务;唯一与任务相关的组件是哪个解码头来解码大语言模型的输出。该模型使用复合损失函数进行端到端训练。

(4)

其中, 是文本的下一 token 预测损失, 是视觉潜变量的整流流匹配损失,且两个损失权重 和 默认均设为 。

5.2 独立编码绕过潜变量

在五项任务中,图像编辑是唯一一个输入同时包含条件图像和目标图像的任务。传统流程,包括 HYDRA(Qiu 等人,2026)以及级联设计如 Show-o2(Xie 等人,2025a)和 TUNA(Liu 等人,2025b),都使用同一个分词器对源图像和目标图像进行独立分词(图 4(b),左图):

(5)

其结果是,源图像和目标图像的潜变量在分词器内部从未产生交互,大语言模型必须在两个独立的语义流之上,从头开始发现它们之间的跨图像对齐关系。这对于高层语义编辑是足够的,但在需要细节忠实度的编辑任务上则始终失败。

5.3 分词器阶段的源-目标交互

一个自然的解决方案源自 Hydra-XTok 的整体式设计:由于 Sem-ViT 已经为视频建模应用了管状因果注意力,我们只需将编辑对通过 Hydra-XTok 路由为一个长度为 2 的片段(图 4(b),右图),即可复用完全相同的机制。Gen-ViT 继续独立编码两幅图像,瓶颈层后的潜变量也依然保持重建忠实性。跨图像交互则完全在 Sem-ViT 中注入,该模块使用与视频处理相同的管状因果掩码进行处理:

(6)

请注意,对于编辑对,我们禁用了 Gen-ViT 的跨帧管状注意力,因为源图像和目标图像在时间上并非相邻的视频帧;只有 Sem-ViT(语义阶段)复用了视频管状因果掩码。这种非对称复用是一个刻意的选择:结构重建受益于独立编码,而语义对齐受益于跨图像交互。

媒体内容 · 前往原文查看
表 3:源-目标交互(STI)消融实验。Hydra-X-STI 将编辑对编码为长度为 2 的片段,并采用 Sem-ViT 管状因果注意力;Hydra-X-Indep 则独立编码源图像和目标图像。Recon-PSNR:在 ImgEdit 上的源图像重建 PSNR。
布局 编辑 图像生成 视频理解 图像理解
ImgEdit () Recon-PSNR () GenEval () MVBench () VideoMME () AI2D () MME ()
Hydra-X-Indep 2.80 20.74 70.51 45.3 45.0 62.2 1478.5
Hydra-X-STI 3.20 27.65 71.97 45.4 45.0 62.5 1501.0

表 3 比较了 Hydra-X-Indep 和 Hydra-X-STI,两者除了编辑对是独立编码还是作为长度为 2 的片段并采用 Sem-ViT 管状因果注意力编码之外,其余完全相同。STI 将 Recon-PSNR(即 ImgEdit(Ye 等人,2025)上直接探测编辑一致性的源图像重建 PSNR)提升了近 dB,并将 ImgEdit 提升了。STI 在大多数非编辑基准测试上也带来了一致的提升,其中 GenEval () 的提升最为显著,这表明新的潜在空间层级耦合也丰富了用于生成的 Sem-ViT。Recon-PSNR 的跃升直接验证了我们来自第 5.2 节的假设:编辑的一致性失败源于分词器内部的潜在空间层级隔离,而非 LLM 的能力或监督信号。

6 主要结果

实现细节。

Hydra-X 在两个规模上实例化。所报告的模型使用 Qwen2.5-7B-Instruct(Yang 等人,2024a)作为大语言模型主干;一个匹配的 1.5B 变体用于第 4–5 节中的方法消融实验。遵循 AToken(Lu 等人,2025),Hydra-XTok 包含一个对称的 ViT 编码器/解码器对,并辅以 3D 旋转位置编码(3D RoPE)(Su 等人,2024)用于联合时空建模。公式 3 中的解压缩器是一个轻量级时间上采样器,它堆叠了两个连续的(时间上采样 Transformer 块)阶段;每个时间上采样是一个卷积,将通道维度加倍,随后进行通道到时间的重塑,从而反转编码器的分层时间分块。瓶颈维度为 。对于蒸馏教师模型,我们使用 SigLIP-SO400M-patch16-naflex(Tschannen 等人,2025)作为图像教师模型,并使用 InternVideo-Next-L(Wang 等人,2025a)作为视频教师模型。

6.1 多模态理解

图像理解。

我们在 AI2D(Kembhavi 等人,2016)、MME(Fu 等人,2023)、MMMU(Yue 等人,2024)、OCRBench(Liu 等人,2024b)、MMBench(Liu 等人,2024a)、RealWorldQA、ChartQA(Masry 等人,2022)、DocVQA(Mathew 等人,2021)和 InfoVQA(Mathew 等人,2022)上进行基准测试。表 4 将 Hydra-X 与相似规模的开源统一多模态模型进行了比较。总体而言,Hydra-X 在大多数报告的指标上达到或超过了 7B 原生统一多模态模型基线,包括对强语义保留至关重要的 OCR 和图表密集型任务。

媒体内容 · 前往原文查看
表 4:图像理解基准评估。# Params. 表示模型大小。灰色行表示参数规模为 B 的模型,不参与排名。在表格的每个子组内,粗体标记最佳结果,下划线标记第二佳结果。

模型 # 参数量 AI2D MME MMMU OCRBench MMB RWQA ChartQA DocVQA InfoVQA 测试 总结 验证 测试 dev_en 测试 测试 验证 验证 纯理解模型 Qwen2.5-VL (Bai et al., 2025) 7B 84.3 2312.0 58.0 88.8 82.8 68.4 84.1 93.0 78.6 LLaVA-1.5 (Liu et al., 2023b) 7B 55.5 1510.7 35.7 31.8 62.3 54.8 17.9 – – LLaVA-OV (Li et al., 2024a) 7B 81.4 1998.1 48.8 62.2 80.8 66.3 80.0 87.5 68.8 统一多模态模型 BLIP3-o (Chen et al., 2025a) 8B – 2329.7 50.6 83.1 83.5 69.0 78.0 – – TokenFlow-XL (Qu et al., 2025) 14B – 1922.1 43.2 – 68.9 56.6 – – – Ming-UniVision (Huang et al., 2025) 16B 82.8 2023.0 40.3 72.4 78.5 – – – – BAGEL (Deng et al., 2025) 14B 89.2 2388.0 55.3 73.3 85.0 72.8 78.5 – – Janus-Pro (Chen et al., 2025b) 7B 71.3 1567.1 41.0 59.0 79.2 58.0 25.8 – – VILA-U (Wu et al., 2024b) 7B – 1401.8 – – 66.6 – – – – Show-o2 (Xie et al., 2025a) 7B 78.6 1620.5 48.9 32.4 79.3 64.7 52.3 77.3 45.8 HYDRA (Qiu et al., 2026) 7B 85.1 2068.6 49.4 57.7 82.4 64.7 – – – Hydra-X 7B 86.5 2350.0 51.5 84.5 84.0 68.7 86.5 81.7 59.1

视频理解。

媒体内容 · 前往原文查看
表 5:视频理解基准评测结果。# Params. 表示模型大小。Video-MME 报告的是无字幕(w/o subtitle)分数。
模型 # 参数量 MVBench Video-MME LongVideoBench LVBench
测试 无字幕 验证 测试
专有纯理解模型
GPT-4V (OpenAI, 2023) – 43.5 59.9 61.3 –
GPT-4o (OpenAI, 2024) – – 71.9 66.7 48.9
Gemini-1.5-Flash (Team et al., 2024) – – 70.3 61.6 –
Gemini-1.5-Pro (Team et al., 2024) – 54.2 75.0 64.0 33.1
开源纯理解模型
VILA (Lin et al., 2024) 40B – 60.1 – –
PLLaVA (Xu et al., 2024) 34B 58.1 – 53.2 –
LongVA (Zhang et al., 2024b) 7B 49.2 52.6 51.8 –
VideoLLaMA2 (Cheng et al., 2024) 7B 54.6 47.9 – –
LLaVA-OV (Li et al., 2024a) 7B 56.7 58.2 56.5 26.9
IXC-2.5 (Zhang et al., 2024a) 7B 69.1 55.8 – –
统一多模态模型
Show-o2 (Xie et al., 2025a) 1.5B 49.8 48.0 49.2 –
TUNA (Liu et al., 2025b) 1.5B 54.4 49.1 49.7 27.4
Show-o2 (Xie et al., 2025a) 7B 55.8 57.4 55.5 –
Hydra-X 7B 59.1 60.0 59.5 30.0

我们在 MVBench(Li 等人,2024c)、Video-MME(Fu 等人,2025)、LVBench(Wang 等人,2025c)和 LongVideoBench(Wu 等人,2024a)上进行了评估(表 5)。在可获得可比数据的基准测试中,Hydra-X 相比已报道的 1.5B 和 7B 统一基线模型有所提升。在多项指标上,它仍低于最强的专用或专有视频大语言模型,但在使用单个共享于理解、生成和编辑任务的 ViT token 编码器的情况下,缩小了差距。这些结果与 Hydra-XTok 中双教师知识蒸馏的作用一致,该蒸馏为压缩后的潜在表示提供了图像级和视频级的语义信息。

6.2 视觉生成

表 6 联合报告了在 GenEval(Ghosh 等人,2023)和 WISE(Niu 等人,2025)上的图像生成结果,以及在 VBench(Huang 等人,2024)上针对 -帧输出的视频生成结果,汇总为质量分数、语义分数和综合总分。在 7B 规模的统一基线模型中,Hydra-X 在 GenEval 和 WISE 的每个报告列中均为最强项;与 B 参数规模的统一模型相比,它在使用 7B 骨干网络的同时,在总体分数上仍具有竞争力。在 VBench 上,Hydra-X 在质量分数、语义分数和总分上领先所有统一模型,相比最接近的统一竞争对手(Show-o2-1.5B),质量分数、语义分数和总分均有提升。VBench 各维度的分数见附录表 13,其中 Hydra-X 在语义密集的维度(包括对象类别、人类动作和场景)上同样领先。这些结果共同表明,双教师知识蒸馏将语义结构传递到潜在表示中,同时保留了其在视觉合成中的作用。

媒体内容 · 前往原文查看
表 6:综合视觉生成结果。GenEval(Ghosh 等人,2023)和 WISE(Niu 等人,2025)上的图像生成;VBench(Huang 等人,2024)上的视频生成,报告了质量分数、语义分数和综合总分。† 表示使用了 LLM 重写器。灰色行表示参数规模为 B 的模型,不参与排名。定性结果见附录 H.4。

模型 # 参数量 GenEval WISE VBench 双物体 位置 重叠 文化 空间重叠 QS SS 总分 纯生成模型 SD3-Med (Esser 等, 2024) 2B 0.94 0.33 0.74 – – – – – – FLUX.1 [Dev] † (Labs 等, 2025) 12B 0.93 0.68 0.82 0.48 0.62 0.50 – – – CogVideoX (Yang 等, 2024b) 5B – – – – – – 82.75 77.04 81.61 Hunyuan Video (Kong 等, 2024) 13B – – – – – – 85.07 76.88 83.43 统一多模态模型 TokenFlow-XL (Qu 等, 2025) 14B 0.60 0.16 0.55 – – – – – – SEED-X (Ge 等, 2024) 17B 0.58 0.19 0.49 – – – – – – Ming-UniVision (Huang 等, 2025) 16B 0.93 0.92 0.85 – – – – – – BAGEL † (Deng 等, 2025) 14B 0.95 0.78 0.88 0.44 0.68 0.52 – – – Show-o2 (Xie 等, 2025a) 1.5B 0.86 0.46 0.73 0.33 0.53 0.39 82.10 78.31 81.34 Harmon (Wu 等, 2025d) 1.5B 0.86 0.74 0.76 0.38 0.52 0.41 – – – Blip3-o† (Chen 等, 2025a) 8B – – 0.84 – – 0.50 – – – MUSE-VL (Xie 等, 2025b) 7B 0.64 0.25 0.57 – – – – – – Janus-Pro (Chen 等, 2025b) 7B 0.89 0.79 0.80 0.30 0.49 0.35 – – – VILA-U (Wu 等, 2024b) 7B – – – 0.26 0.37 0.31 76.26 65.04 74.01 HaploOmni (Xiao 等, 2025b) 7B – – – – – – – – 78.10 Emu3 (Wang 等, 2024c) 8B – – 0.66 – – – – – 80.96 Show-o2 † (Xie 等, 2025a) 7B 0.87 0.52 0.76 0.40 0.58 0.44 – – – Hydra-X 7B 0.95 0.84 0.88 0.53 0.72 0.56 83.97 81.57 83.49

6.3 图像编辑

媒体内容 · 前往原文查看
表 7:图像编辑。ImgEdit-Bench:Ext.=提取,Rm.=移除,Over.=总体(9 个类别的均值)。GEdit-Bench:G-SC=G-语义一致性,G-PQ=G-感知质量,G-Over.=总体。各维度详细数据见附录 12。
模型 ImgEdit-Bench GEdit-Bench
提取 移除 总体 G-语义一致性 G-感知质量 G-总体
纯生成模型
FLUX.1 Kontext [Pro] (Labs 等, 2025) 2.35 3.57 4.00 7.02 7.60 6.56
Qwen-Image (Wu 等, 2025a) 3.43 4.14 4.27 8.00 7.86 7.56
统一多模态模型
OmniGen (Xiao 等, 2025a) 1.71 2.43 2.96 5.96 5.89 5.06
UniWorld-V1 (Lin 等, 2025a) 2.27 3.24 3.26 4.93 7.43 4.85
BAGEL (Deng 等, 2025) 1.70 2.62 3.20 7.36 6.83 6.52
OmniGen2 (Wu 等, 2025c) 1.77 3.20 3.44 7.16 6.77 6.41
Hydra-X 4.04 4.38 4.34 7.80 7.24 7.17

表 7 报告了在 GEdit-Bench(Liu 等人,2025a)和 ImgEdit-Bench(Ye 等人,2025)上的编辑结果。在 7B 规模的统一模型中,Hydra-X 在 Ext.(,)、Rm.(,)、ImgEdit Over.(,)以及 GEdit G-SC/G-Over.(/)指标上领先,并且在每一项指标上都超过了 BAGEL-14B。最大的提升出现在 Ext. 和 Rm. 上——这两项都需要保持身份一致性的源图像保留——这验证了第 5.3 节中 tokenizer 阶段的源-目标交互。凭借 7B 主干网络,Hydra-X 在 G-SC/G-Over. 指标上仅落后 Qwen-Image-20B /;各维度得分见附录表 12。

7 结论

我们提出了 Hydra-X,这是首个将图像和视频 tokenization 统一在单个 ViT 中的原生 UMM 框架。Hydra-XTok 中的三个反直觉设计选择——帧级因果管状注意力、分层时间分块以及用于双图像-视频教师监督的解压缩器——高效地将图像 tokenizer 转变为视频和图像 tokenizer。我们没有将图像编辑视为纯粹的 LLM 侧问题,而是巧妙地将我们的视频时间因果机制重新用于将源图像和目标图像作为长度为 2 的片段进行处理。这恢复了在先前独立编码流程中根本丢失的细粒度潜在级耦合。通过这种统一设计,视觉 tokenizer 超越了其作为静态图像编码器的传统角色,演变为一个整体的图像和视频接口,在单个共享主干网络下统一了五项任务。

参考文献

  • Bai 等人 (2025) Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang, Peng Wang, Shijie Wang, Jun Tang, 等. Qwen2.5-vl 技术报告. arXiv 预印本 arXiv:2502.13923, 2025.
  • Betker 等人 (2023) James Betker, Gabriel Goh, Li Jing, Tim Brooks, Jianfeng Wang, Linjie Li, Long Ouyang, Juntang Zhuang, Joyce Lee, Yufei Guo, Wesam Manassra, Prafulla Dhariwal, Casey Chu, Yunxin Jiao, 和 Aditya Ramesh. 通过更好的描述改进图像生成. OpenAI 技术报告, 2023. URL https://cdn.openai.com/papers/dall-e-3.pdf.
  • Chen 等人 (2025a) Jiuhai Chen, Zhiyang Xu, Xichen Pan, Yushi Hu, Can Qin, Tom Goldstein, Lifu Huang, Tianyi Zhou, Saining Xie, Silvio Savarese 等。Blip3-o:一个完全开放的统一多模态模型家族——架构、训练与数据集。arXiv 预印本 arXiv:2505.09568,2025a。
  • Chen 等人 (2025b) Xiaokang Chen, Zhiyu Wu, Xingchao Liu, Zizheng Pan, Wen Liu, Zhenda Xie, Xingkai Yu, 和 Chong Ruan。Janus-pro:通过数据和模型规模扩展实现统一多模态理解与生成。arXiv 预印本 arXiv:2501.17811,2025b。
  • Cheng 等人 (2024) Zesen Cheng, Sicong Leng, Hang Zhang, Yifei Xin, Xin Li, Guanzheng Chen, Yongxin Zhu, Wenqi Zhang, Ziyang Luo, Deli Zhao 等。Videollama 2:推进视频大语言模型中的时空建模与音频理解。arXiv 预印本 arXiv:2406.07476,2024。
  • Deitke 等人 (2025) Matt Deitke, Christopher Clark, Sangho Lee, Rohun Tripathi, Yue Yang, Jae Sung Park, Mohammadreza Salehi, Niklas Muennighoff, Kyle Lo, Luca Soldaini, Jiasen Lu, Taira Anderson, Erin Bransom, Kiana Ehsani, Huong Ngo, YenSung Chen, Ajay Patel, Mark Yatskar, Chris Callison-Burch, Andrew Head, Rose Hendrix, Favyen Bastani, Eli VanderBilt, Nathan Lambert, Yvonne Chou, Arnavi Chheda, Jenna Sparks, Sam Skjonsberg, Michael Schmitz, Aaron Sarnat, Byron Bischoff, Pete Walsh, Chris Newell, Piper Wolters, Tanmay Gupta, Kuo-Hao Zeng, Jon Borchardt, Dirk Groeneveld, Crystal Nam, Sophie Lebrecht, Caitlin Wittlif, Carissa Schoenick, Oscar Michel, Ranjay Krishna, Luca Weihs, Noah A. Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, 和 Aniruddha Kembhavi。Molmo 和 PixMo:面向最先进视觉语言模型的开放权重与开放数据。载于《IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集》,第 91–104 页,2025 年 6 月。
  • Deng 等人 (2025) Chaorui Deng, Deyao Zhu, Kunchang Li, Chenhui Gou, Feng Li, Zeyu Wang, Shu Zhong, Weihao Yu, Xiaonan Nie, Ziang Song 等。统一多模态预训练中的涌现特性。arXiv 预印本 arXiv:2505.14683,2025。
  • Esser 等人(2024)Patrick Esser、Sumith Kulal、Andreas Blattmann、Rahim Entezari、Jonas Müller、Harry Saini、Yam Levi、Dominik Lorenz、Axel Sauer、Frederic Boesel 等。面向高分辨率图像合成的缩放整流流 Transformer 架构。第四十一届国际机器学习大会,2024 年。
  • Fan 等人(2025)Lijie Fan、Luming Tang、Siyang Qin、Tianhong Li、Xuan Yang、Siyuan Qiao、Andreas Steiner、Chen Sun、Yuanzhen Li、Tao Zhu 等。基于连续 token 的统一自回归视觉生成与理解。arXiv 预印本 arXiv:2503.13436,2025 年。
  • Fu 等人(2023)Chaoyou Fu、Peixian Chen、Yunhang Shen、Yulei Qin、Mengdan Zhang、Xu Lin、Jinrui Yang、Xiawu Zheng、Ke Li、Xing Sun 等。MME:多模态大语言模型的综合评估基准。arXiv 预印本 arXiv:2306.13394,2023 年。
  • Fu 等人(2025)Chaoyou Fu、Yuhan Dai、Yongdong Luo、Lei Li、Shuhuai Ren、Renrui Zhang、Zihan Wang、Chenyu Zhou、Yunhang Shen、Mengdan Zhang 等。Video-MME:首个面向视频分析的多模态大语言模型综合评估基准。收录于计算机视觉与模式识别会议论文集,第 24108–24118 页,2025 年。
  • Ge 等人(2024)Yuying Ge、Sijie Zhao、Jinguo Zhu、Yixiao Ge、Kun Yi、Lin Song、Chen Li、Xiaohan Ding、Ying Shan。SEED-X:具备统一多粒度理解与生成能力的多模态模型。arXiv 预印本 arXiv:2404.14396,2024 年。
  • Ghosh 等人(2023)Dhruba Ghosh、Hannaneh Hajishirzi、Ludwig Schmidt。Geneval:面向文本到图像对齐评估的以对象为中心的框架。神经信息处理系统进展,36:52132–52152,2023 年。
  • Huang 等人(2024)Ziqi Huang、Yinan He、Jiashuo Yu、Fan Zhang、Chenyang Si、Yuming Jiang、Yuanhan Zhang、Tianxing Wu、Qingyang Jin、Nattapol Chanpaisit 等。VBench:视频生成模型的综合基准套件。收录于 IEEE/CVF 计算机视觉与模式识别会议论文集,第 21807–21818 页,2024 年。
  • Huang 等人 (2025) 黄子源、郑丹丹、邹成、刘睿、王晓龙、季凯翔、柴伟龙、孙建新、王立彬、吕永杰等。明-统一视觉:基于统一连续分词器的联合图像理解与生成。arXiv 预印本 arXiv:2510.06590,2025 年。
  • Kembhavi 等人 (2016) Aniruddha Kembhavi、Mike Salvato、Eric Kolve、Minjoon Seo、Hannaneh Hajishirzi 和 Ali Farhadi。一图胜千言。载于欧洲计算机视觉会议论文集,第 235–251 页。Springer,2016 年。
  • Kong 等人 (2024) 魏杰·孔、田奇、张子健、Rox Min、戴卓卓、周进、熊江峰、李鑫、吴波、张建伟等。混元视频:大型视频生成模型的系统框架。arXiv 预印本 arXiv:2412.03603,2024 年。
  • Labs 等人 (2025) Black Forest Labs、Stephen Batifol、Andreas Blattmann、Frederic Boesel、Saksham Consul、Cyril Diagne、Tim Dockhorn、Jack English、Zion English、Patrick Esser 等。Flux.1 Kontext:潜空间中上下文图像生成与编辑的流匹配。arXiv 预印本 arXiv:2506.15742,2025 年。
  • Li 等人 (2024a) 李博、张元翰、郭栋、张任瑞、李峰、张浩、张开晨、张培源、李彦伟、刘子维等。Llava-OneVision:轻松实现视觉任务迁移。arXiv 预印本 arXiv:2408.03326,2024a。
  • Li 等人 (2024b) 李东旭、刘宇东、吴浩宁、王悦、沈志奇、曲博文、牛欣瑶、王国印、陈蓓、李俊男。Aria:一个开放的原生多模态混合专家模型。arXiv 预印本 arXiv:2410.05993,2024b。
  • Li 等人 (2025) 李涵、彭新宇、王耀明、彭泽林、陈鑫、翁荣祥、王金港、蔡勋梁、戴文睿、熊红凯。OneCat:用于统一理解与生成的纯解码器自回归模型。arXiv 预印本 arXiv:2509.03498,2025 年。
  • Li 等人 (2024c) 李坤昌、王亚丽、何一男、李一卓、王毅、刘毅、王尊、徐继兰、陈果、罗平等。MVBench:一个全面的多模态视频理解基准。载于 IEEE/CVF 计算机视觉与模式识别会议论文集,第 22195–22206 页,2024c。
  • Liang 等人(2024)Weixin Liang、Lili Yu、Liang Luo、Srinivasan Iyer、Ning Dong、Chunting Zhou、Gargi Ghosh、Mike Lewis、Wen-tau Yih、Luke Zettlemoyer 和 Xi Victoria Lin。混合 Transformer:一种面向多模态基础模型的稀疏可扩展架构。arXiv 预印本 arXiv:2411.04996,2024 年。
  • Liao 等人(2025)Chao Liao、Liyang Liu、Xun Wang、Zhengxiong Luo、Xinyu Zhang、Wenliang Zhao、Jie Wu、Liang Li、Zhi Tian 和 Weilin Huang。Mogao:一种面向交错多模态生成的全面基础模型。arXiv 预印本 arXiv:2505.05472,2025 年。
  • Lin 等人(2025a)Bin Lin、Zongjian Li、Xinhua Cheng、Yuwei Niu、Yang Ye、Xianyi He、Shenghai Yuan、Wangbo Yu、Shaodong Wang、Yunyang Ge 等。Uniworld:面向统一视觉理解与生成的高分辨率语义编码器。arXiv 预印本 arXiv:2506.03147,2025a。
  • Lin 等人(2025b)Haokun Lin、Teng Wang、Yixiao Ge、Yuying Ge、Zhichao Lu、Ying Wei、Qingfu Zhang、Zhenan Sun 和 Ying Shan。Toklip:将视觉 token 与 CLIP 结合以实现多模态理解与生成。arXiv 预印本 arXiv:2505.05422,2025b。
  • Lin 等人(2024)Ji Lin、Hongxu Yin、Wei Ping、Pavlo Molchanov、Mohammad Shoeybi 和 Song Han。Vila:关于视觉语言模型的预训练。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》,第 26689–26699 页,2024 年。
  • Lipman 等人(2022)Yaron Lipman、Ricky TQ Chen、Heli Ben-Hamu、Maximilian Nickel 和 Matt Le。用于生成式建模的流匹配。arXiv 预印本 arXiv:2210.02747,2022 年。
  • Liu 等人(2023a)Haotian Liu、Chunyuan Li、Yuheng Li 和 Yong Jae Lee。通过视觉指令微调改进基线,2023a。
  • Liu 等人(2023b)Haotian Liu、Chunyuan Li、Qingyang Wu 和 Yong Jae Lee。视觉指令微调。《神经信息处理系统进展》,36:34892–34916,2023b。
  • Liu 等人(2025a)Shiyu Liu、Yucheng Han、Peng Xing、Fukun Yin、Rui Wang、Wei Cheng、Jiaqi Liao、Yingming Wang、Honghao Fu、Chunrui Han 等。Step1x-Edit:一种面向通用图像编辑的实用框架。arXiv 预印本 arXiv:2504.17761,2025a。
  • Liu 等人 (2024a) Yuan Liu, Haodong Duan, Yuanhan Zhang, Bo Li, Songyang Zhang, Wangbo Zhao, Yike Yuan, Jiaqi Wang, Conghui He, Ziwei Liu 等。MMBench:你的多模态模型是全能选手吗?载于《欧洲计算机视觉会议》,第 216–233 页。Springer, 2024a。
  • Liu 等人 (2024b) Yuliang Liu, Zhang Li, Mingxin Huang, Biao Yang, Wenwen Yu, Chunyuan Li, Xu-Cheng Yin, Cheng-Lin Liu, Lianwen Jin, 和 Xiang Bai。OCRBench:大型多模态模型中 OCR 的隐藏奥秘。《中国科学:信息科学》,67(12):220102, 2024b。
  • Liu 等人 (2025b) Zhiheng Liu, Weiming Ren, Haozhe Liu, Zijian Zhou, Shoufa Chen, Haonan Qiu, Xiaoke Huang, Zhaochong An, Fanny Yang, Aditya Patel 等。Tuna:驯服统一视觉表示以构建原生统一多模态模型。arXiv 预印本 arXiv:2512.02014, 2025b。
  • Lu 等人 (2025) Jiasen Lu, Liangchen Song, Mingze Xu, Byeongjoo Ahn, Yanjun Wang, Chen Chen, Afshin Dehghan, 和 Yinfei Yang。AToken:面向视觉的统一分词器。arXiv 预印本 arXiv:2509.14476, 2025。
  • Ma 等人 (2025a) Chuofan Ma, Yi Jiang, Junfeng Wu, Jihan Yang, Xin Yu, Zehuan Yuan, Bingyue Peng, 和 Xiaojuan Qi。UniTok:面向视觉生成与理解的统一分词器。arXiv 预印本 arXiv:2502.20321, 2025a。
  • Ma 等人 (2025b) Shijie Ma, Yuying Ge, Teng Wang, Yuxin Guo, Yixiao Ge, 和 Ying Shan。GenHancer:不完美的生成模型是秘密的强大视觉中心增强器。arXiv 预印本 arXiv:2503.19480, 2025b。
  • Ma 等人 (2025c) Yiyang Ma, Xingchao Liu, Xiaokang Chen, Wen Liu, Chengyue Wu, Zhiyu Wu, Zizheng Pan, Zhenda Xie, Haowei Zhang, Xingkai Yu 等。JanusFlow:协调自回归与修正流以实现统一多模态理解与生成。载于《计算机视觉与模式识别会议论文集》,第 7739–7751 页, 2025c。
  • Masry 等人 (2022) Ahmed Masry, Xuan Long Do, Jia Qing Tan, Shafiq Joty, 和 Enamul Hoque。ChartQA:一个基于视觉和逻辑推理的图表问答基准。载于《计算语言学协会会议发现:ACL 2022》,第 2263–2279 页, 2022。
  • Mathew 等人 (2021) Minesh Mathew、Dimosthenis Karatzas 和 C. V. Jawahar。Docvqa:面向文档图像的 VQA 数据集。载于《IEEE/CVF 冬季计算机视觉应用会议论文集》(WACV),第 2200–2209 页,2021 年。
  • Mathew 等人 (2022) Minesh Mathew、Viraj Bagal、Rubèn P Tito、Dimosthenis Karatzas、Ernest Valveny 和 C. V. Jawahar。InfographicVQA。载于《IEEE/CVF 冬季计算机视觉应用会议论文集》(WACV),第 1697–1706 页,2022 年。
  • Niu 等人 (2025) Yuwei Niu、Munan Ning、Mengren Zheng、Weiyang Jin、Bin Lin、Peng Jin、Jiaqi Liao、Chaoran Feng、Kunpeng Ning、Bin Zhu 等。Wise:面向文生图的世界知识驱动语义评估。arXiv 预印本 arXiv:2503.07265,2025 年。
  • OpenAI (2023) OpenAI。GPT-4V(ision) 系统卡,2023 年。URL:https://cdn.openai.com/papers/GPTV_System_Card.pdf。
  • OpenAI (2024) OpenAI。GPT-4o。https://openai.com/index/hello-gpt-4o/,2024 年。
  • Pan 等人 (2025) Xichen Pan、Satya Narayan Shukla、Aashu Singh、Zhuokai Zhao、Shlok Kumar Mishra、Jialiang Wang、Zhiyang Xu、Jiuhai Chen、Kunpeng Li、Felix Juefei-Xu 等。基于元查询的模态间迁移。arXiv 预印本 arXiv:2504.06256,2025 年。
  • Qiu 等人 (2026) Xuerui Qiu、Yutao Cui、Guozhen Zhang、Junzhe Li、JiaKui Hu、Xiao Zhang、Yang Li、Songtao Liu、Miles Yang、Yu Shi 等。Hydra:通过表示协调的 token 化统一多模态生成与理解。arXiv 预印本 arXiv:2603.15228,2026 年。
  • Qu 等人 (2025) Liao Qu、Huichao Zhang、Yiheng Liu、Xu Wang、Yi Jiang、Yiming Gao、Hu Ye、Daniel K Du、Zehuan Yuan 和 Xinglong Wu。Tokenflow:面向多模态理解与生成的统一图像 token 化器。载于《计算机视觉与模式识别会议论文集》,第 2545–2555 页,2025 年。
  • Rombach 等人 (2022) Robin Rombach、Andreas Blattmann、Dominik Lorenz、Patrick Esser 和 Björn Ommer。基于潜在扩散模型的高分辨率图像合成。载于《IEEE/CVF 计算机视觉与模式识别会议论文集》,第 10684–10695 页,2022 年。
  • Russakovsky 等人(2014 年)Olga Russakovsky、Jia Deng、Hao Su、Jonathan Krause、Sanjeev Satheesh、Sean Ma、Zhiheng Huang、Andrej Karpathy、Aditya Khosla、Michael S. Bernstein、Alexander C. Berg 和 Li Fei-Fei。ImageNet 大规模视觉识别挑战赛。《国际计算机视觉杂志》,115:211–252,2014 年。
  • Song 等人(2025 年)Wei Song、Yuran Wang、Zijia Song、Yadong Li、Haoze Sun、Weipeng Chen、Zenan Zhou、Jianhua Xu、Jiaqi Wang 和 Kaicheng Yu。Dualtoken:通过双视觉词表统一视觉理解与生成。arXiv 预印本,编号 2503.14324,2025 年。
  • Su 等人(2024 年)Jianlin Su、Murtadha Ahmed、Yu Lu、Shengfeng Pan、Wen Bo 和 Yunfeng Liu。Roformer:基于旋转位置编码的增强型 Transformer 架构。《神经计算》,568:127063,2024 年。
  • Tang 等人(2025 年)Hao Tang、Chenwei Xie、Xiaoyi Bao、Tingyu Weng、Pandeng Li、Yun Zheng 和 Liwei Wang。UniLIP:适配 CLIP 实现统一的多模态理解、生成与编辑。arXiv 预印本,编号 2507.23278,2025 年。
  • Team(2024 年)Chameleon 团队。Chameleon:混合模态早期融合基础模型。arXiv 预印本,编号 2405.09818,2024 年。
  • Team 等人(2024 年)Gemini 团队、Petko Georgiev、Ving Ian Lei、Ryan Burnell、Libin Bai、Anmol Gulati、Garrett Tanzer、Damien Vincent、Zhufeng Pan、Shibo Wang 等。Gemini 1.5:解锁跨越数百万 token 上下文的的多模态理解能力。arXiv 预印本,编号 2403.05530,2024 年。
  • Tong 等人(2025 年)Shengbang Tong、David Fan、Jiachen Zhu、Yunyang Xiong、Xinlei Chen、Koustuv Sinha、Michael Rabbat、Yann LeCun、Saining Xie 和 Zhuang Liu。Metamorph:通过指令微调实现多模态理解与生成。载于《IEEE/CVF 国际计算机视觉大会论文集》,2025 年。
  • Tong 等人(2026a 年)Shengbang Tong、David Fan、John Nguyen、Ellis Brown、Gaoyue Zhou、Shengyi Qian、Boyang Zheng、Théophane Vallaeys、Junlin Han、Rob Fergus 等。超越语言建模:多模态预训练探索。arXiv 预印本,编号 2603.03276,2026a 年。
  • Tong 等人 (2026b) 沈邦通、郑博阳、王子腾、唐冰达、马南野、Ellis Brown、杨继涵、Rob Fergus、Yann LeCun 和谢赛宁。利用表示自编码器扩展文本到图像扩散 Transformer。arXiv 预印本 arXiv:2601.16208,2026b。
  • Tschannen 等人 (2025) Michael Tschannen、Alexey Gritsenko、Xiao Wang、Muhammad Ferjad Naeem、Ibrahim Alabdulmohsin、Nikhil Parthasarathy、Talfan Evans、Lucas Beyer、Ye Xia、Basil Mustafa 等人。Siglip 2:具有改进语义理解、定位和密集特征的多语言视觉语言编码器。arXiv 预印本 arXiv:2502.14786,2025。
  • Wan 等人 (2025) Team Wan、Ang Wang、Baole Ai、Bin Wen、Chaojie Mao、陈伟谢、Di Chen、Feiwu Yu、Haiming Zhao、Jianxiao Yang、Jianyuan Zeng、Jiayu Wang、Jingfeng Zhang、Jingren Zhou、Jinkai Wang、Jixuan Chen、Kai Zhu、Kang Zhao、Keyu Yan、Lianghua Huang、Mengyang Feng、Ningyi Zhang、Pandeng Li、Pingyu Wu、Ruihang Chu、Ruili Feng、Shiwei Zhang、Siyang Sun、Tao Fang、Tianxing Wang、Tianyi Gui、Tingyu Weng、Tong Shen、Wei Lin、Wei Wang、Wei Wang、Wenmeng Zhou、Wente Wang、Wenting Shen、Wenyuan Yu、Xianzhong Shi、Xiaoming Huang、Xin Xu、Yan Kou、Yangyu Lv、Yifei Li、Yijing Liu、Yiming Wang、Yingya Zhang、Yitong Huang、Yong Li、You Wu、Yu Liu、Yulin Pan、Yun Zheng、Yuntao Hong、Yupeng Shi、Yutong Feng、Zeyinzi Jiang、Zhen Han、智凡吴和 Ziyu Liu。Wan:开放且先进的大规模视频生成模型。arXiv 预印本 arXiv:2503.20314,2025。
  • Wang 等人 (2025a) 陈廷王、Yuhan Zhu、Yicheng Xu、Jiange Yang、Lang Lin、Ziang Yan、Yali Wang、Yi Wang 和 Limin Wang。InternVideo-Next:迈向无需视频文本监督的通用视频基础模型。arXiv 预印本 arXiv:2512.01342,2025a。
  • Wang 等人 (2025b) Dianyi Wang、Wei Song、Yikun Wang、Siyuan Wang、Kaicheng Yu、Zhongyu Wei 和 Jiaqi Wang。自回归语义视觉重建帮助视觉语言模型更好地理解。arXiv 预印本 arXiv:2506.09040,2025b。
  • Wang 等人 (2024a) Haochen Wang、Anlin Zheng、Yucheng Zhao、Tiancai Wang、Zheng Ge、Xiangyu Zhang 和 Zhaoxiang Zhang。重建式视觉指令微调。arXiv 预印本 arXiv:2410.09575,2024a。
  • Wang 等人 (2024b) Junke Wang, Yi Jiang, Zehuan Yuan, Bingyue Peng, Zuxuan Wu, 和 Yu-Gang Jiang。Omnitokenizer:一种用于视觉生成的联合图像-视频分词器。《神经信息处理系统进展》,第37卷,第28281–28295页,2024b。
  • Wang 等人 (2023) Limin Wang, Bingkun Huang, Zhiyu Zhao, Zhan Tong, Yinan He, Yi Wang, Yali Wang, 和 Yu Qiao。Videomae v2:通过双重掩码扩展视频掩码自编码器。载于《IEEE/CVF计算机视觉与模式识别会议论文集》,第14549–14560页,2023年6月。
  • Wang 等人 (2025c) Weihan Wang, Zehai He, Wenyi Hong, Yean Cheng, Xiaohan Zhang, Ji Qi, Ming Ding, Xiaotao Gu, Shiyu Huang, Bin Xu 等。Lvbench:一个极长视频理解基准。载于《IEEE/CVF国际计算机视觉会议论文集》,第22958–22967页,2025c。
  • Wang 等人 (2024c) Xinlong Wang, Xiaosong Zhang, Zhengxiong Luo, Quan Sun, Yufeng Cui, Jinsheng Wang, Fan Zhang, Yueze Wang, Zhen Li, Qiying Yu 等。Emu3:下一个 token 预测即是一切。arXiv 预印本 arXiv:2409.18869,2024c。
  • Wang 等人 (2022) Yi Wang, Kunchang Li, Yizhuo Li, Yinan He, Bingkun Huang, Zhiyu Zhao, Hongjie Zhang, Jilan Xu, Yi Liu, Zun Wang 等。Internvideo:通过生成式与判别式学习构建通用视频基础模型。arXiv 预印本 arXiv:2212.03191,2022。
  • Wu 等人 (2025a) Chenfei Wu, Jiahao Li, Jingren Zhou, Junyang Lin, Kaiyuan Gao, Kun Yan, Sheng-ming Yin, Shuai Bai, Xiao Xu, Yilei Chen 等。通义千问图像技术报告。arXiv 预印本 arXiv:2508.02324,2025a。
  • Wu 等人 (2025b) Chengyue Wu, Xiaokang Chen, Zhiyu Wu, Yiyang Ma, Xingchao Liu, Zizheng Pan, Wen Liu, Zhenda Xie, Xingkai Yu, Chong Ruan 等。Janus:解耦视觉编码以实现统一的多模态理解与生成。载于《计算机视觉与模式识别会议论文集》,第12966–12977页,2025b。
  • Wu 等人 (2025c) Chenyuan Wu, Pengfei Zheng, Ruiran Yan, Shitao Xiao, Xin Luo, Yueze Wang, Wanli Li, Xiyan Jiang, Yexin Liu, Junjie Zhou 等。Omnigen2:探索先进多模态生成。arXiv 预印本 arXiv:2506.18871,2025c。
  • Wu 等人 (2024a) Haoning Wu, Dongxu Li, Bei Chen, 和 Junnan Li。Longvideobench:面向长上下文交错视频-语言理解的基准测试。《神经信息处理系统进展》,37:28828–28857,2024a。
  • Wu 等人 (2025d) Size Wu, Wenwei Zhang, Lumin Xu, Sheng Jin, Zhonghua Wu, Qingyi Tao, Wentao Liu, Wei Li, 和 Chen Change Loy。协调视觉表征以实现统一的多模态理解与生成。arXiv 预印本 arXiv:2503.21979,2025d。
  • Wu 等人 (2024b) Yecheng Wu, Zhuoyang Zhang, Junyu Chen, Haotian Tang, Dacheng Li, Yunhao Fang, Ligeng Zhu, Enze Xie, Hongxu Yin, Li Yi, 等人。Vila-u:一个整合视觉理解与生成的统一基础模型。arXiv 预印本 arXiv:2409.04429,2024b。
  • Xiao 等人 (2025a) Shitao Xiao, Yueze Wang, Junjie Zhou, Huaying Yuan, Xingrun Xing, Ruiran Yan, Chaofan Li, Shuting Wang, Tiejun Huang, 和 Zheng Liu。Omnigen:统一图像生成。载于《计算机视觉与模式识别会议论文集》,第 13294–13304 页,2025a。
  • Xiao 等人 (2025b) Yicheng Xiao, Lin Song, Rui Yang, Cheng Cheng, Zunnan Xu, Zhaoyang Zhang, Yixiao Ge, Xiu Li, 和 Ying Shan。Haploomni:面向多模态视频理解与生成的统一单 Transformer 架构。arXiv 预印本 arXiv:2506.02975,2025b。
  • Xie 等人 (2024) Jinheng Xie, Weijia Mao, Zechen Bai, David Junhao Zhang, Weihao Wang, Kevin Qinghong Lin, Yuchao Gu, Zhijie Chen, Zhenheng Yang, 和 Mike Zheng Shou。Show-o:用单个 Transformer 统一多模态理解与生成。arXiv 预印本 arXiv:2408.12528,2024。
  • Xie 等人 (2025a) Jinheng Xie, Zhenheng Yang, 和 Mike Zheng Shou。Show-o2:改进的原生统一多模态模型。arXiv 预印本 arXiv:2506.15564,2025a。
  • Xie 等人 (2025b) Rongchang Xie, Chen Du, Ping Song, 和 Chang Liu。Muse-vl:通过语义离散编码建模统一视觉语言模型。载于《IEEE/CVF 国际计算机视觉会议论文集》,第 24135–24146 页,2025b。
  • Xu 等人 (2024) Lin Xu, Yilin Zhao, Daquan Zhou, Zhijie Lin, See Kiong Ng, 和 Jiashi Feng。Pllava:从图像到视频的无参数 LLava 扩展,用于视频密集描述。arXiv 预印本 arXiv:2404.16994,2024。
  • 杨等人(2024a)杨安、杨宝松、张北辰、惠彬元、郑波、于博文、李成远、刘大恒、黄飞、魏浩然、林欢、杨健、涂建红、张建伟、杨建新、杨佳曦、周靖人、林俊阳、党凯、卢克明、鲍克勤、杨可欣、余乐、李梅、薛明峰、张培、朱琴、门睿、林润基、李天浩、夏廷宇、任兴章、任宣成、范阳、苏阳、张一昌、万宇、刘玉琼、崔泽宇、张振儒、邱子涵。Qwen2.5 技术报告。arXiv 预印本 arXiv:2412.15115,2024a。
  • 杨等人(2024b)杨卓异、滕嘉彦、郑文迪、丁明、黄诗宇、徐嘉正、杨元明、洪文逸、张晓涵、冯冠宇 等。Cogvideox:基于专家 Transformer 的文本到视频扩散模型。arXiv 预印本 arXiv:2408.06072,2024b。
  • 姚等人(2025a)姚景峰、宋宇达、周宇聪、王兴刚。面向可扩展的视觉分词器预训练以支持生成任务。arXiv 预印本 arXiv:2512.13687,2025a。
  • 姚等人(2025b)姚景峰、杨斌、王兴刚。重建与生成:驯服潜在扩散模型中的优化困境。载于《计算机视觉与模式识别会议论文集》,第 15703–15712 页,2025b。
  • 叶等人(2025)叶阳、何贤毅、李宗健、林彬、袁胜海、严志远、侯博涵、袁丽。Imgedit:统一的图像编辑数据集与基准。arXiv 预印本 arXiv:2505.20275,2025。
  • 余等人(2023)余立军、José Lezama、Nitesh B Gundavarapu、Luca Versari、Kihyuk Sohn、David Minnen、程勇、Vighnesh Birodkar、Agrim Gupta、Xiuye Gu 等。语言模型击败扩散——分词器是视觉生成的关键。arXiv 预印本 arXiv:2310.05737,2023。
  • 余等人(2024)余思贤、郭相均、张辉元、郑钟宪、Jonathan Huang、金宇硕、谢赛宁。面向生成的表征对齐:训练扩散 Transformer 比想象中更简单。arXiv 预印本 arXiv:2410.06940,2024。
  • Yue 等人 (2024) Xiang Yue, Yuansheng Ni, Kai Zhang, Tianyu Zheng, Ruoqi Liu, Ge Zhang, Samuel Stevens, Dongfu Jiang, Weiming Ren, Yuxuan Sun, 等. Mmmu: 面向专家级 AGI 的大规模多学科多模态理解与推理基准. 收录于 IEEE/CVF 计算机视觉与模式识别会议论文集, 第 9556–9567 页, 2024.
  • Yue 等人 (2025) Zhengrong Yue, Haiyu Zhang, Xiangyu Zeng, Boyu Chen, Chenting Wang, Shaobin Zhuang, Lu Dong, KunPeng Du, Yi Wang, Limin Wang, 等. Uniflow: 面向视觉理解与生成的统一像素流分词器. arXiv 预印本 arXiv:2510.10575, 2025.
  • Zhang 等人 (2023) Lvmin Zhang, Anyi Rao, 和 Maneesh Agrawala. 为文本到图像扩散模型添加条件控制. 收录于 ICCV, 2023.
  • Zhang 等人 (2024a) Pan Zhang, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Rui Qian, Lin Chen, Qipeng Guo, Haodong Duan, Bin Wang, Linke Ouyang, 等. Internlm-xcomposer-2.5: 一个支持长上下文输入与输出的多功能大型视觉语言模型. arXiv 预印本 arXiv:2407.03320, 2024a.
  • Zhang 等人 (2024b) Peiyuan Zhang, Kaichen Zhang, Bo Li, Guangtao Zeng, Jingkang Yang, Yuanhan Zhang, Ziyue Wang, Haoran Tan, Chunyuan Li, 和 Ziwei Liu. 从语言到视觉的长上下文迁移. arXiv 预印本 arXiv:2406.16852, 2024b.
  • Zhang 等人 (2025) Yuanhan Zhang, Jinming Wu, Wei Li, Bo Li, Zejun MA, Ziwei Liu, 和 Chunyuan Li. LLaVA-video: 基于合成数据的视频指令微调. 机器学习研究汇刊, 2025. ISSN 2835-8856. URL https://openreview.net/forum?id=EElFGvt39K.
  • Zheng 等人 (2025) Boyang Zheng, Nanye Ma, Shengbang Tong, 和 Saining Xie. 基于表示自编码器的扩散 Transformer. arXiv 预印本 arXiv:2510.11690, 2025.
  • Zhou 等人 (2024) Chunting Zhou, Lili Yu, Arun Babu, Kushal Tirumala, Michihiro Yasunaga, Leonid Shamis, Jacob Kahn, Xuezhe Ma, Luke Zettlemoyer, 和 Omer Levy. Transfusion: 使用单一多模态模型预测下一个 token 并扩散图像. arXiv 预印本 arXiv:2408.11039, 2024.

附录 A 训练细节

A.1 分词器训练损失

Hydra-XTok 被设计为 Hydra-X 的视觉接口:在任何 token 到达大语言模型之前,它必须足够紧凑以支持生成、足够保真以支持重建、且足够语义化以支持理解。我们从 SigLIP 2(Tschannen 等人,2025)初始化 Gen-ViT 和 Sem-ViT。该分词器通过一个重建项和一个语义蒸馏项进行训练:

其中 是下文详述的重建项,该项将 Sem-ViT 特征与图像和视频教师模型对齐(公式 3)。

为了在保持紧凑隐空间的同时兼顾像素保真度和结构稳定性,重建项涵盖了像素级恢复、感知保真度和隐空间正则化。具体而言,它结合了用于直接像素空间重建的 L1 损失、LPIPS 感知损失、用于优化纹理真实感的对抗性 GAN 损失,以及将后验分布对齐到标准正态先验的 Kullback–Leibler(KL)散度惩罚项。综合重建目标函数公式如下:

(7)

其中 和 分别为原始图像与重建图像,而 和 分别为压缩隐空间的均值和对数方差。

A.2 分词器预训练

Hydra-XTok 通过三个渐进阶段进行训练,以平衡基础表征学习与高保真生成质量:

阶段 1:基础训练。

从 SigLIP-2 初始化后,Hydra-XTok 首先在分辨率 下的 ImageNet-1.2M 数据集上进行训练。随后我们过渡到混合分辨率训练,将视频与像素范围从 到 的图像相结合。这一策略使分词器能够有效泛化到高分辨率视频。我们使用 AdamW 优化器以峰值学习率 对模型进行 k 次迭代优化,并采用混合 SigLIP-2 / InternVideo 教师模型进行蒸馏。

阶段 2:解码器精调。

为增强纹理真实感和感知保真度,我们冻结编码器,仅微调 层 ViT 解码器。此阶段引入对抗训练(GAN 损失),以显著改善视觉重建效果。

阶段 3:表征协调。

在最后阶段,我们首先计算 Gen-ViT 潜在特征的通道均值和标准差。然后我们冻结 Gen-ViT 和解码器,同时解冻 Sem-ViT。Gen-ViT 特征在输入 Sem-ViT 和解码器之前会被归一化;在此过程中,只有 Sem-ViT 被更新。这种归一化消除了两个头部之间的特征异质性,并建立了一个统一的、具备语义感知能力且能够忠实重建的潜在空间,这对于下游的 UMM 任务至关重要。

A.3 原生统一多模态模型预训练

媒体内容 · 前往原文查看
表 8:Hydra-X 的训练细节与计算成本。Hydra-XTok 预训练在 256 小时 GPU 上额外需要 24 小时。数据比例表示 文本:图像描述:图像生成:视频描述:视频 SFT:图像 SFT:编辑。

设置 阶段 1 阶段 2 阶段 3 视觉头部: 视觉头部: 视觉头部:学习率 Sem-ViT:大语言模型 & Sem-ViT:大语言模型 & Sem-ViT:基础分辨率 256 512 1024 批次大小 1024 1024 1024 任务 图像(理解与生成)+ 视频 & 编辑 + 文本理解 数据比例 0:1:3:0:0:0:0 0:2:6:1:1:0:0 1:0:3:3:0:1:3 硬件 256 块 GPU 512 块 GPU 512 块 GPU 训练步数 50K 200K 20K 时间成本 10 小时 96 小时 24 小时

为了培养 Hydra-X 的和谐统一特性,我们为统一多模态模型实施了一种三阶段渐进式训练策略。详细配置和计算成本总结于表 8。

阶段 1:统一表示对齐。

为了解决输入层面的表示差异,我们冻结大语言模型(Qwen2.5-7B-Instruct),并专门调整视觉组件(投影器、时间步嵌入和流头部)。利用 M 个图像-文本对,此阶段将视觉潜在空间与语言领域对齐,确保形成连贯统一的输入表示。

阶段 2:全面多模态预训练。

我们解锁所有参数,以在单一统一流中促进协调共促。该模型在平衡混合的 M 个理解样本和 M 个生成样本(从第一阶段策略性筛选而来)上进行联合优化。我们进一步将约 M 个图像编辑样本和 M 个视频样本纳入联合训练过程。这种全参数更新确保了学习过程的兼容性,并允许不同任务相互增强。

第三阶段:高质量指令微调。

最后阶段专注于使用精选数据集进行高保真度优化。对于多模态理解(MMU),我们采用了来自 LLaVA-OneVision(Li 等人,2024a)和 Pixmo(Deitke 等人,2025)的 M 个指令微调样本,以及来自 LLaVA-Video(Zhang 等人,2025)的 M 个视频指令微调样本。对于生成任务,我们使用了 M 个经过美学筛选的图像(源自第二阶段)和 M 个高保真合成图像。此外,我们继续在高质量图像编辑数据上进行训练,以进一步增强模型的精确控制能力。

A.4 消融实验训练细节

在我们的消融实验中,评估涵盖了三种核心能力,并具有特定设置:(i)多模态理解:我们使用 LLaVA-1.5 多模态理解数据集(Liu 等人,2023a)结合 LLaVA-Video SFT 数据集(Zhang 等人,2025)训练 Hydra-X。(ii)图像生成:我们使用 Qwen2.5-1.5B(Yang 等人,2024a)作为基础模型,首先在 M 个图像-文本对上进行训练,然后使用 ImgEdit 数据集进一步微调以获得图像编辑能力。(iii)图像重建:我们在 ImageNet-1k(120 万)数据集(Russakovsky 等人,2014)上训练 k 次迭代,并使用 rFID 评估质量。

附录 B 视觉重建

媒体内容 · 前往原文查看
表9:ImageNet、DAVIS和UCF数据集上的重建对比。所有方法均采用统一协议,使用其官方实现进行评估:输入图像被调整大小并中心裁剪至指定尺寸,指标使用相同脚本计算。压缩比沿空间轴和时间轴分别报告;纯图像分词器的压缩比。在每个子组内,加粗标记最佳结果,下划线标记次佳结果。†表示严格在ImageNet-1.2M数据集上训练的模型。

方法 压缩比 ImageNet DAVIS UCF 空间 时间 PSNR () SSIM () rFID () PSNR () SSIM () rFVD () PSNR () SSIM () rFVD () 纯生成分词器 SD-VAE (Rombach et al., 2022) 26.26 0.745 0.606 – – – – – – RAE† (Zheng et al., 2025) 18.05 0.500 2.040 – – – – – – FLUX.1 [dev] (Labs et al., 2025) 32.86 0.917 0.176 – – – – – – Qwen-Image (Wu et al., 2025a) 32.18 0.899 1.459 – – – – – – VAVAE† (Yao et al., 2025b) 27.70 0.798 0.279 – – – – – – Wan2.2 (Wan et al., 2025) 31.25 0.878 0.749 27.64 0.820 14.78 36.11 0.961 4.15 统一分词器 OmniTokenizer (Wang et al., 2024b) 26.74 0.824 1.023 24.30 0.737 113.56 29.20 0.931 38.15 Vila-U (Wu et al., 2024b) 22.24 0.612 4.231 – – – – – – UniTok (Ma et al., 2025a) 25.34 0.742 0.362 – – – – – – AToken-So/C (Stage 3) (Lu et al., 2025) 29.72 0.848 0.209 26.60 0.784 29.19 34.66 0.953 7.77 Hydra-XTok † 32.96 0.905 0.154 – – – – – – Hydra-XTok (Stage 3) 32.04 0.898 0.465 28.19 0.835 11.61 36.88 0.967 3.11

我们在统一协议下,将Hydra-XTok与三类分词器进行基准测试:纯图像生成VAE、视频VAE以及联合图像-视频分词器。所有输入被调整大小并中心裁剪至指定尺寸,指标使用相同脚本计算。表9报告了ImageNet、DAVIS和UCF数据集上的PSNR、SSIM以及rFID/rFVD指标。

为了将架构的影响与训练数据的影响分离开来,我们还报告了 Hydra-XTok†,这是一个受控变体,严格在 ImageNet-1.2M 上训练,以匹配 RAE† 和 VAVAE† 的数据预算。在这种数据匹配的设置下,Hydra-XTok† 在 ImageNet 的每一项指标上都大幅优于 RAE† 和 VAVAE†(例如,在 dB PSNR 上优于 VAVAE†)。更引人注目的是,尽管其压缩率是专用图像 VAE 的两倍,并且使用的训练数据严格更少,Hydra-XTok† 在 ImageNet PSNR( vs. )和 rFID( vs. )上仍然超过了图像 VAE FLUX.1,这表明性能提升源于整体的 ViT 设计,而非数据规模。完全训练后的 Hydra-XTok 是视频指标上最强的统一分词器:它在 DAVIS PSNR 上提升了 dB,在 UCF PSNR 上提升了 dB,优于之前的最佳模型 AToken-So/C,同时在两个数据集上的 rFVD 均降低了一半以上(DAVIS 上为 vs. ;UCF 上为 vs. )。在视频基准测试中,Hydra-XTok 也超越了专用视频 VAE Wan 2.2(DAVIS PSNR 为 dB,UCF PSNR 为 dB;rFVD 分别降低了 和 ),这表明采用分层分块(hierarchical patchify)的单一整体 ViT 是级联图像/视频设计的一种有竞争力的替代方案。

附录 C 多模态理解基准测试的评估细节

为全面评估 Hydra-X 的感知与推理能力,我们采用了九个不同的基准测试,涵盖通用理解、专家知识、文档/图表理解以及细粒度视觉感知。我们在 AI2D(Kembhavi 等人,2016)(测试集)、MME(Fu 等人,2023)(测试集)、MMMU(Yue 等人,2024)(验证集)、OCRBench(Liu 等人,2024b)(测试集)、MMBench(Liu 等人,2024a)(dev_en 集)、RealWorldQA(测试集)、ChartQA(Masry 等人,2022)(测试集)、DocVQA(Mathew 等人,2021)(验证集)和 InfoVQA(Mathew 等人,2022)(验证集)上进行了基准测试。表 4 将 Hydra-X 与相似规模的开源统一多模态模型进行了比较。总体而言,在大多数报告的指标上,Hydra-X 达到或超过了 7B 原生统一多模态模型基线,包括那些同时需要细粒度视觉细节(例如,字符笔画、表格单元格)和丰富语义结构(例如,布局和关系推理)的 OCR 和图表密集型任务,而 Hydra-XTok 的紧凑潜变量正是为保留这些信息而设计的。

附录 D 分词器阶段源-目标交互:视觉证据

第 5.3 节论证了分词器阶段的源-目标交互——将源和目标通过一个共享的、采用 tubelet 因果注意力的 Sem-ViT 联合路由,而不是独立编码它们——是实现身份保真图像编辑所缺失的关键要素。从量化角度看,这一单一改动在保持架构其他部分和参数量不变的情况下(表 3),恢复了近 dB 的源重建 PSNR。图 5 提供了定性方面的对应结果。

我们比较了 Hydra-X 的两个变体,它们仅在此路由步骤上有所不同:Hydra-X-Indep 通过两个独立的 Sem-ViT 分支对源和目标进行编码——这是 BAGEL、OmniGen2 及类似系统共享的传统流程——而 Hydra-X-STI 则通过一个共享的、采用 tubelet 因果注意力的 Sem-ViT 对这对数据进行路由,将其视为一个长度为 的片段。两个变体共享相同的 Gen-ViT、相同的 LLM 和相同的流匹配头部,且参数量和训练计划完全相同。

这种对比十分鲜明。在静物示例(第一行)中,Hydra-X-Indep 退化成了碎片化的马赛克,水果的位置、纹理和光照都在局部产生了模型幻觉;而 Hydra-X-STI 则近乎像素级完美地还原了原图。汽车示例(第二行)则清晰地揭示了独立编码的失败模式:Indep 变体将汽车“重新想象”成了另一辆车,移除了驾驶员和乘客,并抹去了屏幕上的文字;而 STI 变体则完整保留了整个场景,包括车内人员和可见的车牌。这些观察结果证实了第 5.3 节所分析的机制:在传统流程中,潜变量在大语言模型读取之前就已经丢失了身份敏感信息,因此即使是一个推理能力完美的大语言模型也无法忠实地还原源图像。STI 在分词器内部以零参数成本修复了这一瓶颈,这正是其在身份敏感编辑维度上能够持续保持优势的原因,相关结果已在表 7 和表 12 中报告。

Refer to caption
图 5:分词器阶段源-目标交互的定性效果。Hydra-X-Indep(源和目标采用独立的 Sem-ViT 编码,即传统流程)与 Hydra-X-STI(通过管状块因果注意力进行联合编码,即我们的方案)生成的源图像重建结果对比。这两个变体共享所有其他架构组件。尽管两个流程使用相同的大语言模型和相同数量的参数,Hydra-X-STI 保留了 Hydra-X-Indep 所丢失的身份敏感细节(物体布局、人物、屏幕文字)。

附录 E 局限性

首先,当前训练数据和模型参数的规模仍然是一个瓶颈,可能限制了模型捕捉高维视频分布全部复杂性的能力。其次,资源限制使我们无法探索长视频生成和视频编辑,而这两者都是我们整体编码器的自然延伸。最后,为了进行公平比较,我们仅在 7B 稠密大语言模型上实例化了 Hydra-X;将我们的分词器与更先进的主干网络(例如 MoE(Li 等人,2024b)或 MoT(Liang 等人,2024))配对,是进一步提升跨任务性能增益的明确路径。

附录 F 更广泛的影响

由于 Hydra-X 在统一框架内引入了强大的文生图能力,我们承认其潜在的下游风险。这些风险包括生成误导性或虚构的视觉内容(例如深度伪造),此类内容可能被用于虚假信息传播或身份冒用。为降低此类风险,我们主张在部署时纳入内容水印和来源追踪机制,并遵循负责任的发布实践,例如设置模型访问门槛和使用指南。我们相信,推进对统一多模态架构的科学理解具有重大的积极社会价值,而相关风险可通过社区驱动的安全标准得到有效管控。

附录 G 更多主要结果

本节提供了第 6 章所总结基准测试的完整逐类别细分数据,作为主论文中精简表格的补充。

GenEval

表 10 报告了 GenEval(Ghosh 等人,2023)上的逐类别细分结果,涵盖单物体、双物体、计数、颜色、位置和颜色属性提示词。该细分有助于定位每个模型在组合维度上表现最强的方面。

媒体内容 · 前往原文查看
表 10:GenEval 基准测试(Ghosh 等人,2023)上的详细图像生成结果。灰色行表示参数量为 B 级别的模型,不参与排名。† 指使用了 LLM 重写器的方法。

模型 参数量 单个物体 两个物体 计数 颜色 位置 颜色属性 总体 纯生成模型 SD3-Med (Esser 等, 2024) 2B 0.99 0.94 0.72 0.89 0.33 0.60 0.74 FLUX.1 [Dev] (Labs 等, 2025) 12B 0.98 0.93 0.75 0.93 0.68 0.65 0.82 DALL-E 3 (Betker 等, 2023) – 0.96 0.87 0.47 0.83 0.43 0.45 0.67 统一多模态模型 TokenFlow-XL (Qu 等, 2025) 14B 0.95 0.60 0.41 0.81 0.16 0.24 0.55 SEED-X (Ge 等, 2024) 17B 0.97 0.58 0.26 0.80 0.19 0.14 0.49 Ming-UniVision (Huang 等, 2025) 16B 1.00 0.93 0.59 0.93 0.92 0.70 0.85 BAGEL† (Deng 等, 2025) 14B 0.98 0.95 0.84 0.95 0.78 0.77 0.88 MetaQuery-XL (Pan 等, 2025) 7B – – – – – – 0.80 Blip3-o† (Chen 等, 2025a) 8B – – – – – – 0.84 MUSE-VL (Xie 等, 2025b) 7B 0.98 0.64 0.54 0.72 0.25 0.31 0.57 Janus-Pro (Chen 等, 2025b) 7B 0.99 0.89 0.59 0.90 0.79 0.66 0.80 Show-o2† (Xie 等, 2025a) 7B 1.00 0.87 0.58 0.92 0.52 0.62 0.76 HYDRA† (Qiu 等, 2026) 7B 1.00 0.97 0.68 0.91 0.81 0.80 0.86 Hydra-X 7B 0.99 0.95 0.83 0.90 0.84 0.75 0.88

WISE。

表 11 报告了 WISE(Niu 等,2025)上按类别划分的细分结果,该基准测试从文化、时间、空间、生物、物理和化学维度探查世界知识,因此与 GenEval 的几何和组合性探查形成互补。

媒体内容 · 前往原文查看
表 11:WISE 基准测试(Niu 等,2025)上的详细图像生成结果。灰色行表示参数量为 B 级别的模型,不参与排名。

模型 参数量 文化 时间 空间 生物 物理 化学 总体 纯生成模型 FLUX.1 [Dev] (Labs 等, 2025) 12B 0.48 0.58 0.62 0.42 0.51 0.35 0.50 SD3.5-Large (Esser 等, 2024) 8B 0.44 0.50 0.58 0.44 0.52 0.31 0.46 统一多模态模型 BAGEL (Deng 等, 2025) 14B 0.44 0.55 0.68 0.44 0.60 0.39 0.52 VILA-U-7B (Wu 等, 2024b) 7B 0.26 0.33 0.37 0.35 0.39 0.23 0.31 Janus-Pro-7B (Chen 等, 2025b) 7B 0.30 0.37 0.49 0.36 0.42 0.26 0.35 Emu3-Gen-8B (Wang 等, 2024c) 8B 0.34 0.45 0.48 0.41 0.45 0.27 0.39 Show-o2 (Xie 等, 2025a) 7B 0.40 0.45 0.58 0.39 0.53 0.34 0.44 HYDRA (Qiu 等, 2026) 7B 0.52 0.53 0.68 0.47 0.58 0.38 0.53 Hydra-X 7B 0.53 0.57 0.72 0.53 0.64 0.40 0.56

ImgEdit-Bench。

表12提供了ImgEdit-Bench(Ye等人,2025)上各维度的完整细分结果,涵盖从物体添加、移除到背景替换、风格迁移和组合编辑等九种指令引导的编辑操作。

媒体内容 · 前往原文查看
表12:ImgEdit-Bench(Ye等人,2025)上的详细图像编辑结果。编辑维度:添加、调整(修改)、提取、替换、移除、背景、风格、组合、动作。灰色行表示参数量为B级别的模型,不参与排名。

模型 参数量 添加 调整 提取 替换 移除 背景 风格 组合 动作 总体 纯生成模型 FLUX.1 Kontext [Pro](Labs等人,2025) 12B 4.25 4.15 2.35 4.56 3.57 4.26 4.57 3.68 4.63 4.00 Qwen-Image(Wu等人,2025a) 20B 4.38 4.16 3.43 4.66 4.14 4.38 4.81 3.82 4.69 4.27 统一多模态模型 BAGEL(Deng等人,2025) 14B 3.56 3.31 1.70 3.30 2.62 3.24 4.49 2.38 4.17 3.20 OmniGen(Xiao等人,2025a) 3.8B 3.47 3.04 1.71 2.94 2.43 3.21 4.19 2.24 3.38 2.96 UniWorld-V1(Lin等人,2025a) 12B 3.82 3.64 2.27 3.47 3.24 2.99 4.21 2.96 2.74 3.26 OmniGen2(Wu等人,2025c) 4B 3.57 3.06 1.77 3.74 3.20 3.57 4.81 2.52 4.68 3.44 Hydra-X 7B 4.49 4.27 4.04 4.41 4.38 4.30 4.77 3.43 4.32 4.34

VBench。

表13将主论文中的QS/SS/Total汇总结果扩展至VBench(Huang等人,2024)全部十四个维度,分别考察视觉质量、运动平滑度、动态程度、语义正确性和组合推理能力。

媒体内容 · 前往原文查看
表13:VBench(Huang等人,2024)上的详细视频生成结果。列缩写说明:QS:质量分数,SS:语义分数,SC:主体一致性,BC:背景一致性,MS:运动平滑度,DD:动态程度,AQ:美学质量,IQ:成像质量,OC:物体类别,MO:多物体,HA:人类动作,C:色彩,SR:空间关系,S:场景。

模型 参数量 QS SS SC BC MS DD AQ IQ OC MO HA C SR S 总计 纯生成模型 CogVideoX (Yang et al., 2024b) 5B 82.75 77.04 96.23 96.52 96.92 70.97 61.98 62.90 85.23 62.11 99.40 82.81 66.35 53.20 81.61 Hunyuan Video (Kong et al., 2024) 13B 85.07 76.88 97.22 97.60 99.05 71.94 60.28 67.24 83.48 66.71 94.40 89.79 72.13 54.46 83.43 统一多模态模型 VILA-U (Wu et al., 2024b) 7B 76.26 65.04 – – – – – – – – – – – – 74.01 HaploOmni (Xiao et al., 2025b) 7B – – 96.40 97.60 96.80 65.30 – – – – – – – – 78.10 Emu3 (Wang et al., 2024c) 8B – – 95.32 97.69 98.93 79.27 59.64 – 86.17 44.64 77.71 – 68.73 37.11 80.96 Show-o2 (Xie et al., 2025a) 1.5B 82.10 78.31 97.28 96.78 98.25 40.83 65.15 67.06 94.81 76.01 95.20 80.89 62.61 57.67 81.34 Hydra-X 7B 83.97 81.57 95.70 95.88 92.69 35.42 63.73 65.23 96.52 76.68 99.00 87.37 73.88 69.74 83.49

附录 H 定性对比

本节展示了 Hydra-X 所支持的五个任务上的定性结果。我们与来自统一多模态模型和任务专用系统的代表性基线进行了对比,并按照任务和分辨率组织对比内容。

H.1 图像重建(标准分辨率)

我们首先考察标准分辨率下的重建保真度。对比涵盖三类基线:专用图像 VAE(FLUX)、内置于统一多模态模型中的统一分词器(MingTok、AToken),以及近期提出的 RAE。视觉差异使得纹理、精细边缘和小文字的重建保真度可以直接比较。

Refer to caption
图 6:标准分辨率下的定性重建对比。我们将 Hydra-X 与 RAE(Zheng et al., 2025)、MingTok(Huang et al., 2025)、AToken(Lu et al., 2025)和 FLUX(Labs et al., 2025)进行了比较。

H.2 图像重建(高分辨率)

为了对训练分辨率之外的泛化能力进行压力测试,我们额外在高分辨率下比较了重建结果,并在纯图像基线的基础上加入了专用视频 VAE Wan 2.2。这一设置揭示了当空间 token 预算被拉伸时,每个分词器如何处理密集的精细细节,例如文字、树叶和小型结构元素。

Refer to caption
图 7:在 条件下的定性重建对比。我们将 Hydra-X 与 Wan 2.2(Wan 等人,2025)、AToken(Lu 等人,2025)和 FLUX(Labs 等人,2025)进行了比较。

H.3 视频重建在 条件下

除了静态图像,我们还可视化了 Hydra-X 重建的时序连续帧,并与专用视频 VAE Wan 2.2 以及联合图像-视频分词器 AToken 进行了对比。这有助于评估 Hydra-XTok 的整体 ViT 是否保留了运动敏感线索,例如物体边界和帧间一致性。

Refer to caption

Refer to caption

图 8:定性视频重建对比。我们将 Hydra-X 与 Wan 2.2(Wan 等人,2025)和 AToken(Lu 等人,2025)进行了比较。

H.4 图像生成

我们提供了 Hydra-X 生成的定性文生图样本,涵盖了从写实摄影、风格化插画到构图性和知识驱动场景的多样化提示词,以表征模型的覆盖范围与美学质量。

Refer to caption
图 9:Hydra-X 的定性图像生成结果。

H.5 视频生成

我们同样展示了涵盖不同主题、场景和运动模式的定性文生视频样本,说明了在相同的 UMM 骨干网络下,整体潜空间如何支持时序连贯的合成。

Refer to caption
图 10:Hydra-X 的定性视频生成结果。

H.6 图像编辑

最后,我们将 Hydra-X 与一系列具有代表性的编辑系统在指令引导编辑任务上进行了比较。基线模型既包括统一多模态模型(BAGEL、OmniGen2),也包括专用于编辑的生成器(Qwen-Image-Edit、Step1X-Edit),使读者能够并排评估身份保持、指令遵循和视觉质量。

Refer to caption
图 11:定性编辑对比。我们将 Hydra-X 与 BAGEL(Deng 等人,2025)、Qwen-Image-Edit(Wu 等人,2025a)、Step1X-Edit(Liu 等人,2025a)和 OmniGen2(Wu 等人,2025c)进行了比较。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org