UEmbed:统一稀疏与稠密的多模态嵌入模型
UEmbed: Unified Sparse and Dense Multimodal Embeddings
UEmbed 是一种仅解码器的多模态嵌入模型,可在单次因果前向传播中同时生成稀疏词级和稠密表示,通过可学习特殊 token 与词汇表分区突破单 token 信息瓶颈。
UEmbed 让一个解码器模型同时输出稀疏与稠密多模态嵌入,稀疏模式精度接近稠密且原生适配倒排索引,对兼顾效率和精度的检索系统,省去了维护多套模型的开销。
宋廷宇
李明鑫
张彦昭
龙定坤
谢鹏军
聂志杰
赵一伦
吴舒
songtingyu23@mails.ucas.ac.cn
yilun.zhao@yale.edu
shu.wu@nlpr.ia.ac.cn
2026年8月3日
摘要
稀疏检索支撑着现代搜索系统,从网页搜索到检索增强生成。已有工作引入了学习式稀疏检索(LSR),以突破精确词法匹配、迈向更丰富的语义理解。然而,LSR 至今仍局限于编码器式双向架构,其向多模态场景的扩展也依然高度依赖辅助的跨模态模块。为解决这些局限,我们提出了 UEmbed(统一嵌入),一种仅解码器的多模态嵌入模型,能够在一次因果前向传播中同时生成稀疏词法表示和稠密表示。UEmbed 在输入中附加可学习的特殊 token,并将词表划分为互不相交的子集。每个 token 的因果隐状态预测其对应子集上的稀疏权重,各子集拼接后构成完整的稀疏向量。基于公开数据训练,我们发布了 2B、4B 和 9B 三个规模的 UEmbed。UEmbed-9B 在 MMEB-v2 上取得 71.8(稠密)和 71.0(稀疏)的成绩,在稠密检索中领先于基于公开数据训练的模型,并在稀疏检索中刷新了最优水平。在 BEIR 上,UEmbed 同样与强力的稠密和稀疏基线保持竞争力。此外,我们从三个维度展示了 UEmbed 的实际应用价值:有效性、效率和智能体应用。总体而言,UEmbed 提供了一种新范式:它将稠密与稀疏嵌入统一于单一模型之中,同时进一步将稀疏检索扩展至文本与多模态输入的统一处理。NNN
宋廷宇 () \通讯作者赵一伦 ()、吴舒 () \项目负责人龙定坤 \项目主页https://alibaba-nlp.github.io/UEmbed
1 引言
信息检索(IR)支撑着广泛的实际应用,包括网页搜索和问答系统。BM25(bm25)等稀疏词法方法因其高效性和可解释性而仍被广泛部署,但其对精确词项匹配的依赖限制了其捕捉超越表层词汇重叠的语义相似性的能力。学习型稀疏检索(LSR)通过训练神经模型生成稀疏词法表示来弥补这一差距。SPLADE(spladev1;spladev2;spladepp)等代表性方法将词元级变换与最大池化相结合,显著提升了相较于经典词项加权方案的检索质量。
尽管取得了上述进展,LSR 在三个关键方面仍存在局限。(1)架构约束:当前的 LSR 方法主要基于编码器式双向架构(如 BERT(bert))。由于单向注意力的因果掩码机制,仅解码器模型无法直接复用传统的池化策略来捕捉稀疏表示所需的全局上下文。利用大语言模型(LLM)进行稀疏检索通常需要要么将因果主干转换为双向架构(bgem3),要么采用专门的训练课程(laconic),这两种方式都会带来额外的训练成本,并破坏与 vLLM(vllm)等经过优化的因果模型推理框架的兼容性。(2)模态受限:大多数 LSR 方法仍局限于文本,因为传统方法高度依赖仅支持文本的 BERT 架构,缺乏原生多模态能力。少数多模态方法(visualsparta;stair)引入了辅助的跨模态模块,而非直接从单一多模态主干中派生稀疏表示,这使得它们难以扩展到新的模态。(3)实际效用未被充分探索:现有稀疏方法主要在 COCO(coco)等传统基准上进行评估,导致稀疏检索在准确性之外的实际优势未得到充分检验。
从因果模型中导出稀疏表示的主要挑战在于信息瓶颈:依赖单个 token(例如 EOS、CLS)投影到大规模维度词汇空间,会严重限制表示能力。为克服这一问题,我们提出了 UEmbed(统一嵌入),它在多模态大语言模型(MLLM)上追加可学习的特殊 token,并为每个 token 分配词汇表的一个不相交子集。具体而言,这些子集通过 k-means 聚类得到,这显式地鼓励每个 token 表示不同的空间方向。在因果注意力机制下,每个特殊 token 从其位置汇总输入,并对其分配的簇预测稀疏权重。随后将这些子集拼接成完整的稀疏向量。这种分区投影有效规避了单 token 表示瓶颈。稠密嵌入则取自特殊 token 之前的 EOS token 的隐藏状态。如图 1(b) 所示,UEmbed 产生了具有语义意义的词汇激活,表明稀疏表示捕获了跨模态语义。|V|NkN
我们在文本和多模态嵌入基准上评估了 UEmbed,结果汇总于图 1(c)。在 MMEB-v2 上,UEmbed-9B 达到 71.8(稠密)和 71.0(稀疏),在我们测试的每个规模下都将两种模式之间的差距缩小到 1 分以内。在 BEIR(9 个数据集,nDCG@10)上,UEmbed 与 SPLADE-v3(spladev3)等强稠密和稀疏基线保持竞争力。此外,我们的分析揭示了 UEmbed 的三个实际优势。首先,其稠密和稀疏模式的混合评分持续改善文本和视觉文档检索。其次,其设计保持与高吞吐量服务栈(例如 vLLM)和倒排索引搜索的兼容性。最后,在 BrowseComp-Plus(browsecompplus)上,稀疏模式在保持相当召回率的同时降低了工具调用成本。
-
我们提出 UEmbed,它从单一解码器主干同时生成稀疏和稠密检索表示。
-
UEmbed 将不同模态统一到一个模型中,并且可以轻松扩展到多种模态设置。据我们所知,UEmbed 是首个在 MMEB-v2 上评估的稀疏模型,并在稀疏多模态检索场景中确立了新的最先进水平。
-
我们的综合评估表明,UEmbed 的稀疏模式同时提升了效率和有效性,而其在智能体搜索中的强劲表现则凸显了其广泛的实用价值。
2 相关工作
2.1 学习型稀疏检索
学习型稀疏检索用神经模型取代了固定的词法统计(如 BM25),这些模型既会对已出现的词项重新加权,也会用原文中不存在的语义相关词项来扩展表示。基于 SPLADE 的方法表明,上下文词元加权和词汇扩展可以使稀疏检索与强大的稠密基线相抗衡(spladev1;spladev2;spladev3)。近期工作利用 LLM 主干和更强的训练方案扩展了这一研究方向(laconic)。虽然相关工作要么将解码器主干适配为双向行为以用于检索(laconic),要么在同一个模型中联合训练稠密和稀疏检索(bgem3;sparsejoint),但我们的工作不同之处在于,我们在统一主干中研究因果注意力下的原生稀疏检索。
2.2 多模态检索
近期,多模态大语言模型(MLLMs)(如gemini2、qwen3vl2025、gpt5)在广泛的任务中展现出了卓越的性能。因此,通用多模态嵌入模型(如vlm2vec、thinkthenembed2025、qwenvlembedding)基于这些MLLM骨干网络构建,并在MMEB-v2(vlm2vecv2)等基准上取得了极具竞争力的结果。然而,多模态稀疏检索的研究仍远未充分。现有的学习型稀疏检索(LSR)工作通常引入辅助模块或额外模型来解释非文本模态(如visualsparta、stair、blipsparse、frozen、splare)。此类辅助模块将稀疏模型限制在特定的模态对上,并使其扩展到新模态变得复杂。我们的工作通过将解码器原生稀疏检索、统一稠密与稀疏建模以及多模态支持结合在单一因果骨干网络中,填补了这一空白。
3 方法
图1展示了UEmbed的整体框架。我们首先在§3.1中回顾对比学习和学习型稀疏检索的相关预备知识,然后在§3.2中介绍所提出的方法,最后在§3.3中描述数据整理过程。
3.1 预备知识
InfoNCE损失。
给定一个查询、一个正例文档以及一组批内负例,InfoNCE损失鼓励模型对正例对赋予更高的相似度:qd+{dj−}j=1K
| ℒInfoNCE=−logexp(sim(q,d+)/τ)∑d∈{d+}∪𝒩exp(sim(q,d)/τ), | (1) |
其中是批内负例集合,表示相似度函数(例如,稠密检索使用余弦相似度,稀疏检索使用内积),是温度超参数。𝒩sim(⋅,⋅)τ
学习型稀疏检索。
基于SPLADE的模型(spladev1、spladev2)通过将每个token的隐藏状态投影到词表上,并使用最大池化和饱和激活函数在序列上进行聚合,从而生成稀疏表示:
| wt=maxi=1Llog(1+ReLU(𝒉i⊤𝒆t)), | (2) |
其中是第个输入token的隐藏状态,是词表词项的嵌入向量,是序列长度,是词项最终得到的权重。该稀疏向量可由标准倒排索引提供服务。𝒉ii𝒆ttLwtt𝒘∈ℝ|V|
3.2 UEmbed方法
将稀疏检索适配到仅解码器模型的关键挑战在于,单向注意力机制使得每个位置无法关注未来的 token,导致对所有隐藏状态进行最大池化失效。我们通过向输入序列末尾追加特殊 token,并将词表划分为互不相交的子集来解决这一问题。NN
词表压缩。
LLM 分词器通常包含冗余 token(例如空白符、重音符号)。在划分之前,我们通过 NLTK(nltk)进行去重音、小写化和空白符折叠来压缩词表。共享相同规范形式的 token 会被合并为单个条目。例如,Hello、HELLO 和 héllò 都会被合并为 hello。在计分时,我们保留其中最大的权重。这使词表大小从 248,320 减少到 184,016。
分区稀疏头。
给定长度为 的输入序列,我们在末尾追加可学习的特殊 token。每个特殊 token 可以关注所有前置 token,从而有效汇总完整输入。为了促使每个特殊 token 捕获不同的语义子空间,我们采用 k-means 聚类将词表划分为大小大致相等的互不相交子集。LN=16⟨s1⟩,…,⟨sN⟩VNV1,…,VN
每个特殊 token 负责通过一个子集专用的稀疏头,为其分配的子集生成稀疏权重。设 为 的最终隐藏状态。我们使用线性投影计算词表项 的稀疏权重:⟨sk⟩VkHsk⟨sk⟩t∈Vk
| wt(k)=log(1+ReLU(𝑾t(k)⊤𝒉sk+bt(k))), | (3) |
对于所有 成立,其中 和 分别是第 个稀疏头中词表项 对应的权重向量和偏置标量。稀疏表示通过拼接所有子集向量获得:t∈Vk𝑾t(k)bt(k)tk
| 𝒘=[wt(1)]t∈V1⊕⋯⊕[wt(N)]t∈VN, | (4) |
其中 表示拼接操作。⊕
稠密表示。
对于稠密检索,我们使用特殊 token 之前的 EOS token 的隐藏状态作为稠密嵌入 。当仅需要稠密检索时,可以完全省略特殊 token,不会产生额外的前向计算开销。𝒅∈ℝD
统一目标。
我们使用涵盖两种检索模式的组合损失来训练模型:
| ℒ=ℒInfoNCEdense+λℒInfoNCEsparse+αqℒFLOPSq+αdℒFLOPSd, | (5) |
其中 和 分别使用余弦相似度和内积计算。 和 是 FLOPS 正则化项(paria2020flops),分别对查询和文档的平方平均项权重进行惩罚,以鼓励稀疏性。、 和 是平衡四个损失的标量系数。训练细节见附录 A。ℒInfoNCEdenseℒInfoNCEsparseℒFLOPSqℒFLOPSdλαqαd
3.3 数据整理
数据来源。
我们从三个公开数据集中提取训练对,共计 394 万个样本。(1) Echo-embedding 训练数据(echoemb),提供覆盖广泛领域的大规模查询-文档对;(2) MLDR 训练数据(bgem3),提供长文档训练数据;(3) MMEB 训练集(vlm2vecv2),提供涵盖多种视觉和跨模态任务的多模态训练数据。
难负样本挖掘。
正如先前工作(spladepp)所证明的,难负样本对于训练学习型稀疏检索器至关重要。由于多模态数据集缺乏有效训练所需的负样本,我们利用 Qwen3-VL-Embedding-8B(qwenvlembedding)作为教师模型,为所有多模态数据挖掘难负样本。具体来说,对于每个查询,我们使用教师模型从语料库中检索出最相似但不相关的 top- 个文档,并将这些文档视为我们的难负样本。k
4 实验
4.1 实验设置
| 模型 | 图像 | VisDoc | 全部 | |||||||||||||
| CLS | QA | RET | GD | 平均 | CLS | QA | RET | MRET | 平均 | VDRv1 | VDRv2 | VR | OOD | 平均 | ||
| 数据集数量 | 10 | 10 | 12 | 4 | 36 | 5 | 5 | 5 | 3 | 18 | 10 | 4 | 6 | 4 | 24 | 78 |
| Qwen3-VL-Embedding-8B | 74.2 | 81.1 | 80.2 | 92.3 | 80.1 | 78.4 | 71.0 | 58.7 | 56.1 | 67.2 | 87.2 | 69.9 | 88.7 | 73.3 | 82.4 | 77.8 |
| Qwen3-VL-Embedding-2B | 70.3 | 74.3 | 74.8 | 88.5 | 75.0 | 71.9 | 64.9 | 53.9 | 53.3 | 61.9 | 84.4 | 65.3 | 86.4 | 69.4 | 79.2 | 73.2 |
| RzenEmbed-V2-7B | 70.6 | 71.7 | 78.5 | 92.1 | 75.9 | 58.8 | 63.5 | 51.0 | 45.5 | 55.7 | 89.7 | 60.7 | 88.7 | 34.7 | 75.5 | 71.1 |
| Embed-RL-4B | 63.7 | 70.5 | 71.3 | 91.3 | 71.2 | 57.6 | 58.4 | 45.1 | 49.5 | 53.0 | 80.2 | 53.4 | 84.9 | 67.1 | 74.7 | 68.1 |
| Embed-RL-2B | 62.8 | 67.9 | 68.6 | 90.4 | 69.2 | 57.0 | 55.9 | 45.1 | 49.4 | 52.1 | 80.0 | 52.0 | 84.6 | 65.7 | 74.1 | 66.8 |
| Ops-MM-Embed-7B | 69.7 | 69.6 | 73.1 | 87.2 | 72.7 | 59.7 | 62.2 | 45.7 | 43.2 | 53.8 | 80.0 | 59.6 | 79.3 | 33.7 | 68.7 | 67.1 |
| Ops-MM-Embed-2B | 68.1 | 65.1 | 69.2 | 80.8 | 69.0 | 53.6 | 55.6 | 41.8 | 33.7 | 47.6 | 76.4 | 53.2 | 77.6 | 32.5 | 65.5 | 63.0 |
| UniME-7B | 67.1 | 69.2 | 71.9 | 84.8 | 71.2 | 48.6 | 60.7 | 38.2 | 39.3 | 47.5 | 75.7 | 50.5 | 83.7 | 29.1 | 65.7 | 64.1 |
| UniME-2B | 64.8 | 62.8 | 67.6 | 77.2 | 66.6 | 44.3 | 51.0 | 32.9 | 39.7 | 42.2 | 72.4 | 46.2 | 79.2 | 28.9 | 62.5 | 59.7 |
| GME-7B | 57.6 | 34.6 | 71.2 | 59.5 | 55.9 | 37.3 | 50.3 | 28.3 | 37.5 | 38.4 | 89.5 | 55.5 | 85.0 | 34.7 | 73.6 | 57.3 |
| VLM2Vec-V2-2.0B | 62.9 | 56.4 | 69.6 | 77.1 | 64.9 | 39.2 | 34.7 | 28.4 | 37.5 | 34.7 | 74.4 | 44.6 | 79.3 | 31.2 | 63.5 | 57.5 |
| UEmbed-2B(稠密) | 59.2 | 67.9 | 68.8 | 85.6 | 67.8 | 56.3 | 52.8 | 45.8 | 41.8 | 50.0 | 82.3 | 59.9 | 85.6 | 67.9 | 77.0 | 66.5 |
| UEmbed-2B(稀疏) | 58.9 | 66.1 | 68.5 | 85.1 | 67.0 | 53.7 | 49.5 | 44.2 | 40.3 | 47.7 | 82.3 | 60.6 | 84.5 | 67.3 | 76.7 | 65.5 |
| UEmbed-4B(稠密) | 62.3 | 72.3 | 72.6 | 88.4 | 71.4 | 61.4 | 65.0 | 50.1 | 47.9 | 57.0 | 84.1 | 61.0 | 87.3 | 70.4 | 78.8 | 70.4 |
| UEmbed-4B(稀疏) | 61.9 | 70.2 | 72.3 | 88.0 | 70.6 | 61.8 | 63.3 | 48.3 | 47.1 | 56.0 | 84.3 | 60.6 | 87.2 | 69.5 | 78.6 | 69.7 |
| UEmbed-9B(稠密) | 64.7 | 73.9 | 73.9 | 90.6 | 73.2 | 63.0 | 65.6 | 51.8 | 53.5 | 59.0 | 85.5 | 59.1 | 87.9 | 70.4 | 79.2 | 71.8 |
| UEmbed-9B(稀疏) | 64.3 | 72.3 | 73.7 | 89.5 | 72.5 | 60.9 | 63.7 | 50.9 | 52.4 | 57.5 | 86.2 | 57.9 | 87.6 | 69.7 | 79.1 | 71.0 |
骨干网络与模型规模。
我们基于 Qwen3.5 系列在三个规模上实例化 UEmbed:2B、4B 和 9B 参数。对于每个规模,我们训练一个同时支持稠密和稀疏检索的单一检查点。
多模态基准与基线。
我们在 MMEB-v2(vlm2vecv2)上评估 UEmbed,该基准为多模态嵌入任务提供了全面的评估。为了全面定位我们模型在当前格局中的位置,我们将其与一系列当前强基线进行比较:(1)Qwen3-VL-Embedding(qwenvlembedding),一个使用大规模数据训练的强视觉语言嵌入基线;(2)RzenEmbed(rzenembed),我们采用具有竞争力的 RzenEmbed-V2-7B 变体;(3)Embed-RL(embedrl),我们选择了其 2B 和 4B 两个版本;(4)Ops-MM-Embed(ops)和(5)UniME(unime2025),我们选择其 2B 和 7B 版本进行多尺度综合比较;(6)GME-7B(gme),一个稳健的 7B 多模态检索器;以及(7)VLM2Vec(vlm2vecv2),专门评估 VLM2Vec-V2-2.0B 版本。
文本基准与基线。
我们在 BEIR 的九个数据集上评估 UEmbed,并采用 nDCG@10 作为评估指标。评估设置的详细信息见附录 B。为确保公平比较,我们特意选择多模态嵌入模型作为稠密基线,有意排除纯文本模型。此外,我们还纳入了具有竞争力的稀疏模型,以构建全面的评估框架。我们选定的基线包括:(1) GME-7B (gme),一个稳健的 7B 多模态嵌入模型,在 BEIR 上展现出强大的文本检索性能;(2) Qwen3-VL-Embedding (qwenvlembedding),一个在大规模数据上训练的强大视觉语言嵌入基线,同样展现出具有竞争力的纯文本检索能力;(3) SPLADE-v3 (spladev3),代表经典稀疏检索方法的最新迭代;(4) Echo-Mistral-SPLADE (mistralsplade),利用强大的大语言模型骨干生成高效的稀疏表示。
4.2 多模态结果
表 1 报告了 MMEB-v2 在全部三个超类别上的结果。
UEmbed 与最强的开放多模态嵌入模型具有竞争力。
UEmbed-9B(稠密)达到 71.8 的聚合分数。虽然这一成绩被 Qwen3-VL-Embedding-8B 超越,但需要指出的是,Qwen 的模型受益于使用海量专有数据集的多阶段训练,因此直接比较具有挑战性。与其他公开检查点并在开放数据集上训练的模型相比,UEmbed-9B(稠密)在公开数据训练的模型中处于领先地位,超越了 RzenEmbed-V2-7B(71.1)和 Ops-MM-Embed-7B(67.1)等模型。在更小规模上,情况一致:UEmbed-4B(稠密)以 70.4 的分数超越了 4B 参数类别的所有其他模型,如 Embed-RL-4B(68.1)。此外,我们最紧凑的模型 UEmbed-2B(稠密)以 66.5 的分数,与一些 7B 规模的开放基线(如 UniME-7B,64.1)高度接近,甚至有所超越。为更好地理解 UEmbed 与 Qwen3-VL-Embedding 之间的差距,我们还在附录 C 中进行了分析。
在多模态场景下,稀疏检索仍然与稠密检索具有竞争力。
我们的研究结果表明,稀疏嵌入向量在多模态领域是稠密嵌入向量的一种可行且强大的替代方案。如表所示,我们稀疏模型的性能在所有规模上都与对应的稠密模型非常接近,整体性能差距最多为 1.0 个百分点(例如,9B 模型为 71.8 对比 71.0)。据我们所知,这是该基准上首次报告的稀疏多模态嵌入向量结果,并且它们显著优于已有的稠密模型。例如,UEmbed-4B(稀疏)以 69.7 的成绩超过了稠密的 Ops-MM-Embed-7B(67.1)。进一步观察可以发现,稀疏模型在视觉丰富文档(VisDoc)任务上尤其有效,其性能下降微乎其微(例如,9B 模型为 79.2 对比 79.1)。这表明稀疏嵌入向量的固有结构可能非常适合基于文档的任务,而在视频类别中性能差距则略显明显。
| 模型 | ArguAna | FiQA 2018 | NFCorpus | NQ | Quora | SCIDOCS | SciFact | COVID | Touche 2020 | 平均 |
| 稠密模型 | ||||||||||
| GME-7B | 64.6 | 57.1 | 38.4 | 67.7 | 88.1 | 27.4 | 62.3 | 52.6 | 23.3 | 53.5 |
| Qwen3-VL-Embedding-2B | 43.2 | 41.8 | 37.2 | 58.1 | 86.6 | 21.9 | 75.1 | 89.6 | 30.8 | 53.8 |
| Qwen3-VL-Embedding-8B | 45.8 | 47.8 | 39.7 | 64.5 | 86.5 | 24.9 | 79.4 | 84.1 | 26.9 | 55.5 |
| UEmbed-2B | 58.1 | 47.5 | 37.8 | 55.5 | 89.3 | 20.3 | 75.3 | 80.2 | 18.2 | 53.6 |
| UEmbed-4B | 60.0 | 53.4 | 40.5 | 60.9 | 89.2 | 22.5 | 77.0 | 82.7 | 18.1 | 56.0 |
| UEmbed-9B | 62.5 | 54.3 | 39.8 | 61.9 | 89.9 | 23.4 | 77.8 | 77.9 | 19.2 | 56.3 |
| 稀疏模型 | ||||||||||
| SPLADE-v3 | 50.9 | 37.4 | 35.7 | 58.6 | 81.4 | 15.8 | 71.0 | 74.8 | 29.3 | 50.5 |
| Echo-Mistral-SPLADE | 56.2 | 57.7 | 42.3 | 56.0 | 86.7 | 25.6 | 77.2 | 76.8 | 18.0 | 55.2 |
| UEmbed-2B | 55.7 | 45.1 | 35.9 | 53.4 | 88.2 | 18.0 | 70.8 | 84.8 | 18.7 | 52.3 |
| UEmbed-4B | 58.8 | 49.4 | 38.4 | 59.9 | 88.6 | 20.8 | 74.4 | 75.4 | 16.7 | 53.6 |
| UEmbed-9B | 58.4 | 51.2 | 38.1 | 59.9 | 88.7 | 20.6 | 74.5 | 82.1 | 23.4 | 55.2 |
4.3 文本结果
在稠密检索场景下,如表 2 所示,UEmbed 在各项评估基准上均展现出极具竞争力的性能。我们的 UEmbed-9B 模型在对比模型中取得了最高的平均 nDCG@10 得分 56.3,而 UEmbed-4B 以 56.0 的得分紧随其后。这使得我们的模型领先于 Qwen3-VL-Embedding-8B 和 GME-7B 等近期强基线模型。此外,UEmbed 在特定数据集上表现尤为突出,例如在 Quora 上取得 89.9 分(UEmbed-9B),在 NFCorpus 上取得 40.5 分(UEmbed-4B)。
在稀疏检索场景下,UEmbed-9B 的平均得分达到 55.2,与强大的专家模型 Echo-Mistral-SPLADE(55.2)基本持平。关键在于,UEmbed 在实现这一性能持平的同时,还在单一骨干网络内同时支持稠密检索和多模态输入。这些结果将 UEmbed 定位为一个统一的模型,在获得强大的多模态和稠密能力的同时,几乎不牺牲文本性能。
5 分析
为更好地理解 UEmbed,本节从以下角度对模型进行分析:(1)组件分析:通过受控消融实验验证各设计选择的贡献(§5.1);(2)跨模态鲁棒性:通过案例研究展示模型在不同模态下的性能表现(§5.2);(3)实际优势:稀疏检索在混合评分、服务效率和智能体搜索中的实用性。
5.1 组件分析
除非另有说明,本节中的消融实验使用在完整混合数据集中随机抽取的 50 万条实例子集上训练的 2B 骨干网络,并在 MMEB-v1(vlm2vec)上进行评估。
基线对比。
| 模型 | 分类 | 问答 | 检索 | 定位 | 平均 |
| SPLADE | 55.8 | 57.1 | 62.9 | 80.9 | 61.3 |
| UEmbed(稠密) | 55.5 | 65.3 | 65.1 | 83.3 | 64.5 |
| UEmbed(稀疏) | 54.7 | 63.1 | 64.8 | 81.8 | 63.4 |
| 分区 | 分类 | 问答 | 检索 | 定位 | 平均 |
| 随机 | 55.0 | 62.3 | 64.2 | 81.0 | 63.0 |
| 最大距离 | 55.1 | 62.4 | 64.9 | 79.8 | 63.2 |
| 语义(我们的) | 54.7 | 63.1 | 64.8 | 81.8 | 63.4 |
为评估§4.2中的性能提升是否归因于UEmbed方案,我们将UEmbed-2B与基于SPLADE的基线模型进行对比。该基线模型共享相同的Qwen3.5主干网络、训练数据和FLOPS正则化,但采用双向注意力机制,并使用标准SPLADE最大池化头(公式2)。表3表明,UEmbed-2B在两种模式下均超越该双向基线:稠密模式平均得分(61.3对64.5),稀疏模式平均得分(61.3对63.4)。差距在IMG-QA任务上最为显著(稠密、稀疏),这表明标准SPLADE方案未能充分利用自回归主干网络固有的问答能力。因此,我们统一的因果公式化方法对嵌入质量具有内在增益,而不仅仅是在服务部署上提供便利。+3.2→+2.1→+8.2+6.0
对联合训练的鲁棒性。
多任务学习中的一个常见陷阱是目标之间的负迁移。为验证我们的联合目标(公式5)是否损害任一检索模式,我们在相同条件下训练了仅稠密模式和仅稀疏模式的基线模型。如图2(a)所示,联合训练的UEmbed模型与两种单模式专家模型的性能高度接近。这证实了双模式能力在训练过程中带来的性能损失可忽略不计。λ=0
词汇表划分。
稀疏头将词汇表划分为互不相交的子集。我们比较了三种平衡划分策略:(1)随机均匀分配;(2)最大距离法,即将距离最远的 -均值聚类两两配对,以在子集内部强制实现语义多样性;(3)我们的方法(语义聚类),即将各个 -均值聚类分别分配到不同的子集。语义聚类取得了最佳性能,而随机划分表现最差。这表明,将语义相关的 token 归组,可以让每个特殊 token 充当“软主题专家”,优化其有限的表征能力,而不是同时费力建模不相关的概念。VNkk
超参数敏感性。
我们扫描了稀疏头特有的两个超参数:稀疏温度()。与稠密头的余弦相似度不同,稀疏内积的动态范围要大得多。因此,共享温度会过度锐化稀疏 softmax。图 2(b) 表明,解耦温度并使用较大的 值可以在不损害稠密检索的情况下提升稀疏性能;我们将 设为默认值,同时注意到在我们报告的单种子扫描中, 的表现与之相当。特殊 token 数量()。扫描 (图 2(c))显示,性能在 之前保持稳定,而在 处出现明显下降。我们将这一退化归因于词汇子集过小以及对比序列长度被过度膨胀。我们采用 作为实现默认值。τs[−1,1]τsτs=32τs=64NN∈{2,4,8,16,32}N=16N=32N=16
5.2 案例研究
基于图 1(b) 中的示例,我们进一步展示了跨多种模态的案例研究。如图 3 所示,我们的模型展现出强大的能力,能够识别输入中的关键组成部分并激活语义相关的概念。例如,它可以仅凭天际线推断出图像拍摄地点为新加坡,并能准确识别出某枚火箭属于 SpaceX。
然而,我们也观察到两个主要局限:(1)异常 token 的生成:模型偶尔会产生非标准 token(例如“_alt”)。与 BERT 这类在受限且高度结构化词汇表内运作的传统掩码语言模型不同,现代大语言模型极其庞大的词汇量增加了生成此类边缘情况 token 的概率。这表明可能需要进行进一步的词汇压缩或定向剪枝,以确保表征的稳定性。(2)多语言支持有限:模型主要激活英文和中文 token,而忽略了其他语言。这种偏差主要源于我们的训练语料库严重偏向英文和中文,以及底层基础模型固有的跨语言局限性。
5.3 实际优势
稀疏检索在实际部署中具有结构性优势。在本节中,我们考察 UEmbed 的三个层面:(1)通过混合评分结合其稀疏与稠密模式所带来的效果提升;(2)自回归服务和原生倒排索引兼容性所实现的部署端效率;(3)其作为检索器在下游智能体搜索工作流中的实用性。
效果。
由于 UEmbed 在单次前向传播中同时生成稀疏和稠密表征,这两种模式可以在无需额外编码过程的情况下进行组合。我们通过线性插值稠密与稀疏相似度来构建混合评分;详细公式和各模态权重见附录 B.3。表 5 显示,混合评分提升了 Text()和 VisDoc()的性能,其中精确的词法匹配对稠密语义形成了补充。相比之下,自然图像和视频帧携带的表面词法信息很少,使得稀疏检索能够贡献的额外信号有限。尽管稀疏检索在依赖词法的任务上可能带来收益,但由于在多样化的 MMEB-v2 和 BEIR 基准上的稀释效应,整体提升幅度显得较为温和。+0.3+0.5
效率。
| 模型 | TXT | IMG | VID | VDR |
| UEmbed(稠密) | 53.6 | 67.8 | 50.0 | 77.0 |
| UEmbed(稀疏) | 52.3 | 67.0 | 47.7 | 76.7 |
| UEmbed(混合) | 53.9 | 67.9 | 50.0 | 77.5 |
UEmbed 具备两大部署优势。首先,由于该模型是纯自回归架构,嵌入向量的生成可直接兼容 vLLM(vllm)等高吞吐量服务栈。其次,稀疏表示可直接接入标准倒排索引,从而在生产环境中实现可扩展的词汇检索。关于倒排索引搜索效率的详细分析,我们留待附录 B.3 中讨论。
应用场景:智能体搜索。
| 模型 | 准确率(%)↑ | 召回率(%)↑ | 平均搜索↓ | 校准误差(%) |
| BM25 | 36.87 | 43.02 | 17.91 | – |
| Qwen3-Embedding-8B | 44.46 | 62.32 | 30.37 | – |
| Qwen3-VL-Embedding-2B | 26.87 | 38.20 | 34.99 | 12.13 |
| Qwen3-VL-Embedding-8B | 31.45 | 44.42 | 34.19 | 12.35 |
| UEmbed-2B(密集) | 44.10 | 53.47 | 39.19 | 16.69 |
| UEmbed-2B(稀疏) | 44.05 | 57.04 | 32.67 | 8.54 |
| UEmbed-4B(密集) | 51.57 | 61.03 | 38.47 | 14.34 |
| UEmbed-4B(稀疏) | 45.54 | 60.10 | 31.85 | 8.79 |
| UEmbed-9B(密集) | 49.76 | 64.72 | 33.68 | 7.06 |
| UEmbed-9B(稀疏) | 49.76 | 64.33 | 31.05 | 8.16 |
正如 meng2026revisiting 所指出的,LLM 智能体经常发出简短、关键词密集的查询,在这种场景下,稀疏检索通常优于密集检索。为进一步探索该问题,我们在 BrowseComp-Plus(browsecompplus)上测试了 UEmbed,这是一个在迭代推理过程中将检索作为工具的基准测试。我们使用 DeepResearch-30A3B(tongyidr)作为骨干推理引擎。如表 6 所示,UEmbed 的稀疏模式所需的工具调用搜索轮数始终少于其密集模式。在 2B 规模下召回率更高,在 4B 和 9B 规模下则相当。这些结果验证了稀疏检索在关键词密集查询占主导、对成本敏感的迭代推理循环中是一种切实可行的选择。
6 结论
在这项工作中,我们提出了 UEmbed,一个仅解码器的多模态嵌入模型,它在单次因果前向传播中原生统一了稠密检索与稀疏检索。通过克服因果注意力固有的瓶颈,UEmbed 系统性地消除了对双向编码器和辅助跨模态模块的依赖。我们的全面评估表明,UEmbed 在稀疏多模态检索中确立了新的最先进水平,同时在稠密检索中保持高度竞争力。通过严格的组件分析,我们验证了算法设计的有效性,并提供了实用的配置方案。关键在于,UEmbed 在实现强大效果的同时,与自回归服务栈和倒排索引原生兼容,并在智能体搜索场景中展现出成本优势。总体而言,它将稀疏检索从传统的独立模块转变为多模态大语言模型(MLLM)的原生副产品。
局限性
尽管 UEmbed 为统一多模态检索奠定了坚实基础,我们仍识别出若干未来可改进的方向。(1)语言与文化偏见:本工作使用的训练语料主要偏向英语和中文。因此,稀疏头激活的跨语言泛化能力有限。要将该框架的稀疏能力扩展到更广泛的语言,将需要高度语言多样化的大规模训练数据。(2)词汇稳定性与伪影:与词汇表受限的传统掩码语言模型不同,在现代大语言模型的庞大词汇表上操作偶尔会导致异常 token 激活(例如,非标准子词或诸如“_alt”之类的伪影)。未来的迭代可以探索有针对性的词汇剪枝、精细化的语义聚类或事后过滤机制,以确保在严格的生产环境中表征的稳定性。(3)模态特定性能差距:虽然稀疏和稠密表征在文本和静态视觉文档上保持接近的性能水平,但我们观察到在视频领域存在略微更明显的差距。我们将此归因于视频帧固有的高信息密度和时间动态特性。这表明,将时空数据简单池化为扁平稀疏向量可能会遇到容量瓶颈。
伦理考量
我们的模型仅在公开可用的数据集上训练,并发布模型权重以促进可复现性。我们承认,嵌入向量模型可能继承其训练数据和骨干大语言模型中存在的偏见;实践者在高风险检索应用部署之前,应评估不同人口群体间的公平性。稀疏表征通过呈现激活的词汇项提供了一定程度的可解释性,这可能有助于与纯稠密模型相比进行偏见审计。
参考文献
附录 A 实现细节
A.1 训练数据
我们构建了一个多源训练混合数据集,涵盖文本、图像、视频以及富含视觉信息的文档检索。各数据源的组成比例见图4,每个数据集的检索指令列于表7和表8。
文本训练数据。
为启用文本嵌入能力,我们纳入了来自Echo-Embedding (echoemb) 和 M3-Embedding (bgem3) 的训练对。文本子集包含NLI、DuReader、ELI5、FEVER、HotpotQA、MIRACL、MrTyDi、MSMARCO Passage、MSMARCO Document、Natural Questions、Quora Duplicates、SQuAD、T2Ranking、TriviaQA 和 MLDR。对于标准文本任务,我们设置最大序列长度为1,500个token;对于长文档检索(MLDR),我们将其扩展至1,800个token。
多模态训练数据。
对于视频检索,我们使用了来自LLaVA-Hound (llava-hound) 的VideoCaption300k 和 VideoQA240k 数据集。每个视频采样8帧,每帧分配最多200个token。对于视觉文档检索,我们整合了来自ViDoRe (vidore) 和 VisRAG (visrag) 的ColPali train (118k)、VisRAG-Synthetic (239k) 和 VisRAG-IID (123k) 数据集。对于图像-文本检索,我们包含了MMEB训练数据集 (vlm2vec),涵盖CIRR、NIGHTS、MSCOCO、VisualNews、N24News、ImageNet-1K、SUN397、VOC2007、HatefulMemes、A-OKVQA、OK-VQA、Visual7W、ChartQA、DocVQA、InfographicsVQA、VisDial 和 WebQA。对于视频任务,最大序列长度为1,800个token,每个视频采样8帧,每帧最多200个token。对于所有其他多模态任务,最大序列长度为1,500个token,其中图像最多分配1,000个token。
| 数据集 | 指令 |
| AllNLI | 给定一个前提,检索一个由该前提蕴含的假设。检索语义相似的文本。 |
| DuReader | 给定一个中文搜索查询,检索能够回答该问题的网页段落。 |
| ELI5 | 提供一个用户问题,检索Reddit ELI5论坛上投票最高的回答。 |
| FEVER | 给定一个声明,检索支持或反驳该声明的文档。 |
| HotpotQA | 给定一个多跳问题,检索有助于回答该问题的文档。 |
| MIRACL | 给定一个问题,检索能够回答该问题的维基百科段落。 |
| MrTyDi | 给定一个问题,检索能够回答该问题的维基百科段落。 |
| MSMARCO-Doc | 给定一个网络搜索查询,检索能够回答该查询的相关文档。 |
| MSMARCO-Psg | 给定一个网络搜索查询,检索能够回答该查询的相关段落。 |
| NQ | 给定一个问题,检索能够回答该问题的维基百科段落。 |
| Quora | 给定一个问题,检索与输入问题语义等价的问题。 |
| SQuAD | 检索能够回答该问题的维基百科段落。 |
| T2Ranking | 给定一个中文搜索查询,检索能够回答该问题的网络段落。 |
| TriviaQA | 检索能够回答该问题的维基百科段落。 |
| MLDR | 检索能够回答该问题的维基百科段落。 |
A.2 训练细节
我们从预训练的多模态骨干网络初始化,并向分词器和嵌入矩阵添加特殊 token。训练使用应用于注意力层和 MLP 投影(q_proj、k_proj、v_proj、up_proj、down_proj、gate_proj)的 LoRA(lora2022),视觉编码器保持冻结。我们使用 bf16 混合精度进行训练,并启用 DeepSpeed ZeRO 和梯度检查点。N=16
超参数。
我们基于 Qwen3.5 训练 UEmbed 模型。我们使用余弦学习率调度,峰值学习率为 ,预热比例为 0.1。稠密检索温度设置为 ,稀疏检索温度设置为 。对于 FLOPS 正则化器,我们设置 并在前 200 步线性提升。稀疏损失因子使稀疏和稠密 InfoNCE 损失权重相等。我们训练 1 个 epoch,并将随机种子固定为 42。UEmbed-2B 和 UEmbed-4B 在 16 块 A100 GPU 上训练,每设备批大小为 16;UEmbed-9B 在 32 块 A100 GPU 上训练,每设备批大小为 8,确保所有模型的批大小一致为 256。3×10−5τ=0.03τs=32αq=αd=1×10−4λ=1.0××
A.3 训练分析
由于稀疏分数是通过内积计算的,未归一化相似度的大动态范围可能导致稀疏训练不稳定。我们发现,加入文本训练数据能显著提升多模态稀疏模型训练的稳定性和速度。参照 GVE(gve),我们在训练过程中监控三个关键指标:损失、最大负间隔和平均负间隔。最大负间隔定义为批次内正样本与负样本之间的最大分数差,而平均负间隔则是批次内所有正负样本对的平均分数差。如图 5 所示,使用文本数据训练时,模型能快速(100 步内)学习到有效的稀疏表示。相比之下,仅使用多模态数据(如图像、视频)训练时,模型需要近 500 步才能可靠地区分正样本与负样本。<
| 数据集 | 指令 |
| CIRR | 给定一张图像,找到一张具有所述变化的相似日常图像。 |
| NIGHTS | 找到一张与所提供图像相似的日常图像。 |
| MSCOCO | 选择图像中隔离出该物体的部分。 |
| MSCOCO(图像到文本) | 找到描述给定日常图像的图像标题。 |
| VisualNews(图像到标题) | 为给定照片中的新闻找到一条标题。 |
| MSCOCO(文本到图像) | 找到一张与给定标题匹配的日常图像。 |
| VisualNews(文本到图像) | 检索一张与该新闻标题对应的图像。 |
| N24News | 对给定新闻图像的领域进行分类。 |
| ImageNet_1K | 对给定图像进行分类。 |
| SUN397 | 识别图像中所示的场景。 |
| VOC2007 | 识别图像中所示的物体。 |
| HatefulMemes | 判断给定图像是否构成仇恨言论。 |
| A-OKVQA | 回答关于给定图像的问题。 |
| OK-VQA | 回答关于给定图像的问题。 |
| Visual7W | 回答关于给定图像的问题。 |
| ChartQA | 回答关于给定图表图像的问题。 |
| DocVQA | 回答关于给定文档图像的问题。 |
| InfographicsVQA | 回答关于给定信息图图像的问题。 |
| VisDial | 根据给定的对话检索图像。 |
| WebQA | 找到一张能回答该问题的维基百科图像。 |
| VISRAG-IID | 找到一张能回答该问题的维基百科图像。 |
| ViDoRe | 找一张能回答这个问题的维基百科图片。 |
| VisRAG-Synthetic | 找一张能回答这个问题的文档图片。 |
| VideoCaption300k(文生视频) | 找一段与给定描述匹配的视频。 |
| VideoCaption300k(视频生文) | 找一段能描述给定视频的文本描述。 |
| VideoQA240k | 回答关于给定视频的问题。 |
附录 B 实验细节
B.1 评估模型
我们在表 9 中提供了与 UEmbed 进行对比的基线模型在多模态基准 MMEB-v2(表 1)和文本基准 BEIR(表 2)上的详细信息。
| 模型 | 发布时间 | 检索方式 | 骨干网络 | 参数量 |
| 基线模型 | ||||
| Qwen3-VL-Embedding-8B | 2026-01 | 稠密 | Qwen3-VL-8B | 8B |
| Qwen3-VL-Embedding-2B | 2026-01 | 稠密 | Qwen3-VL-2B | 2B |
| RzenEmbed-V2-7B | 2025-10 | 稠密 | Qwen2-VL-7B | 7B |
| Embed-RL-4B | 2026-02 | 稠密 | Qwen3-VL-4B | 4B |
| Embed-RL-2B | 2026-02 | 稠密 | Qwen3-VL-2B | 2B |
| Ops-MM-Embed-7B | 2025-07 | 稠密 | Qwen2-VL-7B | 7B |
| Ops-MM-Embed-2B | 2025-07 | 稠密 | Qwen2-VL-2B | 2B |
| UniME-7B | 2025-10 | 稠密 | Qwen2-VL-7B | 7B |
| UniME-2B | 2025-10 | 稠密 | Qwen2-VL-2B | 2B |
| GME-7B | 2024-12 | 稠密 | Qwen2-VL-7B | 7B |
| VLM2Vec-V2-2.0B | 2025-05 | 稠密 | Qwen2-VL-2B | 2B |
| SPLADE-v3 | 2024-03 | 稀疏 | BERT | 110M |
| Echo-Mistral-SPLADE | 2024-08 | 稀疏 | Mistral-7B | 7B |
| 我们的模型 | ||||
| UEmbed-2B | 2026-08 | 稠密与稀疏 | Qwen3.5-2B | 2B |
| UEmbed-4B | 2026-08 | 稠密与稀疏 | Qwen3.5-4B | 4B |
| UEmbed-9B | 2026-08 | 稠密与稀疏 | Qwen3.5-9B | 9B |
B.2 评估设置
评估指标。
对于 MMEB-v2(vlm2vecv2),我们对不同数据集使用其对应的评估指标。对于 BEIR,我们使用 nDCG@10 作为评估指标。
分数计算。
除非另有说明,稠密分数是 EOS token 隐藏状态(即特殊 token 之前的最后一个内容 token,定义见 §3.2)的余弦相似度,稀疏分数是 §3.2 中定义的分区词表表示上的内积。
B.3 消融实验细节
有效性。
我们进一步详细说明 §5.3 中使用的混合评分。给定查询 和候选 ,混合分数将稠密余弦相似度和稀疏内积线性组合为qdsdense(q,d)ssparse(q,d)
| shybrid(q,d)=αsdense(q,d)+βssparse(q,d). | (6) |
由于 和 处于完全不同的量级,稠密余弦相似度被限制在 范围内,而稀疏内积的取值幅度可以大得多。我们固定 ,并在留出划分上按模态分别调节 。我们对文本使用 ,对图像使用 ,对视频使用 ,对 VisDoc 使用 。纯文本的最优值比其余模态小几个数量级,因为原始稀疏内积会随着激活 token 数量的增加而迅速增长,而更重的多模态输入产生的激活模式要稀疏得多,因此可以容纳相对更大的数值。sdensessparse[−1,1]α=1.0ββ=5e−8β=5e−4β=1e−4β=7e−4β
效率。
UEmbed 的稀疏表示与倒排索引天然集成,为大规模词法检索打开了大门。为了量化这一点,我们对 BrowseComp-Plus 的离线检索模式进行了基准测试,将基于 Faiss 的稠密索引与基于 Lucene 的稀疏倒排索引进行了比较。图 6 展示了我们稀疏模式的延迟-精度权衡:通过限制每个查询的最大激活 token 数量(),实践者可以灵活地在搜索延迟和检索质量(NDCG@5)之间进行权衡,以适应部署约束。虽然在该语料库规模下稠密搜索的绝对性能略高,但我们预计随着语料库的增长,倒排索引检索将变得越来越有优势;系统性的多尺度评估留待未来工作。Kprune
B.4 额外实验结果
为了对我们的超参数设置进行更可靠的测试,我们报告了使用随机种子 42 训练的模型在 MMEB-v2 上的结果。这些趋势与主论文中的设置大体一致:(1)联合稠密-稀疏训练在保持稠密性能的同时,产生了一个具有竞争力的稀疏分支(表 10)。(2)使用过多的特殊 token 会损害稀疏检索(表 11)。(3)更高的稀疏训练温度是有益的(表 12)。
| 模式 | 图像 | VisDoc | 全部 | |||||||||||||
| CLS | QA | RET | GD | 平均 | CLS | QA | RET | MRET | 平均 | VDRv1 | VDRv2 | VR | OOD | 平均 | ||
| 数据集数量 | 10 | 10 | 12 | 4 | 36 | 5 | 5 | 5 | 3 | 18 | 10 | 4 | 6 | 4 | 24 | 78 |
| 仅稠密 | 55.3 | 65.4 | 65.3 | 83.5 | 64.6 | 56.3 | 52.2 | 44.8 | 48.3 | 50.6 | 81.6 | 61.7 | 82.9 | 66.8 | 76.1 | 64.9 |
| 仅稀疏 | 54.1 | 63.6 | 64.2 | 79.8 | 63.0 | 54.1 | 52.6 | 43.6 | 45.6 | 49.3 | 79.9 | 58.5 | 82.5 | 64.9 | 74.5 | 63.4 |
| UEmbed-2B(稠密) | 55.5 | 65.3 | 65.1 | 83.3 | 64.5 | 58.3 | 46.9 | 45.6 | 47.5 | 49.8 | 81.6 | 59.5 | 83.1 | 66.7 | 75.8 | 64.6 |
| UEmbed-2B(稀疏) | 54.7 | 63.1 | 64.8 | 81.8 | 63.4 | 56.0 | 46.3 | 44.4 | 45.7 | 48.4 | 79.9 | 59.3 | 82.0 | 65.9 | 74.7 | 63.4 |
| N | 图像 | 视觉文档 | 全部 | |||||||||||||
| CLS | QA | RET | GD | 平均 | CLS | QA | RET | MRET | 平均 | VDRv1 | VDRv2 | VR | OOD | 平均 | ||
| 数据集数量 | 10 | 10 | 12 | 4 | 36 | 5 | 5 | 5 | 3 | 18 | 10 | 4 | 6 | 4 | 24 | 78 |
| 2 | 56.0 | 62.9 | 65.0 | 81.2 | 63.7 | 56.6 | 48.2 | 45.3 | 46.6 | 49.4 | 80.1 | 59.4 | 82.1 | 65.8 | 74.8 | 63.8 |
| 4 | 55.0 | 62.7 | 64.9 | 80.4 | 63.3 | 57.0 | 47.3 | 45.7 | 44.5 | 49.1 | 80.2 | 60.3 | 82.0 | 65.7 | 74.9 | 63.6 |
| 8 | 54.9 | 62.2 | 65.2 | 81.0 | 63.2 | 55.1 | 48.9 | 44.8 | 46.1 | 49.0 | 79.6 | 58.8 | 81.6 | 65.8 | 74.3 | 63.4 |
| 16 | 54.7 | 63.1 | 64.8 | 81.8 | 63.4 | 56.0 | 46.3 | 44.4 | 45.7 | 48.4 | 79.9 | 59.3 | 82.0 | 65.9 | 74.7 | 63.4 |
| 32 | 54.6 | 62.8 | 65.0 | 80.3 | 63.2 | 54.4 | 46.2 | 41.9 | 45.7 | 47.2 | 75.6 | 22.3 | 73.4 | 65.7 | 64.5 | 59.9 |
| 温度 | 图像 | 视觉文档 | 全部 | |||||||||||||
| CLS | QA | RET | GD | 平均 | CLS | QA | RET | MRET | 平均 | VDRv1 | VDRv2 | VR | OOD | 平均 | ||
| 数据集数量 | 10 | 10 | 12 | 4 | 36 | 5 | 5 | 5 | 3 | 18 | 10 | 4 | 6 | 4 | 24 | 78 |
| 2 | 53.7 | 61.7 | 62.8 | 77.4 | 61.6 | 50.7 | 48.6 | 41.7 | 44.3 | 46.6 | 79.5 | 57.5 | 80.0 | 64.4 | 73.4 | 61.8 |
| 4 | 52.9 | 60.4 | 63.2 | 78.0 | 61.2 | 50.4 | 49.0 | 42.4 | 44.1 | 46.7 | 79.1 | 56.5 | 80.3 | 64.7 | 73.2 | 61.6 |
| 8 | 55.0 | 60.8 | 64.5 | 80.2 | 62.6 | 54.9 | 50.6 | 43.2 | 43.6 | 48.6 | 80.3 | 58.1 | 81.6 | 65.3 | 74.4 | 63.0 |
| 16 | 54.0 | 62.2 | 64.3 | 80.8 | 62.7 | 55.7 | 53.0 | 43.0 | 44.8 | 49.6 | 80.1 | 57.7 | 82.2 | 65.4 | 74.4 | 63.3 |
| 32 | 54.7 | 63.1 | 64.8 | 81.8 | 63.4 | 56.0 | 46.3 | 44.4 | 45.7 | 48.4 | 79.9 | 59.3 | 82.0 | 65.9 | 74.7 | 63.4 |
| 64 | 54.8 | 63.4 | 64.7 | 81.8 | 63.5 | 54.6 | 50.5 | 44.5 | 49.3 | 49.8 | 80.4 | 58.9 | 82.1 | 64.9 | 74.7 | 63.8 |
附录 C 案例研究
C.1 定性分析
为了更好地理解 UEmbed 与 Qwen3-VL-Embedding 之间的差距,我们在 MMEB-v2 上重新计算了每个查询的 Hit@1,并检查了 Qwen3-VL-Embedding 成功而 UEmbed 失败的案例。这些错误具有模态依赖性:(1) 图像。差距主要出现在细粒度识别(ImageNet-A、SUN397、N24News)和基于问题的 VQA(GQA、ScienceQA)中,UEmbed 有时会混淆视觉上相似的类别,或受到误导性的词汇线索影响。(2) 视频。Qwen3-VL-Embedding 在动作识别、时间片段定位和长视频推理(HMDB51、UCF101、EgoSchema、NExTQA、QVHighlight)方面表现更强,这很可能归功于其专门的时间/运动监督,而我们当前的训练数据中几乎不包含视频特定数据。(3) 视觉文档。差距较小,主要出现在多语言 ViDoRe 以及表格/数值推理类文档中。Qwen3-VL-Embedding 可能受益于其 rank-KL 目标函数,该目标函数将重排序器的分数蒸馏到嵌入模型中。
C.2 案例研究
我们展示了 UEmbed 在不同任务和模态下的更多案例研究。对于每个示例,我们可视化了前 10 个激活的稀疏 token。在图中,蓝色 token 表示查询激活,绿色 token 表示语料库激活,红色 token 表示查询和语料库之间共同激活的 token。我们发现,稀疏表示在问答、检索和定位任务上表现良好,激活的 token 与查询意图高度相关。然而,对于分类任务,模型倾向于过度关联无关概念,并且在指令遵循方面存在困难,导致稀疏激活不够精确。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org