Gemini Embedding 2:来自Gemini的原生多模态嵌入模型
Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini
Google DeepMind推出Gemini Embedding 2,这是一款原生多模态嵌入模型,支持在统一表示空间中嵌入视频、音频、图像和文本。该模型利用Gemini的多模态能力,通过大规模对比学习实现SOTA性能。在关键基准上表现优异:MSCOCO取得62.9 R@1,Vatex取得68.8 NDCG@10,MTEB multilingual达到69.9,MTEB Code达到84.0,超越了专用模型。其统一能力使其适用于RAG、推荐与搜索等下游任务,并在天文学、生物科学、艺术和烹饪等专业领域展现出强大的零样本性能。
Google 把多模态嵌入统一到一个模型里了,文本、代码、跨模态检索全面刷榜,做 RAG 和搜索的该认真看看了。
Madhuri Shanbhogue
Zhe Li
Shanfeng Zhang
Gustavo Hernández Ábrego
Shih-Cheng Huang
Aashi Jain
Daniel Salz
Sonam Goenka
Chaitra Hegde
Ji Ma
Feiyang Chen
Jiaxing Wu
Tanmaya Dabral
Babak Samari
Kevin Poulet
Daniel Cer
Kaifeng Chen
Paul Suganathan
Hui Hui
Jovan Andonov
Philippe Schlattner
Jay Han
Iftekhar Naim
Wing Lowe
Vladimir Pchelin
Albert Yang
Yi-Ting Chen
Zhongli Ding
Grace Zhang
Georg Heigold
Yichang Chen
Antoine Reveillon
Brendan Mccloskey
Wenlei Zhou
Dahun Kim
Rui Meng
Emma Wang
Jack Zheng
Halley Fede
Zhen Yang
Keegan Mosley
Brian Potetz
Sahil Dua
Henrique Schechter Vera
Shen Gao
Hesen Zhang
Andreas Hess
Hengxuan Ying
Alberto Montes
Karan Gill
Min Choi
Sebastian Russo
Anja Hauth
Jinhyuk Lee
Michael Boratko
Megan Barnes
Vikram Rao
Claudiu Musat
Cyril Allauzen
Ehsan Variani
Shankar Kumar
Tom Bagby
Junyi Jiao
Yang Gu
Tengxin Li
Ayush Agrawal
Roberto Santana
Dev Nath
Stephen Karukas
Shuoxuan Han
Lucia Loher
Alice Twu
Nidhi Vyas
Siddharth Bhai
Frank Palma Gomez
Wangyuan Zhang
Chaoren Liu
Jizheng Yang
Steve Qiu
Shijie Zhang
Sujay Kulkarni
Sascha Rothe
Sean Nakamoto
Raphael Hoffmann
Zach Gleicher
Yunhsuan Sung
Qin Yin
Tom Duerig
Mojtaba Seyedhosseini
摘要
我们推出 Gemini Embedding 2,这是一款原生多模态嵌入模型,能够将视频、音频、图像和文本模态嵌入到统一的表示空间中。我们利用 Gemini 的多模态能力,为这些模态之间任意组合的交错输入生成嵌入,这些嵌入在各类任务中均展现出良好的泛化性能。通过在多任务、多阶段训练框架中应用大规模对比学习,我们在关键嵌入基准测试上取得了最先进的性能,涵盖单模态、跨模态和多模态检索等多样化任务。实验表明,我们的嵌入模型在多种任务上表现强劲(MSCOCO 上 R@1 得分 62.9,Vatex 上 NDCG@10 得分 68.8,MTEB 多语言任务得分 69.9,MTEB 代码任务得分 84.0),超越了专门化模型的性能。这些统一能力使 Gemini Embedding 2 成为 RAG、推荐和搜索等下游应用场景的有力候选方案。此外,该模型在天文学、生物科学、美术及烹饪艺术等不同领域均展现出稳健的零样本性能,使其成为即使在专业领域也能开箱即用的高可靠表示工具。
\undefine@key
newfloatplacement\undefine@keynewfloatname\undefine@keynewfloatfileext\undefine@keynewfloatwithin
1 引言
嵌入模型提供密集向量表示,能够捕捉语义信息,这对于适应广泛的下游任务至关重要。随着基础模型原生具备多模态能力,并且能力持续飞速增长,确保嵌入模型以连贯的方式捕捉所有模态内部及跨模态的语义信息变得尤为重要。这类通用嵌入模型还将提升视频推荐和文档搜索等应用的性能,这些应用包含丰富的跨模态信息,但由于所含模态并非天然同质,因此可以从获取所有模态的丰富语义信息中受益。
现有的多模态嵌入模型,如 CLIP [radford2021learning]、ALIGN [jia2021scaling]、SigLIP 2 [tschannen2025siglip]、CoCa [yu2022cocacontrastivecaptionersimagetext],通过使用配对的跨模态数据并训练特定模态的编码器,将异构模态嵌入到统一的向量空间中。这种后期融合方法虽然能实现良好的单模态和跨模态能力,但在处理混合模态输入方面存在关键局限,且由于未利用模态间的交互,其丰富性有所欠缺。随着多模态大语言模型(MLLM)的发展,如今已能通过跨模态交互的深度融合,实现语义更丰富的嵌入。
在本工作中,我们引入了一个可泛化的多模态嵌入模型,该模型能将视频、音频、图像、文本模态及其任意组合嵌入到同一个表征空间中。多模态 Gemini Embedding 2 通过利用 Gemini [comanici2025gemini] 的能力,并采用多任务训练(涵盖多样化的任务集)进行训练,从而得到一个能捕捉模态间各种交互的模型。图 1 展示了多模态 Gemini Embedding 2 如何将异构来源映射到统一向量空间的高层示意。经过精心策划的任务集有助于模型泛化到广泛的企业应用场景,如文档检索、视频推荐、基于音频的搜索以及 RAG 应用 [lewis2020retrieval]。关键在于,让模型能够处理图像、文本和视频的交错序列,这催生了复杂而新颖的检索范式——例如,利用视觉和文本组合提示,精准定位视频中的特定时间事件。借助 Gemini 的能力,我们还证明了原生音频理解和原生多模态理解优于基于文本的替代方案(如 ASR 或字幕生成)。
我们在涵盖学术和企业场景的多种基准上进行了全面评估。如图 2 所示,我们的模型相比其他模型取得了最先进的性能。在评估文本嵌入能力时,我们采用大规模多语言文本嵌入基准(MMTEB)[enevoldsen2025mmteb],该基准包含多语言任务,覆盖检索、聚类、分类等关键下游嵌入应用场景。Gemini Embedding 2 在多语言和代码任务上取得了最先进的性能,超越了排行榜上的现有模型。我们在 MSCOCO [chen2015microsoftcococaptionsdata]、Flickr30k [plummer2016flickr30kentitiescollectingregiontophrase] 和 MSR-VTT [Xu2016MSRVTTAL] 等广泛跨模态检索基准上展现了强劲的分数。我们还展示了该模型在通用多模态检索任务以及专业领域中的泛化能力。
2 相关工作
大语言模型作为文本嵌入器
文本嵌入模型的范式已从单纯依赖纯编码器架构(如 BERT、RoBERTa)发展到利用仅解码器或大规模大语言模型作为骨干网络。BGE 系列和 E5 等模型建立了指令微调后的表示方法,通过任务特定的前缀将语义搜索、聚类和分类等下游任务有效统一到单一模型中。认识到大语言模型具备丰富的语义理解能力后,近期研究大量聚焦于大语言模型增强训练和知识蒸馏。Gecko 模型展示了可以通过两步蒸馏流程来训练轻量级、高效率的检索器,该流程利用了海量大语言模型教师网络的广博知识。与此同时,NV-Embed 通过使用指令微调对比学习并积极整合合成的非检索数据,将仅解码器的大语言模型转化为通用型嵌入器,在 MMTEB 排行榜上取得了强劲性能。Gemini Embedding 凭借利用合成数据以及通过 Gemini 强大的预训练在多语言任务上展现出的出色泛化能力,在 MMTEB 排行榜上达到了最先进的性能水平。
多模态嵌入器的演进
早期的多模态嵌入范式,以 CLIP [radford2021learning] 和 ALIGN [jia2021scaling] 这类双塔模型为代表,受限于其依赖简单的图文对进行狭窄的对比学习目标。如今,该领域正朝着能够将文本、代码、图像、结构化文档、音频和视频映射到单一、统一、连续的语义空间的多模态架构发展。嵌入模型通过扩展现有 MLLM,并采用多阶段对比训练进行检索,从而实现了卓越的跨模态检索能力。SAIL-Embedding [lin2025sailembeddingtechnicalreportomnimodal] 进一步体现了这一转变,它采用了一种内容感知的渐进式训练方法,将多模态表示无缝映射到工业推荐场景(例如,序列到项目的预测)中。同样,Amazon Nova MME [AWS2025novaembeddings] 和 SigLIP 2 [tschannen2025siglip] 在统一不同模态以用于跨模态检索工作流方面也展现了强大的性能。
面向双向注意力的架构适配
虽然因果(自回归)大语言模型在生成任务中表现出色,但其固有的单向注意力机制在生成密集、上下文感知的嵌入向量时施加了不必要的限制。已有几种创新框架出现以规避这一局限。MoCa [chen2025mocamodalityawarecontinualpretraining] 通过引入模态感知的持续预训练直接解决了这个问题,它利用一个联合重建目标,对交错的文本和图像输入进行去噪,从而在因果骨干网络上强制进行双向上下文感知推理。类似地,MM-Embed [lin2025mmembeduniversalmultimodalretrieval] 通过模态感知的难负样本挖掘来处理模态偏差问题,确保嵌入模型不会不成比例地偏向文本到文本的共振,而牺牲跨模态的相关性。
面向企业用例的适配
随着企业和智能体应用场景对超长上下文的需求不断增长,且越来越聚焦于文档处理,现代嵌入模型需要高效地处理海量信息负载。这些模型利用专门的视觉文档处理技术(例如视觉编码器的分块混合架构)来嵌入复杂的PDF、图表和表格,这使得RAG系统的质量高度依赖于处理流程中的各个环节,比如分块策略等。
尽管前述架构已成功推动了多阶段知识蒸馏、大语言模型主干适配以及企业级应用的发展,但它们主要是在各自独立的维度上进行优化。Gemini Embedding 2 将这些能力统一到一个单一模型中,覆盖了广泛的用例场景,用户可以直接开箱即用。
3 多模态 Gemini 嵌入
在本节中,我们将从模型架构、目标函数和训练方案三个方面,提供多模态 Gemini Embedding 2 的技术细节。
3.1 模型架构
Gemini Embedding 2 模型旨在为不同模态的输入以及融合了多种模态的输入创建整体表征。这些表征可用于多种下游任务,包括检索、聚类、分类和排序。Gemini Embedding 2 利用 Gemini 的多模态和跨模态能力来构建此类表征。该嵌入模型以 Gemini 为初始化基础,并进一步通过任务特定、模态特定和跨模态的训练进行微调。这使得 Gemini Embedding 2 能够在 Gemini 参数中已有的海量知识之上构建表征。从这个意义上说,从 Gemini 初始化 Gemini Embedding 2 可以理解为该嵌入模型的“预训练”阶段。
Gemini Embedding 2 构建表征的方式与我们之前的 Gemini Embedding 模型 [lee2025geminiembeddinggeneralizableembeddings] 类似,但有一个重要区别:不同模态需要不同的步骤来将原始格式转换为 token 序列。在 Gemini Embedding 2 中,我们利用 Gemini 来执行这些类型的数据和格式转换。通过这种方式,该模型能够以 Gemini 原生支持的格式,将原始图像、视频或音频作为输入。
在 token 化之后,输入的 token 序列会由一个从 Gemini 初始化的、采用双向注意力机制的 Transformer 进行处理,生成一个 token 嵌入向量序列,其中 是 Transformer 模型的维度。为了生成一个代表输入中所有信息的单一嵌入向量,会应用一个池化器,。先前的研究 [suganthan2025adaptingdecoder] 表明,简单的池化策略在模型适配中可能很有效。因此,我们选择了均值池化,即简单地沿序列轴对 token 嵌入向量取平均。最后,应用一个随机初始化的线性投影,将嵌入向量缩放到目标维度,其中 是输出嵌入向量的维度。
3.2 训练目标
Gemini Embedding 2 的多模态特性需要采用多任务和多阶段的训练方式。这样,不同的模态可以在不同的任务中进行训练。我们使用了大量的单模态任务、多模态任务以及跨模态任务。
与我们之前的版本类似 [lee2025geminiembeddinggeneralizableembeddings],多模态 Gemini Embedding 2 模型采用带批次内负样本的噪声对比估计(NCE)损失进行训练 [oord2018representation]。具体的损失函数会根据训练任务的不同略有差异。通常,一个训练样本包含一个查询、一个正例目标以及(可选的)一个难负例目标。在纯文本训练任务中,每个样本还附带一个预设的任务字符串,例如"问答"或"事实核查",用于描述任务的性质。在训练过程中,我们会随机丢弃任务字符串,以增强模型在不使用任务字符串的不同模态输入上的鲁棒性。查询和文本段落被嵌入为向量,位于:
| (1) |
给定一个大小为 的批次,应用于这些嵌入的损失函数如下:
| (2) |
其中 是余弦相似度,且
| (3) |
这个掩码项对于分类任务尤其相关,因为这类任务的目标(标签)数量较少。需要注意的是,如果没有提供难负例,则分母中的第二项会被省略。
为了支持单一模型输出不同维度的嵌入,我们使用 MRL [kusupati2022matryoshka] 对上述损失函数进行了调整,将其分解为嵌入维度中重叠子维度上的多个独立损失(例如,多损失训练:对前 768 维嵌入设置一个损失,对前 1,536 维设置另一个损失,以此类推)。Gemini Embedding 2 提供 维嵌入,其 MRL 支持针对 768 维和 1,536 维进行了优化。
3.3 训练方案
我们充分利用训练设置的多任务特性,让模型从每个不同的任务中学习。如第 3.2 节所述,这些任务以不同的方式共同构建跨不同模态的统一嵌入空间。我们采用了与 Gecko [lee2024geckoversatiletextembeddings] 和 Gemini Embedding [lee2025geminiembeddinggeneralizableembeddings] 等先前模型相同的多阶段训练方法,具体描述如下。
预微调(PFT)
为了将模型中的参数从自回归生成调整为编码,此阶段采用多任务设置,使用大量可能带有噪声的查询-目标对进行训练。此外,在此阶段,我们发现使用较大的批次大小是有益的,它能提供更稳定的梯度,从而减轻噪声输入的影响。在此阶段,我们的多任务设置中仅使用图像、文本和代码任务。来自每个不同任务的示例会按预先指定的采样率进行采样,以构建单一任务的训练批次。
微调(FT)
该模型的微调阶段基于使用大量文本、代码、文档、图像、音频和视频任务进行训练。在此微调过程中,许多(但并非全部)任务包含的示例都带有查询、目标和难负例目标三元组。对于此训练阶段,我们发现为每个任务调整批次大小以提升相应评估的质量是有益的。在此阶段,我们同样从单一任务中采样示例来构建训练批次。模态间的对齐基于训练多个单模态批次以及跨模态批次。与前一阶段一样,使用所有不同任务和模态进行训练需要多任务训练设置,并且每个不同任务的采样率是根据经验确定的。根据经验,我们发现平衡所有模态的整体性能对多任务设置中的超参数(如采样率和批次大小)非常敏感。
模型汤
为了系统化地组合不同的检查点,并在不同模态间获得额外的泛化性能,我们对来自各个微调运行的参数进行了平均。我们尝试了不同的参数组合,包括对来自同一训练运行 [izmailov2018averaging] 和不同训练运行 [wortsman2022model] 的检查点进行平均,以及各种加权平均。
4 评估
我们在涵盖多模态和单模态的全面基准测试套件上严格评估了 Gemini Embedding 2,展示了其在文本、图像、视频和音频理解方面的最先进能力。与通常依赖脆弱、特定任务指令的竞品模型不同,Gemini Embedding 2 提供了一个鲁棒、统一的潜在空间,在零样本设置下无需手动提示词工程即可实现高性能。
4.1 多模态检索
| Gemini | Amazon Nova‡ | Voyage-3.5- ‡ | 多模态‡ | ||
| Embedding 2 | MME | 多模态 | embedding@001 | ||
| 旧版 Google 模型 | |||||
| 图像 图像 (Recall@1) | GUIEC [guiec] | 79.4 | 68.6 | 69.4 | 69.5 |
| ImageNet [5206848] | 83.6 | - | - | 71.8 | |
| 文本 图像 (Recall@1) | 平均值† | 80.5 | 71.6 | 75.8 | 69.5 |
| MSCOCO [chen2015microsoftcococaptionsdata] | 62.9 | 57.2 | 58.1 | 53.1 | |
| Flickr30k [plummer2016flickr30kentitiescollectingregiontophrase] | 89.1 | 81.6 | 89.9 | 81.4 | |
| DOCCI [DOCCI] | 93.4 | 84.0 | 83.8 | - | |
| TextCaps [TextCaps] | 89.6 | 76.0 | 79.4 | 74.0 | |
| 图像 文本 (Recall@1) | 平均值† | 91.2 | 81.6 | 85.9 | 83.4 |
| MSCOCO [chen2015microsoftcococaptionsdata] | 78.8 | 68.3 | 74.5 | 68.2 | |
| Flickr30k [plummer2016flickr30kentitiescollectingregiontophrase] | 97.4 | 87.5 | 94.5 | 94.0 | |
| DOCCI [DOCCI] | 91.3 | 76.5 | 77.4 | - | |
| TextCaps [TextCaps] | 97.4 | 88.9 | 88.6 | 88.1 | |
| 文本 视频 (NDCG@10) | 平均值 | 63.1 | 54.0 | 49.9 | 49.2 |
| Vatex [wang2020vatexlargescalehighqualitymultilingual] | 68.8 | 60.3 | 55.2 | 54.9 | |
| MSR-VTT [Xu2016MSRVTTAL] | 68.0 | 67.0 | 63.0 | 57.9 | |
| YouCook2 [zhou2017automaticlearningproceduresweb] | 52.5 | 34.7 | 31.4 | 34.9 | |
| 图像+文本 文本 (Recall@20) | EncyclopedicVQA [Mensink_2023_ICCV] | 71.5 | - | 58.6 | - |
| 文档检索 (NDCG@10) | ViDoRe V2 [mace2025vidorebenchmarkv2raising] | 64.9 | 60.6 | 65.5 | 28.9 |
| 总体性能† | 77.2 | 68.2 | 70.0 | 64.1 | |
| 模态 | V/A/I/T | V/A/I/T | V/I/T | I/T |
我们将 Gemini Embedding 2 与其他多模态嵌入模型——Voyage-3.5-multimodal [VoyageAI2026multimodal35]、Amazon Nova MME [AWS2025novaembeddings] 以及 Google 的旧版模型 multimodalembedding@001 [google_cloud_multimodal_embeddings]——在涵盖图像、文本和视频模态的多种单模态、跨模态及多模态检索基准上进行了评估(见表 1)。对于单模态图像评估,我们使用了 Google 通用嵌入挑战赛(GUIEC)[araujo2022google],该任务要求在一个包含 20 万张图像的大规模索引上进行实例级检索。我们还评估了图像到文本和文本到图像基准上的跨模态检索质量,包括 MSCOCO [chen2015microsoftcococaptionsdata]、Flickr30K [plummer2016flickr30kentitiescollectingregiontophrase]、DOCCI [DOCCI] 和 TextCaps [TextCaps]。这些任务从基础的图像描述到包含空间推理和场景文本理解的长描述,对模型提出了不同难度的挑战。我们使用 Gemini Embedding 2 分别对图像和文本进行嵌入,然后在整个测试集上通过查询与文档之间的余弦相似度进行检索。我们还通过将图像和文本一起嵌入来评估多模态嵌入能力。我们使用 EncyclopedicVQA [Mensink_2023_ICCV] 将视觉问答作为检索评估任务,将图像与问题一起嵌入以检索正确答案。对于文本到视频的检索,我们在 Vatex [wang2020vatexlargescalehighqualitymultilingual]、MSR-VTT [Xu_2016_CVPR] 和 YouCook2 [zhou2017automaticlearningproceduresweb] 上进行了评估,其中视频以每秒 1 帧的速率嵌入,最多 32 帧。
Gemini Embedding 2 取得了最高的全局平均分,并在单模态图像检索、文本到图像、图像到文本以及文本到视频任务上表现领先,尤其在 DOCCI 和 TextCaps 等长描述基准上结果尤为突出。其训练数据组合展现出了出色的泛化能力,能够很好地适应 Vatex、MSR-VTT 和 YouCook2 等第三方评估任务,尽管这些数据集的特定领域训练拆分并未包含在训练集中。
在 ViDoRe 基准测试 V2 [mace2025vidorebenchmarkv2raising] 文档检索基准中,如表 1 所示,Gemini Embedding 2 取得了 64.9 的分数,在需要理解页面级视觉结构、布局和嵌入文本的任务中展现了具有竞争力的性能。这使得 Gemini Embedding 2 领先于 Amazon Nova MME(60.6),并接近 Voyage-3.5-multimodal(65.5)。Gemini Embedding 2 也是此次对比中仅有的两款支持完整视频/音频/图像/文本模态集的模型之一(另一款是 Amazon Nova MME),考虑到它同时为如此广泛的任务进行了优化,其文档检索性能尤其值得关注。
4.2 MMTEB
| Gemini | Amazon Nova∗ | Gemini | voyage-3.5/† | ||
| Embedding 2 | MME | Embedding | voyage-code-3 | ||
| MTEB(多语言)[enevoldsen2025mmteb] | 均值(任务) | 69.9 | 63.8 | 68.4 | 58.5 |
| 均值(类型) | 61.2 | 59.6 | 51.9 | ||
| - 双语文本挖掘 | 85.4 | 79.3 | 60.5 | ||
| - 分类 | 73.1 | 71.8 | 58.5 | ||
| - 聚类 | 55.3 | 54.6 | 45.9 | ||
| - 指令检索 | 2.9 | 5.2 | 6.5 | ||
| - 多标签分类 | 32.2 | 29.2 | 21.7 | ||
| - 配对分类 | 83.2 | 83.6 | 76.0 | ||
| - 重排序 | 69.0 | 65.7 | 64.2 | ||
| - 检索 | 70.0 | 67.7 | 64.0 | ||
| - STS | 79.4 | 79.4 | 70.0 | ||
| MTEB(代码)[enevoldsen2025mmteb] | 均值 | 84.0 | –‡ | 76.0 | –‡ |
| CoIR [li2024coircomprehensivebenchmarkcode] | 均值 | 82.3 | –‡ | 73.9 | 78.5 |
| 模态 | 视频/音频/图像/文本 | 视频/音频/图像/文本 | 文本 | 文本 |
多语言基准 MMTEB [enevoldsen2025mmteb] 包含大量独立的评估任务,覆盖 250 多种语言和 10 种任务类型:双语文本挖掘、分类、聚类、指令检索、多标签分类、配对分类、重排序、检索、STS 和摘要。Gemini Embedding 2 的整体性能以及其他多模态模型的性能如表 2 所示,表中还列出了各模型支持的模态。
MMTEB 结果表明,Gemini Embedding 2 在这个纯文本基准测试中优于其他多模态模型,这表明其扩展的多模态能力并未损害其在纯文本任务上的性能。与我们之前纯文本的 Gemini Embedding 模型相比,新的多模态 Gemini Embedding 2 展现出更强的性能,超过了我们之前模型按任务计算的平均值 68.32,达到了 69.9 的同等水平。此外,我们的多模态 Gemini Embedding 2 在特定任务的评估中树立了新的最先进性能水平,例如 MTEB Code v1 [enevoldsen2025mmteb](包含 15 种编程语言的 12 项代码检索任务)和代码信息检索基准 CoIR [li2024coircomprehensivebenchmarkcode](包含 9 种编程语言的 10 项代码检索任务)。表 2 还显示,我们的新 Gemini Embedding 2 模型在这些基准测试中的表现明显优于我们之前的纯文本 Gemini Embedding 模型。值得注意的是,Gemini Embedding 2 也明显优于其他纯文本模型,并且优于 voyage-code-3 等特定领域模型。
4.3 MSEB
| 模型设置 | 平均值 | 检索部分 (mrr@10) | |
|---|---|---|---|
| 段落语内 | 段落跨语 | ||
| 使用 ASR 的 Gemini Embedding 2 | 70.40 | 73.58 | 67.55 |
| 使用原生音频的 Gemini Embedding 2 | 73.99 | 75.58 | 72.56 |
为了严格评估 Gemini Embedding 2 的听觉能力,我们在大规模声音嵌入基准测试(MSEB)[heigold2026massivesoundembeddingbenchmark] 上对该模型进行了基准测试。我们将评估重点放在 MSEB 的检索部分。模型会收到一个语音查询,任务是在一个大型文本文档语料库中为查询找到最相关的信息。
4.3.1 实验设置
多模态检索中一个长期存在的挑战是标准流水线方法所带来的瓶颈——这类方法通常先将音频转录为文本,再生成嵌入向量。为了衡量我们统一多模态架构的影响,我们对比了两种不同的输入模态:
- 1.
采用 ASR 的 Gemini Embedding 2:一种级联基线方案,原始音频信号首先通过自动语音识别(ASR)系统转录为文本,随后对生成的文本进行编码。
- 2.
采用原生音频的 Gemini Embedding 2:我们提出的方法,直接处理原始音频输入,无需中间文本转录步骤。
我们采用前 10 位平均倒数排名(mrr@10)作为主要评估指标。检索设置进一步划分为两个关键分区以评估泛化能力:PassageInLang(同语言内的语内检索)和 PassageCrossLang(跨语言检索)。
4.3.2 结果
如表 3 所示,结果表明,使用原生音频处理相比 ASR 基线显著提升了检索性能。数据显示,采用原生音频的 Gemini Embedding 2 平均检索 mrr@10 达到 73.99,相比基于 ASR 的方法(70.40)取得了大幅提升。
从任务分区来看,我们在不同语言复杂度场景下均观察到一致的性能提升:
PassageInLang:
直接音频建模使同语言检索性能提升了 +2.0 个百分点(75.58 对比 73.58)。级联基线方案与 Gemini Embedding 2 之间的性能差距,揭示了流水线架构中存在的结构性缺陷。本实验中的级联系统(ASR → 检索)严重受困于错误传播问题。当 ASR 系统误解了一段模糊的音频片段并输出错误的文本结果时,下游检索系统将面对一个本质被篡改的查询,从而导致检索效果不佳。Gemini Embedding 2 通过直接原生编码原始音频克服了这一瓶颈。它不再强制进行“硬性”文本决策(例如,区分“recognize speech”与“wreck a nice beach”),而是让生成的嵌入向量保留了原始声学信号固有的模糊性。这种鲁棒的连续表示,通过保留丰富的声学线索(如韵律、语调和重音),使系统有显著更高的概率返回正确的检索结果。
PassageCrossLang:
值得注意的是,在跨语言场景下,性能差距进一步扩大。原生音频嵌入带来了惊人的 +5.01 个百分点的提升(72.56 对比 67.55)。PassageCrossLang 上的巨大跃升验证了 Gemini Embedding 2 的模态无关潜在空间能够深度对齐语义特征,无论源音频使用何种语言,其泛化能力都远超由中间 ASR 转录器参数化所限定的严格语音边界。
总体而言,MSEB 基准测试证实,Gemini Embedding 2 成功地对连续的原始音频进行了建模,有效整合出一个整体表示,其性能显著优于依赖转录的瓶颈方案。
5 消融研究
为了更好地理解 Gemini Embedding 2 如何在众多不同任务和语言上取得优异性能,我们对训练方案进行了系统分析。
| 模型 | 变体 | MicroVQA [burgess2025microvqa] | ArtCap [lu2022artcap] | AstroLLaVA [zaman2025astrollava] | Recipe1M [marin2021recipe1m+] | |
|---|---|---|---|---|---|---|
| 食材 | 步骤说明 | |||||
| CLIP [radford2021learning] | Base Patch32 | 34.1 | 34.1 | 21.2 | 64.6 | 61.1 |
| Large Patch14 | 44.4 | 49.4 | 28.8 | 76.5 | 74.6 | |
| Large Patch14-336 | 46.7 | 52.2 | 31.6 | 76.0 | 75.6 | |
| ALIGN [jia2021scaling] | Base | 48.1 | 49.2 | 18.4 | 70.3 | 70.8 |
| SigLIP 2 [tschannen2025siglip] | Base Patch16-256 | 23.0 | 16.3 | 6.3 | 69.8 | 70.7 |
| Large Patch16-384 | 27.4 | 7.3 | 11.0 | 78.7 | 78.3 | |
| Giant Patch16-384 | 33.3 | 8.4 | 13.2 | 81.2 | 80.4 | |
| TIPS [maninis2025tipstextimagepretrainingspatial] | Base Patch14 | 14.8 | 59.3 | 6.9 | 60.7 | 59.3 |
| Large Patch14 | 21.5 | 59.9 | 8.9 | 61.3 | 63.0 | |
| Giant Patch14 | 20.0 | 65.2 | 10.1 | 66.0 | 65.6 | |
| Voyage-3.5-multimodal | 53.3 | 48.7 | 30.3 | |||
| Gemini Embedding 2 | 79.3 | 67.7 | 64.4 | 90.2 | 92.1 | |
5.1 对专业领域的泛化能力
为了严格评估 Gemini Embedding 2 在专业场景下的通用性和多模态对齐能力,我们在多个领域专用数据集上评估了其零样本图像到文本的检索性能。为确保评估的全面性,我们选取了对应不同真实应用场景的数据集:显微镜与生物科学(MicroVQA [burgess2025microvqa])、美术(ArtCap [lu2022artcap])、天文学(AstroLLaVA [zaman2025astrollava])以及烹饪艺术(Recipe1M [marin2021recipe1m+])。我们将其构建为标准 Recall@5(R@5)基准测试,并将我们的模型与一系列开源及专有视觉语言模型进行了对比(见表 4)。
我们的研究结果表明,Gemini Embedding 2 在所有评估领域均达到了最先进的性能,并且常常以显著的优势超越现有基线模型。例如,在天文学(AstroLLaVA)和显微镜(MicroVQA)领域,Gemini Embedding 2 的 R@5 分别达到了 64.4 和 79.3,在天文学上性能几乎是这些基线模型的两倍,在显微镜领域则高出 48% 以上。在 Recipe1M 数据集上,它在检索食材(90.2)和操作步骤(92.1)两项指标上均突破了 90.0 大关,显著优于次优模型 SigLIP2-Giant(分别为 81.2 和 80.4)。
超越绝对性能指标,我们的评估突显了跨领域一致性方面的显著差异。现有模型族的表现往往因目标领域不同而大幅波动,而 Gemini Embedding 2 则保持了稳健的通用对齐能力。如表 4 所示,许多基线架构在不同专业领域呈现出偶然性的性能高峰与低谷。例如,TIPS [maninis2025tipstextimagepretrainingspatial] 模型族在美术领域表现出强对齐能力,TIPS-G14 在 ArtCap 上达到了 65.2 的 R@5 值。然而,其在微观生物图像(MicroVQA 上为 20.0)上的表现则相对低得多。同样,SigLIP2 系列在 Recipe1M 数据集上表现出色(得分高达 81.2),但在捕捉 ArtCap 的视觉语义方面却表现不佳(得分降至 8.4)。相比之下,Gemini Embedding 2 并未表现出这些剧烈的、依赖领域的波动。相反,它提供了一个始终可靠的、可预测地泛化到各种高度专业化任务的多模态嵌入空间。
最终,这些结果凸显了 Gemini Embedding 2 开箱即用的表征具有前所未有的稳健性。从实验室生物学家和天体物理学家,到烹饪平台和数字人文学科研究者,各类用户都可以将 Gemini Embedding 2 轻松集成到他们多样化的流程中,以构建高度精确、具备领域感知能力的多模态检索系统。
5.2 合成数据的影响
纯文本版 Gemini Embedding 模型 [lee2025geminiembeddinggeneralizableembeddings] 展示了 Gemini 模型在提升用于训练 Gemini Embedding 模型的文本数据质量方面的有效性。在这款全新的 Gemini Embedding 2 模型中,我们同样借助 Gemini 的能力来改善用于训练该模型的数据质量。我们以部分 MTEB 代码任务为例,说明 Gemini 在合成高质量训练数据时产生的影响。结果如表 5 所示。以纯文本版 Gemini Embedding 模型的结果为基准,多模态版 Gemini Embedding 2 模型的对应结果显示出一定改进,即便在未添加任何合成数据的情况下也是如此。这一点值得注意,因为正如在其他纯文本评估中所观察到的,这款新的多模态模型超越了此前纯文本版本的表现(MMTEB 对比请参见表 2)。使用 Gemini 生成的合成数据后,本分析所涉及的三个 MTEB 代码任务均取得了非常显著的改进,尤其是在 CodeFeedbackMT [zheng2024opencodeinterpreterintegratingcodegeneration] 任务以及 SyntheticText2SQL 和 CodeFeedbackST [li2024coircomprehensivebenchmarkcode] 任务上。总体而言,在这些具有挑战性的代码检索任务中,使用合成数据使我们此前的 Gemini Embedding 模型平均提升了 +15.81 分。
| 平均值 | CodeFeedbackMT | CodeFeedbackST | SyntheticText2SQL | |
|---|---|---|---|---|
| Gemini Embedding | 70.5 | 56.3 | 85.3 | 70.0 |
| Gemini Embedding 2(无合成数据) | 73.0 | 57.9 | 85.5 | 75.7 |
| Gemini Embedding 2(有合成数据) | 86.3 (+15.8) | 92.3 | 88.6 | 78.1 |
5.3 微调与预微调的影响
我们比较了预微调(PFT)检查点和最终微调(FT)检查点在多种图像与视频理解任务上的性能。如图3所示,FT在几乎所有评估基准上的表现均优于PFT。在图像任务上的改进虽然一致,但相对有限。最显著的提升集中在视频评估中,这是因为FT阶段加入了额外的视频训练数据。
5.4 领域内视频数据的影响
| 模型配置 | MSR-VTT | YouCook2 | Vatex | |||
| nDCG@10 | nDCG@10 | nDCG@10 | ||||
| 基线 | ||||||
| Gemini Embedding 2 | 68.2 | – | 55.9 | – | 69.2 | – |
| 微调模型 | ||||||
| + MSR-VTT 数据 | 75.0 | +6.8 | 56.1 | +0.2 | 71.7 | +2.5 |
| + MSR-VTT 与 Vatex 数据 | 76.1 | +7.9 | 55.3 | -0.6 | 79.5 | +10.3 |
| 模型汤(Gemini Embedding 2 : ) | ||||||
| 比例 2:1 | 71.7 | +3.5 | 56.1 | +0.2 | 74.5 | +5.3 |
| 比例 1:1 | 73.7 | +5.5 | 56.8 | +0.9 | 76.8 | +7.6 |
表 6 显示,在 Gemini Embedding 2 基础上构建的微调模型对比中,评估指标对添加针对性领域内数据高度敏感。请注意,我们将领域内数据加入微调混合集,并对新增数据训练一个周期。仅需数千步训练和适度的 O(k) 数据量,就能在目标任务上取得显著提升(例如,加入 MSR-VTT 和 Vatex 的训练集拆分后,MSR-VTT 提升至 76.1%,Vatex 提升至 79.5%)。然而,这种聚焦也可能导致领域外任务性能轻微下降(如 YouCook2 降至 55.3%)。有趣的是,通过模型汤(model souping)技术,新微调的权重与原始基础模型仍保持高度兼容。对汤权重进行简单插值(例如 `或` 混合),能有效恢复视频性能增益,在多个案例中通过平衡任务特定知识与原始模型的鲁棒性,取得了全面优于基线的结果。
6 未来工作
Gemini Embedding 2 强大的原生多模态能力,为众多企业应用场景释放了潜力,例如智能体 RAG、视频推荐、交错多模态检索等,且无需转换为中间模态。基于大语言模型骨干网络的高度能力,我们认为纳入搜索系统中的其他信号(如排序)将极大有助于提升嵌入向量的检索能力。智能体 RAG 应用场景也指明了未来可能的发展方向,即针对这些企业用例,通过微调嵌入向量来训练端到端 RAG 应用。随着交错多模态应用范围的持续扩展,我们邀请更广泛的学术界贡献新颖的评估框架,以帮助对这些新兴能力进行基准测试。
7 结论
Gemini Embedding 2 代表了通用表示领域的一次变革性进步,为我们此前仅支持文本的 Gemini Embedding 模型推出了一个最先进的多模态后继版本。Gemini Embedding 2 能够无缝地为文本、图像、音频和视频等所有模态的任意交错输入组合生成嵌入向量,从而在各类任务中展现出良好的泛化能力。通过利用 Gemini 核心的多模态、多语言和以代码为基础的能力,Gemini Embedding 2 模型在 MSCOCO、Vatex 和 MMTEB 等知名嵌入基准测试中取得了里程碑式的性能,尤其在代码检索方面实现了显著飞跃。我们的研究结果凸显了其非凡的通用性,表明它不仅擅长通用任务,在显微镜、天文学和烹饪艺术等专业领域也表现出色。此外,通过证明原生音频输入在检索任务中优于传统的自动语音识别(ASR),并消除了对昂贵的任务特定指令的需求,Gemini Embedding 2 提供了一种高效的架构。这种统一的嵌入方法促进了复杂的跨数据检索设置,为与 Gemini 协同构建下一代智能体系统提供了必要的基础设施。
参考文献
8 完整结果
| 任务名称 | 性能 |
|---|---|
| AILAStatutes | 49.50 |
| AfriSentiClassification | 59.38 |
| AlloProfClusteringS2S.v2 | 61.75 |
| AlloprofReranking | 84.16 |
| AmazonCounterfactualClassification | 86.99 |
| ArXivHierarchicalClusteringP2P | 63.86 |
| ArXivHierarchicalClusteringS2S | 64.54 |
| ArguAna | 83.60 |
| ArmenianParaphrasePC | 97.56 |
| BUCC.v2 | 99.09 |
| BelebeleRetrieval | 93.81 |
| BibleNLPBitextMining | 34.09 |
| BigPatentClustering.v2 | 41.59 |
| BiorxivClusteringP2P.v2 | 53.10 |
| BornholmBitextMining | 64.14 |
| BrazilianToxicTweetsClassification | 33.21 |
| BulgarianStoreReviewSentimentClassfication | 81.32 |
| CEDRClassification | 57.13 |
| CLSClusteringP2P.v2 | 43.56 |
| CSFDSKMovieReviewSentimentClassification | 54.92 |
| CTKFactsNLI | 87.20 |
| CataloniaTweetClassification | 58.76 |
| Core17InstructionRetrieval | 6.44 |
| CovidRetrieval | 80.14 |
| CyrillicTurkicLangClassification | 95.16 |
| CzechProductReviewSentimentClassification | 68.47 |
| DBpediaClassification | 93.83 |
| DalajClassification | 51.26 |
| DiaBlaBitextMining | 89.00 |
| 爱沙尼亚语情感分类 | 54.47 |
| 法罗语句子语义相似度 | 88.83 |
| 菲律宾语Shopee评论分类 | 50.11 |
| 芬兰语段落语义相似度 | 32.37 |
| 金融短语库分类 | 87.16 |
| Flores双语文本挖掘 | 90.43 |
| 德语STS基准测试 | 87.90 |
| 希腊法律法典分类 | 51.65 |
| 古吉拉特语新闻分类 | 92.19 |
| HAL句子到句子聚类v2 | 32.30 |
| Hagrid检索 | 99.19 |
| IN22Gen双语文本挖掘 | 98.43 |
| 印度语言跨语言语义相似度 | 61.36 |
| IndicGenBench Flores双语文本挖掘 | 99.22 |
| 印度语言分类 | 83.39 |
| 印尼语IdClickbait分类 | 64.95 |
| 祖鲁语新闻分类 | 46.16 |
| ItaCasehold分类 | 69.68 |
| JSICK | 84.85 |
| 韩语仇恨言论多标签分类 | 26.39 |
| 韩语讽刺分类 | 64.39 |
| 库尔德语情感分类 | 87.90 |
| LEMB密钥检索 | 62.25 |
| LegalBench企业游说 | 96.37 |
| MIRACL硬负样本检索 | 71.15 |
| MLQA检索 | 84.51 |
| 马其顿语推文情感分类 | 73.13 |
| 马耳他语新闻分类 | 39.76 |
| MasakhaNEWS分类 | 82.63 |
| MasakhaNEWS句子到句子聚类 | 60.44 |
| Massive意图分类 | 80.86 |
| Medrxiv段落到段落聚类v2 | 46.53 |
| MultiEURLEX多标签分类 | 4.70 |
| MultiHate分类 | 79.31 |
| NTREX双语文本挖掘 | 96.48 |
| 尼泊尔语新闻分类 | 97.98 |
| News21指令检索 | 2.64 |
| 任务名称 | 性能 |
|---|---|
| NollySenti双语文本挖掘 | 76.46 |
| 北欧语言分类 | 90.34 |
| 挪威法院双语文本挖掘 | 95.39 |
| Nusa段落情感分类 | 62.17 |
| Nusa翻译双语文本挖掘 | 84.47 |
| NusaX-senti | 85.26 |
| NusaX双语文本挖掘 | 93.04 |
| 奥里亚语新闻分类 | 95.78 |
| Opusparcus PC | 97.11 |
| PAC | 70.75 |
| PawsX配对分类 | 61.22 |
| Plsc段落到段落聚类v2 | 75.65 |
| 诗歌情感分类 | 57.27 |
| PolEmo2.0-OUT | 77.00 |
| Ppc PC | 95.40 |
| 旁遮普语新闻分类 | 83.12 |
| RTE3 | 89.79 |
| Robust04指令检索 | -0.44 |
| 罗姆语圣经聚类 | 47.88 |
| RuBQ重排序 | 77.98 |
| SCIDOCS | 25.68 |
| SIB200句子到句子聚类 | 43.33 |
| SICK-R | 83.59 |
| SNL层次化段落到段落聚类 | 59.59 |
| STS12 | 81.07 |
| STS13 | 89.69 |
| STS14 | 85.48 |
| STS15 | 90.67 |
| STS17 | 88.96 |
| STS22.v2 | 70.80 |
| STSB | 85.02 |
| STS基准测试 | 88.68 |
| STSES | 76.66 |
| Scala分类 | 54.30 |
| SemRel24 STS | 74.87 |
| 印地语情感分析 | 74.48 |
| 僧伽罗语新闻分类 | 82.82 |
| 斯瓦蒂语新闻分类 | 57.63 |
| 斯洛伐克语影评情感分类 | 93.57 |
| SpartQA | 8.74 |
| Sprint重复问题 | 96.61 |
| StackExchange聚类v2 | 92.18 |
| StackOverflow问答 | 97.76 |
| Statcan对话数据集检索 | 63.11 |
| 斯瓦希里语新闻分类 | 65.71 |
| Swedn段落到段落聚类 | 45.96 |
| 瑞士判决分类 | 61.77 |
| T2重排序 | 67.72 |
| TERRa | 64.52 |
| TRECCOVID | 77.57 |
| Tatoeba | 89.35 |
| TempReason L1 | 7.77 |
| 有毒对话分类 | 85.85 |
| 茨瓦纳语新闻分类 | 53.92 |
| 推文主题单标签分类 | 73.15 |
| TwitterHjerne 检索 | 94.54 |
| Twitter URL 语料库 | 88.07 |
| VoyageMMarco 重排序 | 71.89 |
| WebLINX 候选重排序 | 19.01 |
| 维基城市聚类 | 79.46 |
| WikiClusteringP2P.v2 | 28.51 |
| 维基百科多语言重排序 | 93.25 |
| 维基百科多语言检索 | 94.82 |
| WinoGrande | 69.57 |
| XNLI | 78.95 |
| indonli | 59.21 |
| 任务名称 | 性能 |
|---|---|
| AppsRetrieval | 98.60 |
| COIRCodeSearchNetRetrieval | 91.90 |
| CodeEditSearchRetrieval | 91.94 |
| CodeFeedbackMT | 92.30 |
| CodeFeedbackST | 88.59 |
| CodeSearchNetCCRetrieval | 96.25 |
| CodeSearchNetRetrieval | 92.96 |
| CodeTransOceanContest | 93.19 |
| CodeTransOceanDL | 33.72 |
| CosQA | 52.05 |
| StackOverflowQA | 97.89 |
| SyntheticText2SQL | 78.11 |
9 贡献与致谢
核心贡献者(∗:同等贡献) Madhuri Shanbhogue∗ Zhe Li∗ Shanfeng Zhang∗ Gustavo Hernández Ábrego∗ Shih-Cheng Huang∗ Aashi Jain∗ Daniel Salz Sonam Goenka Chaitra Hegde Ji Ma Feiyang Chen Jiaxing Wu Tanmaya Dabral Babak Samari Kevin Poulet Daniel Cer Kaifeng Chen Paul Suganathan Hui Hui Jovan Andonov Philippe Schlattner Jay Han Iftekhar Naim Wing Lowe Vladimir Pchelin Albert Yang Yi-Ting Chen Zhongli Ding Grace Zhang Georg Heigold Yichang Chen Antoine Reveillon Brendan Mccloskey Wenlei Zhou Dahun Kim Rui Meng Emma Wang Jack Zheng Halley Fede Zhen Yang Keegan Mosley Brian Potetz Sahil Dua Henrique Schechter Vera Shen Gao Hesen Zhang Andreas Hess Hengxuan Ying Alberto Montes Karan Gill Min Choi Sebastian Russo Anja Hauth Jinhyuk Lee Michael Boratko Megan Barnes Vikram Rao Claudiu Musat Cyril Allauzen Ehsan Variani Shankar Kumar Tom Bagby Junyi Jiao Yang Gu Tengxin Li Ayush Agrawal Roberto Santana Dev Nath Stephen Karukas Shuoxuan Han Lucia Loher Alice Twu Nidhi Vyas Siddharth Bhai Frank Palma Gomez Wangyuan Zhang Chaoren Liu Jizheng Yang Steve Qiu Shijie Zhang Sujay Kulkarni Sascha Rothe Sean Nakamoto
领导团队 Raphael Hoffmann Zach Gleicher Yunhsuan Sung Qin Yin Tom Duerig Mojtaba Seyedhosseini
致谢 James Gan, Jon Matthews, Luciano Martins, Patrick Löber, Anna Kelly, Kristen Quan, Roxanne Daniel, Ryan Trostle, Tania Bedrax-Weiss, Srinivasan (Cheenu) Venkatachary, Howard Zhou, Tomas Izo.
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org