Google DeepMind 发布多模态嵌入模型 EmbeddingGemma 2
Bring multimodal semantic search to the edge with EmbeddingGemma 2
Google DeepMind 于 10 月 6 日发布开放权重的多模态嵌入模型 EmbeddingGemma 2,将文本、图像、视频帧和音频映射到统一向量空间,参数量 740M。
原文给出内存占用、延迟和多种开发入口的具体数据,读者可以据此评估在本地多模态检索场景的落地方式。
2026年10月6日
今天,Google DeepMind 推出了 EmbeddingGemma 2,这是一款在其规模下同类最佳、开放权重、多模态的嵌入模型,能够原生地将文本、图像、视频帧和音频映射到单一的统一向量空间中。对于构建本地搜索和媒体检索体验的开发者而言,它降低了将独立的图像描述、语音转文本和文本嵌入模型串联起来所带来的延迟和内存开销。EmbeddingGemma 2 专为本地、隐私优先的应用而设计,以紧凑的 7.4 亿参数规模覆盖文本、视觉和音频模态,提供模块化编码器,在 Google Pixel 11 Pro 上,仅文本权重运行时活跃内存可低至约 191MB,完整多模态模型约为 567MB。最值得注意的是,EmbeddingGemma 2 可以作为超低延迟的端侧决策引擎。无需任何训练数据或微调,它就能将用户输入直接与分类标签和描述进行匹配,在几毫秒内实现即时的零样本意图路由。如需了解模型架构和评估(包括多模态嵌入能力)的概述,请查看 Google DeepMind 博客。
在本文中,我们将分享如何通过 Google AI Edge 的交互式展示、移动端的 Google AI Edge Gallery 以及 Mac 上的 Google AI Edge Foresight 立即体验 EmbeddingGemma 2 的强大功能,以及如何利用该模型构建你自己的私密、端侧语义搜索、视觉关键帧检索和条件触发工作流。在接下来的几周内,我们还将把该模型作为 Android 上的服务提供,可通过 ML Kit 访问,包括使用 NPU 加速,以进一步优化在广泛设备上的性能。
Google AI Edge Gallery 是一款跨平台展示应用,旨在让用户和开发者在实际场景中体验和评估端侧 AI 模型及其能力。今天,我们将在 Google AI Edge Gallery 应用中添加两个由 EmbeddingGemma 2 驱动的交互式展示:即时媒体搜索和视频时刻查找器。
即时媒体搜索允许用户使用自然语言或示例图像在本地媒体中查找特定的图像或视频。通过将输入查询和媒体都转换为端侧嵌入向量——后者存储在本地 SQLite 数据库中——系统通过返回余弦相似度最大的内容来检索相关内容。这实现了用户输入时的即时、交互式搜索体验。
抱歉,你的浏览器不支持此视频的播放
边输入边搜索和图像到图像的检索
- 端侧图像嵌入计算和快速多模态检索:无论你是从应用提供的示例图像集开始,还是在自己的媒体上测试即时搜索,你都可以体验 EmbeddingGemma 2 在手机上本地执行嵌入计算的速度有多快,无需互联网连接。
- 多模态检索与相似度匹配:由于查询 token 嵌入和余弦相似度排序通过 MediaPipe UniversalEmbedder 和 SemanticRetriever 在设备上快速执行,搜索结果会在每次按键时实时更新。当你输入“Katze”(德语中的“猫”)时,网格会立即显示你收藏中的所有猫科动物照片;继续输入“Katze schläft auf Tastatur”(德语中的“猫睡在键盘上”)会动态重新排序,并实时将你心中所想的那张特定照片置顶。除了支持多种语言的文本查询外,用户还可以从手机中选择任意图像,或使用实时摄像头画面来检索视觉和语义相关的照片。
视频瞬间查找器展示了 EmbeddingGemma 2 的跨模态表示如何应用的另一个示例,使用户能够在本地视频录像中定位特定的视觉瞬间,而无需转录音频或生成中间文本字幕。
抱歉,你的浏览器不支持播放此视频
在本地视频文件中搜索特定瞬间
- 设备端视频关键帧索引与自然语言搜索:用户选择本地视频(例如家庭视频或体育集锦)后,设备端引擎会为视觉和音频片段建立索引并生成嵌入。当用户输入描述性查询时,例如“孩子们在笑”、“狗接飞盘”或“人吹灭生日蜡烛”,引擎会计算提示嵌入向量,将其与视频帧嵌入进行比较,并立即高亮显示匹配瞬间发生的精确时间戳。
从 Google Play Store 或 Apple App Store 下载最新版本的 Google AI Edge Gallery 应用,试用这些新演示。查看 Github 仓库了解其实现方式,并开始使用 EmbeddingGemma 2 构建你自己的体验。
Mac 上 Google AI Edge Foresight 中的生产力提升与上下文检索
我们很高兴宣布推出适用于 Mac 的 Google AI Edge Foresight,这是一款实验性应用,将上下文感知的会议助手直接带到你的设备上。Foresight 由完全本地化的 AI 处理提供支持,可无缝协助你记录笔记、建立索引,并回忆对话记录和私人文件。通过直接与系统音频和麦克风集成,它开箱即用,适用于任何会议平台,甚至完全离线。
抱歉,你的浏览器不支持播放此视频
自动增强速记笔记
抱歉,你的浏览器不支持播放此视频
AI 实时检测并回答问题
由 EmbeddingGemma 2 和 Gemma 4 模型提供支持,Foresight 提供:
- 增强笔记记录:用从当前会议对话中实时检索到的详细信息丰富手动速记笔记。
- 跨模态检索:使用自然语言轻松查找不同类型的媒体(图像、文档、转录文本和笔记)。
- 设备端优势:你的敏感信息保持安全,同时无论网络连接如何都能保持不间断的生产力,并且没有云订阅费用。
通过将文本、音频和视觉数据映射到单一向量空间,Foresight 可在你的个人知识库中运行本地、安全的搜索。无论你是在会议中实时回答问题,还是撰写详尽的笔记,你所需的细节始终触手可及,而你的敏感数据永远不会离开你的设备。
立即下载 Google AI Edge Foresight Mac 应用,为你的所有会议带来智能的本地助手。
使用 ML Kit 为 Android 构建
对于面向 Android 生态系统的开发者来说,EmbeddingGemma 2 是一个轻量级、任务专用的模型,非常适合在设备端执行。我们将在未来几周内把这些统一搜索能力引入 ML Kit,为未来的生产级 Android 应用提供一条标准化、与平台集成的路径。通过与 ML Kit 集成,开发者可以开箱即用地获得 EmbeddingGemma 的生产级质量,而无需管理模型,也不必担心 APK 体积膨胀。ML Kit 将通过 NPU 加速(在可用时)和自动模型更新带来极快的性能。
使用 MediaPipe Tasks 进行跨平台构建
集成类似上述 Google AI Edge Gallery 和 Foresight 中的本地搜索功能,通常需要开发者处理底层媒体预处理,以便将数据输入嵌入模型。为简化这一过程,MediaPipe Tasks 正在为现有的 Embedder 和 Semantic Retriever 添加对 EmbeddingGemma 2 的支持;这是我们当前 RAG SDK 的新接口。
无论你的目标是 iOS、macOS、Windows、Linux 还是 Web,MediaPipe Tasks 都提供统一的开发者体验,让你一次编写即可部署到所有平台。开发者无需手动管理预处理和数据转换,Embedder 和 Semantic Retriever Tasks 提供了一套交钥匙解决方案,将这些步骤完全抽象化。
- MediaPipe Universal Embedder Task:自动处理图像缩放、张量归一化和多模态分词。直接传入原始图像或文本字符串,即可获得 768 维(或截断的 128d–512d)归一化向量,无需任何样板代码。
- MediaPipe Semantic Retriever Task:一个针对边缘优化的嵌入式向量搜索引擎,可在设备端索引嵌入并运行快速的近似最近邻(ANN)搜索,在个位数毫秒内返回排序后的匹配结果。
EmbeddingGemma 2 还可以与 MediaPipe Decision Task 一起用作多模态、实时决策引擎。这使开发者能够轻松地对图像、文本或音频输入进行分类,无需微调,并在设备端即时做出决策,从而实现路由或动作预测等用例。下面的示例展示了 MediaPipe Decision 任务在棋局中每回合评估 500 个选项时,响应时间不到 100ms,展示了 EmbeddingGemma 2 作为完全在设备端运行的决策引擎的效率。
抱歉,你的浏览器不支持此视频的播放
EmbeddingGemma 2 在设备端为低延迟 MediaPipe Decision 任务提供支持
使用 EmbeddingGemma 2 和 LiteRT 构建跨平台应用
虽然 MediaPipe Tasks 提供了开箱即用的简洁性,但需要对处理和加速进行细粒度控制的跨平台应用可以直接构建在 LiteRT 这一久经考验的引擎之上,它为 ML Kit、MediaPipe Tasks、Google AI Edge Gallery 和 Foresight 提供动力。得益于跨 CPU、GPU 和 NPU 的统一加速,部署被极大简化,并具备出色的可移植性:单个 .litertlm 文件即可在所有受支持的边缘平台上开箱即用地在 CPU 和 GPU 上运行。
在 Android 上,ML Kit API(即将推出)利用 LiteRT 为该平台提供优化实现,让你同时获得性能与简洁性,而无需担心模型生命周期管理。
为了给 EmbeddingGemma 2 提供最佳推理速度,我们针对视觉编码等计算密集型工作负载实施了有针对性的优化。这解锁了高响应、实时的 AI 体验,例如 Google AI Edge Gallery 应用中的“边输入边搜索”,在 MacBook M5 Pro GPU 上视觉嵌入仅需 37.3 毫秒(每秒 26.9 张图像)。更多测量数据见表格。

表格:在一组具有代表性的设备上,EmbeddingGemma 2 视觉功能在 CPU、GPU 和 NPU 上的每张图像延迟。延迟列指定了视觉嵌入延迟,评估时每张图像的最大预算为 70 个视觉 token。
底层架构优化
在内存受限的边缘设备上实现 EmbeddingGemma 2 的高性能执行,得益于以下优化:
- 跨模态模块化:仅加载你需要的编码器(例如,用于照片和视频搜索的文本 + 视觉,或在添加语音备忘录时动态激活音频编码器),以最大化边缘效率并管理系统内存压力。
- 量化感知训练(QAT):将模型权重压缩至 INT4 和 INT8,使多模态向量搜索能够触达中端消费级硬件。
- 自适应输入与输出缩放:根据文本和图像输入大小,我们在运行时动态加载最优计算图,并在所有 CPU、GPU 和 NPU 后端上一致支持。这种设计可适应可变文本长度而不浪费算力,同时让开发者能够控制视觉 token 预算,以在延迟与精度之间取得理想平衡。在输出方面,内置的 Matryoshka 表示学习(MRL)切片允许即时进行维度截断,将本地存储和索引占用减少最多 8 倍。
LiteRT 在广泛的边缘设备和网页(WASM)上提供稳健的跨平台性能。有关受支持硬件平台的完整列表和最新性能基准,请参阅我们的 Hugging Face 模型卡。你可以在 Google Cloud 上使用 LiteRT 基准测试工具测试更多物理设备,或查看我们的零配置网页演示,即刻在浏览器中体验。
立即开始
EmbeddingGemma 2 和 Google AI Edge 提供了构建模块,可将快速、私密且离线的多模态检索直接带入你的应用。无论你是在试验即时图像搜索、视觉关键帧检索,还是环境条件触发,你所需的所有工具今天都已可用。
- 体验 EmbeddingGemma 2 演示:在 Google AI Edge Gallery App 上,通过 Android 和 iOS 在自己的设备上试用 Instant Media Search 和 Video Moments Finder,并通过 AI Edge Foresight 体验个人知识库检索的实际效果。
- 对 EmbeddingGemma 2 进行基准测试:在 Google Cloud 的 Developer Device Platform 中,跨 200 多台不同的真实物理设备,使用 EmbeddingGemma 2 进行基准测试并开发功能。从我们在 Github 上的交互式 Google Colab 和指南开始。
- 部署 EmbeddingGemma 2:直接从 Hugging Face LiteRT Community 下载可直接运行的预量化
.litertlm包。 - 开始构建:探索 MediaPipe Tasks 以进行开箱即用的集成,或按照 LiteRT-LM 开发者指南进行更多自定义实现。在 Google AI Edge Gallery app 中探索参考实现。
致谢
我们特别感谢我们的 重要贡献者 在本项目中所做的工作:
Abhishek Jatram, Aditya Srivastava, Akshat Sharma, Alexander Kanaukou, Alice Zheng, Ami Kubota, Ander Dobo, Andrew Zhang, Brad Lassey, Chandramouli Amarnath, Chanchal Raj, Charlie Xu, Chenchen Tang, Chirag Gupta, Chintan Parikh, Cormac Brick, David Chou,Debapriya Maji, Denis Daletski, Fengwu Yao, Florian Kübler, Geonsun Lee,, Gregory Karpiak, Himangshu Roy, Henrique Schechter Vera, Hriday Chhabria, Ian Ballantyne,Ivan Llanos Jae Yoo, Jenn Lee, Jianing Wei, Jing Jin, Jingjiang Li, Jingtao Zhou, Jingxiao Zheng, Juhyun Lee, Julius Kammerl, Karthik Thirumalai, Kat Black, Kristen Quan, Kristen Wright, Lu Wang, Lutz Justen, Malini PV, Marissa Ikonomidis, Matthew Chan, Matthew Soulanille, Matthias Grundmann, Mogan Shieh, Na Li, Naina Singla, Olivier Lacombe, Priya Patel, Qidong Zhao, Queenie Zhang, Renjie Wu, Rishika Sinha, Rishubh Khurana, Ronald Wotzlaw, Sachin Kotwani, Sandeep Patil, Sebastian Russo, Sebastian Schmidt, Shengyi Lin, Shuangfeng Li, Steven Toribio, Suril Shah, Sylvain Vignaud, Somdatta Banerjee, Tenghui Zhu, Vinod Mamillapalli, Vladimir Kirilyuk, Wai Hon Law, Weiyi Wang, Xiaoming Hu, Xinan Cheng, Xu Chen, Yi-Chun Kuo, Yishuang Pang, Yu-hui Chen.
上一页
下一页
来源:Google Developers Blog · developers.googleblog.com