Google DeepMind 发布 Gemma 4 12B:统一的无编码器多模态模型
Introducing Gemma 4 12B: a unified, encoder-free multimodal model
Gemma 4 12B 是 Google DeepMind 最新推出的中等规模多模态模型,采用无编码器统一架构,原生支持音频输入。其基准测试性能接近 26B MoE 模型,但内存占用不到一半,仅需 16GB 显存或统一内存即可在消费级笔记本上本地运行。模型内置多 token 预测(MTP)drafter 以降低延迟,基于 Apache 2.0 开源许可发布,已累计超过 1.5 亿次下载。
统一无编码器架构让 12B 模型在消费级笔记本上跑出接近 26B 的多模态 Agent 体验,开源 + Apache 2.0,本地部署门槛又压低了。
Gemma 4 12B 旨在将高性能多模态智能直接带到你的笔记本电脑上,兼具移动端优先的效率与先进推理能力。

今天,我们推出 Gemma 4 12B,这是我们的最新模型,旨在将智能体多模态智能直接带到笔记本电脑上。Gemma 4 12B 弥合了我们面向边缘设备的 E4B 与更先进的 26B 混合专家模型(MoE)之间的差距,以更小的内存占用打包了强大的能力。它也是我们首个支持原生音频输入的中等规模模型。
感谢开发者社区,Gemma 4 系列模型的下载量已突破 1.5 亿次。你们构建了从用于物理辅助的可穿戴机械臂到企业级 AI 安全的各种应用。我们期待看到你用这款最新模型构建出的成果。
以下是 Gemma 4 12B 独特之处的概览:
- 新颖的统一架构:没有多模态编码器。视觉和音频输入直接流入 LLM 主干网络。
- 先进推理:基准测试性能接近我们的 26B 模型,解锁强大的多步推理和智能体工作流。
- 笔记本就绪:足够小巧,仅需 16GB 的 VRAM 或统一内存即可本地运行。
- 开放且易获取:以 Apache 2.0 许可证发布,并获得整个开发者生态系统的支持。
- 可即用作草稿模型:Gemma 4 12B 配备了多 token 预测(MTP)草稿模型,以降低延迟。
这些特性结合在一起,让先进的多模态能力得以在 everyday 硬件上运行,同时不牺牲速度或推理能力。下面我们来仔细看看 Gemma 4 12B 是如何实现这一点的。
在本地运行最先进的智能体
Gemma 4 12B 在标准基准测试中的性能接近我们更大的 26B MoE 模型,但总内存占用不到后者的一半。它足够小巧,可以在配备 16GB 内存的消费级笔记本电脑上本地运行,直接在你的设备上解锁强大的多模态和智能体体验。

体验独特而高效的统一架构
Gemma 4 12B 的突出之处在于其处理视觉和音频输入的精简方式。传统多模态模型通常依赖单独的编码器来转换图像和音频,然后再将这些表示传递给语言模型。由于这些分离的编码器会增加延迟并提高内存使用量,我们以无编码器架构训练了 Gemma 4 12B,使其能够直接整合音频和视觉输入。
以下是 Gemma 4 12B 原生处理多模态输入的方式:
- 视觉:我们用由单次矩阵乘法、位置嵌入和归一化组成的轻量嵌入模块替换了 Gemma 4 的视觉编码器。这使得 LLM 主干能够接管视觉处理。
- 音频:我们进一步简化了音频处理。我们完全移除了音频编码器,将原始音频信号直接投影到与文本 token 相同的维度空间。
想要详细了解的开发者,请前往我们配套的 Gemma 4 12B 开发者指南。
立即上手
- 亲自试用:在 LM Studio、Ollama、Google AI Edge Gallery App、Google AI Edge Eloquent 应用以及 LiteRT-LM CLI 中,只需几次点击即可进行实验
- 下载权重:直接从 Hugging Face 和 Kaggle 下载预训练和指令微调的检查点。
- 集成与学习:查阅 开发者文档 和 快速入门 notebook。
- 使用你喜欢的开发工具:通过 Hugging Face Transformers、llama.cpp、MLX、SGLang 和 vLLM 构建本地推理流水线,或使用 Unsloth 高效地进行微调。
- 借助 Gemma Skills 解锁智能体开发:为支持智能体使用最新的 Gemma 进展进行开发,我们正式发布 Skills 仓库。这是一个专为让智能体基于 Gemma 模型构建而设计的技能库。
- 按你的方式部署:使用 Google Cloud 在生产环境中快速启动端点。通过 Gemini Enterprise Agent Platform Model Garden、Cloud Run 和 GKE 按你的方式部署。
来源:Google DeepMind:Blog(RSS) · deepmind.google