Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像生成与编辑模型
Build with Nano Banana Pro, our Gemini 3 Pro Image model
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 的高保真图像生成与编辑模型,已在 Google AI Studio 和 Vertex AI 以付费预览形式推出。
原文给出模型的核心能力细节、可用分辨率与接入方式,开发者可据此判断是否适合替换现有图像生成工作流。
以下是如何让开发者使用 Nano Banana Pro(Gemini 3 Pro Image),这是一款功能强大的全新图像生成与编辑模型,具备高级功能和创意控制能力。
Alisa Fortin
Google DeepMind 产品经理
Naina Raisinghani
Google DeepMind 产品经理
今天,我们发布 Nano Banana Pro(Gemini 3 Pro Image),这是一款基于 Gemini 3 Pro 构建的高保真模型,让开发者能够获得影棚级质量的图像生成能力。此前,我们刚刚在几个月前发布了 Nano Banana(Gemini 2.5 Flash Image)。自那以来,我们很高兴看到社区将其关键功能投入使用——从角色一致性到照片修复,甚至利用其能力在无限画布中进行局部编辑。
这款最先进的图像生成与编辑模型正开始以付费预览形式推出,借助 Gemini API,在 Google AI Studio 和面向企业的 Vertex AI 中,构建新一代智能多模态应用。该模型可解锁高保真图像,在文本渲染方面具有更高准确性,并具备强大的世界知识,同时凭借其使用 Google 搜索进行接地以根据用户提示检索数据的能力而进一步增强。
Gemini 3 Pro Image 在文本到图像 AI 基准测试中表现出色。
我们还在整个开发者生态系统中扩大 Gemini 3 Pro Image 的覆盖范围。在 Google Antigravity——我们的新智能体开发平台——中,编码智能体现在可以直接利用这些图像生成能力,在实现代码之前生成详细的 UI 模型供用户审阅,甚至生成新的视觉资产。此外,领先的创意平台也在集成该模型,包括 Adobe 和 Figma。
高保真与控制
如果你正在构建需要精确性的高级工具,Gemini 3 Pro Image 可让你控制图像的物理效果(光照、相机、焦点、调色)和构图,以确保获得专业级输出。
一个剪影消失在金色散景与晨雾的海洋中。
提示:将体积光替换为散景
借助可用的 2K 和 4K 分辨率,你可以确保输出满足专业制作所需的清晰度标准。通过组合产品图像、徽标和参考图等多样元素,轻松创建协调一致的广告。实现最多五个人的一致相似度,整合六张高保真照片,或将多达十四个标准输入融合为一张精致的广告。试试我们的演示应用,它允许你将徽标与产品配对,创建自己的模型设计。
用参考图将产品设计变为现实的演示应用。序列已缩短。
改进的文本渲染与本地化
Gemini 3 Pro Image 相较 2.5 Flash Image 实现了重大飞跃,将抽象图像生成转变为功能性资产。它擅长处理逻辑和语言,并提供最先进的文本渲染,在图像中生成清晰、准确的文本。
创意美食摄影,其中每个词都用与该食物相关的真实食材艺术性地拼写出来。
提示:制作 8 个精致极简的徽标,每个都是一个有趣的食物单词,并用逼真的食物制作字母来表达这个词的含义。构图:将所有徽标渲染在一个纯白色背景上
它也是开发营销素材、教育内容和众多其他应用的理想解决方案。在我们的 Google AI Studio 漫画书生成器应用中体验该模型的能力,你可以创建以你和朋友为主角的原创多页漫画书,并配有先进的文本渲染和风格化效果。
演示应用,根据照片和所选类型以你选择的语言创建漫画书。序列已缩短。
借助 Gemini 3 Pro Image,我们消除了图像生成与本地化逻辑之间的障碍。这款先进的模型能够理解图像的语义上下文,利用图像到图像生成技术,在保持原始艺术风格或布局的同时,轻松更改菜单、标牌或文档等元素上的语言。
一个饮料广告活动概念,展示将英文文本准确翻译并渲染为法语。
提示词:翻译成法语
获取世界知识
Gemini 3 Pro Image 连接庞大的知识库,相比之前的图像生成模型能够生成更符合事实的素材。此外,启用后,通过 Google 搜索进行接地可将模型连接到实时网络内容,以生成数据驱动的输出。这对于需要精确呈现的应用尤为有价值,例如生物图表或历史地图。你可以通过我们的演示应用亲自尝试,在其中为你的受众动态创建任何主题的信息图表。
自行车保养与维护信息图表,由一款创建教育性信息图表的演示应用生成。
全力以赴,今天就开始构建
这次新模型发布融入了你已与我们分享的许多意见,但我们不会止步于此。为确保 AI 生成媒体的来源清晰可辨,我们已将 SynthID 数字水印直接集成到使用 Gemini 3 Pro Image 创建或编辑的每一张图像中,以标明其由 AI 生成或编辑的来源。
首先探索我们使用 Gemini 3 Pro Image 的应用合集,激发你的想象力,看看有哪些可能。一旦你获得灵感,可以重新混合这些演示应用,或通过 Google AI Studio 和 Vertex AI 中的 Gemini API 将该模型直接集成到你自己的项目中,以供企业使用。如需了解相关技术细节,请查看文档、提示指南、cookbook,或访问开发者论坛获取帮助并分享反馈。
使用 Gemini 2.5 Flash Image 可实现更快、成本更低的图像生成,或使用 3 Pro Image 实现更高质量的图像生成,但成本和延迟更高。
来源:Google DeepMind:Blog · deepmind.google