跳到正文
北京时间
原文
Google DeepMind:Blog·· 2025-11-20精选AI 评分80

Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像生成与编辑模型

Build with Nano Banana Pro, our Gemini 3 Pro Image model

AI 导读

Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 的高保真图像生成与编辑模型,已在 Google AI Studio 和 Vertex AI 以付费预览形式推出。

推荐理由

原文给出模型的核心能力细节、可用分辨率与接入方式,开发者可据此判断是否适合替换现有图像生成工作流。

正文 · AI 翻译

以下是如何让开发者使用 Nano Banana Pro(Gemini 3 Pro Image),这是一款功能强大的全新图像生成与编辑模型,具备高级功能和创意控制能力。


Alisa Fortin

Google DeepMind 产品经理

Naina Raisinghani

Google DeepMind 产品经理


Image with multiple input-output images with the text Build with Nano Banana Pro in the center

今天,我们发布 Nano Banana Pro(Gemini 3 Pro Image),这是一款基于 Gemini 3 Pro 构建的高保真模型,让开发者能够获得影棚级质量的图像生成能力。此前,我们刚刚在几个月前发布了 Nano Banana(Gemini 2.5 Flash Image)。自那以来,我们很高兴看到社区将其关键功能投入使用——从角色一致性到照片修复,甚至利用其能力在无限画布中进行局部编辑。

这款最先进的图像生成与编辑模型正开始以付费预览形式推出,借助 Gemini API,在 Google AI Studio 和面向企业的 Vertex AI 中,构建新一代智能多模态应用。该模型可解锁高保真图像,在文本渲染方面具有更高准确性,并具备强大的世界知识,同时凭借其使用 Google 搜索进行接地以根据用户提示检索数据的能力而进一步增强。

Gemini 3 Pro Image 在文本到图像 AI 基准测试中表现出色。

Gemini 3 Pro Image Text to Image AI benchmark bar chart compared to other leading competitors

我们还在整个开发者生态系统中扩大 Gemini 3 Pro Image 的覆盖范围。在 Google Antigravity——我们的新智能体开发平台——中,编码智能体现在可以直接利用这些图像生成能力,在实现代码之前生成详细的 UI 模型供用户审阅,甚至生成新的视觉资产。此外,领先的创意平台也在集成该模型,包括 Adobe 和 Figma。

高保真与控制

如果你正在构建需要精确性的高级工具,Gemini 3 Pro Image 可让你控制图像的物理效果(光照、相机、焦点、调色)和构图,以确保获得专业级输出。

一个剪影消失在金色散景与晨雾的海洋中。

提示:将体积光替换为散景

Image showing a side by side of an input image of the silhouette of a man with scattered sun rays and an output image where the same image with more volumetric lighting using AI

借助可用的 2K 和 4K 分辨率,你可以确保输出满足专业制作所需的清晰度标准。通过组合产品图像、徽标和参考图等多样元素,轻松创建协调一致的广告。实现最多五个人的一致相似度,整合六张高保真照片,或将多达十四个标准输入融合为一张精致的广告。试试我们的演示应用,它允许你将徽标与产品配对,创建自己的模型设计。

用参考图将产品设计变为现实的演示应用。序列已缩短。

改进的文本渲染与本地化

Gemini 3 Pro Image 相较 2.5 Flash Image 实现了重大飞跃,将抽象图像生成转变为功能性资产。它擅长处理逻辑和语言,并提供最先进的文本渲染,在图像中生成清晰、准确的文本。

创意美食摄影,其中每个词都用与该食物相关的真实食材艺术性地拼写出来。

提示:制作 8 个精致极简的徽标,每个都是一个有趣的食物单词,并用逼真的食物制作字母来表达这个词的含义。构图:将所有徽标渲染在一个纯白色背景上

Image showing the words Mint, soup, taco, curry, sushi, pasta, apple and pizza rendered using food items with AI

它也是开发营销素材、教育内容和众多其他应用的理想解决方案。在我们的 Google AI Studio 漫画书生成器应用中体验该模型的能力,你可以创建以你和朋友为主角的原创多页漫画书,并配有先进的文本渲染和风格化效果。

演示应用,根据照片和所选类型以你选择的语言创建漫画书。序列已缩短。

借助 Gemini 3 Pro Image,我们消除了图像生成与本地化逻辑之间的障碍。这款先进的模型能够理解图像的语义上下文,利用图像到图像生成技术,在保持原始艺术风格或布局的同时,轻松更改菜单、标牌或文档等元素上的语言。

一个饮料广告活动概念,展示将英文文本准确翻译并渲染为法语。

提示词:翻译成法语

Side by side of an input image of a set of cans with text and output image with text on can translated in French using AI

获取世界知识

Gemini 3 Pro Image 连接庞大的知识库,相比之前的图像生成模型能够生成更符合事实的素材。此外,启用后,通过 Google 搜索进行接地可将模型连接到实时网络内容,以生成数据驱动的输出。这对于需要精确呈现的应用尤为有价值,例如生物图表或历史地图。你可以通过我们的演示应用亲自尝试,在其中为你的受众动态创建任何主题的信息图表。

自行车保养与维护信息图表,由一款创建教育性信息图表的演示应用生成。

An infographic for bike care and maintenance essentials built with a simple text prompt using AI

全力以赴,今天就开始构建

这次新模型发布融入了你已与我们分享的许多意见,但我们不会止步于此。为确保 AI 生成媒体的来源清晰可辨,我们已将 SynthID 数字水印直接集成到使用 Gemini 3 Pro Image 创建或编辑的每一张图像中,以标明其由 AI 生成或编辑的来源。

首先探索我们使用 Gemini 3 Pro Image 的应用合集,激发你的想象力,看看有哪些可能。一旦你获得灵感,可以重新混合这些演示应用,或通过 Google AI Studio 和 Vertex AI 中的 Gemini API 将该模型直接集成到你自己的项目中,以供企业使用。如需了解相关技术细节,请查看文档、提示指南、cookbook,或访问开发者论坛获取帮助并分享反馈。

使用 Gemini 2.5 Flash Image 可实现更快、成本更低的图像生成,或使用 3 Pro Image 实现更高质量的图像生成,但成本和延迟更高。

A table showing comparison between Gemini 2 Pro Image and Gemini 2.5 Flash Image models across speed, quality and cost

来源:Google DeepMind:Blog · deepmind.google