跳到正文
北京时间
原文
Google DeepMind:Blog·· 2025-11-19精选AI 评分86

Google DeepMind 发布 Gemini 3 Pro, coding 与多模态能力升级

Start building with Gemini 3

AI 导读

Google DeepMind 发布 Gemini 3,称 Gemini 3 Pro 在各大基准上超过前代,编码方面超越 2.5 Pro。

推荐理由

官方发布说明给出基准分数、API 定价和新工具细节,读者可以据此评估 Gemini 3 Pro 在编码与多模态场景的实际变化。

正文 · AI 翻译

2025年11月18日

|

无论你是经验丰富的开发者还是氛围编程者,Gemini 3 都能帮你将任何想法变为现实。



Build anything with Gemini 3

今天我们推出 Gemini 3,这是我们最智能的模型,能够帮助将任何想法变为现实。Gemini 3 Pro 建立在最先进推理能力的基础之上,与之前的版本相比,在每一项主要 AI 基准测试中都取得了无与伦比的结果。它在编程方面也超越了 2.5 Pro,精通智能体工作流和复杂的零样本任务。

Benchmarks table with comparison numbers for Gemini 3 Pro, Gemini 2.5 Pro, Claude Sonnet 4.5 and GPT-5.1

Gemini 3 Pro 能够直接融入现有的生产级智能体和编程工作流,同时还支持此前无法实现的新用例。它现已开放预览,对于 200k token 及以下的提示词,通过 Google AI Studio 和面向企业的 Vertex AI 中的 Gemini API 使用,价格为每百万输入 token 2 美元、每百万输出 token 12 美元(速率限制和完整定价详情请参见定价)。此外,它还可以通过更广泛生态系统中你喜爱的开发者工具使用,并在 Google AI Studio 中免费提供(有速率限制)。

智能体编程

开发者正花费越来越多的时间在 AI 的协助下创建软件。在 Gemini 2.5 Pro 的势头和所有反馈的基础上,Gemini 3 Pro 为智能体编程模型所能实现的能力奠定了新的智能基础。

Gemini 3 Pro 在 Terminal-Bench 2.0 上得分 54.2%,该测试评估模型通过终端操作计算机的工具使用能力。

Terminal Bench evaluation charts for Gemini 3 and other AI models

除了 Gemini CLI、Android Studio 以及 Cursor、GitHub、JetBrains、Manus、Cline 等编程产品之外,你还可以在我们的新智能体开发平台 Google Antigravity 中感受这款模型的强大能力。

Google Antigravity

为了推进模型与 IDE 协同工作的方式,我们推出 Google Antigravity,以展示 Gemini 3 所能实现的能力。这是一个智能体开发平台,让开发者能够通过跨工作区管理智能体,在更高的、面向任务的层面上运作,同时核心仍保留熟悉的 AI IDE 体验。

这是一种更快的开发方式:你扮演架构师的角色,与在编辑器、终端和浏览器中自主运行的智能体协作。这些智能体会规划并执行复杂的软件任务,并通过详细的产物与用户沟通其工作。这提升了开发的方方面面,从构建功能、UI 迭代、修复 bug 到研究和生成报告。请访问 Google Antigravity 网站免费下载公开预览版,现已支持 MacOS、Windows 和 Linux。

Gemini API

借助 Gemini 3,我们发布了一款客户端 bash 工具,使模型能够在智能体工作流中提出 shell 命令,用于导航本地文件系统、驱动开发流程和自动化系统操作等任务。我们还为其配备了一款托管的服务端 bash 工具,用于多语言代码生成和安全原型设计。现已面向早期访问合作伙伴在 Gemini API 中提供,即将全面开放。

此外,Gemini 托管工具 Google 搜索接地和 URL 上下文现在可以与结构化输出结合使用。这对于构建涉及获取和提取数据、然后以特定格式输出以供下游智能体任务使用的智能体用例尤为强大。

Vibe coding

Gemini 3 Pro 释放了“vibe coding”的真正潜力,在这里自然语言就是你唯一需要的语法。通过显著提升复杂指令遵循和深度工具使用能力,该模型可以将一个高层级想法通过单条提示转化为完全可交互的应用。它承担了多步骤规划和编码细节的重任,带来更丰富的视觉效果和更深入的交互性,让你能够专注于创意构想。

Gemini 3 Pro 以令人印象深刻的 1487 Elo 分数登顶 WebDev Arena 排行榜。

Graphic showing 1487 WebDev Arena leaderboard score

Google AI Studio

无论是通过单条提示构建一个游戏、从非结构化语音笔记生成一个交互式落地页,还是从一张餐巾纸草图打造一个完整应用,开发者都能借助 Gemini 3 将想法变为现实。借助这一模型,我们将单条提示生成能力推向了前所未有的高度,这意味着你可以通过单条提示从想法直达 AI 驱动的应用,比如这个在 Google AI Studio 中构建的复古游戏。

我们打造 Google AI Studio,是为了让它成为你从提示到 AI 原生应用的最快路径。构建模式让你比以往更快地添加 AI 能力,自动接入合适的模型和 API,而注释等功能则支持快速直观的迭代。你今天就可以开始在 Google AI Studio 中使用 Gemini 3 进行构建。

多模态理解

Gemini 3 是世界上用于复杂多模态理解的最佳模型,在复杂图像推理的 MMMU-Pro 和视频理解的 Video MMMU 上创下新高。结合其智能和 100 万 token 的上下文窗口,开发者在构建关键多模态用例时可以看到显著提升。为了让你更好地控制延迟和成本,你现在可以在 Gemini API 中根据应用所需的视觉保真度,以更细粒度配置多模态视觉处理。

视觉推理

Gemini 3 Pro 在文档理解方面处于同类最佳水平,超越了简单的 OCR(光学字符识别),能够智能处理复杂的文档理解和推理。

你可以在我们的演示应用中看到该模型的视觉理解、推理和编码能力,它在 Google AI Studio 中让任何想法变为现实。

空间推理

该模型改进的空间理解能力也推动了指向、轨迹预测和任务进展等具身推理任务的强劲表现,为自动驾驶汽车、XR 设备和机器人领域解锁了新的用例。

其空间推理能力还支持对桌面、移动端和操作系统屏幕的智能屏幕理解,为计算机使用代理带来显著的性能提升。该模型还能根据鼠标移动和屏幕注释理解用户操作的意图,解锁像这个Visual Computer 演示应用这样的新颖体验。

视频推理

Gemini 3 Pro 通过高帧率理解捕捉快速动作,确保开发者不会错过快速移动场景中的关键时刻。除了速度之外,长上下文回忆能力还允许综合叙事,并在数小时的连续视频中精确定位具体细节。

今天就构建未来

Gemini 3 Pro 现已集成到许多开发者产品和工具中,可无缝融入你现有的工作流程,并解锁全新的编码方式。

  • 使用 Gemini API 构建:你可以立即通过 Google AI Studio 和面向企业的 Vertex AI 将 Gemini 3 Pro 集成到你的应用中。为支持该模型更深入的推理能力,我们在 API 中引入了新的 thinking level 和更细粒度的 media resolution 参数,并对 thought signatures 实施了更严格的验证。此次更新对于在多轮对话中保留模型的思考过程至关重要。请查看 Developer Guide 了解技术细节,并参阅我们的 Prompting Guide 学习如何使用 Gemini 3 Pro 进行构建。
  • 体验该模型的智能体能力:无论你是为 Android 应用添加 AI 原生功能、通过 Gemini CLI 自动化工作流,还是在 Google Antigravity 中管理一组自主智能体,Gemini 3 Pro 都能为复杂的智能体架构提供所需的可靠性。
  • 用 Gemini 3 Pro 进行 vibe code:Google AI Studio 是让你将任何想法变为现实的最快途径。从 Build mode 开始,只需一个提示词即可生成一个功能完整的应用。如果你需要一点灵感,点击“I'm feeling lucky”,让 Gemini 3 Pro 同时处理创意灵感和代码实现。

软件格局正在转变。随着 AI 改变谁在构建以及如何构建,我们致力于在你所在之处与你相遇——为你提供突破可能边界的工具。

这只是 Gemini 3 时代的开始,但我们迫不及待想看到你用 Gemini 3 Pro 构建出什么!

来源:Google DeepMind:Blog · deepmind.google