Google DeepMind 发布 Gemini 3,Gemini 3 Pro 开放预览
A new era of intelligence with Gemini 3
Google DeepMind 发布 Gemini 3 并以 Gemini 3 Pro 预览形式上线,称其在所有主要 AI 基准上显著超越 2.5 Pro,LMArena 达 1501 Elo,HLE 37.5%、GPQA Diamond 91.9%。
官方发布给出各基准分数与开放范围,读者可以据此比较 Gemini 3 Pro 与 2.5 Pro 的实际能力变化和可用入口。
2025年11月18日
|
Gemini 3 是我们最智能的模型,助你将任何想法变为现实。
你的浏览器不支持音频元素。
收听文章
[[duration]] 分钟
此内容由 Google AI 生成。生成式 AI 仍处于实验阶段
来自 Google 和 Alphabet 首席执行官 Sundar Pichai 的说明:
大约两年前,我们开启了 Gemini 时代,这是公司有史以来最重大的科学和产品探索之一。从那时起,看到人们如此喜爱它,真是令人难以置信。AI 概览现在每月拥有 20 亿用户。Gemini 应用每月用户超过 6.5 亿,我们超过 70% 的云客户使用我们的 AI,1300 万开发者使用我们的生成式模型进行构建,而这仅仅是我们所看到的影响的一小部分。
得益于我们差异化的全栈 AI 创新方法——从领先的基础设施到世界一流的研究、模型和工具,再到触达全球数十亿人的产品——我们能够比以往任何时候都更快地将先进能力带给世界。
每一代 Gemini 都建立在前一代的基础上,让你能够做更多事情。Gemini 1 在原生多模态和长上下文窗口方面的突破扩展了可处理信息的种类——以及处理量。Gemini 2 为智能体能力奠定了基础,并推动了推理与思考的前沿,帮助处理更复杂的任务和想法,使 Gemini 2.5 Pro 在 LMArena 上连续六个多月位居榜首。
现在,我们推出 Gemini 3,这是我们最智能的模型,它将 Gemini 的所有能力融为一体,让你能够将任何想法变为现实。
它在推理方面处于最先进水平,旨在把握深度与细微差别——无论是感知创意想法中的微妙线索,还是剖析复杂问题中相互重叠的层次。Gemini 3 也更擅长理解你请求背后的上下文和意图,因此你无需过多提示即可获得所需结果。想到仅仅两年间,AI 就从单纯阅读文本和图像进化到读懂氛围,真是令人惊叹。
从今天开始,我们以 Google 的规模交付 Gemini。这包括在搜索中的 AI 模式中引入 Gemini 3,带来更复杂的推理和全新的动态体验。这是我们首次在第一天就将 Gemini 交付到搜索中。Gemini 3 今天也登陆Gemini 应用,面向AI Studio和Vertex AI的开发者,以及我们全新的智能体开发平台Google Antigravity——更多内容见下文。
与前几代一样,Gemini 3 再次推进了最先进水平。在这个新篇章中,我们将继续推动智能、智能体和个人化的前沿,让 AI 真正对每个人都有帮助。
我们希望你喜欢 Gemini 3,我们会持续改进它,并期待看到你用它构建的作品。更多精彩即将到来!
推出 Gemini 3:我们最智能的模型,助你将任何想法变为现实
Google DeepMind 首席执行官 Demis Hassabis 与 Google DeepMind 首席技术官兼 Google 首席 AI 架构师 Koray Kavukcuoglu,代表 Gemini 团队
今天,我们在通往 AGI 的道路上又迈出了重要一步,发布 Gemini 3。
它是世界上用于多模态理解的最佳模型,也是我们迄今为止最强大的智能体和 vibe coding 模型,带来更丰富的可视化和更深入的交互性——这一切都建立在最先进的推理基础之上。
我们通过预览版发布 Gemini 3 Pro,并在今天将其开放给一系列 Google 产品,以此开启 Gemini 3 时代,让你可以在日常生活中用它来学习、构建和规划任何事情。我们还推出了 Gemini 3 Deep Think——我们增强的推理模式,将 Gemini 3 的性能进一步推向极致——并先向安全测试人员开放,随后再提供给 Google AI Ultra 订阅用户。
最先进的推理,具有前所未有的深度和细微差别
Gemini 3 Pro 凭借其最先进的推理和多模态能力,可以让任何想法变为现实。它在每一项主要 AI 基准测试中都显著优于 2.5 Pro。
它以突破性的 1501 Elo 分数登顶 LMArena Leaderboard。它展示了博士级推理能力,在 Humanity’s Last Exam(不使用任何工具时为 37.5%)和 GPQA Diamond(91.9%)上取得最高分。它还为前沿模型在数学领域树立了新标准,在 MathArena Apex 上达到 23.4% 的新最先进水平。
除文本之外,Gemini 3 Pro 还重新定义了多模态推理,在 MMMU-Pro 上达到 81%,在 Video-MMMU 上达到 87.6%。它还在 SimpleQA Verified 上取得 72.1% 的最先进分数,在事实准确性方面展现出巨大进步。这意味着 Gemini 3 Pro 非常擅长以高度可靠性解决科学和数学等广泛主题中的复杂问题。
Gemini 3 Pro 还为每一次交互带来了新的深度和细微差别。它的回答聪明、简洁且直接,以真正的洞见取代陈词滥调和奉承——告诉你需要听到的内容,而不只是你想听到的内容。它充当真正的思维伙伴,为你提供理解信息和表达自我的新方式,从通过生成代码来制作高保真可视化,以解释晦涩的科学概念,到创意头脑风暴。
Gemini 3 可以为托卡马克中的等离子体流动编写可视化代码,并写一首捕捉聚变物理的诗。
Gemini 3 Deep Think
Gemini 3 Deep Think 模式进一步拓展智能边界,在 Gemini 3 的推理和多模态理解能力上实现跨越式提升,帮助你解决更复杂的问题。
在测试中,Gemini 3 Deep Think 在 Humanity’s Last Exam(不使用工具时为 41.0%)和 GPQA Diamond(93.8%)上超越了 Gemini 3 Pro 本已令人印象深刻的表现。它还在 ARC-AGI-2(使用代码执行,ARC Prize Verified)上取得前所未有的 45.1%,展示了其解决新颖挑战的能力。
Gemini 3 Deep Think 模式在一些最具挑战性的 AI 基准测试中表现出色。请查看我们的评估方法详情。
Gemini 3 帮助你学习、构建和规划任何事情
学习任何事情
Gemini 从一开始就旨在无缝综合任何主题的信息,涵盖文本、图像、视频、音频和代码等多种模态。Gemini 3 推动多模态推理的前沿,通过结合其最先进的推理、视觉和空间理解、领先的多语言性能以及 100 万 token 上下文窗口,帮助你以适合自己的方式学习。
例如,如果你想学习如何按照家族传统烹饪,Gemini 3 可以解读并翻译不同语言的手写食谱,将其变成一本可分享的家族食谱。或者,如果你想了解一个新主题,你可以给它学术论文、长视频讲座或教程,它就能生成交互式闪卡、可视化内容或其他格式的代码,帮助你掌握这些材料。它甚至可以分析你的匹克球比赛视频,找出你可以改进的地方,并生成一份整体动作改进的训练计划。
为了帮助你更好地理解网络上的信息,搜索中的 AI 模式现在使用 Gemini 3 来支持新的生成式 UI 体验,例如沉浸式视觉布局以及交互式工具和模拟,所有这些都完全根据你的查询即时生成。
构建任何东西
在 2.5 Pro 成功的基础上,Gemini 3 兑现了为开发者将任何想法变为现实的承诺。它在零样本生成方面表现出色,并能处理复杂的提示和指令,以呈现更丰富、更具交互性的 Web UI。
Gemini 3 是我们有史以来构建的最好的氛围编程和智能体编程模型——让我们的产品更加自主,并提升开发者生产力。它以令人印象深刻的 1487 Elo 分数登顶 WebDev Arena 排行榜。它在 Terminal-Bench 2.0 上也获得了 54.2% 的分数,该基准测试衡量模型通过终端操作计算机的工具使用能力,并且在 SWE-bench Verified(76.2%)上大幅超越 2.5 Pro,该基准用于衡量编程智能体。
你现在可以在 Google AI Studio、Vertex AI、Gemini CLI 以及我们全新的智能体开发平台 Google Antigravity 中使用 Gemini 3 构建。它也可在 Cursor、GitHub、JetBrains、Manus、Replit 等第三方平台中使用。
推出全新的智能体优先开发体验
随着 Gemini 3 推动模型智能加速提升,我们有机会重新构想整个开发者体验。今天我们发布 Google Antigravity,这是我们全新的智能体开发平台,使开发者能够在更高的、面向任务的层面上运作。
利用 Gemini 3 的高级推理、工具使用和智能体编程能力,Google Antigravity 将 AI 辅助从开发者工具包中的一个工具转变为积极的合作伙伴。虽然 Google Antigravity 的核心是熟悉的 AI IDE 体验,但其智能体已被提升到专门的界面,并可直接访问编辑器、终端和浏览器。现在,智能体可以代表你自主规划并同时执行复杂的端到端软件任务,同时验证自己的代码。
除了 Gemini 3 Pro,Google Antigravity 还与我们的最新 Gemini 2.5 Computer Use 模型紧密耦合,用于浏览器控制,以及我们评分最高的图像编辑模型 Nano Banana(Gemini 2.5 Image)。
Google Antigravity 使用 Gemini 3 为航班跟踪应用驱动端到端智能体工作流。该智能体独立规划、编写应用程序代码,并通过基于浏览器的计算机使用来验证其执行。
规划任何东西
自从用 Gemini 2 开启智能体时代以来,我们取得了很大进展,不仅提升了 Gemini 的编码智能体能力,还改进了它在更长周期内可靠规划的能力。Gemini 3 通过在 Vending-Bench 2 排行榜上登顶证明了这一点,该基准通过管理一个模拟自动售货机业务来测试更长周期的规划能力。Gemini 3 Pro 在整整一个模拟年的运营中保持了一致的工具使用和决策能力,在不偏离任务的情况下带来了更高的回报。
Gemini 3 Pro 展现出更好的长周期规划能力,与其他前沿模型相比能产生显著更高的回报。
这意味着 Gemini 3 能更好地帮助你在日常生活中完成任务。通过将更深入的推理与更出色、更一致的工具使用相结合,Gemini 3 可以代表你采取行动,从头到尾完成更复杂、多步骤的工作流程——比如预订本地服务或整理你的收件箱——这一切都在你的控制和指导下进行。
Google AI Ultra 订阅者今天就可以在 Gemini 应用中通过 Gemini Agent 试用这些智能体能力。我们在改进 Gemini 智能体能力的过程中学到了很多,随着我们很快将其扩展到更多 Google 产品,我们很期待看到你如何使用它。
负责任地构建 Gemini 3
Gemini 3 是我们迄今为止最安全的模型,经历了 Google AI 模型有史以来最全面的安全评估。该模型表现出更少的谄媚倾向、更强的抗提示注入能力,以及针对网络攻击滥用的更好防护。
除了针对我们 Frontier Safety Framework 中关键领域的内部测试外,我们还与全球领先的领域专家合作进行评估,向英国 AISI 等机构提供了早期访问权限,并获得了 Apollo、Vaultis、Dreadnode 等行业专家的独立评估。更多信息,请参阅 Gemini 3 模型卡。
Gemini 的下一个时代
这只是 Gemini 3 时代的开始。从今天起,Gemini 3 开始陆续推出:
- 面向 Gemini 应用中的所有用户,以及搜索中 AI 模式下的 Google AI Pro 和 Ultra 订阅者
- 面向 开发者,可通过 AI Studio 中的 Gemini API、我们全新的智能体开发平台 Google Antigravity 以及 Gemini CLI 使用
- 面向 企业,可通过 Vertex AI 和 Gemini Enterprise 使用
对于 Gemini 3 Deep Think 模式,我们正在花更多时间进行安全评估并听取安全测试人员的意见,之后才会在未来几周内向 Google AI Ultra 订阅者开放。
我们计划很快发布 Gemini 3 系列的更多模型,让你能用 AI 做更多事情。我们期待收到你的反馈,也期待看到你用 Gemini 学习、构建和规划出什么。
合集
隆重推出 Gemini 3
Gemini 3 是我们最智能的模型,它将 Gemini 的所有能力融为一体,让你能把任何想法变为现实。
查看更多
来源:Google DeepMind:Blog · deepmind.google