跳到正文
北京时间
原文
Google DeepMind:Blog(RSS)·· 27 天前精选AI 评分78

Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型

Introducing Gemini 3.8 Flash and 3.8 Flash Cyber

AI 导读

Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。

推荐理由

官方给出两版模型的定价、基准成绩和实际安全应用数据,读者可据此评估在新旧 Flash 模型间的迁移与选型。

正文 · AI 翻译

我们最新的 Gemini 模型为智能体工作流和网络安全带来下一代智能。


Tulsee Doshi 产品管理高级总监

Raluca Ada Popa

Gemini 安全负责人,Google DeepMind


Image 1: a hero image reading "Gemini 3.8 Flash and 3.8 Flash Cyber"

继三周前 3.7 Flash 的强劲势头,以及我们在短短六周内第三次发布 Flash 系列之后,今天我们推出 Gemini 3.8——我们迄今最强的推理与编程模型,速度与低成本均与 3.7 持平。Gemini 3.8 推出 2 个变体:

  • Gemini 3.8 Flash:我们最智能的主力模型,在软件工程、智能体任务以及专业领域中关键的多步推理方面,相较 3.7 Flash 均有显著提升。其定价与 3.7 Flash 相同的首发价格 1,即每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
  • Gemini 3.8 Flash Cyber:我们能力最强的网络安全模型,在漏洞检测和自动化修补方面具备前沿级性能,通过我们全新的 Fairwind Program 向可信防御者开放。

虽然针对不同的部署环境进行了定制,但今天发布的两款产品都由同一基础智能驱动,并进一步借助长时间运行的智能体循环加以加速,这些循环旨在递归地评估和优化底层模型。这一共享核心在编程和推理方面取得的显著提升,源于多项创新,包括在要求极高的网络安全领域进行严格训练。

Gemini 3.8 Flash:为长时程编程和自主智能体而打造

Gemini 3.8 Flash 相较 3.7 Flash 实现了大幅提升,性能往往接近成本更高的前沿模型。

Image 2: comparison chart showing Gemini 3.8 Flash and other models

在 DeepSWE v1.1(长时程软件工程)上,3.8 Flash 在端到端自主解决复杂工程问题方面超越了大多数更大的前沿模型,而成本仅为其一小部分。

Image 3: chart showing Gemini 3.8 Flash DeepSWE v1.1

此外,3.8 Flash 在专业知识领域展现出关键企业级自主性所需的可靠性**。**在需要高级分析和报告的定量与专业领域,3.8 Flash 在 Vals Finance Agent V2 和 Harvey's Legal Agent Benchmark 等基准测试中超越了 3.7 Flash 及其他前沿模型。3.8 Flash 还在 HLE-Verified 上取得了 54.9% 的成绩,展现出其处理 STEM、人文学科和专业领域多步推理的能力。

Image 4: chart showing Gemini 3.8 Flash Vals Finance Agent v2

Image 5: a chart showing Gemini 3.8 Flash Harvey's Legal Agent Benchmark

Image 6: a chart showing Gemini 3.8 Flash HLE-Verified

这些性能提升源于一个核心设计选择:3.8 Flash 更加努力。在处理复杂任务时,它表现出更强的勤勉——执行额外的推理步骤,并迭代调用工具。有时,模型可能会使用更多 token 以最大化性能,尤其是在更高的 effort 级别下。

对于计算效率是首要约束的应用场景,开发者可以利用更低的 effort 级别来最小化 token 开销,或继续依赖 Gemini 3.7 Flash,该模型对于效率优先的工作负载仍提供全面支持。

Gemini 3.8 Flash 在 Google Antigravity 中使用一条简单的提示词,通过循环指令构建了这款游戏。游戏采用解谜、环境叙事以及由 Nano Banana 生成的纹理,打造出一个沉浸式 3D 关卡,你将在其中扮演一位探索城堡的巫师。

Gemini 3.8 Flash 在 Google Antigravity 中通过单条提示词构建了一个功能完整的 DOS 版 Google Maps,包含地点、路线导航和街景,完全可玩。

探索实时横截面、2D 投影和科学解说,尽在一幅由 Gemini 3.8 Flash 在 Google Antigravity 中使用美国地质调查局真实数据集构建的著名地理遗址地形图中。

Hardware Anatomy 是一个交互式 3D 可视化工具,在 Google AI Studio 中使用 Gemini 3.8 Flash 构建,能够为硬件设备生成物理比例精确的拆解 Three.js 逼真渲染图。它会自动将设备分解为多个图层,你可以通过拆解滑块将其爆炸展开并查看。

Gemini 3.8 Flash Cyber:专家级网络安全性能

Gemini 3.8 Flash Cyber 通过 Fairwind 计划向一组受信任的防御者开放,在当今复杂的网络安全格局中提供决定性优势,其 Flash 级的速度和成本支持快速迭代。

自主漏洞发现

在漏洞发现的标准行业基准 CyberGym 上,Gemini 3.8 Flash Cyber 在自主漏洞发现方面展现出前沿级性能。它超越了 3.5 Flash Cyber 以及规模显著更大的前沿模型。

Image 7: a chart showing Gemini 3.8 Flash Cyber CyberGym Pass@1

为了更好地反映现实世界的防御需求——这些需求并不像 CyberGym 那样仅限于 C/C++ 代码库——我们还针对一个全面的内部基准对 Gemini 3.8 Flash Cyber 进行了评估,在该基准中,模型必须在横跨 20 种编程语言的复杂代码库中发现各类漏洞。在此,该模型相较我们此前的模型展现出令人瞩目的飞跃,成功率超过 70%。

Image 8: Chart showing Gemini 3.8 Flash Cyber real world vulnerability discovery

自动修补

借助 Gemini 3.8 Flash Cyber,我们特别专注于为防御者配备专家级能力,使其相较攻击者占据优势。正因如此,我们从一开始就投入漏洞修复,并将其置于利用等攻击性能力之上。

CWE-Bench 由 Collinear 运营,是一项颇具挑战性的外部基准,用于评估补丁修复能力。在该基准上,Gemini 3.8 Flash Cyber 处于帕累托前沿:pass@1 为 47.2%,而领先的前沿模型为 47.8%,但前者的成本显著更低。

Image 9: Chart showing Gemini 3.8 Flash Cyber StaticBench Pass@1 vs Cost Per Rollout

现实世界的影响:保护 Google 的代码

我们已经在使用 Gemini 3.8 Flash Cyber 来保护 Google 各处的代码。例如:

  • Chrome 安全团队发现,与规模大得多的最佳商用模型相比,3.8 Flash Cyber 为 Chrome 中的漏洞生成的正确补丁数量是其 2.6 倍。
  • Wiz 发现,与其他领先的前沿模型相比,Gemini 3.8 Flash Cyber 在其内部渗透测试基准上的召回率高出 +7.5-9.7%,而成本低 2.3-5.2 倍。
  • Google 云漏洞研究团队利用 3.8 Flash Cyber 模型在不到 2 小时内发现了一个关键的基础性漏洞,而该漏洞的研究与发现通常需要数月时间。

我们的 Fairwind 计划合作伙伴怎么说

Image 10: quote from David Slater, Founder and Chief Architect, Armadin

Image 11: quote from Charlie Sestito, Director, Office of the CTO, Palo Alto Networks

Image 12: quote from Mayank Upadhyay, CSTO, Snowflake

Image 13: quote from Gal Nagli, Head of Threat Exposure, Wiz

以安全为设计理念

3.8 Flash 在发布时即配备了针对化学、生物、放射性及核(CBRN)领域和网络攻击领域滥用的防护措施,同时依据我们的 前沿安全框架,支持有益的用例。3.8 Flash Cyber 在网络安全方面配备了一套更为宽松的缓解措施,因此仅面向需要更全面网络能力的可信防御者开放。

根据 Gray Swan 的评测,Gemini 3.8 系列模型在提示词注入鲁棒性方面也实现了显著飞跃,保护 Gemini 模型用户免受与提示词注入相关的恶意攻击。

Image 14: a chart showing Gemini 3.8 Flash Cyber Gray Swan IPI Benchmark

Gemini 3.8 Flash 与 Cyber:即刻开始使用

1

优惠价格将于 2026 年 12 月 31 日到期。自 2027 年 1 月 1 日起,将适用 $1.50/1M 输入 token 和 $7.50/1M 输出 token 的价格。

来源:Google DeepMind:Blog(RSS) · deepmind.google

相关事件