Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型
Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。
官方给出两版模型的定价、基准成绩和实际安全应用数据,读者可据此评估在新旧 Flash 模型间的迁移与选型。
我们最新的 Gemini 模型为智能体工作流和网络安全带来下一代智能。
Raluca Ada Popa
Gemini 安全负责人,Google DeepMind

继三周前 3.7 Flash 的强劲势头,以及我们在短短六周内第三次发布 Flash 系列之后,今天我们推出 Gemini 3.8——我们迄今最强的推理与编程模型,速度与低成本均与 3.7 持平。Gemini 3.8 推出 2 个变体:
- Gemini 3.8 Flash:我们最智能的主力模型,在软件工程、智能体任务以及专业领域中关键的多步推理方面,相较 3.7 Flash 均有显著提升。其定价与 3.7 Flash 相同的首发价格 1,即每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
- Gemini 3.8 Flash Cyber:我们能力最强的网络安全模型,在漏洞检测和自动化修补方面具备前沿级性能,通过我们全新的 Fairwind Program 向可信防御者开放。
虽然针对不同的部署环境进行了定制,但今天发布的两款产品都由同一基础智能驱动,并进一步借助长时间运行的智能体循环加以加速,这些循环旨在递归地评估和优化底层模型。这一共享核心在编程和推理方面取得的显著提升,源于多项创新,包括在要求极高的网络安全领域进行严格训练。
Gemini 3.8 Flash:为长时程编程和自主智能体而打造
Gemini 3.8 Flash 相较 3.7 Flash 实现了大幅提升,性能往往接近成本更高的前沿模型。

在 DeepSWE v1.1(长时程软件工程)上,3.8 Flash 在端到端自主解决复杂工程问题方面超越了大多数更大的前沿模型,而成本仅为其一小部分。

此外,3.8 Flash 在专业知识领域展现出关键企业级自主性所需的可靠性**。**在需要高级分析和报告的定量与专业领域,3.8 Flash 在 Vals Finance Agent V2 和 Harvey's Legal Agent Benchmark 等基准测试中超越了 3.7 Flash 及其他前沿模型。3.8 Flash 还在 HLE-Verified 上取得了 54.9% 的成绩,展现出其处理 STEM、人文学科和专业领域多步推理的能力。



这些性能提升源于一个核心设计选择:3.8 Flash 更加努力。在处理复杂任务时,它表现出更强的勤勉——执行额外的推理步骤,并迭代调用工具。有时,模型可能会使用更多 token 以最大化性能,尤其是在更高的 effort 级别下。
对于计算效率是首要约束的应用场景,开发者可以利用更低的 effort 级别来最小化 token 开销,或继续依赖 Gemini 3.7 Flash,该模型对于效率优先的工作负载仍提供全面支持。
Gemini 3.8 Flash 在 Google Antigravity 中使用一条简单的提示词,通过循环指令构建了这款游戏。游戏采用解谜、环境叙事以及由 Nano Banana 生成的纹理,打造出一个沉浸式 3D 关卡,你将在其中扮演一位探索城堡的巫师。
Gemini 3.8 Flash 在 Google Antigravity 中通过单条提示词构建了一个功能完整的 DOS 版 Google Maps,包含地点、路线导航和街景,完全可玩。
探索实时横截面、2D 投影和科学解说,尽在一幅由 Gemini 3.8 Flash 在 Google Antigravity 中使用美国地质调查局真实数据集构建的著名地理遗址地形图中。
Hardware Anatomy 是一个交互式 3D 可视化工具,在 Google AI Studio 中使用 Gemini 3.8 Flash 构建,能够为硬件设备生成物理比例精确的拆解 Three.js 逼真渲染图。它会自动将设备分解为多个图层,你可以通过拆解滑块将其爆炸展开并查看。
Gemini 3.8 Flash Cyber:专家级网络安全性能
Gemini 3.8 Flash Cyber 通过 Fairwind 计划向一组受信任的防御者开放,在当今复杂的网络安全格局中提供决定性优势,其 Flash 级的速度和成本支持快速迭代。
自主漏洞发现
在漏洞发现的标准行业基准 CyberGym 上,Gemini 3.8 Flash Cyber 在自主漏洞发现方面展现出前沿级性能。它超越了 3.5 Flash Cyber 以及规模显著更大的前沿模型。

为了更好地反映现实世界的防御需求——这些需求并不像 CyberGym 那样仅限于 C/C++ 代码库——我们还针对一个全面的内部基准对 Gemini 3.8 Flash Cyber 进行了评估,在该基准中,模型必须在横跨 20 种编程语言的复杂代码库中发现各类漏洞。在此,该模型相较我们此前的模型展现出令人瞩目的飞跃,成功率超过 70%。

自动修补
借助 Gemini 3.8 Flash Cyber,我们特别专注于为防御者配备专家级能力,使其相较攻击者占据优势。正因如此,我们从一开始就投入漏洞修复,并将其置于利用等攻击性能力之上。
CWE-Bench 由 Collinear 运营,是一项颇具挑战性的外部基准,用于评估补丁修复能力。在该基准上,Gemini 3.8 Flash Cyber 处于帕累托前沿:pass@1 为 47.2%,而领先的前沿模型为 47.8%,但前者的成本显著更低。

现实世界的影响:保护 Google 的代码
我们已经在使用 Gemini 3.8 Flash Cyber 来保护 Google 各处的代码。例如:
- Chrome 安全团队发现,与规模大得多的最佳商用模型相比,3.8 Flash Cyber 为 Chrome 中的漏洞生成的正确补丁数量是其 2.6 倍。
- Wiz 发现,与其他领先的前沿模型相比,Gemini 3.8 Flash Cyber 在其内部渗透测试基准上的召回率高出 +7.5-9.7%,而成本低 2.3-5.2 倍。
- Google 云漏洞研究团队利用 3.8 Flash Cyber 模型在不到 2 小时内发现了一个关键的基础性漏洞,而该漏洞的研究与发现通常需要数月时间。
我们的 Fairwind 计划合作伙伴怎么说




以安全为设计理念
3.8 Flash 在发布时即配备了针对化学、生物、放射性及核(CBRN)领域和网络攻击领域滥用的防护措施,同时依据我们的 前沿安全框架,支持有益的用例。3.8 Flash Cyber 在网络安全方面配备了一套更为宽松的缓解措施,因此仅面向需要更全面网络能力的可信防御者开放。
根据 Gray Swan 的评测,Gemini 3.8 系列模型在提示词注入鲁棒性方面也实现了显著飞跃,保护 Gemini 模型用户免受与提示词注入相关的恶意攻击。

Gemini 3.8 Flash 与 Cyber:即刻开始使用
- 开发者:使用 3.8 Flash 进行构建,并在 Google Antigravity 中探索智能体优先的工作流,或即刻通过 Google AI Studio 和 Android Studio 在 Gemini API 中开始构建,也可以在 Stitch 中生成 UI。请参阅我们的 开发者文档开始使用。
- 企业用户:在 Gemini Enterprise 中访问 3.8 Flash。
- 消费者:3.8 Flash 已面向 Google AI Pro 和 Ultra 订阅用户开放,覆盖 Gemini 应用、Google 搜索中的 AI 模式以及 Google Sheets 中的 Gemini。
- 网络安全:通过我们全新的Fairwind 计划,我们为受信任的政府机构,以及关键基础设施运营方和软件维护者提供优先访问 Gemini 3.8 Flash Cyber 的权限。申请访问。
优惠价格将于 2026 年 12 月 31 日到期。自 2027 年 1 月 1 日起,将适用 $1.50/1M 输入 token 和 $7.50/1M 输出 token 的价格。
来源:Google DeepMind:Blog(RSS) · deepmind.google