跳到正文
北京时间
原文
Google DeepMind:Blog·· 2025-12-13精选AI 评分68

Google DeepMind 发布更新版 Gemini 2.5 Flash Native Audio 语音模型

Improved Gemini audio models for powerful voice experiences

AI 导读

Google DeepMind 发布更新的 Gemini 2.5 Flash Native Audio 模型,用于实时语音智能体,在 ComplexFuncBench Audio 上取得 71.5%,开发者指令遵循率从 84% 提升到 90%,已在 Google AI Studio、Vertex AI 上线,并开始在 Gemini Live 和 Search Live 推出。

推荐理由

原文给出具体评测分数和功能细节,读者可以据此评估新模型在语音智能体和翻译场景的可用性。

正文 · AI 翻译

Bibo Xu

产品管理总监

Tara Sainath

杰出研究科学家


Gemini Audio text logo

收听文章

[[duration]] 分钟

此内容由 Google AI 生成。生成式 AI 仍处于实验阶段

本周早些时候,我们通过升级 Gemini 2.5 Pro 和 Flash 文本转语音模型,引入了对音频生成的更强控制。

但生成富有表现力的语音只是对话的一方面。今天,我们为实时语音代理发布了更新版 Gemini 2.5 Flash Native Audio。此次更新提升了模型处理复杂工作流、遵循用户指令以及进行自然对话的能力。

Gemini 2.5 Flash Native Audio 现已在 Google 产品中提供,包括 Google AI Studio、Vertex AI,并且已开始在 Gemini Live 和 Search Live 中推出,首次将原生音频的自然感带入 Search Live。这意味着你可以更高效地与 Gemini 实时头脑风暴、在 Search Live 中获得实时帮助,或构建下一代企业级客户服务代理。

除了为实用代理提供支持外,原生音频还为全球沟通解锁了新的可能性。我们推出了实时语音翻译,这项能力可为耳机提供流式语音到语音翻译。它保留了说话者的语调、节奏和音高。从今天起,这一测试版体验正在 Google 翻译应用中推出。

实时语音代理

为了支持跨界面和产品的广泛用例,我们在三个关键领域改进了 Gemini 2.5 Native Audio:

  • 更精准的函数调用:我们提升了模型在触发外部函数时的可靠性。它现在能够更准确地识别对话中何时应获取实时信息,并将这些数据无缝融入音频回复中,而不会打断对话流程。在 ComplexFuncBench Audio 这一评估多步骤函数调用及各种约束的基准上,Gemini 2.5 Native Audio 以 71.5% 的得分领先。
  • 更稳健的指令遵循:模型现在更擅长处理复杂指令,从而在内容完整性方面带来更高的用户满意度。其对开发者指令的遵循率达到 90%(此前为 84%),可提供更可靠的输出。
  • 更流畅的对话:我们在多轮对话质量方面取得了显著提升。Gemini 2.5 Flash Native Audio 能够更有效地检索先前轮次中的上下文,从而创造更连贯的对话。

更新版 Gemini 2.5 Flash Native Audio 在 ComplexFuncBench 上相较此前版本和行业竞品的表现

updated Gemini 2.5 Flash Native Audio’s performance against previous versions and industry competitors

客户评价

Google Cloud 客户已经在使用 Gemini 的原生音频能力来推动实际业务成果,从抵押贷款处理到客户来电。

  • “用户在使用 Sidekick 一分钟内常常会忘记自己正在与 AI 交谈,有时还会在长时间聊天后感谢这个机器人……通过 Gemini [2.5 Flash Native Audio] 提供的新 Live API AI 能力,让我们的商家能够赢得成功。” – David Wurtz,Shopify 产品副总裁
  • “通过集成 Gemini 2.5 Flash Native Audio 模型……自 2025 年 5 月推出以来,我们显著增强了 Mia 的能力。这一强大的组合使我们能够为经纪合作伙伴生成超过 14,000 笔贷款。” – Jason Bressler,United Wholesale Mortgage (UWM) 首席技术官
  • “通过 Vertex AI 使用 Gemini 2.5 Flash Native Audio 模型,使 Newo.ai AI Receptionists 能够实现无与伦比的对话智能……。即使在嘈杂的环境中,它们也能识别主要说话者,在对话中途切换语言,并且听起来非常自然且富有情感表现力。” – David Yang,Newo.ai 联合创始人

实时语音翻译

Gemini 现在原生支持新的实时语音到语音翻译能力,旨在处理连续聆听和双向对话。

在连续聆听模式下,Gemini 会自动将多种语言的语音翻译成单一目标语言。这让你可以戴上耳机,用你的语言听到周围的世界。

对于双向对话,Gemini 的实时语音翻译可实时处理两种语言之间的翻译,并根据说话者自动切换输出语言。例如,如果你说英语,并想与一位说印地语的人聊天,你会在耳机中实时听到英语翻译,而当你说完后,你的手机则会播放印地语。

Gemini 的实时语音翻译具有许多在现实世界中非常有用的关键能力:

  • 语言覆盖:通过将 Gemini 模型的世界知识和多语言能力与其原生音频能力相结合,可翻译超过 70 种语言和 2000 种语言对的语音
  • 风格迁移:捕捉人类语音的细微差别,保留说话者的语调、节奏和音高,使翻译听起来自然。
  • 多语言输入:在单次会话中同时理解多种语言,帮助你跟上多语言对话,而无需摆弄语言设置。
  • 自动检测:识别所说语言并开始翻译,因此你甚至不需要知道正在说的是什么语言就可以开始翻译。
  • 噪声鲁棒性:过滤环境噪声,因此即使在嘈杂的户外环境中,你也可以舒适地交谈。

从今天开始,你可以在 Google Translate 应用中的全新 beta 体验里试用它,通过将耳机连接到设备并点击“实时翻译”,即可在耳机中体验实时翻译。该体验正在向美国、墨西哥和印度的所有 Android 设备推出,iOS 和更多地区的支持即将到来。

根据反馈,我们将继续迭代这一体验,并在 2026 年将其带到更多 Google 产品中,包括 Gemini API。

立即开始

立即使用 Gemini 2.5 Flash Native Audio 开始构建语音代理,它现已在 Vertex AI 上正式可用,并在 Gemini API 中提供预览版。你可以在 Google AI Studio 中试用。

Gemini 2.5 Flash 和 2.5 Pro 文本转语音模型也可通过 Google AI Studio 中的 Gemini API 使用。请从语音生成文档开始,探索提示指南,或查看 Gemini API Cookbook 以开始使用。

来源:Google DeepMind:Blog · deepmind.google