Gemini 3.5 Transcribe 发布:面向实时语音交互的高精度语音转文本模型
Intelligent transcription with Gemini 3.5 Transcribe
Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文本模型,支持流式与非流式两种 API。据 Artificial Analysis 评测,其流式与非流式平均词错率分别为 4.0% 和 2.6%,支持超 85 种语言、自定义词汇及最多三人说话人识别。
相较于上一代 Chirp 3,流式词错率降到 4.0% 且最终转录延迟改善 70%,会影响语音代理和实时字幕方案的成本与体验取舍。
我们最新的语音转文本模型,专为精准、智能的实时转录而设计。

今天,我们推出 Gemini 3.5 Transcribe,这是我们迄今为止最精准的语音转文本模型,专为智能语音交互而设计。与那些难以应对背景噪声、复杂专业术语以及口语不流畅清理的传统语音识别模型不同,Gemini 3.5 Transcribe 能将原始音频直接转换为准确、精炼且格式规范的文本。
在 Gemini 应用和 Android 等我们的产品中,我们已经看到消费者通过这一转录模型受益,享受到诸如 Android 上的 Rambler 以及 macOS 上 Gemini 应用中的全新语音能力。如今,开发者可以在 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform 中借助 Gemini 3.5 Transcribe 构建类似的能力。
我们将 3.5 Transcribe 打造为能够无缝接入你的开发者工作流,无论你是在构建语音智能体、实时字幕工具,还是通话后分析流水线。该模型可通过两个独立的 API 使用:
- 实时流式传输:通过 Live API 使用
gemini-3.5-transcribe-live****。 为交互式语音应用提供亚秒级延迟的持续双向流式传输。 - 预录音频处理:通过 Interactions API 使用
gemini-3.5-transcribe****。转录录制的音频、会议、通话记录等,支持说话人归属和词级时间戳。
获得更精准、更智能的转录
Gemini 3.5 Transcribe 旨在捕捉你的自然说话风格,从而更好地理解你的意图并识别自定义词汇,让你能够用语音执行任务。
- 智能转录:无缝处理自我纠正(如 “我们周二见——不,周三”),去除填充词(“嗯”和“啊”),自动格式化你的文本。
- 函数调用:该模型可以通过函数调用将复杂任务(如图像生成和文件分析)委托给其他 Gemini 模型。目前已在 Gemini macOS 应用中提供。
- 更精准的转录:根据 Artificial Analysis 的测量,在流式用例中平均词错误率(WER)为 4.0%,在非流式用例中为 2.6%。它在嘈杂的真实环境中表现出色,能够准确捕捉邮政编码和订单 ID 等字母数字实体。
- 自定义词汇表: 通过将转写内容无缝适配到你提供的自定义词汇表,识别专业术语和独特拼写。
- 全球语言支持: 自动检测并转写超过 85 种语言,无缝处理地区口音和多样化方言。
- 多说话人识别: 在预先录制的音频中准确归属语音,并为最多三位说话人提供时间戳(对 3 位以上说话人的支持为实验性功能)。
Gemini 3.5 Transcribe 可处理实时语言切换和无缝流式转写
观看 Gemini 3.5 Transcribe 借助智能转写能力清理言语不流畅现象。
3.5 Transcribe 提供带多说话人归属和词级时间戳的转写。
Gemini 3.5 Transcribe 的性能相较我们此前的转写模型 Chirp 3 实现了重大进步,带来了新能力、更低的词错误率以及显著更优的延迟。根据 Artificial Analysis 的测量,例如最终转写时间缩短了 70%。在覆盖一组主要语言和地区的 FLEURS 基准上,该模型展现出精准的多语言性能,相较 Chirp 3 有所提升,在流式模式下实现了 5.50% 的 WER,在非流式用例中实现了 5.04% 的 WER。


体验智能转写和高级听写
除了 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 之外,3.5 Transcribe 超越了标准的语音转文字,让在 Google 各项服务中的使用体验更加自然直观。通过将上下文感知理解直接带入 Gboard、Antigravity、Gemini 应用和 Chrome 等日常界面,它能轻松捕捉细微差别、意图和行内编辑。
- 在 Android 版 Gboard 上,通过全新的 Rambler 功能,3.5 Transcribe 能将口述的想法转化为格式规范的文本,并过滤掉填充词。你还可以用语音进行编辑、纠正拼写错误以及更改写作风格。
- 在 Google Antigravity 上,3.5 Transcribe 在获得你许可的情况下,将屏幕上下文与聊天记录相结合,确保在文件名、智能体思路和活动文档方面实现精准的转录准确性。
- 在 Google AI Studio 中,你可以在 Build 模式下使用 3.5 Transcribe,通过语音即兴进行 vibe coding 构建应用。
- 在 macOS 版 Gemini 应用 中,3.5 Transcribe 不仅能将你自然的自由语音转录为整洁规范的文本,还支持语音指令,可与屏幕上下文无缝配合,驱动复杂的工作流程。通过在后台调用其他 Gemini 模型来处理繁重任务,该模型让你只需动口,就能轻松总结本地文件、跨应用复用文本,或直接在光标处生成图像。
- 即将登陆 Chrome,你将能够在任何网页输入框中说话输入——让你轻松地口述回复、起草帖子,或用语音更自然、更便捷地在 Chrome 中向 Gemini 下达提示词。
Gemini 3.5 Transcribe 让你在 macOS 上的 Gemini 应用中仅凭语音即可分析文件、生成图像和进行搜索。
看看 Gemini 3.5 Transcribe 如何在 Android 上使用 Rambler 自动去除填充词并清理语音。
Gemini 3.5 Transcribe 利用 Google Antigravity 上的屏幕上下文来确保转录的准确性。
阅读早期评测
通过利用 Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发者平台,使开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在后台管理复杂的实时媒体流基础设施,让开发者能够完全专注于打造用户体验。
Vivo、Intellitek Health 和 Lingopal 等公司也分享了对 3.5 Transcribe 的积极反馈,称赞其令人印象深刻的延迟、准确性和广泛的语言支持。






立即开始使用 3.5 Transcribe
- 面向开发者:已在 通过 Google AI Studio 提供的 Gemini API 和 Google Antigravity 中开放公开预览。
- 面向企业:已通过 Gemini Enterprise Agent Platform 开放公开预览,并即将登陆 Gemini Enterprise for Customer Experience。
- 面向所有人:已在 macOS 上的 Gemini 应用中提供英文版,Android 上的 Rambler 已在部分国家和地区及语言中推出,并即将登陆 Chrome。
来源:Google DeepMind:Blog(RSS) · deepmind.google