跳到正文
北京时间
原文
OpenAI:官网动态(RSS · 排除企业/客户案例)·· 2026-07-08精选AI 评分77

OpenAI 发布 GPT‑Live 新一代全双工语音模型

Introducing GPT-Live

AI 导读

OpenAI 今日推出 GPT‑Live,基于全双工架构实现同时听与说,支持自然打断与实时回馈。该模型每秒多次判断是否说话、倾听、打断或调用工具,并将搜索、推理等复杂任务委托给后台 GPT‑5.5,保持对话流畅。即日起向全球 ChatGPT 用户提供 GPT‑Live‑1 和 GPT‑Live‑1 mini 两个版本。人类评估显示,在 5‑10 分钟对话中,GPT‑Live‑1 系列在自然度、轮流、打断等方面显著优于 Advanced Voice Mode;在 GPQA、BrowseComp 和 τ³‑Voice Telecom 基准测试中也表现更强。未来将开放 API。

推荐理由

GPT‑Live 不是简单的语音版本升级,全双工架构让 AI 终于能同时听和说,加上后台调用 GPT‑5.5,对话体验跨了一大步,做语音应用的产品人该重新思考交互流程了。

正文 · AI 翻译

新一代语音模型,用于自然的人机交互,现为 ChatGPT Voice 提供支持。

我们推出 GPT‑Live,这是新一代语音模型,让与 AI 对话的感觉更像是在进行一场真实的交谈。

GPT‑Live 基于全双工架构构建,这意味着它可以同时倾听和说话。在对话过程中,GPT‑Live 可以用“嗯哼”或“是啊”这样的短语表示它在认真听,可以进行快速的来回交流,也可以在你需要片刻思考时保持安静。最终带来的语音体验,轻松自然到令人耳目一新。

GPT‑Live 也是我们迄今为止最智能的语音模型。对于需要网页搜索、更深层推理或更复杂工作的问题,它会在后台委派给我们最新的前沿模型,并在结果准备好后将其带回对话中。在它处理的同时,GPT‑Live 可以继续与你交谈,保持对话的流畅进行。发布时,GPT‑Live 将在后台使用 GPT‑5.5。随着我们发布新的前沿模型,我们会持续更新 GPT‑Live 所使用的模型。

这些进展为全新的 ChatGPT Voice 体验提供支持,使其更智能、使用起来更自然。随着时间推移,我们相信这项研究还将解锁将语音用于日益复杂、运行时间更长、更具智能体属性的工作的能力。

我们今日起开始面向全球 ChatGPT 用户逐步推出两个版本的 GPT‑Live——GPT‑Live‑1 和 GPT‑Live‑1 mini。我们还计划很快将它们引入 API,开发者和企业可通过此表单⁠登记以获取通知。

迈入人机交互的新时代

我们的愿景是实现真正自然的人机交互:一个与 AI 协作如同与另一个人共事般流畅、响应迅速的世界,同时推理和复杂任务执行在后台无缝进行。

以往的方法

老一代语音 AI 系统让我们离这一愿景更近了一步,但也伴随着重要的取舍。

级联式语音系统

级联式语音系统依赖一系列模型依次运行来处理每一轮对话。最初的 ChatGPT Voice 将三个模型串联在一起:一个语音转文本模型转录你的语音,一个大语言模型生成回复,一个文本转语音模型再将其转换回语音。这种方法让我们首次能够与前沿 AI 模型对话,但其复杂性也带来了代价:信息可能在模型之间丢失,回复缓慢且生硬。

轮次式语音模型

像 ChatGPT Advanced Voice Mode 这样的轮次式语音模型在单一模型内完成音频的处理与生成,从而降低了延迟、让对话更流畅——但它们仍然以离散的轮次运行。模型必须等用户停止说话后才能回应,导致一来一往显得僵硬。此外,由于轮次检测基于静音,哪怕只是短暂的停顿或背景噪声,也可能被误判为轮次结束——使模型在不自然的时机打断用户。

我们的新方法

GPT‑Live 通过两项架构改动解决了这些局限。

持续交互

首先,我们采用全双工架构构建了 GPT‑Live,以实现持续交互。GPT‑Live 不再处理一连串彼此独立的消息,而是在生成输出的同时持续处理输入。因此,模型每秒可以做出多次交互决策:是说话、继续倾听、暂停、打断,还是调用工具。

这使模型能够进行更自然的一来一往,更好地把握时间感,甚至还能进行实时翻译。

委派以完成更深层的工作

其次,我们将负责持续交互的 GPT‑Live 与更深层的工作解耦。当一个问题需要搜索、推理或更强的智能体能力时,GPT‑Live 可以把任务委派给另一个模型,比如 GPT‑5.5。这样一来,即使它在后台处理多项任务,也能让对话继续进行。

这一架构上的改变也让 GPT‑Live 能够持续使用最新的模型和智能体,将前沿智能与自然交互结合起来。

搜索 + 推理

评估

我们构建了新的真人评估来衡量愉悦感和对话流畅度。在这些一对一的对比中,在时长匹配的 5–10 分钟对话里,GPT‑Live‑1 和 GPT‑Live‑1 mini 相比 Advanced Voice Mode 获得了明显更高的偏好,评估维度包括整体偏好、轮流发言、打断、对话流畅度,以及每次交互给人的自然程度。

  • GPQA:GPT‑Live‑1 在 GPQA 上大幅优于 Advanced Voice Mode,该基准测试涵盖生物学、化学和物理学领域的专家级科学推理能力。
  • BrowseComp:GPT‑Live‑1 在 BrowseComp 上相比 Advanced Voice Mode 展现出显著提升,该基准测试考察智能体式网络搜索以及查找难以定位信息的能力。
  • τ³-Voice Telecom(内部变体)**:GPT‑Live‑1 在 τ³-Voice Telecom 上优于 Advanced Voice Mode,该测试考察语音智能体在真实、多轮电信客服任务中的表现。
媒体内容 · 前往原文查看

* GPT‑Live‑1(即时版)和 GPT‑Live‑1 mini 在后台使用 GPT‑5.5 Instant 模型,而 GPT‑Live‑1 Medium 和 GPT‑Live‑1 High 则使用 GPT‑5.5 Thinking 模型,分别对应中等和高等推理强度。

** 本次评测中,我们使用了一个定制化的用户模型,由我们最新的推理模型驱动。

全新的 ChatGPT Voice 体验

每周有超过 1.5 亿人通过 Voice 和 Dictation 等功能与 ChatGPT 对话。他们用它来获得免手操作的日常帮助、练习语言、讲睡前故事,或者只是在通勤途中闲聊。

从今天起,当你点击 Voice 按钮与 ChatGPT 对话时,你将获得由 GPT‑Live 驱动的改进体验——对话更自然、回答更智能、聆听更出色,还能给出可视化回应。

更自然的对话

现在与 ChatGPT 交谈的感觉应该更像一场真实的对话。你可以随时插话提问、停下来整理思路,或者让 ChatGPT 放慢速度。它会用“嗯嗯”或“明白了”之类的话自然地回应你所说的内容,让你知道它在认真跟随。我们还为 GPT‑Live 重新制作了 ChatGPT 中九种各具特色的声音。

更智能的回答

ChatGPT Voice 现在可以调用我们最新的前沿模型,在你需要时为你提供更智能的答案。你还可以选择适合自己需求的推理级别:Instant 用于快速响应,或者在你希望 ChatGPT 花更多时间思考时选择 Medium 和 High。

更好的倾听

如果你花点时间思考,ChatGPT Voice 现在会等待,而不是插话打断你。如果你让它保持安静并倾听,它就会照做。当有背景噪音时,比如过往车辆或附近的谈话声,ChatGPT 能更好地专注于你的声音,而不是被干扰。

一目了然的可视化答案

有些答案,看得见才更有用。在你说话时,ChatGPT 现在可以针对天气、股票、体育等话题展示丰富的可视化卡片。Voice 也继续支持搜索、记忆、图像和文件上传。

ChatGPT Voice displaying a weather forecast for Denver, Colorado. ChatGPT Voice displaying upcoming international football matches. ChatGPT Voice displaying a map with nearby soccer pubs.

最终带来的是一种更自然、更强大、在日常生活中更实用的 ChatGPT Voice 体验。

专为语音设计的安全机制

GPT‑Live 在设计上默认就是安全的。它建立在我们最新模型的安全进展之上,同时针对关键风险领域增加了专门的安全训练,并新增了专为语音设计的安全防护措施。

扩展的安全测试

为了更好地反映人们在真实场景中使用语音的方式,我们首先将安全测试扩展到包含新的音频原生评估。我们还创建了合成评估,使用生成的音频更集中地关注关键安全领域,并借鉴了我们从 Advanced Voice Mode 中获得的经验。这些领域包括自残、精神病与躁狂、对 AI 的情感依赖、暴力以及性内容。内部专家还对该模型进行了红队测试,以排查语音特有的风险。

在我们的测试中,GPT‑Live 在我们评估的几乎所有领域中的表现都与 Advanced Voice Mode 相当或更好。你可以在 GPT‑Live 系统卡⁠中了解更多关于我们的测试和保障措施的信息。

内置保障措施

由于语音对话是实时展开的,我们还构建了可以在模型说话时采取行动的保障措施。当系统检测到可能不安全的输出时,它可以引导模型转向更安全的回应、呈现额外的安全信息或资源,或在风险较高的情况下结束语音对话。对于涉及自残的对话,我们为语音调整了 ChatGPT 的支持流程,包括提供经专家审核的危机求助热线支持。

我们设计了额外的保护措施来支持青少年用户,并将适合年龄的行为直接训练进模型中,以降低不当回应的风险。家长可以通过 Parental Controls 选择其青少年子女是否可以使用 ChatGPT Voice,在涉及潜在自残或自杀意图迹象的较高风险情况下,已关联的家长可能会收到通知。

从真实世界使用中学习

我们还在推出更长期的衡量指标和发布后监测,重点关注情感依赖,以持续加深我们的理解并完善防护措施。基于我们此前对情感化使用与情绪健康的研究,这将帮助我们识别新出现的模式,并改进系统在情感敏感交互中的响应方式。

最后,GPT‑Live 是为对话而设计的,而非用于声音模仿。它在 ChatGPT 中使用一组预定义的语音,并配有防护措施,以防止其模仿真实人物的声音。

我们致力于支持安全与福祉,并将随着从真实世界使用中不断学习,持续加强这些防护措施。

可用性与局限性

GPT‑Live 现正向全球 ChatGPT 用户推出,覆盖 iOS、Android 以及 ChatGPT.com⁠。GPT‑Live‑1 将成为为 Go、Plus 和 Pro 用户提供 ChatGPT Voice 支持的默认模型,GPT‑Live‑1 mini 将成为 Free 用户的默认模型。更多可用性详情可在我们的帮助中心⁠查看。

我们已针对 ChatGPT 中一些最常用的语言对 GPT‑Live 进行了优化。对于某些语言,该模型可能带有非母语口音或流畅度有所欠缺。我们正在积极努力改善跨语言的使用体验。

发布时,GPT‑Live 在 ChatGPT 中不会支持语音配合视频或屏幕共享,但我们正在努力尽快推出这些功能。你仍然可以使用旧版 ChatGPT Voice,包括 Standard 和 Advanced Voice Mode,在这些版本中这些功能仍然可用。

来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com