推荐理由:官方宣布 ChatGPT Voice 接入插件和新模型并支持语音驱动工作流,读者可据此了解语音能力扩展到哪些日常任务。
语音与音频
全部主题AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
最新精选
第 1–20 条 · 共 170 条
OpenAI@OpenAI精选AI 评分7272
Google DeepMind:Blog(RSS)精选AI 评分7474 Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零设计声音、30 秒样本复刻声音,并提供逐行表演指导、长时音频生成和双说话人场景编排,覆盖 100 多种语言。
推荐理由:官方介绍了两款 TTS 模型的能力细节、评测名次和开放入口,开发者可以据此评估语音生成工作流的选型。
Qwen@Alibaba_Qwen精选AI 评分6767
推荐理由:官方一次性给出五个音频模型的能力细节和三档降价幅度,读者可对照自身场景评估替换成本。
xAI:News(网页)精选AI 评分6464 xAI 发布 Grok Voice Transcribe 2.0 语音转写模型,准确率较 1.0 翻倍
xAI 发布 Grok Voice Transcribe 2.0 语音转写模型,官方称在真实场景评测中准确率是 1.0 的两倍且价格不变。在 Artificial Analysis 公开榜单上,它在 32 个 streaming 模型中准确率排名第一;多语言能力提升最大,短短语集合上词错误率从 20.6% 降至 6.8%。
推荐理由:原文给出公开榜单排名、内部错误率数字和与 1.0 同价的定价,读者可据此评估迁移成本与实际收益。
Qwen:Blog Retrieval(API)精选AI 评分6969 Qwen 发布 Qwen3.8-LiveTranslate 实时同传模型,LAAL 降至 2.3 秒
Qwen 发布 Qwen3.8-LiveTranslate,采用 Interleave 架构与 Hybrid-MoE Thinker–Talker 设计重构实时同声传译,平均滞后(LAAL)从上一代的 2.8 秒降至 2.3 秒。
推荐理由:官方给出了架构设计、LAAL 从 2.8 秒到 2.3 秒的数字和多语言评测结果,读者可以据此评估其实时翻译能力的实际变化。
Qwen:Blog Retrieval(API)精选AI 评分7878 Qwen 发布原生全模态模型 Qwen3.8-Omni-Flash,主打音视频智能体任务交付
Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 上下文窗口,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%。
推荐理由:官方发布同时开放 API 和开源插件与运行时,读者可以据此评估音视频智能体在剪辑、会议、实时交互等工作流中的落地方式。
蚂蚁 inclusionAI:GitHub 新仓库精选AI 评分6363 蚂蚁 inclusionAI 开源 Realtime-Venus 全双工交互系统
蚂蚁集团 Venus 团队与清华大学在 GitHub 开源 Realtime-Venus,一个支持全双工对话与异步任务委托的实时交互系统。系统包含三个组件:Realtime-Venus-Omni(9B,流式音视频对话与主动交互)、Realtime-Venus-Audio(9B,语音交互与音频理解)以及负责后台任务执行并将结果返回同一对话的 Harness 运行时。
推荐理由:蚂蚁和清华开源了全双工对话加异步委托任务的系统,含 9B 的 Omni 与 Audio 两个模型和 Harness 运行时,可直接下载推理或跑浏览器 demo。
Google DeepMind:Blog(RSS)精选AI 评分7070 Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个近实时语音对话模型,主打语音智能体和复杂任务执行。
推荐理由:原文给出两个语音对话模型的定位分工和多项基准数字,读者可以据此评估其推理、成本与工具调用能力。
公众号:阶跃星辰(Step)精选AI 评分6666 阶跃星辰发布 StepAudio 3 系列语音大模型,多款在 Artificial Analysis 榜单全球第一
阶跃星辰发布 StepAudio 3 系列,包含 Realtime、ASR、TTS、Gen 和 Music 五款模型,已在阶跃星辰开放平台上线。
推荐理由:官方完整介绍了五款模型的能力与榜单成绩,可帮助读者了解语音模型在实时交互、理解和创作上的进展。
Artificial Analysis@ArtificialAnlys精选AI 评分6666
推荐理由:原文给出语音到语音模型的完整分数、速度和成本对比,读者可据此在不同后端配置间做选型判断。
Suno:Blog(网页)精选AI 评分6868 Suno 发布 v6 音乐模型,推出 v6、v6-wild、v6-mini 三个版本
Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,后续将全面替换旧模型。v6 分为三个版本:旗舰 v6 和探索向的 v6-wild 面向 Pro 与 Premier 订阅用户,更快的 v6-mini 向所有人开放。
推荐理由:官方发布新一代音乐模型,给出三个版本的定位差异和编辑、混音、采样等具体新能力,可帮助创作者判断如何选择和使用。
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分7070 OpenAI 在 API 中推出全双工语音模型 GPT-Live-1
OpenAI 在 API 中发布语音模型 GPT-Live-1,可同时听和说,支持将推理和工具调用委派给 GPT-6 Astra 等后端模型,前端语音层定价为每分钟 $0.05。
推荐理由:原文给出单模型全双工语音架构、基准变化和定价,读者可以据此评估它能否简化现有语音 Agent 的分层方案。
Suno@suno精选AI 评分6666Suno 发布 v6 模型,可将图片、视频和语音备忘录转化为音乐,并对已创建的歌曲进行精确修改。同时提供 v6-wild 版本供探索更多可能性,官方附有 2 分钟以内的功能演示视频。

推荐理由:官方宣布 v6 上线并给出多模态输入与歌曲精修能力,可据此了解音乐生成模型的最新变化。
Microsoft AI:官方博客(网页)精选AI 评分6464 Microsoft AI 发布语音识别模型 MAI-Transcribe-2
Microsoft AI 发布转录模型 MAI-Transcribe-2,称其在 FLEURS 基准 60 种语言上平均词错率 5.2% 排名第一,并占据 Artificial Analysis 准确率-延迟 Pareto 前沿。
推荐理由:官方给出具体基准排名、对比速度倍数和定价,读者可以据此评估它对现有语音转写方案的可替换性。
Hugging Face:Blog(RSS)精选AI 评分6666 Open ASR 排行榜新增首个全球南方语言:印地语与印度英语评测集
Voice Arena 与 Hugging Face 合作,为 Open ASR 排行榜引入 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,覆盖印地语与印度英语,其中印地语是该排行榜多语言板块首个非欧洲语言。数据集含公开与私有分割,共 4,888 位说话人,并记录 12 项说话人属性,旨在暴露按地区、年龄、性别等维度分布不均的语音识别误差。
推荐理由:把评测单元从单一 WER 下探到带 12 项说话人属性的分组,能暴露模型在不同地域、口音、设备上的表现差异,让 ASR 选型不再只看平均错误率。
Google AI:DEV 作者专属(RSS)精选AI 评分7474 Gemini 3.5 Transcribe 完整指南:告别 ASR 转录难题
Google 推出专用于语音转文字的 Gemini 3.5 Transcribe 模型,主打快速、准确且低成本的转录,原生支持说话人分离和词级毫秒时间戳。该模型支持 85+ 种语言自动识别与代码切换,可通过 custom_vocabulary 传入最多 1,000 个领域术语避免专有名词拼写错误,并提供 Smart Transcription 与 Verbatim 两种模式。
推荐理由:逐字模式保留毫秒级时间戳和说话人分离,智能模式清理填充词但可能改写原文,两者取舍决定字幕同步和会议记录应选不同配置。
Google DeepMind:Blog(RSS)精选AI 评分6868 Gemini 3.5 Transcribe 发布:面向实时语音交互的高精度语音转文本模型
Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文本模型,支持流式与非流式两种 API。据 Artificial Analysis 评测,其流式与非流式平均词错率分别为 4.0% 和 2.6%,支持超 85 种语言、自定义词汇及最多三人说话人识别。
推荐理由:相较于上一代 Chirp 3,流式词错率降到 4.0% 且最终转录延迟改善 70%,会影响语音代理和实时字幕方案的成本与体验取舍。
Artificial Analysis 完整文章(网页)精选AI 评分6363 Artificial Analysis 发布 Speech Agent Arena 评测真实语音智能体表现
Artificial Analysis 推出 Speech Agent Arena,让人类参与者在 15 个工具调用场景和 20 个非工具场景中盲测对比 Speech to Speech 模型,以 Preference Elo 和 Task Success Rate 评分。
推荐理由:原文给出真实任务下语音智能体的偏好与任务成功率两套结果,提示对话好听不等于任务完成。
FireRedTeam:原创语音与多模态项目精选AI 评分6464 FireRedTeam 开源 FireRedAudio 9B 通用音频语言模型
FireRedTeam 发布 FireRedAudio 的代码与模型,一个基于 9B 参数 LLM 的通用音频语言模型,采用理解与生成解耦的连续表征设计。单模型支持 ASR、音频理解、零样本 TTS、指令 TTS、语义与声学语音编辑,以及最长一小时录音的时序定位理解,在 MMAU、Seed-TTS-Eval 等基准上取得竞争性或领先结果。
推荐理由:官方发布了代码和权重,读者可以据此了解用一个 9B 骨干同时覆盖语音理解与生成的解耦表征设计。
Hugging Face:Blog(RSS)精选AI 评分6969 测量语音识别中的基准优化:Hugging Face 新测试揭示 ASR 模型“刷分”现象
Hugging Face 最新研究引入三项测试量化语音识别中的基准优化(benchmaxxing)现象。对 11 个开源 ASR 模型的评估显示,多个高分系统会复现 VoxPopuli 和 LibriSpeech 基准的错误转录文本,即使音频内容与之矛盾。部分模型甚至依赖声学线索识别基准来源,导致其得分高估了真实转录能力。
推荐理由:研究把语音识别中的基准优化现象变成可量化检验,三项探针和开源脚本让模型评估者能区分真实转写提升与仅针对测试集的拟合。