Gemini 3.1 Flash Live:让音频 AI 更自然、更可靠
Gemini 3.1 Flash Live 已上线 Google 全系产品,提供更自然、可靠的实时音频 AI 交互能力。
推荐理由:Google发布Gemini 3.1 Flash Live,提升音频AI自然度与可靠性
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
Gemini 3.1 Flash Live 已上线 Google 全系产品,提供更自然、可靠的实时音频 AI 交互能力。
推荐理由:Google发布Gemini 3.1 Flash Live,提升音频AI自然度与可靠性
你现在可以用 Lyria 3 Pro 创作更长的曲目了。🎶 规划前奏、主歌、副歌和桥段,构建长达 3 分钟的高保真作品。🎹
推荐理由:Google Lyria 3 Pro 支持生成 3 分钟结构化音乐,已上线 Gemini App
Cohere 发布开源 ASR 模型 Cohere Transcribe,基于 Conformer 编码器-解码器架构,参数量 2B,支持英语、法语、中文、日语、阿拉伯语等 14 种语言,采用 Apache 2.0 许可证。
推荐理由:原文给出了模型规格、WER 数据和推理吞吐表现,读者可以据此评估它在语音识别工作流中的实际可用性。
ServiceNow AI团队在Hugging Face上发布了语音智能体评估框架EVA。该框架通过标准化测试集与多模态指标,系统评估语音助手在对话理解、任务完成及交互自然度等方面的性能,旨在量化衡量智能体在复杂真实场景下的表现,助力研究人员客观比较不同模型,推动技术优化。
推荐理由:提供语音代理评估标准,帮助开发者优化模型性能和测试效率。
Mistral AI 发布 4B 参数文本转语音模型 Voxtral TTS,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言。
推荐理由:官方公布了模型架构、延迟数据和与 ElevenLabs 的人类评测对比,可据此评估其在语音智能体场景的适用性。
推荐理由:微软AI医疗助手落地英国国家医疗体系,临床减负从概念走向实际应用
Together AI 发布 SF Streets 与 US Streets 两项基准,测试 15 个先进 ASR 模型在街名转写上的表现,发现平均错误率达 39%,非英语母语者准确率比英语母语者低 18 个百分点(46% vs 64%)。
推荐理由:原文用自建基准量化了 ASR 在街名转写上的短板,并给出可复用的合成数据改进方法,对语音部署有直接参考价值。
FireRedTeam 发布开源工业级一体化语音识别系统 FireRedASR2S,集成 FireRedASR2(支持中文普通话、20+ 方言口音、英文、中英混说及歌声转写)、FireRedVAD、FireRedLID 和 FireRedPunc 四个模块,均开源权重与推理代码。
推荐理由:官方开源的一体化语音识别系统,给出与 Doubao-ASR、Silero-VAD 等的对比数字和完整推理代码,便于直接部署验证。
FireRedTeam 于 2026-02-10 正式开源 FireRed-OpenStoryline,将视频创作变为自然语言对话,支持素材搜索下载、脚本生成、BGM 与配音字体推荐,以及全流程剪辑。
推荐理由:官方开源的对话式视频剪辑项目,覆盖素材检索、脚本生成到剪辑全流程,并可直接通过 Claude Code 等 Agent Skills 安装使用。
OpenMOSS 团队发布 MOVA 音视频基础模型,总参数 32B MoE、激活 18B,支持文本或图像到音视频的端到端同步生成,最高 720p、单段 8 秒。模型采用非对称双塔架构(14B Wan 2.2 I2V 视频塔与 1.3B 音频塔)加双向 Bridge 和 Aligned ROPE 对齐时间轴,并开放模型权重、训练与推理代码及微调方案。
推荐理由:原文给出架构、训练策略和开源范围,读者可以了解端到端音视频生成如何处理同步问题并可复现研究。
MiniMax 发布新一代语音模型 MiniMax Speech 2.8,通过原生声音标签技术模拟人类口语中的"嗯"、"啊"等填充词及呼吸停顿,显著提升对话自然度。该模型支持10秒样本高保真声音克隆,精准还原音色与语速,同时消除背景噪音与数字伪影,输出录音室级纯净音质。此外,模型优化了跨语言表现,从普通话-日语对开始解决口音渗透问题,实现更接近母语者的发音效果。
推荐理由:10秒样本克隆真人声线,AI说话带'嗯啊'呼吸声,MiniMax语音模型上新
xAI 开放 Grok Voice Agent API,基于自研语音栈(VAD、tokenizer、音频模型),Big Bench Audio 基准排名第一,首音频延迟低于 1 秒(比竞品快近 5 倍),定价 $0.05/分钟。支持数十种语言自动切换、实时搜索 X 和网页、调用自定义工具,已深度集成特斯拉车机。提供 Ara、Eve 等多种自然声线,支持 [whisper] 等听觉标签,兼容 OpenAI Realtime API 规范。
推荐理由:xAI发布Grok语音Agent API,延迟低于1秒且定价仅为OpenAI一半,已集成至Tesla车载系统
通义实验室发布 Fun-ASR 端到端语音识别模型系列并开源。Fun-ASR-Nano-2512 参数量 800M,基于数千万小时语音训练,支持中英日三语、7 种汉语方言和 26 种地方口音;Fun-ASR-MLT-Nano-2512 同为 800M,基于数十万小时训练,支持 31 种语言。
推荐理由:原文给出两个识别模型的训练规模、语言覆盖和开源基准对比,还附部署与推理路径,读者可据此评估在中文和方言场景的可用性。
Suno宣布与华纳音乐集团达成合作。Suno已拥有近1亿音乐创作者社区,此次合作旨在推出更强大的创作功能、提供与WMG旗下艺术家互动的机会,并基于授权音乐构建新一代Suno模型,其性能将超越v5。未来,部分同意授权的WMG艺术家声音与形象可用于新的AI生成音乐创作体验,为其开辟新收入渠道。同时,歌曲下载功能将调整为仅限付费用户使用,而Suno Studio作为专业工具将保持现有功能并持续更新。
推荐理由:Suno和华纳的牵手,意味着AI生成音乐终于拿到了正版内容的通行证,从此不用再躲躲藏藏,对音乐创作者和听众都是质变信号。
Hugging Face 的 Open ASR 排行榜新增多语言和长格式语音识别评估赛道。多语言赛道涵盖8种语言,长格式赛道则测试模型处理连续数分钟语音的能力。新榜单显示,领先模型在多语言任务上的词错误率平均比专用单语模型高约15%,在长格式任务上错误率可能上升超20%,凸显了模型在实际应用中的泛化能力仍面临严峻挑战。
推荐理由:ASR排行榜新增多语言和长形式评估,助力开发者优化语音应用。
MiniMax发布语音模型Speech 2.6,端到端延迟降至250毫秒内,支持实时对话。新增多语言特殊格式解析能力,可自动朗读URL、邮箱、电话、日期及金额,无需预处理。推出Fluent LoRA功能,即使源录音带口音也能保留音色并生成流畅语音,支持40余种语言。已被LiveKit、Vapi等平台及智能硬件采用。
推荐理由:MiniMax发布Speech 2.6语音模型,支持Voice Agent场景,实现超低延迟与Fluent LoRA语音克隆优化。
美团开源全模态模型LongCat-Flash-Omni,采用5600亿参数MoE架构(激活270亿),支持128K上下文与实时音视频交互。模型基于快捷连接MoE与零计算专家,配备轻量级编解码器及分块特征交错机制,通过课程式渐进训练提升效率。在OmniBench、WorldSense等基准测试中超越Qwen3-Omni与Gemini-2.5-Pro,在文档理解、语音识别及GUI控制等任务中达到领先水平。
推荐理由:美团开源 560B 参数多模态模型,27B 激活即可实现实时音视频交互
Liquid AI 发布 LFM2-Audio-1.5B,一个支持音频与文本输入输出的端到端基础模型,扩展了 LFM2 家族。
推荐理由:官方给出了 VoiceBench、ASR 词错率和低于 100ms 的延迟数据,读者可以据此评估 1.5B 参数模型在端侧实时语音场景的可用性。
inclusionAI团队推出了MingTok-Audio,这是首个能有效融合语义与声学特征的统一连续语音分词器,适用于语音理解与生成任务。该模型基于纯因果Transformer架构,去除了卷积层以提升效率,并采用VAE进行连续特征建模以实现高质量音频重建。在语音重建性能上,其帧率为50,在SEED-ZH和SEED-EN测试集上的PESQ分别达到4.21和4.04,SIM为0.96,STOI为0.98,显著优于对比模型。在下游ASR任务中,其在多个方言数据集上取得了更低的错误率,例如在Hunan Minnan数据集上WER低至9.80%。
推荐理由:蚂蚁把语音 tokenizer 做到了 PESQ 4.2 的离谱分数,比第二名翻了快一倍,做语音理解和生成的团队值得拿这个当新 baseline 跑一下。
FireRedTeam 发布 FireRedChat,一个完全自托管的实时语音 AI 智能体全双工交互解决方案。系统集成了 TTS、ASR、pVAD(个性化语音活动检测)和 EoT(结束轮次检测),不依赖外部 API、无数据泄露、部署完全可控。
推荐理由:官方发布了可完全自托管的实时语音智能体方案,组件构成和部署路径都写清楚了,适合评估私有化语音交互搭建。