跳到正文
北京时间

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

170条精选相关主题多模态AI 视频产品更新

最新精选

第 141–160 条 · 共 170 条
3月26日周四
  1. Demis Hassabis

    Google DeepMind 推出 Lyria 3 Pro,可生成最长3分钟的高保真音乐,支持自由编排前奏、主歌、副歌与桥段。Google AI 订阅者现可在 Gemini App 体验,开发者也能通过 Google AI Studio API 接入创作。

    引用Google DeepMind@GoogleDeepMind

    你现在可以用 Lyria 3 Pro 创作更长的曲目了。🎶 规划前奏、主歌、副歌和桥段,构建长达 3 分钟的高保真作品。🎹

    推荐理由:Google Lyria 3 Pro 支持生成 3 分钟结构化音乐,已上线 Gemini App

  2. Cohere Labs:官方研究博客65

    Cohere 发布开源语音识别模型 Cohere Transcribe,登顶 HuggingFace Open ASR Leaderboard

    Cohere 发布开源 ASR 模型 Cohere Transcribe,基于 Conformer 编码器-解码器架构,参数量 2B,支持英语、法语、中文、日语、阿拉伯语等 14 种语言,采用 Apache 2.0 许可证。

    推荐理由:原文给出了模型规格、WER 数据和推理吞吐表现,读者可以据此评估它在语音识别工作流中的实际可用性。

3月24日周二
  1. Hugging Face:Blog(RSS)78

    全新语音智能体评估框架EVA发布

    ServiceNow AI团队在Hugging Face上发布了语音智能体评估框架EVA。该框架通过标准化测试集与多模态指标,系统评估语音助手在对话理解、任务完成及交互自然度等方面的性能,旨在量化衡量智能体在复杂真实场景下的表现,助力研究人员客观比较不同模型,推动技术优化。

    推荐理由:提供语音代理评估标准,帮助开发者优化模型性能和测试效率。

3月23日周一
  1. Mistral AI:News(网页)70

    Mistral AI 发布首个文本转语音模型 Voxtral TTS

    Mistral AI 发布 4B 参数文本转语音模型 Voxtral TTS,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言。

    推荐理由:官方公布了模型架构、延迟数据和与 ElevenLabs 的人类评测对比,可据此评估其在语音智能体场景的适用性。

2月24日周二
2月23日周一
  1. Together AI 研究与产品博客(RSS)63

    Together AI 发布 SF Streets 基准,揭示语音模型街名转写错误率达 39% 并用跨语言风格迁移降低 60% 错误

    Together AI 发布 SF Streets 与 US Streets 两项基准,测试 15 个先进 ASR 模型在街名转写上的表现,发现平均错误率达 39%,非英语母语者准确率比英语母语者低 18 个百分点(46% vs 64%)。

    推荐理由:原文用自建基准量化了 ASR 在街名转写上的短板,并给出可复用的合成数据改进方法,对语音部署有直接参考价值。

2月12日周四
  1. FireRedTeam:原创语音与多模态项目61

    FireRedTeam 开源 FireRedASR2S 一体化语音识别系统,含 ASR、VAD、LID 和标点四个模块

    FireRedTeam 发布开源工业级一体化语音识别系统 FireRedASR2S,集成 FireRedASR2(支持中文普通话、20+ 方言口音、英文、中英混说及歌声转写)、FireRedVAD、FireRedLID 和 FireRedPunc 四个模块,均开源权重与推理代码。

    推荐理由:官方开源的一体化语音识别系统,给出与 Doubao-ASR、Silero-VAD 等的对比数字和完整推理代码,便于直接部署验证。

2月7日周六
  1. FireRedTeam:原创语音与多模态项目63

    FireRedTeam 开源 FireRed-OpenStoryline 对话式视频创作工具

    FireRedTeam 于 2026-02-10 正式开源 FireRed-OpenStoryline,将视频创作变为自然语言对话,支持素材搜索下载、脚本生成、BGM 与配音字体推荐,以及全流程剪辑。

    推荐理由:官方开源的对话式视频剪辑项目,覆盖素材检索、脚本生成到剪辑全流程,并可直接通过 Claude Code 等 Agent Skills 安装使用。

2月1日周日
  1. OpenMOSS / 复旦NLP / 上海创智 / MOSI(网页)62

    MOVA 发布:32B MoE 端到端同步视频-音频生成模型全栈开源

    OpenMOSS 团队发布 MOVA 音视频基础模型,总参数 32B MoE、激活 18B,支持文本或图像到音视频的端到端同步生成,最高 720p、单段 8 秒。模型采用非对称双塔架构(14B Wan 2.2 I2V 视频塔与 1.3B 音频塔)加双向 Bridge 和 Aligned ROPE 对齐时间轴,并开放模型权重、训练与推理代码及微调方案。

    推荐理由:原文给出架构、训练策略和开源范围,读者可以了解端到端音视频生成如何处理同步问题并可复现研究。

1月23日周五
  1. MiniMax:Blog(网页)

    MiniMax Speech 2.8 语音模型

    MiniMax 发布新一代语音模型 MiniMax Speech 2.8,通过原生声音标签技术模拟人类口语中的"嗯"、"啊"等填充词及呼吸停顿,显著提升对话自然度。该模型支持10秒样本高保真声音克隆,精准还原音色与语速,同时消除背景噪音与数字伪影,输出录音室级纯净音质。此外,模型优化了跨语言表现,从普通话-日语对开始解决口音渗透问题,实现更接近母语者的发音效果。

    推荐理由:10秒样本克隆真人声线,AI说话带'嗯啊'呼吸声,MiniMax语音模型上新

12月17日周三
  1. xAI:News(网页)

    xAI 发布 Grok Voice Agent API

    xAI 开放 Grok Voice Agent API,基于自研语音栈(VAD、tokenizer、音频模型),Big Bench Audio 基准排名第一,首音频延迟低于 1 秒(比竞品快近 5 倍),定价 $0.05/分钟。支持数十种语言自动切换、实时搜索 X 和网页、调用自定义工具,已深度集成特斯拉车机。提供 Ara、Eve 等多种自然声线,支持 [whisper] 等听觉标签,兼容 OpenAI Realtime API 规范。

    推荐理由:xAI发布Grok语音Agent API,延迟低于1秒且定价仅为OpenAI一半,已集成至Tesla车载系统

12月15日周一
  1. 通义 QwenAudio:原创语音项目60

    通义实验室开源 Fun-ASR 系列语音识别模型,含方言与 31 语言版本

    通义实验室发布 Fun-ASR 端到端语音识别模型系列并开源。Fun-ASR-Nano-2512 参数量 800M,基于数千万小时语音训练,支持中英日三语、7 种汉语方言和 26 种地方口音;Fun-ASR-MLT-Nano-2512 同为 800M,基于数十万小时训练,支持 31 种语言。

    推荐理由:原文给出两个识别模型的训练规模、语言覆盖和开源基准对比,还附部署与推理路径,读者可据此评估在中文和方言场景的可用性。

11月25日周二
  1. Suno:Blog(网页)56

    音乐创作的新篇章 · Suno 联合创始人兼首席执行官 Mikey Shulman · 2025年11月25日 Suno 与华纳音乐集团合作,共同构建交互式音乐的未来 公告

    Suno宣布与华纳音乐集团达成合作。Suno已拥有近1亿音乐创作者社区,此次合作旨在推出更强大的创作功能、提供与WMG旗下艺术家互动的机会,并基于授权音乐构建新一代Suno模型,其性能将超越v5。未来,部分同意授权的WMG艺术家声音与形象可用于新的AI生成音乐创作体验,为其开辟新收入渠道。同时,歌曲下载功能将调整为仅限付费用户使用,而Suno Studio作为专业工具将保持现有功能并持续更新。

    推荐理由:Suno和华纳的牵手,意味着AI生成音乐终于拿到了正版内容的通行证,从此不用再躲躲藏藏,对音乐创作者和听众都是质变信号。

11月21日周五
  1. Hugging Face:Blog(RSS)83

    Open ASR 排行榜新增多语言与长格式赛道,揭示模型性能新挑战

    Hugging Face 的 Open ASR 排行榜新增多语言和长格式语音识别评估赛道。多语言赛道涵盖8种语言,长格式赛道则测试模型处理连续数分钟语音的能力。新榜单显示,领先模型在多语言任务上的词错误率平均比专用单语模型高约15%,在长格式任务上错误率可能上升超20%,凸显了模型在实际应用中的泛化能力仍面临严峻挑战。

    推荐理由:ASR排行榜新增多语言和长形式评估,助力开发者优化语音应用。

10月30日周四
  1. MiniMax:Blog(网页)

    MiniMax发布新一代语音模型Speech 2.6

    MiniMax发布语音模型Speech 2.6,端到端延迟降至250毫秒内,支持实时对话。新增多语言特殊格式解析能力,可自动朗读URL、邮箱、电话、日期及金额,无需预处理。推出Fluent LoRA功能,即使源录音带口音也能保留音色并生成流畅语音,支持40余种语言。已被LiveKit、Vapi等平台及智能硬件采用。

    推荐理由:MiniMax发布Speech 2.6语音模型,支持Voice Agent场景,实现超低延迟与Fluent LoRA语音克隆优化。

10月24日周五
  1. 美团 LongCat:HuggingFace 新模型

    美团开源全模态模型LongCat-Flash-Omni

    美团开源全模态模型LongCat-Flash-Omni,采用5600亿参数MoE架构(激活270亿),支持128K上下文与实时音视频交互。模型基于快捷连接MoE与零计算专家,配备轻量级编解码器及分块特征交错机制,通过课程式渐进训练提升效率。在OmniBench、WorldSense等基准测试中超越Qwen3-Omni与Gemini-2.5-Pro,在文档理解、语音识别及GUI控制等任务中达到领先水平。

    推荐理由:美团开源 560B 参数多模态模型,27B 激活即可实现实时音视频交互

10月1日周三
9月29日周一
  1. 蚂蚁 inclusionAI:GitHub 新仓库57

    inclusionAI发布MingTok-Audio:首个统一连续语音分词器

    inclusionAI团队推出了MingTok-Audio,这是首个能有效融合语义与声学特征的统一连续语音分词器,适用于语音理解与生成任务。该模型基于纯因果Transformer架构,去除了卷积层以提升效率,并采用VAE进行连续特征建模以实现高质量音频重建。在语音重建性能上,其帧率为50,在SEED-ZH和SEED-EN测试集上的PESQ分别达到4.21和4.04,SIM为0.96,STOI为0.98,显著优于对比模型。在下游ASR任务中,其在多个方言数据集上取得了更低的错误率,例如在Hunan Minnan数据集上WER低至9.80%。

    推荐理由:蚂蚁把语音 tokenizer 做到了 PESQ 4.2 的离谱分数,比第二名翻了快一倍,做语音理解和生成的团队值得拿这个当新 baseline 跑一下。

9月9日周二
  1. FireRedTeam:原创语音与多模态项目64

    FireRedTeam 开源 FireRedChat 全自托管全双工语音交互方案

    FireRedTeam 发布 FireRedChat,一个完全自托管的实时语音 AI 智能体全双工交互解决方案。系统集成了 TTS、ASR、pVAD(个性化语音活动检测)和 EoT(结束轮次检测),不依赖外部 API、无数据泄露、部署完全可控。

    推荐理由:官方发布了可完全自托管的实时语音智能体方案,组件构成和部署路径都写清楚了,适合评估私有化语音交互搭建。