跳到正文
北京时间

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

170条精选相关主题多模态AI 视频产品更新

最新精选

第 121–140 条 · 共 170 条
5月1日周五
  1. xAI:News(网页)60

    自定义语音与语音库

    xAI于2026年4月30日推出自定义语音和语音库功能。用户可通过约1分钟录音快速克隆声音,并在Grok文本转语音及语音代理API中即时使用,整个过程仅需2分钟。语音库提供集中管理平台,内置语音已超80种,支持28种语言。为确保安全,系统采用两阶段验证,包括实时转录匹配和说话人嵌入确认,以防止未经授权的克隆。这些功能适用于品牌代理、内容创作、无障碍辅助、多语言团队及游戏娱乐等多种场景,且使用自定义语音无需额外费用。

    推荐理由:xAI 这波‘声音克隆+管理’的更新很实用,安全验证做得细,创作品类和品牌方应该会喜欢,对开发者来说是个加分项,但不是那种能改变格局的大招。

4月28日周二
  1. Hacker News 热门(buzzing.cc 中文翻译)70

    Microsoft VibeVoice:开源前沿语音人工智能

    微软开源了前沿语音人工智能项目VibeVoice,该项目已在GitHub上发布。VibeVoice能够生成高度自然、富有表现力的语音,支持多种语言和情感语调,显著提升了合成语音的真实感与感染力。其开源策略旨在推动语音AI领域的协作与创新,降低开发门槛。该项目在技术社区获得关注,在Hacker News上获得了103个投票点数。

    推荐理由:微软把前沿语音模型直接开源放 GitHub,对做语音产品的团队来说是真金白银的基建降本,不用再从零训一个了。

4月24日周五
  1. xAI:News(网页)75

    Grok Voice Think Fast 1.0:xAI发布旗舰语音模型,专为复杂工作流设计

    xAI发布旗舰语音模型Grok Voice Think Fast 1.0,专为客服、销售等领域的复杂多步骤工作流打造。该模型在τ-voice Bench全双工语音排行榜位列第一,能在电话音频、噪音、口音及频繁打断等真实苛刻条件下稳定运行,并原生支持25种以上语言。其核心优势包括精准的数据录入与复述、实时后台推理不增加延迟,并能通过思考避免错误回答。目前该模型已应用于Starlink的销售与客服,实现了20%的电话销售转化率和70%的客服自主解决率,能跨数百个工作流调用28种工具处理硬件故障排查、换货等高风险任务。

    推荐理由:xAI 的语音代理不再只是实验,Starlink 实测 20% 销售转化率说明它已经能扛真实业务,语音模型进入可用阶段,做客服和销售自动化的团队该试一下。

  2. 公众号:小米 MiMo83

    小米发布 MiMo-V2.5-TTS 系列与 ASR,覆盖语音合成与识别

    小米正式发布 MiMo-V2.5-TTS Series 与 MiMo-V2.5-ASR,覆盖语音识别与合成两大能力。TTS 系列含三款模型,支持风格指令遵循与音频标签控制,其中 VoiceDesign 可零参考音频生成新音色,VoiceClone 仅需数秒参考音频即可复刻音色;ASR 在中英双语、中文方言、强噪音等场景达业界领先水平。

    推荐理由:把角色演出指令从参数模板简化为导演笔记式的自然语言,对有声剧和游戏NPC等依赖声音塑造的场景,定制成本与表现自由度可能同时改善。

4月23日周四
  1. IT之家(RSS)74

    谷歌确认基于 Gemini AI 的苹果新版 Siri 今年亮相

    谷歌云首席执行官在谷歌Cloud Next 26大会上确认,基于Gemini AI技术构建的新一代苹果Siri将于2026年发布。双方合作源于2026年1月签署的多年期协议,谷歌作为首选云服务商提供核心技术支持。该交易年价值约10亿美元,协议严格限制谷歌接触用户数据以保障隐私。技术层面,苹果正通过知识蒸馏将大型Gemini模型精简为可在iPhone等设备端运行的版本,旨在降低云端依赖并提升响应速度。

    推荐理由:苹果终于把 Siri 大脑换成了 Gemini,每年 10 亿美金的合作不是小打小闹,这代 Siri 可能真的会变聪明。但落地得等一年,做端侧部署的可以盯一下苹果的蒸馏方案。

  2. 公众号:小米 MiMo79

    Xiaomi MiMo-V2.5 系列大模型开启公测

    Xiaomi MiMo-V2.5 系列正式公测,包含 MiMo-V2.5、V2.5-Pro、TTS 与 ASR 等模型。其中 V2.5-Pro 在通用智能体、复杂软件工程等维度对标 Claude Opus 4.6、GPT-5.4,曾用 4.3 小时、672 次工具调用完成北大编译原理课程项目并获满分。

    推荐理由:在自主完成编译器构建和视频编辑器开发的长程任务演示中,展示了结构化的逐层搭建和自我修正能力,其效率对比数据有助于判断复杂Agent任务的成本边界。

4月18日周六
  1. xAI:News(网页)72

    Grok语音转文本与文本转语音API发布

    xAI发布Grok语音转文本(STT)与文本转语音(TTS)两款独立API,采用与Grok Voice、Tesla及Starlink相同技术栈。STT支持批量(0.10美元/小时)与实时流式(0.20美元/小时)转录,电话实体识别词错率仅5.0%,整体6.9%,优于竞品,支持25种以上语言及说话人分离。TTS定价4.20美元/百万字符,可通过[laugh]等标签精细控制情感语调。

    推荐理由:xAI 把 Grok 的语音能力拆成独立 API 放出,STT 在实体识别上碾压几个老牌竞品,定价也不算贵,做语音 agent 的可以直接加进方案里对比。

4月17日周五
  1. HuggingFace Daily Papers(社区热门论文)81

    Qwen3.5-Omni技术报告

    阿里通义千问团队发布Qwen3.5-Omni,模型拥有数百亿参数和256k上下文,基于超1亿小时音视频数据训练,在215项基准测试中达SOTA水平,关键音频任务超越Gemini-3.1 Pro。采用混合注意力MoE架构,支持10小时音频与400秒720P视频理解。提出ARIA技术优化流式语音合成稳定性,支持10种语言。模型具备Audio-Visual Vibe Coding能力,可直接基于音视频指令生成代码。

    推荐理由:Qwen3.5-Omni把语音、视频、文本全模态做到一个模型里,且在215项音频任务上超越Gemini 3.1 Pro,这是国内团队在全模态模型上的里程碑,做交互产品的值得关注。

4月16日周四
  1. Google Blog:AI(RSS)70

    Gemini 3.1 Flash TTS:下一代表现力AI语音技术

    Google正式发布Gemini 3.1 Flash TTS,作为下一代表现力AI语音技术,该模型现已全面上线Google旗下各产品线。此次升级标志着Google在语音合成领域的技术突破,旨在为用户提供更自然、富有情感表现力的AI语音交互体验,进一步强化其AI生态系统的语音能力。

    推荐理由:Google 把 TTS 的控制权交给了文本指令,音频标签这个设计让语音应用从'选择预设'变成'现场导演',对多模态应用是个实在的增强。

4月15日周三
  1. 字节 Seed:Research Papers(网页内嵌数据)66

    字节 Seed 发布 Seedance 2.0 音视频联合生成模型

    字节 Seed 发布原生多模态音视频生成模型 Seedance 2.0,2026 年 2 月初在中国正式上线,采用统一架构支持文本、图像、音频、视频四种输入模态。

    推荐理由:官方技术报告梳理了 Seedance 2.0 的统一架构、多模态输入上限与分辨率规格,读者可对照前代看能力变化。

4月13日周一
  1. HuggingFace Daily Papers(社区热门论文)75

    Audio Flamingo Next:面向语音、声音与音乐的下一代开源音频-语言模型

    Audio Flamingo 系列发布下一代模型 AF-Next,支持长达 30 分钟的复杂音频输入,并引入 Temporal Audio Chain-of-Thought 技术,将中间推理步骤显式对应到时间戳。该模型基于超过 100 万小时的新增数据进行课程式训练,在 20 个音频理解与推理基准测试中显著超越同规模开源模型,部分指标超过更大规模的闭源模型。团队同步开源了 AF-Next-Instruct、AF-Next-Think 和 AF-Next-Captioner 三个变体。

    推荐理由:NVIDIA 开源的这个音频大模型在 20 多个基准上大幅超越前代,长音频理解尤其凶猛,做语音、音乐和声音应用的值得把论文翻一遍。

4月3日周五
4月2日周四
  1. Microsoft AI:官方博客(网页)66

    Microsoft AI 发布 MAI-Transcribe-1、MAI-Voice-1 与 MAI-Image-2 三款模型,上线 Microsoft Foundry

    Microsoft AI 宣布发布 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2 三款模型,即日起所有开发者可在 Microsoft Foundry 和 MAI Playground 使用。

    推荐理由:官方同时给出三款模型的定价和 FLEURS 基准对比数据,开发者可以直接在 Foundry 上手评估适用性。

3月30日周一
  1. 美团 LongCat:HuggingFace 新模型

    LongCat-AudioDiT-1B:高保真波形潜空间扩散式文本转语音模型

    美团 LongCat 团队开源的扩散式 TTS 模型摒弃传统的 mel-spectrogram 中间表示,直接在波形潜空间操作,仅通过 Wav-VAE 与扩散骨干网络即可合成语音。该模型修复了训练-推理不匹配问题,并以自适应投影引导替代无分类器引导。最大版本 3.5B 在 Seed 基准实现 SOTA 零样本语音克隆,说话人相似度(SIM)在 Seed-ZH 达 0.818、Seed-Hard 达 0.797,超越此前最优的 Seed-TTS。研究还发现 Wav-VAE 的重建保真度与最终合成质量并非正相关。

    推荐理由:美团开源 1B 语音克隆模型,Seed 基准超 Seed-TTS,零样本推理可用

3月28日周六
3月27日周五
  1. Demis Hassabis

    Google 发布 Gemini 3.1 Flash Live,称其迄今最高质量音频模型,具备更低延迟、更高精度和更自然的对话体验,改进了函数调用能力。现已在 Gemini App 和 Google AI Studio 上线。

    引用Google DeepMind@GoogleDeepMind

    欢迎 Gemini 3.1 Flash Live。🗣️ 我们最新的音频模型带来了更自然的对话体验,并改进了函数调用——使其更加实用且信息更丰富。以下是新功能介绍 🧵

    推荐理由:Google发布Gemini 3.1 Flash Live,支持低延迟语音交互与Agent构建

3月26日周四