跳到正文
北京时间

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

170条精选相关主题多模态AI 视频产品更新

最新精选

第 161–170 条 · 共 170 条
9月2日周二
  1. FireRedTeam:原创语音与多模态项目62

    FireRedTeam 开源 FireRedTTS-2 长对话语音生成模型

    FireRedTeam 发布 FireRedTTS-2,一款面向播客和聊天机器人的长对话流式 TTS 系统,支持最多 3 分钟、4 个说话人的多语种对话生成,覆盖中英日韩法德俄语并支持零样本跨语言音色克隆。

    推荐理由:官方开源了长对话流式语音合成模型,给出多语言支持、延迟数据和部署方案,适合关注播客与对话生成的读者参考。

6月30日周一
  1. Suno:Blog(网页)55

    Suno收购浏览器数字音频工作站WavTool

    音乐技术公司Suno宣布收购完全在浏览器中构建的AI加速数字音频工作站WavTool。WavTool的核心团队将加入Suno并担任产品及工程领导职务。此次收购将WavTool的专业级编辑功能(支持VST插件、采样精确编辑等)与原生AI能力(如音轨分离、AI生成MIDI)整合到Suno平台,旨在增强对专业词曲作者和制作人的支持。Suno CEO表示,此举是为了更好地赋能音乐家,而WavTool联合创始人则认为双方在AI辅助音乐创作的愿景上高度一致。

    推荐理由:一年前的收购,现在看仍是 Suno 从消费级玩具迈向专业工具的关键一步,但新鲜度早没了,只适合补看脉络。

6月20日周五
  1. OpenMOSS / 复旦NLP / 上海创智 / MOSI(网页)69

    OpenMOSS 开源 MOSS-TTSD-V0 中英双语对话语音生成模型

    OpenMOSS 发布并开源 MOSS-TTSD-V0,支持中英双语对话语音生成、零样本双说话人音色克隆、声音事件控制和长语音生成,模型权重、推理代码和 API 全部开源并支持商用。

    推荐理由:原文给出训练数据规模、Codec 设计和对比结果,读者可据此评估这个开源对话语音模型的可复用价值。

4月26日周六
  1. Sarvam AI(网页)61

    印度政府在 IndiaAI Mission 下选定 Sarvam 构建主权大语言模型

    印度政府依据 IndiaAI Mission 选定 Sarvam 从零构建印度主权大语言模型,并提供专属算力资源。模型具备推理能力、面向语音设计并精通印度语言,计划实现大规模安全部署。

    推荐理由:官方公告明确了主权模型的三档规格与本土部署定位,可以据此了解印度 AI 基础设施的建设思路。

2月10日周一
  1. Zyphra Research(网页)71

    Zyphra 发布 Zonos-v0.1 beta 开源 TTS 模型

    Zyphra 以 Apache 2.0 许可发布 Zonos-v0.1 beta,包含 1.6B transformer 与 1.6B SSM hybrid 两个实时 TTS 模型,后者是首个开源 TTS SSM 模型。

    推荐理由:官方发布了模型权重、API 定价和架构细节,读者可以据此评估开源 TTS 与专有模型的差距与可用性。

1月24日周五
7月3日周三
  1. 通义 QwenAudio:原创语音项目62

    FunAudioLLM 发布 Fun-CosyVoice 3.0 开源语音合成模型

    通义 FunAudioLLM 团队开源基于 LLM 的 TTS 系统 Fun-CosyVoice 3.0,官方称在内容一致性、说话人相似度和韵律自然度上超越前代 CosyVoice 2.0,面向零样本多语言语音合成。

    推荐理由:官方发布开源 TTS 新版本,附评测表、安装与部署方式,适合关注多语言语音合成落地的开发者参考。

  2. 通义 QwenAudio:原创语音项目61

    SenseVoice 开源语音理解模型仓库:支持 ASR、情感识别与音频事件检测

    SenseVoice 是一个语音理解基础模型,支持 ASR、语种识别、语音情感识别和音频事件检测。发布的 SenseVoiceSmall 检查点支持普通话、粤语、英语、日语和韩语,并输出情感与事件标签;采用非自回归端到端架构,同参数量级下推理速度比 Whisper-Small 快 5 倍以上、比 Whisper-Large 快 15 倍以上。

    推荐理由:官方仓库文档同时给出基准对比、部署路径和微调方案,读者可以据此评估 SenseVoice 在中英文语音识别场景的可用性。

6月12日周三
  1. Suno:Blog(网页)55

    Audio Inputs——通过 Mikey Shulman(联合创始人兼 CEO)发布·2024 年 6 月 12 日,用任何声音创作一首歌 产品更新

    Suno 发布 Audio Inputs 功能,所有 Pro 和 Premier 用户可上传或录制 6-60 秒的音频片段,通过“Extend”模式选择起始时间戳、设定风格,并可添加歌词来创作歌曲。社区创作者已用其提供自定义音频引子来设定氛围、节奏和乐器灵感。该功能会阻止受版权保护作品的上传,且所有包含人声的输入将保持私密并不可搜索。

    推荐理由:Suno 把上传录音做歌的门槛降到极低,对音乐创作者和普通用户都友好,只是这已经是前年的更新,之后的同类功能可能更完善。

5月14日周二
  1. Sam Altman:Blog(RSS)

    GPT-4o

    OpenAI 将 GPT-4o 向所有 ChatGPT 用户免费开放,无广告。全新语音(及视频)模式响应速度接近人类,表现力极强,被 Sam Altman 称为「用过最好的计算机界面」,像电影里的 AI。未来还将支持个性化、代操作等功能。

    推荐理由:Sam Altman 解读 GPT-4o 发布,强调语音交互与免费策略