FireRedTeam 开源 FireRedTTS-2 长对话语音生成模型
FireRedTeam 发布 FireRedTTS-2,一款面向播客和聊天机器人的长对话流式 TTS 系统,支持最多 3 分钟、4 个说话人的多语种对话生成,覆盖中英日韩法德俄语并支持零样本跨语言音色克隆。
推荐理由:官方开源了长对话流式语音合成模型,给出多语言支持、延迟数据和部署方案,适合关注播客与对话生成的读者参考。
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
FireRedTeam 发布 FireRedTTS-2,一款面向播客和聊天机器人的长对话流式 TTS 系统,支持最多 3 分钟、4 个说话人的多语种对话生成,覆盖中英日韩法德俄语并支持零样本跨语言音色克隆。
推荐理由:官方开源了长对话流式语音合成模型,给出多语言支持、延迟数据和部署方案,适合关注播客与对话生成的读者参考。
音乐技术公司Suno宣布收购完全在浏览器中构建的AI加速数字音频工作站WavTool。WavTool的核心团队将加入Suno并担任产品及工程领导职务。此次收购将WavTool的专业级编辑功能(支持VST插件、采样精确编辑等)与原生AI能力(如音轨分离、AI生成MIDI)整合到Suno平台,旨在增强对专业词曲作者和制作人的支持。Suno CEO表示,此举是为了更好地赋能音乐家,而WavTool联合创始人则认为双方在AI辅助音乐创作的愿景上高度一致。
推荐理由:一年前的收购,现在看仍是 Suno 从消费级玩具迈向专业工具的关键一步,但新鲜度早没了,只适合补看脉络。
OpenMOSS 发布并开源 MOSS-TTSD-V0,支持中英双语对话语音生成、零样本双说话人音色克隆、声音事件控制和长语音生成,模型权重、推理代码和 API 全部开源并支持商用。
推荐理由:原文给出训练数据规模、Codec 设计和对比结果,读者可据此评估这个开源对话语音模型的可复用价值。
印度政府依据 IndiaAI Mission 选定 Sarvam 从零构建印度主权大语言模型,并提供专属算力资源。模型具备推理能力、面向语音设计并精通印度语言,计划实现大规模安全部署。
推荐理由:官方公告明确了主权模型的三档规格与本土部署定位,可以据此了解印度 AI 基础设施的建设思路。
Zyphra 以 Apache 2.0 许可发布 Zonos-v0.1 beta,包含 1.6B transformer 与 1.6B SSM hybrid 两个实时 TTS 模型,后者是首个开源 TTS SSM 模型。
推荐理由:官方发布了模型权重、API 定价和架构细节,读者可以据此评估开源 TTS 与专有模型的差距与可用性。
FireRedTeam 开源工业级 ASR 模型 FireRedASR,支持普通话、中文方言和英文,在公开普通话 ASR 基准上取得 SOTA,并具备歌词识别能力。
推荐理由:原文给出两个模型变体的架构差异和公开基准 CER/WER 对比数字,读者可据此评估选型。
通义 FunAudioLLM 团队开源基于 LLM 的 TTS 系统 Fun-CosyVoice 3.0,官方称在内容一致性、说话人相似度和韵律自然度上超越前代 CosyVoice 2.0,面向零样本多语言语音合成。
推荐理由:官方发布开源 TTS 新版本,附评测表、安装与部署方式,适合关注多语言语音合成落地的开发者参考。
SenseVoice 是一个语音理解基础模型,支持 ASR、语种识别、语音情感识别和音频事件检测。发布的 SenseVoiceSmall 检查点支持普通话、粤语、英语、日语和韩语,并输出情感与事件标签;采用非自回归端到端架构,同参数量级下推理速度比 Whisper-Small 快 5 倍以上、比 Whisper-Large 快 15 倍以上。
推荐理由:官方仓库文档同时给出基准对比、部署路径和微调方案,读者可以据此评估 SenseVoice 在中英文语音识别场景的可用性。
Suno 发布 Audio Inputs 功能,所有 Pro 和 Premier 用户可上传或录制 6-60 秒的音频片段,通过“Extend”模式选择起始时间戳、设定风格,并可添加歌词来创作歌曲。社区创作者已用其提供自定义音频引子来设定氛围、节奏和乐器灵感。该功能会阻止受版权保护作品的上传,且所有包含人声的输入将保持私密并不可搜索。
推荐理由:Suno 把上传录音做歌的门槛降到极低,对音乐创作者和普通用户都友好,只是这已经是前年的更新,之后的同类功能可能更完善。
OpenAI 将 GPT-4o 向所有 ChatGPT 用户免费开放,无广告。全新语音(及视频)模式响应速度接近人类,表现力极强,被 Sam Altman 称为「用过最好的计算机界面」,像电影里的 AI。未来还将支持个性化、代操作等功能。
推荐理由:Sam Altman 解读 GPT-4o 发布,强调语音交互与免费策略