FireRedTeam 开源 FireRedTTS3 语音生成与编辑模型
FireRedTeam 发布 FireRedTTS3,包含 Base 和 Instruct 两个变体,基于语义增强连续语音表征实现统一语音生成与编辑。
推荐理由:原文给出两个模型变体、语言覆盖和多项评测对比数据,读者可以据此评估它的克隆与编辑能力。
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
FireRedTeam 发布 FireRedTTS3,包含 Base 和 Instruct 两个变体,基于语义增强连续语音表征实现统一语音生成与编辑。
推荐理由:原文给出两个模型变体、语言覆盖和多项评测对比数据,读者可以据此评估它的克隆与编辑能力。
小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。
推荐理由:连续自回归跳过离散 Token 的信息损失,又用语义编码器回灌历史抑制累积误差,为音色克隆和低步数流式共用同一基座提供了路径。
NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置“保持”话术避免 API 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。
推荐理由:端到端语音模型消除级联延迟,而工具调用侧通道和保留消息设计在不中断对话的前提下补齐了API等待期,让实时语音智能体更容易工程化。
OpenAI 更新 ChatGPT 桌面应用,新增对 ChatGPT Voice 的支持,用户可直接通过语音对话控制 AI 智能体并让其在电脑上执行任务。该功能基于全新语音模型系列 ChatGPT-Live,支持 ChatGPT Work 和 Codex,在 macOS 上还可借助 Appshots 访问屏幕内容。
推荐理由:桌面端语音不再只是对话,演示中一条指令完成创建线程、提PR和定位Bug,语音开始成为开发者工作流中的可执行指令层。
本周的 ChatGPT 功能更新 - 8月7日: 1/ 网页编辑器中的富文本格式——当你粘贴邮件或文档时,我们的编辑器会保留格式;复制粘贴太常见了,我们早就该做这个了! 2/ 为付费用户更新模型——GPT 5.6 Sol 在快速聊天和深度推理中更加一致。你现在会得到一个滑块,让你选择 ChatGPT 在回答中投入多少思考。移动端滑块上的触觉反馈(振动)很有趣! 3/ 无限文本消息——免费用户将获得 GPT 5.6 Luna,并享有无限文本消息。让所有人都更智能。即将推出。 4/ 快速 Android 相机——我们在 Android 上让点击 ChatGPT 中的“相机”来拍摄新照片并提问变得快多了。 5/ 语音 x 文件——你现在可以在我们由 GPT-Live 驱动的新 ChatGPT 语音体验中上传文件并提问。 本周的团队演示非常棒。队列里有很多内容,接下来几个月会很精彩。在评论中告诉我们你期待什么!
推荐理由:推理深度滑块把算力分配交给用户,对需要精细控制推理时长与成本的流程更有用,免费无限消息则解除了日常对话量限制。
推荐理由:移动端录制与生成流程打通,创作者用手机采集声音即可快速应用到曲目中,省去了跨工具处理音色的步骤。
QwenAudio Toolkits 是一款本地优先的桌面工作台,定位为对话式 Agent 驱动的音视频创作 IDE,首个公开预览支持 Apple Silicon、macOS 14.2 及以上版本。
推荐理由:官方文档给出了能力清单、支持范围和隐私边界,读者可以据此评估这款本地音频 AI 工作台是否适合自己的创作流程。
独立开发者叶小叔用面壁智能开源的 VoxCPM 克隆千万粉丝网红声音,搭建 STT → LLM → VoxCPM(TTS)三段式实时对话管道,TTS 首包延迟不到 1 秒,端到端体感 2 到 3 秒。
推荐理由:案例的实践价值在于澄清了实时对话 TTS 环节的选择逻辑:中文原生支持与默认参数平衡往往优于盲目追求极致克隆,这一取舍对同类项目具直接参考。

推荐理由:将摄像头面部信号、语音对话和LoRA角色塑形组合进一个可玩演示,为交互式AI角色提供了比常见聊天机器人更丰富的多模态模板。
字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。
推荐理由:SeedRealtime 将音视频感知与表达统一到同一端到端模型中,级联系统常见的说话节奏问题减少了一半,实时场景中能主动提醒并自然停顿,为全模态智能助手交互提供了新的技术路线。
腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 与 MoE 架构,融合高精度识别与语义理解。其在开源评测集中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,并支持上下文纠错、热词注入及高噪耳语等场景。该模型已上线腾讯云 API,元宝 App 首发并免费开放。
推荐理由:将 LLM 语义理解融入语音识别,上下文纠错和热词注入降低了专业场景的接入成本,元宝已集成可体验。
SwanTale 提出统一的多说话人语音与音频生成模型,同时支持零样本与指令任务。研究配套推出 SwanData-Caption 数据方案,通过清洗、合成覆盖与多级标注解决数据稀缺问题,并引入 SwanVAE、Unified MoE、GRPO 后训练等技术。实验显示,SwanTale 在多项零样本与指令指标上领先,并在两项任务的表达力评分中均取得最佳成绩。
推荐理由:通过 SwanData-Caption 数据管线和统一模型,让内容创作者能够以自然语言描述生成定制声音,并复用参考音频,减少了动画、游戏等场景中音频合成的碎片化。
GPT-Live 可以边说边听。 为了让这在 ChatGPT 规模下显得自然,我们从头重建了从客户端到模型的语音技术栈。 这一新架构让音频持续流动,因此更深入的推理和工具调用不会打断对话。
推荐理由:在 GPT-Live 架构下推理与工具调用期间音频流不间断,语音交互的等待感和打断感被显著消除,适用于需要持续对话的陪伴和协作场景。
推荐理由:OpenAI 正式把转录拆成实时和异步两个模型,这是一个信号,语音 AI 的落地正在从通用走向场景专用,做语音产品的都该看一眼。
QwenAudio 开源 qwen-audio-agent,一个让 Agent 保持在线的实时语音运行时,前台对话与后台任务并行,任务结果自动回到当前对话。
推荐理由:原文给出了前台语音对话加后台 Agent 执行的架构设计与多款后端 Agent 接入方式,读者可据此评估是否接入自己的工作流。
推荐理由:ChatGPT 的语音助手正式上岸桌面,关键是能同时指挥多个代理干活,一边写代码一边查资料,全程动嘴就行。对重度用户来说,这可能比任何新模型都更直接影响工作流。
Microsoft AI 发布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash 两款新模型公开预览版。
推荐理由:原文给出两款新模型的定价、性能数字和已落地的产品场景,读者可以据此评估在质量速度成本曲线上的选型。


推荐理由:TTS 模型终于学会控制情感和语调了,Qwen 这次把自然语言提示和细粒度标签一起放进去,做语音助手的可以直接从‘能说话’跳进‘有性格’。
OpenRouter 推出 POST /api/v1/audio/transcriptions 端点,用户可使用同一 API key 将 base64 编码音频发送至该端点,返回 JSON 格式文本与用量对象。
推荐理由:OpenRouter 把语音转录集成进 API,一份 key 搞定聊天和转写,对已经在用的团队省心不少,这篇教程直接可跑。
推荐理由:Karpathy 这条语音输入 ramble 技巧,比精心写 prompt 更符合人性,读完后你也会想试试。