跳到正文
北京时间

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

170条精选相关主题多模态AI 视频产品更新

最新精选

第 81–100 条 · 共 170 条
6月5日周五
  1. Suno:Blog(网页)64

    Suno Voices 使用指南:6 个技巧打造高质量人声录制

    Suno Voices 面向 Web 付费用户开放。提升人声质量的 6 个技巧:在安静环境录音以减少背景噪音;先练习歌词再正式录制;不必追求完美,保留真实情感;录音时长尽量超过 1 分钟以提供更多学习素材;将人声匹配到合适的音乐流派(如民谣、流行、死亡金属、波萨诺瓦等);敢于尝试不同风格以发现惊喜。这些技巧旨在帮助用户获得更个性化、表现力更强的声音效果。

    推荐理由:Suno 官方出的 Voices 录制避坑指南,不是大新闻,但照着做能让你克隆的声音干净不少,尤其是安静环境和别怕走音那两条,做音乐的朋友可以直接收藏。

  2. IT之家(RSS)73

    苹果新版 Siri 不会被宣传为完成品,内部将其标记为“Beta”版

    苹果新版Siri被内部标记为“Beta”版,不会作为完成品宣传;可能设置等待清单供用户尝试。iOS 27细节:通知到达重新设计,通知中心手势移至左上角;“查找”应用视觉重设计;照片“清理”功能改进;大量底层安全改进。部分Siri查询将通过Google Cloud调用授权版Gemini,并使用谷歌的NVIDIA Blackwell B200集群处理。

    推荐理由:古尔曼这料把苹果的策略摊开了,Siri不再死守自研,用谷歌Gemini加英伟达芯片,对追求隐私的苹果是转折点,但标Beta也说明离成熟还远。

  3. LMSYS:Blog(Chatbot Arena 团队)77

    Boson AI 与 LMSYS 发布基于 SGLang-Omni 的 Higgs Audio v3 TTS 端到端服务

    Boson AI 与 LMSYS 联合推出基于 SGLang-Omni 推理框架的 Higgs Audio v3 TTS 端到端服务。该模型约 4B 参数,基于 Qwen3-4B 骨干,支持 100 种语言(内部评测覆盖 111 种),在 Seed-TTS、CV3、MiniMax-Multilingual 及 Higgs-Multilingual 零样本语音克隆任务中达到单字级 WER/CER。开发者可通过文本内控制标签实时调整情感(20+种)、风格、韵律(语速/音高/停顿)及音效。模型支持流式合成,文本未完整时即可开始生成语音并保持一致性。SGLang-Omni 专为多阶段生成模型设计,统一调度 AR 解码与轻量计算,实现低延迟推理。

    推荐理由:Higgs v3 把多语言和实时可控制整合进一个流式 TTS 模型,SGLang-Omni 为它搭好了多阶段推理的底座,做语音 Agent 的可以直接抄作业,这比多数论文落地快半拍。

6月4日周四
  1. Hugging Face:Blog(RSS)75

    Nemotron 3.5 ASR:为你的语言、领域或口音进行微调

    Nemotron 3.5 ASR 是一个 600M 参数的多语言流式语音识别模型,单个检查点覆盖 40 种语言-地区(含英、西、德、法、意、日、韩、中、阿拉伯等)。采用 Cache-Aware FastConformer 编码器与 RNNT 解码器,缓存内部状态避免重复计算,实现低延迟流式转录且不损失精度。模型原生输出带标点和大写的生产级文本,无需后处理。支持指定语言(target_lang=es-ES)或自动语言检测(target_lang=auto)。通过注意力上下文大小(att_context_size)可在推理时直接调节延迟-准确率权衡,范围从 80ms 到 1.12s,无需重新训练。模型以 NeMo 检查点形式发布,可用于微调以适配特定语言、领域或口音。

    推荐理由:一个模型搞定40种语言的实时语音转文字,NVIDIA还给了完整微调代码和实测数据,做语音Agent和字幕的可以照着抄作业。

  2. xAI:News(网页)72

    Grok 成为 Vapi 的默认语音引擎

    xAI 宣布与 Vapi 合作,Grok 将作为 Vapi 平台上 12 种核心语音的默认引擎,覆盖超过 250 万个语音智能体。在 Vapi 独立盲测中,Grok Voice 位列第一;X 平台上的人机语音盲猜中,超 4500 名用户有一半无法区分 Grok 与真人。现在,Grok Speech-to-Text 和 Text-to-Speech 已集成至 Vapi Dashboard,团队还可通过 Grok Voice API 获取高级定制选项(含语音克隆),用于旁白、播客、广告等场景。

    推荐理由:xAI 把 Grok 的语音能力直接接入了 Vapi,250 万+语音代理一夜升级,语音交互的“自然度”竞赛从实验室卷到了生产环境。

  3. Elon Musk72

    Vercel 的 AI Gateway 上现已推出 Grok Imagine Video 1.5。该服务支持图生视频并同步音频,一次性完成。示例代码: `await generateVideo({ model: 'xai/grok-imagine-video-1.5-preview', prompt: 'a rabbit sprinting through nyc' });`

    引用Vercel Developers@vercel_dev

    Grok Imagine Video 1.5 上线 AI Gateway。 一次生成即可完成带同步音频的图生视频。 𝚊𝚠𝚊𝚒𝚝 𝚐𝚎𝚗𝚎𝚛𝚊𝚝𝚎𝚅𝚒𝚍𝚎𝚘({ 𝚖𝚘𝚍𝚎𝚕: '𝚡𝚊𝚒/𝚐𝚛𝚘𝚔-𝚒𝚖𝚊𝚐𝚒𝚗𝚎-𝚟𝚒𝚍𝚎𝚘-𝟷.𝟻-𝚙𝚛𝚎𝚟𝚒𝚎𝚠', 𝚙𝚛𝚘𝚖𝚙𝚝: '𝚊 𝚛𝚊𝚋𝚋𝚒𝚝 𝚜𝚙𝚛𝚒𝚗𝚝𝚒𝚗𝚐 𝚝𝚑𝚛𝚘𝚞𝚐𝚑 𝚗𝚢𝚌' });

    推荐理由:Grok Imagine Video 1.5 把同步音频塞进了图生视频,一条 prompt 直接出带声短片,做短视频和创意的可以换上这条流水线了。

  4. IT之家(RSS)72

    深陷版权诉讼仍受资本热捧,AI 音乐生成公司 Suno 再融资 4 亿美元

    AI 音乐生成企业 Suno 完成 4 亿美元 D 轮融资,投后估值 54 亿美元,较七个月前 C 轮估值翻番。公司承认使用受版权保护歌曲训练 AI 模型,但辩称符合合理使用原则。索尼与环球音乐 2024 年首次起诉后,涉案曲目从 560 首增至超 6.1 万首;华纳音乐于 2024 年 11 月与 Suno 和解并签订授权协议。本轮由 Bond Capital 领投,用户日均生成 AI 歌曲超 700 万首。

    推荐理由:一边被三大唱片巨头起诉,一边估值翻倍到54亿美元,资本对AI版权风险的容忍度比我们想的要大得多。创作者和平台都得重新想「合理使用」的边界在哪了。

6月3日周三
  1. Suno68

    我们激动地宣布Suno的新篇章:4亿美元D轮融资,估值54亿美元!🚀 我们的使命一直很简单:让更多人能体验制作音乐的乐趣。非常感谢我们不可思议的社区和投资者与我们共同建设。 点击此处阅读Mikey的博客:https://suno.com/blog/series-d-announcement

    推荐理由:AI音乐生成头部又融了一轮大的,估值涨3倍,但产品本身没啥变化,这轮更多是行业信号而不是用户福利。

  2. Microsoft AI:官方博客(网页)61

    Microsoft 发布 MAI-Voice-2 语音合成模型,支持 15 种语言与零样本声音克隆

    Microsoft 发布文本转语音模型 MAI-Voice-2,官方称在保真度、语言覆盖、说话人一致性和情感范围上较前代显著提升,并列对比偏好测试中 72% 的场景优于 MAI-Voice-1。

    推荐理由:原文给出语言扩展、情感控制、零样本克隆与偏好测试数据,读者可以据此评估它在语音产品里的实际可用性。

5月30日周六
  1. Greg Brockman76

    OpenAI 实时翻译功能——使用70多种输入语言说话,翻译成13种输出语言: gpt-realtime-translate 接收任意语言的语音输入,并输出目标语言的语音。 大语言模型很棒,但特定用例需要专用模型。 我们正在智能眼镜上运行此功能。

    引用cayden 凯登@caydengineer

    OpenAI 刚刚发布了一种全新的模型 gpt-realtime-translate 接收任意语言的语音音频,并输出你目标语言的语音 LLM 很棒,但针对特定用例你需要专门的模型 我们正在我们的智能眼镜上运行这个

    推荐理由:OpenAI悄悄推出一个专门做实时语音翻译的模型,不是通用LLM,而是专用模型。这标志着AI交互从文字转向语音的第一步,做翻译硬件或AR眼镜的团队要睡不着了。

5月29日周五
  1. IT之家(RSS)74

    小米开源可控视频音效生成模型 ControlFoley,让声音“按你想要的来”

    小米大模型应用团队发布开源可控视频音效生成模型 ControlFoley,旨在解决创作中的可控性难题。该模型统一支持文本引导视频配音、文本控制视频配音和参考音频控制视频配音三类任务。ControlFoley 在 VGGSound-Test 等多个 benchmark 上取得开源 SOTA 表现,其代码、模型权重和在线 Demo 均已开放。

    推荐理由:小米开源的 ControlFoley 把视频音效生成从“看画面配声音”推进到“按意图来”,开源 SOTA 且直接提供 Skill,做视频创作的可以上手试试。

5月28日周四
  1. TechCrunch:AI(RSS)72

    Sesame,这家由Oculus创始人创办的对话式AI初创公司,发布其iOS应用

    由Oculus创始人创办的AI初创公司Sesame发布了其iOS应用,该应用将对话式AI智能体带给公众。应用提供更自然的来回交互体验,设计上区别于传统聊天机器人,旨在让用户感觉更像在和真人对话。

    推荐理由:Oculus创始人做的对话AI,交互设计大概率能看到一些VR时代的人机直觉。虽不是大模型层创新,但产品体验可能重新定义什么样的对话才叫自然。

  2. Midjourney:Updates(RSS)59

    Web 更新

    对话模式在文本和语音输入方面进行了改进。语音会话开始时,可访问用户的图像提示、风格参考、侧边栏设置和最近任务。图像提示功能现可从托盘和侧边栏直接使用。在语音提交过程中,托盘中的图像将保持不变,直至用户手动移除。

    推荐理由:Midjourney给语音模式补了一课——现在它能记住你正在用的图片参考和风格设置,语音创作不用反复翻找,用完即走的轻量用户可能无感。

  3. Hugging Face:Blog(RSS)72

    Reachy Mini 实现完全本地化语音交互

    Reachy Mini 机器人现可通过 `speech-to-speech` 库实现完全本地化的语音交互,无需依赖云端。该方案采用级联流水线架构,对外提供 Realtime API 兼容的 WebSocket 接口。默认组件包括 Silero VAD 用于语音活动检测、Parakeet-TDT 作为语音转文本模型、通义千问(Qwen3-TTS)作为文本转语音模型。大语言模型推荐使用 llama.cpp 运行 Gemma 4。所有数据均在本地处理,保障了隐私且无 API 费用。

    推荐理由:小众硬件的本地语音实战,但HF这套开源管线证明端到端对话已完全可用,所有组件都可自由替换,想做本地化语音助手的人可以照抄。

  4. Greg Brockman66

    OpenAI Codex 新增了“Meeting Recorder”技能。该技能可使用 GPT Realtime Whisper 端点实时转录会议并显示文本。用户可在转录过程中随时向 Codex 提问。会议结束后,会提供完整的转录内容及格式化版本。此功能基于实时 API,费用为 $0.017/分钟。相关代码与说明可在 GitHub 链接中查看。

    引用Simon Smith@_simonsmith

    你现在可以使用 Codex 实时转录会议,并在会议进行过程中向 Codex 提问! 我更新了我的新 Codex Meeting Recorder 技能,使其使用 GPT Realtime Whisper。告诉 Codex 使用该技能,它就会开始转录并在预览窗格中显示。你可以在转录生成过程中就转录内容提问。会议结束后,告诉 Codex 结束,你就会得到完整的转录文本和一个格式化版本(格式化版本还需要改进;已在我的待办清单上)。 请注意,由于这使用的是 GPT Realtime Whisper 端点,它比在会议结束时再转录更贵,每分钟 $0.017(所以一场 30 分钟的会议大约 $0.51)。我正在考虑未来添加一个本地实时选项,比如使用 Nemotron Speech Streaming。 GitHub 链接在帖子串中,还有一些说明。

    推荐理由:Greg 转发的这个 Codex 技能把实时会议转录和问答直接塞进了编辑器,0.5 美元一场会,做会议纪要的可以立刻用起来。

5月24日周日
  1. StepFun76

    StepAudio 2.5 Realtime 是一款实时语音交互模型。其核心优势在于能感知用户的副语言特征,如语气、节奏、停顿甚至轻叹,从而理解话语背后的真实意图。该模型支持通过 API 高度定制角色人格与说话风格,内置超过10,000种可组合的预置角色,并提供5种开箱即用的预设角色供体验。同时,模型经过RLHF优化,能在复杂的角色扮演压力测试中稳定保持设定的人设。支持中英文双语交互。

    推荐理由:StepFun 这个语音模型把副语言感知做进了实时 API,产品人想搞点情感化语音交互的可以试试,预设角色能省不少调 prompt 的功夫。

5月23日周六
5月22日周五
  1. IT之家(RSS)70

    网易有道“子曰4”多模态模型、语音合成模型全量开源

    网易有道宣布将其“子曰”大模型4.0的多模态模型与语音合成模型面向全球全量开源。其中,多模态模型(27B参数)专注于教育场景,在处理高难度视觉数理问题上达到行业顶尖水平,纯文本中文数理难题准确率为81.4%。该模型通过思维链优化,将输出长度压缩43.2%,有效降低了推理成本。同时开源的语音合成模型支持跨语种音色与情感迁移克隆,3秒内即可完成零样本复制,准确度超97%,并支持包括中、英、日、韩在内的14种语言。

    推荐理由:有道把垂直教育的多模态模型全量开源,27B参数在视觉数理上做到SOTA,还把思维链压缩了43%,推理成本实打实下降,做教育应用的可以拿来做二次开发;TTS的跨语种情感克隆也实用,3秒克隆14种语言。

5月21日周四
  1. OpenClaw🦞66

    OpenClaw 2026.5.19 🦞 📱 Android Talk Mode 实现实时化 🍎 Mac 设置界面更清爽 🔐 xAI 登录支持无头模式 🧵 Telegram 话题功能更稳定 大版本更新,简短公告。 https://github.com/openclaw/openclaw/releases/tag/v2026.5.19

    推荐理由:一堆小修小补但都很实用,尤其 Android 实时对话模式,开源 AI 客户端里难得把体验做到这个程度,值得更新。