跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-08-03精选AI 评分70

SwanTale:面向指令与零样本任务的统一多说话人语音与音频生成

SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks

AI 导读

SwanTale 提出统一的多说话人语音与音频生成模型,同时支持零样本与指令任务。研究配套推出 SwanData-Caption 数据方案,通过清洗、合成覆盖与多级标注解决数据稀缺问题,并引入 SwanVAE、Unified MoE、GRPO 后训练等技术。实验显示,SwanTale 在多项零样本与指令指标上领先,并在两项任务的表达力评分中均取得最佳成绩。

推荐理由

通过 SwanData-Caption 数据管线和统一模型,让内容创作者能够以自然语言描述生成定制声音,并复用参考音频,减少了动画、游戏等场景中音频合成的碎片化。

正文 · AI 翻译
摘要

语音和音频生成在动画配音、广播剧、电影、广告、游戏、播客和短视频制作中常常是必需的。在这些场景中,创作者可能需要在没有参考录音的情况下设计声音,用自然语言控制说话人风格,支持带有环境和音效的声学场景,并在之后复用所设计的声音。因此,支持面向指令(instruct)和零样本(zero-shot)任务的多说话人语音和音频生成非常重要。指令任务需要环境、说话人风格和细粒度内容的描述,而零样本任务则使用参考音频以及相同的细粒度内容。我们从数据和模型两方面来解决这些任务。首先,我们提出了SwanData-Caption,它清洗原始语音和音频数据,增加有针对性的合成覆盖,并标注多样且准确的多层级描述。然后,我们提出了SwanTale,一个支持零样本和指令任务的多说话人表现力语音和音频生成模型。我们引入SwanVAE来支持高质量的多音频模态生成。接着,我们采用奖励条件质量控制(reward-conditioned quality control)和Engram条件化(Engram conditioning),以及统一MoE(Unified MoE)来进行多任务和多音频模态建模。此外,我们使用课程学习和GRPO后训练,让模型逐步学习并强化其能力。实验结果表明,SwanTale在多个关键的零样本和指令指标上领先,在这两项任务中都取得了最佳的表现力得分,并支持涉及多说话人语音和音频的复杂指令生成。

1 引言

近年来,文本到语音(TTS)系统在零样本语音合成方面取得了显著进展。仅凭一段简短的参考音频片段,这些系统就能根据参考音色合成生动的新内容 [13, 21, 83, 49, 43]。这一能力使得当所需音色已存在于某段录音中时,说话人声音克隆和多说话人语音生成变得切实可行 [103, 51, 117, 63, 94, 113]。然而,媒体创作往往始于相反的情形。在动画配音、广播剧、电影、广告、游戏、播客和短视频制作中,目标说话人可能根本没有参考录音。创作者需要从零开始设计一个声音,指定角色应如何演绎某句台词,并将该台词置于会改变表演感知效果的声学场景中;随后,这个设计好的声音可能通过零样本合成被复用。因此,面向此类工作流程的现代 TTS 系统应同时支持基于参考音频的零样本任务,以及由自然语言描述控制的指令任务。

在经典的零样本语音合成任务中,输入是语音内容与参考音频的配对。参考音频提供说话人身份。除了语音内容,以及在对话任务中的说话人轮次标签外,近期系统越来越多地使用局部风格描述来控制情感和语速 [8, 22]。相比之下,在指令式语音合成任务中,输入仅是一条描述文本,其中可能描述环境、说话人风格和细粒度内容。这里,环境包括场景类型、声场或录音空间线索,以及持续的背景音效 [44, 118, 70]。说话人风格不仅包括性别和年龄,还包括人物设定、角色、音色、惯用风格以及其他稳定的嗓音特征。细粒度内容涵盖额外局部风格描述中的信息,也可以描述局部音效 [114, 108, 35]。现有的指令式 TTS 系统已经能够控制说话人年龄、性别、情感和语速等维度 [60, 41, 8, 80, 38]。然而,它们中的大多数仍然只生成语音。对于需要环境和局部音效的场景,如果这些组成部分由下游音频管线生成,那么即使每个组成部分单独看来都合理,它们的时序、响度、混响和声学质感也可能与语音产生偏差。现有设计还常常将说话人控制简化为分解后的属性标签,而创作者可能希望用自然语言的人物描述直接映射到某个声音上。最后,现有的指令式 TTS 系统通常并非为在同一模型中保留零样本能力而设计。因此,在同一模型中同时支持长篇幅多说话人零样本生成,以及具备环境、说话人人物设定、细粒度内容和音效的高表现力指令式语音生成,仍然是一个有待解决的问题。

总体而言,该任务面临三大挑战。(1)数据稀缺。零样本TTS可以依赖公开语音语料库[100, 9, 52, 84, 73],但指令任务所需的多样化、高质量字幕数据要求更丰富的音频覆盖范围和更细致的字幕标注。收集富有表现力的语音数据以及干净的音频数据成本高昂[98, 111, 34],而标注多层级自然语言字幕同样代价不菲[95, 109, 36]。(2)任务兼容性。指令样本通过自然语言字幕描述说话人风格,而零样本样本则从参考音频中获取说话人风格。与此同时,两个任务都需要共享细粒度的内容字幕。联合训练必须在保留共享语音建模的同时,防止两条条件路径相互削弱[77, 110]。(3)多音频模态复杂性。我们的任务旨在单个波形中生成富有表现力的语音、通用音频、偶发性歌声和音乐,同时保持可懂度和说话人身份[99, 65, 61]。这些组成部分具有不同的时间结构:语音需要词汇对齐和稳定的身份特征,环境音频应保持稳定,局部音效是瞬态的,而歌声和音乐则需要保持音准[107, 62, 112]。

为了获得该粒度级别的字幕数据,我们构建了SwanData-Caption,这是一个将多样化的以语音为中心的媒体音频转换为多层级、多风格字幕的流水线。其覆盖设计阶段将内部数据与针对性的合成子集相结合,因此特殊风格(如发音具有挑战性的文本)不会被留给偶然覆盖。SwanData-Speech预处理阶段为每条字幕提供可靠的语音片段和说话人归属的文本锚点。字幕标注阶段随后标注环境、说话人和细粒度内容字段,而风格-人设库则大幅丰富了说话人风格的描述和特征。最后,为提高数据质量,数据精炼阶段使用波形过滤和字幕审核来筛选和打磨高质量、富有表现力且标注准确的数据。

在建模方面,我们提出了 SwanTale,一个多说话人表现力语音合成与音频生成模型,同时支持零样本和指令跟随任务。为了处理多音频模态生成,我们设计了 SwanVAE,其架构在提升重建质量的同时减轻了 DiT 先验的学习负担。在基于流的 Transformer 中,我们应用了奖励条件质量控制和 Engram 条件化,前者无需强化学习即可在最高质量条件下进行推理。为了同时支持两种任务并提升跨音频模态的兼容性,我们设计了带有任务路由器和音频路由器的 Unified MoE。我们还采用了课程学习,从零样本能力过渡到字幕条件生成,再到全混合训练和表现力高质量监督微调。最后,GRPO 后训练提升了发音准确性、生成稳定性以及字幕条件下的说话人属性控制。

在实验方面,我们在 SwanBench-Speech [72] 上评估了零样本独白和对话语音合成。我们还在 InstructTTSEval [41] 上评估了指令跟随能力,并在 SwanBench-Scene 上评估了声学质量。我们还构建了 SwanBench-Caption,用于包含对话语音和音频的异构指令生成评估。实验结果表明,SwanTale 在多项关键零样本和指令指标上领先,在两项任务中均取得了最佳表现力得分,并支持涉及多说话人语音和音频的复杂指令生成。

2 数据流水线:SwanData-Caption

SwanTale 基于细粒度字幕而非仅文本转录进行训练。对于复杂的多说话人语音和音频数据,基本的语音转录和说话人轮次标注是不够的;模型还需要多层级字幕标注 [53]。图 1 总结了我们的数据处理流水线。以下小节对应四个模块:覆盖设计、SwanData-Speech 预处理、字幕标注和数据精炼。当前混合数据集包含约 7000 万条字幕记录。

Refer to caption
图 1:四阶段 SwanData-Caption 数据处理流水线概览,包括覆盖设计、SwanData-Speech 预处理、字幕标注和数据精炼。

2.1 覆盖设计

媒体风格覆盖。SwanData-Caption 基于内部真实世界、以语音为中心且具有媒体风格的数据构建,涵盖语音、音效和背景音乐。图 1 展示了该覆盖设计的代表性示例,如短剧、广告和动画。覆盖范围涵盖不同的说话人密度、录音条件、角色风格、场景地点、声场条件、持续背景效果、精细的演绎变化以及局部音效。该设计支持在必须同时对语音和场景音频进行建模的场景中实现富有表现力的语音生成。

定向合成覆盖。仅依赖真实语料库会使许多稀有场景代表性不足。参照 SwanVoice [63],我们引入了三个定向合成子集。采用一个音素感知的 TTS 教师模型 [50] 来生成这些子集,以保证发音准确性,每个子集包含 10 万条话语。(1)老年人语音:由于现有语音数据集中老年人语音仍代表性不足 [12],我们扩充了有限的老年说话人数据,以提升模型在人口年龄维度上的覆盖。平均时长约为 10 秒。(2)中英文短句:这些话语涵盖从单个词、人名到标准短句,平均时长为 1.5 秒。许多真实世界的 TTS 应用需要亚秒级的口语内容,该子集增强了模型在此类条件下的稳定性。(3)高难度发音目标:这些主要是包含多音字、专有名词、品牌名、英文插入语以及中英混搭短语的中文文本。对于这些对发音敏感的示例,模型面对的文本保持不变,而教师模型的输入则加入发音提示,以确保合成波形反映预期的读法。我们使用 pypinyin [40] 处理这些数据。总体而言,人类听者对多音字和品牌名的错误高度敏感,但模型遇到的此类示例很少,且现有标注往往不准确;因此,这一针对性扩充至关重要。平均时长约为 10 秒。

2.2 SwanData-Speech 预处理

该阶段复用 SwanData-Speech 主干 [63],针对以语音为中心的片段而非纯音频片段进行处理。其作用是准备干净的语音片段和可靠的文本锚点。

分离。对于混合媒体音频,我们首先使用 Ultimate Vocal Remover [2] 分离人声和残余背景流。人声流用于更高质量的说话人日志、转写和对齐。我们保留带有环境声场和本地音效的原始音频,用于字幕生成。

说话人分离。说话人分离使用 3D-Speaker 工具包 [11] 完成,该工具包结合了 VAD、CAM++ 嵌入向量 [90] 和聚类。对于单说话人数据,我们保留 1 到 60 秒之间的片段。对于多说话人数据,我们允许片段最长 120 秒,并尽可能要求至少包含两次说话人轮换。说话人分离模型的精度有限,因此我们仅将其用于粗略的数据分段;真正的说话人区分交由后续的标注文本来完成。

对声乐流应用 Seed-ASR 2.0 [7] 进行语音识别。我们还使用 SenseVoice ASR [1] 进行额外的基于 ASR 的发音检查。具体来说,我们不信任这些 ASR 工具输出的标点符号,因为它们的标点更多依赖于语义而非实际的停顿。

对齐。SwanAligner [63] 将 ASR 转写文本与声乐流对齐,并存储停顿证据供后续后处理使用。该模块与强制对齐和词级时间戳系统 [78, 4, 39] 相关。具体来说,我们让后续的标注文本根据语义提供合适的标点符号,例如感叹号和问号,然后使用对齐器的结果进行修正,而不是让对齐器从一开始就把所有标点都转换成固定的逗号和句号。

2.3 SwanData-Caption 标注

为了给可控音频生成提供结构化监督,我们开发了 SwanData-Caption,这是一个自动标注流水线,可将原始音频和 ASR 转写文本转换为统一、细粒度的标注文本。

标注输入。我们使用 Seed2.0 Lite [6] 作为字幕标注器。标注器接收目标音频、去除标点后的转写文本以及一条标注提示词。在转写文本中,来自多个说话人的 ASR 输出可能会被拼接在一起,因此模型需要具备说话人分割、句子切分以及添加语义恰当的标点符号的能力。标注提示词为模型规定了严格的输出格式和行为要求,并为每个待标注数据集提供了量身定制的示例。我们的约束条件包括,例如:说话人 ID 必须连续,Content 中的每个说话人片段必须与 Speakers 中的条目一一对应,并且说话人标签内的 ASR 文本必须保留原始语言。

风格-人设库。我们发现,在没有足够示例的情况下,模型生成的说话人风格极为贫乏,缺乏合理的人设信息,且往往只依赖少数几个孤立的示例。因此,我们设计了一个风格-人设库,作为标注过程中的软先验。具体而言,我们为三类具有强风格先验的媒体族构建了独立的风格矩阵:动画、短剧与影视剧、以及广告/数字人内容。这些矩阵规定了场景触发条件、稳定说话人描述符的优先排序,以及稳定说话人画像与瞬时局部表达之间的边界。动画采用配音风格基线,带有角色化的声音原型;短剧与影视剧允许基于剧情支撑的角色身份和戏剧化表达;广告/数字人内容则强调人设类型、音色风格类别、音质以及稳定的产品推销式表达。该库不会引入音频中听不到的标签;相反,它引导标注器在 Speakers 字段中描述稳定的说话人特征,而将瞬时情绪或强调留给 Content 字段。精简后的风格矩阵见附录 6。对于普通数据,我们省略这些风格矩阵,以避免引入无依据的属性。

每条标题都包含表 1 中所述的三个字段。场景地点、声场印象、录音空间、混响以及持续存在的背景声音或音效归入 Environment(环境)。Speakers(说话人)仅收录实际开口说话的对象,并对其详细的说话风格进行描述。诸如情绪等细粒度的局部风格描述,连同局部音效一起写入 Content(内容)。Content 字段同时支持零样本和指令式 TTS。示例标题如下:

Environment: {一座安静氛围的古朴庭院内景;远处隐约可闻<Audio>风声与屋檐滴水声</Audio>。} Speakers: {说话人 1:年轻女性,重生女主,语气沉稳,音调低沉,语调清冷。} Content: {说话人 1 以冰冷而审视的语气说道:<S1>你欠我的,我要你亲手一口一口吐出来还给我!</S1>}。

媒体内容 · 前往原文查看
表 1:标题标注模式中使用的输出字段定义。
字段 描述
Environment(环境) 场景级环境与录音背景,包括地点或场所描述、声场印象、房间或录音空间线索、麦克风特性、混响、背景音乐、人群嘈杂声、交通声、风声、雨声、电流嗡鸣、键盘敲击声、电器噪声、远处脚步声,或其他作为场景底衬的持续背景声或音效。
Speakers(说话人) 实际开口说话对象的清单。每位说话人依据可感知的性别、年龄段、从发声方式中可听出的身份或角色、稳定的音色、吐字清晰度、响度倾向、语速、口音、惯用风格以及稳定的情感倾向来描述。
Content(内容) 一个按时间顺序排列的内容字段,包含细粒度的局部风格描述。语音由 <S1> 和 </S1> 等说话人标签包裹;局部音效由 <Audio> 和 </Audio> 包裹。细粒度的局部风格,包括情绪、音量、语速、停顿、强调、犹豫、打断、语码转换以及邻近音效语境的变化,均在带标签的片段周围进行描述。

2.4 数据精炼

波形滤波。为了按声学质量筛选语音样本,我们仅对语音数据应用以下波形级标准。候选语音片段首先使用 DNSMOS [79] 以及来自 torchaudio-SQUIM [57] 的无参考估计进行评分,其中包括与 STOI 和 PESQ 相关的分数 [101, 81]。在默认滤波配置中,如果 PESQ 低于 2.0、STOI 低于 0.85、SI-SDR 低于 0 或 MOS 低于 2.5,则移除语音样本。时长滤波器将保留的语音片段控制在 1 到 120 秒之间,保留的语音集平均时长约为 10 秒。

字幕规范化会检查说话人特征、标点符号和字幕有效性。SwanVerifier 是一个轻量级的、基于波形的属性模型,详见附录 7,它根据语音流检查性别和年龄段标签,并标记不一致的说话人描述以便移除。标点符号仅对口语内容进行规范化。我们使用 SwanAligner 的对齐数据来规范停顿标记和明显的边界标点。如果原始标点符合停顿要求,则予以保留;否则,我们将其替换或移除。这样,标注者标注的特殊标点(如感叹号和问号)得以保留,而不是将所有标点都转换为句号和逗号。字幕有效性检查会移除非法的说话人索引、不匹配的说话人片段、缺失的必填字段、未使用的说话人描述,或在去除标点后与转写文本不一致的局部文本。

人工核验。人工审核员检查转写准确性、字幕质量、音频质量和表现力。他们纠正 ASR 错误、说话人归属错误、遗漏的局部音效、不准确的环境描述,以及过度解读不可听信息的字幕。他们还检查客观指标常常遗漏的失败模式,例如人群泄漏、分离伪影,以及密集对话中的说话人混淆。此外,他们还标注音频质量问题,如背景噪声、发音不清、严重的词语省略、不自然的口音、电子伪影和可听见的编辑痕迹。

表现力通过分组内的最优–最差比较进行审计。在每个匹配分组和任务类型内,我们抽取四个有效候选样本,并要求标注者选出表现力最强和最弱的一个,评判维度包括自然度、情感强度、韵律变化和语境适配性。与 MOS 相比,该方案不要求标注者在不同说话人、内容和任务之间维持一套全局一致的绝对评分标准。标注者只需在受控分组内判断相对极端值,从而减少尺度偏差和校准噪声。与成对 A/B 测试相比,我们的最优–最差比较方法在标注效率上显著更高 [54]。

3 方法:SwanTale

本节介绍 SwanTale。我们首先描述 SwanVAE,即 48 kHz 波形-潜变量自编码器。随后介绍基于流的 Transformer,包括内容、字幕、说话人轮次、Engram 条件注入,以及奖励条件化的质量控制。接下来介绍用于零样本和指令任务的多音频模态 Unified MoE,随后是课程训练、GRPO 后训练和推理流程。

Refer to caption
图 2:SwanTale 总览。图 (a) 展示 SwanTale 的架构,图 (b) 展示 Unified MoE。在 (a) 中,零样本路径提供参考音频,而两个任务共享文本和字幕。在 (b) 中,任务路由器在样本级别选择专家,而音频路由器对帧级音频专家和空专家应用 Top- 路由。P

3.1 SwanVAE

SwanTale 在 SwanVAE 产生的连续声学潜变量上运行。设计这一潜空间需要在重建保真度、表征紧凑性以及下游流模型的可学习性之间取得三方平衡。较低的潜变量速率会缩短用于长时生成所使用的序列,但这也要求每个潜变量帧携带更多声学信息。编码精细的波形细节可以改善重建效果,但由此产生的潜变量分布可能会让流模型更难预测。SwanVAE 将 48 kHz 单声道音频表示为 25 Hz 下的 96 维潜变量。编码路径采用局部抗混叠卷积编码器和高斯 VAE 瓶颈,大部分波形合成能力被放置在改编自 SAME [74] 的解码器端 Transformer 重采样块中。SwanVAE 有意将自身限制在局部声学建模,更长距离的序列建模则由下游 DiT 处理。图 3 总结了 SwanVAE 的架构以及用于塑造其后验均值的仅训练目标。

Refer to caption
图 3:SwanVAE 概览。(a) 抗混叠卷积编码器、高斯变分瓶颈和局部 Transformer 解码器。(b) 通过流匹配和因果潜变量预测实现生成对齐。(c) 能量、多尺度色度和多频段能量读数,以及源自波形的目标。解码器接收后验样本,而对齐目标在 SwanVAE 训练阶段仅作用于后验均值,在推理时不进入下游生成器。𝐳𝝁ϕ

3.1.1 架构

编码器。编码器首先采用权重归一化的一维卷积,随后是五个下采样阶段,其比率分别为 。它们的乘积产生了 25 Hz 潜在序列所需的 1920 样本跳跃。每个阶段包含三个残差单元,膨胀因子分别为 、 和 ,随后是步幅投影。在时间抽取之前应用固定低通滤波器,以减少大步幅下的混叠 [104]。一个具有较小初始增益的可学习高频包络捷径被添加到滤波路径旁边。通道宽度从 64 增长到 1536。编码器中不使用 Transformer 层,在本文使用的确切配置中,其波形感受野约为 0.95 秒。[4,4,4,5,6]139

变分瓶颈。两个卷积头将编码器输出映射到后验均值 和对数方差 。对于输入波形 ,后验及其重参数化样本为1×1𝝁ϕlog⁡𝝈ϕ2𝐱

qϕ​(𝐳∣𝐱)=𝒩​(𝝁ϕ​(𝐱),diag⁡(𝝈ϕ2​(𝐱))),𝐳=𝝁ϕ​(𝐱)+𝝈ϕ​(𝐱)⊙ϵ,ϵ∼𝒩​(𝟎,𝐈). (1)

在 VAE 训练期间,采样后的潜在变量被传递给解码器。SwanTale 使用全局归一化的后验均值作为其确定性声学表示。𝐳𝝁ϕ

解码器。解码器使用 SAME [74] 中引入的解码器侧 Transformer 重采样块(TRB)。每个潜在向量被投影到解码器宽度,并与六个可学习输出 token 交错排列。一个局部双向 Transformer 处理组合序列,之后每个输出 token 被投影到一个 320 样本的波形补丁。与一个潜在帧关联的六个输出补丁覆盖 个样本,即 40 毫秒的音频。自注意力在投影前耦合相邻的潜在和输出 token,因此相邻波形补丁在共享上下文中重建,即使在训练和推理期间的最终波形输出中它们是无重叠拼接的。6×320=1920

这种不对称的分配反映了每条路径各自的角色。编码器决定了 SwanTale 所看到的潜在目标的时间支撑范围和统计特性,因此每个降采样阶段都保留了一个显式的低通操作,且编码上下文保持局部性。一旦潜在序列形成,解码器就可以混合相邻帧,并将更多计算能力投入到波形合成上。其局部上下文支持相位连续性、分块边界、瞬态结构以及高频细节。

感受野设计。我们刻意将 SwanVAE 的时间上下文限制在有限范围内。卷积编码器将每个潜在变量与局部波形邻域绑定,而解码器则使用局部注意力来协调相邻分块之间的波形细节。在当前配置下,编码器覆盖约 0.95 秒的波形,端到端的理论依赖跨度约为 3.23 秒。下游的 DiT 随后在整个潜在序列上运行,以建模超出该局部声学上下文、跨越完整生成序列的依赖关系。

3.1.2 重建与对抗训练

我们在从训练录音中随机采样的固定时长波形片段上训练 SwanVAE。这使得模型能够接触到长录音的不同局部区域,同时保持训练上下文与 SwanVAE 的局部角色一致。与 EnCodec [19] 中使用的动态源混合类似,我们随机混合成对的片段,并将混合结果同时用作编码器输入和重建目标。这覆盖了重叠的声学来源,同时我们也观察到在潜在插值下解码过渡更加平滑。

SwanVAE 从重参数化的后验样本中重建每个训练波形。重建损失结合了多分辨率复数 STFT 损失、多分辨率多频段 Mel 损失以及逐帧能量损失,总结为以下目标函数:𝐱𝐳

ℒrec=λstft​ℒstft+λmel​ℒmel+λeng​ℒeng. (2)

复合 STFT 损失在多个时频分辨率上比较频谱幅度和相位。多频段 Mel 损失在不同频率范围和分析窗口上提供频谱包络监督,同时在 40 毫秒潜在网格上匹配逐帧对数能量。我们通过 KL 惩罚将后验正则化到单位高斯分布,使用 。ℒengλKL=0.02

精细波形结构在这些回归损失下仍约束不足。因此我们训练了三类判别器:多周期判别器(MPD)[55]、多分辨率判别器(MRD)[46] 和多频段复合 STFT 判别器(MBCSD)[59]。MPD 对周期性波形模式敏感,而 MRD 在多个 STFT 分辨率下评估时频结构。MBCSD 作用于复合 STFT 的实部和虚部。在每个分辨率下,它将频率轴划分为固定频段,并用独立的卷积栈处理每个频段。这就在训练期间提供了覆盖高达 24 kHz 频谱的逐频段判别路径。

设 表示判别器家族。在训练过程中,我们使用以下波形目标来优化生成器:𝒟={MPD,MRD,MBCSD}

ℒwav=ℒrec+λKL​ℒKL+λadv​∑D∈𝒟wD​ℒadvD+λfm​∑D∈𝒟ℒfmD, (3)

其中 控制每个判别器家族的对抗贡献。特征匹配是根据真实音频和重建音频的中间激活计算得出的。所有判别器在训练后被丢弃,在推理时为 SwanVAE 解码增加零成本。wD

3.1.3 潜在对齐目标

波形目标约束了重建信号,但在声学信息如何排列于后验均值方面留下了相当大的自由度。在 25 Hz 的潜在速率下,精细波形细节可能由相邻帧之间的剧烈变化承载,从而增加了下游流模型的负担。关于图像和视频自编码器的相关工作也发现,过高的高频潜在分量会使扩散建模更加困难 [85]。因此,SwanVAE 在训练期间对后验均值施加了几个弱对齐目标作为辅助引导。𝝁ϕ

生成式对齐。遵循 SAME [74] 的做法,我们在潜在序列上联合训练一个轻量级无条件预测器,使用标准的流匹配目标函数。该预测器以其完整训练损失进行优化,而从该目标传递回编码器的梯度则被单独缩放并保持较小。这提供了一个直接信号,表明当前潜在分布能被流网络建模的难易程度,同时不会让辅助预测器主导波形重建。

我们还训练了一个因果预测器,用于根据前文上下文估计未来的潜在块。未来预测在语音表示学习中已有充分研究 [69, 16],潜在域预测编码也已被用于去除神经语音编解码器中的时间冗余 [48]。在 SwanVAE 中,预测器直接作用于连续的均值后验块,并且只向编码器提供较弱的目标侧梯度。因此,预测残差衡量的是局部潜在演化中无法从近期历史推断出来的部分。与固定的时间差分惩罚相比,学习得到的预测器能够适应局部可预测的变化,同时抑制突兀且结构较弱的变异。我们保持面向编码器的梯度较小,以便在整个 SwanVAE 联合训练过程中,全局潜在几何结构主要由重建和 KL 正则化主导。

语义与声学读出。遵循 SAME [74] 中的语义回归目标,轻量级回归器从每个潜在帧预测八度特定的多尺度色度分布。这里,语义对齐指的是局部音频上下文中具有感知意义的结构,包括以潜在帧尺度表示的音高类别与和声组织。

另外两个辅助读取头分别预测归一化帧能量以及各频带间的相对能量分布。为了增加有效带宽的变化,我们偶尔会将 48 kHz 的训练片段降采样到较低的采样率,再重新采样回 48 kHz。这样既保持了波形接口不变,又让编码器接触到具有不同可用频谱范围的信号。多频带能量读取头促使潜在表示保留这些差异。例如,由 24 kHz 音频派生出的 48 kHz 录音,其 12 kHz 以上的能量通常很少。由于频带能量目标在各频带间做了归一化,它描述的是频谱分配情况,与整体响度无关。

重建解码器继续接收重参数化后的样本,而对齐目标则作用于后验均值上。训练完成后,SwanTale 使用全局归一化的后验均值作为其确定性的声学目标。所有辅助预测器和读取头均被丢弃。𝐳𝝁ϕ

3.2 基于流的 Transformer

继 SwanVoice [63] 之后,SwanTale 训练了一个以流匹配为骨干的非因果扩散 Transformer,以避免自回归系统中常见的重复和其他不稳定性,同时保留局部音频效果和环境声景的完整性。具体来说,SwanTale 将两个任务的输入映射到一条潜在音频轨迹上,如图 2(a) 所示。对于这两个任务,零样本样本使用内容提示词来控制局部风格,并使用参考音频来控制全局声学信息;而指令样本则使用完整提示词来控制所有信息。去噪器是非因果的,因为这些控制会跨越整个音频序列进行交互。为实现这一接口,SwanTale 结合了用于语义对齐的提示词、文本和说话人条件,用于全局声学偏好的奖励条件质量控制,用于重复提示词模式的 Engram 条件,以及用于条件生成的流匹配 DiT 骨干网络。

通用指令生成系统通常使用共享的 tokenizer 对字幕和文本进行编码,并依赖 LM 主干网络(通常继承自具有强大语言理解能力的预训练 LLM [97])来实现指令理解与生成 [105, 77]。由于 SwanTale 采用 DiT 主干网络,我们需要在不过度增加模型负担的前提下,保留词汇准确性并增强字幕理解能力。因此,条件堆栈将字幕级控制与文本对齐分离开来。

字幕分支使用 Qwen 系列文本编码器 [3] 来理解字幕并将其编码为嵌入向量,这些嵌入向量通过交叉注意力注入到所有 DiT 层中。此外,我们还添加了一组与字幕嵌入长度对齐的标签嵌入。不同的嵌入用于区分语音内容、局部音效描述、环境信息和其他描述,从而提供声学先验信息并降低交叉注意力的学习负担。

语音内容使用 CosyVoice 2.0 tokenizer [21] 进行分词,生成的 token 由轻量级 Transformer 文本编码器处理。与 SwanVoice [63] 中采用的填充 token 扩展不同,SwanTale 通过将文本编码器隐藏状态插值到音频潜变量时间轴上,再与加噪潜变量流拼接,从而对该分支进行长度归一化。这使得即使边界文本长于潜变量序列,也能正常进行训练和生成。说话人轮次嵌入从结构化说话人标签中派生,与文本嵌入对齐,并注入到文本路径中。

奖励条件化的质量控制。在预处理阶段,SwanData-Caption 为第 2 节中描述的 STOI、PESQ、SI-SDR 和 MOS 相关指标标注质量分数。数据管线会过滤掉极低质量的样本,但剩余数据仍然跨越不同的质量等级,而我们希望生成的语音尽可能高质量。因此,我们添加了显式的质量描述(quality caption)和质量标志(quality flag),使模型能够识别数据质量并将其用作可控信号。当四个分数都可用时,SwanTale 会将它们转换为简短的质量描述,并在内容字段之前将其附加到全局描述中。具体来说,实现的质量描述模板为:Quality: speech clarity {STOI level}; noise level {SI-SDR level}; signal naturalness {PESQ level}; listening quality {MOS level}。

质量分数也被映射到质量标志中。在训练期间,该标志可以在 dropout 下被未知值替换,以支持无分类器引导;在推理期间,我们使用高质量描述和标志,将生成偏向更清晰、更自然的语音。q∈{low,normal,high,unknown}

这使得 SwanTale 成为一个奖励条件化的策略 [58]。四个波形质量分数作为奖励的一部分被提供,而不是作为优化目标,因此模型学习每种质量水平在声学上是如何实现的;在推理时,奖励被固定为最大值,生成始终以最高质量被请求。与显式优化质量奖励相比,这种方法不需要 rollout、不需要循环中的奖励模型,也不需要额外的采样。它还使每个保留的样本都对训练有用:中等质量的数据仍然有助于覆盖说话人、场景和音效,其质量等级被标记而不是被丢弃,从而在整个数据混合中保留其贡献。

印记条件化。在真实字幕中,许多模式会在不同样本间反复出现,且具有稳定而独特的含义,例如“一个充满活力的女孩”这样的人设描述,或“火车汽笛声”这类常见音效。纯注意力机制可以学习这些模式,但它还必须处理长距离的声学规划。为了减轻这一负担,并让固定字幕模式即使在长字幕中也能被识别,SwanTale 在字幕分支中加入了印记记忆层 [14]。印记机制将固定模式识别与更广泛的声学规划分离开来,而无需引入另一个完整的语言编码器。具体来说,字幕编码器输出经过投影后,还会由印记机制处理,并作为记忆更新加回去。由此得到的字幕表示随后被用作交叉注意力上下文。

对于字幕 token 序列和阶数集合,以位置 为中心的 -gram 窗口为:原始公式使用后缀窗口,因为自回归主干无法看到其右侧上下文;而这里的字幕分支是非因果的,因此我们改用居中窗口。记忆机制将每个窗口哈希到各头专属的表中,并拼接所有检索到的槽位:𝐜=(c1,…,cL)𝒩niwi(n)=ci−⌊(n−1)/2⌋:i+⌊n/2⌋.K

𝐞i=concat⁡({Engramn,k⁡(hashk⁡(wi(n)))}n∈𝒩,k=1,…,K). (4)

我们设置 。在读出前进行拼接,可以让一对投影在阶数之间进行权衡,而不是强制每个阶数都均等贡献。给定投影后的字幕嵌入 ,SwanTale 通过门控残差更新来注入该记忆:𝒩={2,3}𝐮i

𝐮~i=𝐮i+σ​(RMSNorm(𝐮i)⊤RMSNorm(WK𝐞i)d+b)​WV​𝐞i. (5)

这里, 是模型维度。门控由两个分支实例化,它们共享表 和 ,但各自保留独立的 ,其门控输出取平均。可学习的偏置初始化为负值,因此记忆路径在训练开始时几乎处于关闭状态,并在训练过程中逐渐打开。点积使门控在每个字幕内部具有内容依赖性,从而使模型能对结构化标记更强地使用印记机制,而对自由形式的自然语言则较弱地使用。通过这种方式,记忆成为字幕条件化堆栈的一部分,并增强了模型对固定模式短语的理解。dWVWKb

流匹配 DiT 主干。SwanTale 基于非因果流匹配 DiT 架构 [63] 构建,并增加了三项改进:Engram 增强的标题交叉注意力、奖励条件化的质量控制,以及统一 MoE 前馈层。每个模块都包含对潜在时间线的自注意力、对 Engram 增强标题 token 的交叉注意力,以及一个统一 MoE 前馈分支。时间步嵌入通过 AdaLN-Zero 适配器 [75] 调制模块,并使用 RMSNorm 来保证深层 Transformer 优化的稳定性 [102]。质量标志嵌入与时间步嵌入被添加到同一个全局条件流中。

SwanTale 使用一个主干网络来同时进行指令训练和零样本训练。设 表示任务类型,设 表示由冻结的 SwanVAE 生成的目标潜在序列。这两个任务仅在各自的标题输入和上下文掩码上有所不同:τ∈{inst,zero}𝐱⋆∈ℝT×dz

𝐜(τ)={𝐜full,τ=inst,𝐜content,τ=zero,𝐦(τ)={𝟎,τ=inst,𝐦prompt,τ=zero,𝐫(τ)=𝐦(τ)⊙𝐱⋆. (6)

这里 是一个上下文掩码:指令样本没有提示上下文,因此将整个潜在序列作为生成目标,而零样本样本则使用提示帧作为参考上下文,仅生成剩余帧。遵循近期非自回归语音生成系统 [64, 13] 的做法,我们采样高斯噪声和时间 ,然后仅对任务特定的生成区域添加噪声:𝐦(τ)ϵ∼𝒩​(𝟎,𝐈)t∼𝒰​(0,1)

𝐱~t(τ)=(1−𝐦(τ))⊙((1−t)​ϵ+t​𝐱⋆). (7)

DiT 接收 、上下文潜在变量 ,以及一个学习得到的上下文掩码嵌入,该嵌入用于区分生成帧与参考帧。它预测一个速度场,该速度场以内容 token 、标题 、说话者轮次和任务特定的参考上下文为条件:𝐱~t(τ)𝐫(τ)𝐲𝐜(τ)

𝐯^θ=fθ​(𝐱~t(τ),t,𝐲,𝐜(τ),𝐫(τ),𝐦(τ)). (8)

训练损失是任务特定生成区域上的掩码均方误差:

ℒflow=𝔼​[‖(1−𝐦(τ))⊙(𝐯^θ−(𝐱⋆−ϵ))‖22max⁡(1,∑i=1T(1−𝐦i(τ)))]. (9)

在此公式下,指令样本在整个潜在轨迹上提供完整标题监督,而零样本样本提供内容标题监督,参考音频被排除在损失之外但作为上下文可用。因此,相同的速度参数化和目标函数训练出一个统一的主干网络,同时支持指令跟随生成和提示条件化的零样本生成。

3.3 统一 MoE

SwanTale 在单一网络内同时处理指令式任务和零样本任务,覆盖多说话人表现性语音、通用音频、偶发歌声以及音乐。语音区域必须在建模说话人相关表现力的同时,保留内容、韵律和说话人连续性。通用音频涵盖两种形态:环境声形成平滑且持续的结构,而局部音效则是瞬态的,需要高度局部的声学塑形。歌声增加了持续的基频轮廓,音乐则承载旋律与和声的规律性,但不含词汇内容。用同一套密集前馈参数处理所有这些信号,会迫使这些异质声学模式竞争同一组共享权重。

因此,我们在基于流的 Transformer 中引入了 Unified MoE——一个由标题条件控制的动态容量稀疏前馈模块,如图 2(b) 所示。它根据生成任务、当前声学状态和扩散时间动态分配模型容量,为复杂区域提供专门变换,同时控制整体计算量。Unified MoE 建立在稀疏专家 Transformer [26, 119]、DeepSeek 式专家专业化 [18] 以及无辅助损失路由偏置 [91] 的基础之上。其路由机制在两个层级上运行。任务路由器选择样本级共享专家,为指令式和零样本生成捕获稳定的先验;音频路由器则对每个潜帧隐藏状态应用动态 Top- 路由,以建模帧级声学变化。音频路由器接收到的隐藏状态已经经过自注意力和标题交叉注意力,因此已包含来自标题、文本流、说话人轮次和参考音频的信息。P

专家布局。每第二个 DiT 前馈层被替换为动态 Top- MoE-FFN 层。稀疏层之间保留的密集层提供了稳定的共享路径,而插入的 MoE 层则为异质声学模式增加了容量。每个 MoE-FFN 在每个稀疏层中都包含路由音频专家、任务共享专家和空专家。PRSU

这三类专家在不同粒度层级上运作。任务共享专家编码的是在整个样本中保持稳定的先验信息:指令生成更强调对提示词的遵循以及多个音频事件的组合,而零样本生成则更依赖提示词与说话人的保持。路由音频专家为说话人变化、重叠语音、表现力变化、局部音效和复杂背景纹理提供基于输入的帧级专业化处理。空专家则充当跳跃路径,不进行额外的前馈变换,从而减少对稳定背景、接近静音区域以及其他无需帧级专业化处理的帧的计算量。

设 表示任务类型。任务路由器选择一组共享专家,该组专家在每个样本的所有稀疏层和帧中复用。共享分支定义为τ∈{inst,zero}𝒯τ

𝐨shared​(𝐡,τ)=∑j∈𝒯τEjshared​(𝐡). (10)

该任务路由分支注入样本级任务先验,而音频路由分支则旨在对潜在序列上的帧级声学变化进行建模。

潜在与时间条件音频路由。在扩散时间 下,设 表示第 个 DiT 块中帧 在自注意力和提示词交叉注意力之后的隐藏状态。DiT 时间嵌入经线性投影后加到对应的帧表示上:t𝐡ℓ,mmℓ𝐞t

𝐫ℓ,m=𝐡ℓ,m+Wt​𝐞t. (11)

音频路由器根据 计算基础路由器 logits:𝐫ℓ,m

ℓℓ,m=Wg​𝐫ℓ,m+𝐛null​(t), (12)

其中 将帧表示投影到路由音频专家和空专家的候选空间中。随后我们按如下方式计算专家选择 logits:Wg

𝐚ℓ,m=ℓℓ,m+𝐛, (13)

其中 是路由专家的负载校正偏置,在空专家维度上为零。专家集合由 确定,而所选集合内的组合权重则根据 [91] 计算。𝐛𝐚ℓ,mℓℓ,m

对于路由专家 ,设 表示其在路由专家中近期非空分配的占比,目标平均负载为 。我们采用如下连续且裁剪的偏置更新:ifi1/R

bi←clip⁡(bi+η​(1R−fi),−B,B). (14)

过载专家的选择分数会被降低,而利用不足的专家则会获得更高的分数。如果某一层没有产生任何非空分配,其路由偏置保持不变。

时间感知的专家预算。所需的专家计算量会随扩散时间而变化。不同的去噪阶段对全局结构、说话人与事件排布、音色以及局部声学细节的侧重程度各不相同。我们从时间嵌入中预测一个学习得到的时间相关预算:

q​(t)=σ​(Wb​𝐞t). (15)

该预算共同控制 Top- 阈值、空专家偏置以及专家容量:P

p​(t) =pmin+(pmax−pmin)​q​(t), (16)
bnull​(t) =bmaxnull+(bminnull−bmaxnull)​q​(t), (17)
c​(t) =cmin+(cmax−cmin)​q​(t). (18)

该向量在空专家维度上取值,在路由专家维度上为零。较大的 会产生更高的累积概率阈值、更弱的空路由偏好以及更大的专家容量。较小的 则减少额外的专家变换,并在同一去噪阶段将更多计算转移到任务共享路径和空路径上。𝐛null​(t)bnull​(t)q​(t)q​(t)

带退火 Gumbel 混合的动态 Top- 路由。不同帧所需的专家数量差异很大。稳定的背景和接近静音的区域通常只需要很少的额外变换,而说话人切换、环境声场以及叠加的全局音频事件则可能受益于多个专家。固定 Top- 路由为每一帧分配相同数量的专家,无法适应这种变化。因此,统一 MoE 采用动态 Top- 路由。PKP

在训练期间,我们首先为所有路由音频专家和空专家采样 Gumbel 噪声:

gℓ,m,i=−log⁡(−log⁡uℓ,m,i),uℓ,m,i∼𝒰​(0,1). (19)

随后根据偏置调整后的选择 logits 计算 Gumbel-Softmax 选择分布:

πℓ,m,ig,sel=exp⁡(aℓ,m,i+gℓ,m,iτg​(n))∑j=1R+Uexp⁡(aℓ,m,j+gℓ,m,jτg​(n)). (20)

对于每一帧,候选专家按 的降序排列,累积概率达到 的最小前缀被选为 。𝝅ℓ,mg,selp​(t)𝒮ℓ,m

Gumbel 温度在优化步骤 上逐步退火:τg​(n)n

τg​(n)↘τmin>0. (21)

遵循 Gumbel-Softmax 退火策略 [45],训练初期较高的温度会产生更平滑的路由分布,并鼓励在更多专家组合上进行探索。随着温度逐渐降低,分布变得更加尖锐,专家逐渐形成明确分工,从而避免在优化早期过早集中于单一专家。

使用相同的 Gumbel 扰动,混合权重由基础路由器 logits 计算得出,并在选定的专家集合上重新归一化:

π~ℓ,m,i=exp⁡(ℓℓ,m,i+gℓ,m,iτg​(n))∑j∈𝒮ℓ,mexp⁡(ℓℓ,m,j+gℓ,m,jτg​(n)),i∈𝒮ℓ,m. (22)

在推理时,移除 Gumbel 噪声。确定性选择分布为

𝝅ℓ,msel=softmax⁡(𝐚ℓ,m). (23)

候选专家根据 排序,选择累积概率达到 的最小前缀作为 。对应的混合权重为𝝅ℓ,mselp​(t)𝒮ℓ,m

π¯ℓ,m,i=exp⁡(ℓℓ,m,i)∑j∈𝒮ℓ,mexp⁡(ℓℓ,m,j),i∈𝒮ℓ,m. (24)

我们在训练时使用 ,在推理时使用 ,下文统一用 表示两者。令π~ℓ,m,iπ¯ℓ,m,iπ^ℓ,m,i

𝒮ℓ,mr=𝒮ℓ,m∩{1,…,R} (25)

表示选定的路由音频专家。音频分支的输出为

𝐨audio​(𝐡ℓ,m,t)=∑i∈𝒮ℓ,mrπ^ℓ,m,i​Eiaudio​(𝐡ℓ,m). (26)

当 时,路由音频分支产生零输出:𝒮ℓ,mr=∅

𝐨audio​(𝐡ℓ,m,t)=𝟎. (27)

空专家参与选定专家上的归一化,但不产生前馈输出。当空专家与路由音频专家同时被选中时,分配给空专家的概率质量会降低音频分支变换的幅度。如果只选中空专家,则该帧跳过路由音频分支,同时保留任务共享分支和 DiT 块的原始残差路径。

最终的 MoE-FFN 输出将共享分支与路由音频分支按如下方式组合:

𝐨MoE​(𝐡ℓ,m,t,τ)=𝐨shared​(𝐡ℓ,m,τ)+𝐨audio​(𝐡ℓ,m,t), (28)

该输出通过 DiT 块的原始残差连接与输入相结合。

容量与辅助目标。专家容量限制了每个路由专家在一个批次内接收的分配数量。如果没有容量控制,大量帧可能集中到单个专家上,从而增加峰值内存使用并削弱功能专业化。

令 表示在容量截断之前由 Top- 路由产生的非空帧-专家分配总数。每个路由专家的容量为MP

cap=⌈c​(t)​MR⌉. (29)

如果某个专家接收的分配数量超过其容量,则仅保留混合权重最大的分配,其余分配作为溢出被丢弃。如果当前层中的所有帧都只选择空专家,则 ,路由专家调度和容量截断被跳过。此外,训练期间还会应用专家丢弃,以减少对固定专家组合的依赖。M=0

同时,我们使用轻量级辅助目标来处理路由器 logits 不稳定和空路由坍缩问题:

ℒMoE=λz​ℒz+λnull​ℒnull. (30)

在训练过程中,路由器的 z-loss 直接应用于基础路由器 logits:

ℒz=𝔼ℓ,m​[(log​∑jexp⁡(ℓℓ,m,j))2], (31)

这会约束路由器 logits 的幅度并提升数值稳定性 [119]。空专家惩罚(null-collapse penalty)是基础路由分布分配给空专家的平均概率质量,用于防止路由音频分支在整个训练过程中保持不活跃状态。ℒnull

SwanTale 的完整训练目标定义如下:

ℒ=ℒflow+ωMoE​(n)​ℒMoE, (32)

其中 在训练早期被线性退火至一个较小的非零下限。更强的初始辅助信号在训练早期稳定路由,而后续的专门化则由流匹配目标驱动。ωMoE​(n)

总体而言,Unified MoE 结合了任务级共享路径、帧级动态专家路由,以及感知扩散时间的计算预算,从而在统一模型内为异构语音和场景音频提供自适应容量,而无需对每个声学区域施加相同的固定计算量。

3.4 课程学习

在训练 SwanTale 基础模型时,我们使用 SwanVoice 作为零样本基础阶段的参考设计。模型首先从单说话人和多说话人零样本数据中学习说话人条件语音生成,然后适配到字幕条件的指令生成。这一顺序很重要,因为字幕条件引入了更长的上下文、文本描述的说话人属性、环境描述和局部音频效果。在语音先验足够稳定之前引入所有这些条件,会使对齐和条件建模都变得更加困难 [5]。

1) 零样本基座模型训练。在第一阶段,我们在 SwanVAE 潜空间中训练一个零样本基座模型。训练方案遵循 SwanVoice 预训练设置,面向单说话人和多说话人语音,仅使用转录文本和可选的参考音频作为条件。这保留了零样本推理所需的参考音频通路,同时又不让生成完全依赖于参考信号。我们首先在内部单说话人零样本数据上进行训练。随后引入包含一至四位说话人的拼接语音,以及真实的一至四位说话人对话数据,并启用说话人轮次编码,以发展多说话人对话生成能力。在整个阶段中,参考音频以 50% 的概率被丢弃,使模型同时接触有参考条件和无参考条件的生成。

2) 基于干净语音的密集描述适配。接下来,我们在带有丰富且可靠属性标注的干净语音数据上训练一个密集 SwanTale 模型。在此阶段,统一 MoE 层被替换为标准密集前馈层。目标是先教会模型理解简单指令(如性别、年龄和情绪),然后再引入稀疏路由。具有一致说话人级和话语级属性的干净双语语音,使模型能够从转录文本条件过渡到描述条件,同时保持可懂度、说话人身份和对齐质量。我们还加入了第 2 节中描述的目标合成子集,在完整描述混合数据训练之前,提升对老年说话人、短话语和发音困难条件的覆盖。在此阶段,每个样本以 70% 的概率作为指令任务训练,以 30% 的概率作为零样本任务训练。

3) 完整字幕混合训练。在稠密模型已习得稳定的字幕条件语音生成能力后,我们将训练数据扩展至第 2 节所述的全量 SwanData-Caption 语料库,并在基于流的 Transformer 架构中引入 Unified MoE。此阶段让模型接触语音、环境音频、局部音效以及更广泛的说话人角色类型。稠密参数初始化共享变换路径,而路由专家则学习针对说话人变化、环境以及全量数据混合中全局与局部音效的专门变换。

4) 高表现力、高质量 SFT。全量字幕混合提供了广泛的覆盖范围,但大规模混合数据集中也包含许多质量中等或表现力有限的样本。因此,我们继续在数据精炼阶段筛选出的高表现力、高质量子集上进行监督微调。该子集中的样本必须同时满足自动波形质量阈值以及第 2 节所述的基于分组最优–最差比较的人工偏好审核。由此得到的更窄数据分布,在奖励引导的后训练之前进一步提升了表现力生成能力。

3.5 奖励引导的 GRPO 后训练

监督阶段赋予了 SwanTale 广泛的指令遵循和零样本能力,但在发音准确性、生成稳定性以及字幕条件说话人属性控制方面仍存在反复出现的错误。因此,我们针对这三个目标应用奖励引导的后训练。后训练集包含广告、影视和动画制作中遇到的困难单说话人语音案例,并同时覆盖指令遵循和零样本条件。多说话人和含音频样本则通过监督锚点回放予以保留,而非在针对性后训练期间分配不可靠的奖励。

任务特定的奖励设计。我们采用组相对策略优化(GRPO)[82]。奖励难度随目标文本和条件的不同而差异显著,因此来自不同提示词的绝对分数无法直接比较。GRPO 改为在同一条件下采样多个候选样本,并在无需额外价值模型的情况下优化它们的相对质量。

两个任务共享五项语音侧奖励。音素准确率奖励(phone_core)对识别出的声调音素序列中的替换、删除和插入错误进行惩罚,而音素时长一致性奖励(phone_len)则专门针对删除和插入错误:

rphone=exp⁡[−α​ws​S+wd​D+wi​IN],rlen=exp⁡[−αlen​wd​D+wi​IN], (33)

其中 、 和 分别是替换、删除和插入的数量, 为音素长度。标点感知停顿奖励(pause_punct)检查短标点和长标点之后是否在其预期时长范围内出现停顿。音频边界能量奖励(edge_rMS)对整段波形中前 0.2 秒和后 0.2 秒内过高的 RMS 能量进行惩罚。波形质量奖励(quality)对削波、异常峰值、过高的边界能量以及高频伪影进行惩罚。SDIN

最终的控制奖励取决于任务类型。对于指令任务,SwanVerifier 从生成的语音中预测年龄和性别,属性奖励衡量其与完整字幕中相应属性的一致性(附录 7)。对于零样本生成,说话人身份由参考音频而非人口统计文本提供;因此我们将属性奖励替换为说话人相似度,

rsim=1+cos⁡(fspk​(x^),fspk​(xref))2, (34)

其中 是一个基于冻结 WavLM 的 ECAPA-TDNN 说话人编码器 [10, 20]。所有奖励项在聚合前均校准至 。设 表示任务类型,并选择适用于任务 的奖励项。候选样本 的总奖励计算如下:fspk[0,1]τ∈{inst,zero}Mτ,mτi

Ri(τ)=gi​∑mMτ,m​λm​ri,m∑mMτ,m​λm, (35)

其中 是一个乘法发音门控,用于降低存在严重发音错误的样本的权重。因此,指令任务和零样本任务共享相同的发音和稳定性奖励,仅在统一的聚合规则下切换说话人控制奖励。gi∈(0,1]

随机流策略。原始采样器遵循确定性 ODE,一旦初始噪声固定,其转移分布即为退化分布。参照 Flow-GRPO 及其 TTS 适配 [89],我们构造了一个保持边际分布的 SDEd​𝐱t=𝐯θ​(𝐱t,t,c)​d​t

d​𝐱t=𝐛θ​(𝐱t,t,c)​d​t+η​(t)​d​𝐖t,𝐛θ=𝐯θ+η​(t)22​𝐬θ, (36)

其中 为维纳过程。在我们的噪声到数据约定下,整流流分数估计与扩散调度定义如下:𝐖t𝐱t=(1−t)​𝐱0+t​𝐱1

𝐬θ​(𝐱t,t,c)=t​𝐯θ​(𝐱t,t,c)−𝐱t1−t,η​(t)=a​1−tt, (37)

两个端点被截断到最近的内部积分时刻以保证数值稳定性。对于连续时刻 ,Euler–Maruyama 给出高斯转移策略tj<tj+1

πθ​(𝐱j+1∣𝐱j,c)=𝒩​(𝝁θ,j,η​(tj)2​Δ​tj​𝐈),𝝁θ,j=𝐱j+𝐛θ​(𝐱j,tj,c)​Δ​tj, (38)

其中 。噪声与转移似然仅应用于生成的潜变量区域 ;参考帧在整个 rollout 过程中保持固定,以实现零样本生成。Δ​tj=tj+1−tj𝒢

组相对策略优化。对于条件 ,我们使用冻结的行为策略快照,以独立的 SDE 噪声实现采样轨迹,在相同条件输入下生成候选组。随后,我们对每条轨迹生成的最终波形进行评分,并在组内对所得奖励进行归一化,得到组相对优势:cK=8

Ai=Ri(τ)−μR​(c)σR​(c)+ϵ. (39)

在 rollout 期间,我们存储每个生成区域的转移及其行为策略对数概率 。当前策略使用相同的 SDE 核重新计算 。高斯对数概率在 中的有效潜变量元素上取平均而非求和。求和式对数似然会随生成元素数量缩放,因此每个元素的微小差异就足以使 移动十个数量级并使裁剪范围饱和;而逐元素均值使 保持在 1 附近,使单个 在不同话语长度之间具有可比性。采用 时,裁剪目标为ℓold,i,jℓθ,i,j=log⁡πθ​(𝐱i,j+1∣𝐱i,j,c)𝒢10−3ρi,jρi,jερi,j=exp⁡(ℓθ,i,j−ℓold,i,j)

ℒGRPO=−𝔼i,j​[min⁡(ρi,j​A~i,clip⁡(ρi,j,1−ε,1+ε)​A~i)]. (40)

我们直接使用 与 ,并将其共享给轨迹 中的所有转移。 在相同的已记录转移上比较两个策略,而非在裁剪策略更新期间基于重新加噪的样本构建去噪替代物进行比较。A~i=clip⁡(Ai,−Amax,Amax)Amax=2iρi,j

能力保持。针对单一说话人的后训练不应抹除在全混合 SFT 阶段学习到的多说话人及音频能力。我们采用两道防护措施。首先,一个冻结的 SFT 参考策略约束每一次 GRPO 转移。由于当前策略与参考策略共享相同的转移方差,它们的 KL 散度具有如下闭式形式:

𝒟KL​(πθ∥πref)=‖𝝁θ,j−𝝁ref,j‖𝒢22​η​(tj)2​Δ​tj. (41)

此处,对 中有效的潜在元素取平均,与转移对数概率的归一化方式相匹配,从而使 能够跨话语长度迁移。其次,每个 GRPO 更新块之后都跟随从原始多说话人及含音频 SFT 混合数据中抽取的监督锚定步骤。这些锚定批次使用标准的前向加噪路径和原始掩码流匹配目标,而非 SDE rollout。行为策略仅在两个更新块都完成之后、下一轮 rollout 之前进行刷新。这两个块分别最小化以下目标:∥⋅∥𝒢2𝒢βref

ℒRL=ℒGRPO+βref​𝔼i,j​[𝒟KL​(πθ∥πref)],ℒanchor=ℒflow​(𝒟anchor). (42)

参考项限制了奖励样本上的策略漂移,而锚定重放则保留了奖励模型覆盖范围之外的能力,包括说话人切换、环境、音乐和本地音频效果。

3.6 推理流程

SwanTale 对指令生成和零样本生成采用统一的推理流程。对于指令生成,模型接收完整描述文本,并生成完整的潜在序列。对于零样本生成,模型接收包含内容文本和参考音频的内容描述;参考帧构成潜在提示,模型生成未掩码区域。在两种情况下,文本和描述均由上述条件模块编码,说话人轮次标签由 <S{id}> 标签构建。生成区域以高斯噪声初始化,而零样本设置中的提示帧保持固定作为参考上下文。随后 SwanTale 在任务特定的生成区域上求解流 ODE,并用 SwanVAE 对得到的潜在轨迹进行解码。

内容条件和说话人轮次条件决定了每一轮说什么以及由哪位说话人发声,而字幕、参考音频和质量条件则控制其余声学属性。单一的引导尺度会将这两组约束耦合在一起,因此我们采用两阶段分解式无分类器引导(CFG)规则[37]。去噪器在空条件、文本与说话人轮次条件、以及任务特定的完整条件三种情况下分别进行评估。引导速度为

𝐯~t=𝐯∅+ωtext​(t)​(𝐯text−𝐯∅)+ωall​(t)​(𝐯full−𝐯text), (43)

其中 引导内容与说话人轮次的一致性, 则加入任务特定的完整条件。对于指令生成任务,完整条件包含完整字幕和质量标志;对于零样本生成任务,完整条件在整条条件化推理轨迹中始终包含内容字幕和参考上下文。ωtext​(t)ωall​(t)

条件强度和数值分辨率在流轨迹上不必保持均匀。早期步骤从噪声中建立粗略的语音结构和文本—说话人对齐,而后期步骤则细化局部声学细节。因此,我们通过设置 来应用随时间步变化的引导退火,其中 , 为对应的基础引导权重。这样在早期施加更强的条件引导,在接近数据端点处施加较弱的引导。另外,摇摆采样[13]将均匀积分网格扭曲为 ,将更多欧拉步数分配到轨迹早期部分。ωk​(t)=γ​(t)​ω¯kk∈{text,all}γ​(t)=a+b​(1−t)pω¯kut​(u)=1−cos⁡(π​u/2)

4 实验

4.1 实现细节

我们在 32 块 A100 GPU 上训练 SwanVAE,使用了约 10 万小时的内部音频数据,涵盖语音、歌唱声、通用音频和音乐。训练采用固定的 3.84 秒波形片段,从较长的录音中随机裁剪,对于较短的录音则根据需要重复使用。对 25% 的裁剪片段应用波形混合。对 1% 的裁剪片段应用有效带宽增强,方法是将它们降采样到 8 至 44.1 kHz 的若干标准采样率之一,再重新采样回 48 kHz。该模型将 48 kHz 单声道波形转换为 25 Hz 下的 96 维连续潜变量。在训练 SwanTale 之前,SwanVAE 被冻结。全局归一化的后验均值被用作声学训练目标,而生成的潜变量则被反归一化并传递给冻结的解码器进行波形合成。SwanVAE 包含 4.07 亿个参数,其中编码器有 5170 万,变分瓶颈层有 30 万,解码器有 3.55 亿;仅用于训练的判别器和辅助头不计入这些数字。所有 SwanTale 实验均使用最终 96 维模型的 20 万步检查点。α∼𝒰​(0.3,0.7)𝝁ϕ

所有有监督的 SwanTale 阶段均在 64 块 A100 GPU 上训练。第一阶段训练一个 2B 激活参数的零样本基础模型,遵循 SwanVoice 风格的预训练方式,使用 2300 万小时的单说话人数据和 170 万小时的双说话人数据。随后,我们在 7000 万个干净、属性丰富的语音样本上进行密集描述适配,训练 2 万步。在此阶段,我们采用 Qwen3.0-Instruct-8B [97] 作为描述编码器。接下来,我们在 1000 万个 SwanData-Caption 样本上训练 Unified MoE 全混合模型,训练 1 万步。在描述混合训练期间,参考音频以 70% 的概率被丢弃,因此训练过程中同时观察到无参考指令生成和参考条件零样本生成。最终的监督微调阶段使用一个包含 100 万样本的高表现力、高质量子集,训练 4000 步。我们使用 AdamW [66],其中 ,。峰值学习率为 ,最小学习率为 。GRPO 后训练使用 8 块 GPU,训练 10 个 epoch。β1=0.9β2=0.9997.5×10−54.0×10−5

在推理阶段,我们采用第 3 节中描述的两阶段分解 CFG 规则,分别对文本/说话人分支和全条件分支使用引导权重。我们还在第 3 节中使用了依赖于时间步长的引导退火方法,并在所有报告的实验中均采用了该设置。[1.5,3.0](a,b,p)=(0.6,0.6,1.0)

4.2 评估指标

SwanVAE。我们在四个音频领域评估重建效果:语音、歌声、通用音频和音乐。每个领域包含 1,000 个片段,分别取自 VCTK [96](语音)、GTSinger [109](歌声)、FSD50K [28](通用音频)以及 MUSDB18-HQ 测试集 [86](音乐)。总计 4,000 个评估片段。对于 GTSinger,我们在中文和英文子集上分别计算各项指标,并以等权重对两个分数取平均。我们排除了与训练数据重叠的任何片段。语音和歌声共享声学和语音结构,因此我们对这两个领域使用相同的指标集:PESQ [81]、STOI [87]、梅尔倒谱失真(MCD)[56] 和 ViSQOL [15]。对于通用音频和音乐,我们报告 ViSQOL 和对数谱距离(LSD)[33]。

零样本任务。SwanBench-Speech [72] 提供了与参考音频配对的独白和对话测试用例。音色一致性计算为从滑动窗口中提取的 WavLM-TDCNN 说话人嵌入 [10] 之间的平均成对余弦相似度;对于对话,我们分别计算每个说话人的得分,并对各说话人得分取平均。混响一致性定义为窗口级 SRMR 分数 [25] 的标准差。声音保真度使用无参考的 SQUIM-PESQ 指标 [57] 进行测量。内容错误率是中文 CER 和英文 WER 的未加权平均值,在求平均之前先将百分比转换为小数。SpeechJudge [106] 根据停顿、语速和整体韵律一致性来评估韵律连贯性。两个表现力指标均由 Gemini 3 Pro [72, 31] 评分。表现力丰富度评估情感共鸣、角色塑造和叙事能力。表现力层次感则综合评估情感变化、声音动态和场景适配度。

指令任务。InstructTTSEval [41] 提供了以自然语言指定说话人属性和表达方式的语音提示词。声学参数规范(APS)测试对12个显式声学属性的直接控制。描述性风格指令(DSD)使用对说话风格的自由形式描述。角色扮演(RP)要求模型从给定的角色或场景中推断出合适的发声风格。对于所有三个任务,我们报告由自动评判模型 Gemini 2.5 Pro [30] 计算的官方指令遵循准确率。

我们还构建了 SwanBench-Scene 来评估声学质量,这是 InstructTTSEval 未覆盖的部分。它包含180条指令式TTS指令:60条广告指令、60条漫画剧指令和60条通用场景指令。标注者从四个维度进行评分:整体表现力、韵律自然度、音频饱满度和场景适配度。每个分数采用1-5分制。每个项目由五位专业标注者进行评估。平均MOS分数计算为四个维度分数的算术平均值。

对于基于硬指令的语音和音频生成,我们构建了 SwanBench-Caption,这是一个聚焦的评估集,包含64个案例,涵盖环境音效和局部音效、歌声、背景音乐、多语言语音和多说话人对话。自动评判模型 gemini-3.5-flash [32] 从三个维度给出1到5分的评分。指令准确度衡量生成的音频是否正确实现了所要求的内容、说话人轮次和声音事件。声学质量评估清晰度、自然度和伪影。整体表现力评估情感传达、动态变化和场景级生动度。

4.3 基线模型

SwanVAE。我们将 SwanVAE 与神经音频编解码器和连续音频自编码器进行了比较。为了保持编解码器在不同领域的比较一致性,我们在全部四个测试集上评估了 DAC [59]、48-kHz 的 EnCodec 模型 [19] 和 WavTokenizer Large Unify [47]。随后,我们根据各连续自编码器预期的数据领域将其加入对比。对于语音和歌声,这些模型包括 VoxCPM2 AudioVAE V2 [116] 和 MegaTTS 3 WaveVAE [50]。对于通用音频和音乐,我们加入了 Stable Audio Open 1.0 [23] 和 SAME-L [74](即 Stable Audio 3 [24] 中使用的大型 SAME 自编码器)。音乐领域还包含了 ACE-Step Music-DCAE [29]。

零样本任务。我们与带有参考音频的开源语音生成系统进行了比较。单人语音基线包括 CosyVoice-2 [21]、CosyVoice-3 [22]、FishSpeech [27]、F5TTS [13]、GLM-TTS [17]、IndexTTS-2 [114]、MegaTTS-3 [50]、SparkTTS [92]、VibeVoice [76]、ZipVoice [117] 和 SwanVoice [63]。对话基线包括 FireRedTTS-2 [94]、MoonCast [51]、MOSS-TTSD [68]、SoulX-Podcast [93]、VibeVoice [76]、ZipVoice-Dialog [117] 和 SwanVoice [63]。

指令任务。我们与具有代表性的开源指令跟随 TTS 系统进行了比较:Parler-TTS-large [67]、VoxInstruct [115]、VoiceSculptor [38]、MiMo-Audio-7B-Instruct [105]、Qwen3-TTS-12Hz-1.7B-VD [77]、MOSS-VoiceGenerator [42] 和 VoxCPM2 [116]。在 SwanBench-Scene 上,我们加入了 Seedance 2.0 [88],使用相同的输入指令,并从其输出中提取音频部分进行评估。

4.4 SwanVAE 评估

我们报告了 SwanVAE 及基线的潜在表示配置和重建质量。表 2 总结了每个系统的采样率、原生潜在表示帧率、潜在表示大小和标称码率。表 3 和表 4 报告了上述四个测试集上的重建质量。

媒体内容 · 前往原文查看
表 2:所评估的音频自编码器和编解码器的潜在表示配置。帧率指下游拼接前的原生编码器输出。对于连续表示,标称码率假设每个标量为 16 位(FP16 或 BF16);对于离散表示,仅计算码本索引,不包括熵编码和辅助信息。

模型 表示方式 采样率 帧率 每帧潜变量 标称码率 ACE-Step Music-DCAE [29] 连续 44.1 kHz 10.77 Hz 128 个标量 22.05 kbps VoxCPM2 AudioVAE V2 [116] 连续 kHz 25 Hz 64 个标量 25.60 kbps Stable Audio Open 1.0 [23] 连续 44.1 kHz 21.53 Hz 64 个标量 22.05 kbps SAME-L [74] 连续 44.1 kHz 10.77 Hz 256 个标量 44.10 kbps MegaTTS 3 WaveVAE [50] 连续 24 kHz 25 Hz 32 个标量 12.80 kbps DAC [59] RVQ 44.1 kHz 86.13 Hz -bit 索引 7.75 kbps EnCodec [19] RVQ 48 kHz 150 Hz -bit 索引 24.00 kbps WavTokenizer Large Unify [47] VQ 24 kHz 40 Hz -bit 索引 0.48 kbps SwanVAE(我们的) 连续 48 kHz 25 Hz 96 个标量 38.40 kbps16→489×1016×101×12

SwanVAE 以 25 Hz 的频率生成 96 维连续潜变量,每个潜变量步长间隔 40 毫秒。按照表 2 中的 16 位约定,这对应 38.40 kbps 的标称码率;同样的 25 Hz 序列也用作 SwanTale 的声学表示。以下各表在相同协议下,对每个已报告的音频领域在该设置下的重建质量进行评估。

媒体内容 · 前往原文查看
表 3:语音和歌声测试集上的重建质量。加粗和下划线值分别表示各领域内对比系统中的最佳和第二佳结果。
模型 PESQ↑ STOI↑ MCD↓ ViSQOL↑
语音
DAC [59] 4.1178 0.9693 1.1963 4.1585
EnCodec [19] 3.1872 0.9297 1.5147 3.5035
WavTokenizer Large Unify [47] 2.1423 0.8428 2.9393 2.3787
VoxCPM2 AudioVAE V2 [116] 3.9987 0.9690 1.2222 4.0340
MegaTTS 3 WaveVAE [50] 3.5968 0.9507 1.5130 4.2348
SwanVAE(我们的) 4.1683 0.9680 0.9638 4.1248
歌声
DAC [59] 3.7872 0.8627 1.9293 3.6681
EnCodec [19] 2.6464 0.8166 2.2392 3.3841
WavTokenizer Large Unify [47] 1.9226 0.6613 5.1885 1.6018
VoxCPM2 AudioVAE V2 [116] 3.7088 0.8838 1.9335 3.6734
MegaTTS 3 WaveVAE [50] 3.5727 0.8620 2.0310 4.0013
SwanVAE(我们的) 3.9821 0.9001 1.5661 3.7085

在语音上,SwanVAE 在 PESQ 和 MCD 上取得最佳成绩,同时在 STOI 和 ViSQOL 上接近最强基线。在歌声上,它在 PESQ、STOI 和 MCD 上排名第一,在 ViSQOL 上排名第二。MCD 结果在两个领域保持一致,这表明尽管两个声乐领域的潜变量帧率较低,25 Hz 的表示仍能很好地保留语音频谱结构。

媒体内容 · 前往原文查看
表 4:通用音频与音乐测试集上的重建质量。加粗和下划线数值分别表示各领域内对比系统中的最优和次优结果。
通用音频
模型 ViSQOL↑ LSD↓
DAC [59] 4.0198 0.9589
EnCodec [19] 4.1140 0.9761
WavTokenizer Large Unify [47] 2.8595 1.0967
Stable Audio Open 1.0 [23] 4.0355 0.9358
SAME-L [74] 3.7541 1.0372
SwanVAE(本文方法) 4.1269 0.9455
音乐
模型 ViSQOL↑ LSD↓
DAC [59] 4.1534 0.9196
EnCodec [19] 4.2976 0.9000
WavTokenizer Large Unify [47] 2.6968 1.0612
Stable Audio Open 1.0 [23] 4.1357 0.9236
SAME-L [74] 4.0267 0.9210
ACE-Step Music-DCAE [29] 4.1756 0.9019
SwanVAE(本文方法) 4.2623 0.9172

在通用音频上,SwanVAE 取得了最高的 ViSQOL 和次低的 LSD,仅次于 Stable Audio Open 1.0。在音乐上,EnCodec 在两个指标上均领先,而 SwanVAE 在 ViSQOL 上排名第二、在 LSD 上排名第三。四个领域均使用同一个 SwanVAE 检查点,未进行针对特定领域的模型选择。

4.5 零样本评估

媒体内容 · 前往原文查看
表 5:SwanBench-Speech 上的零样本独白与对话 TTS 结果。除 Content Error 保留三位小数外,所有分数均保留两位小数。加粗和下划线数值分别表示各设置内对比系统中的最优和次优结果。

模型 音色 混响 声音保真度 内容错误 SpeechJudge 丰富度 层次感 独白 CosyVoice-2 [21] 0.93 2.37 3.58 0.106 2.81 2.02 2.59 CosyVoice-3 [22] 0.93 2.73 3.80 0.077 3.26 2.64 2.47 FishSpeech [27] 0.93 2.00 4.09 0.066 3.77 2.37 2.90 F5TTS [13] 0.92 2.12 2.60 0.085 2.87 2.77 2.97 GLM-TTS [17] 0.94 1.64 3.90 0.074 3.28 1.57 2.39 IndexTTS-2 [114] 0.93 1.77 2.78 0.077 3.63 3.32 2.94 MegaTTS-3 [50] 0.93 2.07 3.52 0.072 3.22 2.40 3.01 SparkTTS [92] 0.92 2.04 3.53 0.314 2.35 2.23 2.22 VibeVoice [76] 0.92 2.45 3.47 0.092 3.75 3.42 3.06 ZipVoice [117] 0.89 2.10 3.53 0.213 2.97 2.11 2.05 SwanVoice [63] 0.93 2.06 3.60 0.172 3.56 3.81 3.62 SwanTale(Ours) 0.95 1.83 3.95 0.086 3.75 3.90 3.70 对话 FireRedTTS-2 [94] 0.91 3.54 2.54 0.148 2.93 2.52 2.65 MoonCast [51] 0.90 3.29 2.60 0.284 2.93 2.42 2.54 MOSS-TTSD [68] 0.89 3.52 2.83 0.227 2.57 3.04 2.86 SoulX-Podcast [93] 0.92 3.23 3.98 0.101 3.89 2.80 3.15 VibeVoice [76] 0.89 2.09 2.75 0.204 3.00 3.09 2.83 ZipVoice-Dialog [117] 0.90 3.49 2.48 0.116 3.46 2.88 2.93 SwanVoice [63] 0.92 3.02 3.77 0.145 3.70 3.62 3.71 SwanTale(Ours) 0.94 3.21 3.73 0.120 3.92 3.66 3.85↑↓↑↓↑↑↑

表 5 报告了 SwanBench-Speech 在独白和双说话人对话两种零样本 TTS 场景下的结果。SwanTale 在两种场景下的音色一致性、表现力丰富度和表现力层次感方面均排名第一,并在对话场景下的 SpeechJudge 指标上排名第一。这表明添加并过滤表现力数据对模型有益。然而,对比结果也揭示了在内容准确性和音频质量方面仍有改进空间。在独白场景下,FishSpeech 实现了更低的内容错误和更高的声音保真度;在对话场景下,SoulX-Podcast 在所对比的系统中在声音保真度和内容错误方面表现最佳。

此外,SwanTale 始终优于 SwanVoice。在单人独白零样本设定下,SwanTale 将音色一致性提升至 0.95,将内容错误率降低至 0.086,并将 SpeechJudge、表现力丰富度和表现力层次分别提升至 3.75、3.90 和 3.70。在双人对话零样本设定下,同样的五项指标分别提升至 0.94、0.120、3.92、3.66 和 3.85。这些提升得益于完整的训练方案:除了加入高表现力数据外,我们还使用基于 ASR 的发音检查来筛选用于预训练和监督微调(SFT)的数据,同时基于奖励的质量控制和 GRPO 进一步提升了生成质量。

4.6 指令跟随评估

媒体内容 · 前往原文查看
表 6:InstructTTSEval 上的指令跟随 TTS 结果。除 SwanTale 外,所有模型的结果均取自 VoxCPM2 论文 [116]。加粗和下划线数值分别表示最佳和第二佳结果。
模型 中文(ZH) 英文(EN)
APS↑ DSD↑ RP↑ APS↑ DSD↑ RP↑
Parler-TTS-large [67] – – – 60.0 45.9 31.2
VoxInstruct [115] 47.5 52.3 42.6 54.9 57.0 39.3
VoiceSculptor [38] 75.7 64.7 61.5 – – –
MiMo-Audio-7B-Instruct [105] 75.7 74.3 61.5 80.6 77.6 59.5
Qwen3-TTS-12Hz-1.7B-VD [77] 85.2 81.1 65.1 82.9 82.4 68.4
MOSS-VoiceGenerator [42] 78.0 80.0 74.0 68.2 82.0 68.7
VoxCPM2 [116] 85.2 71.5 60.8 84.2 83.2 71.4
SwanTale(我们的模型) 86.1 80.1 64.1 84.2 79.2 63.6
媒体内容 · 前往原文查看
表 7:SwanBench-Scene 上的结果。平均 MOS 是其他四项指标的算术平均值。加粗和下划线数值分别表示最佳和第二佳结果。

模型 平均MOS 总体 表现 韵律自然度 音频饱满度 场景适配度 广告 MOSS-VoiceGenerator [42] 3.13 2.89 3.10 3.75 2.76 MiMo-Audio-7B-Instruct [105] 3.13 2.96 3.17 3.49 2.89 Seedance 2.0 [88] 3.38 3.25 3.34 3.73 3.22 Qwen3-TTS-12Hz-1.7B-VD [77] 3.71 3.62 3.73 4.12 3.38 SwanTale(我们的模型) 3.88 3.76 3.82 4.21 3.73 漫画剧 MiMo-Audio-7B-Instruct 3.23 3.06 3.24 3.72 2.89 MOSS-VoiceGenerator 4.06 3.94 4.11 4.33 3.87 Qwen3-TTS-12Hz-1.7B-VD 4.35 4.20 4.35 4.63 4.21 Seedance 2.0 4.35 4.30 4.42 4.45 4.23 SwanTale(我们的模型) 4.45 4.36 4.47 4.60 4.36 通用场景 MiMo-Audio-7B-Instruct 3.28 3.17 3.39 3.49 3.05 MOSS-VoiceGenerator 3.62 3.42 3.65 4.10 3.29 Seedance 2.0 4.14 4.11 4.18 4.23 4.05 Qwen3-TTS-12Hz-1.7B-VD 4.22 4.05 4.18 4.59 4.04 SwanTale(我们的模型) 4.34 4.24 4.30 4.60 4.21 总体 MiMo-Audio-7B-Instruct 3.19 3.04 3.24 3.55 2.93 MOSS-VoiceGenerator 3.48 3.29 3.49 3.98 3.17 Seedance 2.0 3.86 3.78 3.87 4.07 3.73 Qwen3-TTS-12Hz-1.7B-VD 4.09 3.96 4.09 4.45 3.88 SwanTale(我们的模型) 4.22 4.12 4.20 4.47 4.10↑↑↑↑↑

InstructTTSEval。如表6所示,SwanTale在显式声学控制方面表现最强,在中文描述式指令上表现优异。它在中文APS上排名第一(86.1),在英文APS上并列第一(84.2),在中文DSD上排名第二(80.1)。APS和DSD与我们字幕数据中使用的详细声学和说话风格描述高度吻合。同时,SwanTale在各项任务中的中英文得分接近,显示出跨语言的均衡表现。英文DSD在跨系统比较中竞争力较弱:多个基线模型从中文到英文有显著提升,而SwanTale保持在相近水平。RP在两种语言中都是短板。该任务要求模型将职业、角色原型或场景映射为可辨识的声音表现。我们的字幕标注和当前的风格矩阵可能未覆盖足够多的长尾角色模仿风格,限制了对未见角色和场景的泛化能力。因此,提升RP需要在实际指令场景中,对角色、职业、角色原型和情境提供更广泛的字幕和风格矩阵覆盖。

SwanBench-Scene。表 7 总结了 SwanBench-Scene 的结果。SwanTale 在整体平均 MOS(4.22)以及整体表现力(4.12)、韵律自然度(4.20)、音频饱满度(4.47)和场景适配度(4.10)方面均取得最高分。它在广告(3.88)、漫画剧(4.45)和通用场景(4.34)中也获得了最高的平均 MOS。在所有被评估系统中,它唯一排名第二的维度分数是漫画剧场景下的音频饱满度(4.60)。

媒体内容 · 前往原文查看
表 8:SwanBench-Caption 上的结果。所有指标均由 gemini-3.5-flash 按 1–5 分制评分;分数越高越好。32B CE 将默认的 Qwen3.0-Instruct-8B 字幕编码器替换为 Qwen3.0-Instruct-32B [97]。
设置 指令准确率↑ 声学质量↑ 整体表现力↑
去除 MoE 的 SwanTale 3.02 4.09 3.56
SwanTale 3.39 4.31 3.82
使用 32B CE 的 SwanTale 3.70 4.34 3.98

SwanBench-Caption。表 8 报告了 SwanBench-Caption 上的消融实验结果。移除统一 MoE 后,指令准确率从 3.39 降至 3.02,声学质量从 4.31 降至 4.09,整体表现力从 3.82 降至 3.56。三项指标均出现下降,表明统一 MoE 有助于提升指令实现、声学质量和表现力。将字幕编码器从 8B 扩展到 32B 后,三项分数进一步提升至 3.70、4.34 和 3.98,其中指令准确率的提升幅度最大。

总体而言,三项指令评估展现了互补的优势。SwanTale 在 APS 上领先,并在中文 DSD 上表现强劲,而英文 DSD 和 RP 的竞争力相对较弱。SwanBench-Scene 展示了其在多样化场景下的高感知质量,SwanBench-Caption 的消融实验则表明统一 MoE 和更大的字幕编码器容量在复杂语音与音频指令上带来了增益。

5 结论

本工作提出 SwanTale,一个面向多说话人语音与音频生成的统一模型,可同时覆盖指令跟随与零样本任务。SwanData-Caption 通过针对性的数据覆盖、语音感知预处理、多层级字幕标注以及质量过滤,提供了所需的监督信号。SwanTale 结合了 SwanVAE(一个基于流的 Transformer 架构,具备奖励条件质量控制)、Engram 条件机制以及 Unified MoE,并配合课程学习与 GRPO 后训练,逐步将统一生成器适配到字幕与参考音频两种条件上。由此得到的模型能够根据自然语言描述设计说话人音色,通过参考音频复用这些音色,并在单一波形中通过统一的生成过程同时生成语音、环境声与局部音效。

实验表明,SwanTale 在多项关键零样本与指令跟随指标上处于领先地位。它在零样本与指令任务中均取得了最佳表现力得分,并支持在同一模型内完成涉及多说话人语音与音频的复杂指令生成。

指令生成与零样本生成仍面临若干挑战。首先,复杂的背景音乐生成依然困难,尤其是当音乐需要随不同情绪变化类型或进行过渡时。其次,长时指令生成仍具挑战性,尤其是超过两分钟、包含音效的复杂多说话人场景。第三,精细的局部风格控制仍然困难,这包括指定说话人的连续情绪变化、对重音与说话节奏的精确控制,以及时机得当的停顿与音效,这些都对数据标注与模型设计构成挑战。在生成之外,对现有音频的语音内容、说话人身份与情绪进行编辑是另一个重要问题[71]。因此,在统一框架内实现音频生成与编辑一体化的模型,是未来研究的一个明确方向。

参考文献

  • An 等人 [2024] Keyu An、Qian Chen、Chong Deng、Zhihao Du、Changfeng Gao、Zhifu Gao、Yue Gu、Ting He、Hangrui Hu、Kai Hu 等。Funaudiollm:面向人类与大语言模型自然交互的语音理解与生成基础模型。arXiv 预印本 arXiv:2407.04051,2024 年。
  • Anjok07 和 aufr33 [2020] Anjok07 和 aufr33。终极人声分离工具。GitHub 仓库,2020 年。URL https://github.com/Anjok07/ultimatevocalremovergui。
  • Bai 等人 [2023] Jinze Bai、Shuai Bai、Yunfei Chu、Zeyu Cui、Kai Dang、Xiaodong Deng、Yang Fan、Wenbin Ge、Yu Han、Fei Huang 等。Qwen 技术报告。arXiv 预印本 arXiv:2309.16609,2023 年。
  • Bain 等人 [2023] Max Bain、Jaesung Huh、Tengda Han 和 Andrew Zisserman。Whisperx:长音频的时间精确语音转写。arXiv 预印本 arXiv:2303.00747,2023 年。
  • Bengio 等人 [2009] Yoshua Bengio、Jérôme Louradour、Ronan Collobert 和 Jason Weston。课程学习。载于第 26 届国际机器学习年会论文集,第 41–48 页。ACM,2009 年。
  • ByteDance Seed 团队 [2026] ByteDance Seed 团队。Seed2.0,2026 年。URL https://seed.bytedance.com/en/seed2。模型官网。
  • BytePlus [2026] BytePlus。Seed Speech ASR 2.0 文档。BytePlus 文档,2026 年。URL https://docs.byteplus.com/en/docs/byteplusvoice/speechtotextv2。访问日期:2026-06-01。
  • Chen 等人 [2026] Dekun Chen、Xueyao Zhang、Yuancheng Wang、Kenan Dai、Li Ma 和 Zhizheng Wu。FlexiVoice:通过自然语言指令实现零样本 TTS 的灵活风格控制。载于国际学习表征会议,2026 年。
  • Chen 等人 [2021] Guoguo Chen、Shuzhou Chai、Guanbo Wang、Jiayu Du、Wei-Qiang Zhang、Chao Weng、Dan Su、Daniel Povey、Jan Trmal、Junbo Zhang 等。Gigaspeech:一个持续演进、多领域的 ASR 语料库,包含 10,000 小时带转写音频。arXiv 预印本 arXiv:2106.06909,2021 年。
  • Chen 等人 [2022] Sanyuan Chen、Chengyi Wang、Zhengyang Chen、Yu Wu、Shujie Liu、Zhuo Chen、Jinyu Li、Naoyuki Kanda、Takuya Yoshioka、Xiong Xiao 等。Wavlm:面向全栈语音处理的大规模自监督预训练。IEEE 信号处理选题期刊,16(6):1505–1518,2022 年。
  • Chen 等人 [2025a] Yafeng Chen、Siqi Zheng、Hui Wang、Luyao Cheng、Tinglong Zhu、Rongjie Huang、Chong Deng、Qian Chen、Shiliang Zhang、Wen Wang 等。3d-speaker-toolkit:面向多模态说话人验证与说话人日志的开源工具包。载于 ICASSP 2025-2025 IEEE 国际声学、语音与信号处理会议(ICASSP),第 1–5 页。IEEE,2025a。
  • Chen 等人 [2025b] Yang Chen、Hui Wang、Shiyao Wang、Junyang Chen、Jiabei He、Jiaming Zhou、Xi Yang、Yequan Wang、Yonghua Lin 和 Yong Qin。SeniorTalk:面向高龄老人的中文对话数据集,含丰富标注。arXiv 预印本 arXiv:2503.16578,2025b。URL https://arxiv.org/abs/2503.16578。
  • Chen 等人 [2024] Yushen Chen、Zhikang Niu、Ziyang Ma、Keqi Deng、Chunhui Wang、Jian Zhao、Kai Yu 和 Xie Chen。F5-tts:利用流匹配生成流畅且忠实语音的童话讲述者。arXiv 预印本 arXiv:2410.06885,2024。
  • Cheng 等人 [2026] Xin Cheng、Wangding Zeng、Damai Dai、Qinyu Chen、Bingxuan Wang、Zhenda Xie、Kezhao Huang、Xingkai Yu、Zhewen Hao、Yukun Li、Han Zhang、Huishuai Zhang、Dongyan Zhao 和 Wenfeng Liang。通过可扩展查找实现条件记忆:大语言模型稀疏性的新维度。arXiv 预印本 arXiv:2601.07372,2026。
  • Chinen 等人 [2020] Michael Chinen、Felicia S. C. Lim、Jan Skoglund、Nikita Gureev、Feargus O’Gorman 和 Andrew Hines。ViSQOL v3:开源、生产就绪的客观语音与音频指标。载于 2020 年第十二届多媒体体验质量国际会议(QoMEX),第 1–6 页,2020。10.1109/QoMEX48832.2020.9123150。
  • Chung 等人 [2019] Yu-An Chung、Wei-Ning Hsu、Hao Tang 和 James Glass。用于语音表征学习的无监督自回归模型。arXiv 预印本 arXiv:1904.03240,2019。
  • Cui 等人 [2025] Jiayan Cui、Zhihan Yang、Naihan Li、Jiankun Tian、Xingyu Ma、Yi Zhang、Guangyu Chen、Runxuan Yang、Yuqing Cheng、Yizhi Zhou、Guochen Yu、Xiaotao Gu 和 Jie Tang。GLM-4-Voice:迈向智能且类人的端到端语音聊天机器人。arXiv 预印本 arXiv:2507.01006,2025。
  • Dai 等人 [2024] Damai Dai、Chengqi Deng、Chenggang Zhao、R. X. Xu、Huazuo Gao、Deli Chen、Jiashi Li、Wangding Zeng、Xingkai Yu、Y. Wu、Zhenda Xie、Y. K. Li、Panpan Huang、Fuli Luo、Chong Ruan、Zhifang Sui 和 Wenfeng Liang。DeepSeekMoE:迈向混合专家语言模型中极致的专家专业化。arXiv 预印本 arXiv:2401.06066,2024 年。
  • Defossez 等人 [2022] Alexandre Defossez、Jade Copet、Gabriel Synnaeve 和 Yossi Adi。高保真神经音频压缩。arXiv 预印本 arXiv:2210.13438,2022 年。
  • Desplanques 等人 [2020] Brecht Desplanques、Jenthe Thienpondt 和 Kris Demuynck。ECAPA-TDNN:基于 TDNN 的说话人验证中强调通道注意力、传播与聚合。收录于 Interspeech,第 3830–3834 页,2020 年。
  • Du 等人 [2024] Zhihao Du、Qian Chen、Shiliang Zhang、Kai Hu、Heng Lu、Yexin Yang、Hangrui Hu、Siqi Zheng、Yue Gu、Ziyang Ma 等。Cosyvoice:一种基于监督语义 token 的可扩展多语言零样本文本转语音合成器。arXiv 预印本 arXiv:2407.05407,2024 年。
  • Du 等人 [2025] Zhihao Du、Changfeng Gao、Yuxuan Wang、Fan Yu、Tianyu Zhao、Hao Wang、Xiang Lv、Hui Wang、Chongjia Ni、Xian Shi 等。Cosyvoice 3:通过规模扩展与后训练实现真实场景语音生成。arXiv 预印本 arXiv:2505.17589,2025 年。
  • Evans 等人 [2025] Zach Evans、Julian D Parker、CJ Carr、Zack Zukowski、Josiah Taylor 和 Jordi Pons。Stable audio open。收录于 ICASSP 2025-2025 年 IEEE 国际声学、语音与信号处理会议(ICASSP),第 1–5 页。IEEE,2025 年。
  • Evans 等人 [2026] Zach Evans、Julian D Parker、Matthew Rice、CJ Carr、Zack Zukowski、Josiah Taylor 和 Jordi Pons。Stable audio 3。arXiv 预印本 arXiv:2605.17991,2026 年。
  • Falk 等人 [2010] Tiago H. Falk、Chenxi Zheng 和 Wai-Yip Chan。一种针对混响及去混响语音的非侵入式质量和可懂度度量方法。IEEE 音频、语音与语言处理汇刊,18(7):1766–1774,2010 年。10.1109/TASL.2010.2052247。
  • Fedus 等人 [2022] William Fedus、Barret Zoph 和 Noam Shazeer。Switch Transformers:利用简单高效的稀疏性扩展到万亿参数模型。机器学习研究杂志,23(120):1–39,2022 年。
  • Fish Audio 团队 [2024] Fish Audio 团队。Fish-Speech:利用大语言模型实现先进的多语言文本转语音合成。arXiv 预印本 arXiv:2411.01156,2024 年。
  • Fonseca 等人 [2021] Eduardo Fonseca、Xavier Favory、Jordi Pons、Frederic Font 和 Xavier Serra。Fsd50k:一个开放的人工标注声音事件数据集。IEEE/ACM 音频、语音与语言处理汇刊,30:829–852,2021 年。
  • Gong 等人 [2025] Junmin Gong、Sean Zhao、Sen Wang、Shengyuan Xu 和 Joe Guo。Ace-step:迈向音乐生成基础模型的一步。arXiv 预印本 arXiv:2506.00045,2025 年。
  • Google DeepMind [2025a] Google DeepMind。Gemini 2.5 Pro 模型卡,2025a。URL https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-2-5-Pro-Model-Card.pdf。模型卡。
  • Google DeepMind [2025b] Google DeepMind。Gemini 3 Pro 模型卡,2025b。URL https://deepmind.google/models/model-cards/gemini-3-pro/。模型卡。
  • Google DeepMind [2026] Google DeepMind。Gemini 3.5 Flash 模型卡,2026。URL https://deepmind.google/models/model-cards/gemini-3-5-flash/。模型卡。
  • Gray 和 Markel [1976] Augustine H. Gray 和 John D. Markel。语音处理的距离度量。IEEE 声学、语音与信号处理汇刊,24(5):380–391,1976 年。10.1109/TASSP.1976.1162849。
  • Guo 等人 [2025a] Wenxiang Guo、Changhao Pan、Zhiyuan Zhu、Xintong Hu、Yu Zhang、Li Tang、Rui Yang、Han Wang、Zongbao Zhang、Yuhan Wang、Yixuan Chen、Hankun Xu、Ke Xu、Pengfei Fan、Zhetao Chen、Yanhao Yu、Qiange Huang、Fei Wu 和 Zhou Zhao。MRSAudio:一个带有精细标注的大规模多模态录音空间音频数据集。收录于神经信息处理系统进展,2025a。
  • Guo 等人 [2025b] Wenxiang Guo、Yu Zhang、Changhao Pan、Rongjie Huang、Li Tang、Ruiqi Li、Zhiqing Hong、Yongqi Wang 和 Zhou Zhao。Techsinger:通过流匹配实现技巧可控的多语言歌声合成。arXiv 预印本 arXiv:2502.12572,2025b。
  • Guo 等人 [2025c] Wenxiang Guo、Yu Zhang、Changhao Pan、Zhiyuan Zhu、Ruiqi Li、ZheTao Chen、Wenhao Xu、Fei Wu 和 Zhou Zhao。STARS:面向歌声转录、对齐与精细风格标注的统一框架。收录于计算语言学协会 ACL 2025 会议 Findings 论文集,第 15081–15093 页,奥地利维也纳,2025c。计算语言学协会。
  • Ho 和 Salimans [2022] Jonathan Ho 和 Tim Salimans。无分类器扩散引导。arXiv 预印本 arXiv:2207.12598,2022。
  • Hu 等人 [2026] Jingbin Hu、Huakang Chen、Linhan Ma、Dake Guo、Qirui Zhan、Wenhao Li、Haoyu Zhang、Kangxiang Xia、Ziyu Zhang、Wenjie Tian、Chengyou Wang、Jinrui Liang、Shuhan Guo、Zihang Yang、Bengu Wu、Binbin Zhang、Pengcheng Zhu、Pengyuan Xie、Chuan Xie、Qiang Zhang、Jie Liu 和 Lei Xie。VoiceSculptor:你的声音,由你设计。arXiv 预印本 arXiv:2601.10629,2026。
  • Hu 等人 [2025] Ke Hu、Krishna Puvvada、Elena Rastorgueva、Zhehuai Chen、He Huang、Shuoyang Ding、Kunal Dhawan、Hainan Xu、Jagadeesh Balam 和 Boris Ginsburg。面向自动语音识别与翻译的词级时间戳生成。arXiv 预印本 arXiv:2505.15646,2025。
  • Huang 等人 [2023a] Huang Huang、Xiaoquan Kong 等人。python-pinyin:pypinyin,2023a。URL https://github.com/mozillazg/python-pinyin。软件,版本 0.48.0。
  • Huang 等人 [2025] Kexin Huang、Qian Tu、Liwei Fan、Chenchen Yang、Dong Zhang、Shimin Li、Zhaoye Fei、Qinyuan Cheng 和 Xipeng Qiu。InstructTTSEval:对文本转语音系统中复杂自然语言指令跟随能力的基准评测。arXiv 预印本 arXiv:2506.16381,2025。
  • Huang 等人 [2026] Kexin Huang、Liwei Fan、Botian Jiang、Yaozhou Jiang、Qian Tu、Jie Zhu、Yuqian Zhang、Yiwei Zhao、Chenchen Yang、Zhaoye Fei、Shimin Li、Xiaogui Yang、Qinyuan Cheng 和 Xipeng Qiu。MOSS-VoiceGenerator:用自然语言描述创建逼真语音。arXiv 预印本 arXiv:2603.28086,2026。
  • Huang 等人 [2022] Rongjie Huang、Yi Ren、Jinglin Liu、Chenye Cui 和 Zhou Zhao。Generspeech:面向可泛化跨域文本转语音的风格迁移。收录于神经信息处理系统进展大会(NeurIPS),2022。
  • Huang 等人 [2023b] Rongjie Huang、Jiawei Huang、Dongchao Yang、Yi Ren、Luping Liu、Mingze Li、Zhenhui Ye、Jinglin Liu、Xiang Yin 和 Zhou Zhao。Make-an-audio:基于提示增强扩散模型的文本到音频生成。收录于《国际机器学习大会》,第 13916–13932 页。PMLR,2023b。
  • Jang 等人 [2016] Eric Jang、Shixiang Gu 和 Ben Poole。基于 Gumbel-Softmax 的分类重参数化。arXiv 预印本 arXiv:1611.01144,2016。
  • Jang 等人 [2021] Won Jang、Dan Lim、Jaesam Yoon、Bongwan Kim 和 Juntae Kim。Univnet:一种采用多分辨率频谱判别器的高保真波形生成神经声码器。arXiv 预印本 arXiv:2106.07889,2021。
  • Ji 等人 [2024] Shengpeng Ji、Ziyue Jiang、Wen Wang、Yifu Chen、Minghui Fang、Jialong Zuo、Qian Yang、Xize Cheng、Zehan Wang、Ruiqi Li 等。Wavtokenizer:一种用于音频语言建模的高效声学离散编解码器 tokenizer。arXiv 预印本 arXiv:2408.16532,2024。
  • Jiang 等人 [2023] Xue Jiang、Xiulian Peng、Huaying Xue、Yuan Zhang 和 Yan Lu。潜域预测性神经语音编码。IEEE/ACM 音频、语音与语言处理汇刊,31:2111–2123,2023。
  • Jiang 等人 [2024] Ziyue Jiang、Jinglin Liu、Yi Ren、Jinzheng He、Zhenhui Ye、Shengpeng Ji、Qian Yang、Chen Zhang、Pengfei Wei、Chunfeng Wang 等。Mega-tts 2:增强零样本语音合成的提示机制。收录于第十二届国际学习表征会议,2024。
  • Jiang 等人 [2025] Ziyue Jiang、Yi Ren、Ruiqi Li、Shengpeng Ji、Boyang Zhang、Zhenhui Ye、Chen Zhang、Bai Jionghao、Xiaoda Yang、Jialong Zuo 等。Megatts 3:用于零样本语音合成的稀疏对齐增强潜扩散 Transformer。arXiv 预印本 arXiv:2502.18924,2025。
  • Ju 等人 [2025] Zeqian Ju、Dongchao Yang、Jianwei Yu、Kai Shen、Yichong Leng、Zhengtao Wang、Xu Tan、Xinyu Zhou、Tao Qin 和 Xiangyang Li。Mooncast:高质量零样本播客生成。arXiv 预印本 arXiv:2503.14345,2025。
  • Kang 等人 [2024] Wei Kang、Xiaoyu Yang、Zengwei Yao、Fangjun Kuang、Yifan Yang、Liyong Guo、Long Lin 和 Daniel Povey。Libriheavy:一个包含 5 万小时、带标点、大小写和上下文信息的 ASR 语料库。收录于 ICASSP 2024-2024 年 IEEE 国际声学、语音与信号处理会议(ICASSP),第 10991–10995 页。IEEE,2024 年。
  • Kim 等人 [2019] Chris Dongjoo Kim、Byeongchang Kim、Hyunmin Lee 和 Gunhee Kim。AudioCaps:为野外音频生成描述。收录于 2019 年北美计算语言学协会人类语言技术会议论文集,第 119–132 页。计算语言学协会,2019 年。10.18653/v1/N19-1011。
  • Kiritchenko 和 Mohammad [2017] Svetlana Kiritchenko 和 Saif Mohammad。最佳-最差标度比评分量表更可靠:情感强度标注的案例研究。收录于第 55 届计算语言学协会年会论文集(第 2 卷:短论文),第 465–470 页,加拿大温哥华,2017 年。计算语言学协会。
  • Kong 等人 [2020] Jungil Kong、Jaehyeon Kim 和 Jaekyoung Bae。HiFi-GAN:用于高效高保真语音合成的生成对抗网络。神经信息处理系统进展,33:17022–17033,2020 年。
  • Kubichek [1993] Robert F. Kubichek。用于客观语音质量评估的梅尔倒谱距离度量。收录于 IEEE 环太平洋通信、计算机与信号处理会议论文集,第 1 卷,第 125–128 页,1993 年。10.1109/PACRIM.1993.407206。
  • Kumar 等人 [2023a] Anurag Kumar、Ke Tan、Zhaoheng Ni、Pranay Manocha、Xiaohui Zhang、Ethan Henderson 和 Buye Xu。Torchaudio-squim:torchaudio 中的免参考语音质量和可懂度度量。收录于 ICASSP 2023 - 2023 年 IEEE 国际声学、语音与信号处理会议(ICASSP),第 1–5 页,2023a。
  • Kumar 等人 [2019] Aviral Kumar、Xue Bin Peng 和 Sergey Levine。奖励条件策略。arXiv 预印本 arXiv:1912.13465,2019 年。URL https://arxiv.org/abs/1912.13465。
  • Kumar 等人 [2023b] Rithesh Kumar、Prem Seetharaman、Alejandro Luebs、Ishaan Kumar 和 Kundan Kumar。基于改进 RVQGAN 的高保真音频压缩。arXiv 预印本 arXiv:2306.06546,2023b。
  • Lacombe 等人 [2024] Yoach Lacombe、Vaibhav Srivastav 和 Sanchit Gandhi。Parler-TTS。GitHub 代码仓库,2024 年。URL https://github.com/huggingface/parler-tts。
  • Lei 等人 [2026] Ke Lei、Yu Zhang、Changhao Pan、Xueyi Pu、Wenxiang Guo、Ruiqi Li 和 Zhou Zhao。基于自回归扩散 Transformer 的流式同步空间音频生成。第 43 届国际机器学习大会论文集,2026 年。
  • Li 等人 [2024] Ruiqi Li、Yu Zhang、Yongqi Wang、Zhiqing Hong、Rongjie Huang 和 Zhou Zhao。鲁棒歌声转写服务于合成。arXiv 预印本 arXiv:2405.09940,2024 年。
  • Li 等人 [2026] Ruiqi Li、Yu Zhang、Changhao Pan、Ke Lei、Xiang Yin 和 Cheng Yang。SwanVoice:面向独白与对话的富有表现力的长文本零样本语音合成。arXiv 预印本 arXiv:2605.30993,2026 年。
  • Lipman 等人 [2022] Yaron Lipman、Ricky TQ Chen、Heli Ben-Hamu、Maximilian Nickel 和 Matthew Le。用于生成建模的流匹配。第十一届国际学习表征大会,2022 年。
  • Liu 等人 [2025] Zhenyu Liu、Yunxin Li、Xuanyu Zhang、Qixun Teng、Shenyuan Jiang、Xinyu Chen、Haoyuan Shi、Jinchao Li、Qi Wang、Haolan Chen、Fanbo Meng、Mingjun Zhao、Yu Xu、Yancheng He、Baotian Hu 和 Min Zhang。UniMoE-Audio:基于动态容量 MoE 的统一语音与音乐生成。arXiv 预印本 arXiv:2510.13344,2025 年。
  • Loshchilov 和 Hutter [2019] Ilya Loshchilov 和 Frank Hutter。解耦权重衰减正则化。国际学习表征大会,2019 年。
  • Lyth 和 King [2024] Dan Lyth 和 Simon King。利用合成标注对高保真文本转语音进行自然语言引导。arXiv 预印本 arXiv:2402.01912,2024 年。
  • MOSI [2026] MOSI。MOSS-TTSD。项目网站,2026 年 2 月。URL https://mosi.cn/models/moss-ttsd。
  • Oord 等人 [2018] Aaron van den Oord、Yazhe Li 和 Oriol Vinyals。基于对比预测编码的表征学习。arXiv 预印本 arXiv:1807.03748,2018 年。
  • Pan 等人 [2025] Changhao Pan、Wenxiang Guo、Yu Zhang、Zhiyuan Zhu、Zhetao Chen、Han Wang 和 Zhou Zhao。面向空间音频回放系统的多模态评估框架:从定位到听者偏好。收录于第 33 届 ACM 国际多媒体会议论文集,第 7006–7015 页。ACM,2025 年。
  • Pan 等人 [2026a] Changhao Pan、Yifei Fan、Fan Zhuo、Yifu Chen、Wenxiang Guo、Yu Zhang、Ruiqi Li、Zhiyuan Zhu、Rui Yang、Shengpeng Ji、Chenyuhao Wen、Jiayang Xu、Ke Lei、Xiaoda Yang、Jingyu Lu 和 Zhou Zhao。基础模型时代的音频编辑:综述。arXiv 预印本 arXiv:2606.23139,2026a。URL https://arxiv.org/abs/2606.23139。
  • Pan 等人 [2026b] Changhao Pan、Rui Yang、Han Wang、Zhuan Zhou、Xuming He、Wenxiang Guo、Ziyue Jiang、Ruiqi Li、Yu Zhang、Chenyuhao Wen、Ke Lei、Xiang Yin、Jingyu Lu、Zhiyuan Zhu 和 Zhou Zhao。多样场景下长语音生成的综合基准评测。arXiv 预印本 arXiv:2605.28618,2026b。
  • Panayotov 等人 [2015] Vassil Panayotov、Guoguo Chen、Daniel Povey 和 Sanjeev Khudanpur。Librispeech:基于公共领域有声读物的 ASR 语料库。收录于 2015 年 IEEE 国际声学、语音与信号处理会议(ICASSP),第 5206–5210 页。IEEE,2015 年。
  • Parker 等人 [2026] Julian D Parker、Zach Evans、CJ Carr、Zachary Zukowski、Josiah Taylor、Matthew Rice 和 Jordi Pons。Same:一种语义对齐的音乐自编码器。arXiv 预印本 arXiv:2605.18613,2026 年。
  • Peebles 和 Xie [2023] William Peebles 和 Saining Xie。基于 Transformer 的可扩展扩散模型。收录于 IEEE/CVF 国际计算机视觉会议论文集,第 4195–4205 页,2023 年。
  • Peng 等人 [2025] Zhiliang Peng、Jianwei Yu、Wenhui Wang、Yaoyao Chang、Yutao Sun、Li Dong、Yi Zhu、Weijiang Xu、Hangbo Bao、Zehua Wang、Shaohan Huang、Yan Xia 和 Furu Wei。Vibevoice 技术报告。arXiv 预印本 arXiv:2508.19205,2025 年。
  • Qwen 团队 [2026] Qwen 团队。Qwen3-TTS 技术报告。arXiv 预印本 arXiv:2601.15621,2026 年。
  • Rastorgueva 等人 [2023] Elena Rastorgueva、Vitaly Lavrukhin 和 Boris Ginsburg。Nemo 强制对齐器及其在字幕生成词对齐中的应用。收录于 Interspeech,第 5257–5258 页,2023 年。
  • Reddy 等人 [2021] Chandan K. A. Reddy、Vishak Gopal 和 Ross Cutler。Dnsmos:一种用于评估降噪器的非侵入式感知客观语音质量指标。载于 ICASSP 2021 - 2021 年 IEEE 国际声学、语音与信号处理会议(ICASSP),第 6493–6497 页,2021 年。
  • Ren 等人 [2026] Yong Ren、Jianhua Yi、Jianhua Tao、Haiyang Sun、Zhengqi Wen、Hao Gu、Le Xu 和 Ye Bai。OV-InstructTTS:迈向开放词汇指令式文本转语音。arXiv 预印本 arXiv:2601.01459,2026 年。
  • Rix 等人 [2001] A. W. Rix、J. G. Beerends、M. P. Hollier 和 A. P. Hekstra。语音质量感知评估(PESQ)——一种用于电话网络和编解码器语音质量评估的新方法。载于 2001 年 IEEE 国际声学、语音与信号处理会议(ICASSP),第 2 卷,第 749–752 页,2001 年。
  • Shao 等人 [2024] Zhihong Shao、Peiyi Wang、Qihao Zhu、Runxin Xu、Junxiao Song、Xiao Bi、Haowei Zhang、Mingchuan Zhang、Y. K. Li、Y. Wu 和 Daya Guo。DeepSeekMath:推动开放语言模型数学推理能力的极限。arXiv 预印本 arXiv:2402.03300,2024 年。
  • Shen 等人 [2023] Kai Shen、Zeqian Ju、Xu Tan、Yanqing Liu、Yichong Leng、Lei He、Tao Qin、Sheng Zhao 和 Jiang Bian。Naturalspeech 2:潜在扩散模型是自然且零样本的语音和歌声合成器。arXiv 预印本 arXiv:2304.09116,2023 年。
  • Shi 等人 [2020] Yao Shi、Hui Bu、Xin Xu、Shaoji Zhang 和 Ming Li。Aishell-3:多说话人中文普通话 TTS 语料库及基线系统。arXiv 预印本 arXiv:2010.11567,2020 年。
  • Skorokhodov 等人 [2025] Ivan Skorokhodov、Sharath Girish、Benran Hu、Willi Menapace、Yanyu Li、Rameen Abdal、Sergey Tulyakov 和 Aliaksandr Siarohin。提升自编码器的可扩散性。arXiv 预印本 arXiv:2502.14831,2025 年。
  • Stöter 等人 [2018] Fabian-Robert Stöter、Antoine Liutkus 和 Nobutaka Ito。2018 年信号分离评估活动。载于《潜在变量分析与信号分离》,第 293–305 页。Springer,2018 年。
  • Taal 等人 [2011] Cees H Taal、Richard C Hendriks、Richard Heusdens 和 Jesper Jensen。一种用于时间-频率加权含噪语音可懂度预测的算法。《IEEE 音频、语音与语言处理汇刊》,19(7):2125–2136,2011 年。
  • Team Seedance 等人 [2026] Team Seedance、De Chen、Liyang Chen、Xin Chen 等人。Seedance 2.0:推进面向世界复杂性的视频生成。arXiv 预印本 arXiv:2604.14148,2026 年。
  • Wang 等人 [2026] Haoxu Wang、Biao Tian、Weiqin Li、Xiang Lv、Han Zhao 和 Xiangang Li。Flowtts-grpo:基于流匹配的文本转语音的在线强化学习与多目标奖励优化。arXiv 预印本 arXiv:2606.23190,2026 年。
  • Wang 等人 [2023] Hui Wang、Siqi Zheng、Yafeng Chen、Luyao Cheng 和 Qian Chen。Cam++:一种使用上下文感知掩码的快速高效说话人验证网络。arXiv 预印本 arXiv:2303.00332,2023 年。
  • Wang 等人 [2024] Lean Wang、Huazuo Gao、Chenggang Zhao、Xu Sun 和 Damai Dai。混合专家模型的无辅助损失负载均衡策略。arXiv 预印本 arXiv:2408.15664,2024 年。
  • Wang 等人 [2025] Xinsheng Wang、Mingqi Jiang、Ziyang Ma、Ziyu Zhang、Songxiang Liu、Linqin Li、Zheng Liang、Qixi Zheng、Rui Wang、Xiaoqin Feng 等人。Spark-tts:一种基于 LLM 的高效文本转语音模型,采用单流解耦语音 token。arXiv 预印本 arXiv:2503.01710,2025 年。
  • Xie 等人 [2025a] Hanke Xie、Haopeng Lin、Wenxiao Cao、Dake Guo、Wenjie Tian、Jun Wu、Hanlin Wen、Ruixuan Shang、Hongmei Liu、Zhiqi Jiang 等人。Soulx-podcast:迈向具有方言和副语言多样性的逼真长篇播客。arXiv 预印本 arXiv:2510.23541,2025a。
  • Xie 等人 [2025b] Kun Xie、Feiyu Shen、Junjie Li、Fenglong Xie、Xu Tang 和 Yao Hu。Fireredtts-2:面向播客和聊天机器人的长对话语音生成。arXiv 预印本 arXiv:2509.02020,2025b。
  • Xu 等人 [2024] Yaoxun Xu、Hangting Chen、Jianwei Yu、Qiaochu Huang、Zhiyong Wu、Shi-Xiong Zhang、Guangzhi Li、Yi Luo 和 Rongzhi Gu。Secap:利用大语言模型进行语音情感描述。收录于《AAAI 人工智能会议论文集》,第 38 卷,第 19323–19331 页,2024 年。
  • Yamagishi 等人 [2019] Junichi Yamagishi、Christophe Veaux 和 Kirsten MacDonald。CSTR VCTK 语料库:用于 CSTR 语音克隆工具包的英语多说话人语料库(版本 0.92),2019 年。
  • Yang 等人 [2025] An Yang、Anfeng Li、Baosong Yang 等人。Qwen3 技术报告。arXiv 预印本 arXiv:2505.09388,2025 年。
  • Yang 等人 [2024] Bing Yang、Changsheng Quan、Yabo Wang、Pengyu Wang、Yujie Yang、Ying Fang、Nian Shao、Hui Bu、Xin Xu 和 Xiaofei Li。Realman:用于动态语音增强和定位的真实录制并标注的麦克风阵列数据集。神经信息处理系统进展,37:105997–106019,2024 年。
  • Yang 等人 [2023] Dongchao Yang、Jinchuan Tian、Xu Tan、Rongjie Huang、Songxiang Liu、Xuankai Chang、Jiatong Shi、Sheng Zhao、Jiang Bian、Xixin Wu 等人。Uniaudio:面向通用音频生成的音频基础模型。arXiv 预印本 arXiv:2310.00704,2023 年。
  • Zen 等人 [2019] Heiga Zen、Viet Dang、Rob Clark、Yu Zhang、Ron J. Weiss、Ye Jia、Zhifeng Chen 和 Yonghui Wu。Libritts:源自 LibriSpeech 的文本转语音语料库。收录于 Interspeech 会议论文集,第 1526–1530 页,2019 年。
  • Zezario 等人 [2020] Ryandhimas E. Zezario、Szu-Wei Fu、Chiou-Shann Fuh、Yu Tsao 和 Hsin-Min Wang。Stoi-net:一种基于深度学习的非侵入式语音可懂度评估模型。收录于亚太信号与信息处理协会年度峰会暨会议,APSIPA 2020,新西兰奥克兰,2020 年 12 月 7–10 日,第 482–486 页。IEEE,2020 年。
  • Zhang 和 Sennrich [2019] Biao Zhang 和 Rico Sennrich。均方根层归一化。神经信息处理系统进展,32,2019 年。
  • Zhang 等人 [2024a] Leying Zhang、Yao Qian、Long Zhou、Shujie Liu、Dongmei Wang、Xiaofei Wang、Midia Yousefi、Yanmin Qian、Jinyu Li、Lei He 等人。Covomix:推进类人多说话人对话的零样本语音生成。神经信息处理系统进展,37:100291–100317,2024a。
  • Zhang [2019] Richard Zhang。让卷积网络重新具备平移不变性。收录于国际机器学习会议,第 7324–7334 页。PMLR,2019 年。
  • Zhang 等人 [2025a] Xin Zhang、Tianrui Liu、Han Li、Zhi Li、Wenbo Wang、Yunhua Zhu、Zheng Wang 等人。MiMo-Audio:音频语言模型是少样本学习者。arXiv 预印本 arXiv:2512.23808,2025a。
  • Zhang 等人 [2026] Xueyao Zhang、Chaoren Wang、Huan Liao、Ziniu Li、Yuancheng Wang、Li Wang、Dongya Jia、Yuanzhe Chen、Xiulin Li、Zhuo Chen 和 Zhizheng Wu。SpeechJudge:迈向人类水平的语音自然度评判。收录于国际学习表征会议,2026。
  • Zhang 等人 [2024b] Yu Zhang、Rongjie Huang、Ruiqi Li、JinZheng He、Yan Xia、Feiyang Chen、Xinyu Duan、Baoxing Huai 和 Zhou Zhao。Stylesinger:面向域外歌声合成的风格迁移。收录于 AAAI 人工智能会议论文集,第 38 卷,第 19597–19605 页,2024b。
  • Zhang 等人 [2024c] Yu Zhang、Ziyue Jiang、Ruiqi Li、Changhao Pan、Jinzheng He、Rongjie Huang、Chuxin Wang 和 Zhou Zhao。Tcsinger:具有风格迁移和多层级风格控制的零样本歌声合成。收录于 2024 年自然语言处理实证方法会议论文集,第 1960–1975 页,2024c。
  • Zhang 等人 [2024d] Yu Zhang、Changhao Pan、Wenxiang Guo、Ruiqi Li、Zhiyuan Zhu、Jialei Wang、Wenhao Xu、Jingyu Lu、Zhiqing Hong、Chuxin Wang 等人。Gtsinger:一个面向所有歌唱任务的、带有真实乐谱的全球多技术歌声语料库。神经信息处理系统进展(NeurIPS),2024d。
  • Zhang 等人 [2025b] Yu Zhang、Wenxiang Guo、Changhao Pan、Dongyu Yao、Zhiyuan Zhu、Ziyue Jiang、Yuhan Wang、Tao Jin 和 Zhou Zhao。TCSinger 2:可定制的多语言零样本歌声合成。收录于计算语言学协会第 63 届年会论文集,第 13280–13294 页,奥地利维也纳,2025b。计算语言学协会。
  • Zhang 等人 [2025c] Yu Zhang、Wenxiang Guo、Changhao Pan、Zhiyuan Zhu、Tao Jin 和 Zhou Zhao。Isdrama:通过多模态提示生成沉浸式空间戏剧。arXiv 预印本 arXiv:2504.20630,2025c。
  • Zhang 等人 [2025d] Yu Zhang、Wenxiang Guo、Changhao Pan、Zhiyuan Zhu、Ruiqi Li、Jingyu Lu、Rongjie Huang、Ruiyuan Zhang、Zhiqing Hong、Ziyue Jiang 等人。基于提示词控制的通用歌曲生成框架。arXiv 预印本 arXiv:2504.19062,2025d。
  • Zhang 等人 [2025e] Yu Zhang、Baotong Tian 和 Zhiyao Duan。Conan:用于零样本自适应声音转换的分块在线网络。载于 2025 年 IEEE 自动语音识别与理解研讨会,2025e。
  • Zhou 等人 [2025] Siyi Zhou、Yiquan Zhou、Yi He、Xun Zhou、Jinchao Wang、Wei Deng 和 Jingchen Shu。Indextts2:情感表达与时长可控自回归零样本文本转语音的突破。arXiv 预印本 arXiv:2506.21619,2025。
  • Zhou 等人 [2024] Yixuan Zhou、Xiaoyu Qin、Zeyu Jin、Shuoyi Zhou、Shun Lei、Songtao Zhou、Zhiyong Wu 和 Jia Jia。VoxInstruct:基于统一多语言码本语言建模的富有表现力的人类指令转语音生成。载于第 32 届 ACM 国际多媒体会议论文集,第 554–563 页,2024。
  • Zhou 等人 [2026] Yixuan Zhou、Guoyang Zeng、Xin Liu、Xiang Li、Renjie Yu、Jiancheng Gui、Jiaheng Wu、Ziyang Wang、Xudong Shen、Runchuan Ye、Zhisheng Zhang、Jiuyang Zhou、Bingsong Bai、Weiyue Sun、Mengyuan Deng、Qundong Shi、Zhiyong Wu 和 Zhiyuan Liu。VoxCPM2 技术报告。arXiv 预印本 arXiv:2606.06928,2026。
  • Zhu 等人 [2025a] Han Zhu、Wei Kang、Liyong Guo、Zengwei Yao、Fangjun Kuang、Weiji Zhuang、Zhaoqing Li、Zhifeng Han、Dong Zhang、Xin Zhang 等人。Zipvoice-dialog:基于流匹配的非自回归口语对话生成。arXiv 预印本 arXiv:2507.09318,2025a。
  • Zhu 等人 [2025b] Zhiyuan Zhu、Yu Zhang、Wenxiang Guo、Changhao Pan 和 Zhou Zhao。ASAudio:高级空间音频研究综述。载于第 14 届国际自然语言处理联合会议暨亚太计算语言学协会第 4 届会议论文集,第 417–442 页,印度孟买,2025b。亚洲自然语言处理联合会与计算语言学协会。
  • Zoph 等人 [2022] Barret Zoph、Irwan Bello、Sameer Kumar、Nan Du、Yanping Huang、Jeff Dean、Noam Shazeer 和 William Fedus。ST-MoE:设计稳定且可迁移的稀疏专家模型。arXiv 预印本 arXiv:2202.08906,2022 年。

6 字幕风格矩阵

适用范围。以下矩阵浓缩了第 2 节中介绍的三个媒体族类的标注指南:动画;短剧与影视剧;以及广告与数字人内容。源指南是分层级的:动画从广泛的受众和话题趋势延伸到角色层面的声音原型,而剧集则通过对话和演绎证据来细化角色身份。广告与数字人标注将人物形象和声音风格候选与表现力及行业特定的说话策略相结合。这些矩阵为遵循强烈媒体惯例的片段提供软先验,不用于普通数据。

标注流程。标注者首先根据场景触发条件选择适用的矩阵。只有实际说话的说话者才会被列出,按首次发声顺序排列。每个说话者条目以感知性别和年龄段开头,并添加三到五个稳定且有区分度的特征:在言语或演绎支持的情况下给出角色或人物形象、稳定的音色,以及习惯性的演绎方式。矩阵为这些特征提供候选描述。情绪、语速、音量、停顿、强调、犹豫以及局部音频效果在话语层面的变化,按时间顺序记录在内容中。每一个保留的描述符都必须有录音中相应时间位置的可听证据支持。

媒体内容 · 前往原文查看
表 9:动画风格字幕的浓缩风格矩阵。
方面 浓缩规则
典型触发条件 动画、卡通、动漫、配音、角色扮演声音,以及其他遵循角色配音惯例的片段。
稳定说话者画像 按顺序描述感知性别、大致年龄、在有帮助时给出可听到的声音原型、稳定的音色,以及习惯性的演绎方式。诸如充满活力的主角、内敛的成熟说话者或喜剧配角声音等原型,需要有声音表演中的明确证据支持。
局部演绎 在按时间顺序排列的“内容”字段中,记录夸张的反应、突发的情绪转变、抖包袱的时机、喊叫、笑声、犹豫,以及节奏、音量或兴奋程度的变化。
声学证据 将描述建立在诸如习惯性音高范围、明亮度、气声感、力度、起音强度、停顿以及克制或夸张的程度等线索之上。
代表性区分 动作导向的片段偏好更大的响度动态、更快的节奏和更强的爆发力;爱情题材偏好更精细的情绪控制、气声和停顿;悬疑题材偏好克制、清晰的表达;历史或宫廷题材偏好正式的措辞和沉稳的表达。
媒体内容 · 前往原文查看
表 10:短剧与影视剧风格字幕的浓缩风格矩阵。
维度 浓缩规则
典型触发场景 短剧、微短剧、竖屏剧、剧本化短视频、网剧、电影、电视剧,以及其他以对话为主的舞台化媒介。
稳定的说话人画像 描述感知到的性别、大致年龄、由口语对话或发声方式所支撑的角色或社会身份、稳定的音色,以及习惯性的表达方式。
局部表达 在按时间顺序排列的“内容”字段中,记录打断、冲突、情绪升级、反转、恳求、威胁、命令、犹豫,以及由关系驱动的节奏、音量或语气变化。
声学证据 使用诸如节奏、措辞、戏剧化色彩、受控的停顿、冷漠、谄媚的表达方式以及强度的突变等可听属性来描述表达方式。角色身份需要有支撑性的对话或角色证据。
代表性区分 示例包括秘书式表达(语速快、清晰、正式)、护卫式表达(沉稳、简短、有力)、谄媚或太监式表达(声音尖细、句尾上扬、措辞恭敬)。
媒体内容 · 前往原文查看
表 11:广告与数字人风格字幕的浓缩风格矩阵。
维度 浓缩规则
典型触发场景 广告、商业配音、数字人内容、直播带货、产品推荐、产品种草、营销话术,以及剧本化的促销旁白。
稳定的说话人画像 描述感知性别、大致年龄、由语音功能支持的人物类型、音色风格类别、音质以及习惯性的产品推销表达方式。主持人、产品推荐人、讲师或服务人员等人设标签需要从口语内容或表达方式中获取证据。
本地化表达 在按时间顺序的内容字段中记录卖点强调、紧迫感、价格或折扣强调、行动号召、提问钩子、建立信任的解释、对话式软化以及兴奋程度的变化。
声学证据 将描述建立在可听见的属性上,如友好度、权威感、活力、技术密度、对话温度、节奏规律性、停顿时机、情感范围以及照本宣科式的措辞。合成语音的判断需要直接的听觉证据。
代表性区分 代表性群体包括产品推荐人和直播主播、健康或教育讲解者、金融或商业演讲者以及服务角色;匹配的风格范围从对话式分享和讲故事到充满活力的销售和结构化讲解。

7 SwanVerifier

7.1 动机

Speakers 字段为 SwanTale 提供稳定、可控的说话人属性。在嘈杂的媒体音频、儿童或老年人语音、角色扮演配音、广告、动画和游戏风格配音中,自动字幕生成器难以识别感知年龄和性别。由于这些标签在训练数据中反复出现,系统性错误会造成重复性的监督信号,而非孤立的字幕错误。

SwanVerifier 为这些粗粒度属性提供基于波形的校验。它测试人口统计标签在声学上是否合理,并在波形或预测不明确时选择弃权;字幕生成不在其职责范围内。当自动证据不足时,详细的人物设定、角色和表达风格仍由字幕标注和人工审核来处理。

7.2 概述

SwanVerifier 是一个基于预训练 WavLM 编码器 [10] 构建的轻量级音频标注器。输入波形会被重采样至 16 kHz,并编码为帧级语音表征,再由各属性专属的池化头汇总生成话语级预测。在其主要一致性检查中,SwanData-Caption 使用以下两个人口统计学属性头:

  • 年龄段:儿童、青少年、青年-成人、中年、老年。

  • 感知性别:即标注清单中的男性和女性标签。

底层标注器还输出情绪、音高、音高标准差和语速。我们将这些输出视为辅助证据,而非自动人口统计学修正的依据。短暂的情感波动、强调语气、犹豫以及特定场景下的表演风格均保留在 Content 字段中,并在最终标注和审核环节对每个保留样本进行检查。

7.3 问题设定

设 为包含以下说话人清单的标注:c

𝒟​(c)={d1,…,dK},

其中 是 Speakers 字段中说话人 的规范化描述。在验证过程中, 表示归属于该说话人的一段语音片段。仅当 包含单个声学上可分离的说话人时,才应用自动人口统计学检查;存在未解决的重叠、串扰或归属不确定的片段会跳过硬性验证,留待后续审核,之后再进行任何自动修复。dkkxkxk

当 中存在相应的 token 时,设 和 分别表示其规范化的年龄和感知性别标签。SwanVerifier 按如下方式估计其类别分布:dkya,kyg,k

pa(⋅∣xk),pg(⋅∣xk),

并将每个置信度足够高的预测与相应的标注标签进行比较。缺失的标签不会被推断或插入。因此,SwanVerifier 是一种选择性一致性检查工具,而非完整的说话人画像系统。

7.4 主干编码与预测头

WavLM 将语音片段映射为帧级隐藏状态,

Hk=EncWavLM​(xk)∈ℝTk×d,

其中 为有效声学帧的数量。对于每个人口统计学属性 ,一个注意力池化头形成如下话语级表征:Tkr∈{a,g}

αk,t(r)=exp⁡(qr⊤​hk,t)∑τ=1Tkexp⁡(qr⊤​hk,τ),vk,r=∑t=1Tkαk,t(r)​hk,t.

相应的分类器产生如下输出分布:

ok,r=Wrvk,r+br,pr(⋅∣xk)=softmax(ok,r).

独立的预测头使得年龄和性别预测可以分别进行校准和审计。

7.5 训练目标

人口统计头使用归一化标签上的交叉熵进行训练:

ℒtag=λawya,kCE(pa(⋅∣xk),ya,k)+λgCE(pg(⋅∣xk),yg,k),

其中用于补偿年龄类别不平衡。仅当标签可用时才评估某一项。辅助情绪头在具有非未知情绪标签的样本上进行训练;其余辅助输出在此流程中仅用作次要信号。wya,k

7.6 训练与范围

我们在带有标签的语音上微调了一个基于 WavLM 的标注器,这些语音的说话人和话语属性可映射到验证器的分类体系。没有明确声学主体的样本被排除在受监督的人口统计检查之外。SwanVerifier 是一个内部过滤组件,而非新的标注基准;因此,以下结果描述的是数据流程中使用的验证器,不应被解读为与专门的说话人属性系统进行比较。

7.7 评估

我们在一个留出的带标签划分上评估最终模型。表 12 报告了话语级准确率;情绪准确率仅在具有非未知情绪标签的样本上计算。

媒体内容 · 前往原文查看
表 12:SwanVerifier 在留出带标签划分上的话语级准确率(%)
划分 年龄 性别 情绪
留出带标签划分 86.11 97.60 92.75

这些结果确立了过滤组件在其留出划分上的运行准确率。它们并不表明每个预测都可以安全地用于自动修正,因此推理还需要基于置信度的弃权机制,并将模糊案例留给人工审核。

7.8 推理流程

在字幕验证期间,SwanVerifier 处理来自语音流中带说话人属性的片段。只有当预测超过该属性的置信度阈值时,才会将其与归一化的人口统计 token 进行比较。置信度高的匹配保持字幕不变;置信度高的不匹配将该样本标记为需要修复、重新生成字幕或移除。低置信度预测、未解决的说话人重叠以及缺失的人口统计 token 在这些基于置信度的验证规则下不会产生自动决策。

以这种方式限制自动决策,旨在针对系统性的年龄和性别标签错误,而不会将推断出的用户画像、角色身份或临时性投递信息视为人口统计证据。在数据管道的全过程中,通过字幕级检查和人工试听审核来处理这些更丰富的属性。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org

相关事件