跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-06-05精选AI 评分73

dots.tts 技术报告

dots.tts Technical Report

AI 导读

dots.tts 是一个 2B 参数的连续自回归 TTS 基座模型,在连续潜在空间中建模语音。其创新包括:多目标训练的 AudioVAE 构建语义结构化连续语音空间;全历史条件的 flow-matching 头保持长程一致性;无奖励自纠正后训练提升鲁棒性和音质。在 Seed-TTS-Eval 上取得最佳平均性能,中文/英文/中文-hard 的 WER 分别为 0.94%/1.30%/6.60%,SIM 分别为 81.0/77.1/79.5。其他基准也达开源 SOTA。基于 CFG 的 MeanFlow 蒸馏实现低延迟推理,输出流首包 85ms,双流 54ms。训练推理代码及检查点已开源。

推荐理由

dots.tts 在中文 TTS 上把 WER 压到 0.94%,开源且 Apache 2.0 许可,想做语音产品的团队该立刻拉代码试试,单看延迟数据就值了。

正文 · AI 翻译
摘要

我们提出 \robotoslablightdots.tts,一个 2B 参数的连续自回归文本转语音(TTS)基础模型,该模型在连续潜在空间中建模语音。与现有的连续自回归模型相比,我们的关键创新有三点。首先,我们训练了一个具有多个目标的 AudioVAE,以构建一个语义结构良好且易于预测的连续语音空间。其次,我们在流匹配头中使用了全历史条件,以保持长程一致性并减少生成过程中的漂移。第三,我们对流匹配头应用了无奖励的自我修正后训练,以进一步提高鲁棒性和声学质量。在大规模多语言语料库上训练后,\robotoslablightdots.tts 在 Seed-TTS-Eval 上取得了最佳平均性能,在中文/英文/中文困难测试集上的词错误率(WER)分别为 0.94%/1.30%/6.60%,相似度(SIM)得分分别为 81.0/77.1/79.5。在其他基准测试中,\robotoslablightdots.tts 也持续展现出开源领域最先进的性能,表现出强大的生成稳定性、声音克隆能力和情感表现力。为了实现高效推理,我们进一步应用了 CFG 感知的 MeanFlow 蒸馏,实现了低延迟的语音生成,在输出流模式和双流模式下,首包延迟分别为 85 毫秒和 54 毫秒。为了促进可重复研究和实际部署,我们在 Apache 2.0 许可下发布了训练和推理代码,以及预训练、后训练和 MeanFlow 蒸馏后的检查点。

代码: https://github.com/rednote-hilab/dots.tts
模型: https://huggingface.co/collections/rednote-hilab/dotstts
演示: https://rednote-hilab.github.io/dots.tts-demo

1 引言

文本转语音(TTS)系统已在标准朗读语音基准测试中基本解决了可懂度问题。用户对现代系统的期望更为广泛:表达性强且可控的输出、实时合成,以及覆盖中性朗读、情感对话、副语言事件、歌唱和通用音频。当前系统大致沿着三条不同的技术路线追求这一目标,而每条路线都有其自身未解决的问题。

第一条路径是在流匹配(Lipman 等人,2023)或扩散模型填充基础上进行非自回归(NAR)生成。Voicebox(Le 等人,2023)、F5-TTS(Chen 等人,2025b)、OmniVoice(Zhu 等人,2026)和 LongCat-AudioDiT(Xin 等人,2026)均属于此类。它们通过单次并行前向传播生成一段语音,而少步知识蒸馏(Liu 等人,2023;Geng 等人,2025)可将推理延迟压至极低水平。NAR 非常适合离线数据合成、配音和资产制作,而自回归(AR)生成则更适用于交互场景。本报告将聚焦于 AR 一侧。

随着大语言模型取得巨大成功,基于离散 token 的自回归生成已成为主流生产范式。CosyVoice 系列(Du 等人,2025)、Qwen3-TTS(Qwen 团队,2026)、Llasa(Ye 等人,2025a)、IndexTTS(Deng 等人,2025;Zhou 等人,2026)以及 Seed-TTS(Seed 团队,字节跳动,2024b)均遵循该路线的某种变体。将语音压缩为离散词表,使得系统能够复用文本大语言模型(LLM)的大部分技术栈:稳定的下一个 token 预测训练、成熟的 SFT 和偏好优化工具、经过充分验证的扩展规律,以及高效的推理内核。这正是其在部署中占据主导地位的原因。离散 AR 的局限性源于 tokenizer,它限制了大语言模型(LM)的表达能力。这一瓶颈解释了为何离散 token 系统难以在单一分布中同时覆盖语音、情感副语言、歌唱和环境音。

近期一系列工作通过将语音建模为连续表示的 AR 生成,消除了这一瓶颈。这些方法的主要区别在于其每步分布的参数化方式。KALL-E(Xia 等人,2026)使用 KL 散度目标预测 Flow-VAE 的下一帧潜在表示,且不含扩散组件。DiTAR(Jia 等人,2025)、VibeVoice(Peng 等人,2025)和 VoxCPM(Zhou 等人,2025)将语言模型主干与逐块扩散或流匹配头部相结合,而 ARDiT(Liu 等人,2024)则将这两种角色融合到一个纯解码器扩散 Transformer 中。Any2Speech(Song 等人,2026)更广泛地主张在连续分词器上进行原生智能体式生成。避免离散量化提高了感知上限,允许对语音、副语言、歌唱和通用音频使用单一分布,并保留了基于语言模型的系统易于部署的流式、提示词条件化行为。

目前阻碍这一范式达到生产成熟度的主要问题是长程误差累积。对于离散 token,编解码器会在不完美的样本到达波形之前,将其修正回有效的声学配置。而连续潜在表示则没有这种量化缓冲:每一个微小的预测误差都会被解码器忠实地重建,然后作为条件反馈到下一个 AR 步骤中。

\robotoslablight

dots.tts 是我们缩小差距的尝试:一种基于连续潜变量的端到端自回归 TTS 模型。该系统结合了三种实践。首先,我们遵循 HoliTok 风格的 VAE 方案(Li 等人,2026),在高保真语义 AudioVAE 上构建系统。在面向重构的训练之后,我们增加了多任务下游目标以及 WavLM(Chen 等人,2022)表示对齐损失,使得潜空间既具备语义性,又对自回归主干网络可学习。其次,受 ARDiT 的自回归扩散公式启发,我们将连续生成分解为三个专门的模块:用于内容对齐表示的语义编码器、用于长程文本到内容建模的大语言模型,以及用于局部声学渲染的全上下文自回归流匹配头。这种分离避免了语义推理与声学渲染在单个模块内相互竞争,从而减少了长序列生成过程中的误差累积。第三,在后训练阶段,我们将 SOAR(Qin 等人,2026)的无奖励自我修正思想适配到自回归流匹配头,使声学 DiT 暴露于其自身的偏离轨迹推理错误中,而无需奖励模型或外部教师。综合来看,这些选择在保持连续潜变量生成所带来的保真度和表现力的同时,提升了长程稳定性。

该模型在 150 万小时的语音数据上训练,在 Seed-TTS-Eval(Seed 团队,字节跳动,2024a)上实现了最先进的稳定性和零样本语音克隆质量,在 24 语言 MiniMax 多语言测试集(MiniMax 团队,2025)上平均说话人相似度领先,并在 EmergentTTS-Eval(Manku 等人,2025)和 CV3-Eval(Du 等人,2025)上具有竞争力,这些评测共同覆盖了稳定性、说话人相似度、自然度、韵律、副语言特征以及多语言覆盖能力。

为了在不损失质量的前提下实现实时和对话式应用,完整模型从设计之初就在潜在块级别上具备因果性。这种因果结构使得文本端规划与音频潜在发射能够逐步进行,从而实现了 1T1A 交错双流推理。我们进一步应用 MeanFlow 蒸馏,将流匹配 ODE 压缩到仅需 2 到 4 次函数评估,从而在相同主干网络上实现了较低的首包延迟:普通模式下为 85 毫秒,RTF 为 0.231;交错流模式下为 54 毫秒,RTF 为 0.245。完整的效率分析,包括语音克隆场景和音频提示缓存,将在第 3.4 节中报告。除了模型本身,我们还记录了连续 AR TTS 的完整训练方案,涵盖了预训练、针对流匹配头的自校正对齐阶段,以及上述的 MeanFlow 蒸馏。

总之,我们的贡献如下:

  • •

    我们提出了 \robotoslablightdots.tts,一个拥有 20 亿参数的完全连续端到端 AR TTS 系统。该系统去除了离散声学 token,同时在 Seed-TTS-Eval 上实现了最先进的稳定性和零样本语音克隆质量。

  • •

    我们通过三种互补设计缓解了连续 AR 生成的不稳定性:一个语义因果 AudioVAE、一种受 ARDiT 启发的将生成过程分解为语义规划和声学渲染的方法,以及针对流匹配头的无奖励自校正对齐。

  • •

    我们通过支持 CFG 的 MeanFlow 蒸馏和完全因果的 1T1A 交错流技术提升了推理效率,实现了适用于实时部署的低首包延迟(普通模式下 85 毫秒,RTF 0.231;交错模式下 54 毫秒,RTF 0.245;详见第 3.4 节)。

2 模型

2.1 概述

\robotoslablight

dots.tts 是一个完全连续的端到端自回归 TTS 系统,由两个解耦的网络构建而成:一个定义连续表示的音频变分自编码器(AudioVAE),以及一个每次预测一个补丁(patch)的自回归主干网络。AudioVAE 将 48 kHz 单声道语音编码为 25 Hz 下的 128 维潜在流(时间下采样),并通过 BigVGAN 风格的解码器(Lee 等人,2023)将其解码回来;训练完成后,该编码器被冻结,既作为生成目标,也作为主干网络的输入表示。

主干网络包含三个组件(图 1):一个语义编码器、一个大语言模型(LLM)和一个自回归流匹配头。LLM 处理生成的语义部分,流匹配头处理声学部分。该 LLM 从预训练的文本 LLM 初始化,接收 BPE 文本 token 以及一个 6.25 Hz 的音频语义嵌入流,并为每个音频步骤输出一个隐藏状态。在纯 TTS 模式下,文本作为前缀放置;在低延迟流式传输中,文本则以 1T1A 布局与音频交错排列(第 2.3 节)。自回归流匹配头(AR-FM)以该隐藏状态为条件,生成 25 Hz VAE 潜在变量的下一个四帧补丁。从 AudioVAE 训练流程中复用的语义编码器,将每个新生成的补丁投影回一个单一的 6.25 Hz 嵌入,该嵌入在下一步输入给 LLM。LLM 仅看到这个语义摘要,而非原始 VAE 潜在变量。我们发现这对于保持连续自回归(continuous-AR)推演的稳定性是必要的。

Refer to caption
图 1:\robotoslablightdots.tts 主干网络概览。BPE 文本 token 和 6.25 Hz 音频语义嵌入共享一个 LLM 流;每个 LLM 隐藏状态作为 AR-FM 头的条件,生成下一个四帧 VAE 潜在补丁,该补丁在下一步通过语义编码器反馈回来。AudioVAE(第 2.2 节)是单独训练的,在此处被冻结。

2.2 AudioVAE

AudioVAE 遵循并适配了 HoliTok 的训练方案和模型架构,在合成侧采用了 BigVGAN-v2 解码器的因果变体。编码器是一个完全因果的卷积堆栈,由带下采样步长的残差块构成,末端是一个后验投影层,用于生成每帧的均值和对数方差。遵循 KALL-E 的做法,我们在标准 KL 先验之上添加了流正则化,以塑造一个平滑、低噪声的潜在空间。两侧的所有卷积均为因果卷积,使 VAE 兼容严格的流式合成。

我们分两个阶段训练 AudioVAE。第一阶段仅关注重建质量:遵循 BigVGAN-v2 的方案,我们结合了多周期加多尺度子带 CQT 对抗损失、多尺度梅尔频谱重建损失以及特征匹配损失,再加上上述的 KL 加流正则化。

第二阶段关注可学习性。这种高度压缩的潜在表示具有重建能力,但保留了过多的声学变化,导致下游的大语言模型难以将其作为生成目标。为了在不牺牲重建质量的前提下使该空间具有语义结构,我们保留了第一阶段的损失,并在潜在表示上添加了两种监督信号:(i) 针对冻结的 WavLM 教师模型的帧级对齐损失,以及 (ii) 一个多任务下游模块,该模块由一个小型编码器后接一个小型大语言模型头部组成,在 ASR、情感和说话人分类目标的混合任务上进行联合训练。之后丢弃下游的大语言模型;我们仅保留编码器,主干网络将其复用为语义前端(第 2.4 节)。第二阶段在保持重建质量的同时,提升了潜在表示的下游扩散可学习性;完整的重建对比结果(与离散编解码器及其他连续表示相比)见表 1。

2.3 大语言模型主干网络

我们从 Qwen2.5-1.5B Base(Qwen 团队,2024)初始化大语言模型,并直接以 BPE 形式输入文本,而非音素。在音频侧,其运行频率为 6.25 Hz:语义编码器(第 2.4 节)将每个 25 Hz 的 VAE 潜在块压缩为一个音频语义嵌入,供下一个大语言模型步骤使用;而 AR-FM 头(第 2.5 节)则利用大语言模型的隐藏状态,输出下一个四帧 VAE 块。

训练支持两种序列布局:一种为纯文本模式,即完整文本作为前缀置于音频片段之前,用于标准文本转语音;另一种为 1T1A 交错模式,用于低延迟双流传输,详见第 2.3.1 节。两种模式仅在序列布局上有所不同,而大语言模型、语义编码器和 AR-FM 头之间的逐步骤接口完全相同。文本位置不产生损失。大语言模型通过从 AR-FM 头反向传播的流匹配梯度进行端到端优化。

从文本大语言模型出发,使我们获得了更好的韵律、更优的文本规范化能力,以及遵循自然语言风格提示词的能力。代价在于数据:基于 BPE 的骨干网络所需的语音-文本对数量远多于基于音素的方案。我们相应地扩展了训练语料库。

2.3.1 用于双流传输模式的交错序列

在 1T1A 交错模式下,单个 BPE 文本 token 与一个 6.25 Hz 的音频步骤交替出现,直至文本结束标记,之后音频单独继续:

其中 `<T>` 是一个 BPE 文本 token,`<A>` 是一个 6.25 Hz 的音频位置,`<EOT>` 标记文本流的结束。1:1 的交错方式使得上游对话大语言模型能够以其自身的文本生成速率驱动合成:每个生成的文本 token 在下一个音频步骤中被消耗,因此语音可以在生成单个文本 token 后立即开始,并逐 token 持续进行。随后,该骨干网络直接作为流式对话大语言模型的音频输出,无需在说话前缓冲完整的话语。`<EOT>` 标记覆盖了对话模型在对应语音尚未完全渲染之前就完成文本输出的常见情况:音频从已接收的文本上下文继续,直到停止头触发。

此模式专为实时对话系统设计,在该系统中,文本和音频是逐步生成的,且应在完整话语可用之前就开始合成。当合成前已准备好完整文本时,纯文本模式仍是最佳选择。

2.4 语义编码器

语义编码器是监督 AudioVAE 训练第二阶段训练的同一模块,以其预训练权重移植到主干网络中。它将每个新生成的 25 Hz VAE 潜在块转换为一个 6.25 Hz 的嵌入向量供大语言模型使用,在此过程中剥离了高变异性的声学细节。

在架构上,一个带步长的因果卷积投影器首先将输入帧率减半,随后是一个 24 层因果 Transformer,其隐藏维度和 FFN 维度分别为 [原文未提供具体数值];编码器输出随后按时间成对分组,并线性投影到大语言模型的嵌入维度,从而实现从 25 Hz 潜在帧到 6.25 Hz 大语言模型 token 的端到端降采样。每一步的严格因果性使得同一模块在流式推理过程中可以逐块展开。

由于编码器已经过预训练以暴露语义结构化的特征,它将一个潜在块映射到与大语言模型文本语义空间对齐的表示上。大语言模型因此可以在自回归展开过程中忽略声学细节,并基于历史的紧凑摘要进行条件生成。

2.5 自回归流匹配头

2.5.1 逐步潜在生成

遵循 DiTAR 和 ARDiT 的方法,我们使用一个扩散 Transformer(DiT)(Peebles 和 Xie,2023)作为速度场预测器,实例化为 18 层,隐藏维度为 [原文未提供],FFN 维度为 [原文未提供],每层均使用 RoPE,采用带 QK 归一化的 RMSNorm,以及由扩散时间步和说话人嵌入侧输入驱动的 adaLN-zero 调制。训练目标是 Liu 等人(2023)的整流流向量场,针对高斯噪声与干净潜在块之间的直线速度进行回归。推理时,我们使用少量欧拉步数求解常微分方程。

每个逐步骤 VAE 块由 4 个潜在帧组成,帧率为 25 Hz(与 VAE 潜在空间和 6.25 Hz 大语言模型流之间的帧率比相匹配);我们用 表示干净块,用 表示其带噪版本。在每个音频位置,头部会消耗一个流匹配上下文,该上下文由投影到共同隐藏空间的三个流拼接而成:

  • •

    该位置的大语言模型隐藏状态(一个 token),

  • •

    所有更早音频位置的干净块(每个块四个 token),以及

  • •

    正在生成的带噪块(四个 token)。

这些被交错排列成一个单一序列

(1)

其中,按照上述约定,每个 贡献一个 token,每个 / 贡献一个四 token 块。图 1 右上角的插图示出了这种布局,以及替换步骤——该步骤将 替换为下一步历史中已集成的 。由冻结的 CAM++ 编码器(Wang 等人,2023)提取的说话人 x-vector 作为全局 adaLN-zero 条件添加,并且在训练期间,大语言模型隐藏流和说话人流各自以概率 独立丢弃,以便在推理时实现对文本内容和音色的无分类器引导(Ho 和 Salimans,2021)。随后,CFG 在两个条件上联合应用:条件分支保留两个流,无条件分支丢弃两个流,而实际馈入 ODE 求解器的速度是两个流的标准线性外推。在推理时,自回归循环按如下方式运行:从 开始,积分器返回 ;我们将 替换为 ,追加下一对 ,积分,然后重复。每个新生成的 也会通过语义编码器反馈,以更新大语言模型下一步前向传播的音频语义输入。

2.5.2 块因果训练注意力

我们通过单次前向传播,在话语的所有块上并行训练 AR-FM 头部,同时精确再现每个块在推理时会看到的逐步骤自回归上下文。其机制是在一个拼接的因果/生成序列上应用块因果注意力掩码,该序列的两半共享位置索引。

训练序列由长度相等的两半构成。因果部分

保存了干净的大语言模型条件化历史,而生成部分

在去噪过程中,每个噪声块都处于独立采样的流匹配时间点。两半之间的位置索引会被重置:内部的 token 从 开始编号,而 则从 重新开始,并采用相同的逐块布局,因此每个 都继承了对应 的位置范围。这样一来, 和 之间的 RoPE 相位就与逐步骤推理前向传播中的相位相匹配。

Refer to caption
图 2:自回归流匹配头的注意力掩码和 RoPE 位置 ID( 个大小为 的块,/ 个大小为 的块)。(a) 针对 的块因果训练掩码。(b) 在步骤 时的逐步骤推理掩码,左侧是 KV 缓存的历史记录,右侧是新追加的 。(c) 位置 ID:训练行是 和 两个片段的拼接,红色标记位于 位置重置的边界处;推理行则将 放置在训练时所占用的相同位置上。

块因果掩码将注意力矩阵划分为四个子块(图 2): 是标准因果掩码,反映了 LLM 侧前缀的顺序; 被完全掩码,因此原因流的隐藏状态独立于噪声目标,且等于其推理时的值; 是前缀因果掩码,让每个生成块能够精确地关注 和 ,即该块在推理时看到的自回归上下文; 是对角块掩码,使得不同块在其各自采样的时间下独立进行去噪。结合共享的位置索引,这种布局使得并行训练前向传播在数值上与逐步骤推理展开完全相同,同时一次性训练所有头。

由于 AR-FM 前缀已经包含了所有 LLM 隐藏状态,AR-FM 头本身就是一个完整的文本条件语音生成器,其意义与 ARDiT 相同:原则上,它可以在没有 LLM 进一步声学反馈的情况下合成音频。我们观察到,这促使 LLM 更倾向于编码语义信息而非声学信息。

2.6 训练目标

2.6.1 AudioVAE 目标

AudioVAE 有其独立的两阶段目标,该目标在主干网络之前进行优化,并在后续所有主干阶段中保持冻结。对于每个训练片段,

(2)

其中 Stage 1 组是一个 BigVGAN-v2 风格的重建堆栈(多尺度梅尔、多周期加子带 CQT 对抗损失及其对应的特征匹配损失),通过潜变量上的 KL 散度加流先验进行正则化;Stage 2 组则增加了一个帧级余弦对齐损失(针对冻结的 WavLM 教师模型),以及一个监督损失,该损失汇总了通过下游编码器–大语言模型模块路由的 ASR、情感和说话人头部,其中编码器是保留的语义前端模块(第 2.4 节)。以下所有主干网络损失均将 AudioVAE 视为固定的编码器/解码器对。

2.6.2 预训练目标

在主干网络预训练期间,两个目标驱动整个模型。

流匹配损失。

预测速度与(采样得到的)VAE 潜变量上解析条件向量场之间的逐块均方误差。遵循整流流公式,其中 表示音频位置 处的干净四帧 VAE 潜变量块, 表示第 2.5 节定义的逐步骤流匹配上下文,我们优化

(3)

其中 从标准高斯先验中采样, 是四个 25 Hz VAE 潜变量帧的真实块, 是噪声与干净块之间的线性插值, 是基于 DiT 的 AR-FM 头部预测的速度场, 是音频位置 处作为逐步骤条件信号的大语言模型隐藏状态, 是先前生成的干净块,构成流匹配前缀(参见公式 1), 是全局说话人 x-vector。这是唯一一个通过大语言模型和语义编码器反向传播的损失:文本位置不携带损失权重,音频跨度位置被路由到流匹配头部,因此大语言模型通过从 AR-FM 头部反向传播的梯度进行端到端优化。

停止损失。

一个专用的 EOS 预测头部,即附加在大语言模型隐藏状态(每个音频位置处的分离副本)之上的两层 MLP,通过平衡的二元交叉熵进行训练,该交叉熵赋予(唯一的)正位置与所有早期负位置相同的总质量。设 为话语中的音频位置数,其中位置 为 EOS 目标,且设

表示位置 处的预测停止概率,其中 是停止梯度算子, 是 sigmoid 函数。停止损失则为

(4)

使得位置 处的单个正样本贡献的总质量与之前所有负样本的总和相等。分离隐藏状态可防止停止预测器干扰自回归展开的动态过程。

因此,主干网络的预训练总损失为

(5)

其中两项权重相等。在整个主干网络训练过程中,AudioVAE 和说话人编码器保持冻结。只有大语言模型、语义编码器、AR-FM 头、停止头以及连接这些模块的小型输入/输出投影层接收梯度。

2.6.3 后训练目标

预训练完成后,我们仅对 AR-FM 头内部的 DiT 声学生成器进行后训练。AudioVAE、说话人编码器、语义编码器和 LLM 均保持冻结,提供固定的声学、说话人和语义上下文。设 为自校正阶段中可训练的速率预测器, 为蒸馏阶段中的 MeanFlow 学生模型。上标 表示小批量中的元素索引,其中 , 为小批量大小。除非另有说明,平方范数均在潜在块维度上计算。

为简化符号,本节采用紧凑的噪声到数据表示法,与预训练中的流匹配公式保持一致。对于采样的 VAE 潜在块 ,我们写作

并将所有条件信息记为 。其中, 为高斯噪声, 为干净的 VAE 潜在块, 为流时间 处的插值块, 包含由冻结模块提供的固定声学、说话人和语义上下文。索引 表示采样的潜在块,与小批量索引 无关。

对于任意速率预测器 和条件 ,无分类器引导(CFG)写作

(6)

其中 表示丢弃条件的分支, 为 CFG 缩放系数。当 时,我们将对应的 CFG 引导预测器记为 。后训练的两个阶段均采用此约定。

自校正对齐。

在 SOAR 之后,第一阶段对预训练的 DiT 使用无奖励自校正目标。我们用 表示流匹配中随时间变化的回归权重,该权重平衡了不同噪声水平下训练样本的贡献。相同的权重函数同时用于轨迹内损失和辅助的轨迹外损失。

对于每个小批量元素 ,我们采样一个流时间 ,其中 是 上的训练时分布。对于任意时间 ,我们写作

我们还引入 作为归一化流时间中的自校正展开步长。由于我们的时间约定从 处的噪声移动到 处的数据,从时间 开始的展开会前进到

轨迹内项是通常的流匹配回归:

(7)

为了让模型暴露于自身的推理时错误,我们使用当前 CFG 引导预测器从 执行一次分离的欧拉展开:

(8)

其中 是自校正展开期间使用的 CFG 尺度。停止梯度算子阻止梯度通过展开轨迹反向传播。

然后我们将这个轨迹外状态重新加噪到原始噪声端点。设 为每个小批量元素抽取的辅助样本数量。对于 ,

(9)

辅助目标是端点一致的速率,它将 传输到 处的干净端点:

(10)

其中 是一个小的数值常数,用于避免在数据端点附近除以零。

对应的辅助损失是

(11)

设

表示保留的辅助样本集合,并设 。如果没有辅助样本被过滤,则 。使用辅助损失权重 ,自校正对齐损失是计数归一化的组合

(12)

这是第 3.2.3 节详述的流匹配原生后训练阶段;我们的自校正对齐直接将无奖励自校正应用于声学 DiT,而不是整个 TTS 堆栈。

CFG 感知的 MeanFlow 蒸馏。

第二阶段将自校正后的 DiT 冻结为教师模型。我们将这个冻结的教师模型记为 ,并训练一个学生 DiT 来预测时间区间 上的平均速率。区间端点从满足 的 对上的分布中采样

对于训练样本 ,学生在区间起始处的输入是

从 开始

我们使用冻结的教师模型,在 CFG 引导尺度下生成一条教师轨迹。

然后,教师平均速度目标通过有限差分来近似。

(13)

其中近似符号反映了用于获取该目标的数值积分方法。

学生模型采用与教师模型相同的 DiT 骨干网络,为 添加了一个时长嵌入器,并通过单次条件前向传播预测区间平均速度:

其训练目标为

(14)

我们使用自适应的逐样本权重

(15)

其中 是一个较小的数值常数。 中的停止梯度操作防止了梯度流经自适应权重项。

由于 CFG 被融合到教师目标中,学生模型在推理时通过单次条件前向传播直接匹配教师模型的 CFG 引导平均速度预测,从而避免了标准 CFG 所需的条件和无条件分别评估,同时保留了修正后的教师行为。

3 实验

本节概述了 \robotoslablightdots.tts 训练方案,并从四个维度进行评估:基础质量、多语言覆盖、跨语言声音克隆以及表现力。我们使用了 Seed-TTS-Eval、MiniMax-Speech 多语言测试集、CV3-Eval 和 EmergentTTS-Eval。

3.1 数据

总体而言,骨干网络在总计 150 万小时的音频数据上进行了训练,涵盖语音、带字幕的语音以及一小部分通用音频,这些数据来自三个来源:内部中英文语音库、精心挑选的开源 TTS 和 ASR 语料库混合集,以及一个小型带字幕配对数据集,下文将逐一介绍。

内部数据。

我们大部分训练音频来自一个内部的中英文语音语料库。统一的预处理流程包括语音增强、音源分离、基于说话人的说话人分割以及语言路由 ASR:英语及大多数其他语言使用 Whisper-Large-v3(Radford 等人,2023),普通话使用 Paraformer(Gao 等人,2022)。随后,我们通过跨 ASR 一致性、有效带宽估计、UTMOS 以及片段内 x-vector 方差进行筛选。经过筛选后,该数据集包含约 120 万小时的经过清洗、转录并按说话人组织的语音数据,用于骨干网络训练。

开源语料库。

在内部数据集的基础上,我们还整合了经过精心挑选的开源 TTS 和 ASR 语料库混合集,这些语料在重新运行相同的评分流程后达到了我们的质量标准。该混合集包括 Emilia、LibriTTS-R、HiFi-TTS、HiFi-TTS-2、WenetSpeech4TTS、AISHELL-3、Magicdata、MLS、MSR-86K、IndicVoices-R、EuroSpeech、WaxalNLP-TTS 和 FLEURS,总计约 30 万小时,贡献了我们非中日韩语言覆盖的大部分内容。

为了启动自然语言风格控制和通用音频生成,我们还整理了一个小型的配文数据集。它结合了 AutoACD(Sun 等人,2024 年)的样本(带有自然语言描述)以及一个内部子集(来自开源语料库,并补充了 Gemini 生成的说话人特征、情感、表达方式和声学环境描述)。这个配文数据集总计约 7000 小时。

3.2 训练

完整的训练流程分为三个阶段:在第 3.1 节所述的混合数据集上进行预训练、基于流匹配的原生后训练,以及用于低 NFE 推理的 MeanFlow 知识蒸馏。每个阶段的详细方案将在后续小节中介绍。

3.2.1 AudioVAE

AudioVAE 使用来自第 3.1 节内部和开源数据池的 48 kHz 音频进行训练,并加入少量通用音频数据,以使潜在表示也能覆盖非语音声音。优化采用 AdamW,参数为 、 ,以及从 到 的指数学习率衰减。第一阶段在 9.6 秒的裁剪片段上运行 50 万步。第二阶段再运行 20 万步,并将潜在表示与 WavLM 的第 23 层隐藏表示进行匹配,作为帧级教师模型。由此得到的 AudioVAE 将在本节后续部分中被冻结。

3.2.2 预训练

预训练分为三个阶段(模态对齐、通用训练和退火),逐步扩大可训练参数集、训练池和数据难度。在整个三个阶段中,我们均使用 AdamW 优化器,并采用单一的热身-稳定-衰减(WSD)学习率调度:每个阶段开始时,都会在该阶段前 1% 的步骤内进行独立的线性热身,直至达到共享的峰值学习率,而衰减阶段则推迟到最终的退火阶段,在此阶段学习率从 线性衰减至 。

阶段一:模态对齐。

第一阶段在音频表示与大语言模型的语义空间之间建立了一个可用的通道。我们冻结大语言模型主干,仅更新语义编码器和 AR-FM 头部,在内部 GPU 集群上训练,全局批次大小约为 0.5 小时的音频,共进行 10 万步优化。在此阶段,我们将数据限制为 Emilia 数据集:在完整预训练混合数据上的试运行极不稳定,我们将其归因于在编码器尚未与冻结的大语言模型对齐时,通过它们路由梯度的成本。我们还观察到,尽管大语言模型保持固定,但主干已经能够端到端地生成可理解的语音。发音经常不正确,生成的音频在 Seed-TTS-Eval 上的词错误率约为 42%,但在任何大语言模型参数被触及之前,对齐通道已明确建立。

阶段二:通用训练。

一旦模态通道建立,我们便解冻所有模块,并在第 3.1 节所述的完整数据混合集上进行端到端训练,不对各数据源进行任何显式重加权。此阶段以约 8 小时音频的全局批次大小运行 70 万步,相当于对语料库进行四轮遍历。其作用是在大规模上构建文本 token 到音频的映射,并吸收训练池中大部分的跨语言、多领域覆盖内容。

阶段三:退火。

最终阶段使用通过更严格的内部门控质量分数(如第 3.1 节所述)对通用训练池进行重新过滤后获得的高质量子集进行退火训练。该阶段运行 10 万步,大约相当于在过滤后的子集上训练一个周期,在此期间 WSD 调度进入衰减阶段,学习率从峰值线性退火至 。本节后续部分在 \robotoslablightdots.tts (Pretrain) 行下报告的所有评估数值,均使用该阶段结束时的检查点生成。

3.2.3 自我修正对齐

自我修正对齐阶段仅更新 AR-FM 头中的 DiT 声学生成器。大语言模型、语义编码器、AudioVAE 和说话人编码器均保持冻结状态。我们在与预训练相同的多语言/多方言训练池上使用公式 12 中的自我修正对齐目标,并过滤出高质量语句。训练使用包含 4 小时音频的全局批次,运行 5 万次优化步骤,其中包含 5 千步的线性预热,达到峰值学习率 ,随后通过余弦退火降至 。辅助修正权重为 。单步 rollout 使用 CFG 尺度 ,每个主样本生成 个辅助修正状态。积分时间遵循第 2.6.3 节中噪声到数据约定下的 logit-正态采样分布。

该阶段是无奖励的:它不使用奖励模型、人类偏好模型或外部声学教师模型。相反,当前的 DiT 使用公式 8 和 9 构建其自身的分离离轨状态,而公式 10 中的监督修正目标则教导同一个 DiT 将这些状态引导回干净的潜空间端点。在实践中,这直接解决了预训练与推理之间的多步 ODE 失配问题,即小的速度误差会在 AR 块之间累积。在本文中,\robotoslablightdots.tts (SOAR) 表示在此自我修正后训练阶段之后获得的检查点。

3.2.4 MeanFlow 蒸馏

在完成自我修正对齐后,我们将修正后的 DiT 冻结作为教师模型,并从中初始化一个学生 DiT 模型。学生模型保留相同的主干网络,仅添加公式 14 中使用的间隔-时长嵌入器;所有兼容的参数均从教师模型复制,而时长嵌入器则单独初始化。教师轨迹使用 16 步欧拉求解器构建,并在形成教师目标时应用 CFG,以便学生模型直接学习 CFG 引导下的平均速度预测。

MeanFlow(MF)阶段使用相同的设置和 8 小时全局音频批次,训练 50K 步,其中包含 5K 步的预热和余弦衰减至 。我们使用更大的峰值学习率 ,因为学生模型学习的是间隔条件化的平均速度目标,而非原始的瞬时速度。间隔从对数正态分布中采样,该分布在相同的噪声到数据时间参数化下具有均值 和标准差 。遵循 MeanFlow 方案,锚点样本以概率 混合,以确保优化稳定性。在推理时,学生模型将间隔更新为 ,其中 ,并且每步仅需一次条件前向传播,因为 CFG 已融合到蒸馏目标中。由此产生的 MeanFlow 蒸馏检查点记为 \robotoslablightdots.tts (MF),并用于本节后续所有标注为 \robotoslablightdots.tts (MF) 的评估。

3.3 评估

3.3.1 设置

指标。

在本节中,内容保真度通过基于 ASR 的词/字符错误率(对于英语及其他非中文语言使用 WER,为兼容表格,中文的 CER 报告为 WER)来衡量,而说话人相似度(SIM)则是生成语音的 WavLM-SV 嵌入向量与对应参考提示词之间的余弦相似度。我们遵循近期报告所采用的事实上的 ASR 惯例:英语及多语言基准测试使用 Whisper-Large-v3,普通话使用 Paraformer,MiniMax 多语言数据集中的其余语言则使用各基准测试默认的 ASR。所有在 `\robotoslablightdots.tts (Pretrain)` 行下报告的数字均来自第 3.2.2 节所述的预训练检查点;MeanFlow 蒸馏的学生模型则在推理效率部分(第 3.4 节)中报告。

推理配置。

`\robotoslablight`

`dots.tts-Pretrain` 和 `\robotoslablightdots.tts-SOAR` 使用 10 步欧拉求解器并配合 CFG,即每一步执行一次有条件和一次无条件的 DiT 前向传播,有效 NFE 为 20。相比之下,`\robotoslablightdots.tts-MF` 在无 CFG 的情况下以 NFE 进行评估:引导已融合到 MeanFlow 蒸馏目标中,因此每一步仅使用一次条件前向传播。CFG 缩放系数用于 `\robotoslablightdots.tts-Pretrain` 和 `\robotoslablightdots.tts-SOAR` 中的 CFG,以及用于训练 `\robotoslablightdots.tts-MF` 的教师目标(公式 6)。所有运行均使用 float32 并禁用 torch.compile。

基线模型。

我们与近期一系列零样本 TTS 系统进行了对比,涵盖开源发布和商业产品:CosyVoice 2 (Du et al., 2024)、CosyVoice 3 (Du et al., 2025)、Qwen3-TTS (Qwen Team, 2026)、IndexTTS 2 (Zhou et al., 2026)、FireRedTTS-2 (Xie et al., 2025)、Seed-TTS (Seed Team, ByteDance, 2024b)、MiniMax-Speech (MiniMax Team, 2025)、Fish-Audio S2 (Liao et al., 2026)、F5-TTS (Chen et al., 2025b)、MegaTTS3 (Jiang et al., 2025)、DiTAR (Jia et al., 2025)、VibeVoice (Peng et al., 2025) 和 VoxCPM 2 (VoxCPM Team, 2026)。本节报告的所有基线数据均取自原始论文或相应开源版本的官方默认推理配置;我们未对任何基线进行重新调优。

媒体内容 · 前往原文查看
表 1:在 LibriSpeech test-other 上的语音重建性能。FPS 是底层表示的时间帧率。每列中,粗体标记了非 oracle 的最佳条目。“–”表示相应来源未报告该指标。
模型 采样率 FPS PESQ STOI UTMOS SIM WER(%)
NB WB
真实音频 – – 4.55 4.64 1.000 3.50 1.000 4.59
离散 token
XY-Tokenizer 16 kHz 100 2.80 2.23 0.89 3.46 0.82 6.19
WavTokenizer 16 kHz 75 2.40 1.96 0.87 3.22 0.68 13.35
X-codec2 16 kHz 50 2.83 2.26 0.90 3.64 0.81 6.85
SAC 16 kHz 62.5 2.92 2.39 0.90 3.84 0.85 5.77
连续表示
SemanticVAE 16 kHz 40 3.99 3.80 0.969 3.76 0.963 4.15
MingTok-Audio 16 kHz 50 4.23 4.12 0.981 3.75 0.950 4.27
VibeVoice 24 kHz 7.5 2.85 – 0.823 3.72 – –
\robotoslablightdots.tts VAE 48 kHz 25 4.09 3.95 0.973 3.75 0.969 4.14

3.3.2 AudioVAE 的重建质量

在转向端到端 TTS 基准测试之前,我们首先衡量 AudioVAE 的重建性能。表 1 报告了在 LibriSpeech test-other 上,针对代表性离散神经编解码器(XY-Tokenizer (Gong et al., 2025)、WavTokenizer (Ji et al., 2024)、X-codec2 (Ye et al., 2025b)、SAC (Chen et al., 2025a))和连续表示(SemanticVAE (Niu et al., 2025)、MingTok-Audio (Yan et al., 2025) 以及 VibeVoice (Peng et al., 2025) 的连续 tokenizer)的波形重建指标。所有基线数据均取自相应的原始出版物。

上方区块中的离散 tokenizer 在 PESQ、STOI、SIM 和 WER 指标上均落后于连续表示。在连续表示组中,\robotoslablightdots.tts VAE 在表格中拥有最高的输入带宽和第二低的帧率,其 PESQ、STOI、UTMOS、SIM 和 WER 均处于该组的最高区间。另一项低帧率连续表示条目 VibeVoice(7.5 Hz)的 PESQ-NB 降至 2.85,STOI 降至 0.823。

在 WER 为 4.14、SIM 为 0.969 的情况下,潜变量本身对端到端误差几乎没有贡献,因此重建并非下游瓶颈。第二阶段(第 2.2 节)进一步加入了 WavLM 对齐和多任务监督,使潜变量可作为大语言模型生成目标进行学习。这两项改进共同促成了本节后续部分的下游 TTS 结果。

媒体内容 · 前往原文查看
表 2:Seed-TTS-Eval 上的零样本结果。每列最优值以粗体标出。
模型 参数量 test-en test-zh test-zh-hard 平均
WER(%) SIM WER SIM WER SIM WER SIM
CosyVoice 3 1.5B 2.22 72.0 1.12 78.1 5.83 75.8 3.06 75.3
F5-TTS 0.3B 2.00 67.0 1.53 76.0 8.67 71.3 4.10 71.4
FireRedTTS 2 1.5B 1.95 66.5 1.14 73.6 8.98 70.3 4.02 70.1
IndexTTS 2 1.5B 2.23 70.6 1.03 76.5 7.12 75.5 3.46 74.2
MegaTTS 3 0.5B 2.79 77.1 1.52 79.0 — — — —
MiniMax-Speech — 1.65 69.2 0.83 78.3 — — — —
Qwen3-TTS 1.7B 1.23 71.7 1.22 77.0 6.76 74.8 3.07 74.5
Seed-TTS — 2.25 76.2 1.12 79.6 7.59 77.6 3.65 77.8
DiTAR 0.6B 1.69 73.5 1.02 75.3 — — — —
VibeVoice 1.5B 3.04 68.9 1.16 74.4 — — — —
VoxCPM 2 2B 1.84 75.3 0.97 79.5 8.13 75.3 3.65 76.7
\robotoslablightdots.tts (Pretrain) 2B 1.34 76.8 0.96 80.5 6.46 79.2 2.92 78.8
\robotoslablightdots.tts (SOAR) 2B 1.30 77.1 0.94 81.0 6.60 79.5 2.95 79.2
– MF, NFE=4 2B 1.29 76.2 0.94 80.0 6.60 78.5 2.94 78.2
– MF, NFE=3 2B 1.41 75.9 1.02 79.9 7.19 78.6 3.21 78.1
– MF, NFE=2 2B 1.51 75.2 1.04 79.1 7.74 76.7 3.43 77.0

3.3.3 Seed-TTS-Eval

Seed-TTS-Eval 是一个广泛使用的零样本语音克隆基准测试,也是本报告的主要对比基准。我们在标准零样本协议下对所有三个子集(test-en、test-zh、test-zh-hard)进行评估:模型以训练期间未见过的约 3 秒参考提示为条件,生成目标文本,并使用基准测试的参考 ASR 和 WavLM-SV 相似度进行评分。

表 2 报告了结果。\robotoslablightdots.tts 在两个指标上均取得了最佳平均值。在 SIM 指标上,SOAR 行以 79.2 领先,比次优基线 Seed-TTS(77.8)高出 1.4,比 VoxCPM 2(76.7)高出 2.5。在 WER 指标上,Pretrain(2.92%)、SOAR(2.95%)和 MF NFE(2.94%)行的数值均低于所有报告的基线,CosyVoice 3 以 3.06% 紧随其后。

第 3.2.3 节的后训练阶段纠正了预训练与推理之间的多步 ODE 不匹配问题。表中的 Pretrain SOAR 行反映了这一修正,各项数值普遍有所改善。在 NFE 下的 MeanFlow 知识蒸馏使得每一列的 WER 与 SOAR 的差距保持在 0.01 以内,代价是 SIM 指标损失约 1 分。我们还在表中报告了 MF NFE 和 NFE 以作比较,其中 NFE 是三者中的最佳运行点。

3.3.4 MiniMax 多语言测试集

MiniMax-Speech 多语言测试集涵盖 24 种语言,每种语言包含 100 个话语和两个 MCV 参考说话人,被广泛用作多语言零样本基准。我们使用该基准的每种语言 ASR 对全部 24 种语言进行了评估。

表 3 报告了每种语言的 WER 和 SIM。\robotoslablightdots.tts(SOAR)以平均 SIM 83.9 领先,比次优基线 VoxCPM 2(82.3)高出 1.6,并且 \robotoslablightdots.tts 的一个变体在 24 种语言中的 19 种上直接取得了每种语言的 SIM 领先,另有 2 种语言持平。

WER 方面的情况则较为复杂。\robotoslablightdots.tts 在大多数语言上具有竞争力,但平均值被少数低资源语言的异常值拉高。由于这些语言的 SIM 指标保持在正常范围内,WER 差距指向 BPE token 覆盖不足(第 2.3 节)。缩小低资源语言 WER 差距的方法在第 5 节中讨论。

MeanFlow 蒸馏(MF4)在平均水平上与 SOAR 相当(6.8% / 83.5 对比 6.8% / 83.9),偶尔在个别语言上取得优势,平均行的 SIM 成本约为 0.4。

媒体内容 · 前往原文查看
表 3:MiniMax-Speech 多语言测试集上每种语言的 WER / SIM。粗体表示每行每个指标的最佳值。平均值行仅针对每个系统报告了数值的语言进行计算。∗ 粤语的 WER 反映了表中所有系统共有的 ASR 忠实度下限;SIM 列仍具有可比性。
语言 MiniMax ElevenLabs Fish-Audio S2 VoxCPM 2 \robotoslablightdots.tts (Pre.) \robotoslablightdots.tts (SOAR) \robotoslablightdots.tts (MF4)
词错误率(%) / 语音相似度 词错误率 / 语音相似度 词错误率 / 语音相似度 词错误率 / 语音相似度 词错误率 / 语音相似度 词错误率 / 语音相似度 词错误率 / 语音相似度
阿拉伯语 1.67 / 73.6 1.67 / 70.6 3.50 / 75.0 13.05 / 79.1 37.91 / 77.5 36.19 / 79.1 39.65 / 77.6
粤语∗ 34.11 / 77.8 51.51 / 67.0 30.67 / 80.5 38.58 / 83.5 37.91 / 84.7 42.32 / 85.0 37.82 / 84.0
中文 2.25 / 78.0 16.03 / 67.7 0.73 / 81.6 1.14 / 82.5 1.08 / 82.3 0.77 / 82.5 1.01 / 81.8
捷克语 3.88 / 79.6 2.11 / 68.5 2.84 / 79.8 24.13 / 78.3 5.05 / 83.8 4.25 / 84.2 5.67 / 83.9
荷兰语 1.14 / 73.8 0.80 / 68.0 0.99 / 73.0 0.91 / 80.8 1.20 / 81.4 1.39 / 82.2 1.30 / 82.1
英语 2.16 / 75.6 2.34 / 61.3 1.62 / 79.7 2.29 / 85.4 1.06 / 86.9 1.03 / 87.5 1.09 / 86.9
芬兰语 4.67 / 83.5 2.96 / 75.9 3.33 / 81.9 2.63 / 89.0 3.44 / 88.0 4.08 / 88.3 3.61 / 88.3
法语 4.10 / 62.8 5.22 / 53.5 3.05 / 69.8 4.53 / 73.5 3.82 / 78.2 3.56 / 78.6 3.26 / 78.5
德语 1.91 / 73.3 0.57 / 61.4 0.55 / 76.7 0.68 / 80.3 1.03 / 79.5 1.70 / 80.6 0.91 / 79.5
希腊语 2.02 / 82.6 0.99 / 73.3 5.74 / 79.5 2.84 / 86.0 2.97 / 87.6 3.00 / 87.6 3.19 / 87.3
印地语 6.96 / 81.8 5.83 / 73.0 14.64 / 82.1 19.70 / 85.6 14.32 / 84.5 14.24 / 84.7 14.75 / 84.8
印尼语 1.24 / 72.9 1.06 / 66.0 1.46 / 76.3 1.08 / 80.0 2.71 / 80.8 2.96 / 80.8 3.91 / 81.2
意大利语 1.54 / 69.9 1.74 / 57.9 1.27 / 74.7 1.56 / 78.0 3.16 / 84.5 3.12 / 84.7 2.16 / 84.3
日语 3.52 / 77.6 10.65 / 73.8 2.76 / 79.6 4.63 / 82.8 7.16 / 83.1 5.28 / 83.7 5.17 / 83.1
韩语 1.75 / 77.6 1.87 / 70.0 1.18 / 81.7 1.96 / 83.3 5.30 / 84.3 5.66 / 83.6 3.93 / 84.9
波兰语 1.42 / 80.2 0.77 / 72.9 1.26 / 81.9 1.14 / 88.4 2.72 / 87.3 3.59 / 87.8 3.42 / 87.5
葡萄牙语 1.88 / 80.5 1.33 / 71.1 1.14 / 78.1 1.94 / 83.7 1.64 / 83.1 2.00 / 84.3 2.40 / 83.1
罗马尼亚语 2.88 / 80.9 1.35 / 69.9 10.74 / 73.3 21.58 / 79.7 3.36 / 86.2 3.87 / 87.1 3.38 / 86.1
俄语 4.28 / 76.1 3.88 / 67.6 2.40 / 79.0 3.63 / 81.1 3.64 / 83.0 4.28 / 83.2 4.42 / 83.2
西班牙语 1.03 / 76.2 1.08 / 61.5 0.91 / 77.6 1.44 / 83.1 0.96 / 83.9 1.27 / 84.0 0.80 / 84.0
泰语 2.70 / 80.0 73.94 / 58.8 4.23 / 78.6 2.96 / 84.0 7.45 / 83.8 7.86 / 83.9 8.03 / 84.2
土耳其语 1.52 / 77.9 0.70 / 59.6 0.87 / 83.5 0.82 / 87.1 5.45 / 87.4 4.96 / 87.3 6.20 / 86.8
乌克兰语 1.08 / 73.0 1.00 / 64.7 2.30 / 74.7 6.32 / 79.8 1.61 / 80.5 1.27 / 81.2 1.66 / 80.0
越南语 0.88 / 74.3 73.42 / 36.9 7.41 / 74.0 3.31 / 80.6 3.85 / 80.7 3.89 / 81.6 5.43 / 80.5
平均 2.8 / 76.6 7.5 / 65.5 3.7 / 78.0 5.7 / 82.3 6.6 / 83.5 6.8 / 83.9 6.8 / 83.5

3.3.5 CV3-Eval

CV3-Eval 与 CosyVoice 3 一同发布,它用中英文的困难子集对前两个基准进行了补充,更重要的是,它还包含一个跨语言语音克隆子集,该子集使用一种语言的参考说话人生成另一种语言的文本。跨语言克隆是音色解耦最困难的测试之一。

媒体内容 · 前往原文查看
表 4:CV3-Eval 上的结果。W 为 WER,S 为 SIM。
模型 单语言 W(%) enzh zhen
zh en hard-zh hard-en W S W S
CosyVoice 2 4.08 6.32 12.58 11.96 13.50 63.3 6.47 64.3
CosyVoice 3 (1.5B) 3.91 4.99 9.77 10.55 8.01 66.9 4.32 66.4
Fish-Audio S2 2.65 2.43 9.10 4.40 — — — —
VoxCPM 2 3.65 5.00 8.55 8.48 — — — —
\robotoslablightdots.tts (Pretrain) 3.51 5.24 9.69 5.99 10.88 74.6 4.97 71.9
\robotoslablightdots.tts (SOAR) 3.71 4.50 9.22 4.49 10.75 75.0 5.66 72.8
\robotoslablightdots.tts (MF, NFE=4) 3.95 4.05 9.10 4.37 10.73 73.8 5.24 70.9

表˜4 报告了 CV3-Eval 的数值。\robotoslablightdots.tts (MF4) 在 hard-en 上以 4.37% 领先,而 FishAudio S2 和 VoxCPM 2 在其他三个单语言子集上领先,\robotoslablightdots.tts 具有竞争力但未领先。Pretrain 到 SOAR 在 hard-en 上的下降(5.99 到 4.49)是我们在本节基准中观察到的最大 SOAR 阶段增益,而 MF4 通过知识蒸馏继承了这一增益。

在跨语言子集上,\robotoslablightdots.tts (SOAR) 在两个方向上的 SIM 均领先,分别为 75.0 (enzh) 和 72.8 (zhen),比 CosyVoice 3 (66.9 / 66.4) 高出 6 到 8 个绝对百分点。跨语言 WER 落后于 CosyVoice 3(zhen 为 5.66% 对比 4.32%,enzh 为 10.75% 对比 8.01%)。

3.3.6 EmergentTTS-Eval

EmergentTTS-Eval 使用 Gemini-2.5-Pro-0506 音频评判器,将各系统与固定的 gpt-4o-mini-tts 参考系统进行两两对比,涵盖六个面向表现力的场景:情感、外来词、副语言、复杂发音、疑问句和句法复杂度。我们报告了在 \robotoslablightdots.tts 的标准零样本配置下,基于 ASR 的词错误率(WER)以及评判器的偏好胜率(越高越好)。对于开源系统,我们使用 basic_ref_en¹ 作为通用的零样本语音克隆提示,所有运行均采用续说式语音克隆模式。

媒体内容 · 前往原文查看
表 5:EmergentTTS-Eval 中选定的行,按总体得分排序。⋆ 标记闭源/商业系统。粗体表示每列最佳,下划线表示每列最佳开源系统。胜率由 Gemini-2.5-Pro-0506 在与 gpt-4o-mini-tts 的两两对比中评判得出。
模型 语音 词错误率(%) 总体 情感 副语言 外来词 复杂发音 疑问句 句法
Gemini-2.5-Flash-TTS⋆ Zephyr 10.39 70.7% 95.9% 91.3% 58.5% 55.7% 63.0% 57.9%
Gemini-2.5-Pro-TTS⋆ Zephyr 11.79 69.3% 86.9% 82.3% 58.2% 64.8% 61.3% 61.8%
gpt-4o-audio-preview⋆ Ballad 11.87 65.2% 88.8% 82.1% 60.2% 40.4% 57.0% 59.5%
gpt-4o-mini-tts⋆ Alloy 10.76 56.3% 59.2% 58.8% 57.3% 52.4% 52.7% 57.1%
基线:gpt-4o-mini-tts Alloy 10.61 50.0% — — — — — —
\robotoslablightdots.tts (预训练) basic_ref_en 10.86 49.2% 72.7% 54.7% 39.5% 18.0% 48.4% 58.4%
\robotoslablightdots.tts (MF4) basic_ref_en 11.75 47.9% 59.8% 55.2% 36.3% 16.7% 50.5% 64.8%
\robotoslablightdots.tts (SOAR) basic_ref_en 10.45 47.6% 63.9% 52.7% 39.4% 16.4% 47.0% 65.7%
Qwen3-TTS basic_ref_en 17.32 42.8% 39.8% 50.7% 25.4% 30.0% 48.9% 60.4%
HumeAI⋆ — 12.85 42.7% 61.6% 36.9% 34.6% 34.3% 43.2% 44.6%
Qwen3-TTS Ryan 19.65 42.3% 60.5% 62.7% 17.1% 9.8% 56.4% 43.0%
VoxCPM2 basic_ref_en 11.84 41.1% 42.3% 44.1% 33.3% 18.6% 53.4% 52.3%
MiniMax/speech-02-hd⋆ EN-narr 10.02 36.6% 40.9% 34.3% 34.3% 16.3% 47.3% 43.9%
11Labs Multilingual v2⋆ Brian 11.19 33.9% 30.4% 45.5% 35.5% 14.5% 39.5% 35.5%
F5-TTS basic_ref_en 16.47 15.3% 26.8% 21.6% 1.8% 1.4% 14.8% 23.8%

表˜5 报告了结果。\robotoslablightdots.tts(预训练)以 49.2% 的整体胜率领先开源领域,SOAR 和 MF4 紧随其后(分别为 47.6%、47.9%),这三个变体均接近 gpt-4o-mini-tts 基线(按设计为 50%)。SOAR 在开源系统中也拥有最低的词错误率(WER),为 10.45%。

在句法复杂度方面,SOAR 达到 65.7%,是开源和闭源系统中的最高分(其次是 Gemini-2.5-Pro 的 61.8%)。预训练阶段在 SOAR 上的提升在这一列达到 +7.3 个百分点,这是我们从 SOAR 阶段(第˜3.2.3 节)观察到的单列最大增益。同样的转变导致情感(从 72.7% 降至 63.9%)和副语言(从 54.7% 降至 52.7%)得分下降,表明 SOAR 以牺牲表现力为代价,增强了文本忠实度。在情感方面,预训练模型以 72.7% 的得分领先开源领域。闭源系统在这一列(87–96%)使用了精心调校的内置语音,而 \robotoslablightdots.tts 则基于一个基础参考片段进行零样本语音克隆。

在其余列中,\robotoslablightdots.tts 处于中游水平。最弱的方面是复杂发音(16–18%)和外来词(36–40%),这两者都考验罕见或分布外的词汇项。

3.4 效率

我们报告了在 vllm-omni(Yin 等人,2026)下,基于 Seed-TTS-Eval 测试集的推理时效率。大语言模型在 vLLM 上运行,采用连续批处理和分页 KV 注意力机制,而 AR-FM 头部和语义编码器则通过 torch.compile 进行即时编译。首包延迟(TTFP,毫秒)是从请求到达至发出第一个音频数据包的挂钟时间,实时因子(RTF)是生成挂钟时间与合成音频时长的比率。

所有数据均在单个 NVIDIA H800 GPU 上,使用 MeanFlow 蒸馏学生模型(第˜3.2.4 节)测得,AR-FM 头部以每音频块为单位运行。在纯文本合成中,\robotoslablightdots.tts 能够轻松实现实时运行,在纯文本模式下达到 RTF 0.231,在 1T1A 交错模式下达到 RTF 0.245。交错模式通过消耗上游大语言模型解码时产生的 token 流,将首包延迟从 85.4 毫秒降低至 54.4 毫秒,因此音频生成可以在大语言模型开始输出其响应时立即启动。

4 结论

我们提出了 \robotoslablightdots.tts,这是一个拥有 20 亿参数的全连续、端到端自回归 TTS 系统,旨在解决我们为连续自回归范式确定的两大开放性问题:自回归展开过程中的长程误差累积,以及相较于离散 token 级联而言尚不成熟的后训练技术栈。其主干架构分解为语义编码器、大语言模型和自回归流匹配头,其中输入到大语言模型的音频侧信息被限制为每个新生成片段仅 6.25 Hz 的语义摘要,而非原始 VAE 潜变量。这种解耦使得大语言模型始终基于历史的紧凑语义视图进行运算,这对长程展开的稳定性至关重要。在合成侧,一个高保真连续 AudioVAE(采用 WavLM 对齐损失和多任务下游模块进行训练,使得高速率连续潜变量对下游大语言模型保持可学习性)保留了低比特率离散编解码器通常会抹平的音色和副语言细节。我们在预训练方案中补充了自校正对齐——一种无奖励、原生流匹配的后训练阶段,教导声学 DiT 从自身的推理时错误中恢复;同时引入了 CFG 感知均值流蒸馏,使得仅需每步一次条件模型评估即可实现少步生成。

该模型在 150 万小时的语音数据上训练,在 Seed-TTS-Eval 上取得了最先进的平均 WER(2.92)和 SIM(79.2),在 24 语言 MiniMax 多语言基准测试中取得了最高的平均说话人相似度(83.9),并在 CV3-Eval 上取得了领先的困难子集和跨语言结果。在 EmergentTTS-Eval 上,它在表格中获得了最高的句法复杂度分数(65.7%,领先于所有闭源系统),并且是情感维度上最强的开源系统(72.7%)。结合 CFG 感知的 MeanFlow 蒸馏和 1 文本-1 音频交错流式布局,同一骨干网络在单张 H800 上实现了 54 毫秒的 TTFB,RTF 为 0.245,使其可部署于实时和对话场景。我们以 Apache 2.0 许可证发布完整的训练和推理代码,以及预训练、自校正对齐和 MeanFlow 蒸馏后的检查点,作为连续自回归 TTS 的可复现参考技术栈。

5 个局限性

当前系统仍存在若干局限。向大语言模型输入原始 BPE 而非音素,虽然继承了其文本能力,但代价是数据需求量更大;对于第 3.3.4 节中文字体系差异大且资源匮乏的语言(阿拉伯语、印地语、土耳其语、越南语),这导致了图中可见的低资源 WER 差距;而在第 3.3.6 节的外来词和复杂发音场景中,对外来词、技术术语和专有名词的覆盖范围也受到同样的限制。扩大这些语言的多语言预训练数据混合比例、增加一个小的音素侧辅助输入、以及插入一个语言平衡的后训练阶段,是解决该问题的直接手段。此外,已发布的系统仅在标准零样本条件下进行评估,没有明确的风格或指令控制。基于第 3.1 节中配图文数据构建的指令微调变体是顺理成章的下一步。尽管 AudioVAE 原则上与模态无关,但其主干网络是在以语音为主的数据混合上训练的,因此本次发布未涵盖歌唱以及统一的语音与声音生成。最后,高保真零样本语音克隆存在众所周知的滥用风险。已发布的检查点仅供研究和授权部署使用,我们鼓励下游用户将其与基于同意的参考音频策略、稳健的合成语音检测以及内容水印技术结合使用。

贡献者

\robotoslablight

dots.tts 由 dots、小红书公司¹以及上海交通大学计算机科学与工程学院 X-LANCE 实验室²联合开发。双方团队共同参与了模型设计、训练方案和评估工作,并且检查点、代码及本报告均联合发布。

石炼¹、李昌涛¹、李博涵²、王汉坤²、郑达¹、田俊峰¹、马宇峰¹、张科林¹、俞凯²。

参考文献

  • S. Chen, C. Wang, Z. Chen, Y. Wu, S. Liu, Z. Chen, J. Li, N. Kanda, T. Yoshioka, X. Xiao, 等. (2022) WavLM: 面向全栈语音处理的大规模自监督预训练. IEEE 信号处理选题期刊 16 (6), 第 1505–1518 页. 引用于: §1.
  • W. Chen, X. Wang, R. Yan, Y. Chen, Z. Niu, Z. Ma, X. Li, Y. Liang, H. Wen, S. Yin 等人 (2025a) SAC:基于语义-声学双流量化的神经语音编解码器。arXiv 预印本 arXiv:2510.16841。引用于:§3.3.2。
  • Y. Chen, Z. Niu, Z. Ma, K. Deng, C. Wang, J. Zhao, K. Yu 和 X. Chen (2025b) F5-tts:一种利用流匹配生成流畅且忠实语音的童话讲述者。收录于第 63 届计算语言学协会年会 (ACL) 论文集:长文,第 6255–6271 页。引用于:§1, §3.3.1。
  • W. Deng, S. Zhou, J. Shu, J. Wang 和 L. Wang (2025) IndexTTS:一种工业级可控且高效的零样本文本转语音系统。arXiv 预印本 arXiv:2502.05512。引用于:§1。
  • Z. Du, C. Gao, Y. Wang, F. Yu, T. Zhao, H. Wang, X. Lv, H. Wang, C. Ni, X. Shi 等人 (2025) CosyVoice 3:通过规模扩展和后训练实现真实场景语音生成。arXiv 预印本 arXiv:2505.17589。引用于:§1, §1, §3.3.1。
  • Z. Du, Y. Wang, Q. Chen, X. Shi, X. Lv, T. Zhao, Z. Gao, Y. Yang, C. Gao, H. Wang 等人 (2024) CosyVoice 2:基于大语言模型的可扩展流式语音合成。arXiv 预印本 arXiv:2412.10117。引用于:§3.3.1。
  • Z. Gao, S. Zhang, I. McLoughlin 和 Z. Yan (2022) Paraformer:用于非自回归端到端语音识别的快速准确并行 Transformer 架构。收录于 Interspeech 会议。引用于:§3.1。
  • Z. Geng, M. Deng, X. Bai, J. Z. Kolter 和 K. He (2025) 一步生成建模的均值流。收录于神经信息处理系统进展 (NeurIPS) 会议。备注:口头报告。引用于:§1。
  • Y. Gong, L. Jin, R. Deng, D. Zhang, X. Zhang, Q. Cheng, Z. Fei, S. Li 和 X. Qiu (2025) XY-tokenizer:缓解低比特率语音编解码器中的语义-声学冲突。arXiv 预印本 arXiv:2506.23325。引用于:§3.3.2。
  • J. Ho 和 T. Salimans (2021) 无分类器扩散引导。收录于 NeurIPS 深度生成模型及下游应用研讨会。引用于:§2.5.1。
  • S. Ji, Z. Jiang, W. Wang, Y. Chen, M. Fang, J. Zuo, Q. Yang, X. Cheng, Z. Wang, R. Li 等人 (2024) WavTokenizer:一种用于音频语言建模的高效声学离散编解码分词器。arXiv 预印本 arXiv:2408.16532。引用于:§3.3.2。
  • D. Jia, Z. Chen, J. Chen, C. Du, J. Wu, J. Cong, X. Zhuang, C. Li, Z. Wei, Y. Wang 等 (2025) DiTAR:用于语音生成的扩散Transformer自回归建模。收录于国际机器学习大会(ICML),引用自:§1, §3.3.1。
  • Z. Jiang, Y. Ren, R. Li, S. Ji, B. Zhang, Z. Ye, C. Zhang, J. Bai, X. Yang, J. Zuo 等 (2025) MegaTTS 3:面向零样本语音合成的稀疏对齐增强型潜在扩散Transformer。arXiv预印本 arXiv:2502.18924。引用自:§3.3.1。
  • M. Le, A. Vyas, B. Shi, B. Karrer, L. Sari, R. Moritz, M. Williamson, V. Manohar, Y. Adi, J. Mahadeokar 等 (2023) Voicebox:基于文本引导的大规模多语言通用语音生成。收录于神经信息处理系统大会(NeurIPS),引用自:§1。
  • S. Lee, W. Ping, B. Ginsburg, B. Catanzaro 和 S. Yoon (2023) BigVGAN:基于大规模训练的通用神经声码器。收录于国际学习表征大会(ICLR),引用自:§2.1。
  • B. Li, S. Lian, H. Wang, Y. Guo, Y. Xi, Z. Li, D. Zheng, C. Zhang 和 K. Yu (2026) HoliTok:具备语音生成与理解双重鲁棒能力的连续整体式分词器。arXiv预印本 arXiv:2605.29948。引用自:§1。
  • S. Liao, Y. Wang, S. Liu, Y. Cheng, R. Zhang, T. Li, S. Li, Y. Zheng, X. Liu, Q. Wang 等 (2026) Fish Audio S2 技术报告。arXiv预印本 arXiv:2603.08823。引用自:§3.3.1。
  • Y. Lipman, R. T. Q. Chen, H. Ben-Hamu, M. Nickel 和 M. Le (2023) 用于生成式建模的流匹配。收录于国际学习表征大会(ICLR),引用自:§1。
  • X. Liu, C. Gong 和 Q. Liu (2023) 流直且快:学习使用修正流生成与迁移数据。收录于国际学习表征大会(ICLR),引用自:§1, §2.5.1。
  • Z. Liu, S. Wang, S. Inoue, Q. Bai 和 H. Li (2024) 面向文本到语音合成的自回归扩散Transformer。arXiv预印本 arXiv:2406.05551。引用自:§1。
  • R. R. Manku、Y. Tang、X. Shi、M. Li 和 A. Smola(2025)《EmergentTTS-eval:利用模型作为评判者评估 TTS 模型在复杂韵律、表现力和语言挑战上的表现》。收录于《神经信息处理系统进展》(NeurIPS)数据集与基准测试轨道,引用于:§1。
  • MiniMax 团队(2025)《MiniMax-speech:基于可学习说话人编码器的内在零样本文本转语音》。arXiv 预印本 arXiv:2505.07916。引用于:§1、§3.3.1。
  • Z. Niu、S. Hu、J. Choi、Y. Chen、P. Chen、P. Zhu、Y. Yang、B. Zhang、J. Zhao、C. Wang 等(2025)《Semantic-VAE:面向更优语音合成的语义对齐潜在表示》。arXiv 预印本 arXiv:2509.22167。引用于:§3.3.2。
  • W. Peebles 和 S. Xie(2023)《基于 Transformer 的可扩展扩散模型》。收录于《IEEE/CVF 国际计算机视觉大会(ICCV)论文集》,引用于:§2.5.1。
  • Z. Peng、J. Yu、W. Wang、Y. Chang、Y. Sun、L. Dong、Y. Zhu、W. Xu、H. Bao、Z. Wang 等(2025)《VibeVoice 技术报告》。arXiv 预印本 arXiv:2508.19205。引用于:§1、§3.3.1、§3.3.2。
  • Y. Qin、L. Wang、H. Fei、R. Zimmermann、L. Bo、Q. Lu 和 C. Wang(2026)《SOAR:扩散模型中的自校正以实现最优对齐与精炼》。arXiv 预印本 arXiv:2604.12617。引用于:§1。
  • Qwen 团队(2024)《Qwen2.5 技术报告》。arXiv 预印本 arXiv:2412.15115。引用于:§2.3。
  • Qwen 团队(2026)《Qwen3-TTS 技术报告》。arXiv 预印本 arXiv:2601.15621。引用于:§1、§3.3.1。
  • A. Radford、J. W. Kim、T. Xu、G. Brockman、C. McLeavey 和 I. Sutskever(2023)《通过大规模弱监督实现鲁棒语音识别》。收录于《国际机器学习大会(ICML)》,引用于:§3.1。
  • Seed 团队,字节跳动(2024a)《Seed-TTS-Eval 基准测试》。说明:在 Seed-TTS 中提出,arXiv:2406.02430。引用于:§1。
  • Seed 团队,字节跳动(2024b)《Seed-TTS:高质量多功能语音生成模型系列》。arXiv 预印本 arXiv:2406.02430。引用于:§1、§3.3.1。
  • X. Song、D. Wu、D. Zhou、P. Cheng、H. Ding、Y. He、J. Wang、S. Shen、S. Lv、L. Fan 等(2026)《Any2Speech:无边界长语音合成》。arXiv 预印本 arXiv:2603.19798。引用于:§1。
  • L. Sun、X. Xu、M. Wu 和 W. Xie(2024)《Auto-acd:面向音频-语言表征学习的大规模数据集》。载于《第32届ACM国际多媒体会议论文集》(MM),引用于:§3.1。
  • VoxCPM团队(2026)《VoxCPM2:面向多语种语音生成、创意语音设计及高保真克隆的无Tokenizer文本转语音系统》。GitHub。引用于:§3.3.1。
  • H. Wang、S. Zheng、Y. Chen、L. Cheng 和 Q. Chen(2023)《CAM++:利用上下文感知掩码的快速高效说话人验证网络》。载于Interspeech会议,引用于:§2.5.1。
  • K. Xia、X. Zhu、J. Yao、W. Tian、W. Li 和 L. Xie(2026)《KALL-e:基于下一分布预测的自回归语音合成》。载于《AAAI人工智能会议论文集》,引用于:§1。
  • K. Xie、F. Shen、J. Li、F. Xie、X. Tang 和 Y. Hu(2025)《FireRedTTS-2:面向播客和聊天机器人的长对话语音生成》。arXiv预印本 arXiv:2509.02020。引用于:§3.3.1。
  • D. Xin、S. Hu、C. Yang、C. Huang、G. Yu、G. Wan 和 X. Cai(2026)《LongCat-audiodit:波形潜空间中的高保真扩散文本转语音》。arXiv预印本 arXiv:2603.29339。引用于:§1。
  • C. Yan、C. Jin、D. Huang、H. Yu、H. Peng、H. Zhan、J. Gao、J. Peng、J. Chen、J. Zhou 等(2025)《Ming-uniaudio:基于统一表征实现联合理解、生成与编辑的语音大语言模型》。arXiv预印本 arXiv:2511.05516。引用于:§3.3.2。
  • Z. Ye、X. Zhu、C. Chan、X. Wang、X. Tan、J. Lei、Y. Peng、H. Liu、Y. Jin、Z. Dai 等(2025a)《Llasa:面向基于Llama的语音合成,扩展训练时与推理时计算量》。arXiv预印本 arXiv:2502.04128。引用于:§1。
  • Z. Ye、X. Zhu、C. Chan、X. Wang、X. Tan、J. Lei、Y. Peng、H. Liu、Y. Jin、Z. Dai 等(2025b)《Llasa:面向基于Llama的语音合成,扩展训练时与推理时计算量》。arXiv预印本 arXiv:2502.04128。引用于:§3.3.2。
  • P. Yin、J. Zhu、H. Gao、C. Zheng、Y. Huang、T. Zhou、R. Yang、W. Liu、W. Chen、C. Guo 等(2026)《VLLM-omni:面向任意到任意多模态模型的完全解耦服务》。arXiv预印本 arXiv:2602.02204。引用于:§3.4。
  • S. Zhou, Y. Zhou, Y. He, X. Zhou, J. Wang, W. Deng, 和 J. Shu (2026) IndexTTS2:情感表达与时长可控的自回归零样本语音合成领域的突破性成果。载于《AAAI人工智能会议论文集》,引用自:§1, §3.3.1。
  • Y. Zhou, G. Zeng, X. Liu, X. Li, R. Yu, Z. Wang, R. Ye, W. Sun, J. Gui, K. Li, 等 (2025) VoxCPM:面向上下文感知语音生成与逼真语音克隆的无分词器语音合成技术。arXiv预印本 arXiv:2509.24650。引用自:§1。
  • H. Zhu, L. Ye, W. Kang, Z. Yao, L. Guo, F. Kuang, Z. Han, W. Zhuang, L. Lin, 和 D. Povey (2026) OmniVoice:基于扩散语言模型的全语言零样本语音合成技术。arXiv预印本 arXiv:2604.00688。引用自:§1。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org