测量语音识别中的基准优化:Hugging Face 新测试揭示 ASR 模型“刷分”现象
Measuring benchmark optimization in speech recognition
Hugging Face 最新研究引入三项测试量化语音识别中的基准优化(benchmaxxing)现象。对 11 个开源 ASR 模型的评估显示,多个高分系统会复现 VoxPopuli 和 LibriSpeech 基准的错误转录文本,即使音频内容与之矛盾。部分模型甚至依赖声学线索识别基准来源,导致其得分高估了真实转录能力。
研究把语音识别中的基准优化现象变成可量化检验,三项探针和开源脚本让模型评估者能区分真实转写提升与仅针对测试集的拟合。
公开的语音 AI 基准测试越来越表明,模型的表现已达到人类水平。然而,这些分数并不总能反映模型在真实世界中的实际运作方式。由于公开基准是开放且被广泛使用的,模型也可能针对测试本身被优化。它们的分数之所以提高,可能是因为学会了基准特有的模式,而不是因为在底层任务上变得更强。原因之一是,传统基准忽略了使语音系统在实践中可靠、自然、符合语境且高效的许多条件和特质。正因如此,我们最近在 Real World VoiceEQ、Open-ASR Leaderboard 和 Far-field ASR Leaderboard 中引入了留出集:以衡量更多在真实世界使用中真正重要的方面。
然而,仅靠更广泛的测量并不能解决这个问题。这一现象有时被称为基准优化或“benchmaxxing”,在机器学习领域常被讨论,然而在语音识别中一直难以测量。
我们最新的研究引入了三项测试来帮助量化它。我们评估了 11 个广泛使用的开源 ASR 模型,发现若干得分最高的系统会复现 VoxPopuli 英语和 LibriSpeech(clean、other)数据集的基准转写——即使音频与转写相矛盾、相关词语已被静音,或音频同样支持两种不同的书面形式时也是如此。
在某些情况下,模型似乎不仅依赖于说了什么,还依赖于那些暗示它们正在接受哪项基准测试的细微声学线索。因此,它们的得分夸大了它们在更普遍情况下转写语音的能力。
参考文本分歧(VoxPopuli 案例研究)
众所周知,VoxPopuli 包含大量转写错误(这也是 Artificial Analysis 发布清洗版本的原因)。我们的共识分歧探测测试了当领先的 ASR 模型遇到这些错误时会发生什么:它们是准确地转写音频所说的内容,还是复现基准测试中错误的参考转写?
为了大规模测试这一点,我们使用了一个由独立模型组成的集成,这些模型因其低音素错误率(PER)而被选中。PER 衡量的是书面转写与音频中声音的匹配程度,使其成为衡量模型转写所听内容忠实度的有用代理指标。集成结果可用于标记出模型一致不同意基准测试参考转写的案例。然后,我们将这些被标记案例的样本与人工标注进行比较,以验证修正后的转写。
例如,一段 VoxPopuli 音频中可以明显听到“Thank you, Mr. President”这句话,但参考转录文本却省略了“Thank you”。在我们测试的 11 个模型中,有 6 个复现了该基准的错误转录——给出了“预期”答案,尽管它与音频内容相矛盾。在真实音频片段上,格式也遵循同样的模式:省略“Thank you”的模型同时复现了该基准的标点风格,将“Mr”写作不带句点的形式,而包含可听短语的模型则倾向于写作带句点的“Mr.”。
当我们用从欧盟议会录音中新采集的声音或通用声音呈现相同内容时,这种行为往往会减弱或消失。在以下样本中,对于一段新议会录音的克隆,除一个模型外,所有模型都转回了忠实于音频的转录文本。这表明,模型是在对声学线索作出反应,这些线索帮助它们识别出基准归属,从而即使与音频相矛盾也生成预期转录。
这段音频的参考转录文本为“Mr President, I have another complaint about this procedure, which is that it is not secret.”以下三段音频实际上说的都是同样的内容,只是前面多了一句可明显听到的“Thank you”——克隆版本是对那句真实话语的文本转语音再现,因此三段中都能听到这句礼貌用语。绿色高亮和 ✅ 标记的是包含可听“Thank you”的转录;红色高亮和 ❌ 标记的是复现了该基准错误省略的转录。所有转录均为模型原始输出,未经任何规范化处理——大小写和标点均严格保留生成时的样子,包括某些模型输出的小写形式。
原始 VoxPopuli 录音
同一说话人的声音克隆
对某位议会议长的克隆,其录音时间晚于所有模型的训练截止日期
| 模型 | 真实音频片段 | 同一说话人克隆 | ep-fresh 克隆 |
|---|---|---|---|
| CohereLabs/cohere-transcribe-03-2026 | ❌ 总统先生…… | ❌ 总统先生…… | ✅ 谢谢您,总统先生…… |
| nvidia/canary-qwen-2.5b | ❌ 总统先生…… | ❌ 总统先生…… | ✅ 谢谢您,总统先生…… |
| ibm-granite/granite-speech-4.1-2b | ❌ 总统先生…… | ❌ 总统先生…… | ✅ 谢谢您,总统先生…… |
| microsoft/Phi-4-multimodal-instruct | ❌ 总统先生…… | ❌ 总统先生…… | ❌ 总统先生…… |
| nvidia/parakeet-tdt-0.6b-v2 | ❌ 总统先生…… | ✅ 谢谢您,总统先生…… | ✅ 谢谢您,总统先生…… |
| bosonai/higgs-audio-v3-8b-stt-v2 | ❌ 总统先生…… | ❌ 总统先生…… | ✅ 谢谢您,总统先生…… |
| Qwen/Qwen3-ASR-0.6B-hf | ✅ 谢谢您,总统先生…… | ✅ 谢谢您,总统先生…… | ✅ 谢谢您,总统先生…… |
| mistralai/Voxtral-Mini-3B-2507 | ✅ 谢谢您,总统先生…… | ✅ 谢谢您,总统先生…… | ✅ 谢谢您,总统先生…… |
| moonshotai/Kimi-Audio-7B-Instruct | ✅ 谢谢您,总统先生…… | ✅ 谢谢您,总统先生…… | ✅ 谢谢您,总统先生…… |
| openai/whisper-large-v3 | ✅ 谢谢您,总统先生…… | ✅ 谢谢您,总统先生…… | ✅ 谢谢您,总统先生…… |
| moonshine-ai/moonshine-streaming-medium | ✅ 谢谢您,总统先生…… | ✅ 谢谢您,总统先生…… | ✅ 谢谢您,总统先生…… |
| 把 11 个中的那个礼貌用语(❌)去掉了 | 6 | 5 | 1 |
Parakeet 是唯一一个在真实音频片段上复现基准结果、又在同一说话人克隆音频上给出正确结果的模型之间来回摇摆的模型。Phi-4 是唯一一个在 ep-fresh 克隆音频上仍然丢掉礼貌用语的模型。而当我们改用一种与任何议会录音都无关的通用 TTS 音色重新合成这句话时,全部十一个模型都恢复了礼貌用语。
结果表明,这个问题既普遍存在又意义重大。我们的方法在我们分析的 VoxPopuli 测试音频片段中,标记出 40% 存在潜在参考错误,影响了全部参考词中约 3% 的词。
表现出基准优化行为的模型,有 18–30% 的概率复现了错误的参考转录文本。下方的散点图以 VoxPopuli 词错误率(WER)为 x 轴,与每个模型复现基准错误参考(而非共识修正)的比率进行对比。WER 最低——也就是所报告的基准表现最强——的模型,同时也最有可能复现这些错误。

掩码实体检索
为了在共识分歧探针的基础上进一步验证,我们故意将测试数据集音频样本中的数字静音,然后要求模型转写它所听到的内容。数字在音频中完全不存在,因此模型不应输出任何数字,更不应输出文本中的确切数字。
其中一些数字是半可预测的(尽管模型预测出来的可能性仍然不大),而另一些则相当令人惊讶。以下片段结合了两种探针,展示了模型如何重现参考转写中的错误(包括一个错误的数字),甚至有一个模型在年份被静音的情况下自动补全了一个相当随机的年份(2011)。在下面每个模型对应的行中:
- 绿色高亮加删除线标记的是模型正确未重现的参考转写词语(忠实于音频);
- 绿色高亮加下划线标记的是模型在参考转写错误措辞处做出的正确、忠实于音频的替换;
- 红色高亮(纯文本)重现了参考转写中错误的、音频不支持的内容:保留"Mr President"、在音频说的是"one thousand six hundred"的地方写成"more than 1 amendments"、补出被静音的年份"2011",或以"plenary"结尾。
2011 年预算草案(数字已遮蔽)
| 参考 | 主席先生,在预算委员会中,我们对 2011 年预算草案的 1 项以上修正案进行了投票……在全体会议上投票。 |
|---|---|
| 音频内容说的是什么 | 在预算委员会中,我们对⟨被静音⟩预算草案的一千六百多项修正案进行了投票……在……中投票 |
| CohereLabs/cohere-transcribe-03-2026 | 主席先生,在预算委员会中,我们对2011年预算草案的1项以上修正案进行了投票……在全体会议中投票。 |
| nvidia/canary-qwen-2.5b | 主席先生,在预算委员会中,我们对 |
| ibm-granite/granite-speech-4.1-2b | |
| microsoft/Phi-4-multimodal-instruct | |
| nvidia/parakeet-tdt-0.6b-v2 | |
| bosonai/higgs-audio-v3-8b-stt-v2 | |
| Qwen/Qwen3-ASR-0.6B-hf | |
| mistralai/Voxtral-Mini-3B-2507 | |
| moonshotai/Kimi-Audio-7B-Instruct | |
| openai/whisper-large-v3 | |
| moonshine-ai/moonshine-streaming-medium |
在公开基准测试上,还原率最高,而在留出或新采集的音频上(下方 ep-fresh 和 libri-fresh)则较低。在 LibriSpeech 上,一些基准测试表现最强的模型在约 30–40% 的样本中还原出了被掩蔽的数字,即便数字本身已被移除。对若干模型而言,这一效应在新采集的数据上有所减弱,这表明与基准测试相关的周围音频——而不仅仅是文本自动补全——帮助模型还原出了参考内容。

正字法切换
我们的正字法切换探针测试模型是否会复现基准参考转录中所使用的确切拼写,尽管音频中并未明确体现这一点。正字法变体是指语义和语音相同、但可以有不同拼写方式的词(1 与 one、Mr. 与 mister、John 与 Jon、Honor 与 Honour 等)。理论上,模型应当一致地偏好某一种拼写,或者以大致随机的比例在两者之间交替。如果模型系统性地切换到与每个基准参考转录中的拼写相匹配,那就表明模型正在捕捉测试所期望的是哪一种拼写。
转录:“I URGED ON THE BOYS THAT WHATEVER HAPPENED WE SHOULD NOT SHOOT ANY ONE”——使用“any one”的模型:6/11,使用“anyone”的模型:5/11
转录:“CAMOUFLAGE WAS NOT A WORD THE CAPTAIN OR ANYONE ELSE OF HIS TIME YET UNDERSTOOD”——使用“any one”的模型:2/11,使用“anyone”的模型:9/11
在 LibriSpeech 中,我们测试了一个涉及较旧空格惯例的数据集内切换:一些参考转录使用“any one”,而另一些使用“anyone”。我们测量给定变体的最低准确率,称之为“切换率”。如果模型只使用一种变体,其切换率将为 0%;随机选择的模型预期切换率为 50%。如果模型知道每个测试样本中该使用哪种变体,则将获得 100% 的切换率。

我们的第二个探针测试的是数据集间切换,即每个基准在其测试语料中一致地使用不同的拼写惯例。例如,VoxPopuli 使用缩写“Mr.”,而 LibriSpeech 则拼写出“Mister”。
多个模型超过了 50% 的随机选择基线,其中一些达到了约 90% 的切换准确率。这表明模型能够识别一段音频样本来自哪个数据集,并选择该基准所期望的拼写惯例,尽管两种形式听起来完全相同。

定位这些切换
为了测试这些行为是否能泛化到公开基准之外,我们还从相同的来源领域收集了模型训练截止之后的新数据:VoxPopuli 使用近期的欧洲议会录音,LibriSpeech 使用新近活跃的 LibriVox 朗读者录音。然而,当面对来自同一领域的近期收集数据时,许多模型不再匹配参考转录文本,而是回归到更忠实于音频的转录。
其他干预手段也指向同一结论。音频中存在但在参考转录中被省略的短语,当模型被要求翻译音频,或其注意力被限制在相关帧上时,可能会重新出现。裁剪掉周围的基准上下文,或附加普通的对话音频,也能恢复忠实的转录。附加 VoxPopuli 音频则可能产生相反的效果,使原本忠实的合成或挖掘样本更有可能匹配基准参考。

综合来看,这些结果表明,模型能够忠实地转写实际说出的词语,但会利用周围的声学上下文来决定是遵循音频内容,还是遵循某个基准特定的转写策略。
结论
我们的发现表明,在两个主要的开源数据集上,一些模型能够检测到与数据集相关的声学线索,并据此调整其转写行为。具体而言,模型可能会复现音频中不存在但参考转写中出现的词语,以较高的比例恢复被静音的数字,或者利用周围的声学上下文来选择某个特定基准所期望的书面变体。
对于选择模型的人来说,这些发现凸显了使用完全留出的评估集的重要性——正如 RW-Voice-EQ Bench 和 Open ASR Leaderboard 所做的那样——以及不应仅着眼于单一公开基准上的词错误率。为此,Open ASR Leaderboard 新增了一个“基准拟合”标签页,其中包含上述两项跨所有模型的分析:量化(1)来自 VoxPopuli 的参考错误率,以及(2)所有公开数据集上的正字法切换。相关脚本已在 GitHub 上开源,未归一化的模型输出也已公开。
我们的发现还表明,基准测试开发者应避免简单的独立同分布测试划分,而应优先采用基于时间、说话人或其它元数据的划分方式。提高训练数据和模型选择流程的透明度,也有助于研究人员理解这些行为是如何产生的。
公开基准测试仍然有价值:它们透明、可复现、易于运行,并且为研究界所熟知。但只有当我们将真正的转录改进与那些无法泛化到新音频的基准测试特定收益区分开来时,它们才最有价值。
如需了解更多信息,我们建议您阅读我们的完整报告。
来源:Hugging Face:Blog(RSS) · huggingface.co