Open ASR 排行榜新增首个全球南方语言:印地语与印度英语评测集
The Open ASR Leaderboard Adds Its First Global South Language
Voice Arena 与 Hugging Face 合作,为 Open ASR 排行榜引入 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,覆盖印地语与印度英语,其中印地语是该排行榜多语言板块首个非欧洲语言。数据集含公开与私有分割,共 4,888 位说话人,并记录 12 项说话人属性,旨在暴露按地区、年龄、性别等维度分布不均的语音识别误差。
把评测单元从单一 WER 下探到带 12 项说话人属性的分组,能暴露模型在不同地域、口音、设备上的表现差异,让 ASR 选型不再只看平均错误率。
Voice Arena 与 Hugging Face 合作,为印地语和印度英语推出开放 ASR 评测 基准测试决定了什么会被构建出来。一个在 Open ASR Leaderboard 上得分高的模型会被采用并持续迭代,而排行榜没有衡量的能力往往不会得到改进。近期围绕该排行榜的许多工作都投入到让评测指标更加可信上:
所有这些都让单一数字(WER)更难被钻空子。但它仍然只是一个数字。大量研究已经表明,ASR 错误率在使用者之间的分布并不均匀。自动语音识别中的种族差异发现,商业系统对黑人说话者的表现大约是对白人说话者的两倍之差,而量化自动语音识别中的偏见则发现了按性别、年龄和口音的进一步差异。这些在排行榜上都看不到,并不是因为排行榜在隐藏它们。它所运行的测试集记录的是说了什么,而几乎不记录是谁说的。
为填补这一空白,我们向 Open ASR Leaderboard 引入了两个评测集:Monsoon en-IN 和 Monsoon hi-IN。印地语有超过五亿人使用,是这一多语言榜单上首个印度语系语言,而该榜单目前仅覆盖欧洲语言。每个数据集都发布了一个公开划分,可供自行评分,同时保留了一个私有划分,以限制针对基准的特定优化。这四个划分在说话人上互不重叠,共包含 4,888 名说话人,并为每位说话人记录了 12 项属性。
采集设计
测试集只能暴露它在某个维度上有所变化的那种失败模式。大多数基准都是用随手可得的音频构建的。Monsoon 则被设计为在九个维度上有所变化:地域、年龄、性别、词汇、设备、声学环境、语音类型、语速,以及同一段音频存在多个有效转写。每一个维度都是一种方式,使得聚合 WER 在平均意义上正确,却对某一特定人群而言是错误的。
采集方法正是由此而来。
- 地域来自在数百个地区招募,而不是在更少的地方录制更长的会话。
- 设备和声学条件来自贡献者使用自己的手机和网络连接,在室内和室外录制,而不是在安静的房间里使用提供的硬件。
- 词汇、言语类型和语速来自提示词:日常话题会促使贡献者表达观点、分歧、叙述和回忆,而正是这些场景中会出现命名实体、数字和未经排练的措辞。
- 年龄和性别按每位说话人记录并经过核实。
- 多个有效转写是参考文本的属性而非音频的属性,这将在后续章节中讨论。
数据集构成
四个划分,两种语言,通过同一条流水线采集。
| 数据集 | 语言 | 时长 | 说话人 | 片段长度(均值 / 中位数) | 男/女 | 地区 | 邦/联邦属地 | 设备 | 风格 | 转录 |
|---|---|---|---|---|---|---|---|---|---|---|
| Monsoon en-IN 公开 | 印度英语 | 5.62 小时 | 1,444 | 9.6s / 10.4s | 50/50 | 428 | 24/6 | 556 | 对话式、即兴 | 规范化、不流畅 |
| Monsoon en-IN 私有 | 印度英语 | 5.58 小时 | 1,405 | 9.6s / 10.4s | 45/55 | 420 | 24/6 | 560 | 对话式、即兴 | 规范化、不流畅现象 |
| Monsoon hi-IN 公开 | 印地语 | 1.33 小时 | 468 | 6.4s / 5.0s | 54/46 | 202 | 11/3 | 315 | 对话式、即兴 | Lattice(可接受的拼写变体) |
| Monsoon hi-IN 私有 | 印地语 | 4.47 小时 | 1,571 | 6.6s / 5.3s | 55/45 | 295 | 12/3 | 582 | 对话式、即兴 | Lattice(可接受的正字法变体) |
数据来源于无脚本的双通道即兴对话,片段从单一通道切分而来,因此每个片段只包含一位说话人。除表中报告的字段外,每个片段还记录了职业、教育程度、婚姻状况、收入区间、手机品牌、当前城市以及在当前城区的居住年限。
来自公开印度英语数据集的五个片段,以及每个片段所携带的元数据:
29 岁女性,特里普拉邦西特里普拉。学生,samsung SM-G781B。
32 岁女性,中央邦萨特纳。失业,samsung SM-E146B。
22 岁男性,比哈尔邦罗塔斯。学生,motorola moto g54 5G。
27 岁女性,特伦甘纳邦瓦朗加尔。失业,vivo V2247。
57 岁男性,本地治里。私营企业工作,Xiaomi M2006C3LI。
英文数据集使用标准的字符串引用,排行榜的归一化器会合并大多数拼写变体。印地语的拼写变体要多得多,而任何归一化器都无法解决这一问题,因为这些变体并非两套约定之间的固定映射。因此,印地语数据集附带了一个格:对于转录文本的每一段,都提供了一份被接受为正确的拼写列表。
说话人覆盖
Monsoon 以小时衡量很小,以说话人衡量则很大。这正是其设计所在,也是大部分价值所在。
上述字段之外的说话人集中度与多样性。
| Monsoon hi-IN 公开 | Monsoon hi-IN 私有 | Monsoon en-IN 公开 | Monsoon en-IN 私有 | |
|---|---|---|---|---|
| 每位说话人的片段数(均值) | 1.61 | 1.56 | 1.46 | 1.48 |
| 仅有一个片段的说话人 | 261 | 994 | 956 | 924 |
| 每位说话人的音频(中位数) | 8.34 秒 | 8.28 秒 | 12.36 秒 | 12.39 秒 |
| 前 10 位说话人占据的份额 | 6.8% | 3.1% | 2.8% | 2.9% |
| 当前城市 | 289 | 814 | 641 | 584 |
| 设备制造商 | 18 | 25 | 23 | 20 |
由此得出三个特性,每一个都是关于方差而非数量的论断。
没有哪种声音能主导得分:贡献最大的十个来源仅占总时长的 2.8% 到 6.8%,且超过半数的说话者只出现一次。在 Monsoon 上的结果是对数百个不同声音的平均,而非对少数长时间录音的说话者的平均。时长相当的测试集通常以相反的方式构建。
也没有哪个地区或手机型号能主导它:印度英语公开集覆盖 30 个邦和联邦属地的 428 个本土地区;印地语集因属于印地语带语言,分布更为集中,但仍横跨 202 和 295 个地区。录音来自 315 到 582 种不同的设备型号,任何单一型号在任何子集中的占比都不超过 2.1%。在标准化硬件上采集的语料库会过拟合到某一种麦克风响应;而这个语料库不会。
这里的印度英语不是一种口音:这是全国范围内所说的英语,而非某一地区的英语。六个区域均有代表:在公开集中,35% 的片段来自南部说话者,18% 来自东部,18% 来自中部,16% 来自北部,11% 来自西部。由此产生的口音差异被记录在元数据中,而非仅作断言。
元数据字段
Monsoon 每个片段包含 18 列,其中 12 列是元数据,而大多数公开的 ASR 测试集只包含一个标识符、一份转写文本和一段时长。人口统计字段完整或接近完整;贡献者已同意此用途。
| 分组 | 字段 |
|---|---|
| 片段 | id、audio、audio_length_s、language |
| 参考 | lattice(印地语)或 text(印度英语) |
| 说话人 | speaker_id、gender、date_of_birth |
| 背景 | occupation、educational_background、marital_status、income |
| 地理 | native_district、native_state、current_city、years_spent_in_current_district |
| 录音 | device_manufacturer、device_model |
这两种语言的地理分布形态不同,而这种形态本身就具有信息量。印地语数据集集中在印地语带,其中北方邦约占说话者的 40%,这正是按人口抽样的印地语语料库应有的样子。印度英语数据集则平坦得多:没有任何一个邦的占比超过 13%,且三分之一的说话者来自八个最大邦之外。公开与私有两半在两者上都高度吻合。
印度各邦的边界是按语言界线划定的,因此地区和邦承载着真实的口音信号,这也是为什么这些字段被发布出来,而不是被汇总抹去。这类分析已在印度 ASR 上被大规模报道过:地区级错误率大致从 4% 到 44%,代表性不足的地区远远落后于印地语带和大都市,此外还按音频质量、语速、话语时长、性别、年龄和设备进行了细分。那些运行是在一个封闭基准上进行的。Monsoon 让同一类分析得以在一个公开排行榜测试集上进行。
采集与质量控制
广泛的地理覆盖需要在数百个地区进行招募,而不是从更少的说话者那里获取更长的会话,而这一规模的分布式招募会引入较小规模采集不会面临的失败模式:贡献者钻任务空子、将播放的音频作为实时语音提交,以及不专注的标注。每一种都通过一项明确的检查来应对。
招募与录制:贡献者通过 Voice Arena 社区招募,这是一个全球性数字平台,其覆盖范围延伸至语音语料库很少触及的农村和半城市地区。随后,配对参与者通过点对点界面以双声道录制两人对话,围绕指定的日常话题展开。贡献者使用自己的手机和自己的网络连接。其中许多是低端设备,运行在不稳定的带宽上,这正是为什么这种条件存在于发布的音频中,而不是被过滤掉。潜在贡献者在获得录制权限之前完成了语言能力筛查,获得了报酬,并提供了涵盖用于训练和分发的知情同意。按说话人设定的时长上限,根据每种语言的使用者人口规模和地理分布进行校准,防止少数高产贡献者主导某一语言或地区;这些数据集中超过一半的说话人恰好只贡献了一个片段。
引导采集:大规模引导自发语音有其自身的困难,因为如果没有结构化引导,贡献者往往只会给出简短而稀疏的回答。因此,每段对话都以一个开放式的叙事提示作为引子,并逐步揭示后续问题,涵盖旅行、医疗、农业、教育和数字服务等领域,引导交流走向扩展性描述,而不对其加以脚本化。候选话题由大语言模型生成,随后由母语者语言学家审核并进行本地化。
质量控制:每段录音在转写前都通过了一组门控检查。使用在超过 30 种语言的人工标注数据上训练的语言识别模型,将实际口语语言与所分配的语言进行核对。使用专用分类器对照自我报告的标签确认说话人性别,该分类器用于佐证自我报告,而非取代它。另一个模型用于区分真实的自发对话与预先录制或回放的音频。信噪比估计会剔除清晰度已严重受损的录音,而自然环境背景噪声则被刻意保留,以保留真实场景语音的声学真实性。通过这些检查的录音会经语音活动检测进行切分,在连续静音达到两秒处切分,或在达到十五秒软上限后于下一个检测到的静音处切分。切分按声道独立进行,因此每个片段都是单说话人、单声道。随后,这些片段还要通过 DNSMOS P.808 检查。
转录: 参考转录文本由人工完成。初稿由基于领域内数据训练的内部 ASR 模型生成,这些模型均未出现在任何公开排行榜上,因此没有任何在这些数据集上评估的系统为其被评分的参考文本做出过贡献。后续每一个阶段均由母语语言学家按照一套五级协议执行,该协议建立在严格的劳动分工之上,每一轮修正之后都紧接一轮由不同标注员执行的独立验证,因此没有任何语言学家审核自己的产出。语言学家首先逐段对照声学信号修正初稿;第二位语言学家重新验证并标记出残留的分歧。后续层级由新的标注员迭代这一循环,逐步解决模糊的音素实现、语码转换边界、命名实体以及拼写变体之间的正字法一致性问题。数字以文字形式书写,使转录文本与所讲内容直接对应。在最终层级仍被标记的片段会被退回重新转录,之后才会被接纳。标注员的行为全程受到自动监控,对包含目标文字系统之外字符、不自然的字符或词语重复,以及异常偏低或偏高的编辑次数的提交进行标记。
区域差异
下面是一个示例,在公开的印度英语划分上运行,用以展示这些元数据所能支持的那类评估。它并不是这些数据集旨在给出的发现;它只是说明,一旦每一段音频都带有说话人信息,哪些问题就变得可以回答。
在这个数据集上,排行榜上有八个模型的 WER 落在 4.81 到 4.99 之间。从最好到最差仅差 0.18 分,处于五个小时就能解决的范围之内。按语料库排名,它们就是同一个模型。
按地区对说话人分组则呈现出另一番景象。每位说话人的原籍区被归并到其所在的专区委员会——即印度内政部对印度各邦的分组——从而得到五个采样充分的专区。openai/whisper-large-v3-turbo在各专区之间的差异为 0.46 分。mistralai/Voxtral-Mini-3B-2507在语料库上落后前者 0.14 分,其差异却达 1.68 分,在中部专区为 4.38,而在东部专区为 6.06。两个在排行榜上无法区分的系统,其准确率对说话人籍贯的依赖程度相差近四倍。
哪个专区最难也并非固定不变。ibm-granite/granite-speech-3.3-2b在北部表现最差,microsoft/VibeVoice-ASR-HF在南部最差,mistralai/Voxtral-Mini-3B-2507在东部最差。如果仅仅是某个地区更难转写,那么每个模型对各专区的排名都会一致。但事实并非如此,这说明问题出在模型而非音频上。
地区是十二个记录属性之一,而上述专区是对 428 个区的粗略归并。同样的细分分析也适用于年龄、教育、职业和手机型号,所发布的文件包含了复现这一切所需的全部内容。而对于一个只记录说了什么的测试集,这些信息一概无法获得。
印地语中的正字法差异
英语的正字法变体是有限的。英式与美式拼写、标点、大小写、数字与单词的写法:一个规范化器可以把其中大部分映射到单一形式,排行榜上的规范化器就是这么做的。印地语则不是以同样的方式有限的。日常口语高度混合语码,源自英语的词汇没有固定的天城文拼写,复合形式按个人偏好连写或分写。同一个短语可能有十种甚至更多种有效的书写形式,没有任何固定映射能把它们归并,因为并不存在一个可以映射过去的规范形式。
用单一参考文本评分时,WER 会奖励那些恰好产出标注者所选拼写的系统。两个对音频识别得同样好的系统,仅凭正字法差异就可能相差好几分。
因此,印地语数据集附带一个格:对于转写文本的每一段,给出被接受为正确的书写形式集合。构建它是人工工作。候选变体取自同一音频的多个 ASR 转写结果,并用语言模型进行扩展,然后由母语语言学家判定哪些对该话语有效、并剔除其余部分,因此只有与所说内容一致的形式才会被纳入。
因此,对于印地语,我们报告由 AI4Bharat 提出的正字法知情词错误率(OIWER),而非 WER。假设文本会在每一段与可接受集合对齐,因此任何被纳入的形式都算作正确,只有真正的识别错误才会被计入。
为了量化这一影响,我们对同一批假设进行了两次评分。将每个 lattice 展平为每个 span 的第一个变体,就得到了一条单一字符串参考,这正是传统基准测试所提供的形式;任何被认可的变体都同样适用,而选择不同的变体就会得到不同的参考。对照展平后的参考进行评分时,所有系统的错误率都会上升,而且上升幅度并不一致。排名也因此发生变化。下图展示了两对系统,它们在两种参考下顺序发生了反转:在单一参考下,系统部分因为复现了标注者的正字法而受到奖励,而 lattice 只对识别结果评分。
我们还开源了我们的实现,voi-oiwer,因此这些数据集上的每一个结果都可以直接复现。
参与评估
对于私有划分,请将你的模型提交到 Open ASR Leaderboard,Hugging Face 团队将运行评估。和以往一样,将模型添加到排行榜的流程在 Open ASR Leaderboard GitHub 上进行:
- 提交一个 pull request,就会出现一份 模型检查清单。和以往一样,你应当在公开数据集上报告你的结果。
- 我们将在公开数据集上验证结果,并在私有数据集上计算指标。
- 确认我们获得的结果。
印度英语加入主排行榜作为Voice Arena Monsoon,位于默认列集中,而非作为可选开关,因此它会纳入每个模型的总平均 WER。私有划分则汇入聚合的Private (conversational)列,与Appen 和 DataoceanAI 数据并列。公开和私有印地语出现在多语言标签页中,只有当模型支持所有选中的语言时才会被排名,从而使该列成为同类对比。或者,从"语言数据集细分"下拉菜单中选择"印地语"。
接下来会怎样
印地语是一个普遍性问题的鲜明案例。任何有多种书写方式、且其使用者未被某个基准采样到的语言,都同时带有这里描述的两种失败。这些数据集并不能解决它们。它们所增添的,是一种看见这些失败的方式:一个置于业界已在关注的排行榜上的测试集,它携带了关于每位说话者和每条参考的足够信息,使得两个系统之间的差异可以被追溯到是谁在说话、以及他们如何书写,而不是消失在一个单一数字里。
这四个数据集是 Monsoon 的一部分,Monsoon 是 Voice Arena 面向全球南方更广泛的数据集计划。
来源:Hugging Face:Blog(RSS) · huggingface.co