Hugging Face与Voice Arena为开源ASR排行榜新增首个印度语言测试集,覆盖印地语与印度英语
Monsoon数据集包含四个发言人不重叠的分割,覆盖4888名发言人,并附带12项人口统计与设备元数据;印地语部分采用格栅标注以应对拼写变异。
AI解读:这条新闻背后的核心问题是:语音识别基准测试只记录说了什么,却几乎不记录是谁说的,导致排行榜上的单一错误率可能掩盖特定人群的表现差异。Hugging Face与Voice Arena合作推出的Monsoon评测集,用分布在数百个地区的近5000名发言人来构建测试数据,并记录年龄、性别、职业、母语地区、手机型号等12项元数据,试图让研究者能看出模型对哪个地区、哪个年龄段或哪种设备表现更差。对开发印度市场语音产品的团队来说,这意味着不再只能看到一个总数字,而是可以像文章示例那样,发现两个在总错误率上几乎相同的模型,其区域差异可能相差近四倍。印地语部分还采用了格栅标注和正交感知词错误率(OIWER),避免因拼写变体而误判识别质量。需要说明的是,Monsoon目前只有约17小时的音频,规模远小于许多商业数据集,且其对实际模型改进的影响尚无公开效果数据,因此它更像是一个诊断工具,而非直接提升模型性能的训练素材。
6月17日,Hugging Face与Voice Arena宣布在开源ASR排行榜(Open ASR Leaderboard)上新增两个评测集:Monsoon en-IN(印度英语)和Monsoon hi-IN(印地语)。这是该排行榜多语言标签页上首个印度语言(印地语),此前该标签页仅覆盖欧洲语言。
每个数据集都包含一个公开分割(供自行评分)和一个私有分割(用于限制针对基准的优化),四个分割的发言人互不重叠,共覆盖4,888名发言人,并记录了每位发言人的12项属性。
据Hugging Face博客介绍,此举旨在回应一个长期问题:语音识别错误率在不同人群间的分布并不均匀,而传统排行榜的测试集只记录内容、不记录说话人身份,无法揭示这类差异。
数据集构成
Monsoon en-IN公开分割包含5.62小时、1,444名发言人的录音,平均片段时长9.6秒,覆盖428个地区、印度30个邦/中央直辖区中的24个,使用556种设备。印地语公开分割为1.33小时、468人,平均片段6.4秒,覆盖202个地区。私有分割规模与之相当:印地语私有分割4.47小时、1,571人。音频来自无脚本的双通道自发对话,每段从一个声道切出,确保每段只有一个说话人。
除表格列出的字段外,每个片段还记录职业、教育背景、婚姻状况、收入档次、手机品牌、当前城市和在当前地区居住年数。
- Monsoon en-IN公开分割:5.62小时,1,444人,平均9.6秒/段,428个地区,来自556种设备型号,全部为自发、对话式语音,采用规范化转写(含非流利标记)。
- Monsoon hi-IN公开分割:1.33小时,468人,平均6.4秒/段,202个地区,315种设备,采用格栅式参考(接受多种拼写变体)。
- 发言取样刻意强调广度而非时长:每个子集中超过一半的发言人只贡献一个片段,最大10名贡献者占总时长约3%至7%。
- 印度英语公开分割覆盖所有六个区域委员会区域:南部35%、东部18%、中部18%、北部16%、西部11%。
印地语拼写变体与格栅评分
英语的拼写变体有限,规范化器可以映射到单一形式;印地语则不同——日常语音高度混码,源自英语的词汇没有固定的天城文拼写,复合词可连写或分写。Hugging Face称,同一短语可能有十种以上合法拼写,且不存在固定映射。若用单一参考转写评分,系统可能因复现了标注者偶然选择的拼写而获得高分。
因此印地语评测集为转写的每一段提供“格栅”:一份被接受为正确的拼写列表。评分采用AI4Bharat提出的正交感知词错误率(OIWER),将假设与每个片段的接受集合对齐,任何被接受的拼写形式都算正确,仅将真正的识别错误计入。作者称,如果用扁平化参考重新评分,所有系统的错误率都会上升且上升幅度不均,导致排名发生变化。实现代码voi-oiwer已开源。
- 作者对比了两种评分方式:按格栅评分时,两个在单一参考下排名互换的系统对,其差异会反转——单一参考会奖励复现标注者拼写的系统,格栅则只衡量识别本身。
- 印地语转写采用格栅,印度英语则使用标准字符串参考。
- 公共与私有分割的格栅均为人工构建:候选变体来自同一音频的多个ASR转写,并经语言模型扩展,再由母语语言学家裁定哪些对该话语有效。
示例分析:区域误差差异
作为元数据用途的示例,作者在公开的印度英语分割上测试了8个排行榜模型,它们的总词错误率在4.81到4.99之间,仅差0.18个百分点,在5小时音频能分辨的范围内,排名上难以区分。但按发言人母语地区汇总到区域委员会后,差异显现:OpenAI的whisper-large-v3-turbo在各区域间波动0.46个百分点;而总错误率仅落后0.14个百分点的Mistral的Voxtral-Mini-3B-2507,波动达1.68个百分点——中部区域4.38,东部区域6.06。
哪个区域最难也不是固定的:IBM的granite-speech-3.3-2b在北部最差,微软的VibeVoice-ASR-HF在南部最差,Mistral模型在东部最差。作者说,如果单纯是某个区域更难转写,所有模型应有相同排序,事实并非如此,指向的是模型差异而非音频本身。这一分析此前在封闭基准上已大规模报告过(地区级错误率从约4%到44%不等),Monsoon让同类分析在公开排行榜上成为可能。
- 区域是记录的12项属性之一,文章提及年龄、教育、职业和手机型号也可做同样的分解分析,发布的文件包含复现所需的全部数据。
- 数据收集过程包含多项质量控制:语言识别模型验证语音与分配语言一致、性别分类器交叉核对自报性别、检测录音是否为预录或回放、信噪比去除不可听片段但保留自然环境噪声。
- 转写参考全部由人工完成:内部ASR模型生成初稿(这些模型未出现在任何公共排行榜上),后续由母语语言学家按五级协议逐段修正与复核。
评测方式与后续
对于私有分割的评测,模型需先加入Open ASR排行榜,由Hugging Face团队运行评测。流程保持不变:在GitHub上提交拉取请求,模型清单会生成;参与者先在公开数据集上报告结果,Hugging Face验证公开结果后,再在私有分割上计算指标。
Monsoon印度英语集直接加入主排行榜默认列(不设可选开关),其私有分割并入聚合的“Private (conversational)”列,与Appen和DataoceanAI数据并列。印地语的公开和私有集出现在多语言标签页,该标签页要求模型必须支持所有选定语言才会被排名。
Hugging Face在博客中写道:“印地语是一个普遍问题中的尖锐案例。任何以不止一种方式书写、且由基准测试未采样的人群所说的语言,都带有这里描述的两种失败。”并称这些评测集“不是来解决它们,而是提供一种看到它们的方式”。
- 作者未在博客中说明Monsoon数据集的训练许可或商业使用条款。
- 数据收集通过Voice Arena社区完成,采用点对点界面,贡献者使用自己的手机和网络,涵盖低端设备和不稳定带宽场景。
- 招募时,潜在贡献者须通过语言熟练度筛选,并获得涵盖训练和分发用途的知情同意。