Open ASR Leaderboard这次更新,没有新增模型,加的是一份说话人档案。Voice Arena和Hugging Face把印度英语、印地语的Monsoon测试集接入榜单——这是该榜单第一次收录全球南方语言,也是第一次能按说话人属性拆分打分。

真正扎眼的不是多了一门语言,是官方自己甩出的对照组:八个模型在同一份印度英语测试集上,总体WER只差0.18,几乎分不出高下。可一旦按说话人所在地区重新拆分,同样这批模型,误差波动幅度能从0.46拉到1.68——总分打平,拆开却判若两队。

发生了什么:一份能拆开看的测试集

Monsoon一共四个split:印度英语、印地语,各一个公开集(可自测)、一个私有集(防刷分)。4888名说话人互不重叠,每人留了12项属性——性别、出生日期、职业、教育、婚姻、收入、原籍县/州、当前城市、居住年限、设备品牌型号。

音频量不大:印度英语两个split各5.6小时左右,印地语公开集只有1.3小时。它要的不是时长,是分布——428个县、几十个邦、几百款手机型号,前十大贡献者加起来只占总时长的2.8%到6.8%。

印地语正字法变体多,固定字符串比对容易把正常拼写差异算成错误。这次用的是"多种写法都算对"的transcript lattice,不是唯一标准答案。

Monsoon 数据集速览 4 个测试 split 4888 名互不重叠说话人 12 项说话人属性 428+ 覆盖县市(英语公开集)

同分不同命:总分怎么把差异藏起来

八个模型在印度英语公开集上的总体WER落在4.81到4.99之间,最高分和最低分只差0.18。官方自己提醒,这个差距可能就在五小时测试集的分辨力之内——基本可以看成同一个模型。

按印度内政部划分的五个区域重新拆分,故事变了:

模型五区域波动幅度表现最差的区域
whisper-large-v3-turbo0.46未披露
Voxtral-Mini-3B-2507(总分差0.14)1.68(东部6.06 vs 中部4.38)东部
granite-speech-3.3-2b官方未给出具体数值北部
VibeVoice-ASR官方未给出具体数值南部

1.68比0.46,波动幅度差了约3.6倍——但这说的是"模型对地区的敏感度"差了这么多,不是"某个模型的识别错误率是另一个的四倍"。两者总体WER其实很接近,只是拆开后一个稳、一个飘。

更值得琢磨的是,哪个区域最难识别并不固定:三个模型,三个不同的"最差区域"。如果某个区域天生难识别,所有模型应该踩中同一个坑。结果每家踩的坑都不一样,这更像是训练数据在各地区覆盖不均——但这只是相关观察,材料没有给训练数据构成做验证,说成因果还早。

两个总分打平的模型,拆到地区可能查出成倍的差距。选型不能只看总榜第一名。

总分持平,拆开就不一样 总体 WER · 印度英语公开集 4.81–4.99 8个模型,最大差 0.18 看起来像同一个模型 按说话人所在地区拆分 Whisper-large-v3-turbo 波动 0.46 Voxtral-Mini-3B 波动 1.68

对两类人意味着什么

做评测和调模型的团队,以后只报一个总体WER等于没说完整。看到某个模型总分好看,先问它有没有按地区、设备拆分的成绩单。如果没有,最好自己拿Monsoon的公开集跑一遍分组结果,把薄弱地区标出来,再决定要不要针对性扩充训练数据。

面向印度或多口音市场的产品团队,选型不能只挑总榜第一名。如果目标用户集中在东部或南部,最好问供应商要一份分地区成绩单,或者拿自己场景的音频跑一遍私有测试——总分打平的两个模型,服务这批用户的体验可能完全不同。

我的判断:基准决定研发方向,元数据只是起点

1936年美国大选前,《文学文摘》做过一次上百万份问卷的民调,预测兰登会赢,结果输得离谱。样本抽自电话簿和车主名录,天然偏向富裕阶层——样本量再大,也救不回抽样结构的偏差。

ASR的总体WER,其实也在犯类似的错误。测试集来源集中、说话人单一,总分再漂亮,说的也只是模型在"容易的那批人"身上表现不错。

这几年行业一直在给WER这一个数字打补丁:private split防刷榜,benchmark-fitting分析揪出"背答案"的模型,normaliser修正合理拼写变体。但这些补丁都在让同一个总分更难作弊,没解决总分本身会把人群差异平均掉这件事。

兼听则明,偏信则暗——总分是偏信,拆开才是兼听。Monsoon的价值,是第一次让"按地区、设备、人群拆开算"这件事,在一个公开、可复现的榜单上可以操作。

但不必把它捧得太高。总共十几个小时音频,规模仍偏小,官方也承认0.18的总体差距可能就是噪声。地区间的误差差异目前只能证明相关,说不出因果——材料给的是分组统计,不是种族、阶层或歧视的证据。它解决的是"能不能测出差异"这个前提,离"知道差异从哪来、怎么修"还有距离。

它也不是什么"首个非欧洲语音基准",准确说法是:Open ASR Leaderboard现有的多语言榜单里,第一次出现印度语言、第一次可以按说话人属性拆分的测试集。范围不大,方向是对的。

接下来值得盯的有两件事。一是有没有团队真的拿这份分组数据去改训练——比如针对东部口音扩充语料,再看下一轮评测波动会不会缩小;如果只是挂在榜单上没人认领,这份镜头也只是摆设。二是音频规模能不能从十几小时扩大到统计上更站得住脚的量级,决定了这次拆分是昙花一现,还是能成为其他语言评测跟进的标准做法。