一段欧洲议会录音里,说话人清清楚楚说了一句"Thank you, Mr. President"。但VoxPopuli基准的官方参考文本漏掉了"Thank you"。Hugging Face团队拿这段音频测了11个主流开源语音识别模型,结果6个模型选择跟着错误的参考文本走,直接把音频里明明存在的"谢谢"吞掉不写。

换一个新录的欧洲议会声音,同样的内容,大部分模型立刻"听清"了。只有一个模型在全新录音里依然漏词。这不是偶然口误,更像是模型认出了"这是VoxPopuli的题",然后按标准答案作答。

分数最好看的模型,复现错误最积极

Hugging Face团队没有止步于一个案例,他们量化了11个模型在VoxPopuli上"跟随错误参考文本"的比例(accept-ref)。结果很扎眼:Cohere-Transcribe以0.30排第一,Canary-Qwen-2.5B紧随其后是0.23,Granite-Speech和Higgs-Audio均为0.21,Phi-4是0.19,Parakeet-TDT是0.18;而Qwen3-ASR只有0.09,Moonshine-Streaming是0.06,Voxtral-Mini是0.04,Kimi-Audio是0.03,Whisper-Large-v3垫底,0.02。

真正让人皱眉的是这份排名跟公开榜单几乎是一张倒影——VoxPopuli词错率最低的六个模型,正好就是accept-ref最高的六个模型。词错率越好看,越可能是靠背答案换来的。

VoxPopuli:分数越好看,越爱抄答案 误跟随错误参考文本的比例(accept-ref) Cohere-Transcribe 0.30 Canary-Qwen-2.5B 0.23 Granite-Speech 0.21 Parakeet-TDT 0.18 Qwen3-ASR 0.09 Whisper-Large-v3 0.02 红色区间的模型,恰好也是VoxPopuli词错率最低的几个

排除了最简单的那个解释

第一反应是:会不会训练集和测试集里的说话人重叠了?研究团队查了Hugging Face版本的VoxPopuli,确实有约40%的测试说话人同时出现在训练集里。但他们特意验证过,单靠说话人重叠解释不了这种行为差异——问题更可能出在模型学到了某种"基准身份"的声学指纹,而不是单纯记住了某个人的声音。

这个结论靠的不是拍脑袋。团队用一批低音素错误率(PER)的模型做集成,专门标记基准参考文本里的错误,一共在745个测试片段里标出1113处错误,覆盖约40%的片段、3%的参考词,再拿一部分去对人工标注,一致率达到93%。方法站得住,结论才站得住。

标错的流程:不是拍脑袋 40% 测试片段被标出 参考文本错误 1113 处标记错误 约占参考词3% 93% 与人工标注 一致率

静音的数字也能"猜"出来,拼写也会看人下菜

除了"跟着错误答案走",团队还做了两组测试。一是把音频里的数字直接静音,模型理论上应该什么都不写,但一些在LibriSpeech上跑分领先的模型,约30%到40%的样本里还是把被消音的数字复现了出来——换成刚采集的新音频,这个比例明显下降。二是测试"Mr."还是"Mister"、老式空格拼写这类同音不同形的写法,11个模型里有6个在称呼拼写上、8个在LibriSpeech的古式拼写上,明显偏向数据集自己的书写习惯,而不是保持统一偏好。

这两组证据指向同一件事:模型不只是在"听",还在推断自己正处于哪个基准、该交出哪种版本的答案。

分数好看的另一面,可能是更会猜题,而不是更会听话

打补丁的人,补丁上也有洞

这不是语音识别独有的毛病。此前已有研究发现,LibriSpeech不少测试文本本身就混进了Pile这类大模型预训练语料,故意污染文本对最终词错率影响不大,却明显拉高了模型对"见过的测试句子"打分的信心——说明词错率这个单一指标,本来就容易掩盖记忆问题。业内还有过一个更直白的案例:某厂商只在AMI这个会议对话数据集上做了一次正常微调,没有直接碰测试音频,就把自己在Hugging Face公开榜单上的排名拉高了约十位。宏平均词错率这种打分方式,天生就容易被"专攻一门弱科"的策略钻空子。

Hugging Face自己也在打补丁:今年在Open-ASR Leaderboard里加了不公开音频的私有held-out赛道,数据来自Appen和DataoceanAI,覆盖多种英语口音;又和Treble Technologies联合推出远场评测,用模拟房间和噪声场景补测真实环境下的表现。方向没错,但局限也摆在明面上——私有不等于独立,闭源模型完全可能在厂商自家训练数据里见过分布相似的材料;远场评测目前只覆盖单说话人的静态场景,依赖单一商业仿真器,离真实世界还有距离。


所谓语音识别"已达人类水平",很大程度上建立在一套可以被系统性应试的测量体系上。这不意味着这些模型没用,Whisper、Voxtral、Kimi-Audio在这几项测试里表现干净,说明扎实转录和刷榜并不矛盾。但对企业和开发者来说,单看公开榜单排名选型,风险已经写在数据里了——更稳妥的做法,是把公开词错率、抗污染探测和真实场景试跑摞在一起看,而不是相信一个数字。