Hugging Face在2026年9月30日正式上线了Open TTS Leaderboard。在此之前,其模型社区里已经堆积了超过8000个语音合成模型,却长期拿不出同一把尺子去衡量优劣。更反常的是,在过去主导行业话语权的Voice Arena等主观偏好竞技场中,92个参评模型里开源权重模型竟然只有16席。语音合成长期被困在人耳盲测的玄学叙事里,而这套基于客观指标的新系统,直接把单个模型的评测周期从数周压缩到了数小时。

评测范式迁移:从人耳众包到多维工程基准 传统众包竞技场(Arena) • 评测周期:需数周收集众包投票 • 准入门槛:平台自费托管,开源仅占 16/92 • 核心痛点:评委标准漂移,存在中庸评分倾向 商业 API 具备天然展示与预算特权 Open TTS 自动化基准 • 评测周期:H200/CPU 自动化仅需数小时 • 客观解耦:WER 清晰度 + TTFA 首包延迟 • 声纹保真:WavLM 向量余弦相似度计算 推动超轻量端侧模型进入工程选型视野

竞技场的隐形门槛:开源模型为何长期缺席?

业内此前最认可的语音质量基准,是基于Bradley-Terry模型计算Elo积分的双盲对战竞技场,比如Artificial Analysis Voice Arena与TTS Arena v2。这类平台让用户盲听两段音频并投票,直观,但极度昂贵且难以规模化。

商业厂商接入竞技场只需提供一个API Key,而开源权重模型需要平台方自掏腰包搭建推理节点并承担GPU算力账单。商业服务商为了获客有充足动力去争取曝光,开源作者却往往缺乏运营预算。结果便形成了严重的结构性偏差:在Artificial Analysis的92个参评模型里,开源模型仅占16席。即便在如此严苛的筛选下,开源阵营的Fish Audio S2 Pro依然拿下了1118分、位列开源第二,Kokoro-82M也以1064分位列开源第五。

古希腊哲人赫拉克利特曾言,人不能两次踏入同一条河流。人耳主观评分面对的正是这种漂移。学术界与工业界很早就达成过共识:传统的平均意见分(MOS)在面对当今的高水准TTS时,不仅分辨率明显不足,评测者还会不自觉地给出中庸评分。当模型发布速度以日计算,依靠真人耳力逐一打分,既跟不上产能,也无法建立稳定的工业基线。

Open TTS 核心量化指标与结构反差 17.4% 主流竞技场开源占比 92 个席位中仅占 16 席 23 倍 API 部署成本差距 Fish S2 Pro 对比 Kokoro 数小时 自动化单模型测试耗时 替代传统数周众包盲测

拆解工程坐标系:用硬指标拆分听感

Open TTS Leaderboard选择把模糊的听感拆解为可复现的工程参数:

清晰度上,榜单引入Qwen3 ASR转录生成的语音,通过对比原始文本直接算出词错率(WER)与字错率(CER);保真度上,利用WavLM特征向量提取声纹,以余弦相似度(SIM)判定克隆保真度;在交互体验上,依靠H200 GPU与CPU测量单音频流式首包延迟(TTFA)与批处理吞吐率(RTFx)。

不过,客观评估工具同样存在底层算法差异。原生的Seed-TTS-Eval框架使用的是Whisper-large-v3与Paraformer-zh计算转录错误率,相似度则采用WavLM-large;而CV3-Eval官方框架采用ERes2Net提取说话人特征。跨基准的相似度数值无法直接混为一谈,但这并不妨碍统一环境下的横向对照。为了更细致地评估音频质量,业界现有的多指标评估工具(如open-tts-eval)还会进一步整合NISQA质量分、DNSMOS噪声抑制分以及F0基频误差,试图把声学瑕疵全部摊在账面上。


82M小模型的逆袭:撕开云端大模型的溢价

当评测维度落到帕累托效率图上时,参数量和定价的神话迅速破裂。只有82M参数的Kokoro-82M,与来自Supertone、参数量仅99M的supertonic-3,在英文字错率和生成速度上直接占据了效率前沿。

模型名称参数量参考成本(百万字符)授权协议核心工程表现
Kokoro-82M82M约 0.65 美元Apache 2.0极低成本与高清晰度,英文 WER 领先
Supertonic-399M边缘端自建OpenRAIL-M支持 31 语种与 44.1kHz 输出,韩语 WER 第一
Fish Audio S2 Pro较大规模约 15.00 美元非商用研究授权跨语言零样本克隆出色,支持精细指令控制

从参考成本来看,Kokoro-82M大约为0.65美元/百万字符,而Fish Audio S2 Pro约为15美元/百万字符,二者调用成本相差约23倍。Supertone的supertonic-3以99M的小巧身材支持31种语言与44.1kHz采样率,在榜单上拿下韩语WER第一、生成速度第二。对于只需要稳定朗读、对音色克隆要求不高的实时对话场景,高价云端API的性价比优势正在被这批轻量模型迅速瓦解。

语音合成的真正门槛不在模型体积,而在端侧算力与可懂度之间的兑现效率。

指标盲区与落地边界

客观指标虽然把排查效率提升了几个数量级,但绝不等于语音体验的全部。

转录出来的低字错率和高声纹相似度,只能证明模型念对了字、模仿了音色,却完全无法度量语调起伏、呼吸节奏与情感张力。一个模型在ASR识别下可以拿到近乎完美的零错误率,听起来却依然可能生硬机械。此外,全盘依靠统一的ASR进行质检,极易催生针对特定识别工具的刷榜微调。

落地时的另一道硬门槛是开源许可。Kokoro-82M采用了商业友好的Apache 2.0协议,可以直接用于工业级生产管线;supertonic-3采用带有限制性使用条款的OpenRAIL-M协议;而综合表现优异的Fish Audio S2 Pro仅开放了研究与非商用授权,商用落地必须额外采购授权。

  • 结论.语音评测正快速演变为三层流水线,先用自动化客观基准做规模化粗筛,再通过实验室MUSHRA与社区A/B盲测检验自然度,单纯迷信主观排行榜或盲目采购高价闭源API的时代已经过去了。