Speko 这张榜单最扎眼的不是谁排第一,是价格。同一张表里,Universal-3.5 Pro 词错率2.0%,每分钟0.0075美元;Velma 2 词错率4.4%,每分钟只要0.0010美元。准确率差一倍多,价格差了七倍。

Speko 想替开发者省掉这道算术题:把语言、任务和预算丢给它,它自动挑模型,接口统一成OpenAI格式。它自称「语音版OpenRouter」,但这道题它算得准不准,眼下没人验证过——测评方法、实时延迟、故障切换机制,全都没公开。

发生了什么:一把钥匙换掉多套SDK

Speko 是一个语音AI的统一网关,接口完全兼容 OpenAI API。官方给的接入示例直接用了 LiveKit 的 Agent 框架代码。改动只有三处:base URL 换成 Speko 地址,API Key 换成 Speko 的Key,模型名填 auto。业务逻辑不用重写。

它想做的是按语言和任务路由,不是照搬某个厂商在英语上跑出来的排行榜。页面列出了英语、阿拉伯语、法语、德语、印地语、挪威语、西班牙语、泰米尔语、泰卢固语等多语言模型。一个法语呼叫中心和一个印地语语音助手,理论上会被路由到完全不同的模型组合。

硬指标:STT数据说明什么,谁该跟着调整

Speko 公开的量化对比,目前只覆盖语音转文字(STT)这一段,用词错率(WER)和每分钟成本两个维度打分。

排名模型WER单价(美元/分钟)
1Universal-3.5 Pro2.0%0.0075
2GPT-4o Transcribe2.3%0.0060
3GPT-4o-mini Transcribe2.7%0.0030
4Qwen3-ASR2.8%0.0054
5Realtime STT-13.3%0.0025
6Velma 24.4%0.0010
词错率对比(WER,越低越准) Universal-3.5 Pro 2.0% GPT-4o Transcribe 2.3% GPT-4o-mini Transcribe 2.7% Qwen3-ASR 2.8% Realtime STT-1 3.3% Velma 2 4.4% 价格从0.0010到0.0075美元/分钟不等,价格差远大于准确率差

准确率和价格不同向。Universal-3.5 Pro 最准,也是这几家里最贵的一档:2.0%的错误率对应每分钟0.0075美元。Velma 2 最便宜,每分钟0.0010美元,错误率却是Universal-3.5 Pro的两倍多。GPT-4o-mini Transcribe 卡在中间,2.7%配0.0030美元,价格和准确率相对均衡。这正是 Speko 想替开发者省掉的判断,也正是需要外部验证的判断。

页面上还有Flux、Scribe v2 Realtime、GPT Live Transcribe三个模型,只标价格没标WER。说明这套测评还在补全,不是一次做完的成品。

这张表直接影响两类人。做语音Agent、呼叫中心自动化、多语言语音产品的开发者,可以先拿非核心场景试水,比如单一语言的原型或者内部测试流量。观察自动路由在实时延迟和故障切换上的实际表现,再决定要不要把生产流量交给它。同时留一条退路,保留手动指定模型的能力。

负责模型采购和基础设施选型的技术负责人,签约或规模化之前,先问清楚三件事:测试集从哪来,故障切换有没有SLA,数据出境和留存政策写没写清楚。没问清楚之前,可以把 Speko 当成候选测评工具去参考,而不是唯一入口。和直连供应商的方案并行跑一段时间成本和延迟,比一步到位换成自动路由更稳。


锐评:测评可信度,才是真正的关卡

语音路由比文本路由多一层麻烦。LLM 路由基本只看质量和价格,语音还要扛实时延迟、并发和抖动丢包下的容错。Speko 现在拿得出手的,只是一张离线跑分表,测试集来源、并发压力、路由失败率,一概没提。

孟子说「尽信书,不如无书」。一张自制榜单最大的价值不在排名本身,而在能不能被别人复现。

值得肯定的是,它把测评摆上台面,比很多只喊「多供应商接入」的中间层诚实。但诚实不等于可信。所有请求都要经过这一层网关,开发者的语音数据、调用日志、模型偏好都要过它的手。原本想躲开被单家厂商绑死,现在多了一个新的绑点。

接下来该盯的,不是它接了多少家供应商,而是三件事:测评能不能被第三方复现,故障切换有没有实测数据公开,数据留存和出境政策写没写清楚。这三条不过关,统一接口再方便,也只是把选型的麻烦换成了信任的麻烦。