独立开发者Owen Song在Hugging Face上传了Inflect-Micro-v2。这是一套完整的英语文本转语音模型,只有935.65万个可部署参数,FP32权重文件37.53MB,能直接在CPU或CUDA显卡上本地跑起来。主流商用TTS动辄上亿参数,离不开云端算力,Micro-v2把这条链路压进一台笔记本就能装下的体积,这是它这次发布真正值得记一笔的地方。

但体积小和好用是两件事。作者自己给出的测试数据显示,它的CPU推理速度在同类轻量模型里并不领先,音质评测样本也只有34次盲听。对需要离线语音、预算紧张的开发者,这是个新增选项;对需要多语言或多音色的产品,它现在帮不上忙。

935万参数,怎么塞下一整套语音合成

Inflect-Micro-v2输出24kHz单声道波形,支持长文本按标点切分、分段合成再拼接,还能用固定种子做确定性生成。同一句话每次跑出来的音色和语调都一样,这对需要稳定复现效果的场景很实用,比如批量生成播报稿。

它属于Inflect v2系列的"质量款"。同系列还有一个更小的Inflect-Nano-v2,396.67万参数、15.97MB,主打体积。两者共用同一套API,区别只在参数预算:

项目Inflect-Nano-v2Inflect-Micro-v2
参数量396.67万935.65万
FP32权重15.97MB37.53MB
4线程CPU实时倍速10.72×6.28×
Inflect-Micro-v2 体积速览 935.65万 可部署参数 37.53MB FP32权重体积 24kHz 单声道采样率

千万参数以内跑通完整语音合成,给离线部署添了一个更小的备选项。但"更小"不等于"更快"或"更好",这一点下一节展开。


速度垫底,评测口径也没对齐

同一台8 vCPU、32GB内存的机器,用4个推理线程,Inflect-Micro-v2达到6.28倍实时,Nano版本能到10.72倍。放到同类轻量TTS里比一比,差距更明显:

CPU推理速度对比(4线程,实时倍速) Piper Low 31.37× KittenTTS Nano 13.33× Inflect-Nano-v2 10.72× Supertonic 3步 10.15× Inflect-Micro-v2 6.28× Supertonic 8步 4.37× 口径不完全一致:Prompt数量、推理框架均不同

Piper Low快了5倍,KittenTTS Nano也快了一倍多。这份对比表本身口径不算统一。Inflect跑的是100条提示的稳态测试,对手用的是50条提示的确认测试。部分对手跑的还是优化过的ONNX运行时,Inflect这里公布的是没优化的PyTorch数值。作者另外放出过ONNX版本,但没把它的速度数据换进这张表。

音质评估同样有边界。所谓66.2%社区盲听偏好,来自一场只有34次判断的匿名对照(21胜10负3平),样本量偏小。打分用的UTMOS22是一个学习出来的预测模型,不是真人打的MOS分,两者不能直接划等号。

速度垫底、评测口径不统一、样本量偏小,这几个数字更适合当参考,不适合当结论。

谁现在能测,谁该再等等

Inflect-Micro-v2目前只支持英语固定单音色。材料里没有证据显示它能做多语言、多说话人或声音克隆,使用边界很窄。

需要离线跑通英语播报、字幕配音、嵌入式设备语音提示的开发者,可以先拿37.53MB的权重在自己硬件上跑一遍,看6.28倍实时能不能复现。权重小、出错好回退,试错成本足够低。但作者没有公开许可证条款和商用授权范围,批量接入产品前最好先确认能不能商用。

评估本地语音方案的产品和技术负责人,可以把它列进候选清单,但不必急着替换现有工具。作者目前没给出实际内存占用、首包延迟、长文本稳定性,也没放出公开音频样例,这些恰恰是选型时最该看的数据。手里如果已经在用Piper或KittenTTS这类跑得更快的方案,不妨先按兵不动,等这些信息补上或者社区跑出更大样本的盲听结果再做决定。

作者在页面里提到,如果这次发布能找到真实用户,他想继续做一个覆盖更多语言和音色的v3。这只是他个人的意愿表达,不是确定的产品路线,谈不上团队扩张或融资安排。接下来值得盯的变量,是社区反馈能不能撑起一个更大的评测样本,许可证和内存占用这些选型信息会不会补上。