2026年8月24日,印度主权AI创企Sarvam AI发布新一代语音识别模型Saaras V4,并在9月2日全量集成至旗下Voice Agents。官方给出的战报相当亮眼:模型覆盖印度宪法承认的全部22种官方语言与全球英语口音,在多项基准测试上号称超越OpenAI与Deepgram,基础转写API定价压到每小时30卢比(按1美元兑96.16卢比折算约0.312美元)。
表面上看,这是一场区域创企凭借本土语料与端到端架构对全球大模型的成功突袭。但在亮眼的数据与击穿行业底线的价格背后,官方选取的评测指标存在明显倾斜,而在更加注重合规与稳定性的企业真实落地环节,新模型与实际生产环境依然存在脱节。
跑分背后的标尺之争:官方战报与第三方盲测的断层
在Sarvam公布的英语测试中,Saaras V4在7个公开数据集上的平均词错误率(WER)为4.35%,低于ElevenLabs Scribe v2的4.62%、AssemblyAI的4.66%以及Deepgram Nova-3的5.57%。而在涵盖10种印度本土语言的Vistaar基准测试里,官方给出的LLM-WER得分为11.12,显著优于ElevenLabs的14.44。针对高噪声音频Kathbath Noisy,官方甚至宣称其错误率不到GPT-4o Transcribe和Nova-3的一半。
官方测试之所以拉开差距,关键在于评测口径的选择。官方引入的LLM-WER借助大语言模型进行语义仲裁,专门过滤了南亚多语系常见的表层拼写变体与格式差异。然而,评测机构Sthanika.ai发布的印地语独立测试却呈现了完全不同的局面:在未经修饰的标准WER指标下,Saaras V4录得14.68%的错误率,不仅未能登顶,反而落后于AI4Bharat开源的IndicConformer以及SraVaani,位列第三。
与此同时,开发者社区也对Kathbath Noisy的对比提出了质疑。第三方公开基准显示,通用大模型各有长短:GPT-4o在标准英文LibriSpeech上能达到1.47%的极低错误率,但在高噪商业录音Earnings-22中,Nova-3凭借16.13%的成绩反超GPT-4o的18.55%。Saaras V4在嘈杂环境下声称的巨大优势,很大程度上得益于本次新增的关键词偏置功能——在IndicContextEval测试中,该模型支持传入最多50个专有词,将特定场景错误率压到16.03%。但在官方对比测试中,竞品是否获得了同等的上下文提示配置,至今仍未公开。
架构解剖:用3B状态空间模型吞并后处理工程
南亚语音转写的真正痛点并不只是发音识别,而是日常对话中无处不在的语码混用与跨文字音译。印度用户常常在印地语或泰米尔语中夹杂大量英文专有名词,或者用拉丁字母直接拼写本土方言。传统的ASR流水线通常分为两步:先由声学模型输出本土文字,再调用外部LLM进行后处理清洗、专名纠正或翻译。这种多层级联不仅带来昂贵的推理延迟,还会造成误差层层放大。
Saaras V4的核心调整,在于直接用一个自主训练的3B混合状态空间架构语言模型充当解码器。音频波形经由编码器提取声学特征后,通过时间降采样适配器缩减序列长度,直接投影到解码器的向量空间中。
这种设计让单一模型能够通过一个参数原生吐出5种形态的内容:标准规范文本、保留语气词的逐字稿、保留英文单词的语码混用文本、全拉丁拼音的音译文本,以及直接转译出的英文文本。它在工程上消灭了拼接外挂大模型的中间环节,使实时流式首字延迟压到150毫秒以内。
- 结论.用3B参数的自研解码器硬吃小语种音译与纠错,本质上是用前置算力换取工程链路的精简,确实解决了南亚语言后处理繁琐的现实顽疾。
0.31美元定价的诱惑,与私有化缺失的围墙
在商业化层面上,Sarvam展现了激进的价格攻势。其标准API转写定价为每小时30卢比,即使开启说话人分离,费用也仅上升至每小时45卢比(约0.468美元)。对比国际竞品,Deepgram Nova-3预录多语种音频为每分钟0.0052美元(折合每小时0.312美元),GPT-4o约为每分钟0.006美元(折合每小时0.36美元),ElevenLabs批量处理为每小时0.22美元。Saaras V4几乎直接把实时多语种转写的价格拉到了行业底线。
但低价API并不能自动转化为企业订单。Saaras V4并未开源模型权重,所有调用只能走公有云端。在AWS SageMaker的私有化部署列表中,官方镜像目前依然停留在旧款的Saaras V3/V3.1,企业需要租用单价约每小时2美元的ml.g6.4xlarge计算实例来运行旧模型。甚至在Sarvam的官方开发者文档中,默认推荐的生产模型依然被标记为Saaras V3。
本土化的深度能换来方言场景的优势,但合规隔离的缺失会把它关在核心业务门外。
对于PhonePe这类处理海量方言混杂业务的金融科技厂商,或是承接高敏感政务及银行外包的呼叫中心而言,核心数据的本地化留存与隔离运行是监管不可逾越的红线。Saaras V4展现了优异的语境适应力,但在私有化部署镜像就位、独立评测体系补齐之前,它更像是一个运行在云端的概念验证工具,而非能够立即替换全球基础设施的生产力基座。
- 风险.若银行与大型BPO机构无法在合规专网内独立部署V4镜像,击穿底线的公网API价格就很难撬动最高价值的本地企业预算。
