你在电话里应付 AI 客服时,很可能也干过这种事:嘴上客客气气地说着“好的,谢谢,不用了”,但喉咙收紧、语速加快、咬字发硬,整个人其实已经烦躁到了极点。

如果企业按照常规做法,先把这段语音转成文本,再扔给大模型做情绪质检,系统给出的结论大概率是一片祥和。字面毫无冒犯,甚至称得上温和,但客户在挂断电话后立刻销户离场。这是眼下生成式语音交互最尴尬的死角:文字在撒谎,而大模型被文字骗了过去。

波士顿语音智能初创公司 Modulate 近日宣布拿到 2500万美元 新融资,由 Future Ventures 领投,Hyperplane 与 Lakestar 跟投。根据 PitchBook 数据,此前该公司累计融资 4100 万美元,投前估值约 1.7 亿美元;而 Modulate 官方口径显示其累计融资总额已达 6000万美元。这家由 MIT 物理系校友创办、早期做游戏变声起家的团队,如今把赌注压在了企业级音频分析平台 Velma 上。

语音质检的路径断层:文本转录与原生声学 传统模式:语音转文本 + LLM 声学信号剥离(丢失语调、叹气、顿挫) 字面分析欺骗性(礼貌词汇掩盖强烈不满) 代价:Token账单高昂,质检结果假阳性 Modulate 模式:原生声学矩阵(Velma) 双层提取:底层声学信号 + 上层意图研判 旁路流式介入:实时诈骗识别与合规监控 优势:规避转录损耗,免专用硬件低算力

避开昂贵大模型,押注百个小切口

大模型行业目前的主流叙事,是卷更大参数的原生端到端语音模型,试图让 AI 在一次前向传播中同时听懂内容和情绪。但 Modulate 选了一条反向工程的路线:它没有做一个庞大沉重的语音大底座,而是通过其集成的聆听模型调度框架,统筹编排了 超过100个专用小模型。

端侧设备仅凭两三秒音频切片,即可完成实时音调与合成音判伪
端侧设备仅凭两三秒音频切片,即可完成实时音调与合成音判伪

这些小模型被明确切分为两道工序:

  • 底层信号提取.专注切分音调起伏、微表情、语种以及是否为人造合成音;
  • 上层意图分析.研判来电者是否正在遭受钓鱼诈骗、是否存在违规话术、真实意图是催办还是放弃。

把模型做小,核心动力在于算账。大语言模型的 Token 计费在文本时代尚能承受,一旦进入高采样率音频的连续推断,呼叫中心的算力成本会瞬间击穿财务底线。Modulate 强调其系统不需要昂贵的专用硬件,可以在通用算力甚至客户本地端侧跑起来。官方宣称其平台已累计处理 超过6亿小时 音频,月均处理量稳定在 1000万小时 以上。

除了常规质检,他们今年还把矛头对准了黑产。2026 年 3 月,公司上线了针对深伪音频的检测工具,声称在流式或批处理 API 下,只要截取 2至3秒 的音频切片,就能对声音是否为合成克隆给出一个概率评分。

Modulate 业务量级与性能指标 6 亿+ 累计处理音频(小时) 1000万 月均实时分析(小时) 100+ 编排调度专用小模型 2-3 秒 深伪切片检测极速响应

左右夹击:裁判席并不好坐

古人讲“听其言而观其眸”,在语音交互里,声学特征就是那双不能直视的眼睛。但想在企业级服务里稳稳坐住裁判席,光有小模型架构远远不够。

物理旁路分流器直接截取通话信号,充当独立的合规审计观察者
物理旁路分流器直接截取通话信号,充当独立的合规审计观察者

Modulate 面临的是一个被多方势力严密封锁的战局:

靠单点声学特征做裁决,往往容易陷在上下游巨头的夹缝里。

在金融防伪与呼叫中心风控腹地,老牌对手 Pindrop 的防护工具库已经覆盖了超过 370 种语音合成引擎。Pindrop 不单看一段声音像不像 AI,它把声纹活体检测、电信运营商底层元数据和银行核心业务风控流死死绑在一起。这种长期建立的行业信任壁垒,不是几张轻量级 API 就能轻易撼动的。

在情绪与韵律理解这一侧,专注共情交互的 Hume AI 已经拆解出超过 600 个表达维度,支持 50 多种语言的实时韵律分析,专注于提升对话体验;而在多模态深伪鉴真赛道,Reality Defender 覆盖了音频、视频、图像和文档全链条,并且早早与 ElevenLabs、Hume 等生成龙头达成了防守对抗合作。甚至,ElevenLabs 这类源头厂商自己也在疯狂加码内生安全防护。

  • 风险.所谓仅需 2 至 3 秒就能识别深伪的技术指标,目前多来自厂商自身的测试环境;真实电话信道充满压缩破损、环境噪声和回声,独立第三方的抗对抗攻击验证数据依然欠缺。

小模型集成的工程复杂度,会随着语种增加和方言分化呈指数级上升。当主流技术演进全力奔向端到端大模型时,维护一套上百个异构模型的成本可能会逐渐蚕食最初的算力优势。

Modulate 这一轮拿钱,核心逻辑不是去跟巨头拼通用智力,而是赌一个清晰的商业分工:大模型跑得再快,企业也不敢把合规审计与风控防线全权交由被审计者自导自演。旁路监听、不占重算力、兼顾假声音与假礼貌的观察者,在很长一段时间内依然会是刚需。但它的终局,取决于自己能否在生成式大模型原生解决声学理解之前,把真实的抗欺诈准确率钉进高门槛行业的业务流深处。