语音客服AI公司Smallest.ai完成1300万美元A轮融资,由Seligman Ventures领投,Sierra Ventures3one4 Capital跟投。这家2024年末成立的公司累计融资已超过2100万美元。它想解决一个具体问题:企业电话代理反应慢,一停顿就露馅。

真正值得关注的不是创始人那句“像真人”的自述,而是技术路线本身。小模型顶在通话前线,大模型退到后台随时待命——这条路子能不能跑通,现在只有公司自己的说法,没有第三方测试数据。

小模型顶前线,大模型待命

创始人Sudarshan Kamath的判断是,大语言模型习惯等你说完整句再“思考”,放到语音通话里,哪怕零点几秒的停顿都显得不自然。

Smallest.ai的解法是让一个小模型专门盯限定主题,响应几乎没有明显停顿。一旦问题超出这个小模型的知识范围,系统会转给大型基础模型“查资料”,同时让用户短暂等待,像真人客服转接同事一样。

Kamath认为未来所有AI代理都会走这种双模型路线。这更像是他的行业预判,不是已经成型的行业共识。

双模型如何处理一通电话 用户提问 限定主题内 小模型 实时应答 几乎零停顿 超出知识范围 触发转接 大模型 用户等待 “查资料” 转接环节仍会打断对话节奏,这是架构本身的限制,不是需要修复的bug。

风险很具体:一旦问题超纲,系统仍要切到大模型,让用户等一等。这个停顿有多长、多频繁,目前没有公开数据。

对手是ElevenLabs的一块业务,不是全部

Smallest.ai的对手名单里有ElevenLabsCartesiaSarvam。区别在于战场大小。

公司主打场景与Smallest.ai的差异
ElevenLabs配音、播客、内容生成场景更广,实时通话只是其中一块
Cartesia语音基础模型偏底层技术,不专攻电话场景
Sarvam本地语言语音聚焦本地语种覆盖
Smallest.ai企业实时电话代理只押注这一件事,打磨口音、噪声、多语言

Kamath的解释是,像SierraDecagon这类客服AI公司,把语音做到极致会分散主业精力。这正是Smallest.ai想接的活。

公司目前披露的客户包括RingCentralTruecaller,但没公布合同规模、部署量级或留存数据。商业化程度目前只能算“有客户”,谈不上“已验证”。

采购方和创业团队接下来该做什么

对呼叫中心的技术采购负责人来说,这轮融资不是下单的理由。

可以要求Smallest.ai提供三类场景的实测录音:换口音、嘈杂背景、专业术语超纲。合同规模和留存数据都没公开,PoC阶段的预算最好按季度卡死,别一次性签长约。

对Sierra、Decagon这类客服代理平台的产品团队来说,问题变成自建还是外购。如果语音层不是核心壁垒,采购Smallest.ai这类专用模型能省下语音团队的招聘和调优成本。如果语音体验本身就是产品卖点,自己啃这块硬骨头可能更划算。