一家荷兰阿姆斯特丹的初创公司,9月8日甩出18个可以直接塞进手机里跑的AI模型,同时甩出一串足以让开发者心动的数字:转录速度比Whisper快4.7倍,音频降噪模型只有9MB,识别84种语言只用三个词就够了。数字很扎眼,但把官方基准摊开细看,会发现"更快"和"更准"之间,这家公司悄悄做了取舍——只是没写在标题里。
Desert Ant Labs不是凭空冒出来的。它脱胎于视频应用Detail的团队,做了五年"设备端优先"的产品,却因为自动剪辑、音频增强这类功能必须调用云端API,基础设施账单跟着用户量一起涨。这是很多做音视频、做文本处理的团队都遇到过的账,只是这次团队决定自己把账解决掉:训练一批任务专用的小模型,塞进一套SDK,免费额度覆盖每月10万活跃设备。
官方给的成绩单,确实好看
12个稳定模型加6个beta模型,覆盖音频、视觉、文本三条线。挑几个代表性的看:Voz能把10分钟音频在iPhone上两秒转完;Clear是个9MB的模型,能把五分钟的笔记本录音一秒内"修"成录音室质感;Redact能实时遮蔽27种语言里的姓名、地址、卡号,数据不出设备;Tongue用三个词就能从84种语言里认出对的那个,模型只有2MB。
单看这些数字,结论似乎很简单:设备端小模型全面碾压云端大模型。但"全面"这个词,经不起细看。
快是真的,但准确率打了折
官方基准里藏着一组容易被忽略的数字:在30分钟音频、iPhone 17 Pro上,Voz的错误率是7.40%,而它拿来对比的Whisper large-v3-turbo是7.00%。也就是说,Voz体积更小、速度更快,但转录准确率其实略逊于对标对象——只是这0.4个百分点没有出现在宣传语里,出现的是"4.7倍"。
Redact的情况类似。它抓取个人信息的召回率是88.8%,对比2.3GB的GLiNER-PII是91.1%,Redact反而更低;但它的精确率是99.6%,远高于GLiNER-PII的90.4%。换句话说,Redact误报更少,但漏检也更多——对隐私保护这个卖点来说,漏检的11%不是小数字。
尺有所短,寸有所长。Voz赢在速度和体积,却没赢在准确率;Redact赢在精确率,却没赢在召回率。这不是造假,是vendor自评基准里最常见的取景框——挑对自己有利的指标放大,把权衡藏在附录里。真要拿来做医疗记录转录、法律文书脱敏这类高风险场景,这两个"没写全"的数字,分量比宣传语重得多。
Claude Sonnet只是陪跑了一场
发布文里最容易让人误读的一句,是"我们用284MB的Clips模型替代了Claude Sonnet"。听起来像是小模型正面挑战了前沿大模型,但事实是,这个对比只发生在一个很窄的场景里:从10分钟视频里挑出几个片段。Clips确实比Sonnet快、省电,质量也相当,但这不代表Voz、Clear、Redact这些模型也在挑战Sonnet级别的通用能力——它们本来就不是同一个赛道的选手。
用一次局部胜利,给全线产品镀上"打赢大模型"的光,是创业公司叙事里的老套路。这套路本身没问题,前提是读者要分得清:哪句话是真的赢了,哪句话只是借势。
免费的到底有多免费
18个模型里,只有12个是稳定版、能通过公开SDK直接调用;剩下6个beta模型——包括结构化提取、多语言仇恨言论检测这类——目前还没有公开SDK。发布文把这18个模型放在同一张列表里介绍,但"今天就能用"这句话,对这6个来说打了折扣。
- 风险.100k月活设备的免费额度之上如何收费,官方没公布,这决定了这是一个可持续的商业模式,还是靠融资撑着的获客策略。
真正能验证这套模型体系的,是Detail 6随iOS 27上线之后的表现——那时云端API会被彻底换成自研模型,好用不好用,会在真实用户手里见分晓,而不是停留在实验室基准里。
- 结论.数据中心资本开支一年数千亿美元,全球出货的手机、平板、笔记本却超过十亿台,算力早已在用户手里躺着没被用满,这是设备端小模型这套叙事能站住脚的真正底气,但底气不等于免费的午餐。
设备端小模型能不能替代云端大模型,答案从来不是全有或全无。它能替代的,是那些每天跑几十万次、容不下延迟和token账单的重复劳动——清一段录音、打一个标签、抓一个日期。它替代不了的,是需要极限准确率、极限泛化能力的场景。Desert Ant Labs讲清楚了前一半,却把后一半藏进了脚注。
