AI数据标注公司Micro1对外披露,过去八个月里,公司的年化毛营收从1亿美元涨到了5亿美元。创始人Ali Ansari说,公司会"保留"其中60%到70%,换算成净年化收入是1.5亿到2亿美元——这句话听起来很实在,但拿计算器一按就会发现,5亿美元的60%到70%,应该是3亿到3.5亿美元,不是1.5亿到2亿。
这不是笔误那么简单。它暴露的是这类公司财务披露的一个共性问题:增长数字往往是自己讲出来的,口径想怎么摆就怎么摆。
8个月涨5倍,这道加减法先算不平
Micro1的商业模式和同行大同小异:雇医生、律师、工程师等专家,按合同标注和评测AI输出。人力成本占大头,这意味着公司真正能留下的,应该是承包商分走60%到70%之后,自己剩下的30%到40%——这正好接近Micro1早前一次融资时披露过的约40%综合毛利率,也接近行业里普遍的30%到40%毛利区间。
原文的表述,更像是把"承包商拿走多少"和"公司留存多少"这两个方向搞反了。5亿美元这个headline数字本身,也没有第三方审计或独立数据支撑——此前有财经媒体在今年4月估算其年化收入约3亿美元,8月的另一份追踪显示已经超过4亿美元,但都没到5亿。
Micro1去年9月完成A轮融资时,估值5亿美元,当时管理层披露的ARR大约是5000万美元,相当于按10倍营收给出的估值。如今外界传闻其估值已经超过25亿美元,但这更像是融资意向阶段的说法,是否已经完成定价、按什么倍数定价,目前并不清楚。如果5亿美元的营收数字本身站不住,25亿美元的估值故事就更需要打个问号。
一鱼多吃的高毛利,才是真正的增长引擎
Micro1现在也在加大合成数据和"off-the-shelf"数据的生产——同一份数据集,可以卖给不止一个客户。这类数据的毛利率能到80%到90%,比公司整体30%到40%的毛利率高出一大截。
这才是估值故事真正想讲的部分:不是"雇更多专家标注更多数据",而是"同一份数据反复变现"。这也是为什么公司愿意谈"合同规模在加速扩大""利润率会随时间提升"——这类叙事对投资人比营收总量更有说服力,因为它暗示公司正在从劳动密集型生意,转向可复制的软件生意。
- 风险.一鱼多吃的数据一旦被证明质量参差或来源混乱,客户流失的速度可能比增长同样快。
炮轰同行卖数据给中国,但指控目前查无实证
Ansari上个月在社交媒体上公开点名批评同行,说部分人力数据公司在和"外国对手"合作,"结果今天在Kimi K3上就能看到"。他说Micro1不会把数据卖给中国的模型公司,并称这种做法"可耻"。
一边喊营收翻五倍讲增长故事,一边打国家安全牌打对手,两套叙事同时在跑
这个指控背后确实有真实的行业背景:今年8月初有调查报道称,中国六家主要AI实验室每年合计向美国数据供应商支付约5亿美元,买家包括腾讯、阿里巴巴、蚂蚁集团和字节跳动,卖家名单里出现的是Surge AI、Mercor、AfterQuery、Turing——没有Micro1,也没有直接点名Kimi。
但Kimi K3公开的技术报告里,描述其训练数据来自网页文本、代码、数学和知识类语料,以及后训练阶段用早期版本模型自己生成的合成轨迹和人类标注,报告全文没有提到Surge、Mercor、AfterQuery或任何一家美国off-the-shelf数据供应商。也就是说,"Kimi K3因为买了美国数据才变强"这个说法,目前没有对应的证据链,更像是竞争对手之间互相扣帽子。
白宫的AI政策顾问David Sacks在相关讨论里持相反立场:他认为大量数据标注工作本身可替代性很强,中国庞大的本土劳动力完全能自己做,限制出口反而容易招来对等反制。这和Ansari"卖数据等于资敌"的说法形成了直接对立,说明这场辩论目前还没有共识,更谈不上定论。
- 结论.训练数据是否会像芯片一样被纳入出口管制,取决于政策层怎么权衡"卡对手"和"招反制"这两头,而不是哪家公司先喊得响。
接下来值得盯的,是Micro1会不会拿出经审计的财务数据、新一轮融资是否真的按传闻的估值定价,以及Forbes报道里被点名的几家公司会怎么回应。这些答案出来之前,5亿美元和"Kimi靠美国数据变强",都只能算是行业公关战里的两句台词。
