AI 淘金热里最先被判定死刑的赛道,如今正在开出最夸张的支票。
2026 年 9 月 22 日,AI 数据开发平台 Snorkel AI 宣布完成 3.5 亿美元 E 轮融资,投后估值达到 35 亿美元,由 Insight Partners 与 S32 联合领投。距离上一轮 2025 年 5 月由 Addition 领投的 1 亿美元 D 轮融资仅仅过去一年多,其估值从 13 亿美元跃升至 35 亿美元,实际增幅约 2.7 倍。更刺眼的是其业务规模的膨胀速度:CEO Alex Ratner 披露,公司的年化营收运行率在发布融资当周突破 3.75 亿美元,相较一年前约 2000 万美元的水平,单年膨胀了 18 倍。
在大模型问世初期,科技界一度流行一种笃定判断:更强的大模型能自己标注数据,传统数据外包公司将迅速贬值。但眼前的账本撕开了这一幻觉。
从冷板凳到后训练风口
Snorkel 并非横空出世的新秀。它的技术底色源自斯坦福大学的弱监督开源项目,核心逻辑是让领域专家编写标注规则与代码函数,通过统计模型把规则、外部启发式信号与模型推理融合,用算法替代全人工单条打标。
2021 年,Snorkel 踩着上一轮 AI 浪潮以 10 亿美元估值跻身独角兽。但在随后的四年里,它结结实实坐了冷板凳。从 2021 年到 2025 年,其估值仅从 10 亿美元爬升到 13 亿美元,年化增幅只有约 7%。企业客户忙着测试前沿大模型的 zero-shot 能力,都在打自己的算盘:既然大模型自己就能分类文本、打标签,为什么还要买昂贵的数据开发软件?
技术的演进往往在否定旧形态的同时,以更苛刻的形式索取底层补给。
转折发生在预训练数据的红利耗尽。当公开抓取的互联网文本被扫荡一空,模型演进全面撞墙,前沿竞争迅速倒向后训练阶段。强化学习、复杂代码推理、工具调用与多步 Agent 评测,对低成本的人工标注毫不买账。大模型不仅没有消灭标注需求,反而把数据供应链的门槛从机械流水线推上了专家实验室。
面对变局,Snorkel 在商业策略上完成了彻底转向。它不再执拗于向企业兜售数据标注开发平台,而是直接下场,转型推行数据即服务模式。针对特定领域专家网络,Snorkel 将其原生算法与领域专业知识绑定,批量生成合成数据并构建强化学习模拟环境,直接向急需弹药的 AI 实验室交付成品数据集。
企业落地数据也随之兑现:零售平台 Wayfair 应用该系统将模型开发效率提升 10 倍,加购率提高 5 个百分点;Experian 实现了 35% 的客服邮件自动化与秒级响应;Memorial Sloan Kettering 癌症中心在临床试验患者筛选中拿下了 93% 的分类准确率。
巨头阴影下的三派博弈
后训练数据荒引爆的不仅是 Snorkel。整个 AI 数据基础设施赛道正经历空前的资本重定价。Grand View Research 数据表明,全球数据标注市场在 2024 年规模为 38 亿美元,预计到 2030 年将膨胀至 171 亿美元;而 Gartner 与斯坦福 AI Index 同样记录着生成式 AI 软件与民间资本投入的高速扩张。
但在这个高价值阵地里,各家走出的技术路线大相径庭。
| 平台 | 最新估值 | 核心模式 | 交付形态 |
|---|---|---|---|
| Scale AI | 290 亿美元 | 超大规模人力网络与自动化中台 | 标注中台与政企综合数据方案 |
| Surge AI | 传闻约 240 亿美元 | 高门槛专家直聘(NLP/高阶代码) | 人工评测集与对齐验证数据 |
| Snorkel AI | 35 亿美元 | 程序化弱监督算法 + 专家协同 | 强化学习环境与合成训练集 |
Scale AI 依托 Meta 等巨头的入股与政企订单,构建起庞大的运营机器;Surge AI 坚守极高质量的专家直聘体系,吃透最挑剔的代码与对齐任务;估值 35 亿美元的 Snorkel,则试图在纯人力外包与黑盒纯合成之间卡住中间地带。
然而,界限正在变得模糊。Snorkel 宣称自身并非纯人力中介,专家费用被计入营业成本而非流水扣减,但为了满足前沿对齐任务,它同样招揽了数以万计的法律、医疗与软件专家。当各方都在拼抢高水平人力资源时,算法的杠杆率究竟有多高,成为横在毛利率面前的一道考题。
狂飙背后的暗礁与变量
喧嚣的数字背后,有几重现实约束未被摆上明面。
首先是营收口径的透明度。无论是官方博客宣称的 3.75 亿美元,还是路透社报道的超过 3.5 亿美元,所引用的指标均为当周或当月的年化运行率,而非经审计确认的年度营收。路透社虽然报道其预期在 2026 年内实现盈利,但在本次融资通稿中,利润率、客户集中度以及现金消耗数据均未披露。在生成式 AI 实验室突击采买高阶数据的背景下,这些订单究竟是可持续的订阅合同,还是阶段性的单笔突击采购,仍有待观察。
- 风险.如果后训练采买高度集中于极少数头部大模型机构,任何前沿模型推理架构的变化或实验室自建模拟环境的推进,都会立刻拉低第三方数据商的净收入留存。
此外,Gartner 与 G2 的客户反馈显示,虽然 Snorkel 在算法人员与业务专家的协作体验上受到肯定,但其系统在复杂生产环境下的工程稳定性依然偶有波动,部分新特性并未完全达到工业级标准。
汉代扬雄在《法言》中写道:“鸿荒之世,大朴未分。”在公开互联网数据唾手可得的蛮荒阶段,大模型凭暴力堆料一路攻城略地;而当大朴已分、粗放采集见顶,技术的决胜点被迫收缩至高纯度的专业领域。Snorkel 的估值三倍跳涨,本质上是一次行业补税。但这门生意的终局,绝非简单的人工与规则拼接。能否将弱监督算法打磨成具备真实壁垒的复杂 Agent 评测工厂,才是支撑其 35 亿美元估值跨过周期的唯一凭证。
