成立仅两年的机器人训练数据初创公司 Mecka AI,近期传出正与红杉资本敲定一笔估值约 5亿美元 的新一轮融资。这距离其上一轮 6000 万美元融资宣布仅仅过去三个月。更激进的是,其联合创始人兼首席执行官 Josh Gao 甚至给出了极其扎眼的远期预期,宣称基于已签署的合同,公司到 2026 年底的年化运行率将达到 1亿美元。
在通用文本数据已被大模型开发团队挖掘殆尽的当下,真实物理世界的人类动作数据被视作下一个战略高地。但若仔细剥开红杉与数亿美元估值交织的繁茂叙事,这场尚在磋商中的交易其实不仅缺乏最终交割的确定性,更暴露出商业客户极度单一的透明度困境,以及具身智能底层最为尖锐的技术路线大分裂。
6800万美元融资拼图与未落定的红杉传闻
梳理公开档案可以发现,外界对于 Mecka AI 估值飞跃的印象主要来自高密度的融资宣发。在 2025 年 8 月,该公司先获得了由 Neo 领投的 800万美元 种子轮融资;随后加密与多策略基金 Framework Ventures 领衔了其总额 6000 万美元的后续支持。这笔 6000 万美元实际被拆分为两期交付,包含 2025 年 11 月完成的 2500 万美元 A 轮以及后来的 3500 万美元追加注资。
直至本次传闻之前,Mecka AI 累计可核实的实际融资金额为 6800 万美元,而其前几轮的真实估值水平从未对外披露。
更关键的事实断层在于交易的进展状态。截至目前,红杉资本的官方投资组合名录并未收录 Mecka AI,双方也均对交易传闻保持缄默。这意味着所谓的 5 亿美元估值目前仍停留在意向谈判和条款博弈阶段,并不等同于不可推翻的既定事实。
与这种资本层面的模糊对应的是其营收口径的暧昧。Josh Gao 所宣称的年底 1 亿美元年化运行率,计算基准是手头已签订合同的预期规模,而不是在财务报表上按月平摊、稳定回款的常规循环订阅收入。
在真实的商业世界里,为期数年的框架协议能否转化为实际账面进账,完全取决于交付进度与客户验收结果。
- 提醒.二级市场研究中目前能与该公司公开关联的真正付费客户仅有 1X Technologies 一家,其官网上高调列出的斯坦福大学、苏黎世联邦理工学院以及 Meta Reality Labs 等机构,实际均属于开源研究联合体的学术伙伴,并不构成支撑数千万美元收入的企业级大单。
路线对决:手机众包的便宜与遥操作的昂贵
Mecka AI 讲给投资人的核心故事,是成为具身智能领域的 Scale AI。团队招募大量兼职采集员,让他们在身上佩戴基础传感器、手持日常智能手机,在厨房泡咖啡、在车库修车,以第一人称主观视角拍摄数万条生活动作片段。这种模式的边际成本极低,能在极短时间内把数据体量堆砌到成千上万小时。
然而硬件工程师与一线机器人实验室正在用脚投票,走向完全相反的技术流派。
最典型的对照标的是脱胎于开源遥操作框架 GELLO 的初创公司 XDOF。XDOF 同样在洽谈新一轮融资,目标估值高达 12 亿美元。但支撑 XDOF 约 24 倍市销率估值倍数的是相当扎实的现实数据:其此前完成 7000 万美元 A 轮融资,目前年化收入已达 5000万美元 左右,服务着约 20 家企业级客户。
XDOF 让受训操作员操纵实体外骨骼与机械臂去抓取物件,成本虽高,但每个动作都精准绑定了关节角度、扭矩与受力数据。
行业内部的竞争压力不仅来自垂直竞品。标注平台巨头 Scale AI 在 2025 年已对外交付了超 15万小时 的具身智能交互数据,新增 10 家机器人商业客户,其最新隐含估值突破 290 亿美元;由众包起家的 Micro1 也宣称 2026 年 8 月全口径年化运行率达 5 亿美元,净年化收入在 1.5 亿至 2 亿美元区间,并正大举向多目立体视觉与 IMU 机器人数据迁移。
面对拥有成熟工程交付能力的前辈,缺少机器人学原生基因的 Mecka 团队,并没有退路。
缺乏接触力矩,人类录像跨不过具身鸿沟
纯人类第一人称视角的视频数据,能否像大语言模型消化互联网文章那样直接催生出通用的具身智能?机器人学界目前的共识正在变得极其谨慎。
机器人不是长了眼睛的摄像机,它是需要实时对抗重力、摩擦力与冲击碰撞的物理实体。
Mecka AI 开源的核心基准学术成果 EgoVerse 提供了观察其技术局限的最佳切口。在该论文记录的测试集中,团队调动了 2087 名采集者,录制了 1362 小时、近 8 万个片段及 1965 项日常任务;而在其官网上,该数字已动态扩充至 4003 小时。
但撰写这篇论文的学者们在结论中明确承认了一处冷酷现实:人类第一人称数据规模的无序膨胀,只有在与机器人特定任务的学习目标严格对应对齐时,才会展现出正向收益。
物理执行策略模型最渴望的数据并不是画面看起来有多自然,而是手爪捏碎纸杯那一瞬间的力反馈、桌面粗糙度产生的反向阻力,以及操作失误后如何将末端执行器重新移回平衡态的纠偏轨迹。
兼职人员胸前佩戴的手机摄像头可以看清咖啡机的手柄位置,却无法记录手指施加了多少牛顿的拉力。用欠缺力学维度的视频去直接端到端训练机器人运动策略,极易导致算法学出大量的动作幻觉。
- 结论.对于急于在装配车间和家庭场景量产人形机器人的本体厂商而言,向众包平台采购泛化视频只能用于辅助构建理解物理规律的世界模型底座;若想让机械臂真正把杯子稳稳放进托盘,目前依然离不开高昂的遥操作真机训练。
具身智能研发的重心正在从参数量的纸上比拼,迅速逼仄向物理接触的力学细账。红杉资本倘若最终开出这笔 5 亿美元的支票,它买下的究竟是一座足以支撑物理大模型的低成本数据矿脉,还是一个在真机落地门槛前必须再次转型的视频众包中介,终究要看这批由手机拍出的影像,能否让冰冷的机械手指少摔碎几个杯子。
