英伟达初创加速计划实体AI全球主管Les Karpas将于2026年10月13-15日旧金山举办的TechCrunch Disrupt 2026「真实世界AI」舞台发表演讲,直面通用机器人为何尚未迎来类似2022年11月ChatGPT般的爆发时刻。这位常年穿梭于硬件制造与初创企业之间的生态负责人给出了一个朴素判断:实体AI缺乏类似互联网规模的真实世界动作数据集,现阶段试图通过仿真与跨本体基座模型强行催熟的尝试,正撞上一堵无形的物理学墙。
大语言模型依赖互联网公开抓取的百亿级文本与图文Token跨过了泛化门槛,但实体AI需要同步记录关节状态、执行器力矩、触觉力反馈与相机位姿标定等连续动作数据。人类通过键盘敲下的文字能够无损数字化,机械手臂与真实物体的高频摩擦接触却无法靠爬虫抓取。这并非靠堆砌云端算力就能解决的数据工程,而是一场关于物理因果律的代偿危机。
虚实代偿:英伟达GR00T的算力扩张与转移的瓶颈
面对动作数据枯竭,英伟达交出的答卷是重度押注基础设施与合成数据生成。在2025年3月18日推出首个开源人形机器人基座模型Isaac GR00T N1之后,英伟达又在2026年1月5日更新物理AI技术栈,接连发布Cosmos Transfer 2.5、Cosmos Predict 2.5、Cosmos Reason 2,以及Isaac GR00T N1.6与Isaac Lab-Arena评测套件。

官方披露的数据展示了庞大的虚拟生产力:其GR00T管线能够在11小时内生成750,000条合成运动轨迹,通过GR00T-Teleop到GR00T-Mimic再到GR00T-Gen工作流扩张多任务动作。类似的方法也出现在学界,Ai2推出的MolmoBot通过在94,000多个生成环境中运行170万条仿真轨迹实现了部分零样本真实迁移。但仿真轨迹能够精确模拟刚性几何环境,一旦面对流体、柔性线缆装配与不可预测的微观接触力学,合成数据生成的世界模型就会出现断层。仿真降低了遥操作人工示教的单条数据边际成本,却将工程压力完全转嫁给了真实迁移环节。
虚拟环境能够制造无数条完美的运动轨迹,却算不准一颗螺丝旋入时的毫米级摩擦偏差。
落地真相:灵巧手失准与长程任务的数学崩塌
行业内部目前裂变为四种技术落地流派:除了英伟达的基础设施路线,谷歌DeepMind依托Gemini Robotics主攻高级物理推理与多智能体协同;Physical Intelligence专注跨本体通用策略预训练;Figure则坚持垂直一体化闭环硬件与生产线实战。然而翻开各方的实测底牌,光鲜的演示视频与量产工位之间依然隔着一道鸿沟。

谷歌发布的Gemini Robotics 2系列模型虽然具备视觉常识推理,但在精细多指灵巧手任务上表现受限:官方公布的拧灯泡成功率仅为36%、系垃圾袋成功率44%、使用簸箕32%、密封拉链袋40%。Ai2的MolmoAct 2在2026年第三方双臂评估中平均得分仅为0.51。Physical Intelligence发布π0与π0.5,并在家庭未见环境中实现10至15分钟自主清洁操作,但其最新π0.7依然处于研究示范阶段,尚未形成规模化客户现场交付。
相比之下,选择重资产闭环的Figure展现了垂直场景的价值:其Figure 02人形机器人于2025年在宝马斯帕坦堡工厂参与生产30,000辆汽车,并在2026年携搭载Helix 02的Figure 03重返工厂执行物流工序;Figure Index截至2026年8月已上传超过1,600万段人类活动视频。即便如此,人类日常视频中缺失关节力矩与六维位姿数据,依然需要巨大的标定转换成本。
更严峻的制约来自概率数学。当20个连续依赖子任务单步成功率为95%时,整套序列全部完成的独立复合成功率仅约36%。工业场景无法容忍三分之二的故障率。近期针对基准测试的审查更撕下了学术繁荣的标签:无语言编码器的简单探测模型即可在LIBERO基准上达到接近SOTA水平;而CALVIN基准在名义训练范围内仅随机调整方块位置,就会导致所有被测策略性能显著下降。当前的评测集更像是机械工程师的调参工具,而非物理智能涌现的试金石。
退出客厅幻想:具身智能退守工业夹缝
Capgemini 2026年实体AI调查报告显示,76%的受访高管认为从试点项目迈向规模化商业部署是一项重大挑战。这一调查数据解释了为何机器人的全能管家叙事正迅速降温。

- 风险.消费级人形机器人试图直接接管非结构化的家庭环境,已被高昂的硬件损耗与极高的长程错误率证伪;脱离固定工装和结构化防护,通用本体难以提供具备经济可行性的平均故障间隔时间。
- 建议.行业正在形成务实共识,真正的技术突破不会诞生在端茶倒水的起居室,而必须退守至仓储分拣、汽车产线物料周转等局部受限环境;依靠单一工位的高频重复作业积累闭环接触数据,才是跨越物理世界鸿沟的唯一路径。
