全球最懂技术走向的一批头脑,刚刚为自己的保守预测集体买了单。预测研究机构(FRI)长期追踪的纵向专家项目显示,从奥林匹克数学竞赛到病毒学能力测试,大模型的跨越速度比顶尖学者与超级预测员的中位数预估提前了整整五到十年。

这场误判不仅发生在象牙塔的纸面推演里。在商业变现维度,专家此前给出的2026年底全行业最高年化营收预测上限仅有200亿美元,而截至2026年9月,Anthropic的年化营收跑率已折算攀升至约1000亿美元。技术从线性的经验外推,彻底转向强化学习与测试期计算扩展带来的阶跃式失控。

胜率不足一成的集体踏空

许多人把预测研究机构公布的24.6%与9.7%两个数字误读为专家的预测准确率,这恰恰掩盖了真正的技术震荡。这两个数字实际上是专家与超级预测员在2022年调查中,对后来实际达成的MATH、MMLU、QuALITY以及国际数学奥林匹克竞赛(IMO)金牌这四项基准,拟合连续概率分布后赋予的平均发生概率。

换句话说,全球顶级计算机科学家事前认为现实发生的概率不到四分之一,受过严谨概率训练的超级预测员甚至认为发生概率不足10%。在2022年评估2025年底前大模型能否拿下IMO金牌时,领域专家给出的概率只有8.6%,中位数预期要到2030年;超级预测员更是只给了2.3%的极端低概率,中位数看向2035年。结果在2025年7月,模型已达成了金牌水平线。

关键节点时间线:预测共识与现实突破的断层 2025年4月-7月 现实接连突破 VCT与IMO金牌达标 2030年 领域专家中位数 推测达成核心基准 2034年-2035年 超级预测员中位数 推测达成安全与竞赛指标

这场提速同样出现在生命科学和代码代理领域。原定2030年才可能攻破的病毒学排错门槛,在2025年4月发布的病毒学能力测试(VCT)中就被击穿。包含322道多模态专业考题的VCT基准里,人类专家的平均得分仅为22.1%,而OpenAI o3取得了43.8%的得分,一举超过94%的专科专家。与此同时,软件工程基准SWE-Bench Verified被预期在2026年初强提示下达到约87%的解决率,配合独立网络安全测试基准Cybench的推进,机器在智力闭卷考场中几乎剥夺了人类的相对优势。

当做题的边际成本趋近于零,传统基于历史经验的线性外推就已经死亡。

纸面做题狂欢与物理世界的断层

基准测试的惊人提速,直接放大了宏观治理者的安全焦虑。在生物风险专项调查中,46位生物安全专家原先评估全球因突发疫情导致超10万人死亡或万亿美元损失的年化基线概率为0.3%;但当AI达到顶尖病毒学团队水平的条件成立时,专家对该年化风险的预估直接飙升五倍至1.5%。

但在考场之外,一个必须正视的现实断层正横亘在所有人眼前:AI解决试卷的能力,完全没有平移为物理世界的操作能力。

认知与实体脱节:答题得分率 vs 湿实验成功率 VCT 病毒学答题得分 43.8% OpenAI o3 (人类专家均值仅22.1%) 真实生物实验完成率 5.2% 大模型辅助组 (纯网络对照组为6.6%)

在严格控制的实体生物实验中,由大语言模型加互联网辅助的人类操作组,生物实验任务完成率仅为5.2%,甚至略低于仅使用互联网检索的对照组(6.6%)。模型在纸面上击败了94%的专科专家,但一旦进入涉及耗材、仪器调校、试剂配比的湿实验环境,纸面推理的超前并没有带来任何可测量的实操加成。

  • 提醒.把高分闭卷测试直接等同于现实武器化或产业颠覆能力,会引发不必要的监管错配与防御资源空转。

类似的落差同样出现在无人驾驶领域。专家此前对2027年美国自动驾驶网约车里程渗透率给出了7.3%的中位数预估,而根据模型前沿推演,实际兑现值可能仅在2.5%附近徘徊。


击穿预期的千亿营收与口径泡沫

如果说物理落地的迟滞给实体产业留出了喘息空隙,商业层面的数字膨胀则彻底撕碎了经济学家的预测尺子。

评估维度2022年专家预测中位数2026年实际业务表现核心驱动与争议
最高年化营收跑率200亿美元 (经济学家给160亿)Anthropic约1000亿美元包含部分云厂商转售毛额
头部次席跑率未达百亿预期OpenAI超过400亿美元偏向采用净额法核算
单季实际营收远低于50亿美元2026年Q2分别为116亿与67亿企业级Token调用爆发

到2026年9月,Anthropic年化营收跑率突破1000亿美元,相比两个月前披露的650亿美元激增超过50%;OpenAI同期的年化跑率也已越过400亿美元大关。仅在2026年第二季度,两家公司的单季实际营收就分别达到了116亿美元和67亿美元。

这种狂飙的背后并非没有财务口径的推手。Axios等财经分析明确指出,Anthropic的千亿数字采用的是单月或单季折算的Run Rate,并在计算中计入了部分云厂商深度绑定的合作总流水毛额;相比之下,OpenAI更多采用净额核算法。两家公司统计口径的分歧放大了纸面上的差距,但即便剥除水分,市场为AI算力和API接口砸下的真金白银,也让当初超级预测员给出的250亿美元最激进上限沦为笑柄。

  • 结论.技术突破正在跳过实体渗透环节,直接通过算力租赁和企业软件预算,重构科技巨头的现金流底座。

面对全面失效的经验外推,发起调研的FRI已开始将大语言模型自动生成的预测纳入基准系统。当连预测AI演进的工具本身都必须交由AI接管时,决策层面对的不再是按部就班的五年规划,而是一个失去绝对坐标系的全新周期。