2026年9月11日,科技访谈主持人Dwarkesh Patel发布了一场长达一个半小时的深度对话,前OpenAI联合创始人兼ChatGPT强化学习研发主导者、现Thinking Machines首席科学家John Schulman,与Zyphra首席技术官Beren Millidge、Baseten模型训练负责人Charlie O’Neill同台,正面对撞人工智能领域最具争议的命题:系统是否正逼近自主的递归自我改进。

这场讨论撕开了围绕通用人工智能的科幻滤镜。三位身处研发前沿的科学家并未兜售立刻降临的技术奇点,而是给出了冷静且存在巨大断层的推演:能够胜任日常计算机操作、达到月度维度的通用远程白领AI,预计在未来1到3年内(2027至2029年)就会成为现实;但在AI能否凭借自主改写代码与优化算法引发爆发式自增智能上,行业分歧拉大到了近十年。自我改进并非单点突破,它正撞上由科研品味匮乏、真实环境泛化失效以及非平稳任务共同筑起的技术高墙。

关键节点倒计时:从白领替代到十年分歧

在过去两年中,业界习惯了基准跑分的指数级攀升,但一线研发人员感受到的却是能力与落地之间的诡异拉扯。新模型问世时往往惊艳全场,可进入实际工作流一个月后,缺乏长程自检与判断力的短板便暴露无遗。尽管如此,在执行具体、边界清晰的计算机任务层面,技术演进依然遵循着冷酷的惯性。

三人罕见达成共识的判断在于,处理常规流程的数字劳动力即将跨越可用门槛。无论是在多工具协作还是长流程软件操作上,模型正在吃下标准化办公流程。

关键能力突破时间线推演:从日常任务到超智能的分歧 共识阶段 / 1-3年 2027-29 月度级通用远程白领 胜任跨工具日常计算机办公 三位一线专家达成高度一致 研发跃迁 / 约2年 ~2028 AI研发获10倍生产力 自主执行实验-反馈闭环修正 局限于既定指标与局部调优 分歧核心 / 3-10年 2029-36 全面超越顶尖人类专家 Schulman看好3-4年极速跃迁 O'Neill预警架构瓶颈需5-10年

针对AI能否在自身算法研发上带来10倍人类研究员生产力,John Schulman给出的时间窗口仅为2年,即2028年前后。Beren Millidge同样认同这一前景,但他划定了一个刚性前提:模型必须能在无人干预下,稳定执行至少1到2轮完整的闭环实验、评估与代码修正。

真正的分水岭出现在超智能节点的研判上。Schulman持最为乐观的技术态度,认为AI全面接管所有基于计算机的高阶认知工作只需3到4年,大约在2029至2030年完成跳跃。Millidge则相对折中,认为主流垂直赛道需要5年,长尾领域耗时更长。而来自工程一线的Charlie O’Neill则直言,现有的Transformer加强化学习架构离全局最优的学习系统仍有巨大落差,这一跨越很可能需要耗费5到10年,延宕至2036年。

自动化研发与自我改进:混淆概念掩盖了品味断层

大众舆论常将自动化编写代码等同于智能爆炸的开端。评估机构METR近期一直在呼吁,必须对AI辅助研究、自动化AI研发与真正的自主递归自我改进进行严格解耦。

当前的自动化研发现状,本质上是在人类划定的靶心内做梯度下降。模型可以飞速跑完成千上万次消融实验,但它缺乏一种核心素质:科研品味与贝叶斯实验选择能力

概念解耦:执行力内循环与范式跃迁的断层 自动化AI研发(局部顺风区) • 任务属性:累积型、指标可验证(代码/损失值) • 核心机制:在人类指定目标下执行海量实验循环 • 现状:算力放大产出,但难脱离人类设定靶心 递归自我改进(真正深水区) • 任务属性:非平稳型、开放科学探索 • 核心机制:自主提炼下一代学习范式并跨越现实鸿沟 • 瓶颈:缺乏底层品味,面临持续学习与泛化失效

科研任务分为两类:一类是目标函数明确、指标可衡量的累积型任务,比如压低预训练损失或优化推理速度;另一类则是目标高度模糊的非平稳型探索。当年的深度学习先驱发现下一个Token预测能通往通用表征,并非依赖某种既定算法的暴力枚举,而是一种对数据与智能规律的哲学直觉。

代码吞吐量的百倍爆发,并不天然等于科研范式的百倍跃迁。

如果一个系统无法判断哪一个反直觉的小实验值得赌上数百万美元算力,它的自我迭代就会停留在局部最优的死循环里。模型在可控的模拟沙盒中跑分极高,但一旦面临模拟与真实的泛化鸿沟(sim-to-real gap),或者遭遇底层元学习无法持续适应的阻碍,系统就会陷入停滞。这种能力不对称,正是自动化研发早早到来、而超智能迟迟无法收敛的核心症结。


破局者的解法与终局前的人类锚点

在探讨算法演进的同时,对谈揭示了另一个正在重塑全球竞争维度的技术现实:中国实验室在过去一年展现出极快的技术咬合力。

这种追赶并非来自算力规模的绝对对决,而是来自于对部署与路由数据的深度挖掘,以及对强化学习行为的精确模型蒸馏。实践证明,将前沿模型通过强化学习试错习得的推理逻辑迁移给更紧凑的架构,所需的信息量与比特成本极低。少数闭源实验室花费巨资搭建的长时程强化学习壁垒,在下游高效蒸馏机制面前正被迅速抹平。

这种动态让前沿竞争的逻辑发生质变。算力与数据先发优势的半衰期正在缩短,谁能在不确定的开放世界中定义新目标,谁才能守住阵地。

  • 结论.基层算法调试与代码工程的溢价将在两至三年内被全面压缩,软件开发和模型微调的体力劳动会被系统批量接管。
  • 风险.若将模拟环境中的高强化学习奖励等同于真实科研突破,组织很可能在海量无效代码和虚假繁荣的消融实验中耗尽算力预算。

当日常计算机操作被月度AI代理接管,当实验循环能够以十倍速运转,技术演进的接力棒实际上又交还给了人类最本原的特权:提出问题,并定义何为真正的价值。在机器学会自我顿悟之前,审慎挑选航向依然是碳基大脑无法让渡的防线。