前沿实验室最近流行一种论调:AI 正在自己写下一代 AI,递归自我改进(RSI)引发的软件智能爆炸近在眼前。但真实情况是,这种加速本质上是用海量推理算力雇佣成千上万个工程实习生,而非模型拥有了自主发明新科学的超凡智慧。

Epoch AI 洞察团队负责人 JS Denain 与 Nathan Lambert 在播客对话中点破了这一层滤镜:实验室公布的研究加速数据确实惊人,但如果把局部代码的堆砌误判为底层智能的飞跃,就会对当下的技术周期产生严重错判。

单日烧掉 7,000 美元的工程杠杆

OpenAI 与 Anthropic 近期披露的内部数据,展现出一条极其陡峭的工程吞吐曲线。到 2026 年 5 月,Anthropic 代码库中已有超过 80% 的合入代码由 Claude 编写;2026 年第二季度,工程师每日合并的代码量飙升至 2024 年的 8 倍。在受限代码优化任务中,Claude 带来的平均加速从 2025 年 5 月的约 3 倍跃升至 2026 年 4 月的 52 倍,开放式编码任务的成功率也达到了 76%。

OpenAI 同样宣布在 2026 年 9 月达成了“自动化研究实习生”目标,系统可在人类指导下接管需要耗时数天的定义明确型任务。其研究机构内部的人机工时比达到 1:3.1,即人类每投入 1 个工时,就对应约 3.1 个智能体工作日。到 2026 年 8 月,每位活跃实验者运行的实验数量创下了 2025 年 1 月以来的最高纪录。

但这套吞吐奇迹是用真金白银砸出来的。截至 2026 年 8 月中旬,OpenAI 内部使用编码智能体的研究人员,推理成本中位数超过 600 美元/天,排名前 10% 的核心研究员单日消耗更是超过 7,000 美元。在 Anthropic 最常用的内部平台上,同时并发运行着约 30,000 个研究与工程智能体。

实验室内部研发自动化的关键度量(2026) 80%+ Anthropic 合入代码由 Claude 编写 合并代码总量达 2024 年的 8 倍 52 倍 受限代码优化平均加速倍率 开放式编码任务成功率 76% $7,000+ OpenAI 前 10% 用户单日推理开销 研发人员消耗中位数超 $600/天 规模并发背后的工时倍增 Anthropic 平台常态化运行约 30,000 个工程智能体;安全算力占比从全机构的 6% 升至 AI 研发的 12%。 OpenAI 人机工时比达到 1:3.1,但增长几乎全部分布在排错与基建,高端战略决策依然停滞。

这些数字勾勒出的并不是一个自我觉醒的智慧生命,而是一台被超大规模算力驱动的代码压延机。智能体极其擅长在给定的狭窄轨道内排查故障、重构模块、测试用例。然而,把代码产出翻上几倍,并不等于把科学发现的进度条推进同样距离。

代码膨胀不等于认知跃迁,廉价的试错甚至正在稀释研发的真实信噪比。

锯齿状分布与顶层规划的断崖

AI 能力的增长从来不是平滑上升的水位,而是呈现出极其刺眼的锯齿状。

在 Anthropic 的内部评估中,截至 2026 年 8 月,Claude 已经“主导”了约 26% 的内部 AI 研发工作,且超过 90% 的被测任务达到“AI 协同”级别。然而关键限制在于,尚无任何一个研发子领域达成完全自主

研发层级中的锯齿状能力落差(Jaggedness) 高自动化层:工程与基础设施执行 • 代码优化与重构(提速最高 52 倍) • 测试生成与环境排障(接管 80% 提交) • 大规模实验执行(并发 30,000 智能体) 特征:定义明确、验证成本低、试错成本廉价 近零自动化层:科学假设与顶层决策 • 下一代模型架构创新(0% 子领域全自主) • 跨周期算力资源倾斜与战略下注 • 物理世界长程任务与具身闭环约束 特征:需要宏观判断、高试错代价、不可外包

正如 Denain 与 Lambert 在播客中所讨论的,初级科研人员的工作节奏可以被大语言模型加速数倍,因为他们的日常被写胶水代码、清洗数据、跑调参脚本所填满。但对于掌舵核心路线的资深科学家而言,团队的宏观研发节奏并没有实现同等比例的跨越。

研发链条里存在一个无法绕过的阿姆达尔定律:当代码工程被压缩到接近瞬时完成时,剩下的瓶颈——提出有价值的科学假设、判断有限算力的下注方向、识别真正有潜力的技术路线——就变成了整栋大厦唯一的承重墙。

即使活跃实验者运行的实验数量刷新纪录,这些实验里有多少只是因为试错成本下降而带来的数据噪音?当代码变得廉价,平庸的代码和无效的探索就会像潮水一样涌入。人类研究员没有被替代,反而被迫退守到验证阀门的位置,日夜审阅着海量的自动化 PR 与实验曲线。

  • 风险.如果单纯根据代码产出或实验次数来推算通用人工智能的降临节点,会把高强度的算力套利误认为实质性的理论突破。

蒸馏拉锯与隐形壁垒

这场研发自动化的争论,同样延伸到了中美模型代差与开源生态的攻防上。

行业长期存在一种解释,认为开源与跟进者之所以能快速贴近前沿,核心依赖于对顶尖闭源模型的蒸馏。但随着 OpenAI 和 Anthropic 开始将 3 万个智能体编织进自研闭环,竞争的护城河正在发生转移。

闭源头部实验室在内部用海量算力为自己打造了一套专属的“研发加速流水线”。其真正拉开差距的,已经不再是单次训练所公开的论文方法,而是整个后训练配方的工程迭代速度,以及在 AI 协同过程中沉淀的工程基础设施。Anthropic 甚至将其 AI 研发中的安全算力比例提升到了约 12%(全机构常态研发中该比例为 6%),试图通过自动化红蓝对抗来修补系统脆弱性。

中国实验室与全球开源社区展示了极强的工程吸收能力与架构改良效率,但在面临这种“每人每天消耗 7,000 美元推理来迭代下一代算法”的算力重资产玩法时,双方拼的就不再是单纯的模型架构巧思,而是支撑高并发研究智能体的算力资本底座。

  • 结论.中美以及开源闭源的真正分水岭,正从静态的预训练跑分,转向动态的内部研发流水线迭代周期。

《淮南子》有言:“规矩陈设而兼备,不可以为巧。”工具与章法再齐备,也不能凭空幻化出天工之巧。前沿实验室用日掷万金的算力,确实拼凑出了一批不知疲倦的代码劳工,让实验的流水线日夜不休。

但递归自我改进不是把旧工序重复万次,而是要跨过从“按图索骥做工程”到“无中生有立范式”的鸿沟。只要机器还无法自主确立新的科学公理,这套宏大的自动化奇迹,就依然只是人类智力杠杆下的一场昂贵演练。