旧金山前沿实验室正沉浸在一场由并发代码与推理算力驱动的集体狂热中。数以千计的自主Agent被密集排进模型的基础研发环节,促使关于递归自我改进与智能爆炸的末日论调再度甚嚣尘上。
但这并不是奇点降临的现场。眼下的研发提速本质上是一场依托海量推理算力堆砌的有损自我改进,它既未攻克开放式科研的探索黑盒,也无法摆脱商业化落地与物理算力成本的现实约束。
万级集群的推理繁荣与形式化特例
前沿机构对自动化研发的推进确实拿出了密集的实测进展。OpenAI在2026年9月6日宣布达成自动化研究实习生里程碑,其系统能在人类指导下接管原本需要耗费数天的工程任务;截至8月中旬,OpenAI研发团队的人均算力消耗已达到3.1个Agent工作日/人类工作日,内部更立项计划在2028年3月实现真正的自动化AI研究员。
这种并行算力在封闭目标下的吞吐量极为惊人。此前OpenAI曾调度约10,000个并发Agent在88小时内互通了270万条消息,最终成功推导出Navier-Stokes方程候选解并通过Lean形式化验证。然而,这类壮举的核心支柱是规则明确、校验即时的形式化边界,并不等同于模型拥有了自主迭代下一代架构的通用能力。
业内激进派将此视作飞轮已转的铁证。在技术研讨中,John Schulman预判AI研究员的综合生产力将在2年内提升约10倍,并在3至4年内主导计算机相关领域的人类专家;研究员Charlie O'Neill则预测,能够替代常规白领日常工作的常驻远程数字员工将在1至2年内成型。但这种对未来的线性外推,恰恰混淆了大规模推理运算带来的工程提速与算法内核自主进化之间的本质区别。
盲测零突破与科研审美的断层
当离开高度结构化的验证标尺,Agent集群的局限性便暴露无遗。Anthropic截至2026年8月的内部指数清晰表明,尽管Claude主导了内部26%的加权研发工作并在超过90%的项目中参与协作,但Claude在受测的任何研发子集里的完全自主率依然为零。即便在受限科研测试中,Claude通过消耗约800累计Agent小时弥补了97%的可用性能差距(相比之下两名人类专家一周完成23%),但整个问题的边界设定、评估框架与最终裁决,仍完全由人类研究人员掌控。Anthropic内部3月调研记录的4倍员工产出中位数,官方亦审慎提醒可能存在明显高估。
学术界的真实盲测进一步击碎了自主闭环的神话。2026年一项针对前沿Agent的影子评估中,系统在6天内烧掉数千美元算力攻坚两篇NeurIPS未发表论文的核心问题。尽管Agent生成了格式完备的工程代码,但在实质理论推进上颗粒无收,最终全部被原论文作者拒稿。
机器能加速实验执行,但无法代劳人类确立研究范式与直觉假设的审美能力。
正如Schulman谈及后训练团队现状时所承认的,确定模型应当如何表现往往需要大量专业人员介入思考,这类工作很难全盘自动化。Agent在处理开放问题时频频展现出科研审美缺失、资源调度失控以及长程指令漂移的硬伤,使其难以胜任真正的科学家角色。
算力账本与IPO前夕的商业铁壁
将当前的自动化浪潮定义为有损自我改进,其背后的根源在于不可回避的物理约束。缩放定律明确标定了算力指数级消耗与智能线性提升之间的残酷现实,增加并行Agent的边际效用正在加速递减。
前沿实验室还必须直面房间里的大象。随着OpenAI等机构全力筹备公开上市(IPO),资本市场对研发支出的投资回报率(ROI)审查正在急剧收紧。大规模推理算力不仅价格昂贵,更无法在财务报表上被无节制地留作内部自循环。正如Noam Brown所指出,算力与物理硬件等非智能瓶颈,直接排除了技术能够一夜之间提速百倍的设想。
- 风险.若将短期推理算力爆发误读为真递归自我改进,开发者与投资者极易低估长尾白领落地的工程脏活,并在商业化财务铁壁前承受算力成本错配的重创。
正如理性派研究员Richard Ngo的判断,当前社区正陷入一种方向正确但事实上错误的群体预期。未来8年内超级智能大概率不会降临,但局部吞吐量的暴涨足以营造出奇点迫近的感官错觉。从高验证数学攻坚走向脏乱的现实工作流,真正的竞争壁垒依然在于人类对问题标准的定义深度,而非幻觉中的自主飞轮。
