资深软件工程师 Alex Nedelcu 在 2026 年 9 月 22 日发表博文,将矛头直指业内蔓延的生成狂热。过去几个月里,不写代码、不再做代码审查、不再读代码成了技术圈的新潮口号;但 Nedelcu 给出冷峻预言:由于缺乏长周期架构维度的度量衡,由提示词驱动生成的项目迟早会退化为无法维护的泥潭,未来甚至会有越来越多企业将禁止使用 AI 作为核心竞争优势。
这一预言并非技术保守主义者的牢骚,而是切中了软件工程正在发生的深层裂变。大模型让局部生成和单元测试变得前所未有地轻松,但现代工程的支柱从来不是打字速度,而是对系统不变量的掌控。当团队只顾享受提示词即时交付的快感,全行业正在无形中积累起极难偿还的理解债务。
繁荣下的工程剪刀差:重构暴跌62%与交付稳定性滑落
业界对 AI 提效的感知,长期建立在精心挑选的微观测试之上。GitHub 在 2024 年组织过一项针对 202 名资深 Python 开发者的双盲对照实验,Copilot 辅助组在独立评审中的可读性评分提升 3.62%,主观可维护性微升 2.47%,单元测试全部通过的概率更是暴涨 53.2%,PR 批准率同步高出 5%。这类实验室跑分,构成了当下整个行业跑步拥抱自动化的底气。

然而,拉长周期进入真实生产环境,数据立刻露出了截然相反的底色。GitClear 追踪了 2020 至 2024 年间 2.11 亿行变更代码,结果发现系统重构和移动代码的占比从 2021 年的 24.8% 崩塌至 2024 年的 9.5%;与此同时,单纯复制代码的比例攀升至 12.3%,历史上首次超过重构代码。整个代码库的变动率(churn)从 3.3% 蹿升至 5.7%,新提交代码在首月内被二次推倒重写的概率较过去高出 20% 至 25%。
Google 2024 年公布的 DORA 报告同样证实了这种剪刀差的存在。组织内 AI 采用率每提升 25%,团队感知到的文档质量上升 7.5%,代码审查速度提升 3.1%,可宏观上的交付吞吐量反而下降了 1.5%,交付稳定性更是净跌 7.2%。
局部的高歌猛进与全局的系统腐化并存,说明软件工程正在经历一场前所未有的消化不良。
奖励函数的结构局限:大模型理解不了“跨年度成本”
为什么大模型能够生成工整的代码块,却无法维系一个健壮的架构。根本原因藏在强化学习与软件工程本质的冲突中。

现代大模型的代码微调高度依赖基于规则的即时反馈。强化学习需要一个能立刻计算的分数:语法是否合法、单元测试是否通过、静态检查报错是否归零。但可维护性从来不存在即时适应度函数。一个优秀的软件架构往往需要抵御数月甚至数年之后的业务演进;设计中的关键不变量、解耦边界与拓展余量,无法在生成代码后的几秒钟内换算成正向奖励。
因此模型只能退化为规则手册的执行者。它们从良莠不齐的公开开源语料中学习模式,倾向于通过拆分函数来制造模块化的假象,实际却抽取出一堆毫无复用价值的微小函数,迫使人类为了看懂主干不得不逐层翻查实现细节。这种做法能迅速通过圈复杂度等机械检测,却直接粉碎了阅读者的连续思维。
Fu 等人发表于 ACM TOSEM 2025 的研究进一步展示了这种短期拼凑的代价:GitHub 公开项目中由 AI 生成的代码里,有 29.5% 的 Python 代码和 24.2% 的 JavaScript 代码存在安全缺陷,跨越 43 类 CWE 漏洞。即便借助 Copilot Chat 并在静态分析警告辅助下全力补救,最终也仅能修复 55.5% 的漏洞,剩下接近一半的隐蔽隐患依旧留在代码库底层。
模型只负责交付满足当下条件的代码片段,而维持全局稳固所需的主动克制与远见,在现有的奖励机制里根本没有立足之地。
速度幻觉与审查困境:人类正在透支理解资产
当大量看似可运行的代码源源不断涌入仓库,开发团队所经历的效率飞升很可能只是一种认知错觉。

2025 年初非营利研究机构 METR 针对 16 名经验丰富的开源开发者进行过一次随机对照试验。在使用当时的 AI 工具修改熟悉仓库的任务中,开发者主观上笃定自己变快了,实际耗时却比纯人工操作多出了 19%。生成只需一秒,验证却是一场漫长的拉锯。2025 年 Stack Overflow 开发者调查印证了这种群体的疲惫:84% 的受访者在开发中使用或计划使用 AI,但 46% 的人明确表示不信任生成结果,仅有 3% 抱有高度信任;高达 66% 的开发者被那种看似正确但暗藏玄机的代码反复折磨,45% 坦言调试 AI 代码耗费了更多工时,87% 的人对自主 Agent 的可靠性深存戒心。
工具之间的表现同样分化严重。一项追踪 2807 个公开仓库、37623 个 Agent PR 的 2026 年 9 月预印本研究显示,不同工具给团队带来的认知负担截然不同:Claude Code 的每修改行代码变动率在所有基准中最低;OpenAI Codex 生成的 PR 回滚率仅为 6.1%,甚至优于人类对照组的 11.5%;但 GitHub Copilot 提交的 PR 却触发了全场最多的审查修改请求。
真正的危机并非技术债的单纯堆积,而是 Nedelcu 所警告的理解债务(Comprehension Debt)。
根据技能习得的德雷福斯模型,工程师要想从高级初学者进阶为能够一眼识别坏味道的架构专家,必须通过亲手试错、反复经历生产故障并承担后果,建立起不可明说的工程直觉。而如今的提示词编程正在阻断这一反馈回路。当开发者不再深度阅读上下文、不再手写核心逻辑,机器犯错,机器却不会在教训中沉淀直觉,依赖机器的人同样一无所获。
软件开发从未被生成式大模型真正解决,被淘空的只是团队对复杂系统的掌控力。
- 风险.如果团队仅以即时吞吐量评估绩效,放任无人通读的黑盒代码流入主干,系统迟早会在下一次业务结构调整时迎来无法重构的连锁坍塌。
当大厂不再把打字行数当成瓶颈,行业的分水岭正悄然重塑。未来的核心技术竞争力,不会属于那些毫无底线拥抱全自动生成、坐视重构比例崩盘的组织;相反,它将属于那些能够坚守防御性工程规范,划定机器生成边界,并把团队对系统心智模型的理解力视作不可侵犯资产的工程师。
