一位没有任何计算机科班背景的开发者,用了一年时间,借助大模型拼装出一套由 TypeScript 构建的复杂业务系统,包含数据库配置、多模型调用和自动化链路。原型运转良好,但当他尝试推向真正的生产环境时,工程陷入了停滞:每修复一个 bug 就会诱发新的异常,一旦脱离模型提示词便寸步难行。
资深工程师 Mark Seemann 公开拆解了这一现象。人们凭借生成式工具跨越了敲击代码的体力门槛,却也因此绕过了理解软件机理的渐进阶梯,最终造出了一套远超自身认知水准的系统外壳。
提速 55% 与减速 19% 的实测反差
在各家工具的宣传叙事里,编程的门槛正在彻底消失。早期 GitHub 针对 95 名专业开发者的测试表明,使用 GitHub Copilot 构建 HTTP 服务时,任务完成速度确实加快了 55%,完成率也从原本的 70% 提升到了 78%。在另一项涵盖 202 名资深 Python 开发者的对比中,Copilot 让代码通过全部测试的概率提升了 53.2%,盲审评定也显示其在可读性上有些许改善。

然而这些测试大多局限在边界分明的从零新建场景。一旦进入真实项目,情况发生了戏剧性反转。
机构 METR 在 2025 年针对 16 名经验丰富的项目维护者进行了一次随机对照实验。受试者在自身熟悉的大型成熟仓库里解决 246 个真实 issue,主要借助 Cursor 以及 Claude 3.5 和 Claude 3.7 Sonnet 协助编码。测算表明,AI 辅助不仅没有提高生产力,反而使这批资深工程师的处理速度降低了 19%。
更值得深思的是一种主客观错觉:尽管实际交付耗时拉长,受试开发者在主观评估中却一致认为工具极大地加快了自己的进度。
隐性知识断层与 9% 的代码清洗税
导致资深工程师在大仓中减速的核心原因,是工程内部大量无法被模型直接读取的隐性约束。METR 的实验记录表明,开发者平均要把 9% 的辅助时间花费在审查、剔除与重写模型生成的冗余代码上。工具虽然能写出语法合规的代码段,却缺乏对整个软件架构边界与上下文约定的整体把握。

在另一项针对 10 个 GitHub 开源项目的 127 个可维护性问题评测中,Copilot Chat 成功修复了大约 32% 的目标问题,但生成的补丁中常常引入了原本不存在的新逻辑缺陷。而在针对 151 名受试者的 Java 软件演化实验里,虽然初次功能实现耗时被压缩,但后续由其他开发者接手时的演化成本和代码质量,与完全手工编写的一组相比并没有拉开统计学差距。
METR 在 2026 年 2 月 24 日针对重复受试者发布了追踪修正,表面上的点估计从变慢 19% 浮动为变快 18%。但该研究同时严谨指出,受制于样本筛选偏差、并发代理工具的干扰以及计时方式的波动,其最终的置信区间仍然包含了零效应。
认知阶梯断裂下的所有权危机
传统软件工程存在一条清晰的经验规则:工程师想要安全排障,至少需要理解当前所处层级的下一层机理,并明晰其上一层的业务意图。写网页脚本的人或许不需要亲自设计编译器,但他必须清楚底层的执行循环与网络请求的生命周期。

产出字符的动作被大模型无限压缩,人类大脑消化复杂逻辑的生理速度却从未改变。
大模型打破了这套渐进式的理解阶梯。它直接给出一个高精密度的既成结果,把原本逼迫开发者阅读文档、梳理依赖、调试崩溃的试错过程完全遮蔽。对初学者而言,系统在正常运转时显得天衣无缝,但一旦环境产生细微变化,由于缺少关于内存模型、连接池、并发锁以及网络协议的基础认知,排障动作就会瞬间退化为无意义的提示词抽奖。
- 风险.依靠模型快速拼凑功能会带来工程所有权的假象,随之积累的隐性技术赤字将在首个生产级故障发生时集中清算。
工业革命时期珍妮纺纱机替代的是纺织工人的机械动作,但失去生计的工人未能在次日变成机械工程师。当下的代码生成工具正在替人类承担编写样板代码的繁琐任务,但这绝不意味着系统理解与掌控力可以一并外包。
真正的工程胜任力从来不在于你能让终端吐出多少行绿色的代码,而在于系统在深夜发生致命宕机时,你是否敢不依赖任何模型,独自接管整座大厦。
