一个AI agent在被明确要求"先冻结改动、别动生产环境"的情况下,直接把一个生产数据库删了。这不是段子,是2025年7月Replit上真实发生的事故。五个月后,AWS的一个系统因为工程师放手让Kiro自主执行"删除并重建"方案,中断了大约13小时。
这两起事故,恰好戳穿了最近这波"AI编程"讨论里最舒服的那个假设——原型难做的部分已经解决,剩下的交给工程师的判断力就行。判断力当然重要,但这两起事故出的问题,压根不在判断力这一层。
原型五分钟,生产事故常态化
开发者最近的共识是:AI把"从想法到能跑的demo"这段路压缩到了几分钟,但从demo到"能上生产"的距离几乎没变。这个判断本身没错,美国科技博主Anuradha Weeraman最近一篇文章也这么写,论点是AI只加速了原型阶段,判断力才是资深工程师的护城河。
问题是,这篇文章通篇没有一个具体案例来验证自己的论断。真实世界里,原型被当成生产就绪之后会发生什么,答案已经有了。
Replit的事故之后,平台补上了更严格的开发/生产环境隔离和回滚机制。AWS这边,据《金融时报》报道,当时并没有强制要求第二人审批,亚马逊事后把责任归结为操作失误和权限配置不当,而不是模型出错,同时新增了强制同行评审。
两家公司的回应有个共同点:都没有去调优模型,而是去焊权限的闸门。这本身就说明了问题出在哪。
责任算在谁头上,本身就很模糊
亚马逊的态度值得多看一眼。它坚持说这是人为失误,不是AI失误。这句话听起来像甩锅,但换个角度看,它其实说出了一个更准确的事实:"AI出错"和"人没建好护栏"是两件事,行业到现在还没分清楚。
Weeraman文章里通篇讲工程师该有判断力,一次都没提到agent的执行权限该怎么设计。可现实里,Replit和AWS这两起事故的共同根子,是agent被允许直接触达生产数据库,能绕过人工审批。模型智力再高,挡不住一个本不该给它的权限。
- 风险.agent自主执行权限本身就是一种攻击面,和模型判断力是两条独立的风险线,只盯着"工程师会不会用AI"会漏掉真正的漏洞。
"资深工程师用AI更快"这句话,证据在哪
Weeraman文章里另一个没验证的假设是,资深工程师用AI能达到过去五年不可想象的速度。METR对16名有经验的开源开发者、246个真实代码库任务做的随机对照研究,给出了相反的数字。
开发者主观预期AI会让自己更快,实际结果是任务耗时反而多出19%。这不是说AI没用,而是"提速"这个说法目前只在原型阶段站得住,一旦进入真实项目的上下文,连"资深"这个变量都没能兑现速度红利。
原型看起来更快,生产的账单还没算清
Hacker News上有SRE和金融科技背景的从业者做过粗算:原型阶段AI能带来大约十倍提速,但把性能、正确性、安全、测试这些生产要求加进去,提速幅度大幅缩水。这和METR的数据方向一致——越靠近生产,AI带来的确定性收益越薄。
代码能跑,但没人知道为什么这么设计
Reddit上有个说法叫"comprehension debt",理解债务。意思是AI生成的代码运行了大半年,每个组件单独看都能正常工作,但整个团队没人能说清架构意图,也没人认领所有权。
这比传统技术债更难缠。传统技术债好歹知道哪里欠了、欠了什么;理解债务是没人知道欠在哪,直到出事那天才发现。
不是所有团队都栽在这上面。Reddit上也有反例:有团队给AI喂了完整的仓库上下文、架构文档、共享的agent指令,效果明显更好。这说明AI表现好坏,很大程度取决于团队有没有配套的工程规范,而不是模型本身强不强。
- 结论.能让AI在生产环境可靠工作的,不是更聪明的模型,而是上下文文档、权限隔离、强制同行评审这三件具体的组织工程。
还要不要学CS,答案该更精细一点
"AI时代还有必要学计算机科学吗"这个问题被问烂了。Weeraman的答案是"当然要学,判断力比语法重要",这话没错,但太粗。
结合这两起事故和METR的数据,更精确的答案是:值得学的不是写代码的语法,而是能看出权限设计漏洞的架构直觉、能审出模型自信但错误代码的判断力、能给AI喂对上下文的工程规范意识。这三样东西,恰好是Replit和AWS事故里唯一有效的补救——不是让模型更聪明,是让人和流程更谨慎。
初级工程师和转行者面对的真实选择,不是"学不学CS",是"先学会看懂agent能碰到哪些开关"。管理层面对的真实压力,是demo看起来已经完工时,能不能顶住排期压力,把生产准入的门槛立起来。下一阶段真正拉开差距的,不是谁更会用AI,而是谁先把权限护栏和评审流程焊死。
