34岁的软件工程师Paolo Galeone在自己的博客上写了一篇纯粹的牢骚:用AI写代码这几年,他从“造东西”的乐趣里彻底抽离,只剩下“提示—看结果—调整”的机械循环。他把这种状态称为正在失去savviness——靠犯错、纠错攒出来的实践判断力。文章发布当天在Hacker News上几乎没人理,只拿到2个赞、1条评论,看起来就是一篇很快会被算法埋掉的个人博客。
但把它和过去一年几份严肃的实证研究摆在一起看,会发现Galeone的“感觉”不是孤例式的情绪发泄,而是刚好踩在了一组已经被测出来的真实数据线上。
一个牢骚,撞上一组反常数据
Galeone引用的savviness定义来自Merriam-Webster:在实务中表现出的洞察与判断力。他的核心抱怨是,AI把“做—犯错—定位—修正—长经验”这条循环给截断了:错误还在,但纠正错误的动作被AI接走了,他只负责“一眼看出哪里错”,然后让模型去改。
这不只是一个人的主观错觉。METR在2025年做过一项随机对照试验,找了16名经验丰富的开源开发者,让他们完成246个真实项目任务,允许使用Cursor Pro搭配Claude 3.5/3.7 Sonnet。结果是:允许用AI的那组,任务完成时间反而多了19%。更有意思的是,这些开发者事前普遍预判AI会带来24%的提速,任务做完之后,他们仍然主观认为自己被AI提速了大约20%——跟实测方向完全相反。
METR后续对同一批仓库又做了一次自主agent评测,让Claude 3.7 Sonnet独立完成18个任务,自动化测试下成功率约38%,但人工抽检没有一份被认为能直接合并——问题集中在测试覆盖不足、文档缺失、代码脆弱难维护。这恰好呼应了Galeone那句“LLM引入没有大脑参与,就是在无限生成技术债”。
AI没让他变笨,但数据说他确实更慢了
“认知卸载”:手感怎么被悄悄拿走
Galeone最刺耳的一句猜想是:LLM提供商可能在用他纠错的过程反哺训练模型,导致他自己的判断力被“偷走”却练不出来。这个说法目前没有实证支持,但另一份研究能解释他为什么会这么怀疑自己。
微软研究院和卡内基梅隆大学2025年的CHI论文调查了319名知识工作者、936个真实AI使用案例,发现一个明确的相关性:对生成式AI的信心越高,人们自评投入的批判性思维就越少。六类认知活动里,自评投入下降幅度从评估类的55%到理解类的79%不等。卡内基梅隆的软件工程研究所另有一项针对研究生级工程师的研究,发现他们做库升级任务时常常过度信任模型,陷入反复让LLM修自己错的循环,始终没有动用基础工程判断。
但这两份研究都有明显边界。微软-CMU的数据是横断面自评,不是纵向追踪,也不是对知识工作者能力的客观测试;作者自己也说没有证明长期去技能化,样本更偏泛义知识工作者而非专职程序员。METR的样本只有16人、246个任务,且是2025年中期的工具版本——后续跟进研究显示更新版本的工具可能已经带来一定提速,只是那批数据本身存在参与者选择偏差,说服力有限。“变慢”有硬证据,“会一直退化”目前还证明不了。
“不用AI就落后”的压力,靠的是叙事还是数据
Galeone在文章里点出一个矛盾:他所在的公司、乃至整个科技行业,都在推“不用AI会被淘汰”,可他很清楚,如果真有人做出一个覆盖速度、技术债、可维护性、成本的综合生产力指标,LLM未必会赢。METR的数据恰好证明了这种怀疑不是矫情——熟悉复杂代码库的资深开发者,在AI辅助下实测更慢,人工审查一份能直接合并的agent代码都挑不出来。
- 风险.越缺乏严谨的生产力度量,“不用AI就落后”的说法就越容易变成纯粹的竞争恐慌,而不是真实证据支撑的决策。
这个结构性张力对初级工程师尤其危险。他们没有Galeone“34年攒出来的经验直觉”可以拿来一眼识别AI的错误,更容易在流畏的输出里产生虚假的能力自信,而这恰恰是SEI那份研究里“反复让LLM修自己错”的循环最容易发生的群体。
Galeone在写这篇牢骚的同时,仍然给自己搭了一台本地推理的Linux机器,那部分他说“真的挺好玩”。这大概是目前能看到的唯一折中路径:把动手搭建、调参、踩坑的部分留给自己,把纯生成的部分交给模型,尽量不让纠错这一步整个消失。
他自己也点破了这篇文章最讽刺的地方——一篇手写的抱怨博客,未来会被某家公司拿去训练模型,然后被别人用来生成同一类“工程师被AI搞烦了”的文章。手感在流失,产出手感流失感受的素材,倒是源源不断。
