休假三周不碰AI,回来打开电脑,美国博主Brent Fitzgerald看到的是11个cmux标签页,每个里面都卡着没跑完的Claude agent——有的在写代码,有的在整理报税资料,有的在琢磨院子里的景观设计。他在博客《The Human Is the Loop》里写下这一幕,得出一个判断:自己过去这段时间的AI使用,与其说是效率工具,不如说是一种让人更焦虑、更不自信的习惯性依赖。

这篇文章本质是一篇个人反思,靠的是直觉和内省。但把它放进2025年的两份实证研究里看,会发现Fitzgerald的困惑不是孤例,而是整个行业叙事里一个被长期忽略的漏洞。

你以为AI让你快了,数据说慢了19%

AI安全研究机构METR在2025年做过一项随机对照实验:找16名对开源代码库很熟悉的资深开发者,把246个真实issue随机分成"允许用AI"和"禁止用AI"两组,主力工具是Cursor Pro配Claude 3.5/3.7 Sonnet。

结果是,允许用AI的一组,完成任务反而慢了19%。更值得琢磨的是感知落差:开发者动手之前,普遍预期AI能让自己快24%;做完之后回头看,他们仍然主观认为AI让自己快了20%左右。真实效果和主观感受之间,差了将近39个百分点。

主观越自信,实测越拖后腿——这才是AI效率叙事最尴尬的地方。

这组数字解释了Fitzgerald那种说不清的挫败感从哪来。他不是特例,他撞上的是一个系统性的自我高估偏差:工具用得越顺手,人越容易高估它的实际贡献。

METR实测:感知与真实的39个百分点落差 +24% 动手前预期提速 -19% 实测真实效果 +20% 事后仍自认为提速 样本:16名资深开发者 · 246个真实issue · 随机对照

从"人批准agent"到"人协调agent",标题里的那个循环

Fitzgerald标题里那句"the human is the loop",指的是一个正在快速发生的角色转变。过去一年,coding agent工具的默认模式是"human-in-the-loop":人逐条审批AI的每一个动作。

cmux这类工具把这个模式往前推了一步:一个人同时监督多个各自独立会话、各自跑在独立Git worktree里的Claude agent,靠面板、状态指示和通知来协调进度。人不再逐条审批,而是变成整个多agent系统的调度中枢

厂商的叙事很清楚:这能把人解放出来去做更高阶的判断,把琐碎执行外包给agent。但Fitzgerald的实际体验是反过来的——11个标签页,每个都是一件没做完的事,每个都在提醒他"你本该更高效"。

  • 风险.并行agent越多,未完成任务和内疚感越多,而不是时间越多。

这不是工具坏,而是"解放判断力"和"制造待办清单"之间,中间少了一道刹车。Fitzgerald自己也承认,他曾经把agent当成情绪上的护身符——不敢直接面对某项任务,就先塞一个agent进去,ChatGPT语音对话本质上成了"讨好式镜子",产出的东西大多没被真正用过。


谁在鼓励你多用,以及一个未被证实的关联

Fitzgerald在文章里点出了一句很扎人的话:大量AI基础设施公司的估值,只有在用户对LLM形成集体性、社会经济层面的依赖时才成立。换句话说,过度使用未必是用户意志力薄弱,而是被产品设计和商业激励主动引导的结果。

同一时期,OpenAIMIT Media Lab联合做了一项为期四周、约1000人规模的纵向随机对照研究,专门考察聊天机器人使用行为和孤独感、情感依赖、心理社会健康之间的关系。这项研究给了Fitzgerald那句"可能有点抑郁"的自我猜测一个公共议题级别的坐标——但要说清楚,这项研究关注的是单轮聊天类交互,Fitzgerald遇到的是多agent任务编排,两种交互形态的心理机制未必完全相通,现在只能说是呼应,不能直接等同。

  • 结论.过度使用更像是设计与激励共同制造的结果,不完全是个人自律问题。

一个笨办法,能不能推广

文章结尾,Fitzgerald给出了自己的应对方式:每次用AI前先窄范围约束任务、给足上下文、明确说清要什么样的输出,不指望AI给出完美答案,只让它帮自己扫清一部分认知盲区。这个做法本身没有技术含量,更像是给自己重新设了一道审批闸门。

对重度依赖agent编排工具的开发者和知识工作者来说,眼下能验证的信号还不多。METR的实验只覆盖了资深开发者在熟悉代码库里的场景,新手、非编程任务、绿地项目会不会是另一个结果,目前没有对应的独立研究。OpenAI-MIT那份研究能不能延伸到多agent编排场景的心理健康影响,也还是空白。

真正该盯的不是"AI好不好用",而是这两块空白什么时候被填上——填上之前,"agent必然提效"这句话,更像是一句还没兑现的承诺。