过去一年,用AI写代码这件事,从“能不能做到”变成了日常操作。一篇2026年8月的软件工程博客把这个变化讲得很直白:agent harness(智能体工具链)配合大模型,已经能自己写测试、跑通代码、交付“看起来能用”的软件。作者随手举了个例子——他年轻时学电焊,很快就能焊出东西,但常常重到搬不出车间。

代码也是这个逻辑:能跑通写得好,中间隔着一层东西。作者把这层东西归咎于一句话——LLM不会推理,只会预测。他的论据是苹果那篇很有名的论文《The Illusion of Thinking》。这句话被引用得太顺手了,值得摊开看看它到底站不站得住。

能做到什么,不能做到什么

agent配合“红绿TDD”这类提示词,确实能稳定产出两样东西:代码跑得通,测试也能过。但再往上一层——接口怎么设计、模块怎么分层、出问题时好不好排查、半年后接手的人看不看得懂——这些“缝隙”工作,目前还是人类经验的地盘。

能做到 vs 做得好 Agent 能做到 代码能跑通 测试能通过 严格遵循指令 ——预测式产出 人类仍要做 接口设计 可维护性 可调试性 取舍判断 ——经验式判断

那篇“AI不会推理”的论文,本身也在被吵

苹果这篇论文测试了o3-mini、Claude 3.7 Sonnet Thinking、DeepSeek-R1等一批推理模型,发现规律很干脆:题目简单时,普通模型不比“推理模型”差;题目一旦复杂到某个阈值,不管是不是专门做推理训练的模型,全部崩溃,甚至越“努力思考”结果越差。这个结论被行业当成了“LLM没有真推理、只是压缩知识的回声”的实锤,前述博客也是这么用的。

但学界的反驳没那么客气。有研究指出,部分“崩溃”其实是测评设计的锅:模型被要求把所有中间步骤逐字打印出来,直接撞上输出长度上限;还有一部分谜题,像“河流过河”问题,某些参数设置下数学上根本无解,模型答不出来不是不会推理,是题目出错了。更打脸的是,给这些“证明推理失败”的实例配上工具,让模型可以调用外部验证而不是硬憋答案,原本判定为“不可能”的案例反而被解开了。

一篇论文,两种读法 论文原意 高复杂度任务全部崩溃 推理越努力,表现越差 结论:LLM不会真推理 学界反驳 输出被长度上限截断 部分题目数学上无解 配工具后能解开 结论:评测有缺陷

这不是说LLM就真的会推理了,而是说这道判断题目前还没判完。用一篇仍在被质疑的论文去论证“工程师不可替代”,论据本身是脆的。


原文没提的两条变量

一条是技术路线。Yann LeCun推的JEPA/世界模型,思路是让模型预测“世界的下一个状态”,而不是预测“下一个词”——理论上更接近原文说的“预知行动后果”。Meta的V-JEPA 2已经能做视频理解和机器人的零样本操作规划,但目前证据集中在视觉和具身智能领域,还没有看到它在代码这种符号任务上的落地。这条路线值得看,但还谈不上是agentic coding的替代方案。

另一条是经济账。原文说开放权重模型正在追上闭源模型,个人电脑的“delta”在快速缩小。这话对了一半:本地跑模型确实不用付API账单,但成本没有消失,只是从账单转移到了显卡、电费和运维上。本地推理划不划算,取决于任务的并发量、延迟要求和硬件利用率——这是一道工程账,不是“开源=免费”那么简单。

  • 风险.一个不会推理、却严格服从指令的系统,遇到提示注入(prompt injection)时无法分辨好建议和坏建议。Simon Willison提的“致命三件套”——能读外部数据、能调用工具、能对外通信同时具备时,风险最大。目前的对齐训练和沙箱只能加护栏,补不了这个结构性缺口。

护城河搬家了,不是消失了

模型越来越像商品,工具链和判断力才是真护城河。

把这几条线合在一起看,“工程基本功更重要”这句话大概率还是对的,但理由要修一修:不是因为LLM“天生不会思考”这么斩钉截铁,而是因为——评测本身有争议、替代技术路线还在路上、开源模型的便宜是有条件的便宜。三件事叠在一起,才共同指向同一个结论:能决定软件长期能不能用的,还是接口设计、确定性验证工具链、还有那点“知道该在哪里让它硬、在哪里留它软”的经验。子曰“工欲善其事,必先利其器”,可器再利,握器的手艺没跟上,照样搬不出车间的门。