大模型 API 沦为无状态的同质化大宗商品后,整个软件行业都在急于给自己找一个新的壳。科技博主提出过一个足够激进的论断:未来的 SaaS 公司本质上都会沦为一个包裹模型的工程调度层,即 Harness。
在这个推演里,软件公司的演进只有四步:最初是工程师自己手写逻辑,随后是个人把智能体当副驾驶,再到后台自主运行数十个云端智能体,最后彻底反转,变成 Harness 调度个人。到了这步,人类不再是系统的设计架构师,而是散落在各个调用回路里的节点,随时等待被调度算法唤醒,被动提供所谓的品味与判断力。
这套推演描绘了一个近乎完美的自动化闭环,但它把最关键的工程账本与人类心理摩擦悄悄藏了起来。
调度外壳的工程账本,差出近十四倍的成本裂隙
很多推崇架构编排的人喜欢把 Harness 抽象成组织哲学,仿佛只要把 LangGraph 或自主多智能体框架搭好,企业壁垒就自然长出来了。现实当头泼来的往往是一张极其具体的 Token 账单。

在控制变量使用相同托管 DeepSeek 模型的 30 项编程智能体测试中,Claude Code 与 Codex 的成功率一模一样,都是 53.3%。但在相同的解题能力下,Codex 的单任务消耗只有 1.29 美元,比 Claude Code 的 3.12 美元 便宜了整整 59%。如果换成开源轻量框架 OpenCode,单任务成本虽然能压低到 1.03 美元,单次成功成本低至 0.073 美元,代价是成功率直接掉落 6.6 个百分点,跌到 46.7%。
到了复合商用配置里,这种架构层面的工程损耗更被拉扯成了天堑。Artificial Analysis 的测试显示,Claude Code 搭配 Sonnet 5.5 拿下了 68 分的智能体指数,但单任务成本飙到了惊人的 14.19 美元;而 Codex 搭配 GPT-6.1 Sol 拿到 63 分,单任务花费却只有 1.04 美元。
| 测试配置组合 | 评测表现 / 成功率 | 单任务基准成本 | 相对成本特征 |
|---|---|---|---|
| Codex + 托管 DeepSeek | 53.3% 成功率 (16/30) | 1.29 美元 | 成本较同类方案低 59% |
| Claude Code + 托管 DeepSeek | 53.3% 成功率 (16/30) | 3.12 美元 | 同成功率下上下文开销偏高 |
| OpenCode + 托管 DeepSeek | 46.7% 成功率 (14/30) | 1.03 美元 | 成本极低但任务成功率出现衰减 |
| Codex + GPT-6.1 Sol | 63 分 (智能体指数) | 1.04 美元 | 高分表现下兼具极高性价比 |
| Claude Code + Sonnet 5.5 | 68 分 (智能体指数) | 14.19 美元 | 绝对能力居前但单任务成本相差近 14 倍 |
学术界在追踪多智能体长程会话时早就发现,这类系统的大部分开销都在为重复滚动的上下文 Token 付费。堆砌高昂的 Token 绝不代表高正确率。当一个公司宣称自己是一个调度系统时,决定它能否活下去的第一个指标,其实是每个已验证并被合并的真实变更成本。
- 结论.模型本身只是发动机,如果外围 Harness 的上下文检索与重试策略没有做极其严苛的工程节制,企业会在尝到自动化红利之前,先被云端账单榨干。
体感加速两成,实测反而倒退一成九
退一步讲,即便企业财大气粗不在乎调用开销,让智能体在后台自主奔跑、人类只负责抽样验收的假定,也撞上了严苛的实证墙。

METR 在 2025 年 7 月 10 日公布过一项极具讽刺意味的随机对照试验。研究人员挑选了 16 位资深开源软件开发者,在他们自己极其熟悉的代码仓库里处理 246 个真实开发任务。在允许使用 Cursor 搭配 Claude 3.5 与 Claude 3.7 Sonnet 的情况下,这些熟手开发者完成任务的实际用时不但没有减少,反而增加了 19%。
但在事后访谈中,这些开发者却根据直觉普遍认为,AI 让自己的工作效率提升了 20%。
这种体感加速与客观变慢的分裂,到了 2026 年 5 月 11 日 METR 针对 349 名技术人员的更大规模调研中依然存在。受访者自评的工作价值收益中位数高达 1.4 到 2 倍,可是一旦进行严密测量,这些自评就会因为主观选择偏差而迅速失真。
敲键盘变快了,把事情做对却变慢了。
人在顺畅生成代码时会获得多巴胺,但核验一段看起来头头是道、实则暗藏瑕疵的代码,所需要的专注度与认知负荷,往往数倍于从零手写。当 Harness 把任务自动拆解并大量抛出产物时,人类实际上从创作者变成了全职侦错员。
抽样审查不是安全防线,警报疲劳才是常态
构想者常常给这套自动化体系开出一剂解药:抽样审查。他们认为不必全盘复核,只要把最关键的品味节点留给人,让资深员工像抽检流水线一样看一眼关键设计,系统就不会沦为生产平庸低质代码的垃圾工厂。

但这低估了安全与人性的复杂性。Anthropic 在官方安全指引里直言不讳:人类审查绝不等于安全遏制。
当系统在后台高速运转,频繁弹出授权许可或差分比对时,人类不可避免会陷入警报疲劳。面对成百上千次确认,绝大多数人的最终反应不是仔细研读,而是麻木地点下放行。更危险的是,底层智能体执行的环境可能面临非技术人员根本看不懂的复杂命令,甚至遭受提示注入攻击。
把未加严格沙箱隔离的自主系统交给疲惫的人类去抽检,就像给失控的卡车装上一个塑料手刹。以为留一个人在回路里就万事大吉,只是把系统性失误的责任推卸给了坐在屏幕前打哈欠的员工。
- 风险.若无严格的环境边界和确定性沙箱限制,抽样审查不仅防不住提示词越狱,还会因为审查者的机械确认,彻底沦为向客户输送合规漏洞的遮羞布。
软件工程演进了几十年,康威定律始终盘旋在上空。如果一家公司的组织架构真的完全翻转,变成由算法系统来调度人的注意力,那么这家公司的产品最终反映的也是冷冰冰的拼凑痕迹。传统按人头卖席位的计费方式注定撑不住,未来软件的定价权,只会落在谁能以最低的真实成本交付一个经过严格验证的最终结果上。
