AI写代码的竞赛里,各家框架都在争相给大模型穿上越来越厚重的外壳。从繁杂的任务规划树、细粒度的专用文件操作API,到精心设计的多层上下文回溯机制,业界一度形成某种技术惯性:外围框架做得越精密,智能体的工程能力就越强。
2026年9月18日公布在arXiv的学术论文《An Empirical Study of Harness Design for Coding Agents》(arXiv:2609.20804)用176组配对对照实验打破了这种工程迷信。研究团队固定底层的执行循环,针对规划、动作空间与上下文管理三大核心模块进行系统级解耦,横跨SWE-Bench Verified与Terminal-Bench 2.1基准测试。数据给出的结论出人意料:对顶尖模型而言,那些昂贵的专用工具与规划模块不仅没能提高准确率,反而大幅推高了推理账单。
强弱模型的逆向分水岭
在过去一年里,AI软件工程框架在评测榜单上的跑分节节攀升,但外界很难看清这到底是基础模型变聪明了,还是外围工程脚手架在起作用。这份解耦研究最关键的发现,在于外围组件对不同水平模型的效果反转。

在动作空间测试中,当底层模型换成能力较弱的Nemotron-3 30B时,预定义工具的作用立竿见影。面对复杂代码编辑,依靠规则明确的文件查看与检索接口,模型的任务成功率从纯Bash环境下的10.2%跃升至25.2%。对这类模型而言,外围框架提供的结构化API就像学步车。
但在拥有高熟练度终端能力的Nemotron-3 550B上,这一规律彻底倒转。强模型直接使用纯Bash终端时,成功率不仅从预定义工具下的65.8%攀升至69.4%,单任务平均推理成本更是从2.33美元直接腰斩至1.11美元。
独立规划组件同样展现出这种戏剧性的角色分化。对弱模型,持久化规划是解题的必需品,成功率直接从13.6%翻倍至25.2%,代价是成本从0.02美元涨至0.09美元;但在550B强模型上,规划组件没有带来任何精度提升,成功率反而从67.8%微降到65.8%。此时规划唯一的实际价值,是促使模型在无法解决时更早收敛并终止,将单任务Token开销从3.31美元压低至2.33美元。
规划组件在强模型上不再是智商放大器,而是一枚控制Token开销的刹车片。
上下文管理挤掉无用机械
除了工具与规划,上下文管理方案是各家Agent工程团队投入精力最深、但也最容易产生设计冗余的地方。论文横跨4种上下文窗口预算(32k、64k、96k、128k)和5种管理策略的对照测试,厘清了上下文压缩的真实价值边界。

在紧绷的32k窗口中,引入上下文管理将任务成功率大幅拉升了35.7个百分点。但通过轨迹分析可以发现,这种巨额增益并非因为压缩让模型变得更聪明,而仅仅是避免了上下文撑爆导致的强制中断。当模型窗口自然扩大到128k时,管理策略带来的成功率增益骤降至2.7个百分点。
在策略设计上,很多框架热衷于构建具备回溯能力的可检索截断机制,允许智能体在需要时调出历史被删减的代码片段。实测表明这类精巧的机械装置完全沦为摆设,模型在实际运转中极少主动发起回溯调用,最终没有换来任何准确率改善。反而是最简单的组合拳综合性价比最高:先由硬性规则过滤大段冗余输出,必要时再由模型执行一次短摘要。
实验室评测与工程落地的间隙
这些消融实验虽然指出了过度设计的误区,但要直接把结论照搬到生产环境,仍需审视其测试边界。

| 评估维度 | 论文实验设定 | 真实工业级生产环境 | 落地权衡考量 |
|---|---|---|---|
| 动作空间控制 | 纯Bash vs 预定义工具(伴随Prompt调整与自动诊断) | 权限受限的容器、自研CLI工具链与审批流 | 存在混杂变量,纯Bash并不等同于零安全防护 |
| 测试样本轮次 | 每任务单次运行(Terminal-Bench 89题) | 至少3-5次重复采样以抹平推理随机性 | 单次运行下部分题目未达严格统计显著 |
| 账面开销核算 | 本地模型按官方Token公开标价换算 | 涵盖云端API计费、沙箱容器与网络调用 | 账面Token成本减半不完全等于总部署TCO降低 |
在动作空间对比中,研究并未实现纯粹的单一变量剔除。预定义工具组在切换接口的同时,还附加了文件状态追踪与自动化编辑校验机制,提示词也经过重新配比。这意味着强模型在纯Bash下的胜出,很大程度上受益于更自由的代码编辑粒度,而非单纯因为工具数量变少。
- 建议.对采用顶尖基座模型的企业团队,可大胆裁剪复杂的预定义文件操作接口,尝试mini-SWE-agent这类基于极简终端的控制架构。
- 风险.纯Bash高度依赖模型本身的系统指令理解力与沙箱隔离环境,盲目在低参数模型或生产未隔离环境普及裸终端,极易引发越权操作与解析崩溃。
对于正在重构AI代码助手的工程团队而言,盲目照搬全套脚手架的时代已经过去。与其在提示词中叠床架屋、设计复杂的上下文撤回机制,不如先厘清所选模型的底层能力边界。为弱模型备好拐杖,给强模型解开缰绳,才是把账单降下来、把交付提上去的务实解法。
