大家总习惯把大模型太烧钱归咎于参数太大、推理太贵,但真实的工程账单往往死在另一个隐蔽角落。英伟达研究团队在2026年9月17日预印于arXiv(2609.20519)的论文中推出了一套名为SoL-Pi的系统:他们不动底层大模型分毫,仅仅依靠AI分析执行轨迹去重构Coding Agent的控制外壳(Harness),就将运行GPT-5.6 Sol时的成本从Codex基线的1,787美元压低50.0%至894美元,并在运行Opus 5时比Claude Code节省了54.3%的成本。这看似是一场四两拨千斤的工程胜利,却也暴露了代码智能体在省钱与解题之间的深层妥协。

SoL-Pi 外壳优化:API 成本与 Token 降幅对照 Codex 对比 (Sol) -50.0% 成本由 $1,787 降至 $894 基于 EdgeBench 51 项公开任务 Claude Code (Opus 5) -54.3% 成本由 $2,535 降至 $1,158 未微调跨模型直接迁移 Pi 基线 Token 压缩 -49.0% 1.099B vs 2.154B Token 平均得分仅保留原基线 93.7%

谁在偷偷吃掉你的 Token

业内习惯把降本赌注压在更快的推理引擎或量化小模型上,但只要完整盯过一遍复杂代码库的自动修复,就会发现智能体真正的吞吐死穴在控制外壳。所谓Harness,是模型感知运行状态、执行文件修改和读取终端反馈的交互中介。现实中它往往显得极为笨重:智能体改完一行代码调用一次测试,完整的控制台报错日志就会全量塞回上下文;第二轮测试再跑,上一轮的冗余报错依然原封不动叠在提示词里。

这就是为什么高吞吐的编程任务往往几个循环就能吃掉上百万Token。过去团队解决这类问题,全靠人类工程师手动翻看执行日志,一点点手写截断和合并规则。SoL-Pi的做法是建立自动化闭环,让一个AI扮演研究者,跨越535个可执行环境和495个源自GitHub的实际任务,自动分析交互轨迹并提出修改建议。历经3,000多次运行与60,000多次交互探索后,系统提炼出了四种关键机制。

SoL-Pi 过滤冗余的四项工程机制 Action Fusion 动作合并 连续两步合并处理 改写加测试省去单次 直接抹去大模型调用 Context Compact 在线上下文修剪 规划阶段即时清理 剔除已作废前置推演 降低历史上下文堆叠 ObservationPack 工具输出归档 长日志转存后台存档 后续步骤仅回传摘要 避免全文死记硬背 Evidence Reducer 证据保留蒸馏 分流巨大报错日志 便宜小模型提炼核心 搭配自动校验兜底

这套组合拳逻辑非常干脆:Action Fusion把代码改动与紧随其后的单测命令合并发包,当场减掉一次完整的模型往返;Online Context Compact在每次规划完毕后剔除作废的上下文;ObservationPack将大块工具输出归档为简短摘要;Evidence-Preserving Reducer则把冗长报错路由给廉价小模型去提取关键异常。在全套四项机制同时生效的SoL-Pi Efficiency模式下,Token总消耗从2.154B断崖式下跌到1.099B,降低整整49.0%。


节俭反噬:算力账单省下了,题却解不出了

天下没有免费的工程午餐。如果仔细核对NV Labs放出的实测明细,会发现成本腰斩的同时,智能体的能力也悄然退缩。

节制有时是效率,有时却只是过早放弃推导的借口。

在EdgeBench标准基准下,完整四机制变体的平均得分从Pi基线的44.833滑落至42.003,仅保住了93.7%的能力。如果换到难度更高、依赖复杂系统调用的独立基准Terminal-Bench 4上,裂缝变得更为触目。SoL-Pi的运行总开销确实从Pi原生的286.45美元压到了211.12美元,降低了26.3%,但最终成功解决的任务数却从18道缩水到了15道。

  • 风险.激进的上下文截断虽然甩掉了冗余输出,但也抹去了智能体用于回溯边界错误和反复自检的思考草稿。

在复杂排障场景中,长串测试输出里的冷门警告与上下文碎片,往往是模型在死胡同里掉头所必需的微弱信号。强行压缩日志和精简调用,直接剥夺了智能体在棘手问题上的纠错耐心。为了账面上看似便宜的几十美元,导致原本能修好的Bug彻底失败,在工业落地场景里往往得不偿失。

评估基准与系统版本Token 消耗量API 总开销核心任务表现关键权衡结论
EdgeBench: Pi 原生基线2.154B$1,339得分 44.833未裁剪冗余,性能基准
EdgeBench: SoL-Pi (四机制)1.099B (-49%)$894 (-33.2%)得分 42.003 (留存93.7%)成本大幅下降,轻微掉点
EdgeBench: SoL-Pi (单机制)约 1.19B约 $980得分提升 5.3%牺牲少量节约,反超原分
Terminal-Bench 4: Pi 原生基准规模$286.45解决 18 / 63 题保障极端环境排错尝试
Terminal-Bench 4: SoL-Pi压缩约 25%$211.12 (-26.3%)解决 15 / 63 题省下开销,但解题失败率上升

不仅如此,这套机制在不同基座上的表现也缺乏稳态。SoL-Pi基于GPT-5.6 Sol轨迹搜出来的四机制,直接平移给Opus 5后,触发频率和侵略性明显下滑,整体得分保住94.3%的同时,不得不重新挑选机制组合才能摸到更高分。这清晰说明:所谓通用外壳,依然深受底层模型Prompt感知偏好和推理惯性的隐性束缚。

脱去“自我进化”的公关外衣

英伟达在论文中将这一过程包装为递归自我改进(Recursive Self-Improvement),这种宏大叙事容易让人联想到模型自己在暗中反复改写自我架构、实现能力指数级复利。但剥离掉高调宣传,目前的SoL-Pi远谈不上多代自举的智能跃迁。

本质上,它是在人工预设的离散动作空间内,用AI完成了一次规模较大的离线超参数与工程规则搜索(Auto-Research)。开源社区很快发现,英伟达目前仅在GitHub公开了挂载于Pi之上的四项机制扩展实现,而真正用来探索这152个方向、生成新规则的自动化搜索流水线并未全量开源。点石成金的铲子留在了自家实验室,拿出来的只是一袋已经筛好的矿渣。

  • 结论.对于每天并发运行长程任务的高吞吐团队,SoL-Pi每小时省下的8.75至13.50美元是实在的真金白银;但切不可将其当成无损降本的万灵丹。

《韩非子》有云:“释规而任巧,释法而任智,虽工不能成器。”把智能体工程的降本希望全部寄托在底层芯片降价和模型蒸馏上,是低估了软件系统的低效;但反过来,为了省下几个Token而把自检逻辑剪裁殆尽,更是本末倒置。外壳治理已经成为Agent工程跨入长程交付的必修课,但如何在账单数字与系统鲁棒性之间划出边界,考验的依然是工程师对真实业务场景的敬畏。