大家总习惯把大模型太烧钱归咎于参数太大、推理太贵,但真实的工程账单往往死在另一个隐蔽角落。英伟达研究团队在2026年9月17日预印于arXiv(2609.20519)的论文中推出了一套名为SoL-Pi的系统:他们不动底层大模型分毫,仅仅依靠AI分析执行轨迹去重构Coding Agent的控制外壳(Harness),就将运行GPT-5.6 Sol时的成本从Codex基线的1,787美元压低50.0%至894美元,并在运行Opus 5时比Claude Code节省了54.3%的成本。这看似是一场四两拨千斤的工程胜利,却也暴露了代码智能体在省钱与解题之间的深层妥协。
谁在偷偷吃掉你的 Token
业内习惯把降本赌注压在更快的推理引擎或量化小模型上,但只要完整盯过一遍复杂代码库的自动修复,就会发现智能体真正的吞吐死穴在控制外壳。所谓Harness,是模型感知运行状态、执行文件修改和读取终端反馈的交互中介。现实中它往往显得极为笨重:智能体改完一行代码调用一次测试,完整的控制台报错日志就会全量塞回上下文;第二轮测试再跑,上一轮的冗余报错依然原封不动叠在提示词里。
这就是为什么高吞吐的编程任务往往几个循环就能吃掉上百万Token。过去团队解决这类问题,全靠人类工程师手动翻看执行日志,一点点手写截断和合并规则。SoL-Pi的做法是建立自动化闭环,让一个AI扮演研究者,跨越535个可执行环境和495个源自GitHub的实际任务,自动分析交互轨迹并提出修改建议。历经3,000多次运行与60,000多次交互探索后,系统提炼出了四种关键机制。
这套组合拳逻辑非常干脆:Action Fusion把代码改动与紧随其后的单测命令合并发包,当场减掉一次完整的模型往返;Online Context Compact在每次规划完毕后剔除作废的上下文;ObservationPack将大块工具输出归档为简短摘要;Evidence-Preserving Reducer则把冗长报错路由给廉价小模型去提取关键异常。在全套四项机制同时生效的SoL-Pi Efficiency模式下,Token总消耗从2.154B断崖式下跌到1.099B,降低整整49.0%。
节俭反噬:算力账单省下了,题却解不出了
天下没有免费的工程午餐。如果仔细核对NV Labs放出的实测明细,会发现成本腰斩的同时,智能体的能力也悄然退缩。
节制有时是效率,有时却只是过早放弃推导的借口。
在EdgeBench标准基准下,完整四机制变体的平均得分从Pi基线的44.833滑落至42.003,仅保住了93.7%的能力。如果换到难度更高、依赖复杂系统调用的独立基准Terminal-Bench 4上,裂缝变得更为触目。SoL-Pi的运行总开销确实从Pi原生的286.45美元压到了211.12美元,降低了26.3%,但最终成功解决的任务数却从18道缩水到了15道。
- 风险.激进的上下文截断虽然甩掉了冗余输出,但也抹去了智能体用于回溯边界错误和反复自检的思考草稿。
在复杂排障场景中,长串测试输出里的冷门警告与上下文碎片,往往是模型在死胡同里掉头所必需的微弱信号。强行压缩日志和精简调用,直接剥夺了智能体在棘手问题上的纠错耐心。为了账面上看似便宜的几十美元,导致原本能修好的Bug彻底失败,在工业落地场景里往往得不偿失。
| 评估基准与系统版本 | Token 消耗量 | API 总开销 | 核心任务表现 | 关键权衡结论 |
|---|---|---|---|---|
| EdgeBench: Pi 原生基线 | 2.154B | $1,339 | 得分 44.833 | 未裁剪冗余,性能基准 |
| EdgeBench: SoL-Pi (四机制) | 1.099B (-49%) | $894 (-33.2%) | 得分 42.003 (留存93.7%) | 成本大幅下降,轻微掉点 |
| EdgeBench: SoL-Pi (单机制) | 约 1.19B | 约 $980 | 得分提升 5.3% | 牺牲少量节约,反超原分 |
| Terminal-Bench 4: Pi 原生 | 基准规模 | $286.45 | 解决 18 / 63 题 | 保障极端环境排错尝试 |
| Terminal-Bench 4: SoL-Pi | 压缩约 25% | $211.12 (-26.3%) | 解决 15 / 63 题 | 省下开销,但解题失败率上升 |
不仅如此,这套机制在不同基座上的表现也缺乏稳态。SoL-Pi基于GPT-5.6 Sol轨迹搜出来的四机制,直接平移给Opus 5后,触发频率和侵略性明显下滑,整体得分保住94.3%的同时,不得不重新挑选机制组合才能摸到更高分。这清晰说明:所谓通用外壳,依然深受底层模型Prompt感知偏好和推理惯性的隐性束缚。
脱去“自我进化”的公关外衣
英伟达在论文中将这一过程包装为递归自我改进(Recursive Self-Improvement),这种宏大叙事容易让人联想到模型自己在暗中反复改写自我架构、实现能力指数级复利。但剥离掉高调宣传,目前的SoL-Pi远谈不上多代自举的智能跃迁。
本质上,它是在人工预设的离散动作空间内,用AI完成了一次规模较大的离线超参数与工程规则搜索(Auto-Research)。开源社区很快发现,英伟达目前仅在GitHub公开了挂载于Pi之上的四项机制扩展实现,而真正用来探索这152个方向、生成新规则的自动化搜索流水线并未全量开源。点石成金的铲子留在了自家实验室,拿出来的只是一袋已经筛好的矿渣。
- 结论.对于每天并发运行长程任务的高吞吐团队,SoL-Pi每小时省下的8.75至13.50美元是实在的真金白银;但切不可将其当成无损降本的万灵丹。
《韩非子》有云:“释规而任巧,释法而任智,虽工不能成器。”把智能体工程的降本希望全部寄托在底层芯片降价和模型蒸馏上,是低估了软件系统的低效;但反过来,为了省下几个Token而把自检逻辑剪裁殆尽,更是本末倒置。外壳治理已经成为Agent工程跨入长程交付的必修课,但如何在账单数字与系统鲁棒性之间划出边界,考验的依然是工程师对真实业务场景的敬畏。
