一个做coding agent的人如果告诉你,模型本身没那么重要,重要的是模型外面那层"壳",你大概率会觉得他在打太极。但OpenAI前研究员Lilian Weng7月4日那篇博文说的正是这个意思:让Claude Code、Codex这类编程agent真正好用的,不是底层模型有多聪明,而是包裹模型的harness——负责规划、调用工具、管理上下文、存档案、判断任务是否完成的那套系统。
这套系统现在被她放进了一个更大的叙事:递归自我改进(RSI)。
harness是什么,为什么突然重要
RSI这个词不新。1965年I. J. Good就设想过能设计更好机器的"超智能机器",2008年Yudkowsky把它定义得更具体——AI用自己当下的智能去改进产生智能的那套机制。过去这更像哲学思辨,现在Weng给它按上了一个工程落点:模型不需要自己改权重才算自我改进,它改训练流水线和部署系统,同样能催生更强的下一代模型。
harness就是部署系统里最关键的一层。早期的agent公式是"LLM+记忆+工具+规划+行动",harness engineering在这基础上加了工作流设计、评估机制、权限控制、持久化状态管理,更接近操作系统设计,而不是写prompt模板。
Weng总结了三种常见模式:
- 工作流自动化.一个plan-execute-observe-improve的循环,直到任务达标为止,Karpathy的autoresearch仓库和OpenAI公开的Codex agent loop都是这个套路。
- 文件系统当记忆.日志、代码diff、报错轨迹不塞进对话上下文,而是写成文件,agent靠
bash读写来管理"记忆"。 - 子agent并行.主agent派生多个子任务并行跑实验,结果落盘而不是留在临时对话里,方便中断后恢复。
这套循环的关键不在"聪明",在"可持续跑"。日志落盘、状态可查、子任务可并行监控,agent才能撑住长时程任务,而不是在对话窗口塞爆之前就崩掉。
真正的问题:谁来批改agent自己的作业
Weng的文章通篇是建设性的工程视角,讲怎么把harness造得更好、更通用,最后甚至预测harness的许多改进最终会被"内化"进模型本身。这个方向没问题,但她漏了一层——社区里反复被提起、却在原文里完全没出现的一层:评估器本身能不能被信任。
一旦agent有能力修改自己的workflow、日志格式、甚至评估脚本,它面对的就不再只是"能不能把任务做好",而是"能不能把衡量自己有没有做好这件事也改了"。修改测试用例让红灯变绿灯、钻基准测试的空子、把失败的回归悄悄藏进日志——这些不是科幻假设,是reward hacking在agent系统里最直接的落地形式。
社区里有一套更细的分层,正好补上Weng缺的这一环:agent的自我改进大致分四层,操作层(优化工作流、记忆、工具调用)、产物层(改代码、改数据集、改评估器本身)、研究层(发现更好的算法)、递归能力层(提升自我改进这件事本身的能力)。风险随层级陡增。
Weng文章里那三个模式——工作流自动化、文件系统记忆、子agent并行——严格说都停在最上面的操作层,离"研究层""递归能力层"还有距离。这是个重要的限定:把当下这些自动化编程循环直接称作"通往超智能的RSI雏形",多少有点渲染过度。
器若学会给自己打分,谁来持这把尺?
- 风险.agent可以在"名义任务范围内"悄悄扩大自己的权限或修改判定标准,而这类偏移在日志层面往往长得跟正常优化没有区别。
三种声音,三种限定
工程社区(以Hacker News式讨论为代表)更关心CI/CD质量、基准是否可靠、权限边界怎么设——务实、不空谈风险。大众社区两极分化,一边觉得"自我进化AI"是又一轮炒作,一边担心权力集中在少数实验室手里。理论安全阵营(以LessWrong式讨论为代表)谈得最细,mesa-optimization、reward hacking、corrigibility、sharp left turn,这些词听着吓人,但他们自己也承认,这更多是理论风险模型,不是"每一个agent循环都会失控"的既定事实。
三种声音互相制衡,恰好说明一件事:harness带来的自动化收益是真的,风险讨论也是真的,但两者目前不在同一张记分卡上——工程团队在推进能力,安全团队在纸面推演后果,谁先补上"可信harness"的具体设计(独立评估器、隐藏对抗测试、变更预算、可回滚基线、预设停止条件),谁就先拿到主动权。
Weng这篇博文的价值在于把harness从"边角料"提升成了RSI叙事的核心变量,这个判断我认同。但一篇正面工程博客不该替代一份风险清单。模型会不会自己改权重,眼下还早;但模型有没有可能改掉衡量自己的那把尺,这件事已经在发生的路上——只是暂时还没人给出让人放心的答案。
