14小时,251美元,2001项隐藏测试通过2000项。
Epoch AI 与 METR 推出的 MirrorCode 基准里,Claude Opus 4.7 在看不到原始源码、不能联网、没有人类中途接手的条件下,近乎复刻了约1.6万行的 Go 工具 gotree。
这个成绩很强,但还不能写成“完整攻克”。那一项失败测试仍然存在。
更重要的变化藏在实验方式里:AI开始被要求独自守着一个软件项目,连续工作十几个小时乃至数天,而不是接过人类切好的一张工单。
MirrorCode考的不是补丁,而是完整程序
MirrorCode 收录了25个目标程序,覆盖 Unix 工具、生物信息、解释器、密码学和压缩等领域。当前披露的模型运行结果覆盖其中15个,并非25个目标都已完成测试。
它的限制很硬:
| 项目 | MirrorCode的设置 |
|---|---|
| 原始源码 | 不可读取 |
| 网络 | 禁止访问 |
| 人类介入 | 运行期间不允许 |
| 验收方式 | 隐藏的端到端测试 |
| 单次时限 | 最长19天 |
| 单次成本 | 最高2600美元 |
| gotree结果 | 14小时、251美元、通过2000/2001项测试 |
| 人类工期参照 | 无AI条件下估计为2至17周 |
模型并非一次性吐出全部代码。它可以在沙盒里持续编写、编译、运行和调试自己的实现,再交给隐藏测试验收。
所以,“无人干预”不等于“闭着眼睛一次写完”。更准确的说法是:人类不再替它拆任务、修方向、接管残局,模型自己完成长时间的试错循环。
这和常见的 SWE-bench 有明显区别。SWE-bench 通常给模型一个现成代码库,再要求它修复具体 issue;MirrorCode 直接拿走源码,只保留任务材料、外部行为要求和最终验收。
前者更像进维修车间换零件。后者要求重新造出一台能工作的机器。
也正因为如此,gotree 的结果才有分量。基准给出的人类无AI工期估计是2至17周,而模型用了14小时。不过,这只是基准估算,不是同一批工程师参加的配对实验,更不能直接换算成“节省了多少人力”。
2000项通过,不等于软件已经可以交付
我不太赞成把那一项失败测试包装成“最后1%最难”的证明。
我们不知道它对应什么问题。可能是罕见输入、协议细节,也可能只是一个容易修复的边缘错误。单个失败项无法证明模型卡在软件工程最艰难的部分。
真正的问题更具体。
成本仍然很高。 gotree 这次花了251美元,已经比许多日常编程任务昂贵。基准还允许单次运行19天、花费2600美元。这样的预算适合测能力上限,不适合直接塞进每张普通工单。
结果未必稳定。 一次成功样本不能回答重复运行是否还能得到同样成绩。软件团队采购的不是实验室纪录,而是可预测的交付率。
开源数据污染没有完全排除。 模型虽然不能在实验时读取源码,但目标程序的开源代码可能进入过预训练数据。研究结果显示,表现不像完全由记忆复现主导;这只能降低疑虑,不能彻底排除污染。
隐藏测试只检查行为。 它不自动保证代码易读、易维护,也不保证依赖安全、许可证清晰、架构能够承受下一次需求变更。一个程序今天通过测试,不代表三个月后有人敢接手。
“行百里者半九十。”放到软件工程里,难处常常不在代码能不能跑,而在团队是否敢发布、敢维护、敢为事故负责。MirrorCode已经碰到了这道门槛,但还没有跨过去。
分水岭转向长周期执行
过去两年的AI编程产品,大多在争夺同一件事:谁能更快补全代码、修改文件、解决仓库里的一个问题。
MirrorCode把问题往前推了一步:只要给模型足够的时间、推理预算和工具权限,它能否维持目标,处理连续失败,并最终交付一套完整实现?
我更在意“14小时”而不是“1.6万行”。
行数很容易制造声势。长时间不跑偏、能自己定位错误、在多轮尝试后继续推进,才是智能体进入软件工程核心流程的前提。模型看着更强,不代表产品已经可靠;真正稀缺的是持续执行能力。
这也改变了团队评估AI工具的方式。
| 相关人群 | 现在可以做的事 | 暂时别做的事 |
|---|---|---|
| 软件工程团队 | 选择规格明确、验收清楚的内部工具试点;预先设定测试、预算上限和人工审查 | 不要把单次基准成绩换算成裁员比例,也别直接交出核心生产系统 |
| 技术管理者与AI工具厂商 | 记录成功率、重试次数、总成本和人工接管时间;补做安全、许可证及代码质量检查 | 不要只展示代码行数和最好成绩,隐藏失败运行与审查成本 |
软件工程师眼前最现实的变化,不是岗位突然消失,而是任务边界会重新划分。规格清楚、外部行为可验证、失败代价较低的程序,会更早交给长周期智能体。工程师则要把更多时间花在定义验收、审查实现和处理模糊需求上。
技术管理者也该调整采购问题。少问“它能写多少代码”,多问四件事:同一任务重复十次能成功几次,失败后烧掉多少钱,需求变更后能否继续维护,出了安全问题由谁发现。
接下来真正能决定这条路线成色的,是25个目标上的重复性、单位成功成本,以及模型接手后续维护的能力。若这些指标不跟上,MirrorCode只是昂贵而漂亮的实验;若它们持续改善,软件团队的组织方式才会真正松动。
开头那2000/2001项测试,证明AI已经能把工程任务推得很远。剩下的问题是,它能否稳定地再做一次,并让人敢把代码上线。
