14小时,251美元,2001项隐藏测试通过2000项。

Epoch AI 与 METR 推出的 MirrorCode 基准里,Claude Opus 4.7 在看不到原始源码、不能联网、没有人类中途接手的条件下,近乎复刻了约1.6万行的 Go 工具 gotree。

这个成绩很强,但还不能写成“完整攻克”。那一项失败测试仍然存在。

更重要的变化藏在实验方式里:AI开始被要求独自守着一个软件项目,连续工作十几个小时乃至数天,而不是接过人类切好的一张工单。

MirrorCode考的不是补丁,而是完整程序

MirrorCode 收录了25个目标程序,覆盖 Unix 工具、生物信息、解释器、密码学和压缩等领域。当前披露的模型运行结果覆盖其中15个,并非25个目标都已完成测试。

它的限制很硬:

项目MirrorCode的设置
原始源码不可读取
网络禁止访问
人类介入运行期间不允许
验收方式隐藏的端到端测试
单次时限最长19天
单次成本最高2600美元
gotree结果14小时、251美元、通过2000/2001项测试
人类工期参照无AI条件下估计为2至17周

模型并非一次性吐出全部代码。它可以在沙盒里持续编写、编译、运行和调试自己的实现,再交给隐藏测试验收。

所以,“无人干预”不等于“闭着眼睛一次写完”。更准确的说法是:人类不再替它拆任务、修方向、接管残局,模型自己完成长时间的试错循环。

这和常见的 SWE-bench 有明显区别。SWE-bench 通常给模型一个现成代码库,再要求它修复具体 issue;MirrorCode 直接拿走源码,只保留任务材料、外部行为要求和最终验收。

前者更像进维修车间换零件。后者要求重新造出一台能工作的机器。

也正因为如此,gotree 的结果才有分量。基准给出的人类无AI工期估计是2至17周,而模型用了14小时。不过,这只是基准估算,不是同一批工程师参加的配对实验,更不能直接换算成“节省了多少人力”。

2000项通过,不等于软件已经可以交付

我不太赞成把那一项失败测试包装成“最后1%最难”的证明。

我们不知道它对应什么问题。可能是罕见输入、协议细节,也可能只是一个容易修复的边缘错误。单个失败项无法证明模型卡在软件工程最艰难的部分。

真正的问题更具体。

成本仍然很高。 gotree 这次花了251美元,已经比许多日常编程任务昂贵。基准还允许单次运行19天、花费2600美元。这样的预算适合测能力上限,不适合直接塞进每张普通工单。

结果未必稳定。 一次成功样本不能回答重复运行是否还能得到同样成绩。软件团队采购的不是实验室纪录,而是可预测的交付率。

开源数据污染没有完全排除。 模型虽然不能在实验时读取源码,但目标程序的开源代码可能进入过预训练数据。研究结果显示,表现不像完全由记忆复现主导;这只能降低疑虑,不能彻底排除污染。

隐藏测试只检查行为。 它不自动保证代码易读、易维护,也不保证依赖安全、许可证清晰、架构能够承受下一次需求变更。一个程序今天通过测试,不代表三个月后有人敢接手。

“行百里者半九十。”放到软件工程里,难处常常不在代码能不能跑,而在团队是否敢发布、敢维护、敢为事故负责。MirrorCode已经碰到了这道门槛,但还没有跨过去。

分水岭转向长周期执行

过去两年的AI编程产品,大多在争夺同一件事:谁能更快补全代码、修改文件、解决仓库里的一个问题。

MirrorCode把问题往前推了一步:只要给模型足够的时间、推理预算和工具权限,它能否维持目标,处理连续失败,并最终交付一套完整实现?

我更在意“14小时”而不是“1.6万行”。

行数很容易制造声势。长时间不跑偏、能自己定位错误、在多轮尝试后继续推进,才是智能体进入软件工程核心流程的前提。模型看着更强,不代表产品已经可靠;真正稀缺的是持续执行能力。

这也改变了团队评估AI工具的方式。

相关人群现在可以做的事暂时别做的事
软件工程团队选择规格明确、验收清楚的内部工具试点;预先设定测试、预算上限和人工审查不要把单次基准成绩换算成裁员比例,也别直接交出核心生产系统
技术管理者与AI工具厂商记录成功率、重试次数、总成本和人工接管时间;补做安全、许可证及代码质量检查不要只展示代码行数和最好成绩,隐藏失败运行与审查成本

软件工程师眼前最现实的变化,不是岗位突然消失,而是任务边界会重新划分。规格清楚、外部行为可验证、失败代价较低的程序,会更早交给长周期智能体。工程师则要把更多时间花在定义验收、审查实现和处理模糊需求上。

技术管理者也该调整采购问题。少问“它能写多少代码”,多问四件事:同一任务重复十次能成功几次,失败后烧掉多少钱,需求变更后能否继续维护,出了安全问题由谁发现。

接下来真正能决定这条路线成色的,是25个目标上的重复性、单位成功成本,以及模型接手后续维护的能力。若这些指标不跟上,MirrorCode只是昂贵而漂亮的实验;若它们持续改善,软件团队的组织方式才会真正松动。

开头那2000/2001项测试,证明AI已经能把工程任务推得很远。剩下的问题是,它能否稳定地再做一次,并让人敢把代码上线。