当各类编程智能体在公开榜单上刷出七八十分的捷报时,真正趴在企业私有代码库里的工程师大多对此报以冷笑。原因并不复杂:能在 GitHub 公开仓库里修好一个独立 Issue,和在一家运转数年、毫无文档的专有系统里改对一笔账,完全是两码事。

2026年9月,评测机构 Specific Labs 正式发布了基准测试 Real-SWE。这项评测不再使用公开开源项目,而是直接拿到真实公司的商业授权,把前沿大模型扔进完全隔离、未在公网泄露的专有生产代码库中。结果相当惨淡:表现最好的组合 Fable 5.1 配合 Claude Code,单次任务解决率(Pass@1)只有 38.8%。紧随其后的 GPT-6 Astra 搭配 Codex CLI 为 33.8%,Gemini 3.8 Flash 搭配 Gemini CLI 则为 31.2%。除 GLM 5.3 拿下 28.8% 外,其余多款主流模型单次解决率均跌破 25%,GPT-5.6 Sol 甚至只有 16.2%。

Real-SWE 基准单次任务解决率 (Pass@1) Fable 5.1 + Claude Code 38.8% ($6.96/次) GPT-6 Astra + Codex CLI 33.8% ($4.67/次) Gemini 3.8 Flash + Gemini CLI 31.2% ($2.50/次) GLM 5.3 + Claude Code 28.8% ($5.12/次) Grok 4.6 + Grok Build 23.8% ($3.44/次) Muse Spark 1.3 + Muse Code 23.8% ($2.74/次) Kimi K3 + Kimi Code 18.8% ($3.90/次) GPT-5.6 Sol + Codex CLI 16.2% ($2.65/次) 注:指标为每项任务 8 次独立运行均值,已通过 95% 置信区间校验;成本为单次调用估算均值。

模型解决不了真实世界的问题,还真不是时间给得不够。数据显示,运行时间低于 10 分钟的任务失败率为 71.4%,而耗时超过 10 分钟的任务失败率同样高达 73.4%。模型要么很快走入死胡同,要么在漫长的自转中迷失方向。

真实代码库到底难在哪里

过去评测爱用的公开基准,通常由一个相对干净的仓库、几行明确报错和一个单独文件的补丁组成。但真实企业运转依托的业务代码全然不是这副模样。

Real-SWE 采集的代码库来自实打实的商业产品,包括拥有超过 20 万用户且排进 App Store 前百名的消费类应用,以及处理超过 10 万份银行流水账单的金融科技中台。在这些系统里,一次典型的业务修复往往牵一发而动全身:

两种测试维度的复杂度断层 传统合成与公开基准 · 训练数据存在开源 GitHub 污染 · 参考补丁修改文件数中位数为 6 个 · 单一逻辑单元,依赖孤立测试用例 · 榜单通过率被迅速刷至 70% 以上 Real-SWE 企业生产基准 · 专有代码库,零公网训练集重叠 · **参考补丁修改文件数中位数达 11 个** · 牵涉税法、多租户计费与跨服务状态 · 前沿模型平均单次解决率最高仅 38.8%

在 Real-SWE 中,任务指令长度中位数约为 1,742 个字符。智能体要在 Harbor 格式打包的沙箱中运行,动态调动包括 AWS 模拟器、Docker、K8s、Linear MCP 以及多种数据库在内的整套基建。更致命的是,参考基准补丁需要修改的文件数中位数为 11 个,远远高于此前 FrontierCode 与 DeepSWE 的 6 个。

在具体业务场景下,这种长程连锁反应暴露得更彻底。例如在一段开票逻辑修复任务中,模型不仅需要满足沙箱与生产环境切换、多租户费率计算,还要遵守欧盟增值税号对齐和免税客户判定。只要有一处隐式业务规则没有摸透,整套单测就会全盘崩溃。

在 Real-SWE 公布细节的 10 个代表性任务中,有 6 个任务的所有模型综合解决率低于 15%。其中涉及流数据聚合分析的减算器任务全军覆没,通过率为 0%;跨地区税收管辖判断任务的通过率也仅有 3.1%。分类统计表明,导致模型大面积败退的主因并非语法错误或依赖缺失,而是需求遗漏与未经核验的前提假设。

刷榜游戏停摆后的度量裂变

这种断崖式的成绩下滑,实际上宣告了上一代基准测试的失效。

长期被奉为行业金标的 SWE-bench Verified 涵盖 500 个开源任务,但其公信力早已消耗殆尽。2026年,OpenAI 明确宣布不再将 SWE-bench Verified 视为前沿能力评估标准。理由相当直白:测试集不仅经审计发现存在大量缺陷用例,而且开源内容早被各大厂商的模型预训练过程洗刷了无数遍。

评测界随之转向更严苛的封闭集。覆盖 41 个代码库、包含 1,865 项长程任务的 SWE-bench Pro 中,哪怕引入了 18 个初创公司的专有代码库,主流大模型的单次解决率也都被压在 25% 以下,早期的 GPT-5 跑分只有 23.3%。

离开公网公开题库的庇护,大模型在真实企业代码里连及格线都摸不到。

但 Real-SWE 的评测方式也引发了另一重方法学拷问:它衡量的究竟是底模智力,还是工具脚手架的工程成熟度?

在这次跑分中,Specific Labs 直接将模型绑定到原生 CLI 工具上,比如 Claude 搭配 Claude Code、OpenAI 搭配 Codex CLI。学术界(arXiv:2608.27831)的追踪研究指出,真实开发者在交互中给出的指令有 88% 存在严重的信息稀疏,这种非结构化输入会让模型性能天然承受约 6.4 个百分点的减损。模型能否跑出高分,往往取决于背后的系统提示词如何调优、子代理如何分工路由以及超时策略怎么配置。

The Context Lab 曾针对 731 项 SWE-bench Pro 任务对 Claude Code 与 Codex CLI 进行成对对照实验,最终 Claude 净胜 37 项,Codex 净胜 44 项,统计学上根本拉不开差距。与此同时,代码检索工程的权重被急剧放大。CodeScaleBench 的数据显示,仅靠接入 Sourcegraph MCP 提供跨仓库语义检索,Top-10 检索准确率就能从 0.095 拔高到 0.313,召回率从 0.120 升至 0.272,并降低了约 30% 的任务执行成本。

底模的分数差距很小,脚手架的差距却很大。

工程师的防线还没被攻破

在厂商铺天盖地的替代论叙事下,这份成绩单提供了一剂急需的清醒剂。

真实软件工程的日常,从来不是在空白画布上优雅地写一段算法,而是在错综复杂的陈旧逻辑、充满妥协的架构设计以及时刻变动的商业规则中修修补补。

现在的评测体系依然依赖标准补丁(Gold Patch)与隐藏单测,一旦模型的解题路径与出题者不同,哪怕功能实现完备,也常常被判定为失败。但这恰恰反映了企业采纳 AI 时的真实痛点:如果一个补丁需要人类工程师花两倍时间去通读 11 个跨文件变更,并反复核实隐性边界条件,那么省下的编码时间便会立刻被审查负担抵消。

  • 建议.企业评估编程智能体时,应停止参考公网跑分,转而提取内部过去半年的真实拉取请求(PR)构建隔离回溯流水线,重点考核跨文件审查成本而非单纯的生成速度。

程序员不必陷入盲目的被替代恐慌,但工作形态的转变已经注定。当编写单点代码的边际成本逼近于零,真正的专业门槛就退守到了需求规格的精密表达与系统行为的底线校验。谁能把混乱的商业诉求翻译成没有歧义的代码契约,谁才是那个不可替代的人。