资深安全工程师 netmeister 在 2026 年 9 月发布的长文,撕开了大模型安全军备竞赛的一角遮羞布。在 Anthropic 与 OpenAI 相继启动以大模型为底座的漏洞挖掘计划后,网络安全行业正陷入一场严重的资源错配:工程师被动沦为大模型海量报警的核验员,而真正能被下游验证、打上补丁并部署到生产系统的漏洞少得可怜。

信息安全的本质瓶颈从来不在于找出更多潜在漏洞,而在于如何把补丁稳妥打进软件资产并完成更新。当大模型的输出能力呈指数级膨胀,这一基础现实并未被颠覆,反而因上游治理挤兑变得愈发棘手。

2.6 万个漏洞警报背后:0.8% 的补丁转化率与账目落差

2026 年 4 月 7 日,Anthropic 正式启动 Project Glasswing,采用未公开发布的 Claude Mythos Preview 模型进行开源代码审计。这项服务的定价高达每百万输入 Token 25 美元、每百万输出 Token 125 美元,Anthropic 为此提供了最高 1 亿美元的使用额度补贴,迅速引来大量企业与安全团队跟进。

大模型挖掘漏洞的速度确实惊人。Anthropic 在 5 月公布的数据显示,系统共扫描出 23,019 个开源候选漏洞,其中 6,202 个初评为高危或严重漏洞。然而在人工复核的 1,752 个样本中,虽然确认有效漏洞达 1,587 个,但最终向维护者披露的 530 个高危漏洞里,当时仅有 75 个完成了代码修补。

Project Glasswing 开源漏洞转化漏斗(第三方审计核验) 宣称发现总量 26,153 Claude Mythos 初筛候选 进入公开账本 2,736 占比约 10.5% 最终证实修复 202 实际落地率仅 0.8%

到了 9 月,第三方安全审计机构 VulnCheck 针对 Project Glasswing 的公开账本展开了复核,结果暴露出更剧烈的落差。在 Anthropic 声称的 26,153 个发现中,只有 2,736 个被正式登记在公开账本上,而明确显示完成修复的仅有 202 个(约 0.8%)。审计还指出,模型生成的严重程度评级与维护者的实际认知脱节严重,在抽查知名开源项目 curl 的测试样本中,模型提交的 5 个报告最终仅有 1 个被维护者确认为安全漏洞。

这一断层清楚说明:发现端与修补端的割裂正在大模型的助推下被无限放大。

模型能力趋同,胜负手落在工程管道与上游合并

行业对大模型参数能力的迷信也并未得到基准测试的支撑。HackerOne 针对 GPT-5.5、Claude Opus 4.7 与 Claude Sonnet 4.6 展开的漏洞可利用性验证测试显示,在 38 个标准化测试用例中,最高分与最低分仅相差 1 例判断。不同模型在安全审计上的原生智力差异,远没有厂商宣称的那样悬殊。

真正的分水岭在于大模型外围的集成治具(Harness)与端到端工作流设计。OpenAI 推进的 Daybreak 计划采取了不同的路径:不单纯强调挖掘漏洞的总量,而是主攻补丁生成与上游交付。

计划 / 项目覆盖对象规模问题发现量补丁生成表现上游合并接受率
OpenAI Daybreak41 个开源代码库858 个已识别问题生成 263 个补丁(生成率 30.7%)143 个被上游合并(占补丁 54.4%)
Anthropic Glasswing跨生态开源库26,153 个声称发现登记 2,736 个公开账目202 个证实修补(转化率约 0.8%)

OpenAI Daybreak 公布的数据显示,在其覆盖的 41 个开源代码库中,识别出 858 个具体问题,自动化生成了 263 个补丁,最终有 143 个补丁被上游合并接受。这意味着 OpenAI 实现了 16.7% 的端到端闭环率,其补丁在上游维护者那里的采纳率超过一半。相比 Anthropic 依靠天量 Token 漫灌堆砌漏洞报告的做法,将算力用于生成高兼容性代码显得更具实用价值。

挖掘漏洞的边际成本已近乎为零,但上游合并的边际沟通成本正在成倍上升。

挤兑开源公地:中间协调机制与被忽视的基本功

当数以万计的疑似漏洞被自动化推向社区,开源维护者成了事实上的代偿者。软件供应链安全企业 Chainguard 发起的 Athena 计划在启动前三周就处理了超过 40,000 个漏洞,其数据同样佐证了一个残酷现实:某大型 AI 漏洞挖掘项目中,仅有约 6% 的发现能够最终推送到上游开源项目。

绝大多数开源项目由志愿者维护,面对格式整齐、措辞严肃却缺乏可验证利用场景的 AI 报告,维护者不得不耗费大量私人时间进行证伪。

AI 漏洞挖掘的上下游流转与治理瓶颈 大模型挖掘层 · 算力补贴与批量扫描 · 漏洞线索指数级爆发 中立协调层(Akrites) · 保密接收与自动化去重 · 真实危害验证与分流 下游生产落地 · 资产清单全面测绘 · 30 天周期重启与补丁

为了防止开源协作体系被垃圾警报冲垮,Linux 基金会于 2026 年 6 月 25 日联合产业界推出了 Akrites 共享安全事件响应服务(SIRT)。这一中立机构专门承接来自 Glasswing 等 AI 工具的原始报告,承担起前置去重、危害验证与多方披露的缓冲带职责,试图避免企业将未经精细核实的漏洞直接倾倒给开源社区。

但即使上游把补丁打好,企业终端的防御依然脆弱。过去几个月里,多家企业抽调资深安全工程师,花费数百万美元的人力成本开发适配大模型的接口和分拣管道,却将真正的防御基本功抛在一边。

  • 风险.若企业不具备细粒度的软件资产清单,不能做到定期自动重启系统以加载更新内核,再多的 AI 漏洞警报也无法换来生产环境的真正安全。
  • 建议.企业安全预算应当从追逐大模型挖洞噱头,回撤到全量攻击面测绘、自动化补丁分发管道与日常运维演练这些无聊却见效的基建上。