网络安全初创公司 Cantina 联合 Yeta Labs 发布了一款专攻漏洞利用的开源权重模型 apex-flash-1。在官方公布的 20 个留出漏洞案例共 60 项评估任务中,这款基于 GLM-5.3-Flash 强化学习后训练的模型,以 66.7% 的首抽通过率直接逼近闭源旗舰 Claude Opus 5 High 的 71.7%,而单次评测的总推理成本仅需 2.38 美元,不到后者的三十分之一。

这不是开源社区又一次廉价叫板闭源巨头的公关闹剧,而是企业安全自动化路径的一道分水岭。它证明了在极长上下文与多轮攻防工具交互中,通过垂直场景的精准强化学习,完全可以在大幅压缩 token 浪费的同时守住高阶推演能力;但在欢呼免费模型击穿防线之前,企业需要看清其背后的真实工程账本与能力边界。

拆解 60 道评测任务:状态机利用,而非未知代码挖掘

apex-flash-1 在 Hugging Face 上采用 MIT 协议开源,其评测基准由 20 个留出的真实漏洞案例派生而成,总计切分为 60 个具体任务。测试覆盖了引导式白盒、聚焦白盒与聚焦黑盒三种不同的信息暴露维度,且全量置于隔离沙箱环境中,最终由针对系统状态的验证器进行自动化裁定。

密闭沙箱中自动化探针通过系统状态验证了四十项漏洞利用
密闭沙箱中自动化探针通过系统状态验证了四十项漏洞利用
模型参数量与形态解决任务数(共 60 项)首抽通过率(Pass@1)单次总推理成本单题平均推理成本
Claude Opus 5 High闭源商业 API4371.7%74.68 美元1.74 美元
apex-flash-1321B 开源权重4066.7%2.38 美元0.06 美元
GLM-5.3-Flash321B 基座模型3660.0%4.56 美元0.13 美元

单看数字,apex-flash-1 解决了 40 项任务,仅比 Claude Opus 5 High 少做对 3 道题,单题成本却从 1.74 美元骤降到 0.06 美元。而在另一项针对开源项目 OpenClaw 仓库的完整 Agent 工作流对比中,Cantina 的 Apex 安全工作流验证出 11 个漏洞,同期运行的 Claude Code Security 验证出 4 个(消耗 2,956 美元),Codex Security 则仅验证出 1 个(消耗 133.20 美元)。

apex-flash-1 与闭源旗舰基准表现对照 任务解决率 (Pass@1, 共60项) Claude Opus 5 High 71.7% (43/60) apex-flash-1 (本文) 66.7% (40/60) GLM-5.3-Flash (基座) 60.0% (36/60) 单次评测推理开销对照 (美元) Claude Opus 5 High $74.68 apex-flash-1 $2.38 (约为 1/31)

但这个比拼存在明确的技术语境。所谓验证器裁定,是指在已知漏洞框架内,模型通过与靶场环境多轮交互,生成有效 payload 并触发特定越权或崩溃状态。这属于渗透测试链路后半程的漏洞利用验证(Exploitation),而非端到端在数万行复杂工程代码中自主审计出未知的零日漏洞(0-day)。

2.38 美元账本背后,是 642GB 权重的物理门槛

评测中出现的 2.38 美元极易给外界造成免费安全助手的错觉。事实上,apex-flash-1 是一个参数量达 3210 亿(321B) 的庞然大物,其 Safetensors 格式权重文件体积高达 642 GB。

私有化部署庞大权重需要配备高规格计算集群与隔离机房
私有化部署庞大权重需要配备高规格计算集群与隔离机房
单次推理的代币开销不等于系统所有权成本,开源权重的自由必然捆绑着算力基建的重资产。

企业若想在内网环境完整加载该模型以确保源码与漏洞数据绝不出境,以 BF16 精度运行至少需要配备多张高端专业计算卡组成的集群。算力硬件采购、机房托管电费、显存显联损耗以及容器编排运维,构成了一笔巨大的隐形成本。

企业安全落地:表象账面与真实基建落差 公关宣传账面口径 $2.38 单次 60 题推理费用 • 仅计算单次推演生成的 token 计费 • 假定底层算力池已常驻就绪 • 忽略冷启动与持续并发调用峰值 私有部署真实 TCO 642 GB BF16 原始权重体积 • 需整机 8 卡高端 GPU 集群常驻显存 • 包含高阶网络互联与容器编排损耗 • 专用 Worker 架构需要持续调优人力

商业 API 固然贵,Anthropic 按照调用量结算,开箱即用;自建 321B 架构固然解决了保密合规问题,但只有当企业的日常代码提交量与漏洞复现频次跨过规模临界点时,自建集群的总体拥有成本才会显现出对闭源 API 的经济优势。


150 题微调出的专职 Worker,以及未解的污染疑云

apex-flash-1 的技术价值不在于打平了 Claude,而在于证实了领域强化学习的高效杠杆。后训练团队仅使用 50 个漏洞案例派生的 150 个任务 作为训练集,就让基座模型 GLM-5.3-Flash 的推理账单从 4.56 美元压缩到 2.38 美元,同时任务通过数净增 4 道。

强化学习通过精准剪枝去除冗余试探并保留最短验证链路(示意图)
强化学习通过精准剪枝去除冗余试探并保留最短验证链路(示意图)

通用大模型在面对复杂的调试和交互时往往习惯性铺陈发散思维,产生海量无效试探。强化学习在这里充当了精准的剪枝工具,训练模型像资深渗透工程师一样只调用必要工具、输出最短验证链路,这为软件工程 Agent 流水线中配备低成本专职 Worker 提供了现实模板。

  • 风险.截至 2026 年 10 月 5 日,所有评测数据均由 Cantina 单方主导披露。官方尚未开源完整的沙箱执行代码、未披露提示词模板,亦未引入第三方数据污染审计以排除预训练阶段已读过相关 CVE 报告的可能性。
  • 结论.对于严禁核心业务源码出境的研发团队,该模型为内网搭建私有化渗透流水线提供了高性价比基石;但短期内安全工程师的角色仍是把关最终 Exploit 的质检员,而非交出控制权的旁观者。