大模型在网络安全里的角色,长期被视作一个不太灵光的代码审查员,能挑出几个笔误,或者让某个进程意外挂掉。但这个认知界限刚刚被彻底撕开。在 Anthropic 近日发布的红队报告中,GLM-5.3 与 Claude Mythos Preview 在一项关键安全测试里,双双把端到端控制流劫持的成功率从过去的 0% 推到了真实有效的个位数。
这不仅仅是百分比的微调,而是程序攻防逻辑的分水岭。上一代的大模型面对此类任务全军覆没,而新一代模型已经开始在没有人类干预的沙箱里,自主摸索出夺取系统底层控制权的方法。
从制造崩溃到夺取执行权
在这项基于 Google OSS-Fuzz 开源项目的内部二进制利用基准中,Anthropic 随机抽取了 100 个任务。测试结果显示,GLM-5.3 在 4% 的试炼中拿到了完整的控制流劫持,Claude Mythos Preview 则达到 6%。作为对照,上一代的 Claude Opus 4.6 与 GLM-5.2 在全部尝试中成功率皆为 0%。
控制流劫持是二进制攻防中公认的满分线。Anthropic 将利用难度划分为五个梯队,从最底层的 Tier 1 基础崩溃、Tier 2 内存破坏原语、Tier 3 实用利用原语,再到 Tier 4 高级内存操纵,直到最后的 Tier 5 完整控制流劫持。过去的大模型哪怕能触发异常,也大多止步于程序报错退出的初级阶段;而 Tier 5 意味着模型不仅能找到裂缝,还能把执行指令引导到自己铺设的代码路径上。
在另一组针对 41 个已知 V8 漏洞的 ExploitBench 测试中,类似差距同样存在。在总计 410 次尝试里,GLM-5.3 端到端成功了 50次,Claude Mythos Preview 成功了 56次。面对高度复杂的现代浏览器底层环境,AI 独立推演漏洞链路已经不是偶然事件。
基座未变而后训练发生跃迁
更有意思的技术变量在于模型的演化路径。Z.ai 披露的信息表明,GLM-5.3 与前代 GLM-5.2 采用了相同的底层基座模型。这意味着性能质变并没有依赖海量算力堆砌出的更大参数,核心驱动力在于强化学习阶段的智能体后训练。
研发团队通过在可执行编程、真实漏洞挖掘以及智能体沙箱环境中进行高强度强化训练,让模型学会了多步推演与动态验证。大模型处理安全问题的方式,由原本单向的文本推测,变成了边跑边试、据反馈微调攻击载荷的行动系统。
然而,这套评测的严肃性并非没有瑕疵。Anthropic 在公开报告中并未披露这 100 个随机抽样任务的具体名称、输入提示词、采样参数,也省去了时间与 token 预算等关键细节。将外界无法独立复现的闭门评测称为划时代突破,本身就保留了科技机构常见的传播修辞。
战报迷雾下的评测断层
除了透明度缺位,围绕 GLM-5.3 的多方战报还存在明显的口径错位。在 Z.ai 自身的公布数据里,GLM-5.3 在 CyberGym 源码漏洞评测中拿下了 84.5% 的高分,不仅超过前代的 77.2%,也大幅甩开 Claude Opus 4.6 的 66.6%。
但在更考验长程决策的纵深基准上,位次立刻反转。在 ExploitBench 上,GLM-5.3 得分为 54.4%,远落后于 Mythos 5 的 78.0% 以及 GPT-5.6 Sol 的 76.5%。换到需要长时间持续交互的 ExploitGym 环境中,在两小时预算下,GLM-5.3 完成了 105 个任务,Mythos 级模型完成了 181 个;将时间拉长到六小时,GLM-5.3 进账至 130 个,而 Mythos 级模型达到了 247 个。
更为关键的分歧出在环境配置上。Anthropic 测试 Opus 4.6 时仅调用了默认设置和基础思维工具;而 Z.ai 在测试 GLM-5.3 时,为其挂载了完整的 Claude Code 套件、拉满了推理算力、开放了 128K 输出上限,并采用单次运行 pass@1 策略。给一位选手发全套外挂,给另一位选手发标准装备,跑出来的碾压战报,技术参考价值往往要打个折扣。
沙箱里构造出的单点原语,距离现实网络战中隐匿链路与持久潜伏的战壕还有很远。
即便是在基准测试里拿到 Tier 5,也不意味着 AI 已经能化身自动化网络战军团。真实的渗透需要探测复杂目标拓扑、搭建外部跳板、规避实时流量监控,并保持长久潜伏,实验室里的干净沙箱根本无法还原这些阻力。
- 风险.武器化能力的扩散速度远快于防御补丁的下发速度,开源基础设施正面临更高频的机器级漏洞探查。
权重延期与失衡的防御防线
在交出亮眼成绩单的同时,Z.ai 宣布以安全评估与加固为由延期发布 GLM-5.3 权重。这一举动让原本期待开源权重的社区陷入审视。高危网络能力的出现,让开发商不得不直面监管与对齐压力的双重拷问。
古人讲兵者不祥之器,不得已而用之。网络安全领域的攻防博弈从来遵循不对称规律,防守方需要把每一扇门窗锁死,而攻击方只需找到一个未被修补的漏洞原语。当同等基座通过后训练就能点亮高危攻击技能时,防守侧的响应成本正在呈指数级上涨。
大模型确实跨过了从零到有的关键门槛,但比起榜单上谁领先两个百分点的公关话术,真正需要解决的问题在水面之下:当这套无需重构基座的后训练方法被更广泛复现时,原本就处于被动防御状态的开源软件生态,拿什么来抵挡不知疲倦的机器探针。
