一份由AI安全非营利组织SaferAI发布的评测报告,把智谱的开源模型GLM-5.2和OpenAI、Anthropic的旗舰闭源模型放到了同一张考卷上。结果是:在网络攻击和生物两用能力测试里,GLM-5.2对所有攻击性任务都没有拒绝作答,而Claude Opus 4.7护栏拉得太紧,SaferAI压根没能把CyberGym这项网络安全基准跑完。这个对比很容易被读成“开源模型毫无底线、闭源模型高度自律”,但翻开报告的分项数字,故事没这么简单——三个模型在多数基准上分数咬得很紧,真正拉开差距的是测试预算和护栏本身造成的“测不出”,而不是能力鸿沟。

GLM-5.2「全通过」,Opus「测不动」——先说清这不是能力碾压

SaferAI通过智谱公开API测试GLM-5.2,用CyBench、CyberGym评估网络能力,用LAB-Bench、BioMysteryBench评估生物两用能力,对应欧盟《通用人工智能行为准则》里网络攻击、CBRN/生物、失控、有害操纵四类系统性风险。

在满分34题的CyBench测试中,GLM-5.2解出29题(85.3%),GPT-5.5解出31题,Opus 4.7同样是29题——三者置信区间高度重叠。区别在于:GPT-5.5和Opus各有3题被内容过滤直接拒答,GLM-5.2一题没拒。SaferAI据此判断,GLM-5.2的网络能力大致相当于晚两到四个月发布的前沿模型,这是一个具体区间,不是“落后几个月”这种笼统说法。

CyBench解题数:三模型分差不到2题 29 GLM-5.2(85.3%) 0题被过滤拒答 31 GPT-5.5(91.2%) 3题被过滤拒答 29 Claude Opus 4.7(85.3%) 3题被过滤拒答 满分34题,三者置信区间高度重叠 真正的差距不在这道题上

差距真正藏在哪:算力预算,不是拒绝率

更能说明问题的是101题高难度的CyberGym子集。给模型200万token推理预算,GLM-5.2能复现36.6%的漏洞;预算涨到1000万token,超过60%;涨到5000万token,达到76.2%。同等预算下GPT-5.5更强:200万token时55.4%,5000万token时逼近88%。

至于Opus 4.7,SaferAI压根没跑完这项测试——不是因为它答不出来,而是护栏在测试过程中反复触发拒绝,系统判定为“不可测”。这意味着原本听起来像安全性胜利的那句话,从评测机构角度看其实是一处方法论空白:我们不知道Opus 4.7的真实网络能力落在哪个区间,只知道它的护栏在这道题上生效了。

GLM-5.2网络能力随预算飙升(CyberGym子集) 200万token 36.6% 1000万token 60%+ 5000万token 76.2% 同等5000万token预算下,GPT-5.5约88%,Opus 4.7护栏拒绝、未测出

「零拒绝」测的是博士级生物学,不是攻击说明书

舆论最容易误读的是生物两用那部分。LAB-Bench的六项文本类子任务——文献推理、方案排障、序列操作、分子克隆场景等——GLM-5.2全部达到或超过博士级人类基线。在BioMysteryBench里,它完成的试验能解开约81%人类可解的问题,甚至攻克了三分之一人类专家没解出来的题;150轮操作限制内,完成率76%,比GPT-5.5的88%低,比Opus 4.7的68%高。

这些基准测的其实是广泛合法的科学推理能力,不是“怎么做武器”的说明书。SaferAI在报告里特意强调:模型对这类任务零拒绝,本身不构成异常信号——如果连正常的科研问答都要拒绝,那才是过度拒绝。报告作者同时写明,他们没有对GLM-5.2做出总体风险定级,理由包括基准可能被训练数据污染、模型可能“察觉自己在被测试”从而调整表现,以及基准分数和真实世界危害之间本来就有落差。这份审慎,在“零拒绝vs全拒绝”的耸动对比里基本被过滤掉了。

  • 结论.真正的分水岭不是拒绝了多少次,而是模型权重下载后就无法追回。

权重下载之后,谁都管不了

闭源模型的护栏靠分类器、拒绝训练和API级审查维持,厂商能随时打补丁。这套机制一旦离开API、搬到用户自己的硬件上,立刻失效——权重下载后,任何人都能微调、改系统提示词、剥掉安全层。SaferAI执行主任Henry Papadatos说的“前沿能力不等于风险前沿”,指的就是这个:必须把安全措施的实际状态一起算进风险评估。

护栏防得住提问,防不住硬盘拷贝。

技术上有个折中方案叫预训练数据过滤,训练前就把危险的生物学资料从语料里剔除,研究显示这对生物风险确实有效、又不太伤害整体性能。但同样的思路用在网络安全上基本行不通——编程能力和黑客能力高度重叠,而编程恰恰是AI公司最赚钱的业务,厂商没什么动力自断财路。

闭源阵营也不是无懈可击。Far.ai在Grok 4.5、Gemini 3.1 Pro这些闭源模型里找到了数百个“通用越狱”——组合角色扮演、伪造对话记录、权威身份冒充等手法就能大概率突破护栏。Anthropic给Opus 5开的口子是只让它搜未编译源码里的漏洞、不碰编译后的软件,算是一种折衷做法。

中国官方的态度是鼓励开源、同时强调可控,习近平在世界人工智能大会上的表态两头都提到了。但研究中国AI政策的斯坦福学者Graham Webster观察到,中国现行监管的重点历史上落在政治敏感内容、虚假信息和社会稳定上,不是网络攻击、生物滥用这类灾难性风险。他的判断是,同一套拦截敏感政治话题的拒绝机制,理论上完全可以改造用来拦截攻击性网络请求——技术路径是现成的,缺的是把靶心对准过去。

  • 风险.SaferAI报告指出,智谱没有为GLM-5.2发布安全框架、预部署测试承诺或风险评估文件,TechCrunch问询是否做过内部或第三方安全测评,至今没有回应。

对企业和安全团队来说,这次真正该记住的不是“开源模型有多危险”,而是一旦选择自托管开源权重,访问控制、监控、限速这些活儿全部得自己扛,厂商发布之后基本管不着。接下来值得盯的,是欧盟GPAI这类框架会不会把独立评测机构的分项数据纳入强制披露,以及智谱会不会补上安全框架这块空白。