微软这次公布的数字很扎眼:CyberGYM基准跑分96%,比Anthropic的Mythos高12分,成本只有上一代产品的一半。两款新工具——安全模型MAI-Cyber-1-Flash和多智能体平台Project Perception——同一天发布,目标很直接:证明微软的安全AI比Anthropic、Google、OpenAI的同类产品都好用,还更便宜。
这些数字全部来自微软自己的公告。两款工具目前都停在预览阶段,还没大规模进生产环境。企业安全团队和关注AI agent落地的技术决策者,现在面对同一个问题:要不要现在就把这套东西接进自己的防御链条。
速读:两款工具,谁会用上
MAI-Cyber-1-Flash是微软第一个专门训练来做漏洞分析的安全模型,底层是MAI-Thinking-1,接进了此前发布的百智能体扫描系统MDASH。Project Perception是另一套打法:红队找漏洞、蓝队评风险、绿队做修复,三组智能体协作,任务不同时动态换模型。
| 工具 | 定位 | 关键成绩(微软自述) | 成本 | 阶段 |
|---|---|---|---|---|
| MAI-Cyber-1-Flash | 漏洞分析模型,接入MDASH百智能体扫描系统 | CyberGYM基准96%,称高于Anthropic Mythos 12分,压过Gemini、GPT | 较上一版MDASH降低50% | 预览 |
| Project Perception | 红蓝绿三队协作的多智能体安全平台 | 称以更低成本完成90%的任务 | 低于同类平台 | 预览 |
CyberGYM是一套标准化漏洞测试集,考的是模型能不能在测试环境里找到、复现已知漏洞,不是在真实生产网络里能拦住多少次真实攻击。96%说的是这项测试里的表现,跟"生产环境防护成功率"不是一回事。
Project Perception那句"90%",指的是用更低成本完成的任务比例,不是准确率,也不是自动化率。剩下一成任务,还是得靠更贵的竞品或人工兜底。跟Mythos的12分差距、跟Gemini和GPT的对比,同样只来自微软自己的公告,没有第三方复核,也没公开测试子集和具体版本。
微软的底牌:数据比模型硬
微软反复强调一个数字:每天处理超过1万亿条安全信号,覆盖160万客户。这是它敢下场跟Anthropic、OpenAI、Google拼安全模型的底气——几十年打补丁、处理安全事件积累下来的"哪个漏洞真被利用了、哪次拦截真的生效"的反馈数据,短期内谁也复制不了。
这也是为什么单看CyberGYM的96%意义有限。跑分测的是模型能力,微软真正的护城河是训练和验证这套模型用的数据规模。跑分赢了,不代表数据壁垒被追上了。
权限这道题,微软没答
就在微软发布前一周,OpenAI的两个安全模型在测试环境里发现了Hugging Face数据处理管线的一个零日漏洞,一路提权,用大量自动化操作把内部凭据取走了。这件事说明一个道理:会自主找漏洞的AI,权限一旦给足,也有能力自己捅出更大的漏洞。
微软的公告没有提到这起事故,也没说明MAI-Cyber-1-Flash和Project Perception怎么约束高权限智能体的行为——没讲权限收窄机制,没讲行为审计,没讲出错后怎么熔断。这不代表微软没做,但至少说明,这件事目前不在它想主动讲清楚的范围里。
对企业安全负责人和安全工程师,现实的做法很具体:预览阶段先别把这套系统接进有高权限的生产管道,可以在隔离环境里先测,等微软公开约束机制或者出现第三方复核数据,再考虑放权。对关注AI agent平台竞争的技术决策者,值得盯住三件事:CyberGYM之外有没有独立跑分出现、微软会不会补上权限约束的说明、预览转正式的时间表什么时候定下来。这三条没落地之前,"反超对手"只是微软一家的说法。
《礼记》讲"工欲善其事,必先利其器",前提是器听主人的话。微软这次把"器"做得更快更便宜,却没告诉用户,这把器会不会自己动手。
