Google周二发布了新一代安全专用模型Gemini 3.5 Flash Cyber,官方给它的定位是Anthropic Mythos体系的"更省钱替代品"。这款模型基于Gemini 3.5 Flash打底,目前只经Google自家的安全编程智能体CodeMender,向政府部门和一批可信合作伙伴开放,还没有面向普通企业客户或开发者公开。
真正值得琢磨的,不是这个新模型单次能力能不能追上Mythos 5,而是Google想验证的一套逻辑:一个更便宜、更小的模型,如果被反复调用,能不能靠"多扫几遍代码"把漏洞找出来,效果追上一次性调用的大模型。这个逻辑成不成立,关系到安全AI这门生意接下来拼的是谁更聪明,还是谁能把单次推理成本压得更低。
CodeMender先跑,普通用户暂时插不上手
Google在博客里说,CodeMender可以"高速、低成本地多次调用"Gemini 3.5 Flash Cyber,让智能体扫描更多代码路径。这句话本身就说明了产品逻辑:它不是靠单次判断力取胜,而是靠便宜到可以反复跑。同一天发布的Gemini 3.6 Flash主打编码和多模态能力提升,3.5 Flash-Lite是整个3.5系列里最省钱的通用模型——两者都不是安全专用模型,不要和3.5 Flash Cyber混为一谈。
三款模型一起发,但只有安全模型选择了最窄的开放路径:政府和可信合作伙伴优先,这本身也说明Google对这个产品的定位更接近工具试点,而不是急着抢市场份额。
便宜换轮次,对照的是Mythos的账本
Anthropic的Mythos 5是Project Glasswing项目下的安全模型,单次能力强,但计算成本也高——按此前报道,价格是Claude Opus 4.8的两倍。Microsoft已经把Mythos用进了自己的安全检查流程,这个月还借助AI找漏洞,交出了迄今为止规模最大的一次月度补丁更新。这条路径的逻辑是:一次调用尽量强,把成本转嫁给企业客户。
Gemini 3.5 Flash Cyber走的是相反方向。
比的不是单次多聪明,而是够不够便宜地多跑几轮
V8的成绩单:55比47比36,前提是最多调用五次
Google给出的自测数据是这样的:在CyberGym安全基准上,Gemini 3.5 Flash Cyber在最多调用五次的条件下,表现出了与"体量大得多的模型"相当的竞争力。在V8 JavaScript引擎的实测里,它找出了55个独立确认的问题,而普通版Gemini 3.5 Flash找到47个,Opus 4.6找到36个——其中有10个问题是其他模型都没发现的。
这组数字确实好看,但它是Google自己报出来的,还没有独立机构复核过,更谈不上生产环境里的实测表现。而且"找出更多问题"不等于"漏洞更严重"或"修复成功率更高",拿这三个数字直接推出3.5 Flash Cyber整体能力超过Mythos 5,是不成立的跳跃。
- 结论.安全团队和采购负责人该盯的是总调用成本、误报率、修复质量和部署权限的综合账,而不是某一个基准的排名
- 风险.CyberGym和V8的成绩都建立在"最多调用五次"这个特定条件上,换成不设限的场景,便宜换轮次这套逻辑是否还成立,目前没有第三方数据能回答
这场对照才刚开局。中国的Z.ai此前也宣称自家模型能和Mythos掰手腕,安全AI这个赛道正在同时出现"堆算力"和"堆轮次"两种打法,谁能把找漏洞的成本真正做低,才是接下来该盯的变量。
