Gemini 3.8 Flash和3.8 Flash Cyber在9月2日上线,这是Google六周内第三次发布Flash系列模型——3.7 Flash才推出三周,3.8就跟着来了。定价维持3.7 Flash的水平,输入每百万tokens 0.75美元、输出3.75美元,但这个优惠价会在2026年底到期,之后涨到1.50美元和7.50美元,等于翻一倍。
通稿里能验证的具体数字只有两个:CWE-Bench补丁基准pass@1为47.2%,对比头部前沿模型的47.8%;HLE-Verified跑到54.9%。剩下三个被反复提及的基准——DeepSWE、金融Agent、法律Agent——通稿只写了"跑赢前沿模型",没给分数。更麻烦的是,撑起"面向可信防御者"这套叙事的两个关键名字,"3.8 Flash Cyber"和"Fairwind Program",在DeepMind官方页面上目前对应的是另一套版本号和项目名。
通稿没给的分数:法律场景短板明显
第三方基准追踪平台补上了这三个数字:DeepSWE v1.1(长周期软件工程)为71.0%,在被测的23个模型里排第二,仅次于GPT-5.6 Sol的73%;金融Agent基准(Vals Finance Agent V2)拿到61.4%,是当前追踪结果里的第一名;法律Agent基准(Harvey Legal Agent Benchmark)只有10.0%,8个模型里排第五,第一名Muse Spark 1.1是20%的两倍。
三个基准的评分方法和工具链差别很大,不该被简单加总成一个"综合智能分数"。但这组数字至少说明,"frontier-level performance"是个笼统措辞——在编程和金融场景成立,在法律文档场景明显不成立。
"3.8 Flash Cyber"查无实证
原文称新模型通过一个叫Fairwind Program的新计划,向"可信防御者"提供访问权限。但目前在DeepMind官方博客上能查证的,是另一套体系:模型叫3.5 Flash Cyber,配套的是CodeMender试点项目,面向政府和有限合作伙伴开放。官方页面给出的对照数据是,3.5 Flash Cyber在V8漏洞发现上找到55个独特确认问题,对比主线3.5 Flash的47个和Claude Opus 4.6的36个。
这可能是通稿版本号写错,可能是项目改名还没同步到官方索引,也可能确实存在一份尚未被搜索引擎收录的最新公告。三种可能性目前都无法排除,但对于要申请访问权限的机构来说,先按官方页面上能查到的"CodeMender"去核实,比直接相信通稿里的"Fairwind Program"更稳妥。
落地案例是真的,风险控制是模糊的
即便命名存疑,模型在生产环境里的效果数据是具体的:Chrome Security团队测出补丁正确率是同类商业大模型的2.6倍;Wiz在渗透测试基准上recall提升7.5%到9.7%,成本反而低2.3到5.2倍;Google Cloud漏洞研究团队用它在不到2小时内发现一个通常需要数月才能找到的基础性漏洞。这些数字撑起了"防御优先"的设计逻辑——先投入补丁能力,再谈漏洞利用。
找漏洞的能力提升,防御者和攻击者同样能用。
- 风险.模型在漏洞发现上的能力越强,谁有资格进入"可信防御者"名单、审批标准是否透明,就越关键;这部分Google至今没有公开细节。
对普通开发者来说,现实选择很简单:3.8 Flash现在价格没变,年底涨价前是窗口期;如果任务集中在代码和金融分析,性价比大概率跑赢3.7;如果指望它处理法律文档,先看清10分这个数字,别被"frontier-level"的整体措辞带偏。
