谷歌在2026年7月21日一口气放出三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite,以及只对政府和可信合作伙伴开放的3.5 Flash Cyber。前两款当天就上线了Google AI Studio、Gemini Enterprise和Gemini App等公开渠道,第三款则被封在CodeMender代码安全代理里,普通开发者暂时摸不到。
这轮更新没把重点放在"更聪明",而是放在"更便宜、更快、更省Token"。谷歌给出的数字很直接:3.6 Flash比上一代3.5 Flash少用17%的输出Token,定价降到每百万输入Token 1.50美元、输出7.50美元;3.5 Flash-Lite跑到每秒350个输出Token,价格只要0.30美元和2.50美元。竞争的落点,从"谁的模型分数更高"挪到了"谁能把一次代理任务的账单压得更低"。
主力款降本,轻量款抢吞吐
3.6 Flash定位是"主力干活模型",主打编码和知识работа场景。按Artificial Analysis Index的测算,它在DeepSWE代码修复任务上拿到49%,对比3.5 Flash的37%;MLE Bench从49.7%提到63.9%;OSWorld-Verified电脑操作能力从78.4%涨到83.0%。Hebbia和Harvey这两家客户提到,它在文档解析、图表分析和报告起草上表现更扎实。
3.5 Flash-Lite走的是另一条路:牺牲一点绝对能力,换极致的速度和成本。它在Terminal-Bench 2.1上从上一代3.1 Flash-Lite的31%冲到54%,甚至在SWE-Bench Pro(54.2% vs 49.6%)和OSWorld-Verified(74.0% vs 65.1%)上超过了体量更大的3 Flash,适合高并发的搜索和文档处理这类"跑量"场景。
| 模型 | 输入价格(每百万Token) | 输出价格(每百万Token) | 定位 |
|---|---|---|---|
| 3.6 Flash | $1.50 | $7.50 | 综合能力主力款,输出Token减少17% |
| 3.5 Flash-Lite | $0.30 | $2.50 | 350 Token/秒,高吞吐优先 |
基准分数不等于生产账单
这些提升数字都来自特定测试:17%的Token降幅出自Artificial Analysis Index,DeepSWE来自第三方平台Datacurve,350 Token/秒同样是Artificial Analysis的测算结果。它们说明模型在这些评测里更省、更快,但不能直接换算成任何生产环境下的实际成本或延迟——真实的代理工作流里,任务复杂度、重试次数、工具调用链条长短,都会让最终账单和评测数字对不上。
- 风险.文中所有效率和性能对比都基于特定基准测试口径,迁移前应用真实任务跑一轮成本核算,而不是照搬评测榜单排名。
基准分数算的是实验室的账,生产账单得自己重新算一遍。
被锁起来的那一款
3.5 Flash Cyber走的是完全不同的路线。它基于3.5 Flash微调,专门用来发现和修补代码安全漏洞,被塞进CodeMender——一个让多个3.5 Flash Cyber代理协同工作、最终合并成一份报告的安全系统,在CyberGym基准上据称达到接近前沿的水平。但这不是某一个模型单打独出的分数,而是CodeMender整套多代理编排的结果。
因为漏洞挖掘能力本身是双刃剑,谷歌没有把它公开:只通过CodeMender,面向政府和"可信伙伴"做限量试点,目的是让防守方比攻击者早一步补上漏洞,同时压住被滥用的风险。这意味着普通开发者和企业客户在短期内看不到、也用不上这款模型——它和公开可用的3.6 Flash、3.5 Flash-Lite不是一回事,不该被放在同一个采购清单里讨论。
对负责代理系统上线的开发团队来说,值得关心的是3.6 Flash和3.5 Flash-Lite能否顶替此前的3.5 Flash或3 Flash跑同样的搜索、文档处理、多代理流水线——这取决于真实任务的总成本和稳定性,不是评测榜单上的名次。谷歌同时透露,3.5 Pro还在和合作伙伴联调测试,尚未公开,面向下一代Gemini 4的预训练也刚刚起步,都还谈不上落地。
