一份标注为 2026 年 7 月 21 日的 Google 发布材料,同时列出了三款 Gemini Flash:3.6 Flash、3.5 Flash-Lite,以及只向特定对象试点的 3.5 Flash Cyber。

最扎眼的不是又多了几个型号,而是 Google 开始主动谈输出 token、吞吐量和任务成本。Agent 走到生产环境后,模型多答两轮、误改一次代码、重复调用一次工具,都要付钱。能力演示很热闹,财务账单更诚实。

本文数字均来自这份 Google 材料。由于暂时缺少可独立核验的正式页面和生产数据,型号、价格、开放状态及性能结论均按官方口径转述,不应直接视为真实业务中的稳定表现。

三款模型分工明确,Cyber 并非普通发布

Google 给三款模型划了不同任务:3.6 Flash 扛复杂 Agent,Flash-Lite 处理大量轻任务,Flash Cyber 则被锁在网络安全试点里。

模型定位官方价格材料中的关键信息开放范围
Gemini 3.6 Flash主力 Agent、编程与工具操作输入 1.50 美元/百万 token;输出 7.50 美元/百万 tokenGoogle 称其在 DeepSWE、MLE Bench、OSWorld-Verified 等测试中超过 3.5 Flash材料称已开放
Gemini 3.5 Flash-Lite搜索、文档处理等高吞吐任务输入 0.30 美元/百万 token;输出 2.50 美元/百万 token官方速度为每秒 350 个输出 token材料称已开放
Gemini 3.5 Flash Cyber网络安全任务未披露通过 CodeMender 开展限量试点仅政府及可信合作伙伴

3.6 Flash 的重点是减少 Agent 执行中的冗余。Google 称,它比 3.5 Flash 少用 17% 输出 token;在部分 DeepSWE 场景中,最高减少 65%。

这两个数字不能混用。17% 是较宽口径的官方比较,65% 只出现在特定 DeepSWE 观察结果中。它们也不能直接换算成同等比例的账单下降:输入 token 仍要收费,不同型号的单价可能变化,工具、搜索和代码执行还可能另行计费。

材料还提到,3.5 Pro 仍处于合作伙伴测试阶段,Gemini 4 已经开始预训练。这说明 Google 没打算让 Flash 取代旗舰模型。它更像是在建立任务分层:复杂推理交给高阶模型,大量重复工作交给便宜、快速的 Flash。

单价只是表面,Agent 要算一次任务的总账

按公布价格做一个简单测算。

假设某次任务消耗 10 万输入 token、2 万输出 token,不含缓存优惠、工具费用和失败重试:

模型输入费用输出费用单次模型费用
Gemini 3.6 Flash0.15 美元0.15 美元0.30 美元
Gemini 3.5 Flash-Lite0.03 美元0.05 美元0.08 美元

表面看,Flash-Lite 便宜很多。但如果它完成同一任务需要跑四次,总费用就会升到 0.32 美元,反而超过一次成功的 3.6 Flash。

这正是 Agent 选型容易算错的地方。

聊天模型可以比较一问一答的价格。Agent 会读取长上下文、规划步骤、调用工具、检查结果,再根据错误重来。软件开发任务还会产生代码审查、测试流水线和人工回滚成本。模型少写几段废话,价值有限;少走一轮错误路径,才可能真省钱。

Google 列出的 DeepSWE、MLE Bench 和 OSWorld-Verified 成绩,至少说明 3.6 Flash 在代码、机器学习工程和计算机操作任务上有所加强。但基准测试给不出几个生产环境最要命的数字:

  • 完成一次真实任务的成功率;
  • 平均需要多少轮推理和工具调用;
  • P95 延迟及并发限额;
  • 误改、越权操作和人工接管率;
  • 长任务中断后的恢复能力。

上一次类似的转向发生在云计算早期。服务器参数曾经是宣传中心,企业真正大规模迁移后,采购部门开始盯单位请求成本、可用性、监控和故障恢复。Agent 与云计算并不完全一样,但生产化的规律相通:技术一旦进入流水线,规格表就得给运营指标让路。

我认可 Google 这次强调 token 效率。方向是对的。可它目前交出的仍是一张厂商成绩单,还不是企业可以直接拿去做预算的成本证明。

开发团队该测什么,Google 又把边界画在哪里

如果团队正在做批量搜索、文档分类、摘要或结构化提取,Flash-Lite 更适合进入压测名单。每秒 350 个输出 token 很亮眼,但单流速度不等于整体吞吐量。并发配额、首 token 延迟、区域可用性和限流规则,都会改变最终结果。

如果任务涉及代码修改、浏览器操作或多工具协作,3.6 Flash 更值得比较。迁移时别只跑一次标准答案,应记录完整任务数据:

选型动作需要记录的指标
用 50—100 个内部真实任务做对照测试成功率、失败类型、人工接管次数
保留完整 Agent 轨迹推理轮次、输出 token、工具调用次数
对失败任务自动重试首次成功率、重试后成本、总耗时
检查代码或文档改动误改率、回滚率、审核时间
核对平台条款缓存计费、工具费用、并发限额、数据保存规则

上下文窗口、延迟测试口径、详细计费规则和可用地区,在现有材料中还看不清。缺少这些信息,技术负责人最多能决定“要不要测试”,还不能决定“要不要迁移”。

Flash Cyber 的处理则更有分量。它没有作为普通 API 全面开放,只通过 CodeMender 向政府和可信合作伙伴限量试点。这等于承认网络安全模型具有明显的双重用途:它能发现漏洞、生成补丁,也可能帮助攻击者更快定位薄弱点。

受限开放是合理的安全闸门,却不是风险已经解决。谁算可信伙伴、模型能接触哪些系统、操作是否留痕、发现高危漏洞后如何披露,都需要治理规则。平台若只控制入口,却无法审计模型执行过程,限制名单很容易沦为一层形式。

接下来真正该盯的变量已经很具体:3.6 Flash 能否在真实任务中降低重试率,Flash-Lite 的 350 token/s 能否在高并发下维持,以及 Google 会不会公布缓存、工具调用和失败任务的完整成本口径。

模型分数还能继续上涨。生产团队只会问一句:同样一件事,它能不能一次做对。