一份标注为 2026 年 7 月 21 日的 Google 发布材料,同时列出了三款 Gemini Flash:3.6 Flash、3.5 Flash-Lite,以及只向特定对象试点的 3.5 Flash Cyber。
最扎眼的不是又多了几个型号,而是 Google 开始主动谈输出 token、吞吐量和任务成本。Agent 走到生产环境后,模型多答两轮、误改一次代码、重复调用一次工具,都要付钱。能力演示很热闹,财务账单更诚实。
本文数字均来自这份 Google 材料。由于暂时缺少可独立核验的正式页面和生产数据,型号、价格、开放状态及性能结论均按官方口径转述,不应直接视为真实业务中的稳定表现。
三款模型分工明确,Cyber 并非普通发布
Google 给三款模型划了不同任务:3.6 Flash 扛复杂 Agent,Flash-Lite 处理大量轻任务,Flash Cyber 则被锁在网络安全试点里。
| 模型 | 定位 | 官方价格 | 材料中的关键信息 | 开放范围 |
|---|---|---|---|---|
| Gemini 3.6 Flash | 主力 Agent、编程与工具操作 | 输入 1.50 美元/百万 token;输出 7.50 美元/百万 token | Google 称其在 DeepSWE、MLE Bench、OSWorld-Verified 等测试中超过 3.5 Flash | 材料称已开放 |
| Gemini 3.5 Flash-Lite | 搜索、文档处理等高吞吐任务 | 输入 0.30 美元/百万 token;输出 2.50 美元/百万 token | 官方速度为每秒 350 个输出 token | 材料称已开放 |
| Gemini 3.5 Flash Cyber | 网络安全任务 | 未披露 | 通过 CodeMender 开展限量试点 | 仅政府及可信合作伙伴 |
3.6 Flash 的重点是减少 Agent 执行中的冗余。Google 称,它比 3.5 Flash 少用 17% 输出 token;在部分 DeepSWE 场景中,最高减少 65%。
这两个数字不能混用。17% 是较宽口径的官方比较,65% 只出现在特定 DeepSWE 观察结果中。它们也不能直接换算成同等比例的账单下降:输入 token 仍要收费,不同型号的单价可能变化,工具、搜索和代码执行还可能另行计费。
材料还提到,3.5 Pro 仍处于合作伙伴测试阶段,Gemini 4 已经开始预训练。这说明 Google 没打算让 Flash 取代旗舰模型。它更像是在建立任务分层:复杂推理交给高阶模型,大量重复工作交给便宜、快速的 Flash。
单价只是表面,Agent 要算一次任务的总账
按公布价格做一个简单测算。
假设某次任务消耗 10 万输入 token、2 万输出 token,不含缓存优惠、工具费用和失败重试:
| 模型 | 输入费用 | 输出费用 | 单次模型费用 |
|---|---|---|---|
| Gemini 3.6 Flash | 0.15 美元 | 0.15 美元 | 0.30 美元 |
| Gemini 3.5 Flash-Lite | 0.03 美元 | 0.05 美元 | 0.08 美元 |
表面看,Flash-Lite 便宜很多。但如果它完成同一任务需要跑四次,总费用就会升到 0.32 美元,反而超过一次成功的 3.6 Flash。
这正是 Agent 选型容易算错的地方。
聊天模型可以比较一问一答的价格。Agent 会读取长上下文、规划步骤、调用工具、检查结果,再根据错误重来。软件开发任务还会产生代码审查、测试流水线和人工回滚成本。模型少写几段废话,价值有限;少走一轮错误路径,才可能真省钱。
Google 列出的 DeepSWE、MLE Bench 和 OSWorld-Verified 成绩,至少说明 3.6 Flash 在代码、机器学习工程和计算机操作任务上有所加强。但基准测试给不出几个生产环境最要命的数字:
- 完成一次真实任务的成功率;
- 平均需要多少轮推理和工具调用;
- P95 延迟及并发限额;
- 误改、越权操作和人工接管率;
- 长任务中断后的恢复能力。
上一次类似的转向发生在云计算早期。服务器参数曾经是宣传中心,企业真正大规模迁移后,采购部门开始盯单位请求成本、可用性、监控和故障恢复。Agent 与云计算并不完全一样,但生产化的规律相通:技术一旦进入流水线,规格表就得给运营指标让路。
我认可 Google 这次强调 token 效率。方向是对的。可它目前交出的仍是一张厂商成绩单,还不是企业可以直接拿去做预算的成本证明。
开发团队该测什么,Google 又把边界画在哪里
如果团队正在做批量搜索、文档分类、摘要或结构化提取,Flash-Lite 更适合进入压测名单。每秒 350 个输出 token 很亮眼,但单流速度不等于整体吞吐量。并发配额、首 token 延迟、区域可用性和限流规则,都会改变最终结果。
如果任务涉及代码修改、浏览器操作或多工具协作,3.6 Flash 更值得比较。迁移时别只跑一次标准答案,应记录完整任务数据:
| 选型动作 | 需要记录的指标 |
|---|---|
| 用 50—100 个内部真实任务做对照测试 | 成功率、失败类型、人工接管次数 |
| 保留完整 Agent 轨迹 | 推理轮次、输出 token、工具调用次数 |
| 对失败任务自动重试 | 首次成功率、重试后成本、总耗时 |
| 检查代码或文档改动 | 误改率、回滚率、审核时间 |
| 核对平台条款 | 缓存计费、工具费用、并发限额、数据保存规则 |
上下文窗口、延迟测试口径、详细计费规则和可用地区,在现有材料中还看不清。缺少这些信息,技术负责人最多能决定“要不要测试”,还不能决定“要不要迁移”。
Flash Cyber 的处理则更有分量。它没有作为普通 API 全面开放,只通过 CodeMender 向政府和可信合作伙伴限量试点。这等于承认网络安全模型具有明显的双重用途:它能发现漏洞、生成补丁,也可能帮助攻击者更快定位薄弱点。
受限开放是合理的安全闸门,却不是风险已经解决。谁算可信伙伴、模型能接触哪些系统、操作是否留痕、发现高危漏洞后如何披露,都需要治理规则。平台若只控制入口,却无法审计模型执行过程,限制名单很容易沦为一层形式。
接下来真正该盯的变量已经很具体:3.6 Flash 能否在真实任务中降低重试率,Flash-Lite 的 350 token/s 能否在高并发下维持,以及 Google 会不会公布缓存、工具调用和失败任务的完整成本口径。
模型分数还能继续上涨。生产团队只会问一句:同样一件事,它能不能一次做对。
