Google DeepMind在8月13日推出Gemini 3.7 Flash,距离上一代3.6 Flash发布只过了三周,价格却砍到3.6 Flash的一半——每百万输入token 0.75美元,输出3.75美元。跑分表上,从代码生成到长文档理解全线上涨,官方把这轮更新包装成"开发者反馈驱动的算法创新"。但翻开完整的技术规格和定价条款会发现,这更像一场抢时间窗口的价格战:便宜是有截止日期的,而宣传中最大的卖点——百万token上下文——官方给出的实测证据只覆盖到八分之一。

三周一迭代,不是常规节奏

Google最近半年的Flash系列发布明显在提速:3.5 Flash-Lite、3.5 Flash Cyber、3.6 Flash、3.7 Flash依次登场,这一轮间隔缩到三周。Flash系列的定位一直是agentic coding和企业自动化场景里性价比最高的那档模型,和OpenAI、Anthropic在小模型上打的其实是同一场仗:谁能用更低的推理成本喂饱开发者对编码智能体的胃口。三周一迭代,比起过去动辄数月的模型更新节奏,更像是一场提前抢占开发者心智的加速赛。

Flash系列发布节奏 3.5 Flash-Lite 3.5 Flash Cyber 3.6 Flash 3.7 Flash 仅隔3周 半价首发

跑分全线上涨,没写出来的部分更值得看

3.7 Flash在软件工程类基准上进步明显:FrontierCode 1.1从34.4%提到43.6%,DeepSWE v1.1从49.0%涨到65.3%,WebDev Arena Elo从1538升到1588,这些是官方博客图表里给出的数字。真正没上图的几项反而更说明问题:Terminal-bench 2.1从78.0%冲到85.8%,更难的Terminal-bench 3.0从5.4%涨到14.9%;计算机操作能力(OSWorld 2.0)从33.8%跳到47.9%,是全部提升项里增幅最大的一块。

  • 结论.计算机操作能力涨得最猛,说明这次更新的重心是"能替人干活",不是单纯拼智力测试分数。

上下文缺口是最该留意的地方。官方反复强调百万token上下文窗口(1,048,576 tokens),但公布的长上下文基准MRCR v2只测了12.8万token这一档,成绩97.0%对91.8%。100万token场景下模型表现如何,官方没给出任何数字,中间隔着近八倍的差距。另一个细节是,官方博客里DeepSWE v1.1给3.6 Flash标的分数是49.0%,而模型卡里同一项写的是48.6%——差距不大,但说明厂商自己不同发布材料的口径都未必统一。

  • 提醒.厂商自报跑分未经第三方复现,1M上下文的真实表现仍是空白,重度长文档场景建议自测再上生产。

半价是让利还是钓鱼,定价条款写得很明白

模式现价(输入/输出,每百万token)2027年起
Standard$0.75 / $3.75$1.50 / $7.50
Batch$0.375 / $1.875同步翻倍
Flex$0.375 / $1.875同步翻倍
Priority$1.35 / $6.75同步翻倍

现价标注为"introductory",明确写只到2026年底。2027年1月1日起,Standard模式价格直接翻倍,上下文缓存费率也从0.075美元/百万token涨到0.15美元。换句话说,现在锁定的低价是一个带截止日期的窗口,不是长期承诺。

降价换的是用户粘性,不是永久让利。

对正在用Harvey做法律检索、用Hebbia做金融文档分析、用LangChain搭agent流程的团队来说,这半年是最便宜的窗口,但成本模型要按明年翻倍的价格提前算一遍,不能只按现在的报价做长期预算。

关键跑分:3.7 Flash提升幅度 FrontierCode 1.1 43.6% DeepSWE v1.1 65.3% Terminal-bench 2.1 85.8% Terminal-bench 3.0 14.9% OSWorld 2.0 47.9%

该迁移的人和该等等的人

Google把这次更新也塞进了Gemini Spark——面向Google AI Pro/Ultra订阅用户、覆盖超过160个国家的24小时个人智能体,用来处理Workspace里的文件整理、邮件起草这类多步骤任务。对普通订阅用户,这是免费到手的体验升级,不用做选择。

对开发者和企业客户,判断要落到具体场景:如果业务重度依赖代码生成、debug、UI还原这类中短上下文任务,半价窗口值得现在就迁移测试;如果核心诉求是百万token级别的长文档或长代码库处理,官方证据链还没补上,最好先拿自己的真实数据集跑一轮,再决定要不要把生产流量切过去。