Google推出了Gemini 3.8 Flash。距离上一代Gemini 3.7 Flash发布仅几周,新模型就已上线。Google给出的核心说法是:它会“更努力地工作”,在复杂任务中执行更多推理步骤,并以迭代方式调用工具。
入门价格暂时没有变化:输入Token每百万0.75美元,输出Token每百万3.75美元。可问题在于,模型可能为了提高效果消耗更多Token,尤其是在较高的推理强度下。于是,单价没涨,单次请求的成本却可能上升。原始信息没有提供“平均贵四成”的统一测算,因此更准确的说法是:账单增幅取决于任务复杂度、推理强度和工具调用次数。
Gemini 3.8 Flash把成本变量藏进了推理过程
Gemini 3.8 Flash与3.7 Flash的价格对比如下:
| 项目 | Gemini 3.7 Flash | Gemini 3.8 Flash |
|---|---|---|
| 输入价格 | 每百万Token 0.75美元 | 每百万Token 0.75美元 |
| 输出价格 | 每百万Token 3.75美元 | 每百万Token 3.75美元 |
| 推理方式 | 上一代模型 | 可能执行更多推理步骤、迭代调用工具 |
| 成本风险 | 相对容易按历史用量估算 | 单次请求Token消耗可能增加 |
这类变化的关键,不在价目表,而在“每个任务需要多少Token”。模型内部推理、最终可见回答,以及工具调用产生的输入输出,不能简单混成一个数字。开发者最终要看的,是API返回的usage字段和账单记录,而不是模型回答看起来有多长。
Google的产品逻辑并不难理解。复杂任务需要更多计算,模型多想几步,往往能提高规划、代码修改或多工具协作的成功率。问题也同样直接:如果每次请求都多消耗一截Token,原先按3.7 Flash制定的预算就会失真。
这与传统“升级后单价下降”的模型竞争不同。过去开发者换新模型,通常先比较每百万Token价格,再用基准测试评估效果。Gemini 3.8 Flash把另一个变量推到了台前:模型是否会主动增加工作量,以及这部分工作量如何计费、如何被控制。
受影响最大的是Agent团队,不是偶尔聊天的用户
普通用户偶尔调用一次模型,未必会明显感受到差异。真正承压的是持续运行的API服务,尤其是会检索资料、读写文件、调用数据库或执行代码的Agent。
这类系统一次任务可能包含多轮模型请求。模型每多做一轮规划,工具每多返回一段内容,后续请求就可能继续携带更长的上下文。单次增加并不可怕,累积到每天数万、数十万次调用时,月度账单会偏离原来的估算。
Gemini 3.8 Flash目前仍提供了一个相对稳妥的选择:希望控制Token用量的开发者,可以继续使用Gemini 3.7 Flash。这个安排很重要,因为它给团队留出了迁移测试的时间,也避免了新模型一上线就迫使所有生产流量切换。
对开发者而言,现实动作不是立刻迁移,也不是因为价格没变就放心扩大调用量。更合理的做法是:
- 用真实业务样本同时跑3.7和3.8,而不是只看公开基准;
- 记录每个任务的输入、输出和总Token变化;
- 为可接受延迟和成本的场景使用较低推理强度;
- 给最终输出设置上限,并监控异常增长的工具调用;
- 先让新模型处理低风险流量,再决定是否替换生产模型。
这里还有一个容易被忽略的限制:较高推理强度未必适合所有任务。简单分类、格式转换、短文本摘要,本来就不需要模型反复规划。让模型在这些任务上“多想几步”,可能只增加延迟和费用,却没有相应收益。
历史上,云服务商常把更强能力包装成更高单价;推理模型则把成本进一步拆成了“模型单价”和“思考工作量”。Gemini 3.8 Flash仍采用原有价格,只能说明Google在推广阶段没有直接抬高费率,不能说明开发者的总成本保持不变。
接下来最该观察的不是宣传语里的“works harder”,而是三个具体数字:同一任务的总Token、工具调用次数,以及成功完成任务所需的平均请求轮数。只有当效果提升足以抵消这些额外消耗,3.8 Flash才算真正便宜;否则,它更像是一款把计算成本转移到账单细节里的升级版。
