9月2日,Simon Willison更新了他维护的开源工具llm-gemini到0.34版本。这是一款让开发者用统一命令行调用各家大模型的Python库,更新本身很平淡:加入对Google新模型Gemini 3.8 Flash的支持,外加一个社区贡献者提交的bug修复。

但顺着这行更新日志往下查,会发现Google官方发布页里藏着两个更值得说清楚的问题:新模型的"low/medium/high"思考等级很容易被误认成分级计费,事实并非如此;Google公布的基准跑分里,同一模型在Terminal-Bench新旧两个版本上的成绩相差了70个百分点,这暴露的不是模型能力问题,而是评测口径本身的问题。

插件更新是小事,计价误解才是大事

llm-gemini这次加入的gemini-3.8-flash注册了三档thinking level:low、medium、high。这是2025年后Gemini、OpenAI、Anthropic几家不约而同采用的设计范式——让开发者在推理深度和成本之间自己权衡,而不是让模型每次都全力思考再回答。

插件层面唯一遗漏的是"minimal"档位,官方文档显示3.8 Flash的API默认等级是medium。这个细节不大,但决定了开发者如果不手动调整,实际拿到的就是中等思考力度,而不是最省钱的那一档。

"思考等级"不是价目表,是账单的间接结果

容易踩坑的地方在这里:low、medium、high听起来像三档定价,但Google官方明确说了不是这样。thinking level本质是"相对努力程度",不是固定token预算,费用差异完全来自模型实际产生的输出和思考token数量——选了high档不代表账单一定翻倍,选了low档也不保证省钱,一切要看模型这次到底"想"了多少。

真正会让账单变化的,是另一件事:Gemini API标准付费层的价格本身要涨。

时间段输入价格(每百万token)输出价格(含思考token)
2026年12月31日前$0.75$3.75
2027年1月1日起$1.50$7.50
Gemini API 标准定价(美元/百万token) 2026年底前 · 输入 $0.75 2026年底前 · 输出 $3.75 2027年起 · 输入 $1.50 2027年起 · 输出 $7.50
  • 提醒.2027年起输入输出价格都翻倍,Flash系列"低成本"的定位对高频调用的产品团队会明显吃紧,现在做预算模型的开发者最好把这个时间点算进去。

跑分里的裂缝:同一模型两个成绩

Google在发布页公布了一批基准分数,其中最扎眼的不是哪项高,而是Terminal-Bench这一项在新旧版本上的表现——2.1版本拿到89.4%,换到4.0版本只有19.1%,落差70个百分点。

Gemini 3.8 Flash 官方基准分数 DeepSWE v1.1 71.0% Terminal-Bench 2.1 89.4% Terminal-Bench 4.0 19.1% HLE-Verified 54.9% OSWorld 2.0 59.0% 同一系列基准(Terminal-Bench)新旧版本分差达70个百分点

Google没有公布low、medium、high各自的跑分——所有数字都来自单一评测配置。这意味着现在流传的分数只能说明这个模型在某种思考强度下的表现,换一档未必是同一个数字。同一个基准换个版本就能差出70个百分点,说明测评体系本身还没稳定下来,厂商展示的往往是对自己更有利的那个版本。

跑分好看与否,先看它用的是哪把尺子。

谁真正该在意这次更新

真正落到实际生产的,反倒是那个不起眼的bug修复。此前llm-gemini的异步实现无法正确记录API返回的具体模型版本,这个问题由贡献者Charlie Tonneslan通过PR#137修复——方法是调用response.set_resolved_model(),直接用API返回的modelVersion字段回写。

对做异步批处理、多模型对比测试的开发者来说,这不是小事:如果日志里记录的模型版本是错的,后续做成本核算和调试时根本对不上账,查了半天可能查错了模型。这类工具链细节修复,靠的是开源社区里维护者和贡献者的日常协作,和模型本身能力没关系,但决定了开发者用这套工具能不能放心跑生产环境。

接下来值得盯的是两件事:Google是否会补上low/medium/high三档各自的独立跑分,以及其他工具库比如LangChain、LiteLLM是不是会跟进同样的思考等级支持和模型版本记录修复。这两件事,比一条版本更新日志本身重要得多。