一个命令行工具换了默认模型,单次调用可能只多花几厘钱。可一旦脚本跑上几百万、几千万 token,默认值就不再是产品细节,而是账单的一部分。

Simon Willison 的 LLM CLI 在 2026 年 7 月发布了 0.32rc2 候选版。它修复了一个依赖问题,也做了两项方向相反的改动:替部分用户选了更贵的模型,同时让开发者更容易绕开预设模型,直接连接任意 OpenAI 兼容端点。

未设默认模型的人,调用单价变了

安装或升级到 rc2 后,没有自行设置默认模型的用户,默认模型会从 GPT-4o mini 变成 GPT-5.6 Luna。

已经设过默认值的人不受这项变更影响。rc2 也是预发布版本,发布说明本身不会让所有现有安装自动迁移;是否碰到变化,要看用户有没有主动安装或升级这个候选版。

价格差异很直接:

模型每百万输入 token每百万输出 token适合的取向
GPT-5.6 Luna0.20 美元1.20 美元默认的新选择,发布说明称其更新、更强
GPT-4o mini0.15 美元0.60 美元原默认模型,输出价格更低
GPT-5 nano0.05 美元0.40 美元更偏向压低调用成本

Luna 的输出单价是 4o mini 的两倍。输入端差距较小,每百万 token 贵 0.05 美元。

假设一项批处理任务消耗 1000 万输入 token、100 万输出 token,按表中单价静态计算:

  • 4o mini.2.10 美元
  • Luna.3.20 美元
  • GPT-5 nano.0.90 美元

这只是账面示例,不能直接推断实际账单会按固定比例上涨。模型的输出长度、任务成功率和重试次数都会改变总成本。更强的模型如果少跑几次,反而可能更便宜。

“更强”目前也是发布说明给出的评价,不等于已经有长期、独立的基准测试。rc2 刚进入候选阶段,能力收益是否覆盖价格差,仍要看具体任务。

不想接受新默认值,可以明确切回:

BASH
llm models default gpt-4o-mini

或者改用更便宜的 GPT-5 nano:

BASH
llm models default gpt-5-nano

如果你用 LLM 跑定时脚本、批量摘要或数据清洗,升级前最实际的动作不是争论哪个模型“更先进”,而是把默认模型固定下来。交互式试用可以随手切,自动化任务不该把预算交给版本更新。

兼容端点直连,少了一层配置负担

rc2 新增了 llm openai endpoint 命令。开发者无需预先在 LLM 中配置模型,就能对任意 OpenAI 兼容端点运行提示、聊天和模型列表请求。

它尤其适合两类场景:

  • 在 LM Studio 中测试本地模型;
  • 频繁切换第三方 OpenAI 兼容服务,不想为每个端点单独建配置。

发布说明给出的示例,是通过 uvx 调用 LM Studio 的本地端点:

BASH
uvx --pre llm openai endpoint http://127.0.0.1:1234/v1 \
  T llm_version -T llm_time --td \
  -m google/gemma-4-31b 'what is the current LLM version? And the time?'

这里的“免安装”要说准确些:uvx --pre 会临时下载并运行预发布软件包,用户不用长期安装 LLM,但软件并没有凭空消失。

这些调用也不会写入 LLM 自己的日志。可这不等于请求绝对私密。若连接远端服务,端点运营方仍可能记录提示、响应、IP 或账户信息;认证要求也由端点服务方决定。命令减少的是配置步骤,不是安全边界。

兼容性同样不能只看 URL。很多服务都声称支持 OpenAI 接口,但工具调用、流式输出、错误格式和模型列表仍可能存在差异。这个命令让测试更快,并不保证所有“兼容端点”表现一致。

默认值控制消费,开放接口争夺入口

我更在意这两个改动放在一起形成的反差。

更换默认模型,是工具作者替没有表态的用户做选择。开放兼容端点,则把模型和服务商的选择权交还给用户。一个增加代办,一个减少束缚。

软件史上,默认值从来不是中性的。浏览器默认搜索引擎之所以值钱,不是因为用户不能修改,而是多数人根本不会修改。这里的利益结构不完全一样:LLM CLI 没有因此被证明能从 Luna 调用中分成,但默认模型确实会把真实流量和真实费用导向某个选项。

“天下熙熙,皆为利来。”放到开发者工具里,未必意味着作者逐利,却提醒我们盯住结果:谁决定默认值,谁就在影响需求流向。

这次默认模型调整并非强制迁移,而且提供了清楚的退出命令,做法不算蛮横。问题在于,能力升级和成本上升被绑在了同一个默认动作里。对于偶尔问几句话的人,差价近乎无感;对于无人值守的脚本,沉默就可能变成持续付费。

相比之下,llm openai endpoint 是更扎实的进步。OpenAI 兼容接口已经成为模型服务之间事实上的通用语言之一。谁能让本地模型、云端 API 和第三方服务切换得更轻,谁就更接近真正的工具入口,而不是某一家模型的附属客户端。

接下来该看的变量很具体:Luna 在真实任务中能否靠更高成功率抵消价格差,以及不同兼容端点在工具调用和流式输出上到底有多“兼容”。前者决定默认值是否合理,后者决定开放入口是不是只停留在命令行表面。