一家叫 Experiential Labs 的公司,把内部用来省模型调用钱的工具开源了。这个项目叫 World Model Optimizer(简称 WMO),核心卖点是一句话:用你已经在收集的代理运行轨迹,训练出一个持续变强的模型服务端点。官方口径是"接近前沿模型质量,成本降低40%以上"。

截至发稿,项目在 GitHub 上有 136 星、12 fork,还处于刚起步、没被大规模验证的阶段。它的价值不在于"又出了个厉害的小模型",而在于把路由、蒸馏、代理运行时优化这三件通常分开做的事,串成了一条能持续迭代的流水线。这是它和一般路由工具的根本区别。

WMO到底做了什么

流程不复杂。pip install 装好 CLI,注册模型供应商,用 OpenTelemetry 格式的历史轨迹跑 wmo build

接下来 wmo optimize route sweep 拿轨迹里的任务,给每个已注册模型打分。wmo optimize route fit 把打分结果拟合成路由策略,wmo serve 把它变成可调用的端点。

WMO三步走:从轨迹到服务端点 1. 采集轨迹 traces.jsonl OTel 格式 2. 评测拟合 route sweep route fit → policy.json 3. 部署服务 wmo serve 对比基线模型出报告

除了路由,还有几条支线。wmo optimize model 把大模型蒸馏成小模型加入池子。wmo optimize route pin 可以退化成单模型直连。wmo optimize harness 优化代理本身的提示词和工具调用,每个候选版本都要过同一批模拟任务的评测门槛才能转正。

普通模型路由器按价格或规则分流,一次性决策,不管历史反馈,也不碰模型本身。WMO 多做的是拿历史轨迹持续拟合策略,再用模拟评测反复筛版本:

维度普通模型路由器WMO
决策依据价格 / 规则历史轨迹拟合的策略
反馈机制单次决策持续模拟评测
模型优化不涉及支持蒸馏小模型
Harness优化有,需过评测门槛才转正

"降本40%"是谁的账

README 里"frontier quality with 40%+ lower cost"这句话,目前只有项目方自己的表述。没有公开的基准数据集,没有任务分布说明,也没看到第三方复现。

这个数字能不能落到你头上,取决于三件事:你自己积累的轨迹够不够多,任务分布够不够典型,评测标准是不是真的贴近生产场景。不是一个可以直接照搬的通用结论。

部署上还有几个容易被忽略的条件。默认开启匿名使用遥测,可以用 wmo config telemetry disable 关掉。托管平台 platform.experientiallabs.ai 管理模型和沙箱凭证。本地跑 E2B 沙箱评测要自己申请 E2B_API_KEY

这些不是拦路虎,但决定了接入这套工具本身也有成本。至于开源许可证的具体条款、轨迹数据是否会外传、路由策略失效后的回退机制,README 里没有细说,目前还看不清,接入前值得自己再确认一遍。

两类团队接下来怎么办

正在控制多模型调用成本的 Agent 开发团队,如果已经用 OpenTelemetry 收集了轨迹、调用账单确实肉疼,值得拉下来跑一次 wmo buildroute sweep,用自己的真实任务测一遍,看拟合出的策略是不是真比现在的路由省钱。调用量不大、轨迹积累不够的团队,不用急着接入,先把轨迹攒够再说。

负责模型评测、路由与推理基础设施的工程负责人,接入前先确认许可证条款、遥测默认开启和 E2B/API 凭证这几个部署条件,再判断能不能进生产环境。40%这个数字目前没有第三方复现,不适合直接写进内部汇报当结论,得用自己的任务集复测一遍再下判断。