一家叫 Experiential Labs 的公司,把内部用来省模型调用钱的工具开源了。这个项目叫 World Model Optimizer(简称 WMO),核心卖点是一句话:用你已经在收集的代理运行轨迹,训练出一个持续变强的模型服务端点。官方口径是"接近前沿模型质量,成本降低40%以上"。
截至发稿,项目在 GitHub 上有 136 星、12 fork,还处于刚起步、没被大规模验证的阶段。它的价值不在于"又出了个厉害的小模型",而在于把路由、蒸馏、代理运行时优化这三件通常分开做的事,串成了一条能持续迭代的流水线。这是它和一般路由工具的根本区别。
WMO到底做了什么
流程不复杂。pip install 装好 CLI,注册模型供应商,用 OpenTelemetry 格式的历史轨迹跑 wmo build。
接下来 wmo optimize route sweep 拿轨迹里的任务,给每个已注册模型打分。wmo optimize route fit 把打分结果拟合成路由策略,wmo serve 把它变成可调用的端点。
除了路由,还有几条支线。wmo optimize model 把大模型蒸馏成小模型加入池子。wmo optimize route pin 可以退化成单模型直连。wmo optimize harness 优化代理本身的提示词和工具调用,每个候选版本都要过同一批模拟任务的评测门槛才能转正。
普通模型路由器按价格或规则分流,一次性决策,不管历史反馈,也不碰模型本身。WMO 多做的是拿历史轨迹持续拟合策略,再用模拟评测反复筛版本:
| 维度 | 普通模型路由器 | WMO |
|---|---|---|
| 决策依据 | 价格 / 规则 | 历史轨迹拟合的策略 |
| 反馈机制 | 单次决策 | 持续模拟评测 |
| 模型优化 | 不涉及 | 支持蒸馏小模型 |
| Harness优化 | 无 | 有,需过评测门槛才转正 |
"降本40%"是谁的账
README 里"frontier quality with 40%+ lower cost"这句话,目前只有项目方自己的表述。没有公开的基准数据集,没有任务分布说明,也没看到第三方复现。
这个数字能不能落到你头上,取决于三件事:你自己积累的轨迹够不够多,任务分布够不够典型,评测标准是不是真的贴近生产场景。不是一个可以直接照搬的通用结论。
部署上还有几个容易被忽略的条件。默认开启匿名使用遥测,可以用 wmo config telemetry disable 关掉。托管平台 platform.experientiallabs.ai 管理模型和沙箱凭证。本地跑 E2B 沙箱评测要自己申请 E2B_API_KEY。
这些不是拦路虎,但决定了接入这套工具本身也有成本。至于开源许可证的具体条款、轨迹数据是否会外传、路由策略失效后的回退机制,README 里没有细说,目前还看不清,接入前值得自己再确认一遍。
两类团队接下来怎么办
正在控制多模型调用成本的 Agent 开发团队,如果已经用 OpenTelemetry 收集了轨迹、调用账单确实肉疼,值得拉下来跑一次 wmo build 加 route sweep,用自己的真实任务测一遍,看拟合出的策略是不是真比现在的路由省钱。调用量不大、轨迹积累不够的团队,不用急着接入,先把轨迹攒够再说。
负责模型评测、路由与推理基础设施的工程负责人,接入前先确认许可证条款、遥测默认开启和 E2B/API 凭证这几个部署条件,再判断能不能进生产环境。40%这个数字目前没有第三方复现,不适合直接写进内部汇报当结论,得用自己的任务集复测一遍再下判断。
