开源分析工具厂商 PostHog 在 GitHub 上放出了决策模型项目 Jeeves 的权重与训练代码。这套基于 Qwen3.5-9B 与 LoRA 指针头的模型,宣称打破了 Jev 类分类器准头不足的宿命,在 JevBench 公开测试中刷出了 0.935 的高分,并将推理机制与扩散草稿器塞进了一套兼容接口里。
但在热闹的开源跑分之下,这更像一场把多方实验数据拼贴在一起的指标包装。当网关分类器从数十毫秒拉长到秒级响应,它试图解决的问题与它制造的新麻烦一样沉重。
0.935 高分背后的指标挪用
在工业级 Agent 系统的流水线里,Jev 与 Kev 这类受约束决策模型往往扮演交通警察的角色。它们不负责长篇大论,只输出强类型、经过概率校准的判断,比如二元状态、多选路由或风险打分。为了解决分类准确率偏低的痛点,Jeeves 宣称引入强化学习算法 CISPO 与思维链机制,实现了大幅跃升。

然而顺着开源基准顺藤摸瓜,数据口径迅速出现了裂痕。
在 JevBench 公开测试子集上,Open-Jev 9B 官方公布的标准成绩实为 179/231,换算准确率仅为 77.49%,远未触及 0.935。
进一步核对发现,0.935 实际上是第三方 jev-judge-mcp 评测中针对 92 个分类兼容子集跑出的自动覆盖率,而非 Qwen3.5-9B 模型的基准准确率。项目方把覆盖率数值平移为模型在公开测试集上的综合准确率,放大了成果。
训练方法的渊源同样存在移花接木的痕迹。Jeeves 声称借助 CISPO 强化学习方案提升决策质量,但查阅 CISPO 原始论文可以发现,该算法主要应用于 Qwen3-8B 的议价博弈任务,Qwen3.5-9B 在那项研究中仅充当未经微调的零样本议价基线。项目把议价博弈的强化学习标签贴在结构化分类上,更多是在利用开源社区的认知差进行拼装。
扩散草稿器挽救不了的时延代价
抛开跑分注水,Jeeves 在工程架构上做了一次颇具野心的尝试:给分类器装上思维链。

原本这类模型的使命是用最快速度完成分流。Jeeves 强行在做出最终决策前插入一段思考过程。为了压制由此失控的生成延迟,工程团队借用了类似 DEER 方案的思路,设计了针对 Gated DeltaNet 架构的 4-block 扩散草稿器,让掩码标记跨层并行出词,打破传统自回归投机解码的时序依赖。
即使拿出一整张英伟达 H100 显卡,并在投机解码的加持下,Jeeves 开启思考后的中位延迟依然从 0.3 秒飙升到 3.3 秒,其 p90 尾部延迟更是拉长到了 17.1 秒。
延迟放大十倍的网关,已经退化成了它原本想要替代的重型系统。
工业网关最忌讳不可预测的尾部延迟。一旦一个简单的路由判断需要十几秒才能得出,原本作为低成本流水线守门员的架构优势就荡然无存。
词法偏见与落地边界
跳出跑分与速度的表象,更深层的瓶颈在于决策模型的泛化能力。

在真实的分布外测试中,各家模型的成色差异明显。在不超过 5% 错误率的高可信拦截要求下,Jev 取得了 0.211 的 Brier 分数和 70% 的自动化覆盖率;相比之下,Kev-9B 的 Brier 分数为 0.264,自动化覆盖率仅有 45%。即便 Kev-9B 经过温度缩放后的校准误差略有降低,其在不确定性场景下的可用性依然落后。
更棘手的是这类受约束模型普遍存在的词法偏见。多项研究表明,当提示词给定了选项名称与冗长的判别规则时,模型往往过度依赖标签本身的字面含义,而不是细致匹配背后的逻辑边界。一旦开发者定义的枚举名称稍带歧义,决策模型就会产生结构性偏航。
- 风险.如果团队仅仅需要确定性的高吞吐分类,使用微调过的 NLI 模型或现代 Reranker 头,在延迟和稳定性上往往显著优于 9B 级别的生成式思考模型。
在当前的 JevBench v1.4.2 官方榜单中,评测已经转向结合机会校正与密封条目的新计分法。在这套排除了公开子集过拟合的规则下,Jev 1.13.0 位列第 2 名,得分仅为 63.29,而该榜单甚至尚未正式收录 Kev-9B。
开源项目追求亮眼的指标无可厚非,但在企业级控制平面的真实战场上,稳定的概率校准、毫秒级的吞吐和抗漂移的规则执行,远比拼凑出来的 0.935 更加切实际。
