开发者 Jared Palmer 正式开源了决策模型家族 Kev。这套基于 Qwen3.5 底座构建的轻量级模型包含 0.8B、4B 与 9B 三种规格,采用 Apache-2.0 协议开放了全部权重、训练代码与固化评测集。它不写文章、不做长文本总结,也不生成任何一个传统的自回归 Token,而是专为分类、审核、工单分发与状态评分而生的非生成式判决工具。

Kev 的直接对标对象,是 TypeSafe AI 在 2026 年 9 月 15 日推出的商业闭源模型 Jev。后者凭借非生成式的 System One 架构,把单次决策成本压到了每百万输入 Token 仅 0.042 美元,并宣称在特定工作流中比传统通用大语言模型快 193.6 倍、成本降低 444.6 倍。Kev 的出现证明了一件事:在工作流管线里,用庞大的生成式大模型配合 JSON 结构化输出本就是一种巨大的算力浪费;而构筑这种毫秒级决策壁垒,并不需要不可见的数据黑盒。

工作流路由机制演进:自回归生成 vs 指针判决 传统方式:自回归大模型 + 结构化约束 Prompt + JSON Schema / 正则掩码 • 逐 Token 解码,高延迟与计算冗余 • 输出固定标签,无从获取真实置信概率 • 单次请求成本高,上下文易受 prompt 污染 Kev 方案:底座表征 + 专用指针头 单次前向编码 + Pointer Head 分布计算 • **零 Token 生成**,直接输出 Softmax 概率 • 支持 choice 多选、noul 布尔与 score 打分 • H100 下五问并行仅数十毫秒,API 完全兼容

万级数据拉起的平替,逼近专有壁垒

长期以来,开发者为了在代码管线中获得确定性的枚举值,不得不搬出 8B 甚至 70B 的自回归模型,再挂上 Outlines 这类语法掩码库。这种做法不仅延迟常常高达数秒,而且强行生成的 JSON 字符串抹平了模型内部真实的概率分布。读者很难获知模型判定退货的把握究竟是 99% 还是 51%。

Kev 完全兼容 TypeSafe 的 System One API 规范。它在冻结的基础模型顶端挂载 Rank-16 的 LoRA 适配器和一个轻量指针头,将文本与判定项的隐层状态进行点积运算,经过 Softmax 后直接给出概率与置信度。

令人惊讶的是这套系统所需的训练代价极低。其核心训练集 decision-v7 仅包含取自 10 个公开数据源的 10,000 条样本,外加 2,576 条程序生成的策略结构数据,且全程未蒸馏任何 Jev 的商业输出。实验显示,在 4B 参数量级上盲目堆砌通用语料反而会损伤域外迁移能力;反倒是调低学习率以完整保留底座预训练知识,取得了更好的泛化效果。

域外基准测试表现与校准度横向对比 (transfer-v4) 准确率 (越高越好) Jev 闭源: 0.857 Kev-9B: 0.812 Kev-4B: 0.794 Brier 校准分 (越低越好) Jev 闭源: 0.211 Kev-9B: 0.291 Kev-4B: 0.316

在域外测试集上,Kev-9B 取得了 0.837 准确率0.243 Brier 分数,相较旧代基于 Qwen3 的 Kev-8B 提升了 7.3 个百分点。而在基准 transfer-v4 开发集测试中,商业专有的 Jev 准确率为 0.857、Brier 评分 0.211;Kev-9B 录得 0.812 与 0.291,Kev-4B 则录得 0.794 与 0.316。尽管商业标杆在整体校准度上依旧占优,但在完全无依据的不可知问题压力测试中,Kev-9B 仅在 5% 的极端案例中给出大于等于 0.9 的过度自信错判,不仅碾压了前代 Kev-8B 的 26%,甚至反超了 Jev 的 9%。

判决模型剥离了文字创作的幻觉,却无法免除概率本身的盲区。

线性注意力的两难:架构创新背刺了端侧延迟

底座换装并非没有代价。从 Qwen3 切换到 Qwen3.5,带来精度红利的同时,也给部署带来了工程麻烦。

上一代基于纯 Transformer 注意力机制的模型,可以通过精巧的 block-attention 掩码,将主文本与多道互不干扰的评测问题塞进同一个 Token 序列处理。然而 Qwen3.5 引入了 Gated DeltaNet 线性注意力混合层。这种递归结构完全无视传统的注意力掩码,极易导致不同业务问题之间发生信息串扰。

为了守住隔离防线,Kev 最终选择将共享的主状态单次前向编码后,在内存中并行切分为独立的因果行计算。这套方案在数据中心表现强悍:在英伟达 H100 显卡搭载 flash-linear-attention 算子时,单次处理 5 个问题的请求耗时仅需数十毫秒。

但在消费级硬件上情况急转直下。由于苹果生态缺少专门针对 DeltaNet 架构优化的底层内核,在搭载 M5 芯片的 Mac 上以 bf16 运行,Kev-4B 耗时达到 779 毫秒,9B 版本甚至需要大约 2 秒。反观采用旧版 Qwen3 纯注意力架构的模型,在相同硬件上的响应仅需 174 毫秒与 300 毫秒。对于指望在本地端侧搭建亚秒级路由器的开发者而言,这无疑是一次架构演进带来的性能倒退。


格式正确绝非事实无误

很多工程团队对决策模型的狂热,源于所谓的零幻觉承诺。但开发者必须分清类型安全与事实正确之间的红线。指针网络能确保输出绝对符合预设的数据结构,并不意味着它的业务裁决无懈可击。

第三方审计揭示了这项技术当前最隐蔽的缺陷:选项顺序敏感性。在 400 组二选一压力测试中,商业模型 Jev 做到了 0% 的选项颠倒翻转,而 Kev-4B 出现了 8% 的决策翻转,Kev-9B 也有 3% 的翻转率。这意味着仅仅改变提示词里备选项的前后顺序,部分工单的去向就会截然相反。

此外,当工程师将原本的布尔判断改写为选择题语法时,模型的置信度平均位移高达 0.125。更致命的是,若开发者在配置规则时忘记显式声明弃权选项,面对语义模糊的输入,模型在高达 79% 的测试场景下会偏向带有刻板倾向的默认选项。

  • 提醒.绝不能将置信度数值直接作为无人工干预执行的门限,缺乏兜底机制的硬编码路由极易在长尾样本中引发系统性穿透。

TypeSafe 官方宣称 Jev 端到端延迟在 70 至 500 毫秒之间,但其公布的基准测试大多依赖内部合成数据,并以大模型共识而非真实业务客观事实作为校准标准。Kev 最大的价值不仅在于提供了一个免费可审的本地替代品,更在于它揭穿了判决模型的光环:未来的可靠架构,既不会是大语言模型的大包大揽,也不会是非生成判决模型的单兵突进,而是一层轻量判决分流、外加严密规则兜底的联合防线。