让大语言模型做一个是否题,或者在五个工单分类里挑一个,行业已经忍受了太久的荒唐代价:为了拿到一个词的标签,系统不得不跑一遍自回归解码循环,按输出 token 付费,再战战兢兢地解析容易崩坏的 JSON 字符串。
MarkTechPost 报道 Liquid AI 发布了专用于结构化决策的非生成式模型 d1,通过单次调用返回预定义选项的概率分布,usage.output_tokens 消耗直接归零。消息迅速在工程师圈子传开,被视作高频判别任务打倒生成式霸权的转折点。但如果仔细核实底层事实与工程表现,事情远没有那么简单。
剥离生成的决策模型,与官方口径的脱节
按报道给出的定义,d1 不做文本生成,输入状态和问题后,单次调用即可返回校准概率。它把判定工作收拢为三个原语:判断是非的 Noul、多选一的 Choice,以及定序打分的 Score。三者支持混合调用,目标直指内容审核、工单分流和 LLM-as-judge 等消耗大量 token 的判定场景。

但查验 Liquid AI 官方 FAQ,能看到截然不同的商业现实:官方明确指出目前未提供自营的自助托管 API,模型仅通过 Liquid Playground、OpenRouter、Hugging Face 下载以及特定合作伙伴获取。官方对年营收低于 1,000 万美元的机构免商业使用与微调授权费,根本没有发布过任何基于 token 的自营托管 API 定价。
就连 Liquid AI 官方的基准评测套件 Pipette,也仅用于测试端侧延迟、Prefill/Decode 吞吐与显存占用,标准测试均基于固定输入/输出 token 与贪婪解码,未包含任何零输出 token 决策 API 的官方基准。
这场热议更像是一起生态概念的混淆。2026 年 9 月公开的 arXiv 论文记录了由 flock-io 发布的 2B 参数零输出 token 决策模型 this-that-model-1.0,直接从隐藏状态输出概率并报告 Brier 分数。而在开源社区中,也早已出现基于 Liquid AI 的 LFM2.5-350M 骨干网与 LoRA 微调的决策模型原型 lev-350m。外媒报道的云端 d1:free,极大概率是私有测试合作伙伴的包装,或是社区原型与竞品归属的误传。
零 Token 并非无痛,域外泛化现出原形
抛开商业归属,零输出 token 的技术诱惑是真实的。通用 LLM 把大量算力花在自回归解码的循环里,即使强制使用 JSON Schema 约束,也无法根除长尾延迟。决策模型改回类似传统判别模型的做法:跑完前向传播提取隐藏状态,通过轻量级分类头直接输出归一化数值。

但天底下没有免费的午餐。开源社区对基于 LFM2.5-350M 的 lev-350m 原型实测显示,在 M2 Max 上它确实极快,判定 3 个问题耗时 25 毫秒,判定 24 个问题耗时 110 毫秒。然而一旦脱离微调数据的温室,缺陷立刻暴露:该模型在域内测试准确率为 77.3%,但在域外泛化测试中准确率断崖跌至 54.6%,大幅落后于参数量稍大的 kev-0.6b 与云端 Jev。
更深层的工程陷阱在所谓的校准概率。许多工程师误以为模型吐出 0.99 意味着系统拥有 99% 的胜率。事实上,未经过严苛后验校准的归一化数值,仅仅是数学计算的副产物。
输出概率从来不等于置信度,未经校准的确定性不过是自欺欺人。
在对竞品 Jev 的独立置信度审计中,其二元决策预期校准误差(ECE)为 0.050,但在 Banking77 任务上 ECE 扩大到 0.098,实际表现劣于同期的 Gemini 基线。以 5% 误差为阈值实测,Banking77 上的错误率为 3.68%(覆盖率 51.2%),但在 CLINC150 任务上错误率超标至 6.65%(覆盖率 88.3%)。最刺眼的是,在毫无先验信息的掷硬币与掷骰子测试中,模型依然给出了极高的置信分,表现出严重的过度自信。
选项截断与架构三角债
除了概率失真,架构形态本身的约束也相当严苛。在独立基准测试中,同类竞品 Jev 在大型分类集上的中位数延迟为 267 至 316 毫秒,p95 延迟升至 333 至 570 毫秒。更致命的是,非生成式分类网络受制于注意力与指针机制,存在严格的选项数量上限,选项一旦超标便直接拒绝请求;而传统的通用 LLM 即使在单次提示词中塞入 512 个选项,依然可以完成判定。

技术演进并非单行道,往往是古老逻辑的换壳循环。《淮南子》有言:“夫乘舟而惑者,不知东西,见斗极则忤矣。”在眼花缭乱的新词面前,唯有回归系统本质。
企业在工单分类与违规过滤中寻求降低开销,面前其实摆着三条路:
| 架构形态 | 吞吐与延迟 | 选项扩展能力 | 维护与校准成本 |
|---|---|---|---|
| 传统专用编码器 (DeBERTa) | 毫秒级极速响应 | 极差(仅支持固定死标签) | 极低(模型小、行为易收敛) |
| 通用 LLM (JSON 约束解码) | 较慢且显存开销大 | 极强(支持数百个动态选项) | 较高(需长期监控幻觉与长尾) |
| 新型决策模型 (d1 / Jev) | 百毫秒级固定前向 | 中等(支持动态选集但有硬上限) | 极高(需自建 ECE 校验流水线) |
对于标签固定、流水线稳定的日均千万级任务,参数量百兆左右的 ModernBERT 或 DeBERTa 早已千锤百炼,不仅推理延迟极低,部署成本也远低于数十亿参数的庞然大物。而对于提示词内选项频繁增减的长尾任务,通用 LLM 的泛化鲁棒性依然无人能及。
新型决策模型真正能立足的狭窄夹缝,仅限于选项数量适中、动态变化、却又无法承担逐字解码开销的特定工作流。
- 风险.若业务方轻信非生成式模型的自述分数,直接根据阈值截断放行,在遭遇真实世界的数据偏移时,过度自信的概率值极易引发无预警的系统性误判。
把大模型当做百灵鸟,要求它能歌善赋;又把大模型当做算盘,要求它逢问必断。剥离解码机制的探索确实切中了工程痛点,但在轻率地用它重构风控与路由之前,先拿测试集跑一跑 Brier 分数和校准曲线,远比相信一个看似零成本的 API 宣传更靠谱。
