让大语言模型做一个是否题,或者在五个工单分类里挑一个,行业已经忍受了太久的荒唐代价:为了拿到一个词的标签,系统不得不跑一遍自回归解码循环,按输出 token 付费,再战战兢兢地解析容易崩坏的 JSON 字符串。

MarkTechPost 报道 Liquid AI 发布了专用于结构化决策的非生成式模型 d1,通过单次调用返回预定义选项的概率分布,usage.output_tokens 消耗直接归零。消息迅速在工程师圈子传开,被视作高频判别任务打倒生成式霸权的转折点。但如果仔细核实底层事实与工程表现,事情远没有那么简单。

两种判定范式:自回归解码 vs 零 Token 决策直出 通用 LLM 结构化输出 输入文本 → 自回归逐字解码 → 格式化 JSON 输出计费累加 | 延迟随长度增长 | 格式偶发崩溃 单次判定耗时偏长 非生成式决策模型(d1 范式) 输入状态 → 隐层表征提取 → 分类/指针头映射 0 输出 Token | 单次前向固定延迟 | 强类型约束 固定选项下毫秒级响应

剥离生成的决策模型,与官方口径的脱节

按报道给出的定义,d1 不做文本生成,输入状态和问题后,单次调用即可返回校准概率。它把判定工作收拢为三个原语:判断是非的 Noul、多选一的 Choice,以及定序打分的 Score。三者支持混合调用,目标直指内容审核、工单分流和 LLM-as-judge 等消耗大量 token 的判定场景。

所谓零输出云端接口,源于社区开源原型与论文模型的概念混淆(示意图)
所谓零输出云端接口,源于社区开源原型与论文模型的概念混淆(示意图)

但查验 Liquid AI 官方 FAQ,能看到截然不同的商业现实:官方明确指出目前未提供自营的自助托管 API,模型仅通过 Liquid Playground、OpenRouter、Hugging Face 下载以及特定合作伙伴获取。官方对年营收低于 1,000 万美元的机构免商业使用与微调授权费,根本没有发布过任何基于 token 的自营托管 API 定价。

就连 Liquid AI 官方的基准评测套件 Pipette,也仅用于测试端侧延迟、Prefill/Decode 吞吐与显存占用,标准测试均基于固定输入/输出 token 与贪婪解码,未包含任何零输出 token 决策 API 的官方基准。

这场热议更像是一起生态概念的混淆。2026 年 9 月公开的 arXiv 论文记录了由 flock-io 发布的 2B 参数零输出 token 决策模型 this-that-model-1.0,直接从隐藏状态输出概率并报告 Brier 分数。而在开源社区中,也早已出现基于 Liquid AI 的 LFM2.5-350M 骨干网与 LoRA 微调的决策模型原型 lev-350m。外媒报道的云端 d1:free,极大概率是私有测试合作伙伴的包装,或是社区原型与竞品归属的误传。

零 Token 并非无痛,域外泛化现出原形

抛开商业归属,零输出 token 的技术诱惑是真实的。通用 LLM 把大量算力花在自回归解码的循环里,即使强制使用 JSON Schema 约束,也无法根除长尾延迟。决策模型改回类似传统判别模型的做法:跑完前向传播提取隐藏状态,通过轻量级分类头直接输出归一化数值。

原型在本地芯片上虽达毫秒响应,但域外准确率遭遇断崖暴跌
原型在本地芯片上虽达毫秒响应,但域外准确率遭遇断崖暴跌

但天底下没有免费的午餐。开源社区对基于 LFM2.5-350M 的 lev-350m 原型实测显示,在 M2 Max 上它确实极快,判定 3 个问题耗时 25 毫秒,判定 24 个问题耗时 110 毫秒。然而一旦脱离微调数据的温室,缺陷立刻暴露:该模型在域内测试准确率为 77.3%,但在域外泛化测试中准确率断崖跌至 54.6%,大幅落后于参数量稍大的 kev-0.6b 与云端 Jev。

工程审计:轻量级决策模型的核心硬伤 54.6% 域外泛化雪崩 lev-350m 域内达 77.3% 遇未知分布断崖下挫 难以直接应对多变业务 0.098 Banking77 ECE 预期校准误差劣于基线 输出高分不等于真把握 无信息输入现过度自信 570 ms 竞品 p95 延迟 大分类集基准实测 中位数 267–316 ms 选项数量存在硬上限截断

更深层的工程陷阱在所谓的校准概率。许多工程师误以为模型吐出 0.99 意味着系统拥有 99% 的胜率。事实上,未经过严苛后验校准的归一化数值,仅仅是数学计算的副产物。

输出概率从来不等于置信度,未经校准的确定性不过是自欺欺人。

在对竞品 Jev 的独立置信度审计中,其二元决策预期校准误差(ECE)为 0.050,但在 Banking77 任务上 ECE 扩大到 0.098,实际表现劣于同期的 Gemini 基线。以 5% 误差为阈值实测,Banking77 上的错误率为 3.68%(覆盖率 51.2%),但在 CLINC150 任务上错误率超标至 6.65%(覆盖率 88.3%)。最刺眼的是,在毫无先验信息的掷硬币与掷骰子测试中,模型依然给出了极高的置信分,表现出严重的过度自信。


选项截断与架构三角债

除了概率失真,架构形态本身的约束也相当严苛。在独立基准测试中,同类竞品 Jev 在大型分类集上的中位数延迟为 267 至 316 毫秒,p95 延迟升至 333 至 570 毫秒。更致命的是,非生成式分类网络受制于注意力与指针机制,存在严格的选项数量上限,选项一旦超标便直接拒绝请求;而传统的通用 LLM 即使在单次提示词中塞入 512 个选项,依然可以完成判定。

新型决策模型存在选项硬上限,动态输入超标即直接停机拒载(示意图)
新型决策模型存在选项硬上限,动态输入超标即直接停机拒载(示意图)

技术演进并非单行道,往往是古老逻辑的换壳循环。《淮南子》有言:“夫乘舟而惑者,不知东西,见斗极则忤矣。”在眼花缭乱的新词面前,唯有回归系统本质。

企业在工单分类与违规过滤中寻求降低开销,面前其实摆着三条路:

架构形态吞吐与延迟选项扩展能力维护与校准成本
传统专用编码器 (DeBERTa)毫秒级极速响应极差(仅支持固定死标签)极低(模型小、行为易收敛)
通用 LLM (JSON 约束解码)较慢且显存开销大极强(支持数百个动态选项)较高(需长期监控幻觉与长尾)
新型决策模型 (d1 / Jev)百毫秒级固定前向中等(支持动态选集但有硬上限)极高(需自建 ECE 校验流水线)

对于标签固定、流水线稳定的日均千万级任务,参数量百兆左右的 ModernBERT 或 DeBERTa 早已千锤百炼,不仅推理延迟极低,部署成本也远低于数十亿参数的庞然大物。而对于提示词内选项频繁增减的长尾任务,通用 LLM 的泛化鲁棒性依然无人能及。

新型决策模型真正能立足的狭窄夹缝,仅限于选项数量适中、动态变化、却又无法承担逐字解码开销的特定工作流。

  • 风险.若业务方轻信非生成式模型的自述分数,直接根据阈值截断放行,在遭遇真实世界的数据偏移时,过度自信的概率值极易引发无预警的系统性误判。

把大模型当做百灵鸟,要求它能歌善赋;又把大模型当做算盘,要求它逢问必断。剥离解码机制的探索确实切中了工程痛点,但在轻率地用它重构风控与路由之前,先拿测试集跑一跑 Brier 分数和校准曲线,远比相信一个看似零成本的 API 宣传更靠谱。