大模型赛道打了几年,大家似乎默认了一个前提:模型必须滔滔不绝。哪怕你只需要一个简单的二选一判断,自回归模型也要在后台慢慢吐出一串可能格式破碎的 JSON,再按高昂的输出单价向你按字收钱。

TypeSafe AI 上周推出的 Jev 砍向了这个惯性。这是一种被称为决策模型(Decision Model)或快思考系统(System One)的新形态:输入文本或半结构化状态,输出只给浮点数,不吐出任何一段自然语言。它的输入价格定在 0.042 美元 / 百万 Token,输出完全免费,甚至比 OpenAI 的轻量级模型 GPT-5 Nano(0.05 美元 / 百万 Token)还要便宜。

Jev 与传统自回归 LLM 的生成逻辑差异 传统自回归 LLM 状态与提示词输入 逐字生成文本或结构化 JSON 输出计费高昂,延迟随长度递增 Jev 决策模型 单文档状态 + 多问题并发输入 直接映射为概率与分值等浮点数 输出免费,输入 0.042 美元/MToken

把复杂的语言生成退回为纯粹的判别打分,表面看是一笔划算的工程减法。但当人们为低廉的调用账单欢呼时,真正棘手的问题才刚刚浮出水面。

扔掉嘴巴的判别器

主流大模型在工业落地时有三大顽疾:输出延迟不可控、生成内容有幻觉、JSON 解析经常在半夜崩溃。

模型彻底切断了自然语言输出,仅返回纯数字构成的打分结果(示意图)
模型彻底切断了自然语言输出,仅返回纯数字构成的打分结果(示意图)

Jev 解决这套问题的方式粗暴直接:不给模型开口说话的机会。用户向它的接口提交一个状态对象(一篇文章、一段用户日志或一份键值对记录),然后附带一个或多个问题。模型内部并行评估所有问题,耗时不会随问题数量线性暴增,返回结果全是由纯数字构成的数组。

它的接口支持三类问题:

  • Noul 问题.取名自伯努利分布,接收陈述句并返回 0 到 1 之间的概率值,用来回答是非判断。
  • Choice 问题.在给定的几个选项中做单选,返回带有置信度的概率分布。
  • Score 问题.用户定义数值区间与分级描述,模型返回该范围内的具体浮点分数。

早期尝试者迅速把它接入垃圾邮件过滤、内容打标以及搜索重排流程。典型做法是先用成本极低的 BM25 算法粗筛出 100 个候选结果,再让 Jev 对这 100 个结果逐一打分排序。开源社区甚至借此搭建了用浮点数预测下一步走向的 jevchat、实现纯打分补齐的 jev-leftpad,以及跑在数字概率上的 jev-2048 游戏。

但这种热闹更像是一场对极低 Token 单价的技术狂欢。

百万 Token 标价对比(美元) Jev(输入) $0.042 / MToken(输出完全免费) GPT-5 Nano(输入) $0.050 / MToken(输出需额外计费)

算账不能只看 Token 标价

很多工程师看到 0.042 美元的输入单价,就认定重排系统的成本可以原地下降一个数量级。这种乐观忽略了实际生产链路中的开销结构。

生产环境中的时延毛刺与并发抖动,直接影响重排系统的稳定性
生产环境中的时延毛刺与并发抖动,直接影响重排系统的稳定性

重排场景的综合成本从来不只取决于基础单价。当你需要对 100 个候选文档做精细重排时,候选集的扇出规模会瞬间吃掉几十万甚至上百万的输入 Token。即使单价极低,反复扇出的总体用量依然庞大。

更致命的是网络与端到端延迟。大模型服务真正在生产环境卡脖子的指标是 p95 延迟与并发吞吐。一个外部 API 如果没有严苛的 SLA 保障,在几十次并发请求中只要出现一两次抖动,整个下游推荐系统就会超时。

剥离了语言能力的模型,并没有自动获得确定性。

目前在公开网络检索中,尚未检索到 TypeSafe AI 与 Jev 的标准公开技术文档、公开基准测试及模型版本规范。没有 F1 分数,没有 AUROC,也没有信息检索领域通用的 NDCG 跑分,它的工业可用性目前很难独立验证。

  • 风险.决策模型输出的置信度若未经过 Platt 缩放或等保回归等统计校准,数值就不能当作概率使用,所谓 0.8 的置信度可能只是未经校正的原始评分。

彻底黑箱带来的代价

如果说工程算账只是性价比的权衡,那么解释权的彻底丧失,就是算法治理上的严重倒退。

缺乏推理链的判别模型极易固化偏见,且无法解释打分依据(示意图)
缺乏推理链的判别模型极易固化偏见,且无法解释打分依据(示意图)

自回归大模型也是黑箱,但至少保留了一条退路:你可以要求它输出思维链(CoT),或者给出支持该结论的几点论据。尽管它的自我陈述可能存在事后合理化的欺骗,但工程师依然有文本抓手来排查偏见与逻辑漏洞。

Jev 连这点抓手都拔掉了。你输入几千字背景,它只扔回一个冷冰冰的 0.73。究竟是文中的哪句话触发了垃圾邮件标记?没人知道。

在早期的测试中,有人让 Jev 对旧金山湾区各个城市是否是好城市进行打分,结果富人聚集的 Cupertino 拿到最高分,而低收入和少数族裔集中的 East Palo Alto 稳居垫底。这个测试把隐性偏见的风险暴露无遗。如果有人把这种完全不可解释的浮点打分直接搬进简历初筛、信用卡核保或风控预警系统,背后潜藏的歧视风险将无法被审计和规避。

《韩非子》讲“郢书燕说”,燕相好歹还能对着荒诞的郢人来信牵强附会出治国之策;而面对一个只给数字的纯粹判别黑箱,系统运维者连穿凿附会的余地都没有。

在欧美算法监管趋严的当下,企业若要采用这类模型,更现实的路径是构建分层防线:用规则引擎与 BM25 做底层粗筛,用判别模型处理低风险场景的流水线排序,在涉及人身、财产与合规裁量的高敏感节点,仍必须由具备可追溯文本依据的生成模型或人工兜底。

低价是打开市场的敲门砖,但仅靠切除嘴巴来换取速度的模型,无法自发解决公正与可信的账单。