曾深度参与 InstructGPT 研发并见证强化学习技术确立的 Diogo Almeida,带着对生成式路线的反思离开了 OpenAI。在他看来,行业耗费四年让大语言模型习得优雅的人类辞藻,却制造了一个巨大的工程错位:机器与系统之间的自动化调度,根本不需要人类的自然语言。2026 年 9 月 15 日,Almeida 联合 Erik Gafni 与 Sasha Sheng 创立的 TypeSafe AI 结束隐身状态,宣布完成由 DCVC 领投的 4000 万美元种子轮融资,公司估值约 2 亿美元,并正式推出基于 Transformer 的非语言模型 Jev。
与主流模型不同,Jev 不生成任何自然语言文本,仅输出经过校准的概率分布与结构化决策。发布当天,激增的开发者调用请求甚至导致其官方 API 短暂宕机。这不是又一个参数规模竞赛的产物,而是一次把智能接口还原给机器通信的底层重构。
剥离自然语言外壳:从逐字生成到确定性概率
自 2022 年底 ChatGPT 引爆技术浪潮以来,行业长期默认智能必须依附于生成式文本。但在后端架构中,让大模型输出严格的 JSON 配置或执行路由,往往需要借助昂贵的自回归生成与约束解码(如 Structured Outputs),伴随而来的不仅是数秒的等待,还有挥之不去的解析报错与虚构内容。
Jev 走了一条截然相反的路线。它被定义为一个专攻直觉判定的“系统一”(System One)模型,不承担多轮对话与长篇大论,直接面向机器消费。模型单次请求提供约 32,000 token(约合 15 万英文字符)的共享上下文预算,原生支持 Choice(选项归类与置信度)、Score(分值分布)和 Noul(命题真实概率)等类型化原语。在同等上下文状态下,开发者可以无额外延迟地并行评估多个问题。
在训练方法上,Almeida 彻底弃用了自己早年在 OpenAI 开创的依赖人工标注偏好的 RLHF(人类反馈强化学习)机制,转向全新的 RLCD(校准决策强化学习)。其模型完全由统计特征明确的合成数据训练而成。这种纯粹的判别式设计切断了自回归生成的算力浪费,将端到端延迟压缩到 70 至 500 毫秒 的区间。
极端降本下的落地账本:千次判定不足五美分
Jev 的命名源自 19 世纪经济学家提出的“杰文斯悖论”:当一种资源的利用效率大幅提高、消耗成本急剧下降时,其整体需求不仅不会缩减,反而会呈爆发式增长。TypeSafe AI 对该模型的定价为 0.042 美元/百万输入 token(折合约 42 美元/十亿 token),输出决策完全免费;在 Vercel AI Gateway 接入渠道中,标价同样低至约 0.04 美元/百万 token。
这种定价策略直接冲击了自动化场景的成本结构。在企业工作流与 Agent 开发中,判定、路由与安全审核是调用量最大却最不具表现力的环节。过去使用通用大模型做网关过滤,高昂的 Token 费用常年挤压利润空间。
| 评测方案与模型 | 测试任务与样本规模 | 决策准确率 | 平均响应延迟 | 千次调用估算成本 |
|---|---|---|---|---|
| Jev (TypeSafe AI) | Nearhere 独立活动分类 (50例) | 96% (48/50) | 0.59 秒 | 0.043 美元 |
| Gemini 3.5 Flash-Lite | Nearhere 独立活动分类 (50例) | 86% (43/50) | 3.40 秒 | 2.496 美元 |
| Jev vs OpenAI Luna 5.6 | Vercel 生产级命令安全审查 | 准确度更高 | 提速 5–18 倍 | 极低边际支出 |
工程一线的替换动作非常迅速。Vercel 于 2026 年 9 月 16 日迅速在其 AI Gateway 与 AI SDK 7 中增加了名为 experimental_evaluate 的实验性接口支持。Vercel 工程师 Pranit Sharma 实测显示,用 Jev 替换 OpenAI Luna 5.6 运行安全分类器后,不仅规避了越狱指令绕过,响应速度更是提升了 5 到 18 倍。在 Bryo AI 的商业邮件过滤场景以及第三方机构 Nearhere Events 的独立测试中,Jev 展现出接近 60 倍的成本落差,千次分类成本甚至不到 5 美分。
机器需要的不是滔滔不绝的解释,而是带置信度的确定性抉择。
“零幻觉”的语义陷阱与真实的系统分层
面对开发者的狂欢,技术架构师必须保持清醒。官方宣传所宣称的“杜绝幻觉”,存在一个明确的技术语境。
Jev 实现的“零幻觉”本质上是 Schema 级别的类型安全。由于不经过文本生成解码,模型绝不会输出格式崩坏的 JSON、违背预定义枚举的非法字段或荒谬的编造词汇。但在语义分类层面,它依然是一个概率系统,同样存在把合法选项判断错误的可能性。开源评估框架 Pi 的开发者、Earendil CTO Armin Ronacher 指出,这一机制实际上把最终确认权交还给了工程代码:当置信度只有 50% 时,系统必须将其视为抛硬币并走兜底逻辑;只有达到 95% 以上时,才能直接放行。
- 风险.Jev 是纯粹的判定模型,完全缺乏算术、多步因果推理与自由文本生成能力,试图用其替代通用大模型将导致任务全面溃败。
此外,官方宣传的“193.6 倍提速与 444.6 倍省钱”目前仅来自 TypeSafe 内部 4 个非公开工作流,且其对照基准是外部模型的共识概率而非公开黄金测试集。更现实的挑战在于商业模式,TypeSafe 官方博客坦承,目前这种超低输入门槛叠加输出全免费的计费方式,其长期财务可持续性仍未经过充分验证。
但 Jev 带来的最大启发,在于打破了“单一大模型解决一切”的巨石迷思。未来的软件自动化架构正在走向明确的分层:前端由超轻量、低成本的判别模型充当高速网关,处理 90% 的格式验证、意图分流与违规拦截;剩下的长长尾部复杂多步推理,才转交给按秒计费的高溢价 LLM。随着巨头补贴退潮与实际业务成本压力显现,这种将决策权从自然语言泥潭中抽离出来的尝试,正在重塑软件世界的底层契约。
