让大语言模型去充当智能系统的调度员,正在变成一件既昂贵又迟钝的事情。在几乎所有自动化工作流里,开发者都不得不让动辄数百亿参数的模型去逐字生成文本,只为了判断用户的一句话究竟是想退款还是查物流。
Cloudflare 近期宣布开源两款决策模型 Clef(27B)与 Clef-flash(9B),并在其分布式边缘平台 Workers AI 同步上线托管版本。模型权重采用 Apache 2.0 协议开源于 Hugging Face,基座分别采用阿里开源的 Qwen3.8-27B 与 Qwen3.5-9B,并全面对标兼兼容 Typesafe AI 早先确立的 Jev API 规范。
斩断自回归,把大模型降维为概率分流器
通用大模型擅长推理,但不擅长做开关。自回归机制要求模型一个字一个字往下蹦,遇到网络抖动或格式漂移,整个下游代码库就会在 JSON 解析失败处直接崩溃。
Clef 的本质不是常规模型剪枝,而是直接丢弃自回归解码环节。它在推理时只运行 Qwen 骨干网络的 Prefill 阶段,提取输入的上下文表征,再通过联合模式头(joint schema head)并行评估所有候选标签。模型不再向客户端吐出任何中间文本,而是直接输出确定性的概率分布。
模型输出被严格约束在三种数据类型内:二元判断(noul)、多选分类(choice)以及加权序数(score),单次请求允许并发评估最多 64 个问题。同时,Clef 原生支持 65,536 tokens 上下文窗口,不仅接受文本和 JSON,还挂载了视觉编码器,单次 API 请求最多可处理 4 张图像或视频片段,比 Jev 纯文本、32k 上下文的规格更加宽松。
在 Cloudflare 内部的威胁情报实践中,安全团队利用 Clef 配合无头浏览器抓取并分类网页,端到端耗时仅 2.2 秒。而此前调用通用开源大模型 gpt-oss-120b 执行同样任务需要 4.7 秒,且仅能勉强给出两个粗糙分类。
官方基准数据显示,Clef-flash 的中位延迟仅 38.8 毫秒,第 95 百分位延迟保持在 122.4 毫秒;27B 参数的 Clef 中位延迟为 209.3 毫秒。相比 Jev 高达 524.1 毫秒的基准表现,速度有了数量级上的改善。
跑分倒挂背后的边界隐患
在结构化基准评测里,Clef 系列的数据表现相当抢眼。Clef-flash 在 Berkeley 提出的函数调用基准 BFCL exact match 上达到了 98.76%,API-Bank 准确率达到 93.11%,在家电控制测试中取得 97.73%。在训练方案上,研发团队将 rank-256 LoRA 与打分头绑定,联合采用了标签平滑交叉熵、用于概率校准的 Brier loss,以及自研的校准决策强化学习(RLCD)算法。
决定智能体稳定性的,往往不是它多会调用,而是它懂不懂何时收手。
但评测集里隐藏着一个危险的倒挂现象。在专门测试模型何时应当触发工具调用的 When2Call 指标上,原版 Jev 取得了 80.97% 的准确率,而 Clef 仅得 72.37%,小尺寸的 Clef-flash 更是跌到了 65.58%。
- 风险.当开发者试图用轻量决策模型把关敏感业务时,模型对未定义输入、越界提问的抑制力依然脆弱,极易出现不该触发却误触发调用的情况。
在工具调用的执行端,结构化约束能将准确率拔得极高;但在感知调用边界的临界区,小参数决策模型依然难以抗衡更审慎的上下文语义判断。一味追求极低延迟,换来的可能是防御网的破损。
剥离公关包装,边缘网络的防守算盘
除了发布模型权重,官方博客用相当篇幅宣称推出了强化学习微调服务。但在光鲜的宣传标题之下,工程落地的现状并不等同于开放的自服务 SaaS 产品。
这套体系依托 AI Gateway 拦截日志、Workers AI 跑 rollout、Containers 部署打分沙箱、Trainer 组件更新权重的架构闭环,目前主要面向早期设计合作伙伴,并且必须由前向部署工程师(FDE)团队驻场介入。从重人力的定制交付到全自动的自助平台,中间依然隔着漫长的工程调试期。
除去宣传的水分,Cloudflare 此番动作的战略意图十分清晰。
如果所有 Agent 的路由逻辑都由中心化巨头的 API 掌控,边缘网络就会彻底沦为毫无议价能力的哑管道。Clef 坚定地选择在 API 接口上完全兼容 Jev,目的就是让开发者能以极低的改造成本,把网关分流逻辑从外部大模型迁移至 Cloudflare 边缘节点。
把复杂逻辑留给深思熟虑的生成模型,把高频选择交还给毫秒级的判别头。这种架构解耦已成定局,但它也给整个行业提了个醒:再轻巧的扳机,如果瞄不准红线,走火的代价依然得由开发者自己承担。
