只要 104.08 美元 的云端训练费,144.3M 参数 纯本地 CPU 推理,还能在分类任务上击败昂贵的商业 API。

这是巴西 AI 实验室 Supersonic Labs 近期推出的决策模型 Julia 1 给行业端出的一张爽快成绩单。在生成式大模型动辄数百万美元算力账单的今天,这种主打结构化决策、完全不生成文本的轻量模型,很容易被包装成打在闭源巨头脸上的一记响亮耳光。但撕开宣传话术的滤镜,这更像一场精心剪裁的比分游戏。

跑在 CPU 上的决策头

大模型在处理复杂工作流时,意图识别、路由分发和安全过滤往往只需要一个结构化的离散判断。这类任务强行调用自回归大模型,不仅浪费 Token,而且响应迟缓。

Julia 1 瞄准的就是这个轻量级推理生态。它不吐字,只做三类结构化判定:在 2 到 20 个选项里做单选路由、按有序量表打分,或是验证是非概率。

Code
输入上下文 + 2至20个候选 -> Julia 1 编码匹配 -> 输出全概率与固定标签

它的底座并非自研,而是来自 JHU CLSP 开发的 mmBERT-small。这枚基于 ModernBERT 架构的紧凑编码器参数量约 140M,在 1,800 多种语言的超 3 万亿 token 上完成了预训练。Supersonic Labs 保留其分词器与编码器,加挂轻量决策头,以 540 巴西雷亚尔(约合 104.08 美元)完成了格式对齐微调。

Julia 1 极低训练成本的核心拆解 $104.08 总云端微调训练花费 144.3M 模型总参数量 (CPU可跑) 33.15 ms Apple M4 单次决策中位延迟

在 Apple M4 设备上,它的单次中位延迟压到了 33.15 ms;在搭载 i5-1235U 的普通笔记本上,AG News 文本分类的中位耗时为 107.83 ms。整个权重文件仅 550.5 MiB,还能通过 ONNX 在浏览器端利用 WebGPU 渲染。

账面数据看下来,似乎端侧小模型靠着几十美元就能逼平专业基础设施。但真实工况下的技术指标从来不会凭空降临。

5倍速度优势背后的网络障眼法

实验室在社交平台上极力宣扬一个卖点:Julia 1 在酷睿 i5 笔记本上分类比商业竞品 TypeSafe Jev 快了整整 5 倍。

这是一个极其隐蔽的口径置换。

所谓 5 倍提速,是用本地内存里的直接推断,去碰瓷客户端从法国向远程服务器发起请求的 Jev 托管 API。它把跨大西洋海底光缆的物理往返延迟、TLS 握手以及排队开销,统统算作竞品模型的推理耗时。

评测口径对决:纯本地算力对比跨洋网络链路 Julia 1 本地执行方案 • 纯 CPU 算力与内存带宽 • 无外部网络开销,延迟纯粹 测试基准:本地 33 ~ 107 ms TypeSafe Jev 托管服务 • 法国发往跨国机房的网络 RTT • 包含 HTTP 协议解析与排队 宣称落后 5 倍:实为网络耗时
离开物理通信网络谈延迟差距,不过是拿无绳木工刨去嘲笑电锯要插电线。

比网络障眼法更严重的,是评测样本量的严重失真。Julia 1 宣称击败 Jev 的基准测试,每个分类任务仅抽取了 100 个样本作为 pilot 试验。抽样选拔赛很容易掩盖泛化缺陷,一旦遇到真正严苛的工业多分类场景,这套方案立刻见底。


72 分类的溃败与经典方案的嘲讽

在银行业经典的 Banking77 意图识别测试中,面对 72 个细分意图,由于 Julia 1 的决策层原生只支持 2 到 20 个候选标签,它必须依靠外挂的 Router 进行多阶段收窄。

这一收窄机制彻底拖垮了模型。在仅 100 个样本的小集上,Julia 1 准确率暴跌至 64%,在 i5 处理器上的单次中位耗时急剧恶化至 3,713.54 ms。

作为对比,Jev 在完整 3,080 条真实测试集上的准确率达到 92.40%,多线程跑完整个全量测试集仅用时 6 分 51 秒。

更尖锐的参照物甚至不是商业 API,而是工程界沿用了多年的工业老兵。

方案实现Banking77 全集准确率CPU 典型推理延迟部署依赖与复杂度
MiniLM + 逻辑回归93.0%6.8 ms (p95 11.4ms)极简特征工程,纯线性分类
TypeSafe Jev (闭源云端)92.4%托管服务未公开单次分位闭源商业 API,强依赖外网
Julia 1 (144.3M ModernBERT)64.0% (100样本抽检)3,713.5 ms (CPU路由多层)ONNX / Python 两阶段 Router

基于成熟的 MiniLM 嵌入向量外挂逻辑回归分类器,在 Banking77 全量数据集上能以 93.0% 的准确率稳定发挥,在 CPU 上的中位延迟只有 6.8 ms,p95 延迟也不过 11.4 ms。

当一个工业界成熟且无网络开销的传统管道能在毫秒级交付高出近 30 个百分点的表现时,给 ModernBERT 编码器外挂一个简易分类头并冠以“下一代决策模型”的称谓,更像是在旧货架上贴了张新标牌。

  • 风险.在标签数量超过 20 个的多分支场景中,两阶段候选收窄机制会产生早期级联丢弃,直接摧毁后续分类准确度,千万不要盲目引入深层 Agent 路由。

开源身份的疑云

技术的局限尚可归结为版本迭代,但开源合规上的模糊不清却很难用算力不足来掩饰。

官方团队声称模型基于 Apache 2.0 协议开源,但其衍生底座 mmBERT-small 在 Hugging Face 上的原生协议为 MIT 许可证。更重要的是,在低资源语料场景下,mmBERT-small 的分词限制曾导致其在部分实体识别任务中增益有限;而 Julia 1 的专有微调训练管线至今完全闭源,外界无法验证其数据构建质量。

甚至截至目前,独立检索也未能在公共检索渠道核实到 Julia-1 真正合规公开的权重仓库与模型卡,其实际开源可用性依然停留在单向宣称的阶段。

  • 建议.在官方完整公开可复现脚本、独立权重及合规许可前,技术团队切忌将其作为系统依赖,更不应急于重构既有的轻量化向量分类管线。

天下熙熙,皆为利来。在轻量化边缘模型的赛道上,市场极度渴望看到打破闭源垄断的平民奇迹。但如果一个端侧方案既没有打穿工程范式的底层壁垒,又在基础基准上依靠选择性汇报来营造颠覆感,那么这个价值 104 美元的故事,终究只是一场热闹的宣传秀。