Liquid AI在7月28日放出两个新模型:LFM2.5-Encoder-230M和LFM2.5-Encoder-350M,参数量都不大,但都能吃下8192 Token的上下文。官方给出的对比数字很直接——处理满长度输入时,230M版本在CPU上比同类的ModernBERT-base快了约3.7倍:一次8192 Token的推理,ModernBERT-base要跑90多秒,LFM2.5-230M只要28秒左右。
这不是又一个生成式大模型的参数竞赛。LFM2.5编码器是双向理解模型,干的是分类、路由、抽取这类"看懂文本再打标签"的活,不负责聊天或写文章。真正该盯的问题是:企业现有的CPU,能不能靠这两个小模型把长文本处理的成本压下来,少调几次GPU上的大模型。
两个模型,赌的是同一件事
LFM2.5-Encoder由LFM2的decoder backbone改造而来:把单向注意力换成双向,卷积层改成非因果对称结构,再用掩码语言建模(掩掉30%的token)重新训练。训练分两阶段——先在1024 Token的短上下文上打基础,再把上下文拉长到8192,同时补强法律、事实类和多语言语料。
质量上,Liquid AI把14个模型放在GLUE、SuperGLUE和多语言分类共17项任务上做全量微调,取5个随机种子的均值,评测框架和原始结果都开源了——这一点要说清楚,因为整套排名是厂商自测,不是第三方复核。结果是:350M排第四,前面三个都比它体积大,其中一个3.5B模型的参数量差不多是它的10倍;230M则超过了ModernBERT-base和所有EuroBERT系列模型,体积却比大多数对手更小。
真正省的不是参数量,是CPU账单
省的是重复调用的成本
合同分类、客服记录归档、合规文本审查、PII检测——这些任务量大、跑在CPU上、输入越来越长,是很多NLP团队日常最头疼的一块。过去要么用小型BERT扛精度不够,要么调生成式大模型扛成本又太高。LFM2.5给了一个折中选项:按官方说法,一份完整合同或一段长客服对话,在笔记本CPU上30秒内就能扫完分类。
Liquid AI同时放出了几个基于微调版模型搭的CPU demo:意图路由、政策合规检查、拼写纠错,以及能识别16种语言、40类个人信息的PII检测。这些demo说明一件事——base encoder本身只是通用表征,不是开箱即用的业务系统,分类、Token标注、抽取这些下游能力,都得先拿自己的任务数据做一遍微调才能用。
- 风险.基础模型不能直接部署,企业要投入的不只是硬件预算,还有微调和验证的工程时间。
优势的边界在哪
速度优势不是全场景通吃。GPU上的数据反过来:Apple GPU测试里,ModernBERT-base在1000 Token以下的短输入仍然更快,LFM2.5要等输入长到2000 Token左右才反超。
质量排名同样不是碾压式的:350M只排第四,前面还有体量大出一个量级的模型。LFM2.5的强项很具体——CPU、长上下文、高频重复任务这个组合,不是所有场景的最优解。对负责合同、客服文本、合规检查的NLP团队来说,值不值得换,取决于自己现有的负载到底是不是这类长输入、常年跑的CPU任务;如果本来就用GPU处理短文本,这次发布未必是升级理由。
