Liquid AI在Hugging Face上放出了新一代边缘视觉语言模型LFM2.5-VL-3B,参数量3.1B,主打能在手机、笔记本这类本地硬件上离线跑视觉理解。它把前代LFM2-VL-3B的四个短板——屏幕识别、物体定位、多图推理、工具调用——集中补了一遍,跑分表格里也确实交出了几个亮眼的跃升。问题是,这些数字目前全部来自Liquid AI自己的测试环境,网上还找不到任何第三方在真实设备上复测过的结果。
补的不是新能力,是补课
LFM2.5-VL-3B用SigLIP2 400M NaFlex视觉编码器搭配LFM2.5-2.6B文本骨干,预训练约34T tokens,视觉数据量是前代的4倍。词表从原来扩到128K,靠的是在现有基础上原地扩容,而不是推倒重来,目的是让模型认得更多非拉丁文字。后训练分两段:先做知识蒸馏加"Antidoom训练"的监督微调,再上多奖励强化学习。
这套流程本身不新鲜,谷歌Gemma、阿里Qwen、InternVL走的都是类似路子。真正值得看的是效果落在了哪几项上。
定位能力跳了一大截,但"同尺寸最强"经不起逐行核对
官方表格里最扎眼的两个数字,都出在此前明显薄弱的项目上。
定位能力从57.1翻到87.9,多图推理从34.9翻到58.3,这两项确实是硬提升,不是选择性剪裁出来的。
但把整张表格逐行看下去,"同尺寸段领先"这句宣传语就没那么扎实了。在MMMU(学科知识问答)上,LFM2.5-VL-3B拿到48.4分,输给参数更大的InternVL 3.5 4B(60.7);多模态指令跟随MM-IFEval上,60.6分也不敌gemma-4-E4B-it的68.2;文档理解和OCR类任务里,DocVQA、InfographicVQA、OCRBench v2这几项,Qwen3.5-4B和InternVL 3.5 4B基本都跑在前面。
- 结论.这次升级是真实的,但"最强"是拿3B模型的均分去对比部分4B模型的短板项,属于选择性对比框架,不是全面碾压。
没人在真手机上验证过它到底多快
官方给出的边缘速度数字不算含糊:M5 Max上228 tokens/s,Ryzen AI Max+ 395上116 tokens/s,Galaxy S26 Ultra上能跑到20 tokens/s,内存占用约3GB,GPU端高并发下吞吐量能冲到约11K tokens/s,换算下来单张H100一天能吐将近1B输出token。这些数字如果属实,确实是同类模型里的第一梯队。
但检索一圈下来,Hugging Face讨论区、Reddit、GitHub issue里都没有找到任何独立复测记录——没人在自己的手机、Jetson或树莓派上实测过速度和内存占用,也没人验证过量化后精度损失多少。目前所有"更快更好"的判断,都建立在厂商自己给出的一份成绩单上。
- 风险.如果准备把这类模型部署进真实产品,官方跑分只能当参考,不能当验收标准,实际拿到目标硬件上跑一遍量化版本,比看benchmark表格更可靠。
边缘VLM赛道的通病
这不是Liquid AI一家的问题。Gemma、Qwen、InternVL发新模型时,同样习惯挑一组对自己有利的benchmark组合,宣称"同尺寸段最强"。参数量相近的模型之间,跑分互有输赢是常态,真正决定边缘部署能不能用的,是量化后的实际延迟、内存峰值和设备兼容性——这些恰恰是发布博客里最少给、第三方最难测的部分。
官方跑分表能证明能力提升,证明不了边缘可用性。
对准备接入这类模型的开发者来说,比较现实的做法是先按自己的目标硬件跑一版int4或int8量化,再拿真实业务数据测一遍精度损失,而不是直接照着表格里的分数下结论。这份跑分表值得参考,但目前还称不上定论。
