Liquid AI在Hugging Face上放出了新一代边缘视觉语言模型LFM2.5-VL-3B,参数量3.1B,主打能在手机、笔记本这类本地硬件上离线跑视觉理解。它把前代LFM2-VL-3B的四个短板——屏幕识别、物体定位、多图推理、工具调用——集中补了一遍,跑分表格里也确实交出了几个亮眼的跃升。问题是,这些数字目前全部来自Liquid AI自己的测试环境,网上还找不到任何第三方在真实设备上复测过的结果。

补的不是新能力,是补课

LFM2.5-VL-3B用SigLIP2 400M NaFlex视觉编码器搭配LFM2.5-2.6B文本骨干,预训练约34T tokens,视觉数据量是前代的4倍。词表从原来扩到128K,靠的是在现有基础上原地扩容,而不是推倒重来,目的是让模型认得更多非拉丁文字。后训练分两段:先做知识蒸馏加"Antidoom训练"的监督微调,再上多奖励强化学习。

这套流程本身不新鲜,谷歌Gemma、阿里Qwen、InternVL走的都是类似路子。真正值得看的是效果落在了哪几项上。

定位能力跳了一大截,但"同尺寸最强"经不起逐行核对

官方表格里最扎眼的两个数字,都出在此前明显薄弱的项目上。

本次升级最大的两个跃升 87.9 RefCOCO-avg(物体定位) 前代仅57.1 58.3 MuirBench(多图推理) 前代仅34.9

定位能力从57.1翻到87.9,多图推理从34.9翻到58.3,这两项确实是硬提升,不是选择性剪裁出来的。

但把整张表格逐行看下去,"同尺寸段领先"这句宣传语就没那么扎实了。在MMMU(学科知识问答)上,LFM2.5-VL-3B拿到48.4分,输给参数更大的InternVL 3.5 4B(60.7);多模态指令跟随MM-IFEval上,60.6分也不敌gemma-4-E4B-it的68.2;文档理解和OCR类任务里,DocVQA、InfographicVQA、OCRBench v2这几项,Qwen3.5-4B和InternVL 3.5 4B基本都跑在前面。

  • 结论.这次升级是真实的,但"最强"是拿3B模型的均分去对比部分4B模型的短板项,属于选择性对比框架,不是全面碾压。

没人在真手机上验证过它到底多快

官方给出的边缘速度数字不算含糊:M5 Max上228 tokens/s,Ryzen AI Max+ 395上116 tokens/s,Galaxy S26 Ultra上能跑到20 tokens/s,内存占用约3GB,GPU端高并发下吞吐量能冲到约11K tokens/s,换算下来单张H100一天能吐将近1B输出token。这些数字如果属实,确实是同类模型里的第一梯队。

谁验证过这些速度数字 官方自测 M5 Max:228 tok/s Ryzen AI Max+:116 tok/s Galaxy S26 Ultra:20 tok/s 内存占用:约3GB 数据全部来自Liquid AI 自有测试环境 独立验证 暂无 目前没有第三方在真实 边缘设备上复测过

但检索一圈下来,Hugging Face讨论区、Reddit、GitHub issue里都没有找到任何独立复测记录——没人在自己的手机、Jetson或树莓派上实测过速度和内存占用,也没人验证过量化后精度损失多少。目前所有"更快更好"的判断,都建立在厂商自己给出的一份成绩单上。

  • 风险.如果准备把这类模型部署进真实产品,官方跑分只能当参考,不能当验收标准,实际拿到目标硬件上跑一遍量化版本,比看benchmark表格更可靠。

边缘VLM赛道的通病

这不是Liquid AI一家的问题。Gemma、Qwen、InternVL发新模型时,同样习惯挑一组对自己有利的benchmark组合,宣称"同尺寸段最强"。参数量相近的模型之间,跑分互有输赢是常态,真正决定边缘部署能不能用的,是量化后的实际延迟、内存峰值和设备兼容性——这些恰恰是发布博客里最少给、第三方最难测的部分。

官方跑分表能证明能力提升,证明不了边缘可用性。

对准备接入这类模型的开发者来说,比较现实的做法是先按自己的目标硬件跑一版int4或int8量化,再拿真实业务数据测一遍精度损失,而不是直接照着表格里的分数下结论。这份跑分表值得参考,但目前还称不上定论。