把大语言模型搬进网页标签页,过去常被当作极客的技术小品。开源实验平台 MicroLLM Lab 试图打破这种偏见:它依托 W3C WebGPU 标准与 4-bit 量化,让 26M 到 362M 参数的小模型在无须后端服务器介入、完全离线的状态下直接在浏览器里吐字。在特定硬件 Apple M4 芯片的浏览器实测中,124.6M 参数的 PetitGPT 生成速度达到了 115 tokens/s,SmolLM2 135M Instruct 也跑出了 66 tokens/s。数字看起来足够颠覆,但掀开这层轻量化的外壳,端侧运行的代价其实分毫未减。

MicroLLM Lab 端侧吞吐与体积指标(M4 芯片实测) 115 tok/s 峰值吞吐 PetitGPT 124.6M 66 tok/s 推理速度 SmolLM2 135M 75% 内存占用压减 Q4 量化至 50-84MB 591 MB 离线包全量体积 首屏静态资源下载

穿透底层的算力拼图

在没有后端算力卡介入的前提下,纯前端跑语言模型依赖两根技术支柱。第一根是 W3C WebGPU 标准。过去浏览器跑推理只能走被层层封装的 WebGL 或效率打折的 WebAssembly,而 WebGPU 直接映射操作系统底层的原生图形接口——在 macOS 对接 Metal,在 Windows 对接 DirectX 12,在 Android 和 Linux 对接 Vulkan。前端编写的计算着色器因此能绕过虚拟层,直接向设备 GPU 下发并行矩阵计算指令。

第二根支柱是 Q4 量化。原始 16-bit 浮点权重被无情压榨到每个参数只占 4-bit,模型体积缩水整整 75%。得益于这种压缩比,参数量在 100M 上下的模型装进浏览器内存后,只占 50–84 MB 的显存空间。MicroLLM Lab 甚至支持将这些压缩权重缓存在浏览器的 IndexedDB 数据库中,免去用户每次刷新页面重新向服务器拉取文件的周折。

项目涵盖了从 MiniMind2 Small 26M、SmolLM2 135M 到 SmolLM2 360M Instruct 等不同梯队。在跑分演示里,高频的打字机输出效果看起来丝滑无比,仿佛一个自给自足的本地 AI 新纪元已经降临。

统一内存掩盖下的架构代沟

漂亮数据往往需要特定的温室。115 tok/s 的极速成绩,很大程度上归功于 Apple Silicon 的统一内存架构。高带宽、零拷贝的芯片特性,恰好抹平了 CPU 与集成 GPU 之间的数据搬运损耗。但学术界针对 WebLLM 等前端推理管线的评估早已表明,浏览器环境的最佳表现虽然可达同设备原生推理性能的约 80%,在最普遍的单批次长程解码场景中,真实短板依然刺眼。

浏览器沙箱为了保证网页隔离安全,在调度计算时带来了无法消除的命令分发开销(dispatch overhead)。当模型在 batch size=1 的工况下逐个生成 token 时,WebGPU 需要频繁提交微小的着色器调用,这些微小等待累积起来便成了吞吐瓶颈。

端侧小模型:技术落地收益与客观代价对照 设计收益(宣传卖点) 零云端推理成本,前端 GPU 并发自理 无网络请求往返,首字延迟进入毫秒级 单模型内存降至 50-84MB,免环境安装 底层代价(技术约束) 首屏离线打包工程体积达 589-591MB IndexedDB 明文存储,缺乏静态数据加密 4-bit 反量化消耗算力,复杂推理易失真

更为矛盾的是量化本身。4-bit 压缩大幅减小了权重读取时的显存带宽压力,但在缺乏高度手工汇编内核优化的 WebGPU 环境中,模型计算前必须先将 4-bit 权重解包反量化回浮点数。这部分反量化计算直接占用了宝贵的前端着色器周期。更关键的是,虽然语言模型在困惑度指标上对量化并不敏感,但在严苛的代码生成、复杂逻辑判断和结构化输出上,过度的位宽截断会让本来就脆弱的百兆模型精度发生断崖式下跌。


零服务器与完全隐私的叙事裂缝

宣扬纯端侧 AI 时,项目往往喜欢把零服务器成本和完全隐私作为卖点,这往往经不起推敲。

所谓零服务端,只是把云端运行时的算力费用转移成了分发时的带宽账单。MicroLLM Lab 离线打包工程文件的全量体积约为 589–591 MB。即使用户按需加载单个模型,首次访问依然需要瞬时拉取几十兆的模型权重与着色器二进制代码。只要这个网页应用后续加入了遥测采集、网络检索增强或者错误上报,用户输入的数据就依然拥有向外流出的通道。

至于纯本地存储带来的隐私安全,在工程上更像一层窗户纸。浏览器提供的 IndexedDB 存储仅仅保证了页面关闭后的离线持久化,它在本地磁盘上完全明文存储,不提供任何静态数据加密保护。一旦设备存在共享使用环境或遭受同源恶意脚本侵扰,沉淀在 IndexedDB 里的上下文和对话缓存极易被直接提取。学术界针对 WebGPU 的底层研究甚至发现,其精细的指令调度行为本身能够被恶意脚本用于硬件侧信道指纹探测。

把大模型的推理搬进沙箱,并不等于连同安全与推理精度一并打包进了保险箱。
  • 风险.IndexedDB 的明文存储无法满足商用合规的隐私要求,随意将敏感业务数据交付给无沙箱加密的浏览器端极易埋下安全隐患。

极小模型的真实定位:门卫而非管家

既然百兆模型在精度、安全和算力开销上存在如此明显的边界,它是否真的一文不值?

答案在于摆正它的生态位。古人云,兵贵神速,三十六计走为上。在分布式计算里,小有小的生存逻辑。25M 到 360M 参数的模型生来就不是为了撰写长篇小说或解答高深数学题的,强行拿它做通识对话,只会换来荒腔走板的胡言乱语。但在毫秒级的轻量任务上,它是一个极度廉价的端侧过滤器。

端云协同流水线:微型 SLM 的分流路由机制 用户前端输入 打字、搜索、指令 端侧 SLM (WebGPU) 垃圾过滤 / 意图分类 / 补全 Sub-10ms 极低延迟处理 本地直接终结响应 分流转发云端大模型

在实际架构中,这个端侧极小模型应该充当门卫级路由。当用户的输入进入输入框,它用个位数的毫秒延迟判断这段文字是无意义的灌水、基础的格式转换,还是需要调用昂贵云端 GPT-4 或 Claude 的高难度逻辑任务。如果只是日常表单分类或本地打字补全,设备端几毫秒内直接结案;遇到真正棘手的问题,再放行请求流向云端。

  • 结论.不要指望浏览器里的百兆模型扮演全知全能的智者,把它放在前端做意图识别和流量剪枝,才是端侧推理最现实的工程终局。

MicroLLM Lab 证明了现代 Web 技术足以承载基础的神经网络运算,但在脱离具体场景盲目狂欢之前,开发者应当看清:算力、精度与安全构成的三角法则,从未因为运行环境换成了浏览器就悄然失效。