加州理工学院学者领衔的初创团队 PrismML 最近发布了开源模型 Bonsai 2 27B,把阿里巴巴 270 亿参数的开源模型 Qwen3.8-27B 一举压缩了 9 到 10 倍,权重文件缩减至 5.95 GB。官方自测给出的结论相当诱人:在 14 项综合基准跑分中,该模型保留了原版 FP16 架构 98.2% 的水平,似乎让高性能推理模型跑进千元手机和轻薄笔记本的日子近在眼前。但仔细拆解技术细节和工程实现,这场轻量化狂欢背后,藏着不少被平均数掩盖的代价。
极限定制:三值权重与哈达玛旋转的工程代价
Bonsai 2 27B 基于 Apache 2.0 协议开源,其母体 Qwen3.8-27B 采用 64 层混合架构,融合了 Gated DeltaNet 与全注意力机制,原生支持 262,144 tokens 的长上下文。要把这样一个庞然大物塞进几吉字节的存储空间,常规的 4-bit 或 2-bit 后训练量化往往会导致困惑度陡增、推理逻辑崩塌。PrismML 采用的是更激进的三值权重方案,将每个权重的值收敛到 {-1, 0, +1} 三个状态,并结合每 128 个权重一组的 FP16 缩放系数,让平均有效位宽降至 1.72 bits。
在文件交付上,团队提供了 5.95 GB 的密集型 PTQ1_0 封装,以及解码吞吐更快但体积为 7.21 GB 的 PQ2_0 封装;如果要运行多模态视觉功能,还需外挂一个约 0.63 GB 的 Q8_0 视觉文件。
但低比特量化没有免费午餐。为了在如此严苛的精度下稳住网络输出,算法在量化前引入了分块哈达玛旋转预处理,并在运行时执行相匹配的激活变换。这一设计直接带来了生态上的孤岛效应:当前原生上游的 llama.cpp 并未合入该算子,强行加载只会输出一串不可读的乱码,开发者必须使用 PrismML 专门维护的代码分支才能顺利推理。
硬件层面的真实吞吐同样呈现出分化。在高端桌面端,RTX 5090 可跑出 120.5 至 129.9 tok/s 的速度,RTX 4090 也能维持在 81.2 至 91.1 tok/s。然而在端侧设备上,苹果 M5 Pro 的实测速度仅有 28.7 tok/s;至于此前官方宣传中 M5 Max 跑出的 47 tok/s,已被证实属于早期未经旋转优化的测试版本,仍有待重新测定。
跑分幻影:98%保留率背后的知识偏科
厂商公布的综合评测显示,Bonsai 2 的得分为 84.78,对照原版 FP16 的 86.32,保留率高达 98.2%,在相近体积下明显超越了常规量化方案 Qwen3.8 IQ2_XXS 的 72.59 分。但把不同测试集简单取平均,往往会掩饰关键维度的能力滑坡。
仔细拆看分项指标就会发现,模型的能力衰减极不均衡:在逻辑固定的数学测试中,得分由 97.06 微调至 96.57;代码测试甚至出现了逆势波动,从 89.07 变为 89.42,两项硬核理科基准确实几乎无损。
但在非形式化的知识与多模态任务中,缩水肉眼可见。知识与常识推理得分从原版的 85.55 跌落到 79.86,多模态视觉基准从 71.36 降至 66.19,其中衡量图文理解的关键指标 OCRBench v2 更是直接从 60.99 跌到了 56.88。
大模型被压缩到 1.72-bit 时,受损最严重的恰恰是网络中存储广泛背景知识的细碎连接。形式严谨的代码语法被留下了,但感知真实世界的细粒度能力变钝了。所谓的 98.2%,不过是用理科高分拉平了文科退步的算术障眼法。
纸面参数的急剧瘦身,往往以牺牲泛化连接的容错空间为代价。
显存暗礁:5.9G并不等于端侧自由
在端侧部署这件事上,行业常有一种把静态权重等同于运行开销的误区。5.95 GB 仅仅是文件在硬盘或显存中的死重,一旦模型开始处理多轮对话,动态开销就会迅速暴露。
Qwen3.8 原生具备 262K tokens 的上下文吞吐能力。即使只输入数千个词,激活状态与 KV Cache 所占用的内存也会随长度线性攀升。若再加上图形界面的基础显存、操作系统的后台占用以及视觉编码器,一台标配 8 GB 统一内存的个人电脑在加载 Bonsai 2 后几乎无法正常运转。端侧设备若想真正获得流畅体验,12 GB 至 16 GB 统一内存才是不可退让的物理门槛。
这种轻量化思路与市场上的另一派技术形成了鲜明分歧。西班牙团队 Multiverse Computing 推出的 CompactifAI 同样打出高压缩招牌,宣称能实现 93% 的体积缩减。然而细究其测试,其宣称的缩减是拿 27.1 GB 的 FP32 基线作为对照物,压缩后为 2.1 GB;若与工业界常用的 INT4(3.4 GB)相比,其实际压缩幅度仅约 38%。
更关键的是,CompactifAI 依赖张量网络分解,走的是直接物理裁剪参数(将 7B 模型削至 2.1B)的降维路线;而 PrismML 则保留了 27.36B 的完整网络拓扑,仅仅在权重的数值表示上做极限三值化。
古人讲求审大小而图之,在计算世界里,单纯压缩静态体积并不等于掌握了端侧的钥匙。
- 风险.若缺乏上游开源生态对非标算子的原生接纳,高度定制的模型容易沦为维护成本高昂的孤岛实验。
PrismML 获得了 Khosla Ventures 等机构的 2225 万美元种子轮注资,并由伯克利 Sky Computing Lab 主任 Ion Stoica 出任顾问,甚至传出与头部硬件厂商接洽的消息。但技术要真正走进终端系统,既绕不开端侧芯片对低位宽矩阵运算的硬件级指令支持,也绕不开真实场景下长文本带来的显存红线。把模型做小只是第一道门槛,让它在真实的掌上设备里不卡顿、不乱码、不偏科地运转,才是更硬的仗。
