三值大模型在学术界与工业界始终背负着一个看似牢不可破的数字烙印:1.58 比特。这一数值来自香农信息论对正一、负一与零三个状态等概率分布时的编码极限。
当地时间 2026 年 9 月 14 日,Intel 研究团队的 Evangelos Georganas、Alexander Heinecke 与 Pradeep Dubey 在预印本平台 arXiv 提交论文,提出一种名为 BITCOS 的自适应三值排布格式,宣称打破了三值大模型的 1.58 比特壁垒,将权重存储压缩至最低 1.485 比特,并在特定硬件上取得最高 1.27 倍的端到端解码吞吐提升。
但拨开营销式的话术迷雾后可以看到,这并非信息论数学定律的失效,而是一场建立在模型参数偏倚基础上的工程取巧。更关键的是,极限压缩省下的内存带宽,正在被复杂的解包指令迅速蚕食,甚至在部分端侧芯片上诱发了性能腰斩。
巧借稀疏度打破的数学壁垒
在 BitNet b1.58 等三值架构流行以来,行业普遍将 log2(3) 约等于 1.585 比特视作理论基准。但在实际工程部署中,计算机底层体系结构天然偏好 2 的幂次。工程师通常采用 5-trit 打包方案,把 5 个三值符号塞入 1 个字节,结合 128 个权重的分块,物理占用实际上整为 1.625 比特/权重。由于多符号解包逻辑繁琐,不少生产系统甚至退回无损的 2 比特对齐格式。

无论是 1.585 比特的理论计算,还是 1.625 比特的工程打包,都默认三值符号在神经网络中呈现均匀分布。Intel 团队测试了 7 个模型家族的 29 个真实三值大模型权重,发现事实截然相反:真实模型中的零权重占比普遍在 29.7% 到 51.5% 之间。当一个系统里超过一半的状态原本就是空白时,等概率假设便不攻自破。在零占比超过半数的状态下,真实信息熵本就已经降到了 1.485 比特左右。
BITCOS 的实现结构并不玄奥。它放弃了传统多进制打包,改用自适应两级结构:先用一层稠密的 1 比特存在位图标记元素是否非零,随后仅针对非零元素分配 1 比特的正负符号向量。如果模型中零的占比为 z,理论存储代价即为 2 - z 比特。
数学逻辑由此变得直观:只要模型的零密度超过 37.5%,BITCOS 的体积就会立刻低于 5-trit 格式的 1.625 比特。实测的 29 个模型中有 26 个跨过了这条分界线。在零占比达到 51.48% 的 CAT-Q Qwen3-1.7B 模型中,BITCOS 跑出了 1.485 比特/权重 的最低纯载荷记录。相比生产环境的 2 比特表示,权重体积缩减了 1.16 倍至 1.32 倍。
但在模型落盘时,账本并不只有纯载荷。若计入工程部署中每 128 个权重所必须绑定的一个 FP16 缩放因子,CAT-Q Qwen3-1.7B 的真实物理开销会回升到 1.610 比特/权重。压缩的确存在,但并未跳出物理世界的约束。
解包指令代价与端侧算力翻车
大语言模型解码阶段通常是显存带宽受限场景,压缩权重的根本动机在于减少访存数据量,从而换取推理吞吐。论文在 32,768 乘 16,384 的 GEMV 微基准以及 Bonsai(1.7B 到 27B)和 CAT-Q Qwen3(1.7B 到 32B)等 7 个模型、batch 为 1 且生成 256 token 的条件下展开了测试。

在大规模服务器和高规格核显上,这一逻辑得到了印证。搭载 64 核的 Xeon Platinum 8592+ 获得了 1.10 至 1.18 倍 的端到端解码吞吐提升;桌面端 Core Ultra 9 285K 提升 1.02 至 1.15 倍;Arc 140V 核显提升 1.09 至 1.22 倍;独立显卡 Arc Pro B70 则录得 1.02 至 1.27 倍 的增益。
但在面向超轻薄移动设备的 8 核 Lunar Lake 架构(Core Ultra 7 258V)处理器上,测试结果出现了戏剧性的倒挂。其端到端性能仅有基准的 0.47 到 0.70 倍。在 40% 的零密度测试中,BITCOS 内核仅维持了 28.9 GB/s 的实测有效带宽,而无须复杂解包的 2 比特内核却跑出了 74.7 GB/s。
节省内存带宽的微小收益,一旦被微架构的算力负荷击穿,加速就会演变为灾难。
问题出在计算受限场景下的微架构开销。BITCOS 的解包算法为了适配 x86 架构,高度依赖特定的底层指令组合:客户端标注为 AVX2 的内核,底层重度使用了 BMI2 扩展里的 pdep(并行位沉积)指令以及 AVX-VNNI-INT8 的 vpdpbssd 指令;服务端内核则依赖 AVX-512-FP16。在核心规模受限、单核整数向量吞吐有限的轻薄芯片上,从位图与紧凑符号向量中解构出矩阵元素的开销,远远超过了削减存储体积带来的访存收益。
纸面指标拼凑与工程落地盲区
除去微架构层面的分化,论文在结论呈现方式与验证完整度上也保留了鲜明的技术包装痕迹。

摘要中并列呈现的两组最亮眼数据——1.485 比特的极低存储与 1.27 倍的最高加速,实际上来自完全不同的两套模型测试。1.485 比特出自零密度高达 51.48% 的 CAT-Q Qwen3-1.7B;而 1.27 倍的吞吐巅峰,则是在 Arc Pro B70 独显上运行零密度仅约 37.7% 的 Bonsai 4B 时测得。如果观察 CAT-Q Qwen3-1.7B 在这块独立显卡上的实际加速表现,数据仅为极为微弱的 1.02 倍。压缩率与推理加速并不能同时达到理论峰值。
与此同时,基准测试的对照环境也存在失真。论文着重强调对比 llama.cpp 的 TQ1_0 方案取得了最高 1.74 倍加速,但数据同时显示,研究团队自行编写的 2 比特优化内核本就领先 TQ1_0 达 1.78 倍。所谓的大幅跃升,很大程度上是生产级底层内核工程与开源通用框架的基准落差,而非新排布格式带来的绝对红利。
- 风险.截至 2026 年 9 月 16 日,该论文预印本未附带任何公开代码仓库、提交哈希或复现脚本;由于 AVX2 路径引入了对激活值的 INT8 量化及 INT32 累加,论文并未报告困惑度等下游模型质量数据,其位精确的权重存储难以掩盖计算链路中的数值漂移风险。
在跨平台兼容性方面,由于其解包代码深度捆绑了 Intel 特有的指令集实现,若将其迁移至老旧 x86 处理器或对 pdep 指令存在微架构吞吐惩罚的 AMD 处理器上,性能将面临不可控的折损。
- 结论.端侧模型轻量化已经走入精细化的微架构博弈期,单纯在论文中追求理论比特率的边际递减已失去实操价值,只有能匹配端侧芯片执行管线的格式,才能在真实的工程落地中站稳脚跟。
