Qwen3.8 27B的全精度模型有55GB,大多数消费级显卡根本装不下。一项新的量化基准测试给出了一个反直觉的结果:压缩到17GB的4-bit Q4_K_M 版本,在GPQA Diamond、IFBench和Terminal-Bench 2.1三项测试上,成绩几乎跟55GB的BF16没有可测差异。

但再往下压,情况急转直下。量化到6.2GB的1-bit UD-IQ1_S 之后,GPQA Diamond的得分掉到接近随机猜测的水平,推理越久反而越差。这说明量化对模型能力的伤害不是匀速下降,而是先无感、后断崖——4-bit是本地部署目前最划算的位置,1-bit省下的显存,换不回可靠的输出。

事实:Q4_K_M为什么几乎不掉分,1-bit为什么直接崩

GPQA Diamond考研究生水平的科学问答,IFBench测指令遵循,Terminal-Bench 2.1是89个任务的编程代理测试。三项测试里,几个量化版本的表现差得很明显。

版本体积GPQA DiamondIFBenchTerminal-Bench 2.1
BF16 全精度55GB基准线基准线基准线
Q4_K_M(4-bit)17GB几乎持平持平持平
Q2_K_XL(2-bit)10.7GB小幅下滑未掉分小幅下滑,多用约25%的token
UD-IQ1_S(1-bit)6.2GB接近随机未测未测

4-bit复现了BF16的水平,IFBench上连2-bit都没掉分。只有GPQA和Terminal-Bench上,2-bit才出现一点下滑——按第三方排行榜的大致位置,下滑后仍接近Opus 4.7或Gemini 3.1 Pro的区间,不算顶尖,但也谈不上不能用。

量化不是匀速衰减,而是先无感、后断崖。

1-bit是另一个故事。原因之一是推理设置:默认的xhigh档会让模型想得更久,但1-bit模型常常想到token预算耗尽,最后交一份空答案。推理越努力,表现反而越差。

体积与质量的取舍 55GB BF16 全精度 基准线 17GB Q4_K_M 质量几乎无损 6.2GB UD-IQ1_S 逼近随机水平

为什么这组数字对本地开发者重要

显存预算不能只算模型体积。测试用的是F16的KV缓存,每3.2万token上下文大约要占2.3GB显存。

24GB的RTX 4090装下17GB的Q4_K_M之后,剩下的显存要在上下文长度和安全余量之间分配。原文给出的约6.4万token,已经是这套配置能撑住的上限,不是模型体积省出来的空余。

对计划在消费级GPU上本地跑Qwen3.8 27B的开发者,这组数字能直接落到一个动作:先算清楚自己的显卡能不能同时装下Q4_K_M、目标上下文和KV缓存的安全余量。24GB显卡基本能稳稳装下,不用往下压。显存在这条线以下的用户,原文没有给出对应档位的具体数字,只能类推——上下文要求越低,越有资格留在4-bit;上下文要求高,才值得考虑降到2-bit。

需要在质量、显存预算和上下文长度之间反复权衡的个人或小团队,更该盯的是任务本身能不能容忍2-bit在Terminal-Bench和GPQA上那点下滑,而不是死盯显存数字本身。

2-bit省显存,不一定省算力。测试发现,在同样能解出的Terminal-Bench任务上,2-bit模型用的对话轮数和BF16一样,却多写了约四分之一的token。显存降了,推理时间和成本未必跟着降。

这跟此前对上一代Qwen3.6 27B的量化测试结论相呼应——那次测试里,压缩到16GB仍能保住大部分知识。量化曲线"先无感、再小跌、最后断崖"的形状,在Qwen这几代模型上看起来是个相对稳定的模式,但目前也只是两次观察,还谈不上定论。

这个结论管多远

测试用的是2026年8月16日的一个llama.cpp构建版本,量化文件来自Unsloth。2-bit、4-bit、8-bit用v2版本,1-bit用v3版本。

麻烦的是,Unsloth在8月19日替换了v2文件。原文测试用的那批文件已经找不到了,后来者想完全复现同一组数字,并不容易。

8-bit的Q8_0这次被直接跳过,结论只是"预期落在4-bit和全精度之间",不是实测数字。这些结果也来自单次测试,没有给出误差范围,也没有独立团队复测过——4-bit"几乎无损"和1-bit"接近随机",更像是这套特定测试条件下的观察,不是能直接套用到所有硬件和量化实现的定论。

这些结论只覆盖GPQA Diamond、IFBench、Terminal-Bench 2.1这三项特定测试,和这套特定量化实现,不能直接推广到长上下文场景、KV缓存量化,或者其他厂商的1-bit方案。

接下来值得盯的是三件事:有没有人用替换后的v2文件重新跑一遍这三项测试;Q8_0的实测分数会不会补上;长上下文或KV缓存量化会不会把"4-bit几乎无损"这条结论推倒。

对计划在消费级显卡上跑Qwen3.8 27B的人,眼下最实际的判断是:先看4-bit能不能塞进自己的显卡和目标上下文,能塞下就不用纠结。真到了必须压到2-bit甚至1-bit的地步,先想清楚任务本身能不能容忍随机水平的答案。

【锐评】省一分显存,丢一分底气——1-bit这笔账,划不来。