阿里巴巴Qwen实验室上周发布了27B参数的视觉大模型Qwen 3.8 27B,Apache 2.0协议开源。独立测试者Simon Willison用同一道"画一辆鹈鹕骑自行车"的SVG测试题跑了两遍:开着官方默认的最高推理强度,模型想了21分钟,烧掉22276个推理token才吐出3223个token的结果;把推理关掉,同样的题目137秒搞定,产出反而更长,有3715个token。默认设置比关闭推理慢了将近十倍,这不是小毛病,是这次发布里最值得说道的事。
同一道题,21分钟和2分钟的差距
Qwen官方文档写得很清楚,reasoning_effort参数支持三档:xhigh、medium、low,用来在准确度和速度之间取舍。但模型默认就锁在最耗算力的xhigh档,测试者用的LM Studio量化版本也原样保留了这个默认值。
更离谱的是极简单的请求也逃不掉。测试者只输入"画一个圆的SVG",模型的推理过程却在纠结要不要加渐变、要不要做同心圆构图、配色用暖色还是冷色,几分钟后交出一个带动画效果的抽象圆环设计——完全不是用户要的东西。
- 风险.默认最高推理档会让本地用户误以为模型"很慢很笨",实际上换个参数体验完全不同。
默认拉满,更像是为了跑分好看
这套默认值的逻辑并不难猜。推理token越多,模型在复杂基准测试上的分数通常越高,官方给出的自评跑分显示Qwen 3.8 27B全面超过前代Qwen 3.6 27B,也超过了今年5月还被视为同门最强模型之一的闭源版Qwen 3.7-Plus。把默认档位设到最高,跑分演示时数字自然最漂亮。
问题是普通用户拿到手的不是跑分环境,是笔记本电脑和有限的耐心。一个27B参数、17GB体积、号称能在消费级硬件上跑起来的模型,如果日常用起来要等二十分钟,"能在笔记本上跑"这个卖点就打了折扣。测试者的建议很直接:拿到手先把推理强度调到low甚至关掉,再决定要不要为特定任务加码。
默认设置好看是给演示用的,不是给用户用的
官方跑分之外,还没人验证过
值得留意的是,测试者自己也没有把官方跑分当结论,他明确表示"独立评测结果如何值得关注"——言下之意,Qwen 3.6、Qwen 3.7-Plus、Qwen 3.8这几个版本之间的对比目前只有阿里一方给出的数字,还没有第三方机构做过交叉验证。这在推理模型这个赛道并不罕见:新模型发布节奏太快,独立评测机构往往跟不上官方发布的速度,跑分先入为主地占据了舆论场,验证要等上几周甚至几个月。
这中间还有个现实限制:本地跑27B模型的速度本来就吃硬件。测试者在MacBook Pro和NVIDIA DGX Spark上用LM Studio实测,速度大约在每秒15到30个token,跟云端托管的模型比明显慢一截——同期的OpenAI闭源模型,一款能跑到每秒74个token,另一款更快,接近每秒184个token。本地部署省下的是API费用和数据隐私,换来的是等待时间,这笔账每个想用它跑编程代理或者批量任务的人都得自己算。
本地部署的爱好者和开发者是这次最直接的受影响群体:拿到模型第一件事是改参数,而不是直接跑默认值。阿里官方的产品逻辑也该被追问——把最费时间的档位设成默认,到底是为了展示最好的分数,还是没考虑清楚终端体验。接下来真正该看的,是有没有独立评测机构对这几个版本做交叉验证,以及官方会不会调整这个默认档位。
