科技媒体 MarkTechPost 近日报道了一个引发本地 AI 社区震动的开源项目:ConwayResearch 推出了名为 Underdog-Saluki-27B-1.0 的模型,声称通过 2-bit 混合量化(IQ2-mix),将原本需要 54 GB 显存的 Qwen3.8-27B 压缩至 7.89 GB,并在智能体关键的工具调用(Tool Calling)基准上反超了全尺寸原版。
在本地部署与消费级显卡玩家眼里,这是一则标准的以弱胜强叙事。但如果穿透极度浓缩的模型卡宣传,就会发现这场逆袭背后堆叠了严重的统计方差、不可忽视的格式损毁率,以及把静态文件与运行时显存混为一谈的工程障眼法。
120 题抽样下的胜出与暴跌的数学基底
发布方 ConwayResearch 给出的核心论据,是在原生 stock llama.cpp 框架下测试的 Underdog Bench 工具调用集。该测试基于 BFCL v4 抽取的 120 项子任务,在关闭 thinking、温度设定为 0 的严苛条件下,Saluki 27B 取得了 88/120 的成绩,而原始全尺寸 Qwen3.8-27B 仅为 84/120。在 100 项并行工具调用任务中,Saluki 27B 也以 42/100 领先原版的 35/100。
从表面上看,模型不仅瘦身近七成,还展现出更强的结构化参数提取能力。发布方顺势宣称其以约七分之一的体积保留了原版 96% 的综合性能。在 IFEval 的宽松提示测试中,它也以 93.5 微弱领先全尺寸版本的 91.5。但在更依赖严密逻辑推演的基准上,掩盖在均分下的裂痕迅速暴露。
在考察前沿数学推理的 AIME 2025(avg@4)测试中,全尺寸 Qwen3.8-27B 能拿到 96.7 的高分,而 Saluki 27B 剧烈失血至 79.2,仅保留了原版约 82% 至 85% 的水准。在软件工程基准 SWE-bench Verified 的 50 题抽样中,Saluki 27B 亦以 30 题落后于原版的 33 题。
120 道题的局部测试里仅多做对 4 道题,在大模型评测中很容易被样本切分方差完全吞没。把一个小样本任务的微小扰动放大为能力全面反超,忽视了推理主干遭到重创的客观事实。
两成格式损毁与被隐去的运行时显存
工具调用对生产系统最基本的要求不是偶发性的聪明,而是格式的绝对严密。如果在自动化工作流中模型输出的 JSON 语法断裂,下游系统将直接抛出异常并中断任务。
模型卡自身的警告揭示了这一隐患:在并行工具调用中,约 五分之一(1/5) 的回复存在轻微格式错误。在单卡交互演示中,多一个括号或少一个逗号或许可以被人类肉眼容忍,但在无人工干预的 Agent 调用链路中,20% 的格式语法破损意味着工作流整体可用性的雪崩。
工具调用的核心价值是自动化执行,两成语法失律足以摧毁整个调用链路。
另一个巨大的认知落差在于部署成本。Saluki 27B 宣称体积小于 8 GB,可选视觉模块额外占用 629 MB 或 928 MB。许多本地开发者据此认为一张 8GB 显存的甜点级显卡(如 RTX 4060)就能跑起完整的 27B 级智能体。但这一数字指的仅仅是硬盘上的静态权重文件。
模型卡并未提供任何实测运行时的总 RAM 与 VRAM 占用报告。在实际推理中,工具调用通常伴随着大段系统提示词、Schema 定义和多轮上下文交互,KV Cache 占用的显存极其可观。一旦把输入上下文推高,7.89 GB 的模型会立刻击穿 8GB 硬件物理上限,引发向系统内存的吞吐回退,推理速度断崖式下跌。
- 风险.将该模型作为 8GB 显卡生产级智能体落地的团队,很快会遭遇显存溢出与高发语法解析错误的双重打击。
复现真空与社区对评测黑盒的审视
Saluki 27B 发布后,Reddit 社区的 r/LocalLLaMA 板块在 2026 年 10 月 8 日至 9 日展开了密集讨论。本地开源社区的开发者并未盲目乐观,而是迅速将疑点聚焦在方法论与复现透明度上。
质疑的核心首先在于发布方至今未公开评测 harness 脚本,也没有披露 120 项测试选取的具体任务 ID 与原始回复输出记录。对于使用 stock llama.cpp 的推理项目,环境细节至关重要,但发布方未提供固定的 llama.cpp 提交版本(commit),也未公开量化校准(calibration)流程的具体工程细节。
更为敏感的问题在于评测基准的分数对齐。有开发者指出,发布方在横向对比时,存在将自测分数与来自不同评测框架(harness)的公开原版分数混为一谈的嫌疑。缺少统一运行环境的基准对照,跑分本身的说服力大打折扣。截至目前,在 GitHub 与各大开源模型排行榜上,没有任何公认的第三方独立机构成功复现这组逆袭数据。
极低比特量化(IQ2-mix)确实是一项出色的工程压缩技术,但技术演进有其物理规律。极端量化削减了权重矩阵的表达冗余,必然伴随着底层逻辑容错空间的收窄。
- 建议.在官方开源完整的校准流水线、评估任务 ID,并由独立社区在无特挑的完整 BFCL 测试集跑出无偏复现前,不必急于调整本地硬件与技术选型。
