每次前沿大模型发布,社区里总会准时上演同一出悬疑剧:新玩具刚上手惊为天人,两周之后开发者便开始怀疑模型被厂商偷偷削弱。

量化压缩、偷换小模型、暗削思考预算,各种猜测在社交网络上此起彼伏,却始终只能停留在信者恒信的体感玄学。原因很简单,过去从未有人在模型发布当天拉起一条不受干扰的基准线。Anthropic 在 2026 年 9 月 22 日推出 Claude Opus 5.5,给出输入每百万 token 4 美元、输出 20 美元的标价,名义价格比上一代降低 20%,官方宣称综合工作流成本可省下约 40%。伴随这轮降价,针对性能漂移的疑虑再次浮出水面。

开发者 ninjahawk 启动的开源项目 livenerf,就是为了终结这种无休止的体感辩论。该项目借助英国人工智能安全研究所的 Inspect 框架,利用 Claude Max 订阅配合固定的 Claude Code 2.1.280 无头命令行,在模型上线约 2.5 天后正式打下 Day-0 桩位,展开为期 30 天 的追加式监测。

livenerf 评测流水线设计 1. 题库敏感筛选 2,336 道高难题库 筛出 78 道敏感题 2. 冻结外部环境 固定 CLI 2.1.280 无头单轮纯文本执行 3. 每日双轨采集 78 个测试样本 12 个对照样本 4. 统计判定决策 成对逐题差分 双 10 天窗口校验

打造一把锁死变量的标尺

现代前沿模型普遍内嵌思考机制,且大多移除了面向用户的采样超参数。面对本质上具备随机分布特征的推理黑盒,单次测试的对错毫无说服力。

锁死全部外部变量,从海量题库中筛选出78道临界敏感题作为基准
锁死全部外部变量,从海量题库中筛选出78道临界敏感题作为基准

livenerf 的破局思路是彻底放弃对单次输出确定性的执念,转而将其余一切外部要素牢牢锁死。测试团队最初动用了 2,336 道涵盖 GPQA Diamond、MMLU-Pro、竞赛数学与 AIME 的题库,对新模型进行校准排查。测试显示模型首轮答对率高达 93%,其中 97% 的题目表现为恒对或恒错。如果题目每次必对,哪怕模型能力下滑也无法显现;如果题目恒错,同样测不出变化。

最终进入核心测试面板的,只有被筛选出的 78 道敏感题。这些题目在未校准前的通过率在临界线徘徊,换用全新样本复测后的实际通过率为 62.0%。

在执行层面,评测杜绝了一切提示词工程或外挂工具干扰:固定空工作目录、单轮交互、无记忆状态,代码题由外部沙箱直接根据输出文本跑测试用例,不使用容易产生自我漂移的大模型充当裁判。评测每日运行 90 个样本,包括 78 个测试样本与 12 个上一代对照样本。前 10 天确立为基准期,后设两个 10 天观测窗口。按照预注册规则,只有在 99% 置信区间 下两组窗口的绝对分差均不低于 3 个百分点,且对照组未出现同向波动,才能在统计学上认定模型确实发生了漂移。

截至 2026 年 9 月 29 日,该项目已稳定采集了 6 天基准数据,尚未得出任何降级或增强的论断。


严密统计背后的灵敏度代价

这套设计在方法论上足够干净,但也揭示出黑盒测试必须面对的物理限制。

调低服务层节流阀会让输出消耗骤降,最终准确率却只受到轻微影响(剖面示意)
调低服务层节流阀会让输出消耗骤降,最终准确率却只受到轻微影响(剖面示意)

在有限的算力开销下,追求低假阳性率必然导致检测灵敏度的妥协。以目前每日单轮测试的规模换算,该体系在一个 10 天观测窗口内能辨别的准确率变化下限约为 7.5 个百分点。

更反直觉的结论出现在验证阶段:项目组在验证阶段尝试将底层模型替换为上一代的 Opus 5,结果在 99% 置信度下,准确率波动仅为 −3.8 ± 6.3 个百分点。换句话说,现有样本量甚至无法在单次验证周期内把跨代模型的替换在统计学上明确揪出来。

推理 Effort 档位调整的非对称代价 降至 Medium 档位 -26% 输出 Token 消耗 准确率仅下降 4.2 ± 3.9 百分点 降至 Low 档位 -62% 输出 Token 消耗 准确率下降 8.3 ± 4.5 百分点

真正对算力调控敏感的,不是最终准确率,而是输出的 token 规模。验证数据显示,当人为将推理努力程度从 high 调低至 low 时,模型输出 token 骤降 62%,而准确率仅下跌 8.3 ± 4.5 个百分点;即便是调至 medium,也能直接节省 26% 的 token 消耗,对应准确率损耗仅有 4.2 ± 3.9 个百分点。

决定模型体感的往往不是核心参数变动,而是服务层的算力节流阀。
  • 风险.若厂商在服务端逐步压缩思考预算,基于题库准确率的外部评测极难在短期内发出告警,但复杂工程任务中的调用体验会率先发生劣化。

变笨的真正元凶藏在服务层

大家习惯将模型变笨归咎为阴谋论:仿佛厂商机房里有一位精明的工程师,在用户涌入后按下按钮,把旗舰模型偷偷置换成粗制滥造的廉价量化版。

导致性能体感滑坡的真正原因,往往是服务层路由调度与配额限制
导致性能体感滑坡的真正原因,往往是服务层路由调度与配额限制

但在真实的工程实践中,这种恶意调包几乎不存在,也无必要。复盘 Anthropic 过往披露的技术故障,每一次引发广泛质疑的性能回退,全部来自于产品服务层的调整与事故:

  • 客户端配置降级,例如早先在更新中将默认推理配置悄悄从 high 改为 medium;
  • 上下文处理缺陷,如空闲会话由于长文本管理机制误丢弃前序思考历史;
  • 系统防护提示词微调,为防范滥用而严格限制工具调用间隙的文本返回长度;
  • 基础设施故障,包括特定硬件环境下的编译异常以及长短文本请求的路由调度失衡。

大模型正在经历从预训练算力到推理性测试时算力的重心转移。在当前竞争态势下,不仅 Anthropic 连续推出 Opus 5.5 与 Sonnet 5.5,OpenAI 的 GPT-5.5 与 Google 的 Gemini 3.x 也在多方施压。为了维持高并发下的服务利润率,服务侧任何细微的提示词拼接、缓存淘汰策略或算力配额微调,都足以在终端引发连锁反应。

  • 结论.与其紧盯神秘的模型权重降级,不如在工程流水线中主动监控实际输出的推理 token 分布与思考连贯性。

建立对现代 AI 服务的确定性信任,不能仅依赖民间的抓包逆向。厂商如果想真正摆脱周期性的舆论内耗,就必须在 API 与订阅端提供思考算力消耗、动态路由规则与系统层变更的清晰审计口径。否则,哪怕日后 livenerf 在 30 天周期结束后给出一份完全合格的答卷,用户与黑盒之间的猜忌链条依然不会断裂。