让大模型学会像一个半世纪前的发报员那样说话,正在成为降低算力账单的最新尝试。Travis Smith 近期开源的基准测试 The Telegraph Test 抛出一个极具诱惑力的数据:只要在提示词里加上一句指令,让模型用剔除虚词的电报体输出,GLM-5.3-Flash 就能节省 48.4% 的输出 Token,Qwen3.8-27B 节省 48.9%,Gemma-4-31B 也能降下 40.4%。而在跨模型测试中,下游模型读取这套高度压缩的记录,问答恢复率甚至维持在 0.99 到 1.10 之间。

看似不费吹灰之力的免费午餐,在工程落地里往往暗藏玄机。世人皆见其省字,未见其耗神;一旦扒开代码审计与计费底牌就会发现,这套极简协议不仅无法通用,甚至会在当下普及的推理模型上让账单反向翻倍。

沉睡在语料里的发报员

1866 年横跨大西洋的海底电缆开通,每发送十个单词就要收一百美元,相当于今天的两千六百美元。昂贵的计字费逼出了电报体:删掉冠词、代词与客套,只留核心事实。百余年的人类印刷史完整吸收了这套文本形态,最终原封不动地沉淀在现代大模型的预训练语料里。

测试表明,模型无需微调,仅凭单句提示词就能唤醒这种压缩本能。但提示词的细节极其苛刻:必须强制指定使用小写字母。若放任模型按照历史惯例输出全大写电报体,分词器在切分大写字母时的效率骤降,格式化代价会瞬间吞掉 14 到 19 个百分点的节省幅度。

输出端电报体压缩收益与格式陷阱 48.9% Qwen3.8-27B 节省 48.4% GLM-5.3-Flash 节省 40.4% Gemma-4-31B 节省 -19% 全大写格式损耗惩罚 关键约束:只有在完全关闭思考链的前提下,小写指令才能跑出近半的净输出减免。 注:各模型节省比例基于自身独立分词计量,数据源自 The Telegraph Test 冻结测试集。

在多智能体流水线里,输出 Token 的单价通常是输入的 3 到 5 倍。如果仅仅是将中间沉淀结果传递给后续模型消费,这种省去修饰词的做法看起来极其自然。然而,这种优势只存在于传统的单向生成结构中。

推理模型的账单反噬

行业正在快速转向内生推理模型,而电报体与思维链的碰撞直接击碎了降本预期。随后的计费审计揭开了残酷的现实:当测试转向 GPT-5-mini 这类强制启用思考的模型时,要求其撰写电报体虽然在最终可见文本上省了 17.7%,但模型为了做语义精简,内部思考 Token 中位数从常规纯文本的 128 直接暴增至 384。

结果就是显性字符变短了,计费输出却翻了一倍,净写入节省变成了负 99.8%。

极简表达非但没有减负,反而逼迫模型用更深的长考去解压缩题。

早期测试在 GLM-5.3-Flash 上也犯过类似错误,因接口未硬性剥离思考参数而带入额外开销,后续审计才明确修正:电报体压缩绝不能套在推理模型头上。

常规模型与强制推理模型的成本流向分歧 非推理端点(无 CoT) 输入文本 → 单向编码生成 → 电报体输出 Token 开销下降近 50% 账单按可见输出结清,收益完全兑现 推理端点(如 GPT-5-mini) 输入文本 → 隐式思考激增(128→384)→ 短输出 账单写入节省为 -99.8% 压缩难度诱发长思考链,费用直接翻倍
  • 风险.在无法完全关闭推理参数的 API 端点上部署电报体压缩,会导致思考溢价直接吞噬上下文节省,引发意料之外的费用失控。

评测脚本掩盖的真实损耗

比账单反噬更值得警惕的,是那个号称超越纯文本的 1.09 恢复率。

作者在核心跨模型评测集 crossmodel_xm4 中使用了 694 个锚定问题,在单模型组 cablese_cbl2 中使用了 727 个问题。表面上看下游读取电报体回答得更好,但细究测试代码中的评分函数 ab/grade.py,其准确率计算依据的是字符集合的重合比例:

overlap = |expected ∩ answer| / min(|expected|, |answer|)

只要这个交集比例达到 0.8 就判定为完全正确。这种计算方式存在致命的盲区:当期望答案是 approved 时,模型如果回答 not approved,词交集依然是 1.0 满分;期望答案是 John Smith,模型回答 John 同样被判定为满分。

更重要的是,所谓 1.09 的恢复基线,对比的仅仅是经过二度提炼的纯文本总结(准确率 75.8%)。如果直接对比原始未压缩的全文材料(准确率 91.5%),电报体记录的准确率仅为 82.5%,实际上存在 9 个百分点的不可逆降级。

同时,在显著性分析中,727 题里仅提取了 662 个有效对进行麦克尼马尔检验,且完全是在独立题目级别执行,没有针对同源阅读篇章做聚类控制。电报体之所以显得更准,很可能是因为它去掉了长难句结构,恰好避开了简陋评测脚本对冗余词汇的过度扣分,并非真正做到了语义无损。

信息保留的真实梯次分布 原始完整全文 (参考基准) 91.5% 电报体记录 (Cablese Record) 82.5% 纯文本总结 (对照基线) 75.8% 电报体相对纯文本总结看似高出 1.09 倍,但相比原始文本依然存在实质性降级。

学术界此前并非没有探索过压缩路线。微软在 ACL 2024 提出的 LLMLingua-2 采用非生成式的词元剪枝,依靠专门蒸馏的小编码器直接划定保留词,提取速度比对比方案快 3 到 6 倍,虽然保留原词遏制了幻觉,但难以重塑深层逻辑;而 2026 年 5 月的生成式方案 Telegraph English 虽然在长文本细粒度事实问答上刷到了 96.5% 的准确率,但其平均保留了 58.5% 的内容,对比 LLMLingua-2 基线时并未处于相同的预算约束下。

  • 建议.电报体只适合用于思维链闭环之后的暂存区、Agent 间低敏状态交接等宽容场景;任何涉及合同、审批、金额等对否定词与主谓约束极度敏感的核心业务,必须避开此类有损重写。