让大模型学会像一个半世纪前的发报员那样说话,正在成为降低算力账单的最新尝试。Travis Smith 近期开源的基准测试 The Telegraph Test 抛出一个极具诱惑力的数据:只要在提示词里加上一句指令,让模型用剔除虚词的电报体输出,GLM-5.3-Flash 就能节省 48.4% 的输出 Token,Qwen3.8-27B 节省 48.9%,Gemma-4-31B 也能降下 40.4%。而在跨模型测试中,下游模型读取这套高度压缩的记录,问答恢复率甚至维持在 0.99 到 1.10 之间。
看似不费吹灰之力的免费午餐,在工程落地里往往暗藏玄机。世人皆见其省字,未见其耗神;一旦扒开代码审计与计费底牌就会发现,这套极简协议不仅无法通用,甚至会在当下普及的推理模型上让账单反向翻倍。
沉睡在语料里的发报员
1866 年横跨大西洋的海底电缆开通,每发送十个单词就要收一百美元,相当于今天的两千六百美元。昂贵的计字费逼出了电报体:删掉冠词、代词与客套,只留核心事实。百余年的人类印刷史完整吸收了这套文本形态,最终原封不动地沉淀在现代大模型的预训练语料里。
测试表明,模型无需微调,仅凭单句提示词就能唤醒这种压缩本能。但提示词的细节极其苛刻:必须强制指定使用小写字母。若放任模型按照历史惯例输出全大写电报体,分词器在切分大写字母时的效率骤降,格式化代价会瞬间吞掉 14 到 19 个百分点的节省幅度。
在多智能体流水线里,输出 Token 的单价通常是输入的 3 到 5 倍。如果仅仅是将中间沉淀结果传递给后续模型消费,这种省去修饰词的做法看起来极其自然。然而,这种优势只存在于传统的单向生成结构中。
推理模型的账单反噬
行业正在快速转向内生推理模型,而电报体与思维链的碰撞直接击碎了降本预期。随后的计费审计揭开了残酷的现实:当测试转向 GPT-5-mini 这类强制启用思考的模型时,要求其撰写电报体虽然在最终可见文本上省了 17.7%,但模型为了做语义精简,内部思考 Token 中位数从常规纯文本的 128 直接暴增至 384。
结果就是显性字符变短了,计费输出却翻了一倍,净写入节省变成了负 99.8%。
极简表达非但没有减负,反而逼迫模型用更深的长考去解压缩题。
早期测试在 GLM-5.3-Flash 上也犯过类似错误,因接口未硬性剥离思考参数而带入额外开销,后续审计才明确修正:电报体压缩绝不能套在推理模型头上。
- 风险.在无法完全关闭推理参数的 API 端点上部署电报体压缩,会导致思考溢价直接吞噬上下文节省,引发意料之外的费用失控。
评测脚本掩盖的真实损耗
比账单反噬更值得警惕的,是那个号称超越纯文本的 1.09 恢复率。
作者在核心跨模型评测集 crossmodel_xm4 中使用了 694 个锚定问题,在单模型组 cablese_cbl2 中使用了 727 个问题。表面上看下游读取电报体回答得更好,但细究测试代码中的评分函数 ab/grade.py,其准确率计算依据的是字符集合的重合比例:
overlap = |expected ∩ answer| / min(|expected|, |answer|)
只要这个交集比例达到 0.8 就判定为完全正确。这种计算方式存在致命的盲区:当期望答案是 approved 时,模型如果回答 not approved,词交集依然是 1.0 满分;期望答案是 John Smith,模型回答 John 同样被判定为满分。
更重要的是,所谓 1.09 的恢复基线,对比的仅仅是经过二度提炼的纯文本总结(准确率 75.8%)。如果直接对比原始未压缩的全文材料(准确率 91.5%),电报体记录的准确率仅为 82.5%,实际上存在 9 个百分点的不可逆降级。
同时,在显著性分析中,727 题里仅提取了 662 个有效对进行麦克尼马尔检验,且完全是在独立题目级别执行,没有针对同源阅读篇章做聚类控制。电报体之所以显得更准,很可能是因为它去掉了长难句结构,恰好避开了简陋评测脚本对冗余词汇的过度扣分,并非真正做到了语义无损。
学术界此前并非没有探索过压缩路线。微软在 ACL 2024 提出的 LLMLingua-2 采用非生成式的词元剪枝,依靠专门蒸馏的小编码器直接划定保留词,提取速度比对比方案快 3 到 6 倍,虽然保留原词遏制了幻觉,但难以重塑深层逻辑;而 2026 年 5 月的生成式方案 Telegraph English 虽然在长文本细粒度事实问答上刷到了 96.5% 的准确率,但其平均保留了 58.5% 的内容,对比 LLMLingua-2 基线时并未处于相同的预算约束下。
- 建议.电报体只适合用于思维链闭环之后的暂存区、Agent 间低敏状态交接等宽容场景;任何涉及合同、审批、金额等对否定词与主谓约束极度敏感的核心业务,必须避开此类有损重写。
