一份标注发布日期为2026年7月24日的Anthropic材料称,公司面向Claude Opus 5、Claude Fable 5等新一代模型,大幅精简了Claude Code的系统提示词,删减比例超过80%。Anthropic称,调整后在内部编程评测中没有发现“可测的性能损失”。
这组说法目前不能当成已经落地的产品新闻。发布日期晚于当前时间,“Claude Opus 5”和“Claude Fable 5”也不是已经得到公开确认的常见产品名称,尤其“Fable”需要进一步核验。更稳妥的理解是:这份材料透露了Anthropic可能正在验证的一条路线,即能力更强的模型不再依赖大量通用规则,工程重点开始转向工具设计、信息调度和结果验证。
Anthropic拟为Claude Code删掉八成提示词,模型开始摆脱规则堆叠
过去几年的Agent开发有一套常见做法:把行为要求、操作步骤、示例、异常处理和禁止事项全部塞进系统提示词。模型容易忘,就重复一遍;任务可能出错,就再补一条规则。提示词因此越写越长,CLAUDE.md之类的项目说明文件也容易变成无人清理的规则仓库。
Anthropic此次提出的方向几乎相反。材料称,新模型可以自行完成更多判断,因此Claude Code不必继续前置大量通用指令。超过80%的删减发生在系统提示词层面,不代表成本下降80%、延迟缩短80%,更不代表性能提升80%。原文没有提供这些数据。
新旧方法的差异,可以归纳为以下几项:
| 工程环节 | 旧方法 | 新方法 |
|---|---|---|
| 行为约束 | 明确写出大量规则,反复提醒 | 让模型处理通用判断,只保留关键边界 |
| 背景信息 | 尽量一次性放入上下文 | 需要时再加载,采用渐进披露 |
| 正确示范 | 在提示词中堆放多个示例 | 提供少量、高保真的参考结果 |
| 外部能力 | 重点打磨调用工具的文字说明 | 优先设计清晰、稳定、可检查的工具接口 |
| 长期信息 | 人工维护固定说明文件 | 结合自动记忆动态补充上下文 |
| 维护方式 | 出现失败就继续加规则 | 清理冲突和重复项,再做回归验证 |
材料还提到,Claude Code新增了claude doctor或/doctor,用于检查并精简Skills与CLAUDE.md。这个动作比“删掉八成”更有实际意义:Anthropic似乎准备把上下文维护从一次性写作,变成可以持续诊断的产品功能。
这件事真正说明的,也不是提示词已经过时。变化在于,提示词不再适合承担所有系统职责。模型需要什么信息、何时读取、通过哪个工具取得,以及调用失败后如何恢复,正在变成更重要的工程问题。
工程重心转向按需加载,但证据仍停留在Claude内部
“无可测性能损失”是这份材料里最容易被误读的一句话。它只指向Anthropic内部的编程评测,原文没有披露基准名称、样本量、任务分布、具体得分和误差范围,也没有说明是否覆盖长任务、并行工具调用、权限控制及高风险代码修改。
换句话说,目前能够确认的只是厂商自述,无法判断删减前后到底是完全持平,还是差异小到没有达到其内部测量门槛。没有公开提示词前后版本,也缺少第三方复现,外界更无法知道被删掉的是重复措辞、通用风格要求,还是曾经用于修补具体失败案例的规则。
这也限制了结论的适用范围。Anthropic可以同时调整模型、Claude Code、工具协议和评测体系,普通企业团队往往做不到。许多Agent还要混用不同厂商的模型,接入内部搜索、审批、数据库和权限系统。一套在Claude生态内有效的精简方案,换到能力较弱的模型或高合规场景,结果可能完全不同。
历史上,软件工程一直在把复杂性从一个层级转移到另一个层级。数据库减少了应用层的数据管理代码,但没有消灭数据建模;高级语言减少了手工内存操作,却没有取消边界检查。上下文工程也一样。系统提示词变短,不等于系统更简单,复杂性可能已经移到工具参数、检索策略、记忆写入和评测集里。
“过犹不及”适合描述旧式规则堆叠,但不能成为无差别删规则的理由。安全限制、合规要求和代码库特有的陷阱,仍然需要明确表达,并由系统权限和测试共同兜底。
Claude Code团队可以先清理重复规则,企业Agent必须分级试验
使用Claude Code的研发团队,最现实的动作不是马上删除80%的CLAUDE.md,而是先找出冲突、重复和已经失效的指令。比如相同的代码风格要求在多个文件中反复出现,或旧目录结构已经变更,相关规则就应合并或删除。项目独有的构建命令、不可修改目录、迁移步骤和发布禁区,则应继续保留。
搭建企业Agent的开发者要更谨慎。客服措辞、文档格式等低风险约束可以先做精简试验;付款、删除数据、权限变更、医疗与金融合规等规则,不应只靠模型自行判断,更不能因“新模型能力更强”而撤掉硬性校验。
一套可执行的验证流程应包括:
- 从单一仓库或低风险Agent开始,不直接改动全量生产配置。
- 为现有提示词建立版本,记录删改项及对应原因。
- 使用同一组真实任务做前后对照,覆盖成功率、工具误调用、越权行为和人工返工。
- 单独测试长任务、上下文接近上限以及工具失败后的恢复能力。
- 预设回滚条件;关键错误增加,即恢复原配置并定位缺失约束。
接下来应观察的变量很具体:Anthropic是否正式发布上述型号,是否公开Claude Code提示词的删改示例,/doctor能否解释每条清理建议,以及第三方团队能否在公开基准和真实代码库中复现“无可测损失”。
在这些证据出现前,“删掉八成”更适合被视为一个待验证的工程假设。可以试,但不宜照抄;可以减少通用约束,却不能把安全、合规和项目经验一并交给模型猜测。
