Anthropic在自己的开发者文档里开了一个页面,专门记录Claude系统提示(system prompt)从Claude Haiku 3一路到最新几代模型的每一次修改时间。这份记录本身没有惊天动地的内容,但动作性质少见:大模型开始对话前被塞进去的那段"隐藏指令",它的更新历史被摆到了台面上。文档里还写清楚一件容易被忽略的事——这些更新只对claude.ai网页版和iOS/Android应用生效,跟Claude API完全无关。
系统提示长期被各家公司当成机密,普通用户过去只能靠诱导话术去"套"。Anthropic从2024年起主动公布这段版本史,这是行业里相对罕见的做法。
网页版和App在调,API用户什么都不会变
文档里有一句技术细节值得单独拎出来:从Claude 4.6这一代开始,每个模型ID被视为固定快照,系统提示不再多次修订,只留一条记录。这意味着此前那种"同一个模型名字,提示词悄悄改了好几轮"的情况,以后基本不会再出现。
回看历史记录,修订最密集的几个系列是Sonnet 3.5、Sonnet 4、Opus 4、Sonnet 4.5和Haiku 4.5——这些恰好是Anthropic消费级产品打磨最凶的阶段,说明系统提示的调整节奏,本质上跟着产品迭代密度走,不是随机改动。
对用调用Claude API做产品的开发者来说,这条边界很实在:网页版换了口吻、格式偏好或拒答策略,跟你的产品行为没有关系。API侧的Claude靠的是开发者自己写的系统提示和参数,Anthropic这份更新记录只是给消费级产品用户和体验型用户看的说明书。
公开的只是"消费级客厅",Agent和工具房间还锁着门
把Anthropic这个动作放进行业坐标系里看,会更清楚它的分量。OpenAI公开的是Model Spec,一份描述系统/开发者/用户指令层级的抽象规范,明确说明可能省略实现细节,不等同于生产环境的完整提示。Google在Gemini上更偏向讲红队测试、模型加固这类防御手段,也没有公开完整生产提示文本。
三家的选择拼出一条谱线:Anthropic给出具体到日期的版本记录,OpenAI给出抽象规范,Google干脆只谈方法论不谈文本。单看这条线,Anthropic确实站得靠前。
但"最透明"这个说法要打折扣。Anthropic公开的只是网页/App核心提示,Claude Code、浏览器插件、Agent这些工具专属的指令仍然没有对外披露。相当于只开放了客厅,卧室和工具间都还锁着。
公开提示词是姿态,不是安全边界。
97%的提取成功率,说明"藏起来"从来靠不住
安全研究界对这类透明动作有一个共同提醒:提示词能不能被公开,跟系统安不安全,是两件不搭边的事。西北大学的研究者测试了200多个自定义GPT,提示提取成功率达到97%,关联文件泄露成功率达到100%。这组数字说明,靠"模型不复述指令"这个假设去守安全,本身就站不住。
- 风险.公开提示词≠系统安全,真正该防的是权限、凭证和文件访问,不是一段自然语言指令。
更值得盯的是,行业普遍认为间接提示注入——攻击者把恶意指令藏在网页、邮件、文档里,诱导Agent执行未授权操作——比提示提取危险得多。这个问题OpenAI和Google都当作未解难题,提示词公开与否,对它几乎没有帮助。
社区的反应也不统一。有人认可这种"反填充式"的坦诚风格,也有人质疑靠自然语言约束模型行为,边界本来就不牢。这两种声音同时存在,说明这件事离"解决"还远。
需要提一句审慎的话:部分检索资料里出现了Claude Opus 5、Claude Fable 5及2026年的更新日期,这些信息目前无法用公开渠道核实,可能是未来规划或推测性内容混入,读者和同行引用时应留一手,不要当成既定事实。
对claude.ai和App的普通用户来说,知道有这份版本记录是件好事,至少行为变化有官方依据可查。对企业采购方而言,"是否公开系统提示"可以作为供应商透明度的一项参考指标,但不该是唯一指标——工具权限设计、沙箱隔离这些看不见的部分,才是真正决定安全水位的地方。
