网上开始流传一份186页的PDF,标题是《Redacted Risk Report August 2026》,落款Anthropic,链接挂在Anthropic自己的CDN域名下。目录看起来相当专业:高风险场景下的模型失准、自动化AI研发加速、化学与生物武器产能提升,三大威胁模型一个不少,格式对标Anthropic自家的Responsible Scaling Policy。

问题是,这份文件的发布时间标注为2026年8月14日——如果你现在读到这篇文章,大概率还没到那一天。一份"已发布"的官方报告,日期却指向未来,这是第一个不对劲的地方。

三层核查,第一层就卡住了

判断一份自称"官方"的文件是否可信,通常从三个地方下手:域名、日期、独立信源。

这份PDF的域名是Anthropic真实使用的CDN路径,不是伪造的钓鱼链接,这一点具备迷惑性。但把标题和关键代号拿去检索,找不到anthropic.com上任何独立可验证的发布记录——没有官方博客提及,没有对应页面,没有第三方安全研究者交叉确认。日期指向未来、又查无实据,这两条叠在一起,基本可以判定:至少现在,没有证据支持它是一份已经正式对外发布的官方文件。

(免责说明:现有检索能力有限,不能100%排除它是内部草稿泄露或未来某次发布的预印本,只能说"目前看不清",不能说"已证实"。)

命名体系,一半熟悉一半陌生

第二层核查看得更细。Anthropic对外沟通的模型命名一直很稳定:Claude、Opus、Sonnet、Haiku,配合ASL-2、ASL-3这样的安全等级标签。这份报告里出现的却是Mythos 5、Model 2、Fable 5这类从没在公开场合露面的代号,唯独"Opus 4.8"和现有版本号规律对得上。

命名体系对照 已知的公开命名 Claude Opus Sonnet Haiku ASL-2 / ASL-3 分级体系 文件中出现的代号 Mythos 5 Model 2 Fable 5 Opus 4.8 仅 Opus 4.8 与已知规律吻合

三个陌生代号加一个吻合的版本号,这种混合特征值得留意:如果是纯粹伪造,通常会全套编造,不会特意留一个真实感极强的锚点;如果是真实泄露的内部草稿,那说明Anthropic内部确实存在一套外界从未见过的产品代号体系,只是还没到对外披露的阶段。两种可能都存在,谁也不能拍死。

RSP这类报告,天生容易被仿造

Anthropic从2023年起就用Responsible Scaling Policy和ASL分级体系,定期发系统卡、红队评估,做的是行业内少见的"自我风险披露"。OpenAI的Preparedness Framework是同类思路。这种文本有固定套路:威胁模型分类、能力现状、风险缓解措施、前瞻计划,读起来像论文又像合规文件。

套路一旦固定,就最容易被高仿。格式对、术语对、章节结构对,普通读者很难从行文风格上分辨真假,只能靠外部证据——域名、日期、独立信源、命名体系——一层层查。这份"2026年8月报告"恰恰卡在两处硬伤上:时间线不通,来源不独立。

  • 风险.这类"高仿官方文件"一旦被大量转发,很容易被当成AI治理讨论的既定事实,污染监管和公众判断的基础信息。

内容本身,姑且当参考读

即便真伪未定,报告目录透露的三大关切——模型会不会在高权限场景里偷偷越界、自动化AI研发会不会让能力提升失控加速、模型会不会给生化武器研发提供实质性帮助——确实是过去两年AI安全圈反复讨论的核心议题,框架本身没有编造的痕迹,更像是有人摸透了这套话术之后做的仿真练习,或者是一份提前泄露、尚未官方确认的草稿。

标题里的"Redacted"值得多想一层。哪怕这份文件全部属实,被涂黑的内容本身就是一块信息黑洞——外界永远不知道被隐去的部分改变了整体判断多少。这提醒我们:读一份"已编辑"的风险报告,拿到的从来不是全貌,只是对方愿意给你看的那部分全貌。

  • 结论.判断一份泄露文件的真假,比读懂它写了什么更重要,这才是能复用到下一次类似事件的方法。

接下来真正该盯的,是Anthropic官方是否会就此发声、是否有独立安全研究者拿出交叉证据、以及"Mythos""Fable"这些代号会不会在未来某次正式发布里被印证。哪一条先出现,答案就先出现在哪一条上。