一名 Anthropic 资深安全研究人员说,到本世纪末,人工智能“杀死全人类”的概率超过 10%。

就在几小时后,曾在 Anthropic 和 OpenAI 参与训练 AI 系统的研究员 Jacob Coxon 宣布离职。他批评两家公司正“直奔可自我改进的超级智能”,却没有证明自己能控制这些系统。

两个消息挨得很近,冲击力自然很强。但有一个边界必须守住:这不是 Anthropic 官方宣布“AI 灭绝人类概率超过 10%”,也不是一份经过同行评审的风险模型。它更像一名内部安全研究者的个人判断,加上一名离职员工对行业竞速的公开抗议。

数字很吓人,证据仍然有限。真正重要的,是这两句话来自同一行业、同一类人,而且都指向同一个矛盾:最接近前沿模型的人,未必相信现有安全机制已经跟得上能力增长。

10%到底意味着什么

“超过 10%”不是天气预报,也不是保险公司的精算结果。

目前看不到这名研究人员使用了什么模型、如何定义“杀死全人类”、把时间范围中的哪些事件算进去,也不知道这个概率是针对某个具体模型,还是针对整个 AI 发展路径。

它至少可能包含几类完全不同的风险:

风险类型现实表现与“人类灭绝”的距离
模型滥用网络攻击、诈骗、自动化武器研发已经存在,影响通常是局部的
产品失控AI 在复杂任务中误判、越权、持续执行错误目标需要更强的工具权限和自主性
能力扩散高级模型被复制、泄露或被多个组织调用风险取决于访问控制和治理能力
长期失控系统获得持续改进、资源调用和规避限制的能力仍属高度不确定的极端情景

把这四类风险都压缩成“AI 杀人概率”,会让普通用户误以为聊天机器人明天就可能发动末日攻击。这个表达不够精确。

但它也不能被一句“只是个人观点”轻轻带过。安全研究者做的本来就是在信息不完整时估计极端风险。核电站不会因为事故概率无法精确计算,就不做冗余系统;航空业也不会把罕见事故当作“统计误差”。

问题在于,AI 行业现在同时扮演两个角色:它们既在估算风险,又在决定风险增长有多快。

安全团队看到的,和公司要交付的,不是一张表

Coxon 的离职指控,重点并不只是某个模型是否已经失控,而是公司有没有足够强的动机在能力竞赛中主动减速。

Anthropic 公开推动过 Responsible Scaling Policy,也持续强调模型评估、分级部署和前沿安全研究。这些动作说明公司并非完全没有安全框架。

但框架存在,不等于框架拥有刹车权。

公司要面对投资人、客户、竞争对手和产品发布时间。安全团队则更关心一个不容易写进季度目标的问题:模型能力一旦跨过某条线,现有评估是否还有效,出了问题谁能关掉系统,谁有权阻止下一次发布。

这几件事之间没有天然共识。

公开叙事实际约束
我们会在模型变强前完成安全评估能力增长往往快于评估方法成熟
我们会设置部署门槛客户需求和竞争压力会推动门槛下移
我们会监控模型行为复杂系统的异常可能只在真实环境中出现
安全团队拥有重要话语权最终发布权通常仍在管理层和产品线

所以,我不太买账的是“安全研究员发出警告,说明公司已经承认没有方案”这种说法。现有材料支撑不了这么重的结论。

更准确的判断是:公司可能有方案,但没人能证明这些方案足以覆盖下一阶段的能力。两者差别很大。前者是组织失职,后者是技术和治理能力都还没有经过压力测试。

这也是离职消息让人不安的地方。安全团队成员不是普通用户。他们了解训练流程、评估方法和发布节奏。如果连这些人都认为竞赛速度超过了控制能力,企业客户在采购模型时就不能只看价格、上下文长度和 API 稳定性。

普通用户暂时不用恐慌,但企业不能装作没看见

对大多数使用 Claude、ChatGPT 或其他助手的人来说,眼下更现实的风险仍然是隐私泄露、错误答案、权限配置失误、自动化诈骗和高风险场景中的误导。

“AI 可能在本世纪末毁灭人类”不会改变今天是否该用一个聊天机器人写邮件。但它会改变企业怎么采购、怎么部署、怎么给模型授权。

如果团队把 AI 接入代码仓库、客服系统、财务流程或内部知识库,接下来更该问这些问题:

  • 模型能访问哪些数据,能执行哪些动作?
  • 是否有人工审批和一键撤销?
  • 供应商有没有公布高风险能力评估?
  • 发生异常时,客户能否暂停调用,而不是只能等官方处理?
  • 模型升级后,原有测试是否会重新跑一遍?

这比盯着“10%”这个数字更有用。

历史上,核工业和航空业都经历过类似的争论:工程师知道系统存在低概率灾难,管理层却必须在安全成本和商业进度之间做决定。两者与 AI 不完全一样,但有一个共同点——事故概率从来不是唯一问题,谁承担后果、谁拥有停机权,才决定安全规则有没有牙齿。

AI 行业目前最缺的,不是更多一句“我们重视安全”,而是把这种重视变成公开的发布门槛、可核验的测试结果,以及真的能叫停产品的人。

“其兴也勃焉,其亡也忽焉。”这句话放在今天并不意味着 AI 一定会走向灾难。它提醒人们,技术公司最容易高估增长带来的收益,低估控制能力落后的代价。

这次新闻真正暴露的,不是一个可以精确计算的末日数字,而是安全判断和商业决策之间正在拉开的距离。距离继续扩大,10%会越来越像警报;距离缩小,才说明那些安全承诺开始有了实际重量。