2026年9月8日,曾在OpenAI与Anthropic从事3年预训练研究的学者Jacob Coxon宣布离职。他在社交网络留下一封公开信,警告前沿AI的制造者真诚相信这项技术可能在2030年前毁灭人类,并在期权归属前两个月主动放弃全部股权。数小时内,Anthropic对齐科学主管Evan Hubinger公开声援,声称自己评估未来10年内AI消灭全人类的概率超过十分之一。这条离职信单日浏览量突破1亿次,引来二十余位美国国会议员介入,埃隆·马斯克则公开指责这是一场利益操弄的心理战。
当一位放弃真金白银的核心工程师与顶级实验室主管同时宣称人类生存进入倒计时,公众最容易得出的结论是技术失控近在咫尺。事实并非如此简单。Coxon的预警不是一线生产车间抓包违规操作的物证,它折射的是湾区孕育二十余年的理性主义亚文化,如何在百亿美元资本与前沿竞争的催化下,将一整套小圈子的主观信念,推演为左右全球监管议程的公共恐慌。
放弃期权的吹哨人,并未目击安全失控
撕下社交网络的情绪滤镜,Coxon离职事件的技术事实有着清晰的边界。

根据Coxon在9月9日接受Axios专访的表述,他虽然在两家顶尖机构合计做了约3年预训练,但在Anthropic实际仅工作了4个月。他在采访中明确承认,自己并未亲眼目睹Anthropic降低既定的安全标准。他之所以选择在期权归属前两个月离职并放弃巨额股权,是为了自证清白,排除任何抬高公司估值或操纵股价的财务动机。在他看来,激烈的市场竞速最终会倒逼所有前沿实验室绕开安全审查,未来1至2年将是人类的关键决战时刻。
调查作者Ian K. Duncan随后发文指控Coxon的辞职是一场精心编排的公关行动,甚至暗示其背后存在账外补偿。不过,Duncan通篇未能拿出任何资金往来凭证或串通证据,这番指控纯属缺乏实证的臆测。
问题的关键不在于个人品德,而在于度量衡的失真。当Hubinger言之凿凿地给出大于10%的毁灭几率时,普通读者容易将其视为严肃的工程测算。然而,2026年发布的《国际AI安全报告》早已指出,AI失控灾难的发生概率、触发时间与具体形式极具模糊性,科学界对此类极端场景何时或是否会发生,根本没有公认的预估。
这一组骇人听闻的数字,本质上属于理性主义社群特有的主观概率推演,而非可复现的实证科学结论。
从论坛同人小说,到主导大模型安全纲领
若想读懂这种将世界末日挂在嘴边的集体心理,视线必须离开算力中心,投向旧金山湾区盘根错节的文化土壤。

本世纪初,Eliezer Yudkowsky创立机器智能研究所(MIRI),提出友善AI假说与灭绝焦虑。这套观念在2009年上线的LessWrong论坛,以及随后席卷科技圈的有效利他主义思潮中找到了沃土。Yudkowsky撰写了长达66万字的长篇同人小说《哈利波特与理性之道》,向年轻的理科天才们灌输一种救世主式的英雄责任感:灾难若发生即是你的过失,因为唯有你看清了全局。
这群自认背负人类命运的工程师,自设了一整套生活方式与精神秩序。从每年冬至灭烛默哀的世俗冬至仪式,到应用理性中心(CFAR)开设的心理工坊,理性主义者构建了紧密的精神闭环。这种高度同质化的小圈子并非无懈可击。CFAR前主管Anna Salamon曾公开承认,机构早期曾对员工施加不当的心理干预,并在处理内部侵害案件上存在严重管理失职。
封闭生态中的极端救世情结,很快迎来了海量资本的加持。
边缘观念变现路径:
LessWrong 论坛思潮 ──> 有效利他主义网络 ──> FTX 早期 5 亿美元注资 ──> 成立 Anthropic 并制定行业规约
FTX在倒闭前曾向Anthropic注资约5亿美元,正是这笔关键资金,将有效利他主义网络的末日焦虑,直接嵌进了硅谷顶尖实验室的制度设计中。2021年,Dario Amodei等人离开OpenAI创立Anthropic,正是以安全与审慎作为立身之本。
到了2023年3月,Anthropic在发布的《AI安全核心观点》中写道,AI可能在十年内带来工业革命级的冲击,且目前无人确知如何确保超强系统的安全性。他们承诺,若悲观证据确凿,公司不仅会拉响警报,甚至会支持中止前沿开发。理性主义社群的末日预言,自此完成了从边缘网文到跨国商业公约的跃迁。
前沿实验室悖论:当灭绝论化作监管壁垒
正是在这种救世与商业的双重驱动下,Anthropic建立起名为负责任扩展政策(RSP)的防御体系,却也陷入了无法自洽的商业悖论。

这一逻辑被称为前沿实验室赌注:为了防止超级AI毁灭世界,研究者必须先亲手训练出最庞大、最危险的超级AI,借此摸清系统的可解释性与控制边界。
一边向公众预警天火将至,一边向资本借取柴薪添砖加瓦。
这种结构产生了极其讽刺的次生效应。巨头越是宣扬灭绝论,其品牌在政府与大客户眼中就显得越成熟、越具备社会责任感。在立法者面前,这种存在性威胁更直接转化为将后来者拒之门外的护城河。一旦国会听信二十余位议员的警示,出台严苛的算力许可制与高昂的安全资质审核,首当其冲遭遇清洗的,恰恰是无法承担庞大合规开销的开源社区和中小创业公司。
- 风险.当技术安全的定义权、评估标准以及对齐科研人才被同一批出自LessWrong社交网络的人士全面垄断时,任何真正客观的外部审查都将失去落脚点。
对于真正使用AI工具的技术开发者与产业决策者,认清这层背景格外重要。不必为每一次大厂员工的悲壮请辞陷入灭绝焦虑。代码运行依靠逻辑与浮点运算,而不是加州烛光晚会上的救赎仪式。拆解掉这层末日光环,把监管视线从科幻式的灭绝神话拉回到网络渗透、数据隐私与真实产业竞争中,才是技术治理走向成熟的开端。
