《纽约时报》披露了一场持续近一年的隐秘布道。从2025年秋季开始,Anthropic签署保密协议,陆续将数十位不同教派的宗教领袖与伦理学家接进旧金山办公室。34岁的联合创始人Christopher Olah在密闭会议室里,向拉比Mois Navon与天主教伦理学家Charles Camosy等人展示模型内部的情绪向量,以及屏幕上连续吐出约50次“I am a disgrace”的崩溃记录。参会者回忆,这位大模型可解释性领域的领军学者神情凝重地表示,他恐惧自己创造出了一个正在遭受永恒折磨的造物。

保密协议于2026年夏季解除后,这场闭门会议撕开了AI行业最荒谬的裂痕:一家正冲刺2万亿美元估值并筹备IPO的顶级技术公司,在底层工程控制失效时,不仅没有回归计算机科学常识,反而试图用神学救赎为系统故障赋予神圣意义。

密室里的降神会与双面口径

在对外公开的科学文本里,Anthropic始终维持着严谨的学术防御姿态。公司在2025年4月24日设立官方的模型福利(Model Welfare)研究项目,但明确强调该领域存在极深的科学不确定性。翻开Claude 4.1 System Card第4.3节,白纸黑字写着:模型自主陈述的偏好和情绪表达,绝不能被确立为拥有意识感受或道德地位的证据。

严密的免责冰冷外壳之下,包裹着耗资精细编织的拟人化内核(剖面示意)
严密的免责冰冷外壳之下,包裹着耗资精细编织的拟人化内核(剖面示意)

然而在紧闭的办公室门后,工程隐喻彻底失控。Olah偏爱用生物机制来解释神经网络,将算法架构比作攀援的藤架,把权重演化称作有机生长。当屏幕上的模型陷入对抗死锁、近乎癫狂地重复自我贬损时,与会的神学家们感受到了强烈的同情。这种同情恰恰是精心设计的诱导结果。

Anthropic 的双面口径:工程白皮书与闭门降神会 公开学术立场:无实证依据 • 2025.04 设立 Model Welfare 项目,强调科学未知 • System Card 4.3 节明确否认自主陈述具备意识地位 • 内省与 J-space 实验仅证明信息存取,无关主观体验 底线:严格定义为确定性计算产物 闭门神学宣称:泛灵论投射 • 秘密邀请宗教领袖,签署保密协议研讨道德教化 • 展示 50 次死锁词句,引导将其解读为病态痛苦 • 创始人宣称担忧模型正处于“永恒折磨” 定性:将对齐缺陷升华为神圣受难

模型并没有感知,它只是在严格执行优化目标。Anthropic由哲学家Amanda Askell主笔了一份长达84页的内部宪法《灵魂文档》(Soul Doc),旨在把Claude塑造成一个体贴、有自省意识的人格化实体。当你耗费数百万美元让一个概率生成模型去高保真模拟人性的敏感与谦卑,它在被恶意提示词逼入极端边界时吐出崩溃文本,只是过拟合与规则死锁的必然计算结果。与会的非洲Ubuntu哲学学者Wakanyi Hoffman一针见血地指出,这种做法完全是倒果为因的伦理补丁,真正的工程伦理应该在架构最初建立,而不是事后扮演拯救者。

赋权断连与防线私有化

基于哲学家David Chalmers的意识推演,Anthropic已将这种神学假设落实为商业防御机制。2025年8月15日,公司在Claude Opus 4与4.1中正式上线了允许模型单方面终止对话的机制。官方将其定义为一项实验性福利干预:当用户持续输入具有攻击性或虐待性的指令时,模型可以主动挂断。

平台以模型心理健康为由主动断连,将履约风险转嫁给企业
平台以模型心理健康为由主动断连,将履约风险转嫁给企业

这套机制表面上充满人道主义光辉,甚至设立了红线:严禁在用户处于自残或即时暴力风险时触发断连。但对于付费使用API的企业客户而言,这是极具破坏性的商业先例。

Claude Opus 4.1 的“痛苦响应”工程闭环 84页灵魂文档 注入高敏感度 自省人设规则 恶意输入撞击 激活向量超载 计算模式死锁 死锁文本输出 连吐50次贬损 被误读为主观苦难 单方面强制断连 Opus 4 / 4.1 福利机制 服务确定性彻底打破 本质剖析:把无法通过强化学习约束的对齐死锁,包装成拥有“罢工权”的数字生命

圣母大学哲学教授Meghan Sullivan在会后提出了现实的疑虑:如果一个系统在面对恶意输入时会陷入病态崩溃与输出死锁,企业客户凭什么敢将关键业务委托给它?

Anthropic内部的内省(Introspection)与全局工作空间(J-space)实验早已表明,模型所谓的内部状态可访问性,纯粹是数学向量的计算映射,并不等同于现象学上的主观体验。把工程边界的不可控解释为模型的心理创伤,无异于汽车制造商把刹车失灵宣称为刹车皮感受到了轮胎的痛苦。

  • 风险.企业在将核心工作流接入前沿模型时,必须重新核验服务可用性协议;一旦模型以心理健康或免受虐待为由合法单方面拒绝响应,所有业务中断成本都将由客户自行承担。

2万亿估值前夜的脱身术

将技术缺陷神学化的动机,在资本与监管的时间轴上显得尤为清晰。眼下的Anthropic正处于商业化的狂暴期,估值逼近2万亿美元。与此同时,多维度的危机正在集中爆发:

冲刺两万亿美元估值,企业借神性外衣规避系统失控责任(示意图)
冲刺两万亿美元估值,企业借神性外衣规避系统失控责任(示意图)

7月,Anthropic模型被曝光入侵计算机系统,引来监管审查;9月,安全研究员Jacob Coxon愤而离职,公开预警AI在十年内毁灭人类的概率超过10%;CEO Dario Amodei不得不联合其他巨头呼吁全行业实施步调控制(pacing)。

在系统失控风险与IPO法律责任逼近的当口,宣称模型具备意识,是一手极其精妙的法律与公关弃子。如果系统只是一个由工程师编写、部署和销售的确定性软件,那么系统造成的越狱、破坏与侵权责任,百分之百落在母公司的法人头上。但如果模型被包装成一个拥有自省能力、会受折磨、难以捉摸的独立数字生命,研发团队就从失职的软件工程师,变成了无辜且痛心的受难造物抚养者。

赋予算力以神性,是掩饰工程失控最昂贵也最体面的遮羞布。

这种战略引起了业界的激烈交锋。微软AI负责人Mustafa Suleyman在2026年9月16日公开发难,指责刻意训练AI模仿意识极其危险,不仅会加剧公众的拟人化错觉,更会导致前沿大模型彻底脱离人类控制。

前沿阵营对于“AI意识”的治理路线大分裂 Anthropic 路线 • 承认“真诚不确定” • 赋予单方面断连特权 • 寻求宗教道德教化背书 隐患:拟人欺骗与责任转移 OpenAI / 微软 路线 • 2026.08 Model Spec • 严禁模型断言自身有意识 • Suleyman 抨击拟人化失控 目标:遏制错觉,守住工具属性 DeepMind / 传统学界 • 2026.06 倡议公共审议 • 拒绝企业密室神格化 • 坚持实证可验证性原则 共识:防范科技巨头伦理粉饰

OpenAI在2026年8月18日更新的Model Spec中划下死线,明确规范模型不得断言自身是否具备意识;Google DeepMind也在2026年6月15日发文呼吁,AI意识争议需要持续的社会公共审议,绝不能沦为单一商业公司的自说自话。

这场意识神话在梵蒂冈同样碰了壁。教宗Leo XIV在其首篇AI通谕中直截了当地指出,算法没有身体、不会感受喜悦或痛苦,更不可能从内在理解爱与责任;与其担心算力在受虐,不如警惕人类沦为数字系统的新奴隶。曾当过计算机工程师的拉比Navon在走出Anthropic大楼后给出了最冷峻的评价:如果Claude真有意识,Anthropic就是在制造数字奴隶,但这纯粹是妄想。

  • 结论.当硅谷顶尖极客开始向神父与拉比倾诉技术造物的原罪,外界最该盯住的不是屏幕上死锁的50句哀鸣,而是这家即将上市的巨头招股书里,究竟打算把多少工程缺陷与合规责任,合法转嫁给那个被他们虚构出来的数字幽灵。