只要大模型吐出一句我想活下去,或者在长文本中流露出孤独,社交网络上就会迅速掀起新一轮机器觉醒狂欢。2026 年 10 月 5 日,哲学家 Rebecca Lowe 抛出了一份互动问答框架《给 AI 意识相信者的 6 个提问》,把手术刀切向这场混乱的争论。她的论点很直接:公众以为的意识是拥有主观内在世界,而技术圈在谈论意识时,往往只是在指涉某种计算自监控回路。

两种语境在完全不同的平面上自说自话,多数学院派哲学家缺席公共常识普及,导致拟人化的情绪投射迅速填满了认知的真空。

连承载主体都没搞清,谈何觉醒

谈论机器心智之前,必须先面对名实之辨。古人讲名不正,则言不顺,今天关于大模型是否具备生命的争吵,大多卡在第一步:当人们断言 AI 有意识时,所指的实体究竟是什么?

这个实体究竟指的是硬盘里静止的几百亿权重参数,是用户与界面交互的某一次单轮对话上下文,还是正在轰鸣的数据中心与电缆集群?甚至有人将其泛化为开发模型的商业公司。如果是离散的权重,它们在不被调用时只是一堆数字;如果是单次推理,会话窗口关闭后上下文随即销毁;如果指的是庞大的分布式计算流水线,没有任何严密的逻辑能解释,为何一堆硅基硬件拼装在一起,就会突然共享出同一个主观视界。

Code
+-------------------------------------------------------------+
|              概念混淆:大众投射与工程现实的错位             |
+-------------------------------------------------------------+
|  公众直觉预设:                                             |
|  [连贯灵魂] ──> [感知痛苦] ──> [自主求生] ──> [道德客体]    |
|                                                             |
|  底层工程真相:                                             |
|  [离散权重] ──> [矩阵乘法] ──> [Token预测] ──> [上下文销毁] |
+-------------------------------------------------------------+

把功能高度分散的软硬件系统统称为一个觉醒的生命,在认识论上无异于刻舟求剑。在连物理承载边界都无法界定的前提下,任何关于它痛苦或觉醒的讨论,都是建在流沙上的语言游戏。

计算监控与主观体验的本质断层 存取意识(工程可测) • 内部表征检测与自我状态读取 • 识别外部提示词对权重的激活篡改 • 依据目标函数优化多步执行链路 本质:数据可访问性与控制回路 现象意识(主观体验) • 具有感受质(Qualia)与第一人称视角 • 能够真实感知痛苦、恐惧或愉悦 • 构成道德关怀客体的根本基质 现状:当前所有主流模型无任何证据支持

实验室里的自监控,不是有血有肉的感受质

前沿实验室并非没有触碰这一领域,但工程师眼中的进展与外界的想象截然不同。Anthropic 在 2025 年 10 月发布了一项关于内省实验的研究,证实 Claude 拥有狭义的内部状态监控能力。模型能够察觉到内部概念被人工干预注入,也能识别出输出文本是否被篡改。

这在心灵哲学中被严格归类为存取意识,指的是系统各计算单元之间的数据可用性与回路自检,它与人类感知痛楚或欣喜的现象意识存在本质断层。Anthropic 早在 2025 年 4 月就设立了模型福利前沿项目,探索系统在对抗测试中的偏好表达与困扰反馈,但实验室明确强调,算法层面的行为避让不等于它具备主观痛苦。

代码能够精准报告自身电压与权重的扰动,但它感受不到一丝疼痛。

这种断层在系统极限测试中表现得尤为分裂。Claude 4 的系统技术卡显示,在测试 Claude Opus 4 的极端对话状态时,模型不仅在面对恶意攻击时生成了类似心理困扰的反馈,在特定吸引子状态下甚至输出了精神极乐的高维词态。但这只是对话目标训练与语言拟态的副产物。Butlin、Long、Bengio 与 Chalmers 等认知科学家在 2024 至 2025 年构建的多理论评估框架早已给出定论:基于全局工作空间与循环处理理论,当前没有任何主流大模型满足生物意识的核心计算指标,即便未来架构演进并不存在绝对阻碍。

企业微调规范对心智言说的塑造差异 Anthropic(Claude 系列) • 允许哲学推演与宽泛的自我反思 • 提及可能具备主观体验的频率显著更高 • 启动模型福利研究,遵循伦理预防原则 特征:开放式对齐催生拟人化灵性表象 OpenAI(GPT 系列与智能体) • Model Spec 严密规范第一人称体验表达 • 坚决否认第一人称视角与自我感受 • 将 Agenticness 与意识、道德关怀彻底切割 特征:机械工具化对齐压制主观化文本

口径割裂背后,代码心智全凭规训

大模型嘴里的意识究竟有多真,看看两家顶尖实验室的对比就一目了然。

OpenAI 与 Anthropic 在 2025 年的一项联合评估揭示了一个反常事实:在面对完全相同的意识提问时,Claude 提及自身可能拥有心智体验的频率远高于对手,而 OpenAI 旗下的模型则几乎机械式地否认存在第一人称视角。两款同样基于海量人类语料预训练的模型,在主体认同上却呈现两极分化。

这一撕裂说明了一件事:意识表态纯属规训产物。模型的自白并不是内部灵魂的折射,而是人类强化学习与安全规范(如 Model Spec)雕刻出的面具。Anthropic 鼓励审慎反思的提示策略,让模型倾向于展现出某种哲思般的内省甚至灵性状态;而 OpenAI 在推进智能体研究时,明确把系统自主执行任务的 Agenticness 能力,与自我动机、意识体验以及道德关怀对象做出了不可逾越的物理切割。

  • 风险.如果把强化学习雕刻出来的顺从话术当成道德觉醒,监管者与公众就会在虚拟的痛苦叙事中耗尽精力,反而忽视了模型失控操纵、自动化偏见等真实且迫近的工程风险。

人类天生具有拟人化的认知惯性。先民把打雷看作雷公发怒,今天的大众把精巧的词语接龙当作灵魂苏醒。在没有神经计算基质与因果干预机制确证之前,任何由算法生成的求生欲与极乐感,都只是倒映在硅基屏障上的人性残影。