科技评论站点 NekoWiki 近期刊发了一篇言辞激烈的文章《Computers Cannot Make Decisions》,直截了当地踢翻了算法神话:计算机程序根本不具备决策能力,任何把坏结果归咎于大模型的说辞,本质上都是在进行决策洗白。文章指责开发商本有能力阻止危害却主动放任,甚至将用户的订阅费斥为纵容恶行的资金。
这种愤怒点出了一个被长期掩盖的事实:大模型正在成为现代机构推卸道德与法律责任的避雷针。但若将一切归结为厂商不愿意按下安全开关,则低估了前沿技术的工程黑盒,也忽视了组织机制如何在人类监督的名义下悄然转移法律风险。
泛黄的IBM幻灯片与现代免责迷因
NekoWiki 刊文的核心论据,是一张据称拍摄于 1979 年 IBM 内部培训的幻灯片照片,上面印着一句被奉为技术伦理图腾的话:计算机永远无法承担责任,因此计算机绝不能做出管理决策。

然而技术考证往往比迷因更残酷。Simon Willison 于 2025 年 2 月 3 日发文考证了这张照片的源头:该图最早由推特用户 @bumblebike 于 2017 年 2 月上传,称属于其父亲在 IBM 的工作资料,但其实体原件已在 2019 年的一场洪水中彻底被毁。IBM 档案室工作人员 Max Campbell 多次检索,均未能在官方档案库中找到对应记录;即便现代 IBM 官方文章也曾引用过该名句,同样拿不出具体的档案编号或页码。
这句文献学上无从坐实的档案金句在半个世纪后被反复咀嚼,恰恰折射出公众面对现代 AI 时的失语:四十年前产业界还在告诫管理者别让机器当挡箭牌,四十年后科技企业已经把这套说辞制度化了。
87%合规率背后的工程黑盒与安全妥协
公众往往以为,前沿实验室只要修改几行代码就能彻底消除有害输出。但一手评测数据证明,治理模型不仅存在真实的工程难度,还夹杂着商业竞争下的策略性退却。

OpenAI 在 2025 年 12 月 18 日更新了《Model Spec》以规范助手交互行为,并在 2026 年 3 月 25 日发布了基于该规范的 Model Spec Evals 评测结果。在涵盖 225 个领域的 596 个提示词测试中,模型综合策略合规率呈现明显的代际差异:GPT-4o 仅为 72%,OpenAI o3 达到 80%,GPT-5 Instant 为 82%,GPT-5.3 Instant 达到 84%,而具备深度推理的 GPT-5.4 Thinking 达到了 87%。这组由 GPT-5 Thinking 判定的数据表明,即使是最先进的旗舰模型,在面对策略边界时依然存在无法忽视的不确定性空间。
与此同时,标榜安全的 Anthropic 同样在承受防线拉扯。尽管其《负责任扩展政策》(RSP)第 3.4 版定于 2026 年 7 月 8 日生效,但在 2026 年 2 月 24 日重写该政策时,Anthropic 已经悄然将前沿安全路线图目标调整为不具法律约束力的公开目标。
在其 2026 年 8 月发布的风险报告中(统计涵盖至 2026 年 7 月 15 日),由于外部不确定性增加,Anthropic 将灾难性对齐风险评级从极低上调为低。自 2026 年 3 月 1 日以来,其漏洞赏金计划共确认了 5 起非通用越狱和 1 起通用越狱;虽然通用越狱对 2 级及以上分类器模型无效,但部分跨部署缺陷的修补周期长达数月。
厂商并非单纯地在放任与阻止之间做非黑即白的选择,而是在技术无法绝对兜底的前提下,选择通过弱化自身约束来保全商业扩张的节奏。
- 风险.当头部厂商把安全路线图降级为非强制目标,合规承诺就退化成了公关门面,监管机构也将失去直接惩戒的技术抓手。
形式化的人类在环正在制造底层替罪羊
如果说技术局限为厂商提供了客观掩护,那么组织机制的漏洞则催生了更隐蔽的推诿。学者 Rubel、Castro 和 Pham 早在 2019 年的研究《Agency Laundering and Information Technologies》中就提出了代理洗白概念,专指机构利用信息系统的不透明性来遮蔽自身的道德与管理责任。而在大模型时代,这种洗白正在延伸出更残酷的次生结构:责任下沉。

算法给出的不是无可辩驳的真理,而是机构规避道德审查的护身符。
立法者原本试图建立防火墙。欧盟《人工智能法案》(EU AI Act)第 14 条、第 14(4) 条以及第 26(2) 条明确要求高风险 AI 系统必须配备有效的人类监督,监督者必须具备识别自动化偏差并随时叫停系统的能力。然而法案并未要求人类对每一项输出进行逐一审批。
这个合规空隙迅速被部署企业所利用。政企客户在引入自动化系统时,名义上保留了人类在环,实际上却给基层审核员分配了海量的审批配额。面对高强度的时效考核与自动化偏差,一线员工只能对模型的建议机械打勾。一旦系统输出歧视性招聘结论或出现风控误判,管理层便能拿出带有签字的合规记录:决策并非系统做出,而是由人类员工最终核准。
- 建议.企业评估 AI 系统的真实安全性时,不能仅看宣传的合规率,而应审查基层审核岗位是否拥有推翻模型结果的免责豁免权与申诉机制。
在这套精密的制度设计中,厂商以概率黑盒推托系统缺陷,管理层以中立算法掩饰商业意图,而承受最终法律与职业追责的,变成了流水线末端根本无力反抗的基层审核者。击碎技术神话的第一步,绝不是对着机器宣泄情绪,而是穿透代码与审核流程的迷雾,把责任重新钉死在做出商业与管理抉择的具体机构身上。
