新泽西州前副州长 Dale Caldwell 因性骚扰及违反伦理调查被迫辞职后,在接受媒体专访时拿出了荒诞的辩解理由:他将调查报告喂给了多个 AI 模型,提问 59 次得到的结果均是不构成性骚扰。这一极端个案将网络社区中蔓延已久的诉诸 AI(appeal to AI)现象推向台前——在日常讨论与公共辩论中,越来越多人把一句 ChatGPT 都这么说当成终结争议的免死金牌。但大语言模型本质上只是词元概率生成器,毫无事实鉴别能力,其自信的语调非但没有澄清事实,反而构筑了一道危险的确认偏差防线。
诉诸AI成新型逻辑谬误,前副州长拿模型背书
在政治风波与日常争辩中,以我问过 AI 了作为论据核心,正在演变为数字化时代的诉诸权威新变种。Caldwell 在 NJ PBS 访谈中反复强调自己咨询了多个模型,试图用算法输出对抗独立调查结论。这种操作的逻辑漏洞显而易见:聊天机器人具有极强的顺从性特征,往往倾向于迎合提问者的引导性倾向,给出提问者潜意识里最想看到的回答。
把机器生成的文本视作客观事实的裁决,忽视了大模型最根本的工作原理。这类工具并不理解是非真伪,它们只是在庞大的语料库中计算下一个 Token 的出现概率。一旦用户输入带有预设立场的 Prompt,模型便顺水推舟拼凑出看似严密、实则虚妄的论证框架。这种将统计学概率误作真理神谕的倾向,正在让本该严肃的证据质证演变为一场算法套话比赛。
诉诸 AI 的认知闭环陷阱
提问者预设立场 ──> 迎合性概率生成 ──> 伪造权威证据 ──> 强化确认偏差
35%争议错误率刺破全知神话,专业审计揭示实质危害
与用户将模型奉为裁决者的狂热相比,事实核查机构给出的实测数据相当骨感。NewsGuard 在 2025 年针对主流 AI 聊天机器人进行审计,结果显示它们在争议新闻话题上重复错误说法的比例达到35%。在同年 6 月的调查中,49%的受访者至少相信了 3 个争议性虚假说法中的 1 个,更有 74%的人对其中至少 1 个说法的真伪无法判断。
专业核查机构 Full Fact 在对 ChatGPT、Google Gemini 和 Grok 进行事实核验能力专项测试时,累计记录了 39项重大错误和67个错误回复。在多轮测试中,模型反复把 AI 生成的图片误判为真实场景,甚至将往年的旧战场视频指认为正在发生的冲突。在更广泛的 112 起 AI 篡改与错误信息案例库中,多达 94 起造成了实质性误导,其中 46 起具备引发健康损害、财务损失或政治动荡的潜在破坏力。
| 评估机构 / 指标维度 | 核心发现 | 风险定性 |
|---|---|---|
| NewsGuard 审计 | 主流模型争议话题错误率 35% | 重复扩散争议假信息 |
| Full Fact 专项测试 | 记录 39项重大错误 与 67 个错误回复 | 战场视频与合成图误判 |
| 危害案例样本分析 | 112 起案例中 46起具有实质危害 | 牵涉医疗、财产与公共秩序 |
尽管科技高管不断宣扬模型的推理突破,但现实应用中的普及度与真实性能之间存在断层。Pew 在 2026 年 2 月针对 5,119 名美国成人的调查表明,美国成人使用过 ChatGPT 的比例达到 44%,Google Gemini 为 24%,Anthropic Claude 为 6%。而在用户满意度层面,YouGov 与 ACSI 2026 年数据显示,Gemini 凭借 17.6 的感知准确度得分拿到 76 分的 ACSI 满意度,Claude 则在 YouGov 调研中以 62.5 分居前。公众对模型的接纳度一路走高,但工具自身的基本事实把关能力并没有跟上市场渗透的速度。
89.5%知晓责任却有70.1%不查:自信语调制造核验鸿沟
技术本身的缺陷固然麻烦,但更大的风险在于人性的松懈。F-Secure 于 2026 年 4 月公布的调查揭开了一个尖锐的心理悖论:89.5%的受访者认为核验事实的责任完全在于自己,但在实际操作中,却有 70.1%的用户极少或从不核验 AI 给出的答案。
流畅且自信的语调,成了大语言模型瓦解人类警惕心最有效的武器。
这种知行脱节的核验鸿沟直接源于模型的表意风格。大模型善于生成结构完整、措辞笃定的长篇大论,F-Secure 调查发现,35.5%的用户在答案听起来很自信时极少或从不核查;同时有 42.4%的人承认自己根本无法分辨 AI 的回答是否准确。
更深层的危机在于信源洗白机制。当模型将互联网上未经证实的流言、论坛碎片与常识混编在一起,并附上格式规范的伪造引用时,普通读者已经失去了传统的鉴别参照物。在 Reddit 等技术社群内,针对模型事实错误的讨论正陷入撕裂:一部分人将其归结为技术本质缺陷,另一部分人则将责任推给提问者的提示词工程。这种争吵演变出了次生的虚无疲劳,由于 AI 生成内容的大规模泛滥,社群开始倾向于怀疑所有真实发言,导致基础人际信任受损。
- 风险.当算法的流畅表达成为事实替代品,最先受损的是依赖 AI 获取医疗或法律决策的普通群体,信源洗白正在让错误主张获得虚假的权威豁免权。
- 建议.将大模型定位于草稿生成工具而非真理裁判器,在涉及关键权益与事实判断时,建立交叉验证习惯是抵御认知偏差的底线。
