法国和意大利三所大学做了一个实验:找一批AI经常答错的问题,让参与者先自己判断,再看AI给出的错误建议。结果很难看——本来27%的准确率,看完AI的错误答案后跌到9%;本来44%的人会诚实地说“不知道”,看完AI建议后只剩3%还敢这么说;但他们对自己判断的信心,反而从30%冲到76%。
这项研究还没经过同行评审,题目也是刻意挑出来的AI易错题,不能说明“用AI就会让所有人变笨三倍”。它真正说明的是:AI用确定的语气给错答案时,人会跟着更自信,也更不愿意承认自己没把握——这对靠AI做搜索和答疑的产品,是一个具体的设计风险。
一、准确率腰斩、自信心翻倍:实验测的是什么
研究团队用的模型是Step 3.5 Flash,题目专挑它容易答错的那类——比如电影《我爱贝克汉姆》里球队队服的颜色。参与者本来能靠自己经验答对不少题,一旦看到AI给出的错误答案,不少人跟着改了。
| 指标 | 无AI基线 | 看到错误AI建议 |
|---|---|---|
| 准确率 | 27% | 9% |
| 回答“不知道” | 44% | 3% |
| 自信度 | 30% | 76% |
三个数字放一起看,问题不在“答错”本身——任何工具都会出错。问题在于“不知道”这个选项几乎消失了。研究者瓦莱里奥·卡普拉罗(米兰比可卡大学副教授)总结得很直接:参与者的准确率只剩三分之一,自信度却从30%涨到76%,超过两倍。
二、加了奖励也救不回来,这才是真正该担心的地方
研究团队后来给参与者发钱,答对有奖励。准确率从9%回升到16%,“不知道”的比例从3%回升到8%——两个数字都还是明显低于没有AI时的27%和44%。金钱能挽回一部分懈怠,挽不回被AI改写的判断标准。
沃顿商学院今年早些时候的一项研究,把类似现象称为“认知投降”:参与者接受AI错误答案的比例高达80%,信心还比不用AI时更高。两项研究放在一起,指向同一件事——AI答得越笃定,人越不愿意保留怀疑。
这对靠AI做摘要和问答的产品是个实在的麻烦。Google今年改版了AI搜索,用AI摘要取代了大量原始链接;教育公益组织Common Sense Media本周把这种设计称为对学生的“不可接受的风险”。这更像是一种设计层面的警示,不能说Google的产品已经被证明造成了和这项实验同等幅度的认知损害,但两件事指向的问题是一致的。
三、学生和产品团队现在能做什么
这项研究没公开样本量,也没经过同行评审,题目又是刻意挑的AI易错题,不能直接套用到日常查资料、写作业这类场景。但它给出的具体信号,值得认真对待。
用AI搜索或学习工具的学生和家长,遇到没把握的题目,该让AI给出信息来源,再拿另一个渠道交叉核对,而不是看AI答得笃定就直接采信。做AI搜索摘要或问答产品的团队,该在低把握度的答案上加提示,或者干脆设计“拒答”机制,而不是让模型对每个问题都给出一个确定语气的答案。
接下来值得盯的,是这篇论文能不能通过同行评审,以及样本量、统计显著性这些细节会不会补全——目前公开的只是初步结果。同样值得看的是,主流AI搜索产品会不会在低置信度回答上加类似提示,这比争论“AI是否让人变笨”更实际。
