一份由OpenAI经济研究团队博科尼大学合作完成的随机对照实验给出了一组具体数字:1053名大一学生被随机分成四组,写同一份给校园周边商店做营销的作业。拿到ChatGPT(GPT-4o)的那组,评分从对照组的2.09分(五分制)跳到2.95分,提升0.86分,1%水平上统计显著。而专门训练学生做"因果推理"这种批判性思维的那组,评分几乎没有变化,估计值甚至略微为负。

OpenAI官方博客把这个结果讲成"AI访问与批判性思维训练相互补充"的双赢故事。但把两个数字摆在一起看,故事没那么圆满——批判性思维训练在传统评分标准下几乎不起作用,真正的收益藏在评分表根本没测量的地方。

0.86分从哪来,又漏了什么

四组学生的评分变化 2.09 对照组(无AI无训练) 基准分 2.95 仅ChatGPT组 +0.86,1%显著 ≈0 仅批判性思维训练组 估计值略为负 组合组(ChatGPT+训练):评分与仅ChatGPT组接近,无显著额外提升 控制文本连贯性和观点数量后:ChatGPT效应仍保留约一半 说明AI增益不只是"看起来更专业",也涉及实质内容改善

论文题目直接叫《Training novices to think, or giving them LLMs? Evidence from an RCT》,作为CEPR工作论文发布。标题本身就是一个问句:教学生思考,和直接给他们大模型,到底哪个更管用?

数据给出的答案有点扫兴。批判性思维训练单独作用几乎为零,而训练+ChatGPT的组合组,在评分上也没有比只用ChatGPT额外多拿一分。如果只看这张评分表,训练环节像是白做了。

训练的价值,评分表看不见

事情没那么简单。研究者用自动文本分析额外测了一层:观点数量、观点多样性、和三位专家答案的相似度、因果推理痕迹。

在这套指标上,两种处理呈现出完全不同的效果。ChatGPT让学生的答案更像专家——观点更多、逻辑更清楚、和专家写法的相似度更高。批判性思维训练让学生的答案更不像同学——同一组学生里,彼此的答案差异明显更大,独特观点更多。

问题在于,博科尼这次用的评分表,只考核两个营销标准目标——是否提升店铺知名度、是否提升使用率。这种rubric天然奖励清晰、结构完整、贴近"标准答案"的写法,却看不出一个学生是不是想出了别人都没想到的点子。

  • 结论.批判性思维训练的收益不是消失了,而是被评分标准系统性漏掉了。

这对教育评估是个尴尬的提示:如果打分只看最终答案够不够"专业",AI会比训练更快把学生的答案改造成评分表喜欢的样子。


两个实验没测的变量

Bocconi这次实验设计干净,四组横向对照说得清"谁的功劳是谁的"。但它测的是同一时间点、同一份作业的横截面结果,回答不了两个更长期的问题。

第一个问题来自另一批学者(Terwiesch等)的研究:个体用AI辅助后答案变好了,但如果全班用同一个模型、类似的提问方式,班级整体的创意多样性会不会反而收窄?Bocconi的实验没有测这种群体层面的趋同效应。

第二个问题关于AI本身怎么和学生对话。外部研究给出的证据是混合的——一项针对高中生的研究发现,苏格拉底式追问的AI提高了学生参与度,但AI撤除后学生难以独立运用所学;另一项针对大学生的研究却发现,苏格拉底式对话式AI比直接给答案的AI更能提升成绩和反思能力。Bocconi实验里的ChatGPT是直接给答案模式,没有涉及交互设计这个变量。

分数变好,不等于学生学会了思考。

学校该盯什么,学生该做什么

对高校老师来说,短期能做的调整很具体:把评分标准从"答案对不对、够不够专业"扩展到"能不能看出这个学生自己的判断路径",比如要求学生标注哪些内容是AI给的初稿、哪些是自己改动或质疑的部分。

对学生来说,现实选择也很直接——用AI把答案打磨得更连贯、更完整没问题,但如果整份作业的观点结构完全由AI给出,评分表暂时测不出差距,长期学习效果的差距未必消失,只是暂时看不见。

后续真正值得盯的,是有没有研究去做"AI撤除后的迁移测试":拿到ChatGPT训练出的"专家式"答题能力,学生离开AI之后还能不能独立复现。这个问题,博科尼的实验目前还没有回答。