OECD最新一期PISA测评结果出来,标题很扎眼:用AI写作业的学生,成绩普遍不如不用AI的学生。这是ChatGPT真正进入课堂之后的第一次全球性测评,调整了家庭社经背景之后,不用AI的学生在科学、数学上依然占优。
但只看这一句,你会漏掉整份报告里最有意思的部分——AI用得多不代表成绩差,用得对才代表成绩不差。这中间的差别,才是这条新闻真正值得花时间看的地方。
数据先讲清楚
先把事实摆平:
- 总体结论.不用AI完成作业的学生,科学成绩总体高于用AI的学生(已调整社经背景)。
- 用途决定伤害大小.用AI来"总结课文""代写作业"的学生,分数掉得更明显;用AI做"预习"或"帮助我学习"的学生,掉得少得多。
- 频率也不是线性的.一年只用一两次的学生,和天天离不开AI的学生,成绩都偏低;每月、每周使用的学生,表现反而更好。
- 有条件的正向案例.每周用AI辅助学习、并且平时被训练去判断AI给的信息靠不靠谱的学生,成绩能反超不用AI的同龄人。
把这几条摆在一起,标题里那句"用AI成绩更差"就站不住脚了——它只描述了平均值,没描述形状。
两端差,中间稳,这是U型曲线,不是斜线。The Verge那句"generally score worse"讲的是平均数,平均数是把U型曲线两端的坑压在了中间的稳定段上,压出来的一条假直线。
被藏起来的那个变量
比U型曲线更值得盯住的,是社会经济地位(SES)。报告里的一个细节容易被忽略:不用AI的学生,往往本来就来自更弱势的家庭;用得频繁、用得熟练的学生,往往家里条件更好、设备更全、家长也更懂怎么引导。
- 结论.AI使用和成绩的原始相关性,很大程度上是被家庭背景"混"出来的——不是AI拉低了成绩,是本来就处境不同的两群学生,分别落在了曲线两端。
孟子说"富岁子弟多赖,凶岁子弟多暴,非天之降才尔殊也,其所以陷溺其心者然也"——环境塑造行为,不是天赋决定命运。放到这里也一样:决定一个学生怎么用AI、用了之后学得好不好的,往往不是AI本身,而是他背后有没有人教他怎么用。
相关性不是因果链
PISA是横截面调查,同一年测一次,拿不到"用AI之前是什么水平"的数据。这意味着一个反过来的解释同样成立:是本来学习困难的学生更依赖AI求助,不是AI把他们拖差了。到底哪个方向是因,OECD自己的技术文档里写得很清楚——这类数据只能说相关,不能说因果。教育测量学界对PISA建模方式的质疑也不是新鲜事,跨国可比性、因果推断的边界,一直有人在挑刺。
曲线是U型的,新闻是直线的。
问卷本身也粗糙。"用AI做作业"这一个选项,既能装下学生让AI逐句讲解思路,也能装下学生直接复制AI生成的答案交上去——这是两种完全不同的学习行为,却被压进了同一道题里。效应被这种粗颗粒度的问卷稀释,也被放大,谁也说不清具体比例。
- 风险.如果教育部门只看"用AI成绩更差"这一句结论就出台一刀切禁令,等于把"每周用、会判断"这个唯一被验证有效的用法也一起掐掉。
真正该盯的不是"AI伤不伤脑子",而是学校有没有教会学生怎么用——判断AI给的东西对不对,比是否打开聊天框重要得多。这份报告最大的价值,其实不是给了一个"AI有害"的结论,而是意外画出了一条区分"有效使用"和"外包思考"的分界线。接下来该看的,是OECD会不会放出分国家、分使用场景的细分数据,以及有没有人愿意做一次跨年的纵向追踪——横截面数据讲不清的因果方向,只有时间才能讲清。
