OECD最新一期PISA测评结果出来,标题很扎眼:用AI写作业的学生,成绩普遍不如不用AI的学生。这是ChatGPT真正进入课堂之后的第一次全球性测评,调整了家庭社经背景之后,不用AI的学生在科学、数学上依然占优。

但只看这一句,你会漏掉整份报告里最有意思的部分——AI用得多不代表成绩差,用得对才代表成绩不差。这中间的差别,才是这条新闻真正值得花时间看的地方。

数据先讲清楚

先把事实摆平:

  • 总体结论.不用AI完成作业的学生,科学成绩总体高于用AI的学生(已调整社经背景)。
  • 用途决定伤害大小.用AI来"总结课文""代写作业"的学生,分数掉得更明显;用AI做"预习"或"帮助我学习"的学生,掉得少得多。
  • 频率也不是线性的.一年只用一两次的学生,和天天离不开AI的学生,成绩都偏低;每月、每周使用的学生,表现反而更好。
  • 有条件的正向案例.每周用AI辅助学习、并且平时被训练去判断AI给的信息靠不靠谱的学生,成绩能反超不用AI的同龄人。

把这几条摆在一起,标题里那句"用AI成绩更差"就站不住脚了——它只描述了平均值,没描述形状。

AI使用频率与成绩:一条U型曲线 偶尔用(一两次/年) 较低 每月用 接近均值 每周用(帮助学习) 与非用户持平 每周用+会评估AI 反超非用户 每天用 较低 两端(偶尔/天天)拖后腿,中间(每周+会判断)不输甚至反超

两端差,中间稳,这是U型曲线,不是斜线。The Verge那句"generally score worse"讲的是平均数,平均数是把U型曲线两端的坑压在了中间的稳定段上,压出来的一条假直线。


被藏起来的那个变量

比U型曲线更值得盯住的,是社会经济地位(SES)。报告里的一个细节容易被忽略:不用AI的学生,往往本来就来自更弱势的家庭;用得频繁、用得熟练的学生,往往家里条件更好、设备更全、家长也更懂怎么引导。

  • 结论.AI使用和成绩的原始相关性,很大程度上是被家庭背景"混"出来的——不是AI拉低了成绩,是本来就处境不同的两群学生,分别落在了曲线两端。

孟子说"富岁子弟多赖,凶岁子弟多暴,非天之降才尔殊也,其所以陷溺其心者然也"——环境塑造行为,不是天赋决定命运。放到这里也一样:决定一个学生怎么用AI、用了之后学得好不好的,往往不是AI本身,而是他背后有没有人教他怎么用。

谁在用AI,谁的成绩好——两条线绞在一起 弱势家庭学生 AI使用率:偏低 设备/指导:偏少 问卷里更常见于 "不用AI"那一组 优势家庭学生 AI使用率:偏高 设备/指导:偏多 更容易学会"每周用 +会判断AI"这种用法

相关性不是因果链

PISA是横截面调查,同一年测一次,拿不到"用AI之前是什么水平"的数据。这意味着一个反过来的解释同样成立:是本来学习困难的学生更依赖AI求助,不是AI把他们拖差了。到底哪个方向是因,OECD自己的技术文档里写得很清楚——这类数据只能说相关,不能说因果。教育测量学界对PISA建模方式的质疑也不是新鲜事,跨国可比性、因果推断的边界,一直有人在挑刺。

曲线是U型的,新闻是直线的。

问卷本身也粗糙。"用AI做作业"这一个选项,既能装下学生让AI逐句讲解思路,也能装下学生直接复制AI生成的答案交上去——这是两种完全不同的学习行为,却被压进了同一道题里。效应被这种粗颗粒度的问卷稀释,也被放大,谁也说不清具体比例。

  • 风险.如果教育部门只看"用AI成绩更差"这一句结论就出台一刀切禁令,等于把"每周用、会判断"这个唯一被验证有效的用法也一起掐掉。

真正该盯的不是"AI伤不伤脑子",而是学校有没有教会学生怎么用——判断AI给的东西对不对,比是否打开聊天框重要得多。这份报告最大的价值,其实不是给了一个"AI有害"的结论,而是意外画出了一条区分"有效使用"和"外包思考"的分界线。接下来该看的,是OECD会不会放出分国家、分使用场景的细分数据,以及有没有人愿意做一次跨年的纵向追踪——横截面数据讲不清的因果方向,只有时间才能讲清。