一项追踪2.7万名中国中学生、跨度30个月的研究,把"AI帮学生变强还是变笨"这个争论第一次装进了大样本、长周期的实证框架里。结果并不讨喜:用AI做作业的学生,作业分数六个月内平均涨了18%,但换成闭卷考试、身边没有AI可用时,这群学生的成绩反而比不用AI的同学低了20%

这项研究由斯德哥尔摩大学的David Strömberg与香港大学的Victor Lei、Yanhui Wu完成,已作为CEPR工作论文(No. 21577)挂出,尚未经过同行评审。样本覆盖七至十二年级、九门学科的作业、月考和升学考试成绩,用交错采纳和双重差分的设计来排除"本来学得差的学生才爱用AI"这类反向因果的干扰。这个规模和时长,比此前大多数依赖小班实验或教师主观观察的研究,证据分量重得多。

分数剪刀差背后,是"外包"还是"辅助"

真正值得记住的细节,不是18%和20%这两个数字,而是损失分布得极不均匀。研究发现,损失最重的是那批作业完成异常快、得分异常高的学生——他们大概率是把题目原样甩给AI,自己没动脑子。这群学生的作业耗时,从原来的64分钟降到了45分钟,降幅接近三成。

反过来,那些用了AI但完成时间基本没缩水的学生,学习损失明显小得多。换句话说,AI本身不是病因,"省时间"才是外包行为暴露的信号。

  • 结论.考试分数的塌陷不是均匀发生的,而是集中在"用AI替自己做完题"的那一小群人身上。

更让人不安的是长期账:研究预估,这批学生在中考、高考这类升学考试里的成绩,分别可能下降18%24%——比月考数据还要难看。月考跌一点还能补,升学考试的分数是一次性写进档案的,这才是这项研究真正该让家长和老师紧张的地方。

两种AI用法,两种命运 耗时腰斩型 64→45分钟 完成作业时间降三成 得分异常高、异常快 疑似直接外包AI 考试损失最大 耗时基本不变 ≈原时长 用AI核对、启发思路 作业分数同样提升 仍在动脑子 考试损失明显更小

土耳其的对照实验:同样是AI,防护栏差在哪

这个"用法决定后果"的判断,不是孤证。原文提到的"宾大研究"其实容易让人误会——它并非2024年在美国校园做的实验,而是Hamsa Bastani等人在土耳其一所高中、近千名九至十一年级学生中完成的对照实验,今年6月才正式发表在PNAS上。

实验分三组:无AI对照组、类似ChatGPT直接给答案的"GPT Base"组、教师设计了引导式提示的"GPT Tutor"组。GPT Base组练习成绩涨了48%,但闭卷考试反而比对照组低17%——和中国研究的模式几乎是一个模子刻出来的。GPT Tutor组练习成绩涨了127%,考试却没有出现统计上显著的损失。

差的不是AI这项技术,是"给答案"和"教你怎么想"之间那道栏
两套AI工具,两种考试结果 GPT Base(直接给答案) 练习+48% 考试-17% 无引导,直接抄结论 GPT Tutor(教师设计引导) 练习+127% 考试无显著下降 强制推理步骤,不给现成答案

两项研究都有软肋,但方向一致

两份研究都不是定论。中国这份论文还停留在工作论文阶段,没有经过同行评审;土耳其实验样本只有一所学校,AI组还多领了一台笔记本电脑,设备本身就是一个混杂变量,GPT Base和GPT Tutor之间同时变了教材、提示策略和常见错题库,很难精确拆出到底是哪个环节起了作用。

布鲁金斯研究院今年早些时候的一份说明,倒是给出了折中的说法:AI"设计得当、用得有意图"可以帮助学习,但如果拿来替代思考、社交和创造力,会挡住学生该发展的认知能力。这句话和两项研究拼在一起看,结论其实变得清晰——问题不在AI这项技术,而在产品有没有强制学生走完思考步骤,以及学生自己有没有偷懒的空间。

  • 风险.如果教育科技公司只把"防护栏"当营销话术、不真的限制"一键给答案",这道栏迟早会被绕开。

对家长和老师来说,眼下能落地的判断很朴素:盯着作业分数没用,盯着孩子写作业花了多长时间,可能才是更靠谱的信号。至于中国这份论文能不能通过同行评审、结论能不能在别的国家复现,值得接着看。