OpenAI这周发了一份叫《Learning never stops》的报告,说学生和老师已经把ChatGPT用成了随时待命的私人辅导。数字很扎眼:各年龄段用户每周有多达7000万次对话是在自测知识,美国学年期间课业相关的消息峰值超过4.6亿条/周,暑假也不低于1.8亿条。
听起来是个漂亮的增长故事。但把这份报告和OpenAI自己另一份报告放在一起看,故事就没那么干净了。
一份公司,两套数字
同样是OpenAI,今年9月中旬还发过一份《How People Use ChatGPT》,里面的统计口径完全是另一套:消费者ChatGPT的日消息量从2024年6月的约4.51亿条,涨到2025年6月的约26.27亿条,其中被归类为"辅导或教学"的消息占比约10.2%。
这两份报告都是OpenAI自己发的,却找不到一个能互相印证的桥梁。外部检索也没能在官网找到《Learning never stops》里"7000万""4.6亿"这两个数字的原始方法论出处。
数字口径不一致不等于造假,但至少说明,一家公司愿意公开哪套数字、用什么口径讲故事,本身就是个选择。企业自述数据不经第三方核验,天然带着营销滤镜。
练得好,不等于学得会
比数字对不上更值得在意的,是一个学术界已经验证过的落差:AI辅助"表现"和真实"学习",是两件事。
一项覆盖近千名高中数学生的大型随机对照试验给出了具体答案。学生用标准ChatGPT界面做练习时,表现提升了48%——看起来立竿见影。但一旦脱离AI单独考试,这批学生的成绩反而比完全没用AI的对照组低了17%。
真正管用的是另一种设计:一个只给引导式提示、拒绝直接给答案的"护栏版"辅导工具。同样是做练习,表现提升到127%,而且脱离AI后的负面效应基本消失。
表现提升是练出来的假象,还是能力提升的证明,取决于工具有没有护栏。
OpenAI这份报告展示的场景,清一色是开放式ChatGPT的日常使用——学生问算数、要练习、查资料。这恰恰是研究证明最容易产生"看似进步"的那一种用法,报告里没有区分工具有没有护栏,这个区分本该是重点。
老师省下的时间,是真的省下了
报告说AI能让老师"有更多时间教学",这句话有证据支撑,但证据比说法窄很多。
英国教育捐赠基金会做过一次覆盖259名科学教师、68所中学的随机对照试验:用ChatGPT辅助备课的老师平均每周花56.2分钟,不用的组要花81.5分钟,降幅约31%,盲审也没发现资源质量下降。
这个数字可信,但边界也很清楚:只测了英国中学科学老师的备课环节,靠教师自评时间,没有直接证明学生成绩因此提高。OpenAI报告把这条窄证据讲成了"教师普遍解放",省略了限定词,这是常见的营销手法,但读者该知道这一层。
- 风险.老师省下的备课时间,很可能被新增的AI内容核查、监督学生合规使用抵消一部分,报告里完全没提这笔账。
报告没写的那些事
隐私、学术诚信、公平性——这三条治理线,原文一个字没提。
联合国教科文组织2023年的指南明确建议:13岁作为学生独立在课堂使用生成式AI的最低年龄门槛,并强调仅靠年龄规则解决不了隐私和监管问题。未成年人的对话数据怎么处理,报告没交代。
AI检测工具对非母语英语写作者的误判率更高,这意味着学术诚信的执法本身可能不公平。设备和付费版本的差异,也会让"人人可用"的普惠叙事打折扣。
孔子说"温故而知新",学习从来不是一次性获取,而是反复检验、修正、内化的过程。ChatGPT让"随时可问"变成现实,这一点是真的进步。但如果工具只擅长让人"看起来会了",而不擅长让人"真的学会",那这场随时可用的辅导,离真正的因材施教还差一层设计。
护栏版辅导工具的实验结果已经摆在那里,普通ChatGPT不是不能用,而是不能不加约束地用在需要独立掌握的知识点上。学校采购AI工具时,该问的不是"用量多不多",而是"有没有护栏"。这才是这份报告真正该被拿去核对的地方。
