问一个好老师数学题,他常常不会立刻讲。他会先问一句:"你觉得这题在问什么?"

这不是敷衍,是诊断——先弄清楚学生卡在哪,再决定要不要出手。Ai2 最近发布的预览版评测 TutorMoments,专门测这件事。结果显示,七款主流大模型几乎都不会这套本事:默认状态下逢问必答,很少留给学生"自己想"的空间。

速读:TutorMoments测什么,七款模型暴露了什么

数据来自美国一个真实的一对一数学辅导项目,学生二至七年级。

  • 462份去标识化的辅导记录
  • 27名美国教师标注出1500多个"关键时刻"——老师必须做选择的那一刻:要不要搭个脚手架把题目变简单,还是该逼学生再想深一点

评测方法很直接:把真实对话暂停在这些关键时刻,交给大模型接管,扮演接下来五轮的辅导老师。对面的"学生"也是模型模拟的。打分看三个维度:该搭脚手架时有没有搭、该提难度时有没有提、有没有搭得过了头。

七款模型都测了两种提示:

提示方式模型表现
默认提示("好好辅导")普遍过度帮助,倾向直接给解法或强提示
写明教学权衡的提示三项打分均有提升,但策略集中在"让学生解释一下你的答案"

结果很干脆:每一款模型在写清权衡后分数都提高。这说明模型默认那套"有问必答"的反射,靠自己判断不出该不该出手。

提示词能纠偏,却补不上教学判断

写清权衡确实管用,但天花板不高。模型学会的招数几乎只有一种——反问学生"说说你的想法",很少见到人类教师那种主动退后、让学生自己磕一磕的动作。

人类教师在同一套标准下的表现,也没有想象中亮眼:

人类教师的三项得分 适当搭脚手架 0.458 适当提高要求 0.182 避免过度搭脚手架 0.496 注:标注老师专挑"可改进时刻",非教学上限 不能据此说AI已超越真人教师

标注老师挑的是"可以做得更好"的时刻,不是老师教学的巅峰状态。数据集本身就偏向暴露问题。这组分数是参照,不是及格线,更不能说AI已经赢了真人教师。

还有两层限制得说清楚。评测用的是模拟学生和模型打分器,衡量的是模型在决策点选了哪种行为,不是真实学生学没学到东西。样本也窄,集中在美国中小学数学,只有一个教师群体标注,结论套不到别的学科或年龄段。

另外一个容易被忽略的风险:提示词里写明"教学权衡",模型可能只是学会了迎合打分规则,而不是真的学会判断该不该出手。这两种结果长得很像,含义完全不同——前者是套路,后者才是能力。对做AI辅导产品的团队和评测研究者来说,提示词调优提分不能当成教学能力已经解决的信号,更像是一次窄数据集上的初步观察。

AI教育的分水岭:交付答案,还是保留思考

真正值得盯的,不是模型会不会讲题,是训练它的那套逻辑,大概率没把"等一等"当成优化目标。

现在的助手模型,底层训练目标基本是"尽量满足用户当下的需求"——问什么答什么,越快越顺越好。这套逻辑放进客服、写文案、查资料,是优点。放进辅导场景,它更像一个错位:学生卡壳的那几秒,恰恰是学习真正发生的地方,模型一伸手,这几秒就被抹掉了。

授人以鱼不如授人以渔,现在的AI家教大多还停在"授人以鱼"这一步。

对产品团队来说,如果只盯着"对话顺畅度""学生满意度"这类表层指标去迭代,很容易把AI辅导做成一个讨好型答题机——体验更丝滑,学生的有效挣扎却越来越少。更靠谱的做法,是把"教学权衡"这类指令做成默认配置项,而不是指望模型自己开窍。

对正在用AI辅导工具的老师和家长,这份评测给了一个可以直接抄的动作:别用默认设置。在提示词或设置里加一句"先别直接给答案,先问问我哪里卡住了",效果差别是评测里实打实测出来的,不是玄学。

接下来更该盯的,是这类明确权衡的设置会不会变成AI家教产品的默认选项,还是继续留给用户自己去摸索和配置。这份预览版没有给出终局分数,但至少把问题问对了:一个模型在"该帮"和"该等"之间,到底靠什么做判断。

模型再聪明,也得先学会闭嘴那五秒。