评估 AI 辅导质量时,最难量化的问题之一是时机:模型是否知道何时该提供帮助,何时该克制、让学生自己思考。研究团队为此设计了 TutorMoments——一个基于回放的评估框架,把真实一对一数学辅导中的关键时刻重放给大语言模型,观察模型在“帮助”与“暂不帮助”之间的选择。配套的 TutorMoments-Preview 数据集包含 462 份美国 2 至 7 年级学生的一对一数学辅导脱敏记录,以及超过 1,500 个教师标注的关键时刻。需要说明的是,该数据集范围较窄:学生来自美国,内容以小学和初中数学为主,标注由同一批教育者完成,研究结果未必能推广到其他场景。
评分流程会把模型的回放表现拆成三个标准来打分:是否在需要时提供支架、是否在学生准备好时推动更严谨的思考、以及是否避免过度支架。初步测试中,只给普通提示的模型表现出过度帮助的倾向;当提示中明确写出帮助与克制的取舍后,模型得分有所提升,但作者表示仍未拉平与人类辅导的差距。研究团队同时提醒,这类自动评估不能替代真实学生和真实学习效果的验证;而且评分管道对“推动严谨思考”的检测可靠性低于对“提供支架”的检测,标注中的严谨思考时刻也少于支架时刻。
作者特别提醒:即使某次评估中模型得分高于人类辅导员,也不能解读为 AI 辅导优于真人教师,因为数据集本身聚焦的是人类教师错过帮助机会的场景。因此,TutorMoments 更适合作为衡量 AI 辅导时机把握的早期工具,而不是用来宣称 AI 可以替代真人教学的依据。