TutorMoments:以真实辅导回放评估 AI 的“帮助时机”
研究团队推出 TutorMoments,用真实一对一数学辅导回放评估大语言模型在辅导中把握“何时帮助、何时收手”的能力,为 AI 辅导的时机判断提供可复现的测评方式。初步结果显示模型普遍过度帮助,明确提示权衡能改善表现,但距离人类辅导仍有差距。
1 篇文章
研究团队推出 TutorMoments,用真实一对一数学辅导回放评估大语言模型在辅导中把握“何时帮助、何时收手”的能力,为 AI 辅导的时机判断提供可复现的测评方式。初步结果显示模型普遍过度帮助,明确提示权衡能改善表现,但距离人类辅导仍有差距。