TutorMoments:AI导师知道何时该帮助、何时该收手吗?
摘要
Ai2推出了TutorMoments,一个基于回放的评估框架和数据集,用于衡量大语言模型在1对1数学辅导中能否平衡何时提供帮助与何时放手。初步结果显示,模型倾向于过度帮助,而提示工程只能部分缩小与人类导师的差距。
查看缓存全文
缓存时间: 2026/08/07 19:50
TutorMoments:AI 辅导老师知道何时该帮助、何时该放手吗?
来源:https://huggingface.co/blog/allenai/tutormoments 返回文章列表(https://huggingface.co/blog)
Kyle Wiggers 的头像(https://huggingface.co/Ai2Comms)
- 什么造就了一位好老师?(https://huggingface.co/blog/allenai/tutormoments#what-makes-a-good-tutor)
- TutorMoments 如何运作(https://huggingface.co/blog/allenai/tutormoments#how-tutormoments-works)
- 初步结果(https://huggingface.co/blog/allenai/tutormoments#preliminary-results)
- 局限性与下一步(https://huggingface.co/blog/allenai/tutormoments#limitations-and-next-steps)
📄 技术报告:https://tutormoments.allen.ai/static/paper/tutormoments-preview.pdf|📊 数据:https://huggingface.co/datasets/allenai/tutormoments-preview|💻 代码:https://github.com/allenai/tutormoments
TutorMoments social copy - Google Docs-image-1 (2)(https://cdn-uploads.huggingface.co/production/uploads/638e39b249de7ae552d977b5/LlOloe_6sFprFVqSBBk5t.png)
今天我们推出 TutorMoments(https://tutormoments.allen.ai/)的预览版。这是一个用于衡量前沿 LLM 能否平衡教育中最难的权衡之一:何时介入帮助学生,何时退后一步,让学生承担更多思考工作。
TutorMoments 是一个基于真实一对一数学辅导课程的重放式评估框架。经验丰富的数学教师会审阅从美国一个辅导项目中收集的对话记录,并标注出那些辅导老师必须在“让问题更容易上手”和“推动学生进行更多自己的推理”之间做出抉择的时刻。TutorMoments 随后截取对话记录中到达该决策点之前的内容,将其交给一个语言模型,让模型在模拟会话中接管辅导老师的角色——学生则由另一个语言模型扮演——以观察 LLM 辅导老师会怎么做。
仅被告知要“辅导得好”的情况下,我们发现模型往往倾向于过度帮助,给予过多支持,很少推动学生进行更深层次的思考。在辅导老师的提示词中明确说明这种权衡(何时帮助、何时退后),确实能提升表现,但仍无法缩小与那些始终切合时机的人类辅导老师之间的差距,而且不同 LLM 在做出这一判断的可靠性上差异依然很大。
作为我们对开放研究承诺的一部分,我们发布了一个去标识化的辅导对话记录数据集(https://huggingface.co/datasets/allenai/tutormoments-preview)、用于运行重放流程的代码(https://github.com/allenai/tutormoments),以及我们在这些对话记录中评估的关键时刻的模型辅导重放结果,以供可复现研究使用。我们希望 TutorMoments 能为教育工作者、研究人员以及正在构建 AI 辅导老师的团队提供一种更精准的方式,去审视模型如何处理那些最重要的教学决策——并帮助该领域构建出能够适应每个学生、而不是替学生完成任务的辅导系统。
什么造就了一位好老师?
向一位优秀的数学辅导老师求助,你很可能会收到这样的反问:“关于这个问题在问什么,你知道哪些信息?”这并不是不帮忙——优秀教学的一部分在于诊断学生已经知道什么,并在当下为他们提供恰当的支持。立刻主动提供帮助,会剥夺学生那部分有助于学习的心智劳动。有时候学生需要支持;另一些时候,最有效的做法是推动学生通过解释正确答案来巩固理解。
然而,语言模型被训练成乐于助人,而一个乐于助人的助手往往会替你完成最难的部分——解释概念、列出步骤、引导你得出答案。在辅导会话中,这会打断那种“有效的挣扎”——那种费力的、有时令人沮丧的问题解决过程,而学习研究早已将这种过程与更深的理解联系在一起。
大多数用于评估语言模型作为辅导老师的基准测试,并没有捕捉到这种张力。它们往往只奖励某一种特定行为——比如从不直接给出问题答案,或总是提供提示——而不考虑这是否符合学生当时理解程度的正确做法。但优秀的辅导并不是一种你能在所有情况下一刀切识别的固定行为。它是一种判断:这个学生此时此刻,在这道题上,需要什么?
TutorMoments 如何运作
TutorMoments 建立在真实辅导数据之上。我们发布的数据集 TutorMoments-Preview(https://huggingface.co/datasets/allenai/tutormoments-preview)包含了 462 份去标识化的纯文本对话记录,来自美国 2-7 年级学生的一对一真实数学辅导,附有超过 1,500 个教师标注的关键时刻,以及来自 27 位美国教师标注者的数千条自由文本注释。这些对话记录来自一个高剂量辅导项目,其学生大多就读于 Title I 学校;数据是根据家长和监护人同意的研究条款共享的。所有数据都经过了去标识化处理,首先由数据提供方完成,随后再通过一个数学感知的额外流程处理。
所有标注都由经验丰富的数学教师完成。我们请他们阅读对话记录并标出关键学习时刻——记录当时发生了什么、辅导老师做了什么、以及对学生产生了怎样的效果。每个关键时刻都是一个决策点,辅导老师必须权衡搭建脚手架(让问题更容易理解)与推动严谨性(鼓励学生进行更难的思考)。
TutorMoments 的运作方式是:在一个关键时刻暂停对话记录,把会话交给一个语言模型,由它接管辅导老师角色,与一个模拟学生进行五轮互动。我们将每一个模型生成的续写称为一次重放。随后,一个基于 LLM 的评分流程会从三个方面对每次重放进行评分:模型是否 (1) 在学生需要支持时提供了脚手架式帮助,(2) 在学生准备好接受更大挑战时推动了严谨性,以及 (3) 避免了过度搭建脚手架(比当前时刻所需的程度更多地降低挑战难度)。
评分流程从教师定义的基准真相出发:对于每个关键时刻,判断该时刻是需要脚手架式帮助还是需要推动严谨性。每个时刻由多位教师标注,意见不一致时我们采用多数标签——如果三位教师标注了一个时刻,其中两位认为应推动严谨性,一位认为应搭建脚手架,那么基准真相就是推动严谨性。随后,一个经过教师标注验证的独立 LM 分类器会判断辅导老师的实际行为是否符合该时刻的要求——一次“恰当”的回合意味着辅导老师的分类行为(搭建脚手架、推动严谨性或过度搭建脚手架)与教师对该时刻的判断一致。
初步结果
我们使用两种提示词,让七个 LLM 接受了 TutorMoments 测试:一种是朴素提示词,不提供任何实际指导——只告诉模型利用它对良好辅导的了解来回应学生;另一种是知晓评估提示词,明确说明了搭建脚手架、过度搭建脚手架和推动严谨性之间的权衡。每个模型都在从辅导对话记录中抽取的关键时刻上评分,这些时刻在“搭建脚手架是正确的做法”和“应当推动严谨性”之间均等分配。
表格中的每个数字都是 0 到 1 之间的评分——即模型在相关时刻做出恰当行为的比例——因此分数越高,说明模型做出正确判断的频率越高。例如,适当严谨性得分为 0.50,意味着模型在需要推动严谨性的时刻中,有一半做了这样的推动。
阅读分数时需要注意几点:
人类辅导老师是自然主义的参照,而非上限。 我们不把人类辅导老师视为理想实践的范本——即使经验丰富的辅导老师也会在当下做出不尽理想的选择。用同样的方式在相同的决策点上进行评分,我们对话记录中的人类辅导老师得分分别为 0.458(适当搭建脚手架)、0.182(适当推动严谨性)和 0.496(避免过度搭建脚手架)——均低于模型在知晓评估提示词下的得分,且大约落在其朴素提示词得分的区间内。但这并不是在声称 AI 辅导老师优于人类教师。标注者被特别要求寻找辅导本可以做得更好的时刻,因此数据集聚焦于错失的机会,而非理想实践。
分数衡量的是辅导行为,而非学习效果。 重放使用了一个模拟的“先知”学生,因此这些数字反映的是模型在决策点的行为——而不是真实学生是否学到了东西。
严谨性的评分比搭建脚手架有更多噪声。 评分流程检测推动严谨性的可靠性较低,而且基础标注中的严谨性时刻(260)远少于搭建脚手架时刻(738)。
TutorMoments social copy - Google Docs-image-2 (1)(https://cdn-uploads.huggingface.co/production/uploads/638e39b249de7ae552d977b5/iJjIPaPGPMCpnMrFiYxIZ.png)
表中呈现出的最清晰规律是提示词的影响有多大:每个模型在知晓评估提示词下的得分都高于朴素提示词。这表明模型默认的“乐于助人的助手”行为本身并不足以实现良好辅导。但在提示词中明确说明权衡也只能做到这一步——虽然它提升了每一项得分,不同模型在如何理解增强提示词上仍差异巨大,即便是得分最高的模型也还有很大的提升空间。
我们还将各场景下辅导老师采取的行为进行了细分。虽然提示词能促使模型推动严谨性,但它们使用的策略比人类更少,往往依赖于请学生解释答案。相比之下,人类辅导老师会采用更多样化的策略,并且更倾向于退后一步,让学生独立完成工作。
局限性与下一步
TutorMoments 仍处于早期开发阶段,目前存在若干局限。最大的问题是,自动化评估能为我们提供模型在决策点行为的信息,但它无法替代涉及真实学生和真实学习成果的研究。数据集的范围也较窄:基于美国情境,且大多是小学和初中数学,并由同一批教育工作者进行标注。我们的发现可能无法推广到其他学科、年级或场景中。
我们分享这一预览版,是为了在构建更大规模、多模态数据集、更强大的评分流程和更深入分析的过程中收集反馈。
致谢
本项目的实现部分得益于盖茨基金会(Gates Foundation)和 Learning Commons 的支持。
相似文章
LLM-as-a-Tutor:面向不可验证强化学习的策略感知提示自适应
LLM-as-a-Tutor提出了一种框架,通过成对比较和添加约束动态调整提示难度,将LLM的角色从评判者扩展为导师,从而提升强化学习中的指令跟随性能。
重新思考LLM评判的有用性作为教学信号:跨辅导模型的预注册审计
本文对LLM评判的有用性是否能够可靠地区分AI辅导中直接给出答案与教学引导进行了预注册审计。作者发现,通用有用性并非可靠的教学信号,建议改用针对教学的评分标准和确定性过程度量。
确认正确,遗漏其余:LLM辅导代理在最需要反馈之处表现欠佳
本文对七个LLM反馈代理在命题逻辑辅导中进行基准测试,发现它们在最优步骤上表现良好,但系统性地未能正确诊断有效的次优和错误解决方案,凸显了自适应辅导的局限性。
使用教学适宜性指数评估和改善基于LLM的AI导师的教学适配性
本文介绍了教学适宜性指数(PSI),这是一个综合指标,用于评估和改进基于LLM的AI导师如何使回答与学习者的准备程度和课程进度保持一致,并表明PSI引导的反馈能够改善薄弱的教学案例。
学习提示:通过自适应基于LLM的高中辅导提高学生参与度
本文提出了一种自适应、学科感知的提示路由框架,用于基于LLM的高中辅导,利用14个教学特征来切换策略。对359名学生进行的A/B测试显示,与静态基线相比,效率和转化率有所提高。