使用教学适宜性指数评估和改善基于LLM的AI导师的教学适配性
摘要
本文介绍了教学适宜性指数(PSI),这是一个综合指标,用于评估和改进基于LLM的AI导师如何使回答与学习者的准备程度和课程进度保持一致,并表明PSI引导的反馈能够改善薄弱的教学案例。
arXiv:2608.05411v1 公告类型:新
摘要:大型语言模型(LLM)越来越多地被用作AI导师,但正确答案并不总是教学上合适的答案。在课堂学习中,有效的帮助不仅取决于正确性,还取决于回答是否匹配学习者当前的基础、课程顺序以及概念引入的时机。现有评估主要关注答案质量,导致这种教学适配性未被充分衡量。我们提出了教学适宜性指数(PSI),这是一个由六个基于理论的子分数组成的综合指标,用于评估LLM生成的辅导回答与学习者准备程度和课程进度的契合程度,并进一步将PSI用作回答改进的结构化反馈信号。我们使用配对的标准化提示和有缺陷提示,对四个LLM导师(ChatGPT、Gemini、Gemma4和Qwen3)进行了240项基于场景的评估,然后对62个表现较弱的案例应用了PSI引导的再生成协议。四个测试模型的基线差异总体不大(PSI范围:0.557至0.638),开放权重模型和封闭模型在教学适配性上没有表现出明显的分离。在测试的提示扰动下,整体PSI基本保持稳定(Delta = -0.002),但出现了子分数权衡。更重要的是,PSI引导的反馈显著改善了表现较弱的案例:62个案例中有51个得到改善(82.3%)。对62个PSI选取的薄弱案例进行的有针对性的手动评估提供了初步证据,表明所识别的弱点在教学上是有意义的,并且许多PSI引导的再生成与人工判断的改进相对应。这些结果表明,对于有效的辅导,学习者和课程感知的对齐可能比模型类别本身更重要,而且这种对齐既是可以衡量的,也是可以改进的。
查看缓存全文
缓存时间: 2026/08/07 07:46
# 利用教学适宜性指数评估并改进基于LLM的AI导师的教学适配性 来源:https://arxiv.org/html/2608.05411 ###### 摘要 大语言模型(LLMs)越来越多地被用作AI导师,但一个正确的答案并不总是一个教学上恰当的回答。在课堂教学中,有效的帮助不仅取决于正确性,还取决于回答是否匹配学习者当前的基础、课程顺序以及概念引入的时机。现有评估主要关注答案质量,导致这种教学适配性未被充分测量。我们提出教学适宜性指数(Pedagogical Suitability Index, PSI)——一个由六个具有理论依据的子分数构成的复合指标,用于评估LLM生成的辅导回答与学习者准备度和课程进度的匹配程度;我们还进一步将PSI作为结构化反馈信号,用于改进回答。我们使用配对的标准提示和缺陷提示,对四个LLM导师(ChatGPT、Gemini、Gemma 4 和 Qwen 3)进行了240个基于场景的评估,然后对62个表现较差的案例应用了PSI引导的重新生成协议。四个被测模型的基线差异总体适中(PSI范围:0.557到0.638),开放权重模型与闭源模型在教学适配性上没有表现出明显的分野。在测试的提示扰动下,整体PSI基本保持稳定(Δ=−0.002),但出现了子分数之间的权衡。更重要的是,PSI引导的反馈显著改进了表现较差的案例:62个案例中有51个得到改善(82.3%)。对62个PSI选出的薄弱案例进行的有针对性的手动评估提供了初步证据,表明所识别出的薄弱点在教学上有意义,并且许多PSI引导的重新生成与人工判断的改进一致。这些结果表明,对学习者和课程感知的对齐可能比单纯模型类别对有效辅导更重要,而且这种对齐既可以被测量,也可以被改进。 ## I. 引言 一个学生问AI导师为什么程序运行失败。导师给出了流畅的解释,甚至可能给出了一个可用的修复方案。然而,这个回答在教学中可能仍然时机不当:它可能假设了学生尚未学过的概念,跳过了教学本应培养的先决推理,或者给出的答案虽然解决了眼前的问题,却没有增强长期理解。在这种情况下,仅凭正确性并不能完整反映辅导质量。在教育使用中,核心问题不仅在于答案是否对,还在于这些帮助对于处于当前教学序列中这一节点的学习者是否合适。 这一挑战的出现是因为LLM通常缺乏关键的教学上下文。在许多真实场景中,模型并不知道学习者已经掌握了哪些概念、班级目前处在课程进度中的哪个位置、或者相关概念是多久之前引入的。因此,LLM可能产生总体正确但与学习者基础或预期教学节奏不匹配的回答。这促使我们开发超越事实准确性、转而测量教学适配性的评估方法:即回答是否尊重先决依赖关系、是否提供适当的脚手架、是否与目标认知水平一致、以及是否考虑了概念接触的时机。此前关于AI生成教育内容评估的工作主要集中在事实准确性或特定领域的质量度量[28](https://arxiv.org/html/2608.05411#bib.bib3),而没有完全捕捉这些以学习者和课程为感知的支持维度。最近发展区(Zone of Proximal Development)[25](https://arxiv.org/html/2608.05411#bib.bib1)提供了理论基础:有效的教学应针对独立能力与有指导的成就之间的差距。 为了弥补这一空白,我们引入了教学适宜性指数(PSI),这是一个基于理论的指标,用于评估LLM生成的辅导回答是否适合学习者当前的基础和教学情境。我们将该指标实例化在一个包含30个辅导场景的基准上,并由学生评分者验证其真实性和课程契合度;然后用它来比较四个商业和开放权重LLM导师在标准提示和缺陷提示条件下的表现。我们还进一步证明,PSI不仅可以作为评估指标,还可以作为有针对性的重新生成的结构化反馈信号;此外,我们对PSI选出的薄弱案例进行了集中的手动评估,以考察识别出的薄弱点以及随后的改进是否具有教学意义。 我们的研究结果表明,当前各模型在基线教学适配性上存在差异,但差异适中,并且不足以支持简单的开源与闭源之分。更有意义的发现是,当根据学习者准备度、先决结构和教学时机来评估回答时,教学适配性既可以被测量,也可以被改进。PSI引导的反馈改善了82.3%的薄弱案例。所有补充材料可在 https://doi.org/10.5281/zenodo.19603300 获取。 ## II. 相关工作 先前关于AI生成教育回答的评估工作主要关注答案正确性和文本质量[28](https://arxiv.org/html/2608.05411#bib.bib3), [27](https://arxiv.org/html/2608.05411#bib
相似文章
重新思考LLM评判的有用性作为教学信号:跨辅导模型的预注册审计
本文对LLM评判的有用性是否能够可靠地区分AI辅导中直接给出答案与教学引导进行了预注册审计。作者发现,通用有用性并非可靠的教学信号,建议改用针对教学的评分标准和确定性过程度量。
超越怀疑:用自适应教学警戒框架评估LLM的教学意图推理能力
本文介绍了自适应教学警戒(APV)框架,用于评估LLM在教学交流中推理教学意图的能力。该框架采用贝叶斯推理,并展示了GPT-4o和Claude 3.5等模型在区分教学内容方面的改进。
LLM-as-a-Tutor:面向不可验证强化学习的策略感知提示自适应
LLM-as-a-Tutor提出了一种框架,通过成对比较和添加约束动态调整提示难度,将LLM的角色从评判者扩展为导师,从而提升强化学习中的指令跟随性能。
学习提示:通过自适应基于LLM的高中辅导提高学生参与度
本文提出了一种自适应、学科感知的提示路由框架,用于基于LLM的高中辅导,利用14个教学特征来切换策略。对359名学生进行的A/B测试显示,与静态基线相比,效率和转化率有所提高。
确认正确,遗漏其余:LLM辅导代理在最需要反馈之处表现欠佳
本文对七个LLM反馈代理在命题逻辑辅导中进行基准测试,发现它们在最优步骤上表现良好,但系统性地未能正确诊断有效的次优和错误解决方案,凸显了自适应辅导的局限性。