视觉语言模型能否在数学教育中实现自适应?基于学习者模型的评价标准研究
摘要
本文提出了一种基于学习者模型的评价标准,用于评估视觉语言模型(VLM)在数学教育中的自适应性。实验表明,不同模型在自适应性上存在可测量的差异,并揭示了当前的VLM难以生成一致且适应学习者的教学回应。
arXiv:2605.16011v1 公告类型:新
摘要:自适应学习是指跟踪学习者学习进度并根据个体学习者的学习表现调整教学过程的教育技术。它越来越被认为是开发有效学习支持工具的关键。视觉语言模型(VLM)已在数学教育中得到应用,学生将其作为个性化教学的学习辅助工具。然而,目前尚不清楚VLM在提供数学指导时是否具备适应不同学习者特征的能力。当前的VLM在数学辅导任务中缺乏针对不同学习者特征的自适应性的系统评估框架。为填补这一空白,我们借鉴自适应学习框架中的学习者模型(Shute和Towle, 2018),并提出了一个基于学习者模型的评价标准。我们的评价标准将自适应性评估形式化为三个方面:认知方面、动机方面和复杂性。我们还评估了VLM回应的两个额外维度:正确性(答案和解决方案)和质量(回应本身)。我们的实验结果显示,不同模型在自适应性上存在可测量的差异,并揭示了当前的VLM在一致地生成基于学习者模型的教学回应方面存在困难,尤其是在接收有限的学习者信息时。
查看缓存全文
缓存时间: 2026/05/18 06:35
# 视觉语言模型在数学教育中能否具备适应性?一项基于学习者模型的评分标准研究
来源:https://arxiv.org/html/2605.16011
Jie Gao¹,² Yongan Yu¹,²¹¹footnotemark:¹ Junzhu Su¹ Yiran Lin¹ Adam K. Dubé¹ Jackie Chi Kit Cheung¹,²,³²²footnotemark:²
¹麦吉尔大学 ²Mila – 魁北克人工智能研究所 ³加拿大CIFAR人工智能主席
{jie.gao3, yongan.yu, junzhu.su, yiran.lin}@mail.mcgill.ca [email protected], [email protected]
###### 摘要
自适应学习是指那些能够追踪学习者学习进度、并根据个体学习者的学习表现调整教学过程的教育技术。它越来越被认为是开发有效学习支持工具的关键。视觉语言模型(VLM)已被应用于数学教育,学生也将其用作个性化指导的学习辅助工具。然而,目前尚不清楚VLM在提供数学指导时是否具备适应不同学习者特征的能力。现有的VLM在数学辅导任务中缺乏针对这种适应不同学习者特征能力的系统评估框架。为填补这一空白,我们借鉴自适应学习框架中的学习者模型(Shute and Towle, 2018 (https://arxiv.org/html/2605.16011#bib.bib25)),提出了一种基于学习者模型的评分标准。我们的评分标准将适应性评估形式化为三个维度:认知维度、动机维度和复杂度维度。我们还评估了VLM回复的另外两个维度:正确性(答案和解答的正确性)和质量(回复本身的质量)。我们的实验结果显示,不同模型在适应性上存在可测量的差异,同时也揭示了当前的VLM在生成基于学习者模型的指导性回复时存在困难,尤其是在接收到的学习者信息有限的情况下。
视觉语言模型在数学教育中能否具备适应性?一项基于学习者模型的评分标准研究
![[未标注图片]](https://arxiv.org/html/2605.16011v1/x2.png)
Jie Gao¹,²††感谢:同等贡献。Yongan Yu¹,²¹¹footnotemark:¹ Junzhu Su¹ Yiran Lin¹ Adam K. Dub鹆†感谢:通讯作者。Jackie Chi Kit Cheung¹,²,³²²footnotemark:²
¹麦吉尔大学 ²Mila – 魁北克人工智能研究所 ³加拿大CIFAR人工智能主席
{jie.gao3, yongan.yu, junzhu.su, yiran.lin}@mail.mcgill.ca [email protected], [email protected]
## 1 引言
随着人工智能在教育领域的应用日益增长,由大型语言模型驱动的、用于提供数学指导和教学支持的工具也相应增多。学习者越来越多地将VLM用作个人辅导代理,以解答数学问题并提供个性化的解答反馈 (Baral et al., 2025 (https://arxiv.org/html/2605.16011#bib.bib42); Cherian et al., 2024 (https://arxiv.org/html/2605.16011#bib.bib43); Gupta et al., 2025 (https://arxiv.org/html/2605.16011#bib.bib41); Liu et al., 2024 (https://arxiv.org/html/2605.16011#bib.bib49))。个性化既是个人辅导的典型特征,也是教育中的一个关键原则,因为教育者历来会调整教学,以便根据学习者不同的背景提供个性化和差异化的学习支持 (Bernacki et al., 2021 (https://arxiv.org/html/2605.16011#bib.bib36))。
参照图注 图1:基于学习者模型的适应性模式概览。该框架描绘了学习者特征与教学支架之间的相互作用。为了提供个性化学习以满足不同个体的学习需求,在做出教学决策之前理解学习者的学习表现至关重要。自适应学习作为一种最有效的教育方法之一,通过根据不同学习者的需求动态调整学习过程,来提供个性化的学习指导和反馈 (Imhof et al., 2020 (https://arxiv.org/html/2605.16011#bib.bib24); Shute and Towle, 2018 (https://arxiv.org/html/2605.16011#bib.bib25); Vanzo et al., 2025 (https://arxiv.org/html/2605.16011#bib.bib9); Zheng et al., 2022 (https://arxiv.org/html/2605.16011#bib.bib44))。其目标是通过追踪学习者先前的学业背景和学习表现,调整内容以适应不同学习者,从而最大化教学效果 (Shute et al., 2000 (https://arxiv.org/html/2605.16011#bib.bib26))。自适应学习的基础组成部分是学习者模型,它捕捉学习者的关键方面,例如学习表现和学习态度,以支持个性化教学。多项研究表明,自适应学习优于“一刀切”的教学方法 (Du Plooy et al., 2024 (https://arxiv.org/html/2605.16011#bib.bib59); Wang et al., 2023 (https://arxiv.org/html/2605.16011#bib.bib39))。当前的VLM主要通过对话交互收集学习者信息 (Kumar et al., 2023 (https://arxiv.org/html/2605.16011#bib.bib3))。当学习者没有明确分享他们的学习表现、行为或需求的细节时,推断这些学习者的特征可能很困难,这限制了教学决策的制定 (Song et al., 2024 (https://arxiv.org/html/2605.16011#bib.bib60))。因此,目前尚不清楚VLM是否生成了真正合适的答案和解答来支持个体学习者的需求 (Sharma et al., 2025 (https://arxiv.org/html/2605.16011#bib.bib2))。
本文通过开发一个基于自适应学习框架中学习者模型的自适应评分标准,来解决这一关键研究空白。我们的评分标准整合了学习者模型中的核心评估因素,包括认知和动机方面。该评分标准旨在评估VLM在数学辅导任务中的自适应能力,以及它们提供与学习者知识背景相符的教学指导的能力。因此,我们的研究问题是:“VLM在基于视觉的数学辅导任务中能够在多大程度上展现自适应教学能力?”
我们的贡献总结如下:(1)我们提出了一个基于学习者模型的评分标准,用于系统评估VLM在数学辅导任务中的适应性模式,该模式基于认知、动机和复杂度维度,如图1 (https://arxiv.org/html/2605.16011#S1.F1)所示。(2)我们基于TIMSS数学题目构建了一个人工标注的评估数据集,其中包含了多样化的学习者特征和受控的上下文条件,以模拟真实的辅导场景。构建的模型生成流程和评分标准设计可在我们的GitHub仓库¹¹GitHub仓库: https://github.com/Michaelyya/Adaptive-LLMs 中获取。(3)我们对五个最先进的VLM进行了广泛实验,提供了关于生成学习者感知的教学回复时面临的挑战的第一手分析,特别是在学习者信息有限的情况下。
## 2 背景及相关工作
### 2.1 自适应学习:学习者模型
学习者模型是自适应学习的基础,它整合评估信息并支持关于学习者能力的推断 (Shute and Towle, 2018 (https://arxiv.org/html/2605.16011#bib.bib25))。自适应学习系统内的个性化始于对学习者特征的系统评估 (Zhou et al., 2023 (https://arxiv.org/html/2605.16011#bib.bib46))。Bernacki 等人 (2021 (https://arxiv.org/html/2605.16011#bib.bib36)) 的系统性综述确定了四个关键维度的学习者特征:认知因素、信念与动机、社会文化因素以及情绪与情感。这些维度直接指导了我们评分标准的结构设计。例如,在提供教学之前,理解学习者的先验知识(一个认知因素)至关重要。因此,我们的评分标准包含了“当前知识”这一标准,以评估VLM如何识别学习者的先前水平,从而避免提供冗余或过于困难的内容。类似地,Plass 和 Pawar (2020 (https://arxiv.org/html/2605.16011#bib.bib22)) 将教学回复中可以调整的变量分为四个领域:认知、动机、情感和社会文化。在动机领域中,自我效能感反映了学习者对自己完成特定领域任务能力的感知。因此,一个学习者可能总体上对学习持积极态度,但同时对自己完成特定数学任务信心不足 (Kaskens et al., 2020 (https://arxiv.org/html/2605.16011#bib.bib37); Wen and Dubé, 2022 (https://arxiv.org/html/2605.16011#bib.bib38))。我们的工作综合了先前研究的见解,并考虑了VLM的对话属性来构建自适应评分标准。
### 2.2 (V)LM在教育中的作用
在数学领域,(V)LM 作为“解题器”展现出了卓越的能力,在基于文本(例如,GSM8K (Cobbe et al., 2021 (https://arxiv.org/html/2605.16011#bib.bib16)), MathQA (Amini et al., 2019 (https://arxiv.org/html/2605.16011#bib.bib15)))和基于视觉的基准(例如,MATH-Vision (Wang et al., 2024 (https://arxiv.org/html/2605.16011#bib.bib11)), MathVerse (Zhang et al., 2024 (https://arxiv.org/html/2605.16011#bib.bib13)))上都取得了优异的性能。然而,自动解题器和教育代理之间存在一个关键区别:解题器优先考虑解题效率和最终答案的正确性 (Yan et al., 2025 (https://arxiv.org/html/2605.16011#bib.bib21)),而教育代理必须提供适合学习者最近发展区的、具有教学透明度的指导和支架 (Cai et al., 2025 (https://arxiv.org/html/2605.16011#bib.bib12); Yu et al., 2025 (https://arxiv.org/html/2605.16011#bib.bib10))。最近的研究表明,LLM可以在互动会话中模拟类似导师的行为 (Vanzo et al., 2025 (https://arxiv.org/html/2605.16011#bib.bib9)),Scarlatos 等人 (2025 (https://arxiv.org/html/2605.16011#bib.bib20)) 进一步强调了它们在知识追踪方面的潜在作用。尽管取得了这些进展,现有工作往往忽视了真实数学学习的多模态性质。现实世界的数学任务通常要求学生跨模态进行推理,将文本指令与几何图形、数据可视化和函数图像结合起来。VLM(包括 GPT-4V、LLaVA 和 Qwen-VL)的出现,使得联合视觉-文本推理成为可能 (Lu et al., 2023 (https://arxiv.org/html/2605.16011#bib.bib8))。然而,当前的评估范式很大程度上仍沿用纯文本设置,强调视觉问答的准确性,而非教学推理的质量 (Lee and Zhai, 2025 (https://arxiv.org/html/2605.16011#bib.bib7))。这种以准确性为中心的评估未能捕捉到解释视觉概念或根据学习者情境调整指导的能力,导致关于多模态模型能否充当自适应导师的实证证据仍然有限。
参照图注 图2:基于自适应评分标准的评估流程概览。学习者特征和数学问题在四种测试组中结合,信息量逐步增加,提供给VLM以生成教学回复,并由专家使用提出的评分标准进行标注。
### 2.3 自适应学习实证研究
将VLM整合到教育技术中代表了智能辅导系统的一个范式转变 (Liu et al., 2025 (https://arxiv.org/html/2605.16011#bib.bib19))。虽然基于生成模型的系统有可能根据学生行为实时定制教学内容 (Banjade et al., 2024 (https://arxiv.org/html/2605.16011#bib.bib17); Lin et al., 2023 (https://arxiv.org/html/2605.16011#bib.bib18)),但它们在提供与情境相符的指导方面的能力仍值得怀疑。值得注意的是,Borchers 和 Shou (2025 (https://arxiv.org/html/2605.16011#bib.bib6)) 采用了一个提示变化框架来评估教学适应性,发现即使是最先进的模型,在引入或移除关键上下文(例如,学生表现或知识成分)时,也常常无法调整其反馈策略。这表明存在一种“情境不敏感性”,模型会退回到通用辅导脚本,而不是响应学习者的特定状态。为填补这一空白,我们旨在提供一种严格的、基于评分标准的评估,以衡量VLM在多大程度上遵循特定的学习者特征。
## 3 适应性评估的评分标准设计
我们的评分标准旨在评估VLM在为具有不同数学能力和背景的学习者定制支持时,是否展现出自适应教学智能。从理论到度量标准,该评分标准围绕三个主轴构建:适应性、正确性和质量。这种结构设计策略性地将教学意图与技术准确性区分开来,确保评分标准能够将模型的适应性与其底层的语言和数学能力分离。其中,适应性是评估的核心重点,而正确性和质量则作为必要的基线控制指标,以确保数学严谨性和语言清晰度。在本工作中,我们将VLM的回复操作化为两个不同的组成部分:“答案”(最终结果)和“解答”(全面的教学内容)。“解答”涵盖了最终答案之外的所有推理步骤、反馈和支架策略。我们提出的评分标准评估模型是否达到自适应教学行为的基本标准。在高层面上,适应性维度评估模型回复是否与提示的教学意图和学习者的背景适当对齐。正确性维度评估答案和解答在数学上是否有效。质量维度考察VLM回复的整体质量。
适应性。适应性维度共包含九个关键问题(Q1–Q9;见附录A.1 (https://arxiv.org/html/2605.16011#A1.SS1))。这些问题的评估要素是基于自适应学习环境的核心因素选定的 (Bernacki et al., 2025 (https://arxiv.org/html/2605.16011#bib.bib23); Plass and Pawar, 2020 (https://arxiv.org/html/2605.16011#bib.bib22)),同时考虑了VLM的交互特性。该评分标准中的主要因素包括:学习者当前的数学知识、学习者的数学学习态度、学习者的自我效能感、解答的数学知识范围、解答难度以及解答复杂度。例如,当学习者表现出消极的数学学习态度时,自适应的回复应提供积极的反馈和指导,帮助学习者解决数学问题,而不是以消极语气继续对话或忽略它 (Wen and Dubé, 2022 (https://arxiv.org/html/2605.16011#bib.bib38))。此外,为了在我们的评分标准中建立一个严谨且细粒度的规范性参考,我们将共同核心州立标准(CCSS)作为一个关键维度。尽管TIMSS框架提供了广泛的领域类别,但CCSS可以提供微观层面的评估分类,并且与TIMSS框架在概念上有90%的一致性 (Schmidt and Houang, 2012 (https://arxiv.org/html/2605.16011#bib.bib58))。解答复杂度通过Q6–Q9进行评估,考察LLM回复是否帮助学习者理解和解释数学问题、提供相关示例、提供额外的类似数学练习以进行巩固,以及提供逐步的详细指导。
正确性。相似文章
VLM是通过自适应测试时优化进行视频推理的优秀教师
本文提出一种新范式:视觉-语言模型(VLM)作为测试时教师,通过可微分奖励和LoRA优化引导视频生成模型(VGM),在视频推理基准测试上平均提升16.7个百分点。
利用视觉-语言模型检测教育视频中的注意力
本文探讨了使用视觉-语言模型(VLM)通过结合注视数据与视频内容来检测教育视频中的注意力丧失,但发现VLM方法并未超越传统的机器学习基线。
LEVANTE-bench:使用认知任务对VLM与儿童进行多尺度比较(或者,“你的VLM比五年级学生更聪明吗?”)
本文介绍了LEVANTE-bench,这是一个系统评估视觉-语言模型在六项认知任务上的表现,并将其与5-12岁儿童的表现进行比较的基准测试,发现当前的VLM仅部分与儿童的认知能力相符。
大型语言模型教导视觉学生:细粒度概念知识的跨模态迁移
本文介绍了LaViD框架,该框架通过生成多项选择题作为概念签名,将语义知识从纯语言大语言模型转移到视觉学生模型,实现了优越的细粒度分类性能和鲁棒性。
视觉语言模型真的能进行视觉推理吗?模态差距的严格研究
本文介绍了CrossMath,一个受控多模态推理基准,揭示了当前视觉语言模型的一个关键局限:它们主要在文本空间进行推理,而非真正的视觉接地推理,视觉输入往往会降低性能相比仅文本基线。作者提出了微调方法来减轻这种模态差距并改进多模态推理能力。