从掌握程度档案到模拟响应:随机学生知识图谱(SSKG)用于忠实的LLM学生模拟
摘要
本文提出了随机学生知识图谱(SSKG),以实现LLM对学生知识的忠实模拟,克服了LLM倾向于按自身能力水平表现而非模拟不同掌握程度档案的限制。
查看缓存全文
缓存时间: 2026/08/25 04:22
# 从精通画像到模拟响应:用于忠实LLM学生模拟的随机学生知识图谱
来源:https://arxiv.org/html/2608.21668
Yuan An, Emily Wang§, Benjamin Wang§, Ruhma Hashmi
隶属机构:计算机与信息科学学院,Nick Howley 工程与计算学院,德雷塞尔大学,宾夕法尼亚州费城 19104,美国 \{ya45, rh927\}@drexel\.edu
###### 摘要
大语言模型 \(LLMs\) 正被日益用于模拟不同精通程度的学生。这类模拟可以生成合成训练数据,并对辅导系统进行压力测试。然而,常见的基于提示的方法将答案决策权交给了LLM,即使要求模拟一个精通程度较低的学生,LLM也倾向于根据其内置能力来表现。因此,这些方法可能难以区分精通程度低和高的学生。我们使用379道经过美国大学理事会校准的SAT代数题目和五种典型的精通画像来证明这一局限性。来自三家厂商的三个LLM(Gemini 3\.1 Flash Lite、Claude Haiku 4.5和GPT\-5.4\-mini)在所有画像中都达到了96\.8\-100%的准确率。为了解决这一局限性,我们引入了一种基于随机学生知识图谱 \(SSKG\) 的方法。课程知识图谱 \(CKG\) 从开放的代数教材中提取,每个SAT解答被分解为所需三元组的链条。SSKG为每个三元组分配一个精通概率,并通过采样来确定问题答案是否正确。然后,LLM生成与结果一致的第一人称合理解释。该模拟将不同画像的准确率降至44\.1\-85.2%,并产生了清晰的单调精通梯度。
###### 索引术语:
知识图谱、学生模拟、大语言模型、知识追踪、合成教育数据、随机本体
§§脚注文本:德雷塞尔暑期实习生。## I引言
图1:传统LLM驱动的学生模拟 \(a\) 与基于SSKG的模拟 \(b\)\. 在传统流程 \(a\) 中,一个题目项和一个学生画像直接交给LLM,由LLM决定模拟的答案及其正确性。在我们的流程 \(b\) 中,首先从源课程中提取一组细粒度三元组构建课程知识图谱 \(CKG\)。学生画像被表示为一个随机学生知识图谱 \(SSKG\),它在某一时刻为每个CKG三元组分配一个精通概率。每道题目被映射到解决它所需的一系列三元组。我们通过将该题目的三元组链与SSKG的精通概率进行采样对比,来模拟一个画像在该题目上的表现,从而决定回答是否正确。这个结果与对应的正确性标签一起传给LLM,由其叙述一个与结果相符的第一人称合理解释。当真实课堂数据因伦理或实际限制而成本高昂、速度缓慢或难以大规模收集时,合成学生响应数据就显得很有价值。其应用包括在课程开设前训练知识追踪模型\[1 (https://arxiv.org/html/2608.21668#bib.bib1)\]、对智能辅导系统在不同精通水平上进行压力测试\[2 (https://arxiv.org/html/2608.21668#bib.bib2)\],或在真实学生接触前试运行新的评估题目\[3 (https://arxiv.org/html/2608.21668#bib.bib3)\]\。LLM是生成此类数据的有吸引力的引擎,因为它们能回答广泛的问题并用自然语言解释其推理过程\[4 (https://arxiv.org/html/2608.21668#bib.bib4)\]。一个悬而未决的问题是*控制*:给定一个能近乎完美地解决课程问题的LLM\[5 (https://arxiv.org/html/2608.21668#bib.bib5)\],如何让它表现得像一个不会的学生?
示例。*给定一组NNSAT代数问题,我们希望模拟三种学生,他们对这些问题所需的代数知识分别达到高、中、低精通水平。一个忠实的模拟应为第一个学生正确回答NN题中的高比例,为第二个学生回答中等比例,为第三个学生回答低比例。此外,如果一个学生在课程的特定部分存在知识缺口,其模拟的错误应集中在需要该知识的问题上。每个错误答案也应能追溯到该学生未能应用的具体代数概念或技能。*□\\square
文献中和实践中一种常见的基于LLM的方法是在提示中描述所期望的学生,例如通过指定技能水平\[6 (https://arxiv.org/html/2608.21668#bib.bib6)\]、考试成绩\[7 (https://arxiv.org/html/2608.21668#bib.bib7)\]或典型学生画像\[8 (https://arxiv.org/html/2608.21668#bib.bib8)\],然后让LLM决定答案和解释(图1 \(a\))\)。我们通过一个具体、现实的基准测试表明这种方法会失败。使用379道SAT代数多选题\[9 (https://arxiv.org/html/2608.21668#bib.bib9)\]和五种从接近专家到存在严重缺口的典型画像,来自三家厂商的三个LLM*无论画像如何*都以96\.8\-100%的准确率作答,包括在一个明确标记为“挣扎的学生,对大多数代数概念掌握程度较低”的画像下。两个设计为具有结构化、章节局部化缺口的诊断性画像,对于每个测试的LLM来说,在统计上都与高精通画像无法区分。这并非一个新发现,它复现并扩展了最初针对GPT\-3.5在非数学领域报告的能力偏差发现\[6 (https://arxiv.org/html/2608.21668#bib.bib6)\]。在这里,我们以更大的规模、在数学推理题目上、以及针对不同的LLM确认了这一点。
为了解决这个问题,我们提出一种基于随机学生知识图谱 \(SSKG\) 概念的模拟方法(见图1 \(b\)\)。构建包含一组细粒度三元组的课程知识图谱 \(CKG\) 后,我们将学生画像表示为一个SSKG,它在某一时刻为每个CKG三元组分配一个精通概率。此外,我们将一个问题的解答描述为从CKG中识别出的一系列三元组。为了进行模拟,我们通过显式采样,将一道题目所需的一系列三元组与该画像的精通向量进行核对。这个分析步骤决定了模拟学生是否正确回答,以及如果失败,具体是哪个知识单元首先出现了问题。最后,调用LLM来呈现一个与已决定的结果一致的第一人称合理解释。
我们设计了这种基于SSKG的方法的四个累积消融分支 \(a\-d\),以便将任何增益归因于特定机制。分支-a是一个单次采样器。为每个所需的三元组进行一次伯努利采样,因此题目中三元组链里的每个三元组都具有同等重要性。分支-b增加了检索/执行(知识追踪)分解,将事实是否可用于学生(检索)与是否能无误应用(执行)区分开来。分支-c增加了基于分类法的题目权重调整,使得失败一个纯定义性事实(例如,忘记什么是变量)的后果不如失败一个程序性或关系性事实(例如,错误应用多步方法或选择错误的解题方法)那么严重。分支-d增加了干扰项路由。在特定三元组上失败时,不是均匀选择一个错误选项,而是使用题目的干扰项映射选择该失败会导致的特定错误答案选项。
我们做出了以下贡献。
1. 1\. 我们描述了一种人工引导的提取方法,用于从给定源材料中提取和构建课程知识图谱 \(CKG\)。
2. 2\. 我们开发了一种基于SSKG的方法来模拟具有分层画像的学生。该方法实现了画像准确性的单调性以及特定技能的错误模式。
3. 3\. 我们展示了该模拟方法的理论基础和实际实现。
4. 4\. 我们进行了一项四分支累积消融研究,将该方法的增益归因于特定机制。
论文的其余部分组织如下。第II节讨论相关工作。第III节介绍一个说明性的SAT示例。第IV节形式化几个关键概念和问题。第V节描述CKG的提取过程。第VI节描述如何识别每道题目所需的三元组链。第VII节讨论干扰项映射的构建方式。第VIII节描述五个学生画像SSKG的表示方法。第IX节介绍SSKG模拟方法的理论基础及其四个累积消融分支。第X节报告完整的实验评估。第XI–XIII节讨论研究发现、其局限性及未来工作。
图2:相关工作层级结构
## II相关工作
在本节中,我们根据图2描述相关工作。
### II\-A教育知识图谱
MOOCCube\[10 (https://arxiv.org/html/2608.21668#bib.bib10)\]从超过700门真实MOOC课程中构建了一个大规模的知识图谱,包含课程概念、视频和练习,专门用于支持下游的自然语言处理和学习分析任务。Pan等人\[11 (https://arxiv.org/html/2608.21668#bib.bib11)\]详细阐述了LLM用于知识图谱构建的模式。由于LLM提出的三元组不一定是正确的,因此需要人工验证。Tsaneva等人\[12 (https://arxiv.org/html/2608.21668#bib.bib12)\]表明,单独的LLM验证能力较弱,而人机混合验证提供了最佳的总体效果。
### II\-B随机与概率知识图谱
在多个表示层次上,已研究过将概率附加给一个事实而非将其视为普遍真理。概率本体语言如PR\-OWL\[13 (https://arxiv.org/html/2608.21668#bib.bib13)\]扩展了OWL(Web本体语言),增加了贝叶斯语义,使得类成员资格和关系可以基于置信度而非确定公理来断言。由开放信息抽取构建的概率知识图谱,如NELL\[14 (https://arxiv.org/html/2608.21668#bib.bib14)\],在从文本读取时为每个自动抽取的信念附加一个置信度分数,并且仅保留置信度超过阈值的信念。不确定知识图谱嵌入\[15 (https://arxiv.org/html/2608.21668#bib.bib15)\]为每个三元组附加一个置信度分数,并学习预测未见三元组置信度的嵌入。从一般层面讲,随机过程\[16 (https://arxiv.org/html/2608.21668#bib.bib16)\]是一组由参数索引的随机变量的集合。在这里,参数是链中待解决的步骤,我们每个三元组的采样提供了该过程的具体实例。
### II\-C知识追踪与认知诊断
对学生的已知和未知进行建模是一个独立于LLM的、已有数十年历史的问题,最初由适应教学以适应推断掌握状态的智能辅导系统所驱动。VanLehn\[17 (https://arxiv.org/html/2608.21668#bib.bib17)\]对辅导研究进行了元分析,发现基于步骤的ITS辅导已经接近人类导师的效果。两类模型主导了对该掌握状态的推断。Corbett和Anderson\[18 (https://arxiv.org/html/2608.21668#bib.bib18)\]引入了贝叶斯知识追踪 \(BKT\)。Piech等人\[19 (https://arxiv.org/html/2608.21668#bib.bib19)\]则引入了深度知识追踪 \(DKT\),用在交互序列上端到端训练的循环网络取代了BKT中每个技能的贝叶斯更新。在认知诊断方面,Junker和Sijtsma\[20 (https://arxiv.org/html/2608.21668#bib.bib20)\)形式化了确定性输入、噪声“与”门 \(DINA\) 模型,作用于一个二进制属性(此处为三元组)掌握向量。De la Torre\[21 (https://arxiv.org/html/2608.21668#bib.bib21)\]将DINA推广为G\-DINA(广义DINA)。这两类模型的基础都是经典的项目反应理论 \(IRT\)\[22 (https://arxiv.org/html/2608.21668#bib.bib22)\],它将学生正确回答的概率建模为潜在能力参数和项目级难度/区分度参数的函数。Harwell等人\[23 (https://arxiv.org/html/2608.21668#bib.bib23)\]展示了随机采样模拟考生对测试项目的响应。他们的蒙特卡洛IRT研究为许多模拟考生中的每一位抽取一个潜在能力,并根据拟合的项目参数随机生成每个人对每个项目的响应。
### II\-DLLM驱动的学生模拟
先前的LLM学生模拟方法在以下位置之一控制模拟的精通水平:提示、模型的权重或logits,或外部符号架构。
提示级控制。Benedetto等人\[6 (https://arxiv.org/html/2608.21668#bib.bib6)\]用数字技能水平 \ell∈\{1,...,5\}\\ell\\in\\\{1,\\dots,5\\\} 提示GPT\-3.5,并要求其选择该学生会给出的答案选项。他们报告说,无约束模型和他们模拟的最高水平之间仅相差0\.92与0\.90的准确率,即提示将行为压缩向上限靠拢,并且提示对无关紧要的措辞变化很脆弱。Lu和W instead\[8 (https://arxiv.org/html/2608.21668#bib.bib8)\]将画像描述为学生已掌握、困惑或无证据的知识组件 \(KCs\) 列表。他们要求LLM*预测*学生的答案,而不是直接扮演该学生。在针对100名真实学生和20道题目的评估中,该框架显示,在掌握的KCs上,画像对齐的预测达到85\.2%的准确率,而在困惑的KCs上仅为11\.0%。Acquaye等人\[24 (https://arxiv.org/html/2608.21668#bib.bib24)\]通过聚合许多模拟考生的LLM模拟响应准确率,并将结果与IRT校准的真实值进行比较,来估计题目难度。Srivatsa等人\[7 (https://arxiv.org/html/2608.21668#bib.bib7)\]提供了独立的、现实世界的证据,表明基于LLM的学生模拟未能保持学生精通水平的差异。他们用国家教育进展评估 \(NAEP\) 年级水平(4、8或12)提示LLM,并将生成的模拟响应置于与真实学生群体相同的IRT能力量表上,他们发现,强大的通用模型在没有任何额外指导的情况下,在每个年级都持续优于平均水平的真实学生。仅仅一个年级水平提示并不能将一个有能力的模型拉低到目标能力水平。
模型级控制。PS2\[25 (https://arxiv.org/html/2608.21668#bib.bib25)\]在logits层级在一个强大的上界LLM和一个微调以产生概念和程序错误的弱下界LLM之间进行插值。他们证明这比提示基线在更细粒度上保持了单调的准确率排序,后者在五个到七个水平上会颠倒排序。然而,PS2的熟练度调节仍然是一个单一标量,即两个模型之间的插值比率。我们的SSKG基础用相似文章
StudentSim:训练基于LLM的学生模拟器
StudentSim从稀疏数据中训练个性化的基于LLM的学生模拟器,以镜像学习者响应并适应导师指导,在国际象棋、写作和数学领域超越GPT-5.4。
INSIDE the Student's Mind: Jointly Modeling Latent Reasoning and Action in LLM Student Simulators
This paper presents INSIDE, a framework that fine-tunes LLMs to generate internal dialogue grounded in Bloom's Taxonomy, enabling student simulators to model both latent reasoning and observable actions. Evaluations show improved action fidelity and reasoning alignment compared to prompting baselines.
LLM的未来发展方向
文章讨论了为何LLM无法从用户交互中学习,且缺乏确定性的真值层,提出动态知识图谱可以减少幻觉并在医学等高风险领域提升性能。
Learning Stateful Predictive Knowledge From Experience
This paper introduces Stateful Knowledge Learning (SKL), a framework that shifts LLM agents from trajectory-level reflection to maintaining explicit state-anchored predictive knowledge, demonstrating improved generalization and policy-making on interactive environments like WebShop, ScienceWorld, and ChessPuzzles.
KnowSim:使用学习型用户模拟器评估LLM助手的信息校准
本文介绍了KnowSim,一个通过建模用户知识状态来评估LLM助手信息校准的评估框架,经人类判断验证并优于基线模拟器。