通过能力与熟练度建模来解耦知识状态以进行知识追踪

arXiv cs.LG 论文

摘要

提出了阶段感知知识追踪(PAKT)框架,该框架将学生交互分解为能力阶段和熟练度阶段,利用多分支Transformer建模阶段特定和整体的知识状态,在六个基准测试上相比基线方法实现了一致的改进。

arXiv:2607.13103v1 公告类型:新 摘要:知识追踪(KT)旨在通过从历史交互中建模学生不断变化的知识状态,来预测学生的未来表现。现有的KT方法通常将原始交互序列视为统一的行为过程,忽视了学习行为的阶段性特征。我们的初步观察表明,学生在充分练习后更有可能正确回答之前失败的知识概念,这表明学习从能力构建过渡到了熟练度导向。受此启发,我们提出了阶段感知知识追踪(PAKT),这是一个基于定制分解机制将学生交互分解为能力阶段和熟练度阶段的KT框架。为有效利用分解后的序列,我们设计了一个具有类型感知读取模块的多分支Transformer,以联合捕获阶段特定和整体的知识状态。我们还进行了因果分析,揭示了忽略阶段的KT模型中因纠缠复杂学习行为而导致的混淆偏差。在六个公开基准上的广泛实验表明,我们的方法始终优于代表性基线,最大AUC提升1.33%,平均提升0.82%。
查看原文
查看缓存全文

缓存时间: 2026/07/16 04:21

# 解耦知识状态:基于能力与熟练度建模的知识追踪
来源:https://arxiv.org/html/2607.13103
李端腾川 https://orcid.org/0000-0003-2902-7365, 毕英骞 https://orcid.org/0009-0003-3672-3470, 陈劲松 https://orcid.org/0000-0001-7588-6713, 张瑞 https://orcid.org/0000-0001-9418-0863, 童明文 https://orcid.org/0000-0002-9524-7983
李端腾川和张瑞与武汉大学信息管理学院合作,武汉,430072,中国。毕英骞与湖北工业大学计算机科学与人工智能学院,武汉,430068,中国;武汉大学信息管理学院,武汉,430072,中国。陈劲松和童明文与华中师范大学人工智能教育学部,武汉,430074,中国。前两位作者贡献相等。(通讯作者:陈劲松和张瑞。电子邮件:[email protected][email protected]。)

###### 摘要

知识追踪(KT)旨在通过建模学生与知识的历史交互,预测其未来表现。现有KT方法通常将原始交互序列视为统一的行为过程,忽略了学习行为在不同阶段的特性。我们的初步观察表明,学生在经过充分练习后,更有可能正确回答之前失败的知识概念,这表明从能力构建到熟练度导向的学习转变。受此启发,我们提出了阶段感知知识追踪(PAKT),这是一个KT框架,通过定制化的分解机制将学生交互分解为能力阶段和熟练度阶段。为了有效利用分解后的序列,我们设计了一个多分支Transformer,结合类型感知读出模块,共同捕捉阶段特定和整体知识状态。我们进一步进行了因果分析,揭示了在阶段无感知的KT模型中,纠缠复杂学习行为所造成的混杂偏差。在六个公开基准上的大量实验表明,我们的方法在代表性基线模型上持续取得改进,最大AUC提升达1.33%,平均提升达0.82%。

## I 引言

随着教育数据挖掘和学习分析技术的发展,智能辅导系统(ITS)受到了广泛关注[32]。ITS是一种基于计算机的系统,能为学生提供个性化教学和自适应反馈。通过对学生优点和弱点进行建模,ITS提供自适应问题选择、学习表现预测和及时反馈,以促进有效的学习成果。ITS的一个核心挑战在于准确建模个体学生不断演变的知识状态。为此,旨在从学生历史交互序列中估计其知识概念掌握程度的知识追踪(KT),已成为ITS中的基本任务。

早期的KT模型基于概率建模和心理测量理论,包括隐马尔可夫模型(HMMs)和项目反应理论(IRT),用于学生表现预测[4,21]。DKT[26]首先将深度学习引入KT任务,使用循环神经网络(RNNs),显著优于之前的概率方法。由于每个学生的交互历史具有天然的序列性,用于序列数据的深度学习架构被广泛应用于KT任务[34,24,10]。序列KT研究集中在三种主要建模方法上。第一种包括深度序列模型,如基于RNN的DKT[26]和基于Transformer的SAINT[2,22],它们捕捉学生交互序列中的时间依赖关系,以估计演变的知识状态。第二种涵盖结构增强的KT模型,这些模型引入辅助结构,如DKVMN[37]中的外部记忆、GKT[23]和GRKT[6]中的概念先决条件图。第三种包括可解释的KT模型,如EKT[19]、XKT[13,12]和DisenKT[17],它们通过融入教育理论或学习学生知识状态的解耦表示来增强透明性[40,41,31,7]。

尽管现有KT方法[14,20]取得了显著进展,但大多数方法直接使用神经网络对原始学生交互序列进行建模,隐含地假设所有交互都以相同的方式促进学生知识状态的演变[1,28]。然而,这种统一建模范式忽视了学生在不同知识习得阶段可能表现出截然不同的学习行为。最近一项研究DisKT[36]根据回答正确性分解学生响应序列,并从相应的子序列中学习熟悉能力和不熟悉能力的独立表示。然而,这种基于正确性的分解过于粗糙,无法表示不同学习阶段的行为语义,例如初始知识习得与技能巩固。

在实践中,学生在掌握知识概念之前和之后的响应行为可能有很大不同。早期的交互主要反映学习者通过反复练习进行能力发展,而后期的交互则更好地指示已掌握知识的稳定性和运用。如图1所示,相当一部分学生在经过充分练习后,更可能在后续交互中正确回答知识概念。因此,直接对整个交互序列进行编码而不区分这些阶段,可能会混合复杂的学习信号,限制模型精确刻画学习者知识阶段动态演变的能力。这一现象提出了一个具有挑战性的问题:我们如何能有效地从原始学生交互序列中建模阶段特定的学习行为,以更好地刻画学习者知识状态的动态演变?

参见图1:六个基准数据集中表现出两阶段学习属性的学生比例。如果学生在超过四分之一符合条件的知识概念上,后期阶段的准确率高于早期阶段,则认为该学生表现出该属性。
为此,我们提出了阶段感知知识追踪(PAKT),一种新的KT模型,将学生交互序列分解为能力阶段和熟练度阶段进行阶段性建模。学习过程包含两个阶段。在初始阶段,学生通过练习逐步掌握知识概念。一旦掌握,进一步练习会促进技能自动化,带来更流畅、更一致的表现,而不是正确率的额外提升。据此,我们的分解机制根据每个知识概念的累积正确响应次数来划分学习者的响应历史,将早期交互分配给能力阶段,后期交互分配给熟练度阶段。分解后的两个子序列,连同原始完整序列,被输入到一个多分支Transformer基骨干网络中,其中分别对应对学生的能力、熟练度和整体知识状态进行编码。一个类型感知读出模块随后将这些互补表示整合为统一的知识状态,用于最终预测。本文的贡献总结如下:

- • 我们提出了一种新的学习行为感知分解机制,将学生交互序列划分为能力阶段和熟练度阶段。
- • 我们提出了一个多分支Transformer骨干网络,结合类型感知读出模块,用于建模KT任务中的分解交互序列。
- • 在六个公开基准上的大量实验表明,PAKT在所有代表性基线模型上均取得了一致的改进。

## II 相关工作

在本节中,我们首先全面回顾KT领域的最新工作。然后,我们介绍在KT任务中应用序列分解机制的方法。

### II-A 知识追踪

早期的KT任务方法基于概率模型和心理测量理论。BKT[4]是一种经典的概率模型,采用隐马尔可夫模型模拟学生的知识掌握,并基于其历史练习表现进行预测。TLS-BKT[38]在BKT基础上进行了阶段划分,但仍局限在概率图建模框架内,未利用深度神经网络的表示能力。项目反应理论(IRT)[21]是一种心理测量模型,通过建模人的潜在能力(如知识水平)与项目特征(如难度、区分度)之间的交互,来估计正确响应的概率。然而,这些方法依赖强假设和手动定义的知识结构,限制了它们在现实场景中的应用[27]。

最近,基于深度学习的KT方法因其优越的性能和灵活性受到了广泛关注。DKT[26]通过引入RNN直接对序列学生交互进行建模,开启了KT的新时代。接着,KT模型尝试通过引入更复杂的神经网络来更显式地表示知识状态。DKVMN[37]提出了一种带有记忆增强的网络,分别用矩阵存储概念和掌握状态,而AKT[11]和SAINT[2,22]利用Transformer[22]注意力机制动态加权历史交互。

基于这些序列建模的进展,后续研究探索加入外部知识结构和新的训练范式以进一步增强模型能力。除了序列模型之外,深度学习中的先进技术也被引入KT领域。GKT[23]是一种基于图的KT模型,在前提关系图上使用图神经网络(GNNs)捕捉知识概念之间的依赖关系。为了提高模型鲁棒性,CL4KT[16]使用对比学习来获得噪声不变的学生表示,DTransformer[35]集成了诊断解码器来隔离概念特定的掌握水平。

为了增强可解释性,教育理论被整合到深度KT模型中。Deep-IRT[34]将经典的项目反应理论(IRT)融入深度学习框架,使得模型的参数(如能力、难度)保留了其心理测量含义。MIKT[31]显式建模学生知识状态与正确回答概率之间的单调关系,这是教育中的一个核心原则,确保预测的可解释性。CoreKT[5]专注于概念层面的可解释性,设计了一个保证在单个知识组件层面单调性的模型,使得其预测更加透明且在教育上合理。

与此同时,另一条研究路线追求简洁和效率。SparseKT[15]通过稀疏Transformer架构解决长序列中的数据稀疏问题,用局部模式替代全注意力以提高效率和泛化能力。SimpleKT[20]倡导模型简洁性,表明一个良好正则化的单层LSTM可以达到远比其复杂的KT模型的性能。

总之,先前的KT模型大多采用同质化建模范式,对整个学习序列应用单一系统。这种方法自然混淆了早期知识习得(由认知能力驱动)和后期技能巩固(由练习驱动)的独特动态。我们的工作打破了这一传统,引入了一种基于时间、数据驱动的序列分解方法,使得能够明确而独立地建模这两个基本学习阶段。

### II-B 知识追踪中的分解机制

将序列分解引入KT任务是捕捉学习过程中细节特征的一种有前景的方法。DisKT[36]通过使用结构因果模型来去混淆虚假相关并估计反事实效应,开创了序列分解在KT中的应用。

然而,其干预机制依赖于对学生交互的简单划分(如根据历史表现),未能建模不同的教育语义,例如初始知识习得阶段与技能巩固阶段。

相比之下,所提出的PAKT引入了一种定制化的分解策略,将历史记录划分为能力阶段和熟练度阶段,使得基于因果推断的技术能够深入建模学习行为。

## III 预备知识

### III-A 问题定义

KT任务旨在基于观察到的学习交互,建模学生潜在知识状态的演变。我们首先定义教育系统的核心元素:

- • \( \mathcal{S} = \{s_1, s_2, \dots\} \):所有学生的集合。
- • \( \mathcal{Q} = \{q_1, q_2, \dots\} \):所有问题的集合。
- • \( \mathcal{C} = \{c_1, c_2, \dots\} \):所有知识概念(或技能)的集合。

对于给定的学生 \( s \in \mathcal{S} \),他们在 \( T \) 个离散时间步上的学习过程被记录为一个序列化的交互历史:

\( X^{(s)} = \{x_1, x_2, \dots, x_T\} \)。

每个在时间步 \( t \) 的交互 \( x_t \) 表示为一个三元组:

\( x_t = (q_t, \mathcal{C}_{q_t}, r_t) \),

其中:

- • \( q_t \in \mathcal{Q} \)

相似文章

利用课程先决条件图从对话式AI交互中检测知识缺口

arXiv cs.CL

该论文提出了一种流水线,利用少样本文本分类器和GPT-4提取的先决条件知识图谱,将学生在对话式AI助教中提出的问题映射到课程主题。在1,340个问题事件上实现了80%的准确率,并与学生自我报告的难度相关。

KACE:面向数学推理的知识自适应上下文工程

arXiv cs.AI

KACE 引入了一种知识自适应上下文工程方法,通过认知树和分层自一致性将存储与使用分离,在 AIME 2025 上达到了 62.2% 的准确率——相比固定自一致性提升了 10.4 个百分点。