从SQL错误到概念差距:一个用于个性化反馈的AI驱动知识图谱分析平台

arXiv cs.CL 论文

摘要

这篇IEEE论文介绍了一个AI驱动的知识图谱平台,将数据库课程中的SQL错误与概念差距联系起来,自动提取课程概念并将其与学生提交关联,以提供个性化的诊断反馈。

arXiv:2608.03118v1 Announce Type: new 摘要:这篇创新实践全文论文描述了一个AI驱动的知识图谱平台,将本科生和研究生数据库系统课程中的SQL错误与概念差距联系起来。学习结构化查询语言(SQL)的学生经常遇到语义错误,这些错误反映的是概念误解而非语法错误。一个查询可能执行成功但返回错误结果,原因是跨越相关概念的知识缺口;例如,使用NATURAL JOIN代替显式子查询,反映了对JOIN、GROUP BY和HAVING之间相互交织的误解。自动评分系统能检测正确性,但只提供表面级反馈,未将错误与课程的概念结构联系起来。教育知识图谱研究已表明结构化概念表示在课程分析和自适应学习中的价值,但这些方法尚未应用于从学生提交中诊断SQL误解。我们提出了一个平台,能够从教学材料中自动提取课程概念和关系,通过图数据库将其与学生提交轨迹关联,并在概念层面分类错误。我们在两所大学的两门数据库系统课程中评估了该平台,其中一门使用真实学生提交,另一门使用模拟提交,评估方式包括一项由五名参与者组成的专家研究和一项使用LLM作为评判者的自动化评估。结果表明,95.7%的提取节点被评为至少有一定有效性,63.8%的三元组被评为完全正确。专家反馈证实,生成的图谱与教师的心智模型一致,并且将错误映射到课程概念能提供可操作的诊断见解;评估对学生学习的影响仍是未来的工作。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:44

# 从SQL错误到概念缺口:一个用于诊断反馈的AI驱动知识图谱分析平台 © 2026 IEEE. 允许个人使用此材料。出于任何其他用途,包括以任何当前或未来媒体形式转载/重新发布此材料用于广告或促销目的、创作新汇编作品、转售或再分发至服务器或列表,或在此作品的其他作品中重用任何受版权保护的组成部分,必须获得IEEE的许可。
来源:https://arxiv.org/html/2608.03118
###### 摘要

这篇创新实践全文描述了一个AI驱动的知识图谱平台,它将SQL错误与本科生和研究生数据库系统课程中的概念缺口联系起来。学习结构化查询语言(SQL)的学生经常在语义错误上遇到困难,这些错误反映的是概念性误解,而非语法错误。一条查询可能可以执行,但由于涉及相关概念的综合缺口而返回错误结果;将NATURAL JOIN误用为显式子查询,反映了对JOIN、GROUP BY和HAVING交织在一起的误解。自动评分系统能检测正确性,但提供的反馈停留在表面层面,没有将错误与课程的概念结构联系起来。教育知识图谱研究已显示出结构化概念表示在课程分析和自适应学习中的价值,但这些方法尚未应用于从学生提交中诊断SQL误解。我们提出了一个平台,它能自动从教学材料中提取课程概念和关系,通过图数据库将它们与学生提交轨迹关联起来,并在概念层面分类错误。我们在两所大学的两门数据库系统课程中评估了该平台,一个使用真实学生提交,一个使用模拟提交,评估方式包括一项五名参与者参与的专家研究和一项使用LLM作为裁判的自动评估。结果表明,95.7%的提取节点被评为至少基本有效,63.8%的三元组被评为完全正确。专家反馈证实,生成的图谱与教师的思维模型一致,并将错误映射到课程概念上能提供可操作的诊断洞察;评估对学生学习的影响仍是未来工作。

## I. 引言

SQL是数据库系统课程中教授最广泛的主题之一,因为它是查询和操作关系数据的标准语言,具有基础性作用。然而,SQL对许多学生来说具有挑战性,因为它需要一种不同于更具程序性编程任务的推理方式;SQL不是描述过程的每一步,而是要求学生指定(声明)他们想要的结果。以往的研究表明,这种转变会产生持续性的概念困难,特别是围绕SQL概念,包括连接(Join)、分组与聚合(Grouping and Aggregation)、过滤(WHERE)和嵌套查询(Nested Queries)[2 (https://arxiv.org/html/2608.03118#bib.bib1),15 (https://arxiv.org/html/2608.03118#bib.bib2),14 (https://arxiv.org/html/2608.03118#bib.bib3)]。最近的研究还大规模分析了学生SQL作业和问题解决模式,表明学生的困难往往通过重复提交行为系统地显现出来,而不仅限于孤立的失败尝试。[13 (https://arxiv.org/html/2608.03118#bib.bib5),17 (https://arxiv.org/html/2608.03118#bib.bib6),16 (https://arxiv.org/html/2608.03118#bib.bib7),19 (https://arxiv.org/html/2608.03118#bib.bib18)]

现有的自动评分系统主要关注查询正确性,未能很好地捕捉这些困难。学生可能会提交一条能运行但仍反映错误推理的查询,或者可能通过反复试错编辑查询,却不理解他们缺失的底层概念。虽然自动评分器帮助教师在规模上评估提交,但简单的二元反馈往往过于粗糙,无法解释为什么解决方案失败,或者哪种误解导致了失败。因此,先前关于SQL辅导的工作强调了互动工具、个性化指导和更丰富的反馈生成,而不仅仅是简单评分[7 (https://arxiv.org/html/2608.03118#bib.bib10),9 (https://arxiv.org/html/2608.03118#bib.bib11)]。然而,大多数现有系统仍然专注于单次尝试,而不是维护课程概念结构的显式表示。

这一限制在真实课堂中很重要,因为学生错误很少是孤立的。一次失败的提交可能反映了对单个概念的缺口,但也可能源于对几个相关概念如何组合在一起的误解。同时,课程的关键信息通常分散在讲稿幻灯片、练习题、参考解答和提交日志中。知识图谱为组织课程概念提供了一种有前景的方式,能够增强课程分析、自适应学习和可解释的学习支持,正如近期教育研究所强调的那样[1 (https://arxiv.org/html/2608.03118#bib.bib13),6 (https://arxiv.org/html/2608.03118#bib.bib12),8 (https://arxiv.org/html/2608.03118#bib.bib19),19 (https://arxiv.org/html/2608.03118#bib.bib18)]。然而,先前的工作也指出,手工构建和维护教育知识图谱是劳动密集型的,这推动了自动化和AI辅助方法的发展[1 (https://arxiv.org/html/2608.03118#bib.bib13),6 (https://arxiv.org/html/2608.03118#bib.bib12)]。

受这些差距的驱动,我们提出了一个用于SQL教育的AI驱动知识图谱分析平台。该系统自动从教学材料中提取课程概念和关系,将它们与评估问题和提交轨迹关联起来,并利用这种结构在概念层面语境化学生错误。其架构将基于执行的评分与模型辅助的语义解释分开,同时异步地将学习者证据同步到图数据库中,用于面向教师的分析和面向学生的进度反馈。

本工作做出了以下关键贡献。

- 它引入了一条从教学材料和评估内容构建课程知识图谱的自动化流水线。
- 它将基于执行的评分与基于LLM的语义反馈相结合,以分类SQL错误并将其连接到相关课程概念。
- 它支持对学生提交进行概念级分析,既能为学生提供诊断性反馈,也能为教师提供反复出现的概念缺口和误解模式的视图。

## II. 相关工作

先前关于SQL学习系统的工作通过语义分类、误解分析和学生提交的大规模分析来研究学生错误。Ahadiet al. [2 (https://arxiv.org/html/2608.03118#bib.bib1)]表明,学生会在不同类型的SQL查询中犯重复性的语义错误,而不仅仅是孤立的语法失误。Taipaluset al. [15 (https://arxiv.org/html/2608.03118#bib.bib2)]进一步对SQL查询构造中的错误和复杂性进行了分类,并认为这些困难是系统性的,且具有教学意义。Miedemaet al. [12 (https://arxiv.org/html/2608.03118#bib.bib4)]通过考察SQL误解及其成因深化了这一研究方向,强调许多学生错误反映的是不完整或不正确的心理模型,而非简单的粗心。Poulsenet al. [13 (https://arxiv.org/html/2608.03118#bib.bib5)]表明,学生的困难可以通过解决方案在多次尝试中的演变过程显现出来,强调了分析提交轨迹而不仅仅是最终正确性结果的价值。总之,这些研究促使我们关注语义性SQL错误,但不同于以往主要将错误视为提交层面现象的分析,我们的工作将错误与显式的课程概念图和学生提交轨迹连接起来,以进行概念层面的解释。

SQL辅导和自动评分系统已越来越多地从正确性检查转向更丰富的形成性反馈。Brusilovskyet al. [7 (https://arxiv.org/html/2608.03118#bib.bib10)]将互动工具和个性化整合到SQL学习中,展示了引导式练习环境的价值。Kleiner and Heine [9 (https://arxiv.org/html/2608.03118#bib.bib11)]通过比较学生和参考解析树来生成结构性提示和部分分数,证明自动评分的反馈能够反映查询结构,而不仅仅是最终输出。Yousefet al. [18 (https://arxiv.org/html/2608.03118#bib.bib16)]提出了BeGrading,一个基于微调LLM的系统,用于编程作业的自动评分和反馈,证明LLM生成的评估可以接近人工评分的一致性,同时减少教育工作者的负担。在SQL特定领域,Manikaniet al. [11 (https://arxiv.org/html/2608.03118#bib.bib14)]开发了一个基于LLM的SQL自动评分器,使用微调的开源模型,达到了96.77%的评分准确率,并能对错误提交提供结构化反馈,展示了基于LLM的评估在大学环境中的可扩展性。Lai and Hui [10 (https://arxiv.org/html/2608.03118#bib.bib15)]提出了一个基于GPT 4o的SQL作业反馈系统,使用结构化的提示工程和预定义评分标准来评估语法和语义,在80名学生中达到约91%的反馈准确率。Alrabah and Alawini [4 (https://arxiv.org/html/2608.03118#bib.bib9)]提出了CodeLens,一个生成式AI框架,用于检测语义SQL错误并生成不泄露答案的反馈,旨在引导学生而不直接给出解决方案。他们的框架将用于语义错误检测的通用LLM与一个在人工策划反馈上微调的模型相结合,以过滤掉会泄露解决方案的内容。两个学期的评估表明,接受AI支持反馈的学生需要的提交尝试次数更少,尤其是在涉及子查询和条件逻辑的复杂查询上。然而,这些系统都在单个提交层面运作,没有维护一个关于错误如何与更广泛的课程概念和依赖关系相关联的持久表示。我们的系统通过将提交级反馈作为知识图谱分析流水线中的证据来复用,而不是将每次尝试视为独立的辅导事件,从而实现了改进。

教育知识图谱研究已经表明,概念和关系的结构化表示可以支持课程分析、推荐和自适应学习。Abu-Salih and Alotaibi [1 (https://arxiv.org/html/2608.03118#bib.bib13)]强调教育知识图谱在概念映射、个性化学习和教学组织方面很有用,同时也指出图谱的构建和维护仍然是困难的瓶颈。Aytekinet al. [6 (https://arxiv.org/html/2608.03118#bib.bib12)]提出了一种专家在环(expert-in-the-loop)的方法来构建带有先修关系(prerequisite relations)的教育知识图谱,表明AI辅助可以在保持可解释性的同时减少人工工作量。类似地,Alatrashet al. [3 (https://arxiv.org/html/2608.03118#bib.bib20)]通过投票算法结合基于文档、基于图和基于文本的特征,在没有标注数据的情况下推断先修关系。AlRabahet al. [5 (https://arxiv.org/html/2608.03118#bib.bib17)]提出了InstructKG,一个从讲座材料中提取概念并推断先修和组成依赖关系(compositional dependencies)的框架。我们的平台采用了类似的依赖结构,并通过将概念图与学生提交轨迹和错误分类相连接来扩展它,以进行概念级诊断,进而支持个性化学习。

文献中的一个关键空白是,先前关于SQL错误、反馈和教育知识图谱的工作在很大程度上是分开进行的。现有的SQL辅导工作在识别或解释查询错误方面很强,而先前的教育知识图谱工作在组织概念和先修关系方面很强。我们的工作通过将学生提交轨迹、语义SQL错误类型、提取的课程概念和概念关系统一到一个基于图的表示中,将这些线索连接起来。这种统一表示使系统能够将学生错误追溯到特定的课程概念及其先修概念,为教师和学生提供关于概念缺口和误解起源的结构化视图。

## III. 方法论

参见图1:提交评估与图谱分析平台的端到端架构。在线路径执行低延迟自动评分和受控语义反馈生成,而异步路径将存储的尝试和提取的概念同步到Neo4j中,用于概念级分析、对账和仪表板支持。

### III-A. 数据集与数据准备

我们的平台在两个同步的数据空间上运行:一个用于评估定义和教学材料的课程内容空间,以及一个用于提交轨迹的学生尝试空间。课程内容空间由从大学在线评估平台导出的结构化JSON问题文件构建。对于自动评分的SQL题目,问题JSON扩展了提示、可执行模式、测试数据、预期输出和参考查询,这些共同定义了一个确定性的评分目标。学生尝试空间存储在PostgreSQL中,通过后端ORM中定义的submissions、submission_errors和vector_embeddings表来管理。

这种分离是必要的,因为系统必须同时支持低延迟评分和跨尝试分析。因此,我们按student_id、assessment_id和question_id对所有记录进行规范化,并为每次存储的尝试保留时间戳、状态标签、反馈和嵌入向量。在摄取期间,问题文本会被清理,以去除仅界面产生的痕迹,例如结尾的query.sql指令,而学生历史会被追加而不是覆盖。所得到的模式为评分、错误聚合和知识图谱同步提供了稳定的连接键。

### III-B. 系统架构

图1 (https://arxiv.org/html/2608.03118#S3.F1)展示了端到端的平台架构,围绕两个工作流组织,它们都汇入一个共享的知识图谱。教师工作流(左侧)处理课程内容摄入,上传的讲座材料经过预处理,LLM辅助的提取提出候选概念和关系。教师可以在候选概念和关系被最终确定为三元组(概念-关系-概念边,例如,INNER JOIN ---> Part Of ---> JOIN)并同步到知识图谱之前,对其进行审查和编辑。学生工作流(右侧)通过基于执行的评分和LLM辅助的语义反馈处理SQL提交,然后进行错误分类和概念关联,将每个识别出的错误链接到知识图谱中的相关节点。中央知识图谱统一了两侧,既存储课程结构(概念之间的先修和组合关系),也存储学习者证据(带标签的错误记录和学生提交轨迹)。一个题目标注层通过将每个评估问题与其在图谱中的目标概念关联起来,桥接了两个工作流,这使得系统能够将学生错误追溯到特定的课程概念及其依赖关系。

### III-C. 评估流水线与自动评分

在线评估模块满足了一个核心教学要求:在每次尝试后立即返回可靠的反馈。前端发送submission、questio

相似文章

利用课程先决条件图从对话式AI交互中检测知识缺口

arXiv cs.CL

该论文提出了一种流水线,利用少样本文本分类器和GPT-4提取的先决条件知识图谱,将学生在对话式AI助教中提出的问题映射到课程主题。在1,340个问题事件上实现了80%的准确率,并与学生自我报告的难度相关。

面向AI教育中算法追踪与问题求解的检索增强型辅导

arXiv cs.AI

本文介绍了KITE,一个基于检索增强生成(RAG)的智能辅导系统,用于AI教育中的算法推理和问题求解。该系统采用意图感知的苏格拉底式回应策略和多模态RAG,提供基于课程内容、符合教学法的反馈,并通过指标评估、专家评审和模拟学生交互进行评价。