TutorTrace:一个用于在AI辅助编程教育中分类学习者行为状态的数据集与分类体系
摘要
TutorTrace提供了一个数据集和分类体系,旨在AI辅助编程教育中对学习者行为状态进行分类,借助IDE遥测和行为上下文实现实时可见与可计算的适应性辅导系统。
arXiv:2608.26184v1 公告类型:新
摘要:AI编程辅导器提供可扩展的支持,但缺乏人类辅导器依赖的行为上下文来适应学习者的需求。我们提出TutorTrace,这是一个数据集和行为抽象管线,能够从低级IDE遥测中实时使学习者的行为上下文可见和可计算。在两个入门Python课程的四次部署中(N=480),TutorTrace捕获了大约180K遥测事件、13,633个行为段和27个连续计算的度量指标。基于此,我们推导出一个学习者活动分类体系,涵盖第一次AI查询之前、连续查询之间以及整个会话期间,使系统不仅响应学习者所说的内容,还能响应他们在寻求帮助时刻之前所做的事情。在初步的课堂评估中,行为感知提示与查询间隔中无独立工作的比例从50.0%下降到20.7%相关联。作为下游效用的额外证明,我们在两个保留的预测任务上评估了TutorTrace:学习者是否会在接下来60秒内查询(AUROC=.726)以及即将到来的查询是否反映引导式或依赖式求助(AUROC=.717)。这些发现共同表明,行为上下文如何能够实现大规模适应性AI辅导。
查看缓存全文
缓存时间: 2026/08/28 09:30
# 一个用于分类AI辅助编程教育中学习者行为状态的数据集与分类法 来源:https://arxiv.org/html/2608.26184 ## TutorTrace:用于分类AI辅助编程教育中学习者行为状态的数据集与分类法 **会议**:第39届ACM用户界面软件与技术年度研讨会;2026年11月2日至5日;美国密歇根州底特律 第39届ACM用户界面软件与技术年度研讨会(UIST ’26),2026年11月2日至5日,美国密歇根州底特律 DOI:10\.1145/3830398\.3830712 (https://doi.org/10.1145/3830398.3830712) ISBN:979\-8\-4007\-2856\-3/2026/11 David Barron OrcID:0009\-0005\-7252\-7762 (https://orcid.org/0009-0005-7252-7762) 隶属机构:弗吉尼亚理工大学,布莱克斯堡,弗吉尼亚州,美国 邮箱:[dbarron410@vt\.edu](mailto:[email protected]) Xiaohang Tang OrcID:0000\-0002\-2691\-9280 (https://orcid.org/0000-0002-2691-9280) 隶属机构:弗吉尼亚理工大学,布莱克斯堡,弗吉尼亚州,美国 邮箱:[xiaohangtang@vt\.edu](mailto:[email protected]) Rezky Dwisantika OrcID:0009\-0003\-3192\-090X (https://orcid.org/0009-0003-3192-090X) 隶属机构:日惹理工大学,泗水,东爪哇,印度尼西亚 邮箱:[rezkysantika21@gmail\.com](mailto:[email protected]) Minsun Kim OrcID:0009\-0002\-4593\-2672 (https://orcid.org/0009-0002-4593-2672) 隶属机构:弗吉尼亚理工大学,布莱克斯堡,弗吉尼亚州,美国 邮箱:[minsunkim@vt\.edu](mailto:[email protected]) David H\. Smith IV OrcID:0000\-0002\-6572\-4347 (https://orcid.org/0000-0002-6572-4347) 隶属机构:弗吉尼亚理工大学,布莱克斯堡,弗吉尼亚州,美国 邮箱:[dhsmith4@vt\.edu](mailto:[email protected]) Jiaming Cui OrcID:0000\-0002\-2685\-2776 (https://orcid.org/0000-0002-2685-2776) 隶属机构:弗吉尼亚理工大学,布莱克斯堡,弗吉尼亚州,美国 邮箱:[jiamingcui@vt\.edu](mailto:[email protected]) and Yan Chen OrcID:0000\-0002\-1646\-6935 (https://orcid.org/0000-0002-1646-6935) 隶属机构:弗吉尼亚理工大学,布莱克斯堡,弗吉尼亚州,美国 邮箱:[ych@vt\.edu](mailto:[email protected]) 2026; © cc ###### 摘要。AI编程导师可提供可扩展的支持,但缺乏人类导师用来适应学习者需求的行为情境。我们提出了TutorTrace,一个数据集和行为抽象管道,它使学习者的行为情境能够从底层IDE遥测数据中实时可视化并进行计算。在两个入门Python课程的四次部署中(N=480),TutorTrace捕获了大约180K个遥测事件、13,633个行为片段和27个持续计算的指标。在此基础上,我们推导出一个分类法,用于刻画首次AI查询之前、连续查询之间以及整个会话过程中的学习者活动,使系统不仅能响应学习者的表述,还能响应其在寻求帮助时刻之前的行为。在初步的课堂评估中,行为感知提示与独立工作间隔查询的比例从50.0%下降至20.7%相关联。作为下游效用的进一步证明,我们通过两个保留的预测任务评估了TutorTrace:预测学习者是否会在接下来的60秒内发起查询(AUROC=.726),以及即将进行的查询是引导式还是依赖式求助(AUROC=.717)。这些发现共同展示了行为情境如何能够实现大规模的适应性AI辅导。 ###### 关键词:行为分析、智能学习环境、教育技术、学生行为分类、LLM辅助编程、IDE遥测、人机交互 ††cc\-license:by ## 1\.引言 表1\. TutorTrace与现有计算机科学教育和AI辅助编程数据集的比较:第二届CSEDM数据挑战赛(CSEDM数据挑战赛组织者 2021 (https://arxiv.org/html/2608.26184#bib.bib10);Edwards and Murali 2017 (https://arxiv.org/html/2608.26184#bib.bib11)),ProgSnap2(Price et al\. 2020 (https://arxiv.org/html/2608.26184#bib.bib29)),CodeAid(Kazemitabaar et al\. 2024 (https://arxiv.org/html/2608.26184#bib.bib21)),以及CodeWatcher(Basha et al\. 2025 (https://arxiv.org/html/2608.26184#bib.bib4))。 大语言模型通过提供基于任何单一导师都无法匹敌的知识库的即时、深入的响应,改善了个性化计算教育(Tang et al\. 2025 (https://arxiv.org/html/2608.26184#bib.bib35))。然而,一对一的人类辅导仍然是提高学习者成果的黄金标准(Bloom 1984 (https://arxiv.org/html/2608.26184#bib.bib6))。一个关键原因是,人类导师不仅响应学习者明确表述的内容,还响应其可观察行为所暗示的隐含需求(Wood et al\. 1976 (https://arxiv.org/html/2608.26184#bib.bib37);Chi et al\. 2001 (https://arxiv.org/html/2608.26184#bib.bib8))。 思考一下这在大规模下可能是什么样子。 > 想象一下,如果一门400人的编程课程中的每个学生都有一位导师坐在旁边,观察他们的所作所为和遇到的困难。这位导师知道何时推动他们更努力,何时放慢节奏并提供支持。这位导师能区分是真正遇到困难的学生还是没有付出努力的学生。 实现这一愿景需要系统能够从细粒度交互数据中实时推断学习者不断演变的行为情境,这是我们社区尚未具备的能力和数据资源。人类导师的比较优势在于寻求帮助时刻之前的行为情境。当前的AI辅导系统通常仅限于问题本身,忽略了问题之前挣扎或缺乏挣扎的过程。要弥合这一差距,系统必须能够以编程方式检测人类导师直观观察到的行为模式。这需要能够大规模暴露学生细粒度编程行为的数据集。 大多数现有数据集仅捕获学习者编程过程的子集,例如静态代码提交或AI交互日志。很少有提供连续、细粒度交互遥测数据的数据集,无法实现学习者编程会话的高保真重放(表1 (https://arxiv.org/html/2608.26184#S1.T1))。那些确实捕获了这种粒度交互的系统(Mozannar et al\. 2024 (https://arxiv.org/html/2608.26184#bib.bib28);Zhang et al\. 2026 (https://arxiv.org/html/2608.26184#bib.bib39))并非为了发布课堂规模的数据集而构建。 先前的研究表明,围绕寻求帮助时刻的行为情境与学习成果相关(Ma et al\. 2026 (https://arxiv.org/html/2608.26184#bib.bib25)),特定的交互模式能区分有效和无效的AI使用(Ma et al\. 2026 (https://arxiv.org/html/2608.26184#bib.bib25);Shen and Tamkin 2026 (https://arxiv.org/html/2608.26184#bib.bib32))。在接受指导前投入独立努力的学生能从中学到更多(Kapur 2014 (https://arxiv.org/html/2608.26184#bib.bib20);Sinha and Kapur 2021 (https://arxiv.org/html/2608.26184#bib.bib33)),学生的行为情境直接为导师的干预教学策略提供信息(Harvey et al\. 2025 (https://arxiv.org/html/2608.26184#bib.bib14))。然而,当前的AI辅导系统通常响应学习者明确提供的信息,而非其之前的行为过程。因此,两个拥有相似代码、错误和问题的学习者,尽管通过根本不同的过程到达那个时刻,却可能获得相似的支持。 我们提出了TutorTrace,一个数据集和自动化行为抽象基础设施,旨在使这种情境可视化并可计算。该数据集包含来自两个入门Python课程四次部署中480名学生的细粒度IDE遥测数据。一个自动化管道将此遥测数据转换为持续计算的可观察指标和行为序列。与现有仅捕获学习者提交内容或提问的数据集不同,TutorTrace捕获了他们如何到达那里的故事,使每个学习者不断演变的行为情境能够以编程方式实时访问。 为了证明TutorTrace对未来研究和系统设计的效用,我们研究了其行为情境表示如何支持适应性AI辅导。首先,我们推导出一个三窗口行为分类法,组织首次AI查询之前的活动、连续查询之间的活动以及整个会话中反复查询的模式。接下来,我们进行初步比较,研究行为感知提示是否与查询之间可观察活动的变化相关。最后,我们通过两个任务展示了额外的预测效用:预测学习者是否会在接下来的60秒内发起AI交互,以及即将进行的查询是引导式还是依赖式求助。 这些能力共同使系统能够检测、响应和预测围绕AI交互的学习者行为。我们做出以下贡献: - •**TutorTrace数据集**:一个公开可用的数据集[1](https://github.com/divadbaroon/TutorTrace_dataset_and_benchmark/tree/uist),包含来自两个入门Python课程四次部署中480名学习者的数据,包括大约180K个细粒度IDE遥测事件,映射到13,633个自动分类的行为片段,以及围绕1,386次AI交互的27个持续计算的可观察指标。 - •**TutorTrace分类器**:一个自动化的行为分类器,将原始IDE遥测数据实时转换为标记的行为序列。该分类器基于专家制定的规则,并根据专家标签和学生自我报告进行验证,总体成对一致性范围为78%至87%。 - •**TutorTrace分类法与下游效用**:我们展示了TutorTrace提供的表示如何通过以下方式支持适应性AI辅导: - –一个由十个概况组成的三窗口行为分类法,这些概况刻画了首次AI查询之前、连续查询之间以及整个会话中反复查询模式期间的活动。 - –一个初步的课堂比较,其中行为感知提示与被动(Passive)查询间窗口比例从50.0%下降至20.7%以及查询之间更大的可观察活动相关。 - –两个保留的预测任务,证明可观察指标支持预测60秒内查询的临近性(AUROC=.726)以及引导式与依赖式求助(AUROC=.717)。 ## 2\.相关工作 ### 2\.1\.计算机科学教育中的先前分类法 分类法通常组织跨越一个或多个维度的独立、非重叠类别,同时揭示分类单元之间的关系(Irvine 2021 (https://arxiv.org/html/2608.26184#bib.bib17))。过去的计算机科学研究中已采用教育分类法来设计学习目标并评估学习效果(Smith et al\. 2025 (https://arxiv.org/html/2608.26184#bib.bib34)),尽管研究人员认为像Bloom分类法和SOLO这样的通用框架并未完全捕捉计算机科学学习的独特特征,尤其是在编程相关环境中(Fuller et al\. 2007 (https://arxiv.org/html/2608.26184#bib.bib13))。 随着大语言模型(LLMs)的兴起,编程交互的行为分析变得更加重要和复杂。Copilot,一个基于LLM的代码生成工具,能够为许多入门编程问题产生正确的解决方案,这引发了关于其存在如何重塑学生工作的疑问(Wermelinger 2023 (https://arxiv.org/html/2608.26184#bib.bib36))。特别是在计算机科学教育中,基于LLM的编程助手支持学生完成编码任务,同时也重塑了他们的交互模式、问题解决过程和对AI辅助的依赖(Kazemitabaar et al\. 2024 (https://arxiv.org/html/2608.26184#bib.bib21);Liffiton et al\. 2023 (https://arxiv.org/html/2608.26184#bib.bib23);Hou et al\. 2024 (https://arxiv.org/html/2608.26184#bib.bib15))。因此,编程会话产生了大量不易被传统教育分类法单独描述的人机交互痕迹(Mozannar et al\. 2024 (https://arxiv.org/html/2608.26184#bib.bib28);Barke et al\. 2023 (https://arxiv.org/html/2608.26184#bib.bib3))。 为解决这一差距,Mozannar等人(Mozannar et al\. 2024 (https://arxiv.org/html/2608.26184#bib.bib28))提出了一个将AI辅助编码会话表示为程序员活动转换时间线的分类法,而Barke等人(Barke et al\. 2023 (https://arxiv.org/html/2608.26184#bib.bib3))表明Copilot的使用也反映了更广泛的交互模式,例如加速和探索。尽管有这些进展,专门为表征LLM辅助编程环境中学生行为而设计的分类法仍然很少。在这项工作中,我们引入了一个针对AI辅助编程教育的学习者行为概况分类法,旨在使学生-AI交互模式在教育环境中更可见和可解释。 ### 2\.2\.求助质量与AI依赖性 随着AI的发展,学生越来越依赖它们来完成作业,而非作为学习辅助工具,这引发了关于过度依赖和独立解决问题能力下降的担忧(Jošt et al\. 2024 (https://arxiv.org/html/2608.26184#bib.bib18);Xue et al\. 2024 (https://arxiv.org/html/2608.26184#bib.bib38);Liu et al\. 2026 (https://arxiv.org/html/2608.26184#bib.bib24))。计算机科学教育领域的最新工作开发了利用LLMs生成结构化提示的工具,同时包含防止解决方案托管的防护措施(Kazemitabaar et al\. 2024 (https://arxiv.org/html/2608.26184#bib.bib21);Hou et al\. 2024 (https://arxiv.org/html/2608.26184#bib.bib15);Liffiton et al\. 2023 (https://arxiv.org/html/2608.26184#bib.bib23))。然而,即使系统级限制了模型的输出,学生也会在有选择时绕过它们:Kapoor等人(Kapoor et al\. 2026 (https://arxiv.org/html/2608.26184#bib.bib19))部署了一个带有可选“查看解决方案”控制(会禁用防护措施)的AI助教,885名学生中有50%至少在一个问题上使用了它,14%在所有三个问题上都使用了它。 为缓解这些行为,一些方法在学生查询到达底层LLM之前对其进行塑造或限定。CodeHelp(Liffiton et al\. 2023 (https://arxiv.org/html/2608.26184#bib.bib23))用结构化字段(语言、代码、错误消息和问题描述)替换单个自由格式框,并运行基于LLM的充分性检查,当查询缺少关键信息时返回澄清请求。CodeAid(Kazemitabaar et al\. 2024 (https://arxiv.org/html/2608.26184#bib.bib21))类似地提供特定功能的输入模板,以构建学生提出请求的框架。然而,这些方法是基于查询本身的内容进行干预,而非其之前的行为情境。一个在提问前花了五分钟独立调试的学生和一个在上次响应后立即重新查询的学生可能会提交完全相同的问题,却需要根本不同的教学回应。 TutorTrace通过使每次查询周围的行为情境可视化并可计算来解决这一差距,从而实现基于学生在说之前所做之事的干预,而不仅仅是他们所说的话。 [屏幕截图] 图1\.带有任务描述、代码编辑器、终端、测试用例和AI聊天窗口的学生界面。 [屏幕截图]
相似文章
面向AI教育中算法追踪与问题求解的检索增强型辅导
本文介绍了KITE,一个基于检索增强生成(RAG)的智能辅导系统,用于AI教育中的算法推理和问题求解。该系统采用意图感知的苏格拉底式回应策略和多模态RAG,提供基于课程内容、符合教学法的反馈,并通过指标评估、专家评审和模拟学生交互进行评价。
TutorMoments:AI导师知道何时该帮助、何时该收手吗?
Ai2推出了TutorMoments,一个基于回放的评估框架和数据集,用于衡量大语言模型在1对1数学辅导中能否平衡何时提供帮助与何时放手。初步结果显示,模型倾向于过度帮助,而提示工程只能部分缩小与人类导师的差距。
TRACE-BN: 将孟加拉语-英语辅导行为迁移到低于10亿参数的离线语言模型
TRACE-BN 介绍了一个课程引导的数据集,用于结构化的孟加拉语-英语辅导,并展示了如何使用 LoRA 将此行为迁移到低于10亿参数的语言模型中,在资源受限的离线环境中显著提高了辅导质量。
从启发式到分析:在线学习中的努力与进度预测
本文针对智能导学系统引入了参与度预测,利用425名中学生的交互日志,预测每周练习分钟数和掌握的新技能数量。基于特征的模型相比启发式基线将误差降低了22-33%,为导学-学习者目标设定提供了可解释的模式。
@huang_chao4969: 介绍 DeepTutor v1.5:智能体原生的个性化辅导。我们的核心理念:辅导应该是一个数据循环,而不是孤立的…
HKUDS 发布了 DeepTutor v1.5,这是一个开源的、智能体原生的个性化辅导平台,将聊天、测验、研究、可视化和精通练习集成到一个统一的运行时中,具有可检查的内存和可扩展的工具。