跨主题覆盖、能力与认知深度的课程对齐测量:应用于CS2013和CS2023的纵向框架
摘要
本文提出一种人在回路流水线,用于测量计算机科学项目对课程指南的覆盖情况,并纵向应用于CS2013和CS2023。该框架显示主题覆盖率近乎恒定,但由于新版指南提高了期望,认知深度存在差距。
arXiv:2606.19469v1 公告类型:新
摘要:本科计算机科学由大约每十年修订一次的国际课程指南所指导,但各项目缺乏可靠、可重复的方法来衡量它们对当前指南的覆盖程度,以及在指南重组时覆盖如何变化。我们通过一种人在回路流水线来解决这一问题,该流水线可测量项目对外部知识体系的覆盖情况,并纵向应用于一个经认可的计算机科学学士学位项目,对照计算机科学课程2013(CS2013)和2023(CS2023)。流水线将项目和每个指南表示为结构化语料库,通过语义检索生成课程到知识单元的候选匹配,并在明确的覆盖定义下通过人工判断确认。在七个基准检索器中,倒数秩融合集成最强,而一个著名的长上下文模型表现不如一个小型句子模型,因此必须衡量检索器的选择。两个映射图均由独立第二评估者验证(CS2023的Cohen's kappa为0.64,CS2013的0.69)。该项目覆盖了CS2023知识单元的49.7%和CS2013的50.9%,十年间几乎不变。将相同的“检索后确认”设计扩展到能力表述和认知深度显示,在每个指南下,项目对约88%覆盖单元表述了能力,但在CS2023下,76%的现有单元以推荐深度交付,而CS2013下为95%,这一差距反映了新版指南提高了期望,而非项目本身。纵向比较将持久的结构性差距(并行与分布式计算、编程语言基础、系统基础)——在两个指南和ABET下均未覆盖——与反映标准演变的差异区分开来。该工具可重复使用,并可应作者要求提供。
查看缓存全文
缓存时间: 2026/06/20 14:30
# 跨主题覆盖、能力表述与认知深度的课程对齐测量:应用于CS2013与CS2023的纵向框架 来源:https://arxiv.org/html/2606.19469 Sherzod Turaev 计算机科学与软件工程系,信息技术学院,阿联酋大学 阿联酋,阿布扎比,阿尔艾因 & Mary John 学术支持部,阿布扎比理工学院 阿联酋,阿布扎比 Saja Aldabet 计算机科学与软件工程系,信息技术学院,阿联酋大学 阿联酋,阿布扎比,阿尔艾因 & Mamoun Awad 计算机科学与软件工程系,信息技术学院,阿联酋大学 阿联酋,阿布扎比,阿尔艾因 Nazar Zaki 计算机科学与软件工程系,信息技术学院,阿联酋大学 阿联酋,阿布扎比,阿尔艾因 & Khaled Shuaib 信息系统与安全系,信息技术学院,阿联酋大学 阿联酋,阿布扎比,阿尔艾因 ###### 摘要 本科计算机科学教育由大约每十年修订一次的国际课程指南主导,但各个项目缺乏一种可靠且可复现的方法来衡量其对当前指南的覆盖程度,以及当指南重组时这种覆盖如何变化。现有分析依赖主题模型或人工标注,很少报告其判断的信度,未对匹配方法进行基准测试,仅停留在主题重叠层面而不询问能力是否被清晰表述或以推荐的认知深度进行教学,并且是在单一时间点考察单一标准。我们通过一种人机协同流水线来弥补这些不足,该流水线测量项目对外部计算知识体系的覆盖情况,并对其进行纵向应用:将某个认证的计算机科学学士项目同时映射到2013年计算机科学课程指南(CS2013)和2023年课程指南(CS2023)。该流水线将项目及各指南表示为结构化语料库,通过语义检索生成课程到知识单元的候选匹配,并在明确的覆盖定义下通过人工判断进行确认。我们对七个检索器进行了基于聚合相关性判断的基准测试;其中倒数排名融合集成方法表现最强,而一个知名长上下文模型的表现却不如一个小型句子模型,这表明检索器的选择必须针对该任务进行测量。两个映射图均由独立第二评分人验证,具有较高的一致性(CS2023的Cohen's kappa为0.64,CS2013为0.69)。该项目覆盖了CS2023知识单元的49.7%和CS2013知识单元的50.9%,在十年间几乎保持恒定。我们将相同的“检索-确认”设计扩展到能力表述和认知深度,并通过另外三次评分人间信度检验进行验证,结果表明:在每套指南下,该项目约88%的已覆盖单元明确表述了相应能力,但在CS2023下,仅76%的已有单元达到了推荐认知深度,而在CS2013下这一比例为95%。这一差距反映的是新指南提高了预期,而非项目本身。纵向比较区分了持久的结构性差距——即并行与分布式计算、编程语言基础、以及系统基础——这些差距在对两份指南和ABET标准的映射中均被发现,而其他差异仅仅反映了标准本身的演变。该工具可复用,并可通过合理请求向作者索取。 *关键词*:CS2023,CS2013,课程映射,学习成果,能力本位教育,认知深度,文本嵌入,认证 ## 1 引言 本科计算机科学课程,比大多数学科更受一套共同的国际参考指南所支配。自第一份《课程68》报告以来,美国计算机协会(ACM)和IEEE计算机学会定期编纂本科计算机科学学位应包含的内容,将其表述为一个按知识领域、知识单元和主题组织的“知识体系”,并附带推荐学时和学习成果。最近的两份报告构成本研究的基础。《计算机科学课程2013》将学科组织为18个知识领域,采用分层核心与选修模型[3 (https://arxiv.org/html/2606.19469#bib.bib3)];其后续版本《计算机科学课程2023》将学科重组为17个领域,提升了人工智能以及计算的社会与专业维度,并引入了一个数学与统计基础领域[4 (https://arxiv.org/html/2606.19469#bib.bib4)]。这些指南不仅仅是咨询性文件;它们指导课程设计,是ABET计算认证委员会等认证机构制定项目标准时所参考的依据[1 (https://arxiv.org/html/2606.19469#bib.bib5)],也塑造了毕业生应具备的知识。因此,项目与当前指南的一致性程度,对于课程委员会、认证机构和学生而言,是一个具有实际影响的问题。 然而,要严格确定一个具体项目相对于指南的位置,却出奇地困难。指南规定了应该教什么,而项目则以另一种词汇记录其所教内容——即课程学习成果和教学大纲主题——因此测量覆盖度需要在两个大型的半结构化文本之间建立映射。在实际操作中,这种映射是通过专家阅读非正式地进行的,费力、难以复现,且难以保持更新。困难因参考本身在变动而加剧。由于指南大约每十年修订一次,根据一代标准设计的项目最终必须根据下一代标准来评判,此时的问题不仅在于项目覆盖知识体系的完整程度,还在于当知识体系重组时,其覆盖情况如何变化。无论是静态还是纵向的问题,指南本身并未给出答案。 此外,覆盖度仅仅是项目必须回答的第一个问题。确定一个主题被教授,并不等于确定相应的“能力”在课程学习成果中被清晰表述,也不等于该主题是以指南推荐的“认知深度”进行教学的。而能力和其深度,而非仅仅主题列表,正是认证机构和劳动力市场日益强调的重点[18 (https://arxiv.org/html/2606.19469#bib.bib2)]。因此,对一致性的完整描述需要三个层层递进的严格视角:内容是否被教授(主题覆盖)、能力是否被表述为明确成果(能力表述)、以及该成果是否达到推荐的认知水平(认知深度)。 已有越来越多的文献开始运用计算方法进行课程分析,但仍未完全解决测量问题。一条研究路线直接测量项目与ACM指南的一致性,例如通过主题模型将课程大纲集合投影到CS2013知识领域空间[16 (https://arxiv.org/html/2606.19469#bib.bib14)],通过标注课程材料来对标标准以进行覆盖度审核[11 (https://arxiv.org/html/2606.19469#bib.bib15)],或通过本体表示课程[9 (https://arxiv.org/html/2606.19469#bib.bib16)]。第二条路线则利用语言技术自动化教育文本的对齐,将课程学习成果映射到项目学习成果,并报告与专家判断相比的精确度[20 (https://arxiv.org/html/2606.19469#bib.bib19)],以及使用词嵌入和大语言模型对教学材料进行分类以符合课程指南[15 (https://arxiv.org/html/2606.19469#bib.bib20)]。这些研究表明覆盖度分析是可行的,且嵌入和语言模型能够对齐教育文本。尽管有价值,但它们存在对所研究问题至关重要的局限性:它们依赖主题模型或人工标注,很少报告判断的信度;它们没有对哪种检索器或模型适用于该任务进行基准测试,而是默认使用一种;它们是根据专家精确度评估模型输出,而非将其视为待确认的候选;它们映射到机构成果或课程材料,而非外部的学科知识体系;并且局限于单一指南的单一快照。对于能力本位的认证而言,决定性的缺陷是它们仅测量主题重叠,而不询问项目的既定成果是否表述了指南的能力,或者是否以推荐的认知深度交付。 为克服这些缺陷,需要一种方法:能测量对外部标准的一致性;经过基准测试和信度检查而非假定有效;在关键环节保持人工判断介入;能超越主题覆盖延伸到能力表述和认知深度;并且能跨指南世代应用。在本研究中,我们开发了这样一种方法,并纵向应用于一个认证的计算机科学学士项目,通过三个层层递进的视角(主题覆盖、能力表述、认知深度)将同一项目同时映射到CS2013和CS2023。该方法结合了语义检索(提出项目文本与指南知识单元及学习成果之间的候选匹配)与人工确认(依据覆盖、能力交付和深度充分性的明确定义),并通过经验验证了检索器和最终映射图。本研究的贡献如下: 1. 一个可复现的人机协同流水线,用于测量项目对外部计算知识体系的覆盖,将高召回率的候选生成与高精度的确认分开; 2. 针对该任务的七个检索器基准测试,通过聚合相关性判断进行评估,识别出有效的配置,并表明检索器的选择必须经过实际测量,而非从通用排行榜移植; 3. 项目对CS2013和CS2023的主题覆盖图,每个都经独立第二评分人验证且具有较高的一致性,并通过协商达成共识; 4. 能力表述层面,将项目的课程学习成果与指南的学习成果进行匹配,报告每个已覆盖单元的能力是否确实在课程成果中得到表述,经两位人类评分人验证,并附带“表述差距”(即被教授但未表述为成果的单元); 5. 基于五级量表的认知深度层面,报告每个已表述能力是否以指南推荐的水平交付,同样经过信度检验,揭示出相对于CS2013差距较小,但相对于CS2023差距显著; 6. 对照ABET项目标准对覆盖差距的诊断,区分有意的专业化与认证相关的遗漏;以及 7. 跨三个视角的纵向比较,得出两个指南世代之间的项目相对差异,区分持续十年的差距与仅因标准自身演变而产生的变化。 论文组织如下。下一节回顾关于课程指南、课程映射与覆盖分析、以及我们借鉴的语言技术方法的相关工作。材料与方法部分描述项目及两个知识体系作为结构化语料库的情况,并详细说明流水线的九个阶段,从主题覆盖延伸到能力表述和认知深度。结果部分报告检索器基准测试和信度检查、对当前标准的覆盖、基于认证的差距诊断、能力存在性与认知深度的发现,以及纵向比较。讨论部分解释这些发现对需要跟踪不断演变标准的项目以及认证实践的意义,并考虑自动化的局限。最后结论部分总结并指出未来工作,主要是将方法扩展到多所院校。 ## 2 相关工作 ### 2.1 课程指南及其演变 ACM和IEEE计算机学会大约每隔十年发布一次计算机科学课程指南,本研究利用的过渡是最新一次。《计算机科学课程2013》将知识体系组织为18个知识领域,主题分为核心一级、核心二级或选修,并对每个单元给出了推荐学时和学习成果[3 (https://arxiv.org/html/2606.19469#bib.bib3)]。《计算机科学课程2023》保留了领域-单元-主题结构,但将学科重组为17个领域,采用CS核心、KA核心和非核心分类,扩大了人工智能以及社会、伦理与职业领域的处理,并将数学先修要求整合为一个专门的数学与统计基础领域[4 (https://arxiv.org/html/2606.19469#bib.bib4)]。指南定义了应该教什么以及以什么深度教,但既未规定如何测量特定项目完全覆盖它们的方法,也未解决当指南修订时项目覆盖如何变化的问题。这两个问题推动了本工作。 ### 2.2 课程映射与覆盖分析 已有研究测量项目与课程指南的一致性程度。与本研究目的最接近的一项基于教学大纲的研究,使用简化的监督主题模型将计算机科学系投影到CS2013知识领域空间,比较不同机构的覆盖情况,并观察到各项目强调不同领域[16 (https://arxiv.org/html/2606.19469#bib.bib14)]。基于工具的方法如CS Materials,允许教育者为设计、对齐、审核和搜索等目的,将课程材料标注到标准[11 (https://arxiv.org/html/2606.19469#bib.bib15)]。相关工作还包括对课程的可视化理解[17 (https://arxiv.org/html/2606.19469#bib.bib17)]、课程与学习材料的本体表示[9 (https://arxiv.org/html/2606.19469#bib.bib16)],以及计算机科学课程中语义技术的系统综述[8 (https://arxiv.org/html/2606.19469#bib.bib18)]。这些工作确认了覆盖分析是一个活跃的研究方向,但它们依赖主题模型或人工标注,很少报告映射的信度,未将结果差距与认证标准联系起来,并且仅考察单一时间点。本研究贡献了经过人工确认、信度验证的知识单元级映射图、基于认证的差距解读,以及跨两个指南世代的比较。 ### 2.3 成果与材料的自动对齐 第二条研究路线应用自然语言处理和大语言模型来对齐教育文本。最相关的工作中,一个系统将课程学习成果自动映射到项目学习成果,针对两个项目报告了相对于领域专家的精确度,并论证了这种自动化可以支持项目评估[20 (https://arxiv.org/html/2606.19469#bib.bib19)]。其他工作使用经典词嵌入方法和预训练语言模型,将教学材料对照计算机科学课程指南进行分类[15 (https://arxiv.org/html/2606.19469#bib.bib20)]。
相似文章
从执行到教育:基于布鲁姆分类学的LLM教育控制能力测量框架
本文介绍了一个基于布鲁姆分类学的框架,用于测量大型语言模型(LLM)中的教育控制能力——即在保持教学意图的同时调整认知需求的能力——并在使用Qwen3模型的编程任务上对其进行评估,揭示了模型在增加难度方面表现出色,但在降低难度方面存在困难。
基于跨难度优化动态的大语言模型课程学习研究
本文通过分析不同难度水平间的优化动态,研究大语言模型中的课程学习,并提出一种名为迁移感知动态课程采样(TDCS)的新方法,该方法基于迁移关系动态调整训练数据。
利用课程先决条件图从对话式AI交互中检测知识缺口
该论文提出了一种流水线,利用少样本文本分类器和GPT-4提取的先决条件知识图谱,将学生在对话式AI助教中提出的问题映射到课程主题。在1,340个问题事件上实现了80%的准确率,并与学生自我报告的难度相关。
先竞争后协作:前沿AI教师构建可验证课程,使编程学生超越模仿
本文介绍了一种先竞争后协作的框架,多个前沿AI教师(Claude、Codex-GPT、Grok、Gemini)通过执行测试排名,然后协作构建可验证课程。研究发现,对教师解决方案进行模仿(SFT)会降低有能力的编程学生的表现,而使用相同课程进行带可验证奖励的强化学习(RLVR)则能提升表现,尤其是在竞赛问题上。
解构NLP中的课程学习:迈向统一分类法
本文提出了一种用于NLP中课程学习的细粒度分类法,将难度评估与训练调度分离,从而能够系统性地分析和比较CL策略。它识别了先前工作中存在的不可比问题,并提供了一个设计和评估CL方法的框架。