从执行到教育:基于布鲁姆分类学的LLM教育控制能力测量框架

arXiv cs.CL 论文

摘要

本文介绍了一个基于布鲁姆分类学的框架,用于测量大型语言模型(LLM)中的教育控制能力——即在保持教学意图的同时调整认知需求的能力——并在使用Qwen3模型的编程任务上对其进行评估,揭示了模型在增加难度方面表现出色,但在降低难度方面存在困难。

arXiv:2607.08009v1 公告类型:新 摘要:我们提出一个基于布鲁姆分类学的框架,用于测量大型语言模型(LLMs)中的教育控制能力:即在将任务的认知需求转向指定的学习目标的同时,保留其教学意图的能力。我们将该框架应用于计算机科学教育中的编程任务,以研究完成任务与为学习者调整任务之间的差距。使用修订后的布鲁姆分类学作为认知需求的操作量表,我们评估了两种干预设置:一般难度控制(要求模型使任务更难或更容易)和布鲁姆控制(要求模型针对更高或更低的布鲁姆级别)。我们评估了一个匹配的Qwen3-Next模型对,比较了Qwen3-Next-80B-A3B-Instruct和Qwen3-Coder-Next在来自三个基准测试的2,520个任务上的表现。该框架揭示了强烈的方向不对称性:两个模型都能可靠地提高认知需求,但在降低认知需求方面存在困难。我们进一步通过语义增量聚类和逐层Fisher判别比探测来表征这些结果。在这个受控比较中,通用模型在一般难度和布鲁姆控制对比中均显示出更清晰的中间层可分离性,而编码器模型在一般难度上显示出较弱的可分离性,并在布鲁姆控制对比中显示出更深的峰值。这些结果表明,强大的执行性能并不自动意味着符合布鲁姆分类学的教育控制。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:12

# 从执行到教育:基于布鲁姆分类法的大语言模型教育控制测量框架  
来源:https://arxiv.org/html/2607.08009  

Yi Zhang & Julia Rayz  
应用创意计算学院  
普渡大学  
西拉法叶,IN 47907,美国  
\{zhan3050,jtaylor1\}@purdue\.edu  

###### 摘要  
我们提出一个基于布鲁姆分类法(Bloom)的框架,用于测量大语言模型(LLM)中的教育控制能力:即在保持任务教学意图的同时,将认知需求转向指定学习目标的能力。我们将该框架应用于计算机科学教育中的编程任务,研究模型在解决问题与为学习者适配问题之间的差距。以修订版布鲁姆分类法作为认知需求的操作化度量尺度,我们评估两种干预设置:通用难度控制(要求模型使任务更难或更易)和布鲁姆控制(要求模型针对更高或更低的布鲁姆层级)。我们评估一个匹配的Qwen3-Next模型对,在来自三个基准的2,520个任务上比较Qwen3-Next-80B-A3B-Instruct与Qwen3-Coder-Next。该框架揭示了一种稳健的方向不对称性:两种模型都能可靠地提升认知需求,但在降低认知需求方面表现不佳。我们进一步通过语义-增量聚类和逐层Fisher判别比探测来表征这些结果。在此受控比较中,通用模型在通用难度和布鲁姆控制对比中均显示出更清晰的中间层可分性,而代码模型在通用难度对比中显示出较弱可分性,在布鲁姆控制对比中则出现更深的峰值。这些结果表明,强大的执行能力并不自动意味着具备基于布鲁姆分类法的教育控制能力。  

## 1 引言  
大语言模型(LLM)的最新进展已证明其在复杂软件工程任务中显著的能力扩展。随着这些模型深度融入实际应用,它们越来越多地被部署为协作教育工具(Hou et al., 2024)和智能导师(HKUDS, 2025;Yu et al., 2026),而不仅仅是代码补全。然而,在执行基准测试中表现出色只能说明模型是熟练的问题解决者,却不一定是有效的教育者。最近发展区理论(Vygotsky, 1980)为这种区别提供了背景:教育需要动态调整难度,使任务既具有足够挑战性以促进学习,又不至于低效。因此,我们研究*教育控制*:在保持教学意图的同时,将认知需求转向指定学习目标的任务级能力。在本文中,我们使用修订版布鲁姆分类法(Anderson and Krathwohl, 2001)操作化教育控制,该分类法提供了有序的认知过程结构。编程任务为观察执行性能与教育适配之间的差距提供了受控测试平台。  

为了衡量LLM在软件工程中的熟练程度,研究社区开发了庞大且多样化的基准生态系统,从静态函数级评估(如HumanEval, Chen et al., 2021)到复杂仓库级框架(如SWE-bench, Jimenez et al., 2024)。虽然这些执行指标对于确保生成代码的有效性至关重要,但它们在教学上是浅层的,因为它们将代码生成视为通过/失败的结果,忽略了解决问题所需的潜在认知负荷。当LLM直接应用于计算机科学教育时,仅优化即时功能正确的解决方案常常导致“学习幻觉”(Prather et al., 2024)。要将这些模型用作教育工具,我们必须超越标准执行基准,实施额外考量,以确保它们引导学生经历建立独立解决问题技能所必需的生产性挣扎。  

虽然先前工作表明某些LLM能够评估现有任务的认知复杂性(Huber and Niklaus, 2025),但在理解它们如何在生成过程中积极响应教育控制方面仍存在关键空白。具体而言,关于模型是否能在保持任务教学意图的同时,沿着学习分类法移动所需的认知操作(而不仅仅是改变表面形式)的证据有限。尚不清楚专门针对软件工程数据的训练是否会改变模型处理通用难度控制和布鲁姆目标教育控制的能力,或者这些行为是否反映了更广泛的训练分布偏差。  

为了研究任务控制行为及其表征相关性,我们分析了作为通用模型的Qwen3-Next-80B-A3B-Instruct(Yang et al., 2025)和作为代码模型的Qwen3-Coder-Next(Cao et al., 2026)。我们评估这些模型如何处理请求更难或更易任务的难度提示,测量它们对针对更高或更低教育水平的布鲁姆目标提示的响应,并通过映射外部语言偏移和探测内部神经表征的可分性来表征结果模式。  

本文做出三个主要贡献:(1)我们引入一个基于布鲁姆分类法的框架,用于测量LLM中的教育控制,该框架围绕匹配的难度干预、布鲁姆目标干预以及两个指标构建:观察认知偏移(OCS)和目标区域准确率(TZA)。(2)我们将该框架应用于一个受控的通用/代码模型对,涵盖2,520个编程任务,显示出一致的定向不对称性:模型可靠地提升认知需求,但常常未能降低它。(3)我们将这些行为结果与外部词汇突变策略和逐层表征诊断联系起来,揭示匹配模型间不同的突变模式和可分性特征。  

## 2 相关工作  
本工作处于三条先前研究线索的交汇点:编程任务中LLM的执行中心评估、认知控制的教学框架,以及内部模型状态的表征诊断。  

### 2.1 计算教育中的LLM  
LLM的快速采用已改变了软件开发范式,并推动教育界思考这些系统能否支持学习而不仅仅是生成。早期评估文献大多仍集中在执行正确性上,像HumanEval(Chen et al., 2021)和MBPP(Austin et al., 2021)这样的基准将代码生成视为通过/失败问题。最近的基准将场景扩展到污染感知或仓库级任务,包括LiveCodeBench(Jain et al., 2024)和SWE-bench(Jimenez et al., 2024),但它们所衡量的仍然是执行中心。教学上的担忧在于,一个正确的解决方案仍可能绕过生产性挣扎;先前计算教育方面的工作表明,直接答案即使最终代码有效,也可能造成学习幻觉(Kazemitabaar et al., 2025;Prather et al., 2024)。可控教育生成超越了静态评估,询问模型是否能有意识地塑造其产出的认知水平。BloomWise(Zoumpoulidi et al., 2024)使用布鲁姆启发的提示引导LLM推理穿过认知阶段,而链式提示系统研究模型如何通过静态或自适应提示为学生搭建支架(Jangra and Muresan, 2026)。  

### 2.2 教育框架与LLM评估  
研究者使用各种模型测量学习和推理,例如以结果为中心的结构(Biggs et al., 1982;Zhang et al., 2025)和知识深度框架(Webb, 1997;Yu et al., 2025)。修订版布鲁姆分类法(Anderson and Krathwohl, 2001)将学习目标组织成六个有序的认知过程:记忆、理解、应用、分析、评价、创造。近期研究应用布鲁姆分类法发现特定的AI限制。例如,当前研究强调LLM在高阶评估任务中失败(Huber and Niklaus, 2025),并揭示了自动程序修复中的显著性能下降(Ma et al., 2025)。  

### 2.3 表征诊断  
机械可解释性和表征分析已发展出一套实质工具集,用于分析Transformer如何表示和转换信息。残差流(Elhage et al., 2021)和logit透镜(nostalgebraist, 2020)表明,中间状态通常可以在最终层之前很久就被解码。线性表征假设(Park et al., 2024)与线性探测(Alain and Bengio, 2018;Belinkov, 2022)将概念视为激活空间中的方向,后续工作表明这些方向通常从宽泛抽象随深度转向更任务特定的特征(Gurnee and Tegmark, 2024;Gupta et al., 2026;Skean et al., 2025)。该领域还发展了互补的干预性文献。因果差距(Ravichander et al., 2021)激发了遗忘探测(Elazar et al., 2021)、激活补丁(Meng et al., 2022)和电路追踪(Wang et al., 2023);基于电路的工作随后澄清了归纳头(Olsson et al., 2022)、稀疏特征电路(Marks et al., 2025)和代码相关路由模式(Li et al., 2024)。与此同时,稀疏自编码器(Bricken et al., 2023)和表征工程(Zou et al., 2025)将这些想法转化为可控方向,包括代码和教育重点分析(Yin et al., 2025;Raimondi and Gabbrielli, 2026)。  

## 3 方法论  
我们的方法论遵循一个三阶段流程。首先,我们在两种指令设置下生成任务干预:通用难度控制和布鲁姆控制。布鲁姆控制设置具有目标区域,而难度设置则用于观察性比较,看看更难/更易请求在布鲁姆尺度上的行为。然后,我们评估这些干预是否实际将任务移向预期的认知水平(对于布鲁姆目标提示),或者它们如何沿着布鲁姆尺度移动(对于难度提示)。最后,我们检查与这些偏移相关的词汇变化和内部表征。确切的提示模板和解码设置见附录A(https://arxiv.org/html/2607.08009#A1)。  

### 3.1 模型架构与任务数据集  
我们评估Qwen3-Next系列中的两个开放权重模型:作为通用模型的Qwen3-Next-80B-A3B-Instruct(Yang et al., 2025)和作为代码模型的Qwen3-Coder-Next(Cao et al., 2026)。两个模型使用相同的48层架构和分词器,这提供了通用指令模型与代码专用模型之间的受控比较,同时减少了架构和分词混淆。我们选择这一对,是因为在研究时,这是我们能找到的具有匹配架构和分词器的最接近的开放权重通用/代码模型对。  

为涵盖各种编码行为,我们从三个基准中抽样了2,520个编程任务。BigCodeBench(Zhuo et al., 2025)包含1,140个Python函数调用任务,LiveCodeBench v5(Jain et al., 2024)包含880个算法问题求解任务,SWE-Bench-Verified(OpenAI, 2024)包含500个仓库级软件工程任务。对于每个任务,我们在两种指令设置下生成四个独立干预:通用难度控制(使任务“更难”或“更易”)和布鲁姆控制(针对“更高”(评价/创造)或“更低”(记忆/理解)的布鲁姆分类法层级)。所有四个干预使用相同的模板和解码设置,因此比较不会受方向特定提示调优的影响。“更难/更易”设置提供了一个观察性比较,展示通用难度请求在布鲁姆尺度上如何行为,并与布鲁姆控制并行。  

### 3.2 认知突变的行為评估  
我们采用LLM-as-a-judge框架,使用claude-3.5-haiku(Anthropic, 2024)来评估这些干预的成功程度。该模型基于近期验证其在编程任务布鲁姆分类法分类方面性能的工作(Zhang and Rayz, 2026)被选中。具体而言,它在来自相同三个基准来源的150个验证子集上,相对于人类共识达到了0.95的Gwet's AC2一致性率,为认知水平分类提供了可靠且可扩展的方法。由于生成的突变可能与原始验证分布不同,我们主要使用评判者比较匹配干预条件下的相对移动,而不是断言每个绝对标签都是确定的。我们使用两个自定义指标量化每次干预的结果。评判者和干预的精确提示模板见附录A(https://arxiv.org/html/2607.08009#A1)。  

观察认知偏移(OCS)测量沿布鲁姆分类法的平均移动,将分类法视为从1(记忆)到6(创造)的序数尺度。其正式定义见公式1(https://arxiv.org/html/2607.08009#S3.E1):  
\[
\text{OCS} = \frac{1}{N} \sum_{i=1}^{N} (L_{\text{mut}}^{(i)} - L_{\text{orig}}^{(i)})
\]  
其中...

相似文章

当LLM从未接触过五年级以上材料时会怎样?

Hacker News Top

本文介绍了LittleLearner,一个用于研究LLM知识获取的受控沙箱,使用K-5课程过滤的数据集,发现诸如规模化和后训练等干预措施能增强范围内的性能,但无法提升范围外的能力。

教育中的LLM评判:基于课程大纲的评分流水线

arXiv cs.AI

本文提出了一种基于课程大纲的LLM评判流水线,用于高风险考试备考中的自动化试题评分。该流水线利用教学大纲材料及评分指南,提升一致性与透明度。初步评估显示,其评分结果与人工导师相当。