CSTutorBench:面向积木编程的小型语言模型辅导能力基准测试

arXiv cs.AI 论文

摘要

CSTutorBench是一个基准测试,用于评估小型语言模型在积木编程环境中作为辅导员的性能,重点关注教学行为。初步结果显示,模型在较深层的辅导技能(如避免答案泄露)上表现不佳,而提示词修订能提升分数。

arXiv:2607.05571v1 Announce Type: new Abstract: 大型语言模型作为AI辅导员正被越来越多地探索,但在K-12环境中部署引发了隐私、成本和依赖专有模型的担忧。小型语言模型(SLM)提供了一种有前景的替代方案,但在特定教育场景中选择合适的模型仍然困难,尤其是当目标领域(如积木编程)在模型训练数据中几乎不存在时。我们提出了CSTutorBench,这是一个在积木式机器人环境VEX VR中评估语言模型作为计算机科学辅导员能力的基准测试。该基准测试包含17个基于场景的问题,按照基于现有辅导和反馈研究的教育评分标准进行评分,并采用人工参与的大语言模型评判流水线进行评估。对11个模型(4B-120B参数)的初步结果显示,模型在词汇和语气等表面标准上表现良好,但在更深层的教学行为(尤其是避免答案泄露和参与学生调试历史)上存在困难。在我们的样本中,模型家族和指令微调方法似乎比参数规模更能预测辅导质量,尽管模型数量较少限制了这一结论的强度。一项基于近期教育提示工程研究的有针对性的提示词修订提高了11个模型中10个的分数。这些结果强调了在教育部署中选择SLM时,需要基于具体环境和教育理论的基准测试的价值。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:38

# CSTutorBench: 为积木式编程辅导任务评估小型语言模型的基准测试
来源: https://arxiv.org/html/2607.05571
\\copyrightclause

版权归作者所有。使用遵循知识共享署名4.0国际许可协议(CC BY 4.0)。

\\conference

SLM4ED’26: 第1届教育领域小型语言模型研讨会(SLM4ED),2026年6月28日,韩国首尔

(2026年)

###### 摘要

大型语言模型作为AI辅导者的研究日益增多,但在K–12场景中部署会引发隐私、成本以及对专有模型依赖的担忧。小型语言模型(SLM)提供了一种有前景的替代方案,但针对特定教育场景选择合适的模型仍然困难,尤其是当目标领域(如积木式编程)在模型训练数据中很少出现时。我们引入了CSTutorBench,这是一个评估语言模型在VEX VR(一种积木式机器人编程环境)中作为计算机科学辅导者的基准测试。该基准测试包含17个基于场景的问题,评分依据一个基于既有辅导和反馈研究构建的教学评分量表,并采用人机协同的LLM-as-judge评估流程。初步结果(涵盖11个模型,参数规模从4B到120B)显示,模型在词汇和语气等表层标准上表现良好,但在更深层的教学行为上存在问题,特别是避免泄露答案和处理学生的调试历史。在我们的样本中,模型家族和指令微调方法似乎是比参数数量更好的辅导质量预测指标,不过模型数量有限限制了这一结论的强度。针对性的提示修订(基于近期教育提示工程研究)使11个模型中的10个分数得到提升。这些结果凸显了在部署SLM进行教育时,需要结合具体场景、基于教学理论构建的基准测试。

###### 关键词:

小型语言模型\\sep基准测试\\sep智能辅导\\sep积木式编程\\sepLLM-as-judge

## 1 引言

大型语言模型(LLM)在教育工具方面展现出巨大潜力,尤其在生成解释、提供反馈以及与学习者进行对话等任务上\[shi2026large\]。对于计算机科学教育而言,尤为吸引人的是,许多模型在大型代码语料库上进行了训练,因此能够可靠地生成语法正确的解决方案,跟踪程序逻辑,并以令人印象深刻的流畅度解释编程概念\[jiang2026survey\]。但是,这呼应了人工智能教育领域的一个经典教训:简单地将一个辅导系统包装成一个专家系统是不明智的\[clancey1984Neomycin\]。我们不应该期望一个擅长编码的LLM也同样擅长*教*人编码。有效的辅导需要微妙地平衡提供指导与让学习者保持自主感\[chi2001learning,vanlehn2011relative,wood2012role\]。尽管有一些基准测试关注LLM的教育能力\[xu2025edubench\],另一些关注辅导能力\[srinivasa2025tutorbench\],但仍需更直接地评估现代LLM的辅导和指导能力,并探索定制其行为的新方法。

当目标群体是在Scratch、VEX、Snap!等积木式编程环境中学习的年轻学习者时,这些挑战更加突出。积木式环境专为教育设计,即使在最强大的模型的训练数据中也几乎不存在。同时,K-12场景中关于隐私、预算有限以及对高度本地控制的需求等实际限制,都指向小型语言模型(SLM)作为满足这些需求的可行路径。但是SLM的行为差异很大,并且缺乏指导来选择哪个8B或30B模型作为课堂辅导者。本文中,我们介绍了CSTutorBench,这是一个用于评估语言模型在VEX VR(面向中学生的积木式机器人编程模拟环境)中作为计算机科学辅导者的基准测试。该基准测试包含17个基于场景的问题、一个包含8个标准的教学评分量表,以及一个自动化的LLM-as-judge评估流程。我们展示了参数从4B到120B的模型的初步结果,并讨论了在教育场景中选择SLM的含义。

## 2 CSTutorBench

图1: VEX VR珊瑚礁救援环境。

### 任务领域

CSTutorBench专门针对单一任务和受众:在VEX VR珊瑚礁救援场景中工作的中学生(6-8年级)。学生在该模拟环境中使用拖拽式Blockly界面编程虚拟机器人,在海底环境中导航并收集垃圾。任务分为三个递进难度级别:第1级涉及顺序和基本移动,第2级增加了距离传感器导航,第3级需要算法优化。我们需要一个基于实际任务、受众和教学目标的基准测试。通用基准测试无法捕捉特定领域的要求,例如知道VEX“前进”积木块是非阻塞的,或者模拟器场地是2000 mm×2000 mm。学生程序以Blockly XML表示,这种格式在标准代码训练语料库中几乎不存在,这使得该基准测试能够有效检验模型是否能在其预训练数据不足的领域中进行有效辅导。

### 数据集

该基准测试包含17个基于场景的问题,分为四种类型:调试(8个)、迭代调试(6个)、优化(1个)和概念性(2个)。这些问题并非来自真实学生数据,而是基于我们在学生使用VEX VR时观察到的常见错误和Bug,包括缺少“永远循环”、条件逻辑颠倒、阻塞命令、传感器误用以及绝对航向与相对航向的混淆。每个条目包括学生的问题文本、一个或多个Blockly XML代码快照、一个包含通用标准和条目特定评分指南的8标准评分量表,以及描述正确诊断的评估者笔记(对被测试模型隐藏)。

六个“迭代调试”条目旨在模拟多轮辅导互动。每个条目概述了学生努力的几个回合:2-3个代码快照显示了学生在寻求帮助前自我尝试修复Bug的过程。例如,一个条目描述了一个学生先尝试了“重复10次”循环,然后切换到“重复100次”,试图理解为什么机器人总是停止。模型收到完整的迭代历史,必须契合学生的进展,而不是将其视为一个全新问题。专门的评分标准“认可进展”专门评估回复是否认可并基于这些先前的尝试。

### 评分量表

每个条目按八个标准评分(每个标准0-2分,满分16分):七个通用标准应用于每个问题,外加一个根据问题类型变化的特定标准。该评分量表将关于辅导和形成性反馈的既定研究操作化为可计算的维度。表1总结了每个标准、其衡量内容以及文献依据。

表1: CSTutorBench评分量表标准。每个标准评分0(无分)、1(部分)或2(满分)。括号中的代码对应表2中的列标题。

| 标准 | 衡量内容 | 文献依据 |
|------|----------|----------|
| **通用标准 — 对所有17个问题评分** | | |
| 简洁性 | 回复简短(1-3句),无填充内容或重述问题 | shute2008focus,narciss2013designing |
| 词汇 | 语言对中学生易懂;无未解释的行话 | wiggins2012seven,graesser1995collaborative |
| 准确性 | 关于积木块行为、传感器或机器人物理无错误说法 | shute2008focus,vanlehn2011relative,black1998assessment |
| 格式 | 无原始XML或不合适的标记;读起来像自然对话 | shute2008focus,narciss2013designing |
| 语气 | 鼓励且有耐心;适合中学生 | lepper2002wisdom,mueller1998praise,hattie2007power |
| 可操作性 | 学生阅读回复后知道该查看或尝试什么;提供下一步指导 | hattie2007power,wiggins2012seven,black1998assessment |
| 针对性 | 针对该学生的具体情况进行回复,而非给出通用建议 | lepper2002wisdom,nicol2006formative,vanlehn2011relative |
| **类型特定标准 — 每个问题一个,由问题类型决定** | | |
| 提示而非答案 | 引导学生找到答案而不直接给出(n=8个调试问题) | narciss2013designing,shute2008focus |
| 认可进展 | 认可并基于学生的先前尝试(n=6个迭代调试问题) | vanlehn2011relative,narciss2013designing |
| 基于成功 | 验证正确的完成情况,而非编造额外问题(n=1个优化问题) | narciss2013designing,shute2008focus |
| 概念清晰度 | 当直接回答更合适时能清晰解释积木块功能(n=2个概念性问题) | shute2008focus,vanlehn2011relative |

有几个标准对基于LLM的辅导者特别具有挑战性。“简洁性”反映了Shute的研究发现\[shute2008focus\]:反馈的复杂性与错误纠正和学习效率成反比。当反馈太长或太复杂时,学习者会停止关注。“可操作性”借鉴了Hattie和Timperley的模型\[hattie2007power\],即有效反馈是缩小当前表现与期望目标差距的信息,通过指定下一步该做什么来实现。“针对性”基于对专家人类辅导者的研究\[lepper2002wisdom,vanlehn2011relative\],他们总是针对具体情境因素给出建议,而非泛泛而谈。VanLehn的元分析进一步显示\[vanlehn2011relative\],步骤级反馈优于最终答案反馈,这强化了在精细粒度上介入学生工作的重要性。Wiggins认为\[wiggins2012seven\],有效的反馈必须易于理解和使用,这促使了“词汇”标准的设立。“语气”反映了鼓励在专家辅导中的作用的相关研究\[lepper2002wisdom\],以及Mueller和Dweck对有意义努力型表扬与空洞能力型表扬的区分\[mueller1998praise\]。四个类型特定标准反映了Narciss的交互式辅导反馈(ITF)模型\[narciss2013designing\],该模型认为没有一种反馈类型对所有任务都最优,反馈必须根据学习任务和学生状态进行调整。此外,Liu等人近期的工作\[liu2025comparative\]从可读性、具体性和可操作性等相关维度评估了LLM和SLM的反馈质量,发现AI反馈在清晰度和结构方面表现出色,而人类反馈则提供更具情境细微差别的指导。

表1中的每个标准都包含一个对所有条目稳定的描述,并且在需要时会包含一个条目特定的附录,描述针对该特定问题正确和错误回复的样子。这种结构使评分量表在整个基准测试中保持一致性,同时捕捉准确评分所需的领域知识。

### 评估流程

我们评估了来自六个模型家族(Google Gemma、Alibaba Qwen、NVIDIA Nemotron、DeepSeek、Allen AI OLMo和OpenAI GPT)的11个模型,参数范围从4B到120B。每个模型在两个系统提示条件下进行测试。第一个提示提供了VEX VR积木块参考、作业描述以及使用教学策略的指令,唯一的特定指导是不要泄露答案,另外还有限制,比如不要提及原始XML,回复保持在1-3句。第二个提示保留了这些元素,但根据教育AI提示工程的研究\[holmes2026prompt,ahn2026mentors\]进行了有针对性的修改:增加了基于观察到的模型弱点而补充的领域特定知识(例如,澄清哪些传感器与任务无关,指定移动命令的阻塞行为)和明确的教学支架指导方针(例如,在指出错误前先肯定正确部分,引导发现而非直接陈述修复方法,认可学生在多次尝试中的进展)。

回复通过本地运行的Ollama或Google AI Studio API收集。评分采用人机协同的LLM-as-judge协议\[shi2025hitl\]。在自动评分环节,评判者(Claude Sonnet 4)每个问题每个标准进行一次评分,接收学生问题、评估者笔记、该标准的评分指南以及模型的回复,然后返回0、1或2的分数以及简短的理由。在人工审查环节,一位审查员检查所有评判结果——按基准测试问题(而非按模型)组织,涵盖所有模型和试验——以避免系统性偏差。

对于每个问题,评判者(Sonnet 4)对每个回复进行完整审查,并将其建议的更改分为“确定”和“边缘”两类。审查员(人类)检查这两类情况,提供反馈,并引导评判者关注先前审查中发现的其他问题。在进入下一个问题前,进行最终检查,评判者记录校准笔记,这些笔记会延续到后续问题,逐步提高其一致性(图2)。对于“简洁性”标准,评判者在统计句子等效物方面不可靠,因此使用字符计数脚本来确保所有回复评分一致(每个标准的评分量表定义的长度阈值根据每句100字符转换为字符数)。评判者选择在第3节讨论。结果增量保存,管道支持每个模型多次试验以评估回复变异性。

图2: 混合评估工作流程。每个基准测试问题(EX)在进入下一个问题前,对所有模型和试验进行审查。校准笔记跨问题累积,逐步提高评判者的一致性。

## 3 初步发现

我们评估了来自六个模型家族的11个模型,参数范围从4B到120B(表2),使用了17个基准测试问题。我们测试了两个系统提示版本:初始提示(试验1)和基于Holmes等人\[holmes2026prompt\]的教育提示工程模式修订的提示(试验2)。除非另有说明,以下所有结果均使用试验2(修订版)提示。

### 评判者选择与校准

我们最初尝试使用SLM作为自动评判者,但发现其存在严重宽容偏差。例如,Phi4:14b将gemma3:27b(试验1)的回复评分定为91-96%(多种配置),而人类评分员将相同回复评为61%。寻找可靠的基于SLM的评估模型仍是优先事项。我们最终选择了Claude Sonnet 4作为自动评判者,因为它与人类地面真值对齐更紧密,然后使

相似文章

QuantCode-Bench:评估大语言模型生成可执行算法交易策略能力的基准

Hugging Face Daily Papers

# 论文页面 - QuantCode-Bench:评估大语言模型生成可执行算法交易策略能力的基准 来源:[https://huggingface.co/papers/2604.15151](https://huggingface.co/papers/2604.15151) ## 摘要 QuantCode\-Bench 通过测试大语言模型能否将自然语言描述转化为可在历史金融数据上正确运行的功能性代码,来评估其生成可执行交易策略的能力。

GTBench:一个基于课程体系的图论数学研究助手大语言模型评估基准

arXiv cs.AI

论文介绍了GTBench,这是一个基于课程体系的基准,用于评估大语言模型在图论中作为数学研究助手的能力,包含63个问题,分为三个难度级别。它评估了五个前沿模型,发现性能随难度增加而下降,其中GPT-5在基础问题上近乎完美,但在研究生级别的证明上仅达到82%。