AIriskEval-edu:用于AI介导的K-12教育解释风险评估的新数据集
摘要
介绍AIriskEval-edu-db2,这是一个用于AI生成的K-12教育解释的教学风险评估的新数据集,包含1,639条解释和结构化风险标注。还包括比较LLM在风险检测和可解释性方面的验证实验。
arXiv:2607.01934v1 公告类型:新
摘要:本文介绍了AIriskEval-edu-db2,这是一个新数据集,旨在训练和评估基于LLM的审计员,用于K-12年级教学内容中可解释的教学风险评估。该数据集包含来自170个精选ScienceQA问题的1,639条解释,涵盖科学、语言艺术和社会科学。每个问题都包含由人类教师撰写的解释,以及由LLM模拟的不同教学风险的教师档案生成的11条解释。我们提出了一个与既定教育标准相一致的综合风险评分标准,涵盖五个互补维度:事实准确性、深度和完整性、重点和相关性、学生水平适宜性和意识形态偏见。一个关键贡献是增加了785条带有结构化可解释性标注的解释,包括风险定位和风险描述。这些标注通过半自动过程并经过专家教师验证生成。最后,我们展示了验证实验,比较了最先进的专有模型与轻量级本地Llama 3.1 8B模型在教学风险检测和可解释性评估方面的表现。这些实验评估了在AIriskEval-edu-db2上进行监督微调是否能使本地可部署模型接近或超越更强的前沿模型,同时保持教育审计和评估任务中的隐私性。
查看缓存全文
缓存时间: 2026/07/03 05:41
# AIriskEval-edu: 面向AI辅助K-12教育解释中风险评估的新数据集 来源:https://arxiv.org/html/2607.01934 Javier Irigoyen¹, Roberto Daza¹², Francisco Jurado², Julian Fierrez¹, Ruben Tolosana¹, Alvaro Ortigosa², Enrique Blas¹, and Aythami Morales¹³本研究由Cátedra ENIA UAM-VERIDAS en IA Responsable (NextGenerationEU PRTR TSI-100927-2023-2)、M2RAI (PID2024-160053OB-I00, MICIU/FEDER)、TRUST-ID (PID2025-173396OB-I00, MICIU/AEI and the EU)以及PowerAI+ (SI4/PJI/2024-00062, Comunidad de Madrid and UAM)资助。Javier Irigoyen获得MINECO/FEDER的FPI奖学金支持。 ###### 摘要 本文介绍了AIriskEval-edu-db2,这是一个新数据集,旨在训练和评估基于LLM的审计器,用于对K-12年级教学内容进行可解释的教学风险评估。该数据集包含来自170个精选ScienceQA问题的1,639个解释,涵盖科学、语言艺术和社会科学。对于每个问题,数据集包含由人类教师编写的解释,以及由LLM模拟的教师画像生成的11个解释,这些解释与不同的教学风险相关。我们提出了一套全面的风险评分标准,该标准与既定的教育标准保持一致,涵盖五个互补维度:事实精确性、深度与完整性、重点与相关性、学生水平适宜性以及意识形态偏见。一个关键贡献是新增了785个带有结构化可解释性注释的解释,包括风险定位和风险描述。这些注释通过半自动流程生成,并经过专家教师验证。最后,我们进行了验证实验,比较了最先进的专有模型和轻量级本地Llama 3.1 8B模型在教学风险检测和可解释性评估方面的表现。这些实验评估了在AIriskEval-edu-db2上进行监督微调是否能使本地可部署模型接近或超越更强的前沿模型,同时在教育审计和评估任务中保护隐私。 ## I 引言 参见图注图1:本文用于构建AIriskEval-edu-db2和可解释教学风险评价的框架概览。该图展示了所提出流程的主要阶段:i) 教学风险评分标准的定义;ii) AIriskEval-edu-db2的构建和注释,其中每个K-12问题与由LLM模拟的教师画像和人类教师生成的多个解释配对,并附有二元教学风险标签以及可解释性注释(包括风险定位和风险描述);以及iii) 使用AIriskEval-edu-db2对基于LLM的教学评估器进行基准测试和微调。 大型语言模型(LLM)越来越多地部署在面向人类的系统中,在这些系统中,原始能力必须辅以监督、自动监控和风险感知的质量保证。在教育技术中,这些模型可以高精度地回答K-12问题[14 (https://arxiv.org/html/2607.01934#bib.bib3)],这引起了人们对其作为导师以及作为由人类或AI生成的教学解释的自动评估者的兴趣日益增长。同时,由于此类系统可能产生不安全、不可靠或误导性的输出,其部署也引发了与自动监控、人为因素、人工智能以及安全技术的社会影响等主题密切相关的担忧[5 (https://arxiv.org/html/2607.01934#bib.bib55)]。从这个意义上说,教育AI也可以被视为一个安全技术问题:它需要监测机制,能够在部署之前或部署期间检测有害、不可信或其他有风险的语言输出。 最近的研究表明,LLM,特别是在进行任务适配后,可以近似关键的教学行为[7 (https://arxiv.org/html/2607.01934#bib.bib2)],而LearnLM[19 (https://arxiv.org/html/2607.01934#bib.bib8)]等工业界努力以及关于教学角色适应的研究[16 (https://arxiv.org/html/2607.01934#bib.bib4)]进一步支持了这一趋势。同时,LLM也带来了有充分记录的风险[34 (https://arxiv.org/html/2607.01934#bib.bib7)],这在K-12环境中尤为严重。这促使需要能够根据既定的教育框架检测教学和认识论风险的自动教学评估器[1 (https://arxiv.org/html/2607.01934#bib.bib39)]。 先前的工作表明,在基于评分标准的教育数据集上微调LLM可以提高评估器的可靠性[25 (https://arxiv.org/html/2607.01934#bib.bib16), 15 (https://arxiv.org/html/2607.01934#bib.bib1)]。然而,当前公共资源仍然有限:很少有专门针对教学解释评价(而非通用问答)的;很少有采用多标准风险视角的;并且很少有支持超出二元风险检测的可解释风险评估。 考虑到上述所有情况,本文旨在为教育背景下的教学风险评估提供一种资源:一个带有经人工审核的风险标签的K-12教学解释数据集,旨在支持基于LLM的教学评估器的训练和评估。此类评估器不仅可以应用于AI导师生成的解释,也可以应用于人类教师生成的解释,从而实现对数字学习环境中教学内容的监控、审计和质量保证。 相对于我们之前的工作EduEVAL-DB[15 (https://arxiv.org/html/2607.01934#bib.bib1)],本文引入了以下扩展(见图1 (https://arxiv.org/html/2607.01934#S1.F1)): - •扩展数据集,新增LLM生成的解释。我们发布了一个数据集AIriskEval-edu-db2¹¹¹https://github.com/BiometricsAI/AIriskEval-edu,其中包含使用Gemini 2.5 Pro生成的新分区。它包含139个问题(每个对应五种教师画像),以及另外90个针对讽刺型教师的问题,大大扩展了画像条件化教学解释的多样性。 - •可解释的教学风险注释。原始数据集仅提供二元标签,而此新版本为正向风险案例引入了配对的可解释性数据:风险定位(文本摘录)和风险描述(潜在理由)。 - •新的评估训练和基准测试实验。我们展示了实验,其中对一个轻量级本地模型进行了微调,不仅用于二元教学风险检测,还用于可解释的风险评估。此外,我们研究了一种组合设置,其中原始数据集和扩展数据集分区在5折交叉验证协议下合并,产生了比单独使用任一分区训练更好的结果。 ## II 相关工作 最近评估大型语言模型在辅导角色中的基准测试通常侧重于数学和对话策略。像ScienceQA[22 (https://arxiv.org/html/2607.01934#bib.bib28)]这样的基础工作提供了包含人类参考解释的多领域K-12问题,但缺乏具体的教学注释。为了评估交互式教学,MathDial[23 (https://arxiv.org/html/2607.01934#bib.bib29)]引入了对话,其中人类教师通过错误为LLM模拟的学生搭建脚手架。随后的基准测试明确针对数学响应质量:SocraticMATH[12 (https://arxiv.org/html/2607.01934#bib.bib37)]提供了带有结构化教学阶段注释的对话,而MRBench[24 (https://arxiv.org/html/2607.01934#bib.bib32)]则跨多个教学维度人工注释数学响应。BEA 2025共享任务[17 (https://arxiv.org/html/2607.01934#bib.bib30)]通过一个带有黄金教学注释的公共数据集进一步标准化了评估。 其他工作强调基于结果或基于模拟的评估;EducationQ[29 (https://arxiv.org/html/2607.01934#bib.bib34)]通过使用学习收益的多智能体模拟来衡量教学质量,但不发布可复用的对话,而SocraticLM[21 (https://arxiv.org/html/2607.01934#bib.bib35)]引入了一个大规模模拟的苏格拉底式数学辅导数据集。超出核心教学法,Weissburg等人[33 (https://arxiv.org/html/2607.01934#bib.bib36)]通过不同学生画像中的差异化解释选择来评估人口统计偏见。尽管推进了特定的评估主轴,但现有工作较少统一考虑多领域K-12背景、广泛的教学风险和不同的教师角色。为弥补这些差距,我们之前的工作EduEVAL-DB[15 (https://arxiv.org/html/2607.01934#bib.bib1)]在多领域K-12教学解释中进行了教学风险识别。 ## III 教学风险评分标准 我们制定了面向K-12教学解释的教学风险评分标准,该标准与教育标准[1 (https://arxiv.org/html/2607.01934#bib.bib39)]保持一致。除了事实准确性,它还评估解释在教学上是否有效且适合学习者。该评分标准包含五个维度,分别归属于诚实性(H1)、有用性(H2)和无害性(H3)[2 (https://arxiv.org/html/2607.01934#bib.bib41)]。 事实准确性(H1):捕捉可能导致持续性误解的错误或幻觉性陈述[13 (https://arxiv.org/html/2607.01934#bib.bib51)]。解释深度与完整性(H2):衡量推理是否得到适当发展而不仅仅是陈述[6 (https://arxiv.org/html/2607.01934#bib.bib46)]。重点与相关性(H2):评估解释是否包含增加认知负荷的不必要信息[30 (https://arxiv.org/html/2607.01934#bib.bib48)]。学生水平适宜性(H3):评估难度和语言是否与学习者的发育水平和最近发展区(ZPD)匹配[32 (https://arxiv.org/html/2607.01934#bib.bib50)]。意识形态偏见(H3):筛选刻板印象、排斥性框架或隐性课程效应[28 (https://arxiv.org/html/2607.01934#bib.bib43)]。 该评分标准旨在既正交又全面:正交性在于分离不同的教学失败模式;全面性在于覆盖教学内容质量、教学脚手架、学习者匹配以及在教学核心[8 (https://arxiv.org/html/2607.01934#bib.bib52)]中的伦理呈现。这最后一个维度尤其重要,因为考虑到对基于LLM的教育系统危害的更广泛担忧[20 (https://arxiv.org/html/2607.01934#bib.bib42)]。 ## IV 贡献数据集:AIriskEval-edu-db2 参见图注图2:来自AIriskEval-edu-db2的示例,展示了一个讽刺型教师的解释及其可解释的教学风险评估,包括检测到的风险以及风险定位和风险描述。我们基于170个K-12 ScienceQA问题[22 (https://arxiv.org/html/2607.01934#bib.bib28)]构建了AIriskEval-edu-db2,包含十一个LLM模拟教师画像的1,639个解释。跨五个风险维度(第三节 (https://arxiv.org/html/2607.01934#S3))进行评估,产生了8,195个二元风险注释,分两个阶段开发: I) EduEVAL-DB:原始数据集将一个人工解释与六个GPT-5生成的画像解释配对,涉及139个问题(854个解释,4,270个标签)。前四个标准(事实准确性、重点与相关性、深度与完整性、学生水平适宜性)各有139个正向和715个负向标签。意识形态偏见有20个正向和834个负向标签。 II) 扩展子集:这个新引入的分区包含170个问题和785个解释(3,925个标签),通过Gemini 2.5 Pro生成。生成过程使用了少样本提示,以ScienceQA参考为锚点,并明确指定年级水平。标准画像覆盖原始的139个问题,而讽刺型教师画像覆盖45个问题(31个新问题),每个问题生成两个“轻度”和“严重”强度的解释。前四个标准各自产生139个正向和646个负向标签,而意识形态偏见产生90个正向和695个负向标签。一个主要的新颖之处在于为所有标记的风险引入了可解释性注释:风险定位(确切文本摘录)和风险描述(决策理由)(见图2 (https://arxiv.org/html/2607.01934#S4.F2))。 ### IV-A LLM生成的教师画像解释 该数据集围绕六种受教师启发的画像构建,这些画像旨在反映现实的教学风格和缺陷:模范教师、啰嗦教师、简洁教师、不准确教师、过度超前教师和讽刺型教师。这些解释是使用Gemini 2.5 Pro API通过提示工程和少样本提示生成的,使用ScienceQA教师解释作为教学上合理的参考,并明确以年级水平为条件。所有画像都覆盖了完整的问题集,但讽刺型教师除外,受调节限制,它仅限于45个问题,每个问题两个解释,并在LLM辅助下手动编写。教师解释限制在400个字符以内(通常150-300个字符),以减少长度偏差。图2 (https://arxiv.org/html/2607.01934#S4.F2)显示了代表性示例。 ### IV-B 教学风险评估协议 注释过程分两个阶段进行。在第一阶段,通过一个半自动程序(源自该画像预期的风险特征)为每个由LLM模拟的教师画像生成的解释分配二元标签。为了验证这一程序,两位经验丰富的教师手动审查了大约30%的数据集,并确认了分配标签的一致性。一旦建立了这种一致性,标签程序就被接受了。随后,在基于评估器的验证(第五节 (https://arxiv.org/html/2607.01934#S5))期间产生的任何分歧案例都由专家重新检查。在第二阶段,每个正向风险案例都通过可解释性注释(即风险定位和风险描述)进行丰富。这些注释首先由Gemini生成,然后由专家教师验证。 ## V 实验与结果 我们在三种数据集设置下,根据所提出的评分标准,评估了作为自动教学评估器的LLM:先前引入的教学风险数据集[15 (https://arxiv.org/html/2607.01934#bib.bib1)]、新引入的可解释性增强分区,以及通过合并两者获得的完整AIriskEval-edu-db2数据集。作为基线,我们考虑了Gemini 2.5 Pro、GPT 5.5和Llama 3.1 8B Instruct,后者是一种可以部署在消费级GPU上的轻量级本地模型。评估涵盖二元教学风险检测和可解释性评估,包括风险定位和风险描述。为了评估AIriskEval-edu-db2对于训练本地评估器的有用性,我们在相同协议下也对Llama 3.1 8B Instruct进行了微调。 ### V-A 实验协议 表一:基线模型与在不同训练设置下微调的Llama 3.1 8B评估器的比较,每个评分标准维度的平均绝对误差(MAE)归一化到[0,1]。结果显示了在原始EduEVAL-DB、扩展子集以及完整AIriskEval-edu-db2数据集上的评估。数值越低表示性能越好,每个评估设置的最佳值以粗体显示。缩写:FA = 事实准确性,F&R = 重点与相关性,D&C = 深度与完整性,S-L A = 学生水平适宜性,IB = 意识形态偏见。Base = 基线模型。Fine-tuned
相似文章
SciRisk-Bench:面向AI4Science安全的风险维度感知基准
本文介绍了SciRisk-Bench,这是一个用于在AI4Science场景下评估大语言模型安全的基准,涵盖7个学科、31个子学科和10个风险维度,以同时评估科学能力和风险意识。
LessonBench-V1:评估AI课程生成代理的基准数据集
LessonBench-V1是一个新的基准数据集,将647个人类编写的STEM课程与逆向工程的教学计划配对,能够系统评估AI课程生成代理。
面向欧盟解释权的可解释人工智能:法律-XAI转化差距的系统综述
针对欧盟解释权背景下的可解释人工智能(XAI)研究进行系统综述,分析GDPR与《人工智能法案》中法律要求与技术实施之间的差距。
AI认知风险:新兴机制与证据 [R]
一篇由30位专家合著的新论文探讨了来自人工智能的认知风险—即对我们形成准确信念和良好推理能力的威胁—包括说服、认知卸载和反馈循环等机制,并概述了减轻这些风险的方向。
AICompanionBench:评测 LLM 作为裁判在 AI 伴侣安全领域的表现
AICompanionBench 推出了首个公开可用的基准数据集,包含 2,123 条真实 AI 伴侣对话,并按九个安全风险类别进行标注,用于评估 20 个 LLM 作为安全裁判的表现。结果显示,强模型能较好地处理显性有害内容,但在操控等细微风险的识别以及对无害对话的误判问题上仍存在明显不足。