Elmes*:长尾教育场景下大型语言模型细粒度评估标准的自动构建
摘要
本文介绍了Elmes+,一个面向长尾教育场景下LLMs细粒度评估标准构建的自动化框架,并提出了涵盖11个学科330个场景的Edu-330基准。该框架使用多智能体引擎和自演化模块来协同优化评估标准与测试数据,揭示了顶级LLMs在多维教育能力上的差异。
arXiv:2606.06546v1 公告类型:新
摘要:评估教育领域的大型语言模型(LLMs)需要衡量模型如何教学,而不仅仅是它们知道什么。现有基准侧重于领域通用正确性或依赖手动设计的标准,这些标准难以扩展到长尾教学场景。我们提出了Elmes*,一个用于构建、完善和应用细粒度场景特定标准的端到端框架。Elmes*结合了一个声明式多智能体引擎用于教师-学生-评判者交互,以及SceneGen(一个自演化模块),该模块从专家定义的教学维度协同优化评估标准与测试数据。利用Elmes*,我们构建了Edu-330,涵盖11个学科、3个年级段和10种任务类型的330个场景,拥有超过1,000个二级指标。在Edu-330和四个专家编写的黄金标准场景上的实验表明,教育能力是多维的:顶级LLMs主要在创造力和价值观整合上存在差异,知识强的模型可能在苏格拉底式支架教学上失败,而教育专用模型InnoSpark获得了人类评估的最高平均分。LLM评判者保留了与人类相当的排名,且评分方差显著更低,但表现出评判者特定的偏见,如自我偏好。消融实验表明,专家评分的少样本锚定可改善人机对齐,而推理强制和贪婪解码则依赖于模型。因此,Elmes*为基于教学法的LLM评估提供了可扩展的诊断基础设施。
查看缓存全文
缓存时间: 2026/06/08 09:16
# 面向长尾教育场景的大型语言模型细粒度评估量规自动构建 来源:https://arxiv.org/html/2606.06546 刘涛¹²,陆晔¹²,张若华¹²,宋思雨¹²,刘文涛¹²³,周爱民¹²³,郝浩¹\* ¹华东师范大学上海智能教育研究院,上海 200062 ²华东师范大学计算机科学与技术学院,上海 200062 ³上海创新研究院,上海 200231 通讯作者:郝浩([email protected]) ###### 摘要 评估用于教育领域的大型语言模型(LLM)需要衡量模型如何教学,而不仅仅是它们知道什么。现有基准侧重于领域通用正确性,或依赖手动设计的量规,难以扩展到长尾教学场景。我们提出 **Elmes+**,一个端到端框架,用于构建、优化和应用细粒度的场景特定量规。Elmes+ 结合了一个声明式多智能体引擎,用于教师–学生–裁判交互,以及 **SceneGen**,一个自演化模块,从专家定义的教学维度协同优化评估标准和测试数据。利用 Elmes+,我们构建了 **Edu-330**,涵盖 11 个学科、3 个年级段和 10 种任务类型的 330 个场景,包含超过 1000 个二级指标。在 Edu-330 和四个专家编写的高质量标准场景上的实验表明,教育能力是多维的:顶级 LLM 主要在创造力和价值观整合方面存在差异;知识强大的模型可能在苏格拉底式引导上失败;而教育专用的 **InnoSpark** 在人工评估平均得分上取得最佳成绩。LLM 裁判保持了与人类可比的排名,但得分方差更低,但表现出特定裁判的偏见,如自偏好。消融实验表明,专家评分的 few-shot 锚定改进了人机对齐,而推理强制和贪心解码依赖于具体模型。因此,Elmes+ 为基于教学法的 LLM 评估提供了可扩展的诊断基础设施。 **Elmes+**:面向长尾教育场景的大型语言模型细粒度评估量规自动构建 刘涛¹²,陆晔¹²,张若华¹²,宋思雨¹²,刘文涛¹²³,周爱民¹²³,郝浩¹\* ¹华东师范大学上海智能教育研究院,上海 200062 ²华东师范大学计算机科学与技术学院,上海 200062 ³上海创新研究院,上海 200231 通讯作者:郝浩([email protected]) ## 1 引言 大型语言模型已迅速进入教育技术领域,支持智能辅导、教案设计和个性化内容生成(Kasneci 等,2023 (https://arxiv.org/html/2606.06546#bib.bib1);Yan 等,2024 (https://arxiv.org/html/2606.06546#bib.bib2))。然而,评估 LLM 是否真正作为教学代理有效仍然困难:与事实问答不同,教育任务是主观的、多维度的且依赖上下文的,要求模型在内容准确性、引导、情感敏感性和文化适宜性之间取得平衡(Wang 等,2024a (https://arxiv.org/html/2606.06546#bib.bib17))。 现有的评估范式仍不够充分。通用基准如 MMLU-Pro(Wang 等,2024b (https://arxiv.org/html/2606.06546#bib.bib4))、C-Eval(Huang 等,2023 (https://arxiv.org/html/2606.06546#bib.bib5))和 GSM8K(Cobbe 等,2021 (https://arxiv.org/html/2606.06546#bib.bib6))强调知识或推理,而非教学过程质量;交互式框架如 MT-Bench(Zheng 等,2023 (https://arxiv.org/html/2606.06546#bib.bib9))和 Chatbot Arena(Chiang 等,2024 (https://arxiv.org/html/2606.06546#bib.bib10))提供粗糙的偏好信号;而教育专用基准(Dan 等,2023 (https://arxiv.org/html/2606.06546#bib.bib12);Xu 等,2025 (https://arxiv.org/html/2606.06546#bib.bib13))覆盖有限的场景,并依赖手动策划的量规。 核心挑战是量规构建瓶颈:细粒度标准需要教学专业知识,而教育场景随学科、年级和任务类型组合增长。 我们通过 **Elmes+** 解决这一挑战,它自动化了从量规生成到评分和优化的教育 LLM 评估。我们的设计原则是评估指标和测试数据应共同演化:分数分布可以揭示过于严格、过于宽松或区分度低的量规,而测试数据可以重新生成以更好地锻炼目标教学维度。 Elmes+ 做出以下贡献: 1. **多智能体评估引擎**。我们设计了一个声明式 YAML 到 DAG 的引擎,支持教师–学生–裁判角色配置、条件路由、轨迹级评分和专家在环的场景优化,适用于单轮和多轮教育任务。 2. **自演化量规合成(SceneGen)**。我们引入了一个闭环合成模块,从 4 个专家定义的维度开始,通过诊断过于严格、过于宽松或区分度低的指标,协同演化量规和测试数据,为 330 个场景生成了超过 1,298 个二级指标。 3. **大规模基准与专家级评估**。我们构建了 **Edu-330**,一个覆盖 330 个核心场景的基准,并辅以 4 个专家设计的教学场景,以揭示模型特定的教育轮廓和权衡,这些是领域无关基准所忽视的。 4. **一致性增强与人机对齐**。我们通过专家锚定和推理约束分析并提高了 LLM 作为裁判的可靠性,将人工专家的平均分数偏差降低了约 30%,同时保持高评分者间信度。 ## 2 相关工作 ### 2.1 通用 LLM 基准 LLM 评估长期由知识和推理为中心的基准主导。MMLU(Hendrycks 等,2021 (https://arxiv.org/html/2606.06546#bib.bib8))和 MMLU-Pro(Wang 等,2024b (https://arxiv.org/html/2606.06546#bib.bib4))评估广泛的事实知识,C-Eval(Huang 等,2023 (https://arxiv.org/html/2606.06546#bib.bib5))针对中文语言知识理解,GSM8K(Cobbe 等,2021 (https://arxiv.org/html/2606.06546#bib.bib6))和 MATH(Hendrycks 等,2021 (https://arxiv.org/html/2606.06546#bib.bib8))评估数学推理。尽管这些基准能有效衡量模型知道什么,但它们并未评估模型教学的能力,而这需要评估教学过程质量而非仅结果正确性。 ### 2.2 交互式与基于裁判的评估 LLM-as-a-Judge 范式(Zheng 等,2023 (https://arxiv.org/html/2606.06546#bib.bib9))通过使用强 LLM 评估弱 LLM,解决了人工评估的可扩展性限制。MT-Bench(Zheng 等,2023 (https://arxiv.org/html/2606.06546#bib.bib9))评估多轮对话质量,而 Chatbot Arena(Chiang 等,2024 (https://arxiv.org/html/2606.06546#bib.bib10))大规模众包成对偏好。然而,它们的整体或成对偏好信号缺乏教育诊断所需的维度粒度;一个模型可能在总体上“获胜”,但在特定教学维度(如元认知培养或情感支持)上失败。 多项研究记录了 LLM 裁判的系统性偏差,包括位置偏差、冗长偏差和自偏好(Wang 等,2026 (https://arxiv.org/html/2606.06546#bib.bib3);Zheng 等,2023 (https://arxiv.org/html/2606.06546#bib.bib9))。Prometheus(Kim 等,2024 (https://arxiv.org/html/2606.06546#bib.bib20))训练专门的裁判模型,采用细粒度、基于量规的评估。Auto-J(Li 等,2024 (https://arxiv.org/html/2606.06546#bib.bib11))为裁判模型生成基于批评的训练数据。我们在这一工作基础上,通过多裁判集成和专家锚定校准,同时自动生成量规,而非假设量规已给定。 ### 2.3 教育专用 LLM 评估 最近的工作开始专门针对教育评估。EduChat(Dan 等,2023 (https://arxiv.org/html/2606.06546#bib.bib12))提供了教学对齐的聊天机器人,但缺乏系统评估量规,而 EduBench(Xu 等,2025 (https://arxiv.org/html/2606.06546#bib.bib13))侧重于教育知识而非教学过程质量。EQGBench(Zhou 等,2025 (https://arxiv.org/html/2606.06546#bib.bib14))针对教育问题生成,MathDial(Macina 等,2023 (https://arxiv.org/html/2606.06546#bib.bib16))评估数学辅导对话,TutorBench(Srinivasa 等,2025 (https://arxiv.org/html/2606.06546#bib.bib15))使用过程级指标评估辅导质量,但量规是固定且手动设计的。 这些工作仍然覆盖有限的教育场景,并且往往依赖手动设计的量规,使得扩展困难。Elmes+ 通过自动化量规生成和迭代优化解决了这两个局限性,能够以最小专家工作量扩展到数百个场景。 ## 3 Elmes+ 框架 Elmes+ 包含两个集成组件(图1 (https://arxiv.org/html/2606.06546#S3.F1)):一个多智能体评估引擎(§3.1 (https://arxiv.org/html/2606.06546#S3.SS1))和一个自演化量规合成模块(§3.2 (https://arxiv.org/html/2606.06546#S3.SS2))。  参见标题:图1:Elmes+ 概述。SceneGen 从专家定义的教学维度演化量规和测试数据,而多智能体引擎协调教师、学生和裁判之间的交互,并通过专家锚定和多裁判集成提高一致性。 ### 3.1 多智能体评估引擎 #### 3.1.1 声明式配置系统 Elmes+ 的一个核心设计原则是声明式而非程序化地指定评估场景。每个 YAML 文件通过将模型绑定到教学角色、注入任务特定内容、指定交互流并附加基于量规的裁判来定义一个教育场景,使专家能够在不更改框架代码的情况下调整场景。图2 (https://arxiv.org/html/2606.06546#S3.F2) 显示了一个简化的问题生成场景。 ```yaml models: test_model: judge_model: agents: test_model: model: test_model role: educational question generator content: "Generate a contextualized math problem for \{question\}" tasks: mode: iter content: - question: "Design a Grade 4 problem on equilateral-triangle perimeter . . . ." (Generated by SceneGen) directions: [START to test_model, test_model to END] evaluation: model: judge_model format: [Generated by SceneGen] ``` 图2:用于定义教育问题生成场景的简化 YAML 配置。 #### 3.1.2 基于 DAG 的交互与评估 `directions` 规范被编译为 LangGraph 状态图,其中每个节点代表一个智能体,边定义对话流。边可以直接将一个智能体的输出转发到下一个智能体,或调用路由器从当前对话状态中选择下一个节点,内置支持基于关键字的终止和多条件门控。对于多轮场景(如苏格拉底式辅导),教师和学生智能体在由最大轮次预算 \(T_{\max}\) 和任务特定退出条件控制的循环中交互。生成的对话轨迹 \(\tau = (m_1, m_2, \ldots, m_n)\) 随后由裁判智能体在场景特定量规下进行评估。给定量规 \(\mathcal{R} = \{(d_i, w_i)\}_{i=1}^D\),其中每个 \(d_i\) 是由 SceneGen 生成或优化的教学评估维度,\(w_i\) 是其权重,总体得分计算为: \[ \text{Score}(\tau, \mathcal{R}) = \sum_{i=1}^D w_i \cdot s_i(\tau, d_i) \] (1) 其中 \(s_i(\tau, d_i)\) 表示裁判为轨迹 \(\tau\) 在维度 \(d_i\) 上分配的分数。 #### 3.1.3 用于场景配置的交互式人类专家界面 为支持专家在环优化,Elmes+ 提供了一个基于 Gradio 的界面,使教育工作者和课程设计者能够无需编写代码即可加载、检查、编辑和重新运行场景配置。专家可以将领域知识注入 SceneGen 生成的量规,调整模糊或不一致的标准,并通过即时评估反馈校准测试案例。实践中,教育工作者通常在 2-3 轮配置更新后收敛。完整界面见附录 A (https://arxiv.org/html/2606.06546#A1),图6 (https://arxiv.org/html/2606.06546#A1.F6)。 ### 3.2 自演化量规合成:SceneGen Elmes+ 的另一个关键创新是 SceneGen,一个自动生成并迭代优化教育场景评估量规的模块。核心设计是让评估指标和测试数据共同演化:一方的缺陷可以通过对另一方的分析检测出来,并在后续迭代中修正。  参见标题:图3:SceneGen 工作流。从专家定义的维度开始,该流水线生成初始指标,并通过锚定校准、早停和最佳版本回滚,迭代地协同优化合成提示和评估标准。 #### 3.2.1 专家定义维度框架 SceneGen 并非从零生成评估标准,而是从一组紧凑的初始教学维度开始。在本工作中,初始维度源于不少于 70 次教育专家访谈,并基于既有理论,包括 Shulman 的教学内容知识(PCK)、Vygotsky 的最近发展区以及 TPACK 模型(Vygotsky, 1978 (https://arxiv.org/html/2606.06546#bib.bib22);Mishra and Koehler, 2006 (https://arxiv.org/html/2606.06546#bib.bib23))。这一过程产生了四个起始维度及其专家分配的权重: - **个性化**(\(w_1=0.3\)):适应学习者画像、认知水平和个人需求。 - **教学方法专业性**(\(w_2=0.4\)):教学策略、引导和领域专业知识的质量。 - **创造力激发**(\(w_3=0.2\)):鼓励批判性思维、发散推理和求知欲。 - **价值观整合**(\(w_4=0.1\)):融入积极社会价值观和文化敏感性。 这些加权维度为 SceneGen 生成细粒度、场景特定的量规提供种子,权重越大,分配到相应种子维度的定制指标比例就越高。种子维度是可替换的输入,这使得 SceneGen 成为一个通用的量规合成框架;本文在 Edu-330 和所有实验中用上述四个维度实例化它。 #### 3.2.2 初始指标生成 对于每个教育场景 \(s\),SceneGen 从场景描述和加权种子维度生成一组初始细粒度指标: \[ \mathcal{M}^{(0)} = \text{MetricGen}\bigl(s, \{(d_i, w_i, \text{desc}_i)\}_{i=1}^4\bigr) \] (2) 这里,\(s\) 指定教育上下文(例如,“初中数学:函数概念”),每个生成的指标 \(m \in \mathcal{M}^{(0)}\) 表示为: \[ m = (\texttt{name}, \texttt{dim}, \texttt{weight}, \texttt{desc}, \texttt{pos\_ex}, \texttt{neg\_ex}) \]
相似文章
面向LLM-as-a-Judge的动态评估准则生成与优化
本文提出了一种无需训练的方法,可以在无需人工标注的情况下自动生成细粒度的评估准则用于LLM-as-a-Judge,并进一步介绍了一种迭代微调策略,使准则生成器的性能超过更大的专有模型。
基于LLM的自动化评分中可学习的评估技能:通过迭代优化构建评分标准
本文提出为LLM学习评估技能,以自动化评分任务的评分标准构建,达到与专家编写的评分标准相当的性能,且无需人工编写的示例。
LLM能否生成可靠的评分标准?实验复现的元评估
本文首次系统性地对LLM生成的用于复现研究论文实验的评分标准进行元评估。它将评分标准重新表述为检查表格式,并从内在(语义相似性)和外在(分数对齐)两方面评估生成设置,发现增强设置改善了下游评估对齐,但生成的评分标准往往过于细粒度,且偏向高分。
超越分数预测:基于强化学习与评分标准奖励的LLM作文评分与反馈生成
本文提出RLAES,一个统一的LLM框架,通过基于评分标准的强化学习联合优化作文评分与反馈生成,在ASAP基准上实现了最先进的评分性能,同时保持高质量的反馈。
LP-Eval: 用于衡量法律命题生成质量的评分标准与数据集
本文介绍了LP-Eval,这是一个由法律专家标注的、用于评估大语言模型生成法律命题质量的评分标准与数据集。结果表明,基于评分标准的LLM评估比直接打分更接近专家评估。