通过类比教学:教育类比生成的模块化流水线
摘要
本文提出了一种用于教育类比生成的模块化流水线,将任务分解为四个阶段,并评估了12种大语言模型和7种嵌入模型。结果表明,子概念基础化能够提升解释质量和检索精度,同时采用了一种新颖的LLM作为裁判的评估方法,并针对七名人类标注员的标注进行了验证。
arXiv:2605.24211v1 公告类型:新提交
摘要:类比通过将陌生概念与已知概念联系起来,帮助学习者理解。尽管近期取得了进展,但大语言模型(LLM)在生成与人类质量相当的类比方面仍然存在困难。我们提出了一种用于教育类比生成的模块化流水线,将任务分解为四个阶段:源发现、子概念生成、解释生成和评估。该流水线基于结构映射理论,能够系统性地、分阶段地分析模型选择和输入配置如何影响类比质量。我们在两个带有结构化子概念标注的数据集(SCAR 和 ParallelPARC)上评估了来自六个模型家族的12种先进LLM,以及七种用于封闭设置检索的嵌入模型。结果表明,子概念显著提升了解释质量和封闭设置检索精度,但在开放式源生成方面收益有限。我们进一步引入了一种LLM作为裁判的评估方法,并根据七名标注员的人类标注验证了其评分,发现Claude Sonnet 4.6在与人类排名的一致性上比精细的绝对分数更加可靠。综合来看,我们的研究揭示了孤立研究所无法捕捉到的跨阶段交互,并强调了子概念基础化是类比质量生成的关键驱动因素。
查看缓存全文
缓存时间: 2026/05/26 09:00
# 教育类比生成的模块化管道
来源:https://arxiv.org/html/2605.24211
## 通过类比教学:教育类比生成的模块化管道
Ekaterina Kochmar 穆罕默德·本·扎耶德人工智能大学,阿联酋 \{mariam\.barakat, ekaterina\.kochmar\}@mbzuai\.ac\.ae
###### 摘要
类比通过将不熟悉的概念与已知概念联系起来,帮助学习者理解新概念。尽管近期取得了进展,大语言模型(LLMs)在生成与人类水平相当的类比方面仍面临挑战。我们提出了一种教育类比生成的模块化管道,将任务分解为四个阶段:源系统查找、子概念生成、解释生成和评估。该管道基于结构映射理论,支持系统化、逐阶段分析模型选择和输入配置如何影响类比质量。我们在两个具有结构化子概念标注的数据集(SCAR 和 ParallelPARC)上评估了来自六个模型家族的 12 个最先进的 LLM,同时使用了七个嵌入模型用于封闭环境检索。结果表明,子概念显著提高了解释质量和封闭环境检索精度,但在开放式的源系统生成中收益有限。我们还引入了一种 LLM-as-a-judge 评估方法,并验证了其评分与七名标注者的人类标注的一致性,发现 Claude Sonnet 4.6 在与人类排序的一致性上表现更可靠,而非细粒度的绝对分数。综合来看,我们的发现揭示了孤立研究无法捕捉到的跨阶段交互作用,并强调了子概念基础化是类比质量生成的关键驱动因素。
**通过类比教学:教育类比生成的模块化管道**
Mariam Barakat 和 Ekaterina Kochmar
穆罕默德·本·扎耶德人工智能大学,阿联酋
\{mariam\.barakat, ekaterina\.kochmar\}@mbzuai\.ac\.ae
## 1 引言
参见图注
**图 1:** 原子与太阳系之间系统类比的示例,显示了源系统与目标系统及其对齐的子概念。
随着教育系统在人工智能时代的发展,死记硬背已不再足够。相反,学生需要能够跨领域推理并理解底层结构——这些技能是在快速变化的世界中进行批判性思维的基础。发展这些能力的有效方法之一是通过类比(Eriksson 等人,2024 (https://arxiv.org/html/2605.24211#bib.bib25)),它通过关系结构将不熟悉的知识(目标系统)映射到已有知识(源系统)上,从而促进学习(Ye 等人,2024 (https://arxiv.org/html/2605.24211#bib.bib6); Czinczoll 等人,2022 (https://arxiv.org/html/2605.24211#bib.bib12); Bettin 和 Ott,2023 (https://arxiv.org/html/2605.24211#bib.bib5))。即使在存在显著认知差距的情况下,中间“桥梁”类比也可以引导学生走向理解(Brown 和 Clement,1989 (https://arxiv.org/html/2605.24211#bib.bib32))。在这项工作中,我们将类比生成构建为一个模块化管道,以便对过程的每个阶段进行系统分析和改进。
遵循先前研究(Yuan 等人,2023a (https://arxiv.org/html/2605.24211#bib.bib4)),我们使用“系统”而非“概念”一词,以强调类比映射多个组件。我们在本文中将这些组成部分称为“子概念”,使用“子-”前缀强调它们是更大系统的组件,而非独立概念。
如图 1 (https://arxiv.org/html/2605.24211#S1.F1) 所示,通过太阳系(源系统)解释原子(目标系统)需要解释各个子概念的映射:原子核映射到太阳,电子映射到行星,能级映射到轨道距离。
自动生成高质量类比仍然是一个未解决的挑战,因为构造不当的类比可能通过错误的映射或过度简化底层概念引入或强化误解(Zhou 等人,2025 (https://arxiv.org/html/2605.24211#bib.bib19); Shao 等人,2025 (https://arxiv.org/html/2605.24211#bib.bib18))。
尽管近期取得了进展,类比生成研究仍然碎片化:先前的工作孤立地处理检索、生成或评估,而没有将它们连接成一个统一的管道(Yuan 等人,2023a (https://arxiv.org/html/2605.24211#bib.bib4), b (https://arxiv.org/html/2605.24211#bib.bib13); Zhai 等人,2024 (https://arxiv.org/html/2605.24211#bib.bib15); Sultan 等人,2024 (https://arxiv.org/html/2605.24211#bib.bib33))。源系统查找主要依赖于在封闭候选池上的基于嵌入的检索,偏向表面相似性而非结构对齐(Yuan 等人,2023a (https://arxiv.org/html/2605.24211#bib.bib4); Czinczoll 等人,2022 (https://arxiv.org/html/2605.24211#bib.bib12); Jiayang 等人,2023 (https://arxiv.org/html/2605.24211#bib.bib14)),而 SCAR(Yuan 等人,2023a (https://arxiv.org/html/2605.24211#bib.bib4))和 ParallelPARC(Sultan 等人,2024 (https://arxiv.org/html/2605.24211#bib.bib33))中的子概念标注主要用于数据集构建,而非指导生成。评估仍然关注不足,因为无论是词汇指标还是 LLM-as-a-judge 方法都无法可靠地与人类判断对齐(Zhai 等人,2024 (https://arxiv.org/html/2605.24211#bib.bib15); Bhavya 等人,2024 (https://arxiv.org/html/2605.24211#bib.bib9)),且大多数研究仅评估 GPT-4 变体(Yuan 等人,2023a (https://arxiv.org/html/2605.24211#bib.bib4); Kim 等人,2023 (https://arxiv.org/html/2605.24211#bib.bib1); Sultan 等人,2024 (https://arxiv.org/html/2605.24211#bib.bib33); Shao 等人,2025 (https://arxiv.org/html/2605.24211#bib.bib18); Li 等人,2024 (https://arxiv.org/html/2605.24211#bib.bib7)),跨模型泛化性仍未被探索。
在本文中,我们做出三项贡献:(1)一个基于结构映射理论(Gentner,1981 (https://arxiv.org/html/2605.24211#bib.bib21))的教育类比生成模块化管道,分解为源系统查找、子概念生成、解释生成和评估四个阶段;(2)跨六个家族 12 个 LLM 的系统性跨模型评估,发现子概念能提升检索和解释质量,但在开放式源系统生成中收益有限;(3)一种封闭到开放的评估方法,从在 SCAR(Yuan 等人,2023a (https://arxiv.org/html/2605.24211#bib.bib4))和 ParallelPARC(Sultan 等人,2024 (https://arxiv.org/html/2605.24211#bib.bib33))上对照黄金标注的受控评估,过渡到使用基线、基于嵌入和重排序选择策略的 LLM 生成候选。
我们提出的管道中的每个阶段对应一个研究问题:
**RQ1:源系统查找。** LLM 能否在封闭和开放设置中为目标系统识别合适的源系统,超越预定义候选池?
**RQ2:子概念生成。** LLM 能否在给定目标-源对的情况下可靠地生成子概念映射,以及在管道的哪些阶段子概念能提升性能?
**RQ3:解释生成。** LLM 能在多大程度上生成完整的类比解释,以及哪些输入配置能产生最高质量?
**RQ4:评估。** LLM-as-a-judge 评估与人类对类比质量的判断对齐得如何?此外,在开放设置中,哪个生成模型在源系统查找方面表现最佳?
## 2 相关工作
#### 源系统查找。
先前源系统查找的方法主要依赖于封闭候选池中基于嵌入的检索。Yuan 等人(2023a (https://arxiv.org/html/2605.24211#bib.bib4))使用贪心和 Kuhn-Munkres 匹配,但侧重于映射给定概念而非发现新的源系统。类似地,Yuan 等人(2023b (https://arxiv.org/html/2605.24211#bib.bib13))采用嵌入相似性,但仅关注简单的单一或双重关系类比。Jiayang 等人(2023 (https://arxiv.org/html/2605.24211#bib.bib14))表明 LLM 容易被表面相似性分散注意力,仅达到 30% 的准确率,而人类为 85%,同时 Ye 等人(2024 (https://arxiv.org/html/2605.24211#bib.bib6))报告了在较长类比上的显著性能差距。Li 等人(2024 (https://arxiv.org/html/2605.24211#bib.bib7))进一步表明,在历史领域,自由生成优于基于嵌入的检索,这表明基于相似性的方法存在根本性局限。然而,开放式的源系统发现(模型必须在没有预定义候选的情况下识别合适的源系统)仍未得到充分探索。
#### 子概念生成。
诸如 SCAR(Yuan 等人,2023a (https://arxiv.org/html/2605.24211#bib.bib4))和 ParallelPARC(Sultan 等人,2024 (https://arxiv.org/html/2605.24211#bib.bib33))等数据集提供了连接源系统和目标系统的丰富子概念标注。然而,这些标注主要用于数据集构建,而非作为生成模型的输入。Yuan 等人(2023a (https://arxiv.org/html/2605.24211#bib.bib4))表明子概念匹配对类比质量至关重要,但即使提供了两侧的子概念,模型也仅达到 62% 的准确率,而人类为 86%。此外,评估仅限于具有完全指定输入的封闭设置。LLM 在开放设置中生成子概念的能力及其对管道各阶段的影响尚未被研究。
#### 解释生成。
匹配良好的源系统和准确的子概念映射是必要但不充分的,因为最终决定学习者是否理解类比的是解释。生成能捕捉类比为何成立的解释尤其具有挑战性。Zhai 等人(2024 (https://arxiv.org/html/2605.24211#bib.bib15))将概念生成和解释生成分开,发现虽然 LLM 在概念生成上接近人类水平,但它们难以产生具有足够关系深度的解释。Bhavya 等人(2024 (https://arxiv.org/html/2605.24211#bib.bib9))同样报告模型生成的解释常常缺乏连贯性或偏离预期的类比。总体而言,解释生成仍然探索不足,特别是关于输入表示如何影响质量。
#### 评估。
评估类比质量仍然具有挑战性。ROUGE 和 BLEURT 等词汇指标无法捕捉关系的健全性(Zhai 等人,2024 (https://arxiv.org/html/2605.24211#bib.bib15)),而更结构化的评估框架仍未能完全捕捉类比质量(Bhavya 等人,2024 (https://arxiv.org/html/2605.24211#bib.bib9))。尽管更可靠,人工评估成本高昂(Jiayang 等人,2023 (https://arxiv.org/html/2605.24211#bib.bib14); Czinczoll 等人,2022 (https://arxiv.org/html/2605.24211#bib.bib12))。LLM-as-a-judge 方法提供了一种可扩展的替代方案(Zhai 等人,2024 (https://arxiv.org/html/2605.24211#bib.bib15)),但其在类比特定设置中与人类判断的一致性仍然一般。
## 3 方法
参见图注
**图 2:** 拟议的教育类比生成模块化管道概述。给定一个目标系统及其子概念和背景描述,该框架通过四个阶段进行:(1)源系统查找,生成并选择候选源系统池;(2)子概念生成;(3)解释生成;(4)使用外部 LLM-as-a-judge 进行评估。每个阶段根据我们的实证结果,在适合其要求的输入配置下运行。输出展示了最终生成的类比,包括对齐的子概念、解释和评估分数。
我们提出对拟议的教育类比生成模块化管道进行系统评估,分析模型选择和输入配置如何影响每个阶段的性能。该管道分解为与我们研究问题对应的四个阶段:源系统查找(RQ1)、子概念生成(RQ2)、解释生成(RQ3)和评估(RQ4)。图 2 (https://arxiv.org/html/2605.24211#S3.F2) 提供了实验设置的概览。为说明完整的管道,考虑图 1 (https://arxiv.org/html/2605.24211#S1.F1) 中的示例,其中目标系统“原子”通过源系统“太阳系”来解释。在源系统查找阶段,根据候选源系统与目标系统的相似性进行检索。接下来,子概念生成对齐诸如“原子核” → “太阳”和“电子” → “行星”等组件。然后解释生成阶段产生一个自然语言解释,将这些对应关系联系起来。最后,根据连贯性、映射健全性和解释力对类比进行评估。这个示例展示了每个阶段如何为最终类比做出贡献。
### 3.1 数据集
我们使用两个具有显式子概念标注的数据集,从而能够在管道的各个阶段进行受控评估。¹¹¹在本文中,我们为清晰起见采用 SCAR 的字段名,并将其他数据集的对应字段对齐到该结构。
SCAR(Yuan 等人,2023a (https://arxiv.org/html/2605.24211#bib.bib4))包含跨 13 个科学领域的 400 个系统级类比实例,由人工标注者创建。每个实例将一个目标系统与一个源系统配对,并标注有背景描述、多个子概念映射以及这些映射的解释(共 1,614 个标注映射)。代表性示例见附录 A (https://arxiv.org/html/2605.24211#A1)。
ParallelPARC(Sultan 等人,2024 (https://arxiv.org/html/2605.24211#bib.bib33))扩展了 ProPara 数据集(Tandon 等人,2018 (https://arxiv.org/html/2605.24211#bib.bib34)),通过 LLM 生成、自动标注和人工验证的管道将科学过程描述转换为类比对。它引入了 310 个黄金类比,每个都标注有对应属性之间的关系对齐,格式为 `(entity, verb, entity)` 映射到 `(entity, verb, entity)`。请参见附录 1 (https://arxiv.org/html/2605.24211#LST1) 中的示例。
### 3.2 模型
#### 封闭设置。
对于封闭设置中的源系统检索,我们评估一组多样化的嵌入模型:OpenAI 的 `embedding-small` 和 `embedding-large`,²²²https://platform.openai.com/docs/guides/embeddings E5-large,³³³https://huggingface.co/intfloat/e5-large BGE-large,⁴⁴⁴https://huggingface.co/BAAI/bge-large-en MPNet-base,⁵⁵⁵https://huggingface.co/sentence-transformers/all-mpnet-base-v2 MiniLM-L6,⁶⁶⁶https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2 和 SPECTER⁷⁷⁷https://huggingface.co/allenai/specter。这些模型覆盖互补的范式:专有通用嵌入(OpenAI)、开源检索导向模型(E5-large、BGE-large)、句子相似性基线(MPNet-base、MiniLM-L6),以及领域专精的科学编码器(SPECTER),从而能够在规模、训练目标和领域特异性不同的模型之间进行比较。
#### 开放设置。
对于所有三个阶段的开放式生成,我们使用 DSPy 框架(Khattab 等人,2022 (https://arxiv.org/html/2605.24211#bib.bib29),2024 (https://arxiv.org/html/2605.24211#bib.bib28))来保持一致的输入/输出接口。我们评估来自六个家族的 12 个 LLM:OpenAI 的 GPT-4.1 (mini, nano),GPT-OSS (20B, 120B),Meta 的 LLaMA 3.1 (8B, 70B, 405B) Instruct,Google 的 Gemini 2.5 Flash-Lite,xAI 的 Grok-4-Fast,DeepSeek-R1,以及阿里巴巴的 Qwen3 (14B, 32B)。模型选择基于相似文章
Elmes*:长尾教育场景下大型语言模型细粒度评估标准的自动构建
本文介绍了Elmes+,一个面向长尾教育场景下LLMs细粒度评估标准构建的自动化框架,并提出了涵盖11个学科330个场景的Edu-330基准。该框架使用多智能体引擎和自演化模块来协同优化评估标准与测试数据,揭示了顶级LLMs在多维教育能力上的差异。
教育中的LLM评判:基于课程大纲的评分流水线
本文提出了一种基于课程大纲的LLM评判流水线,用于高风险考试备考中的自动化试题评分。该流水线利用教学大纲材料及评分指南,提升一致性与透明度。初步评估显示,其评分结果与人工导师相当。
超越大语言模型:从叙事文本生成因果图的语言学方法
本文提出了一种混合框架,结合了LLM摘要、语言学基础的专家指数(Expert Index)以及STAC分类,用于从叙事文本生成因果图,在基准故事上超越了GPT-4o和Claude 3.5。
错误作为透镜:通过合成误解生成探究LLM推理
本文提出了一个框架,使用LLMs生成针对性的合成误解,这些误解基于从布鲁姆分类学改编的五类分类法,旨在解决教育研究中标记学生错误数据稀缺的问题。
OmniThoughtVis:一种用于部署型多模态推理模型的可扩展蒸馏流水线
本文介绍了 OmniThoughtVis,这是一种可扩展的流水线,用于将多模态推理能力从大型教师模型蒸馏到更小、面向部署的多模态大语言模型(MLLMs)中。该方法利用精心策划的思维链(chain-of-thought)数据,显著提升了从2B到8B参数规模模型在 MathVerse 和 MMMU-Pro 等基准测试上的推理性能。