K12-KGraph:一个课程对齐的知识图谱,用于基准测试和训练教育大语言模型
摘要
介绍了K12-KGraph,一个从中国教科书提取的课程对齐知识图谱,以及用于评估和提升LLM在K-12教育中课程认知能力的基准测试(K12-Bench)和训练数据(K12-Train)。
查看缓存全文
缓存时间: 2026/07/24 09:00
论文页面 - K12-KGraph: 一个与课程对齐的知识图谱,用于基准测试和训练教育类大语言模型
来源:https://huggingface.co/papers/2605.09635
摘要
大语言模型在K-12教育中的应用日益增多,但现有基准测试主要考察考试答题能力,而非理解课程知识的结构化组织和视觉呈现方式。我们将这种能力称为课程认知。它涵盖先修链、概念分类法、实验-概念链接、教学排序和视觉定位。我们提出K12-KGraph,一个从人民教育出版社官方教材中提取的、与课程对齐的知识图谱,覆盖小学、初中和高中的数学、物理、化学和生物学科。它包含九种节点类型和十四种关系类型,涵盖课程结构和视觉定位。基于该图谱,我们构建了K12-Bench,一个包含23,640道多选题的基准测试,涵盖五大任务族:Ground(基础定位)、Prereq(先修)、Neighbor(邻居)、Evidence(证据)和Locate(定位)。我们还构建了K12-Train,一个由7,335个样本组成的图谱引导监督微调语料库,包括2,267个纯文本问答对和5,068个多模态视觉问答对。在K12-Bench上,Gemini-3-Flash的精确匹配率仅为57%,Gemma-4-31B-IT达到46%,其中Prereq和Neighbor是最困难的任务。我们的训练实验表明,领域特定的监督可以缩小这一差距。在匹配的2,300样本预算下,K12-Train-Text在GaokaoBench和EduEval上的表现持续优于八个主流指令微调语料库的同等规模子集。对于视觉语言模型,K12-Train-Full在所有比较的训练配置中,在Gaokao-MM、MDK12-medium和K12Vista上取得了最佳总体结果,尽管使用的样本数少于完整的DataFlow和WizardLM基线。它同时超越了纯文本和纯多模态变体,表明文本和视觉监督是互补的。我们发布了图谱、基准测试、训练数据和完整的构建流水线。
查看arXiv页面 (https://arxiv.org/abs/2605.09635) 查看PDF (https://arxiv.org/pdf/2605.09635) 项目页面 (https://haolpku.github.io/K12-KGraph-page/) GitHub38 (https://github.com/haolpku/K12-Dataset) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.09635)
获取此论文至您的代理:
hf papers read 2605\.09635
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型链接此论文
在模型的README.md中引用arxiv.org/abs/2605.09635以从此页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集的README.md中引用arxiv.org/abs/2605.09635以从此页面链接。
引用此论文的空间0
无空间链接此论文
在空间的README.md中引用arxiv.org/abs/2605.09635以从此页面链接。
包含此论文的合集0
无合集包含此论文
将此论文添加到一个合集中以从此页面链接。
相似文章
增强元认知AI:基于图论的大语言模型富集的知识图谱填充
MetaKGEnrich是一个全自动流水线,使用图指标检测大语言模型应用中的知识缺口,检索网络证据,并在三个基准数据集上将答案质量提升80%-87%。
BLINKG:大语言模型集成知识图谱生成的基准测试
BLINKG 是一个基准测试,旨在评估大语言模型(LLM)从异构数据源构建知识图谱时的映射能力。它提供了一个标准化框架,用于评估 LLM 在数据模式与本体概念之间建立对应关系的有效性。
MHGraphBench:基于知识图谱的大语言模型心理健康知识基准测试
本文介绍了MHGraphBench,这是一个基于知识图谱的基准测试,用于评估大语言模型在心理健康知识方面的能力,包括实体识别、关系判断和多跳推理。对15个LLM的实验揭示了识别能力与判断能力之间存在差距。
GTBench:一个基于课程体系的图论数学研究助手大语言模型评估基准
论文介绍了GTBench,这是一个基于课程体系的基准,用于评估大语言模型在图论中作为数学研究助手的能力,包含63个问题,分为三个难度级别。它评估了五个前沿模型,发现性能随难度增加而下降,其中GPT-5在基础问题上近乎完美,但在研究生级别的证明上仅达到82%。
基于语言模型的知识图谱构建
昆明大学的综述论文调研了如何利用预训练语言模型自动化构建知识图谱,并提出了轻量级大语言模型框架LLHKG,其性能可媲美GPT-3.5。