K12-KGraph:一个课程对齐的知识图谱,用于基准测试和训练教育大语言模型

Hugging Face Daily Papers 论文

摘要

介绍了K12-KGraph,一个从中国教科书提取的课程对齐知识图谱,以及用于评估和提升LLM在K-12教育中课程认知能力的基准测试(K12-Bench)和训练数据(K12-Train)。

大型语言模型越来越多地应用于K-12教育,但现有基准测试主要测试考试答题能力,而非理解课程知识的结构和视觉呈现方式。我们将这种能力称为课程认知,涵盖先决条件链、概念分类、实验-概念链接、教学序列和视觉定位。我们提出了K12-KGraph,一个从人民教育出版社官方教科书(涵盖小学、初中和高中的数学、物理、化学和生物)中提取的课程对齐知识图谱。它包含九种节点类型和十四种关系类型,涵盖课程结构和视觉定位。基于该图谱,我们构建了K12-Bench,一个包含23,640道多选题的基准测试,涵盖五个任务族:定位、先决条件、邻居、证据和查找。我们还构建了K12-Train,一个由7,335个样本组成的图谱引导的监督微调语料库,包括2,267个纯文本问答对和5,068个多模态VQA对。在K12-Bench上,Gemini-3-Flash仅达到57%的精确匹配率,Gemma-4-31B-IT达到46%,其中先决条件和邻居任务最为困难。我们的训练实验表明,领域特定的监督可以缩小这一差距。在匹配的2,300样本预算下,K12-Train-Text在GaokaoBench和EduEval上始终优于八个主流指令微调语料库中同等规模的子集。对于视觉语言模型,K12-Train-Full在Gaokao-MM、MDK12-medium和K12Vista上取得了所有对比训练配置中的最佳整体结果,尽管使用的样本数量少于完整的DataFlow和WizardLM基线。它还超越了纯文本和纯多模态变体,表明文本和视觉监督是互补的。我们开源了该图谱、基准测试、训练数据以及完整的构建流程。
查看原文
查看缓存全文

缓存时间: 2026/07/24 09:00

论文页面 - K12-KGraph: 一个与课程对齐的知识图谱,用于基准测试和训练教育类大语言模型

来源:https://huggingface.co/papers/2605.09635

摘要

大语言模型在K-12教育中的应用日益增多,但现有基准测试主要考察考试答题能力,而非理解课程知识的结构化组织和视觉呈现方式。我们将这种能力称为课程认知。它涵盖先修链、概念分类法、实验-概念链接、教学排序和视觉定位。我们提出K12-KGraph,一个从人民教育出版社官方教材中提取的、与课程对齐的知识图谱,覆盖小学、初中和高中的数学、物理、化学和生物学科。它包含九种节点类型和十四种关系类型,涵盖课程结构和视觉定位。基于该图谱,我们构建了K12-Bench,一个包含23,640道多选题的基准测试,涵盖五大任务族:Ground(基础定位)、Prereq(先修)、Neighbor(邻居)、Evidence(证据)和Locate(定位)。我们还构建了K12-Train,一个由7,335个样本组成的图谱引导监督微调语料库,包括2,267个纯文本问答对和5,068个多模态视觉问答对。在K12-Bench上,Gemini-3-Flash的精确匹配率仅为57%,Gemma-4-31B-IT达到46%,其中Prereq和Neighbor是最困难的任务。我们的训练实验表明,领域特定的监督可以缩小这一差距。在匹配的2,300样本预算下,K12-Train-Text在GaokaoBench和EduEval上的表现持续优于八个主流指令微调语料库的同等规模子集。对于视觉语言模型,K12-Train-Full在所有比较的训练配置中,在Gaokao-MM、MDK12-medium和K12Vista上取得了最佳总体结果,尽管使用的样本数少于完整的DataFlow和WizardLM基线。它同时超越了纯文本和纯多模态变体,表明文本和视觉监督是互补的。我们发布了图谱、基准测试、训练数据和完整的构建流水线。

查看arXiv页面 (https://arxiv.org/abs/2605.09635) 查看PDF (https://arxiv.org/pdf/2605.09635) 项目页面 (https://haolpku.github.io/K12-KGraph-page/) GitHub38 (https://github.com/haolpku/K12-Dataset) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.09635)

获取此论文至您的代理:

hf papers read 2605\.09635

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型链接此论文

在模型的README.md中引用arxiv.org/abs/2605.09635以从此页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集的README.md中引用arxiv.org/abs/2605.09635以从此页面链接。

引用此论文的空间0

无空间链接此论文

在空间的README.md中引用arxiv.org/abs/2605.09635以从此页面链接。

包含此论文的合集0

无合集包含此论文

将此论文添加到一个合集中以从此页面链接。

相似文章

BLINKG:大语言模型集成知识图谱生成的基准测试

arXiv cs.AI

BLINKG 是一个基准测试,旨在评估大语言模型(LLM)从异构数据源构建知识图谱时的映射能力。它提供了一个标准化框架,用于评估 LLM 在数据模式与本体概念之间建立对应关系的有效性。

GTBench:一个基于课程体系的图论数学研究助手大语言模型评估基准

arXiv cs.AI

论文介绍了GTBench,这是一个基于课程体系的基准,用于评估大语言模型在图论中作为数学研究助手的能力,包含63个问题,分为三个难度级别。它评估了五个前沿模型,发现性能随难度增加而下降,其中GPT-5在基础问题上近乎完美,但在研究生级别的证明上仅达到82%。

基于语言模型的知识图谱构建

arXiv cs.CL

昆明大学的综述论文调研了如何利用预训练语言模型自动化构建知识图谱,并提出了轻量级大语言模型框架LLHKG,其性能可媲美GPT-3.5。