面向多讲座教育推理的基于证据的多模态知识图谱构建

arXiv cs.AI 论文

摘要

提出了一种基于证据的多模态流水线,从讲座视频中构建富含溯源信息的知识图谱,结合ASR、OCR和视觉-语言模型,在神经网络讲座上实现了高检索准确率。

arXiv:2608.03161v1 公告类型:新 摘要:讲座视频将知识分布在语音、幻灯片文本、图表、公式和演示顺序中,仅基于转录文本的检索无法完全保留这些信息。本文提出了一种基于证据的多模态流水线,该流水线转录讲座、选择语义锚点、应用光学字符识别(OCR),并使用视觉-语言模型仅提取由转录文本、OCR或视觉证据支持的概念和类型化关系。提及内容经过验证并规范化,形成富含溯源信息的知识图谱。在三个神经网络讲座上,该流水线处理了3,118帧、756个转录片段和559个锚点。它保留了1,022个概念提及和312个关系提及,最终得到172个规范化概念和282条关系,端点覆盖率达90.38%。初步的三问题检索测试实现了100%的top-1和top-3准确率,以及100%的平均top-5召回率。其贡献在于一种可审计的构建方法,而非最先进的性能声明。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:39

# 面向多讲座教育推理的基于证据的多模态知识图谱构建

###### 摘要

讲座视频将知识分布在语音、幻灯片文本、图表、公式和演示顺序中,仅依赖转录文本的检索无法完整保留这些信息。本文提出了一种基于证据的多模态流水线:对讲座进行转录、选择语义锚点、应用光学字符识别(OCR),并使用视觉-语言模型仅提取由转录文本、OCR 或视觉证据支持的概念和类型化关系。所提取的提及项经过验证并规范化,形成一个带有完整来源信息的知识图谱。在三个神经网络讲座上,该流水线处理了 3,118 帧、756 个转录片段和 559 个锚点。它保留了 1,022 个概念提及和 312 个关系提及,最终得到 172 个规范化概念和 282 条关系,端点覆盖率达 90.38%。一项包含三个问题的初步检索测试取得了 100% 的 top-1 和 top-3 准确率,以及 100% 的平均 top-5 召回率。本文的贡献是一种可审计的构建方法,而非声称达到最先进的性能。

## I 引言

教育概念可能通过语音讲述、幻灯片书写、图表绘制、公式表示,并在多堂讲座中反复出现。学生需要整合这些信号,以连接定义、示例和先修知识。因此,自动化讲座问答需要一种能够保留概念、关系、证据和时间上下文的表示方式,而不仅仅是扁平的转录文本块。

检索增强生成(RAG)将语言模型锚定在外部上下文中,但传统的转录文本 RAG 在显式依赖关系、概念演化和视觉传达信息方面最为薄弱。知识图谱(KG)则可以表示概念节点和类型化关系边,同时保留每次提取所依据的讲座、时间戳、帧和证据引用。这种可审计性在教育中非常重要,因为得不到支持的断言可能误导学习者,而教师需要能够检查或纠正提取出的知识。

我们提出了一条端到端流水线,结合了带时间戳的自动语音识别(ASR)、高召回锚点选择、OCR、基于证据的视觉-语言提取、验证、规范化、知识图谱构建和 GraphRAG 风格的检索。设计约束很简单:只有当概念或关系与讲座证据相关联时,才会被提升进入图谱。本研究使用三个概念上相互关联的 3Blue1Brown 讲座,内容涉及神经网络、梯度下降和反向传播。

本文的贡献包括:(1) 一种多模态“讲座到知识图谱”的工作流;(2) 一个保留证据、置信度、模态、讲座、时间戳、帧和锚点标识符的提取模式;(3) 一个包含 172 个规范化概念和 282 条关系的富含来源信息的图谱;(4) 一种混合语义、词汇、模糊和证据感知的检索方法;(5) 由最终运行结果得出的可复现图表和表格。

## II 相关工作

### II-A 检索增强与图结构生成

Lewis*等人*提出了用于知识密集型自然语言处理的 RAG,并展示了基于检索文档进行条件生成的价值[1 (https://arxiv.org/html/2608.03161#bib.bib1)]。后续综述围绕索引、检索和生成阶段对快速发展的 RAG 文献进行了梳理,并一致认为幻觉和过时的内部知识是外部检索旨在解决的核心失败模式[12 (https://arxiv.org/html/2608.03161#bib.bib12)]。GraphRAG 通过引入实体、关系和社区索引,扩展了这一动机,以解决扁平块检索可能遗漏的语料级问题[2 (https://arxiv.org/html/2608.03161#bib.bib2)]。最近的工作将 GraphRAG 风格的检索推广到非文本证据:多模态 RAG 综述报告称,在文本之外,将图像、视频和其他模态的证据整合到生成过程中,相比仅文本检索能进一步减少幻觉,尤其是当视觉和文本线索共同构成回答问题的必要条件时[11 (https://arxiv.org/html/2608.03161#bib.bib11)]。我们的工作将图结构检索应用于多模态讲座,并且与大多数检索不透明篇章的 RAG 系统不同,我们为每个提取项都保留了来源证据,从而使每个答案都能追溯到具体的转录文本片段、OCR 字符串或帧。

### II-B 多模态知识图谱构建

多模态知识图谱(MMKG)将文本、图像和其他模态整合为单一结构化表示,以支持跨模态推理。Zhu*等人*综述了主要基于文本-图像对构建和补全 MMKG 的方法,并指出符号接地——将文本实体与其支持的视觉证据关联起来——是一个核心的开放问题[6 (https://arxiv.org/html/2608.03161#bib.bib6)]。此后,大型语言模型被用于自动化该流水线的部分环节。一篇关于 LLM 赋能知识图谱构建的最新综述描述了如何级联使用视觉-语言模型,在提取之前将视觉特征转换为文本,并系统梳理了由 LLM 驱动的实体融合和规范化方法,这些方法使用嵌入相似度而非手写规则来合并重复提及项[7 (https://arxiv.org/html/2608.03161#bib.bib7)]。这一策略与我们规范化阶段中使用的别名、模糊匹配和基于嵌入的合并策略在概念上相似。

视频原生的 MMKG(例如 Kuaipedia)将实体大规模关联到短视频证据,但它们是为开放领域、单片段内容而构建的,而非具有诸如 `prerequisite_of` 或 `computed_by` 等类型化教学关系的多讲座教学材料[15 (https://arxiv.org/html/2608.03161#bib.bib15)]。我们的流水线与其不同之处在于:将提取约束在一套固定的、面向教育的关系统词表内,并要求每个提及项在进入图谱之前,必须引用支持它的转录文本、OCR 或视觉证据。

### II-C 教育知识图谱

教育知识图谱(EduKG)对课程概念及其关系进行结构化组织,以支持课程设计、先修知识发现和个性化学习。一篇关于教育领域知识图谱构建与应用的系统综述发现,大多数现有的 EduKG 是基于静态、已经结构化的材料(如教科书、教学大纲或课程描述)构建的,并指出现有方法的一个开放挑战是如何直接从原始教学内容中自动构建图谱[10 (https://arxiv.org/html/2608.03161#bib.bib10)]。关于 CourseMapper 平台的研究比较了自顶向下(先本体)和自底向上(先提取)两种自动从讲座幻灯片构建 EduKG 的策略,随后报告了一条经过优化的流水线,相比最初的方法提高了概念提取准确率和处理效率[8 (https://arxiv.org/html/2608.03161#bib.bib8),9 (https://arxiv.org/html/2608.03161#bib.bib9)]。这些工作仅基于幻灯片文本或转录文本。相比之下,我们的流水线将视频帧、OCR 输出和转录片段视为同一锚点的三个同步证据来源,因此能够捕获仅靠幻灯片或转录文本的 EduKG 流水线所无法看到的、只在图表和等式中出现的内容。

### II-D 语音、视觉与文本识别组件

讲座处理依赖稳健的 ASR。Whisper 展示了大规模弱监督带来的强大泛化能力[3 (https://arxiv.org/html/2608.03161#bib.bib3)];我们使用 Faster-Whisper `large-v3`,并将每个带时间戳的片段与一个主帧对齐。为了联合解释转录文本、幻灯片文本、图表和方程,我们使用 Qwen2.5-VL[4 (https://arxiv.org/html/2608.03161#bib.bib4)],但将其置于受约束的 JSON 提取提示之下,而非作为无约束生成器使用。由于幻灯片和图表文本只有被正确读取时才有价值,OCR 充当第二个视觉证据通道。关于基于深度学习的场景文本识别的综述描述了背景杂乱、字体多样和非正面拍摄如何使该场景比扫描文档 OCR 更加困难[13 (https://arxiv.org/html/2608.03161#bib.bib13)],这与讲座视频中遇到的含噪摄像头拍摄幻灯片帧情况相符。规范化后的图谱文本使用 BGE-large English[5 (https://arxiv.org/html/2608.03161#bib.bib5)] 进行嵌入。

### II-E 视频问答

由于该图谱旨在回答讲座问题,我们的检索阶段与视频问答(VideoQA)相关。VideoQA 将视频特征化、问题特征化和联合嵌入配对,直接根据原始视频生成答案[14 (https://arxiv.org/html/2608.03161#bib.bib14)]。VideoQA 系统通常针对固定片段进行推理,没有显式的中间知识表示,因此难以针对单一概念跨多个单独录制的讲座进行证据聚合,也难以解释为什么产生某个特定答案。我们的图接地检索首先将问题解析为规范化概念及其一跳邻域,然后仅从检索到的定义、关系和证据生成答案。这使得推理过程可检查,并可在不同讲座之间复用,而不是绑定于单次视频处理过程。与从教科书或结构化材料中人工整理的教育知识图谱不同,本文提出的图谱直接从原始视频构建,同时保留了可检查的多模态来源信息。

## III 方法

### III-A 流水线与对齐

图1 (https://arxiv.org/html/2608.03161#S3.F1) 总结了工作流。视频被下载,帧以 1 帧/秒进行采样,音频被转换为 16-kHz 单声道波形。Faster-Whisper 生成带有开始时间、结束时间和文本的片段;片段中点确定其主帧。这种同步使转录文本和视觉证据能够共享一个时间邻域。

参见图注图 1:基于证据的多模态知识图谱构建流水线。

### III-B 语义锚点与 OCR

对每一帧都运行视觉-语言模型(VLM)既昂贵又冗余。一个面向召回的选择器结合了视觉变化、转录关键词、关系线索和首提分数。其目标是约 18% 的帧,并通过时间间隔抑制近似重复。每个锚点获得从其时间戳前 15 秒至后 22 秒的转录上下文。EasyOCR 处理锚点帧,并提供可能未被语音提及的幻灯片标签、图表注释、符号和方程。

### III-C 接地提取与验证

对于每个锚点,Qwen2.5-VL 接收帧、转录窗口、OCR 文本以及局部派生的候选术语。它返回严格 JSON 格式的概念和关系数组;允许空数组。一个概念记录名称、定义、证据引用、来源模态和置信度。一条关系记录源概念、目标概念、八种允许类型之一(`prerequisite_of`、`component_of`、`uses`、`optimizes`、`computed_by`、`example_of`、`contrasts_with` 或 `related_to`)、证据引用、来源模态和置信度。

验证步骤会移除缺失或低信息量字段、不支持的证据、无效关系类型以及置信度低于 0.55 的条目。来自转录文本和 OCR 的断言必须出现在证据池中;仅视觉概念需要更强的置信度。验证提高了可审计性,但本身并不保证事实正确性。

### III-D 规范化与图谱构建

经过验证的提及项通过别名、归一化和模糊字符串匹配、词元重叠以及嵌入相似度进行合并。每个规范化节点保留其标识符、显示名称、别名、定义、提及项列表、讲座覆盖情况、证据计数和平均置信度。关系端点仅在概念去重之后进行映射;这个顺序防止当原始端点名称与规范化名称不同时,本来有效的边被丢失。

结果是一个 NetworkX `MultiDiGraph`。节点是规范化概念,边是类型化的关系实例。边元数据包括关系类型、讲座、时间戳、锚点、证据引用和置信度。当不同证据支持同一对节点之间的多条关系实例时,允许存在多个边实例。

### III-E 图接地检索与问答

规范化概念文本结合了名称、定义、别名和证据片段,并使用 BGE-large English 进行嵌入。检索分数结合了语义相似度、精确名称和别名匹配、模糊相似度以及证据计数先验。前六个概念被扩展为一个一跳子图。答案提示仅接收格式化的定义、关系和证据,并在可用时要求提供讲座标识符和时间戳。

## IV 实验设置

### IV-A 数据集与配置

评估涵盖三个关于神经网络、梯度下降和反向传播的讲座。表 I (https://arxiv.org/html/2608.03161#S4.T1) 报告了处理和 OCR 覆盖情况;图 2 (https://arxiv.org/html/2608.03161#S4.F2) 可视化了每个讲座的数据量。本次运行使用了 Faster-Whisper `large-v3`、EasyOCR、Qwen2.5-VL-7B-Instruct、BGE-large-en-v1.5 嵌入、1 帧/秒采样、18% 锚点目标以及 0.55 的最小概念和关系置信度。

表 I:数据集、锚点与 OCR 汇总

参见图注图 2:每个讲座的帧数、转录片段数、锚点数和 OCR 数量。

表 II:模型与处理配置

总体锚点率和非空 OCR 率分别为 17.93% 和 94.63%。报告的指标涵盖帧、转录、锚点、OCR、原始和验证后提及项、规范化节点、图谱边、端点覆盖率、证据密度和检索。检索仅使用三个种子问题,是一次健全性检查,而非最终基准。

## V 结果

### V-A 提取产量

VLM 返回了 1,155 个原始概念提及和 400 个原始关系提及。证据和置信度检查保留了 1,022 个概念(88.48%)和 312 条关系(78.00%)。规范化产生了 172 个概念,端点映射保留了 282 条边(占验证后关系的 90.38%),如表 III (https://arxiv.org/html/2608.03161#S5.T3) 和图 3 (https://arxiv.org/html/2608.03161#S5.F3) 所总结。从 1,022 个提及项减少到 172 个节点是符合预期的,因为课程概念在多个锚点和讲座中反复出现。

表 III:提取和图谱构建产量

参见图注图 3:从原始提及项到验证后及规范化图谱项的产量。

### V-B 知识图谱统计

图谱包含 172 个规范化概念和 282 条关系,每个概念平均有 5.94 条证据提及。图 4 (https://arxiv.org/html/2608.03161#S5.F4) 显示了构建出的图谱。规范化概念表示为节点,提取出的类型化关系表示为边。密集簇表示在多个讲座和锚点中反复出现的神经网络概念,而外围节点表示低频或局部化的证据。

表 IV:图谱和启动检索摘要

参见图注图 4:构建出的教育知识图谱。

### V-C 概念证据与检索

核心训练概念主导了证据分布。表 V (https://arxiv.org/html/2608.03161#S5.T5) 列出了出现频率最高的 15 个节点,图 5 (https://arxiv.org/html/2608.03161#S5.F5) 提供了相应的可视化。剩余的单数/复数变体揭示了保守但不完整的实体解析。

表 V:证据最多的规范化概念

参见图注图 5:拥有最多证据支持提及的概念。

所有三个种子问题都将目标概念排在第一位,并且都在前三名之内,平均 top-5 召回率为 1.00(表 VI (https://arxiv.org/html/2608.03161#S5.T6))。图 7 (https://a

相似文章