Slide Deck Q&A 质量保证应用:面向教学问题的多阶段生成流水线

arXiv cs.CL 论文

摘要

本文介绍了 slidesqaqa,这是一个基于 Flask 的软件系统,能从 PDF 幻灯片中生成富有教学价值的问题。该系统采用四阶段大语言模型流水线,依次进行文本和图像提取、全幻灯片范围内的问题规划、幻灯片标注以及输出整合,在技术讲座幻灯片上展示了高保真的问题生成能力。

arXiv:2605.26428v1 公告类型:新提交 摘要:从讲座幻灯片中生成高质量、富有教学价值的问题十分困难,因为重要的教学内容同时分布在文本和视觉元素中,而且有用的问题必须沿着演示的流程进行搭建,而非孤立地逐张幻灯片生成。本文描述了 Slide Deck Q&A 质量保证(slidesqaqa),一个基于 Flask 的软件系统,它从 PDF 幻灯片中提取文本和渲染图像,并通过四阶段大语言模型流水线进行处理:窗口规划、幻灯片组综合、幻灯片标注和整合。该系统联合推理幻灯片的模态和教学角色,分配有限的问题预算,并在幻灯片组层面修订草稿标注以减少冗余并提高覆盖率。最终输出是一个结构化的 JSON 标注,包含幻灯片组级别目标、章节结构、单张幻灯片摘要、问题集和评估分数。在两个技术讲座幻灯片组上的初步实验表明,该流水线能够过滤非教学幻灯片,并为视觉复杂的内容生成高保真、教学连贯的问题。 工作系统位于 https://slidesqaqa-974767694043.us-west1.run.app 软件仓库位于 https://github.com/blinding2submit/slidesqaqa
查看原文
查看缓存全文

缓存时间: 2026/05/27 09:04

# 引言
来源:https://arxiv.org/html/2605.26428
幻灯片问答质量保证应用:面向教学问题生成的多阶段流水线

###### 摘要

从讲座幻灯片中生成高质量、具有教学意义的问题十分困难,因为重要的教学内容分布在文本和视觉元素两者之上,且有用的问题必须沿着演示流程逐级搭建,而非孤立地逐张幻灯片生成。本文介绍了 Slide Deck Q&A Quality Assurance (slidesqaqa),一个基于 Flask 的软件系统,该系统从 PDF 幻灯片中提取文本和渲染图像,并通过一个包含窗口规划、幻灯片组综合、幻灯片标注和协调四个阶段的大型语言模型流水线进行处理。该系统联合推理幻灯片模态和教学角色,分配有界的问题预算,并在幻灯片组层级修订草稿标注以减少冗余并提高覆盖率。最终输出是一个结构化的 JSON 标注,包含幻灯片组级别目标、章节结构、幻灯片级别摘要、问题集和评估分数。在两个技术讲座幻灯片组上的初步实验表明,该流水线能够过滤掉非教学幻灯片,并为视觉复杂的内容生成高保真度、教学连贯的问题。

可运行的系统位于:https://slidesqaqa-974767694043.us-west1.run.app/

软件仓库位于:https://github.com/jsalsman/slidesqaqa

关键词:自动问题生成,大型语言模型,多模态学习,文档理解,教育技术,幻灯片组

教育工作者经常依赖演示幻灯片作为传递教学内容的主要媒介,然而为每张幻灯片创建有针对性、高保真度的理解问题需要大量人工努力和教学专业知识。虽然已经探索了自动问题生成方法来减轻这一负担,但它们常常难以应对现代演示文稿固有的多模态特性——信息分布在文本、图像和图表中——并受限于底层模型的上下文窗口。开发稳健的自动化系统至关重要,因为已知高质量的教学问题能显著增强主动学习、学生参与度和长期记忆。构成许多早期自动化工具基础的標準生成文本模型,通常难以解释视觉信息——如图表、图形或复杂图表——而这些信息承载了当代幻灯片中大部分的语义重量。

为了应对这些挑战,我们提出了 slidesqaqa,一个新颖的软件系统,旨在自动化提取和生成过程。slidesqaqa 以 PDF 演示文稿为输入,将每张幻灯片渲染为视觉缩略图,提取相应的原始文本,并精心协调一个复杂的四阶段大型语言模型 (LLM) 工作流,包括窗口规划、幻灯片组综合、幻灯片标注和协调。该系统最终输出一个全面的、分层 JSON 结构,详细说明幻灯片组的主题、分类幻灯片角色、定义具体学习目标,并提供有界、上下文感知的理解问题。

本文的主要贡献有三方面:首先,我们引入了一种窗口化的幻灯片组规划方法,专门设计用于减轻 LLM 上下文限制,同时保留演示文稿的关键叙事流;其次,我们提出了静态启发式方法,根据检测到的每张幻灯片模态动态平衡问题预算;第三,我们详细描述了一个多遍生成架构,该架构最终通过一个专门的协调步骤来确保一致性和质量。本文的其余部分结构如下:我们首先回顾自动问题生成和多模态分析的相关工作,然后概述系统的目标和高级架构,接着详细描述其使用 Flask 和 PyMuPDF 的具体实现,并讨论用于推理的方法。最后,我们讨论未来评估的途径并承认当前系统的局限性。

### 相关工作

传统的自动问题生成 (AQG) 主要侧重于基于文本的输入,使用 NLP 技术将陈述句转化为教育问题,建立评估覆盖范围和教学效用的基础指标 (Kurdi 等,2020 (https://arxiv.org/html/2605.26428#bib.bib3);Gorgun 和 Bulut,2024 (https://arxiv.org/html/2605.26428#bib.bib1))。然而,现代教学材料,尤其是幻灯片组,本质上是多模态的。

从这些视觉和文本模态中提取信息的任务与视觉问答 (VQA) 密切相关 (Kim 等,2025 (https://arxiv.org/html/2605.26428#bib.bib2))。最近多模态大型语言模型 (MLLM) 的出现提供了一个强大的基线架构,能够处理交错文本和图像输入 (Yin 等,2024 (https://arxiv.org/html/2605.26428#bib.bib5))。然而,将标准 MLLM 或朴素纯文本流水线应用于幻灯片组往往会导致性能不佳。研究表明,视觉语言模型 (VLM) 可能在细粒度证据基础和模态依赖方面存在困难,尤其是在解释涉及图表、图形和公式的复杂布局时 (Sim 等,2025 (https://arxiv.org/html/2605.26428#bib.bib4))。

此外,现有系统常常以单个大块或不相连的页面处理文档,忽略结构流程并依赖脆弱的 OCR。这种方法丢失了叙事连贯性,未能捕捉对于有效的视觉丰富文档检索至关重要的布局相关语义 (Zhang,2025 (https://arxiv.org/html/2605.26428#bib.bib6))。slidesqaqa 通过将渲染的缩略图拼接成多张幻灯片联系表,使用滑动窗口分块策略保留过渡上下文,并通过实现动态协调阶段来平衡异构幻灯片类型间的问题预算,从而弥补了这些差距。

### 研究问题

本研究旨在回答以下关于从多模态幻灯片组自动生成教育问题的研究问题:

- • RQ1:与朴素逐幻灯片生成相比,多阶段重叠窗口流水线在多大程度上改善了生成问题的教学搭建?
- • RQ2:明确考虑幻灯片模态和角色如何影响所得问题集的保真度(基础性)和覆盖率?
- • RQ3:静态启发式方法结合动态协调阶段能否有效平衡异构幻灯片类型间的问题预算而无需人工干预?

## 方法

### 系统概述

slidesqaqa 的高级架构被构建为一个稳健的、单服务器 Python Flask 应用程序,作为协调文档处理和复杂模型交互的中心枢纽。其核心,系统依赖 PyMuPDF 进行高保真文档提取,精心提取上传演示文稿的结构组件和文本内容。为了生成语义洞察和教学问题,该应用程序与 Google GenAI SDK 紧密集成,提供有效处理多模态输入所需的推理能力。

该架构由三个紧密耦合的主要组件组成,每个组件在流水线中扮演关键角色。**预处理器**充当初始摄入层;它直接读取上传的 PDF 文档,系统性地提取所有可用的原生文本,同时渲染每张幻灯片的高分辨率 PNG 图像以捕获其视觉布局。提取之后,**LLM 流水线引擎**接手,作为系统的编排器。它管理四个不同的、顺序生成阶段的执行——窗口规划、幻灯片组综合、幻灯片标注和协调——同时严格执行所有输出符合强类型 JSON 模式,确保数据完整性。最后,**前端 UI** 提供用户界面;它是一个嵌入式 HTML 和 JavaScript 页面,设计用作实时日志查看器,提供生成过程的透明度,以及最终输出的动态数据可视化器。

通过 slidesqaqa 系统的典型数据流(如图 1 (https://arxiv.org/html/2605.26428#Sx2.F1) 所示)是线性且高度结构化的。该过程始于用户上传 PDF 文档,这立即触发由预处理器处理的文本和图像提取阶段。提取的数据随后被输入窗口规划阶段,在此形成初始上下文窗口。随后是综合与启发式方法阶段,在此推断整个幻灯片组的结构并分配问题预算。流水线然后进入幻灯片标注阶段,根据之前的分析生成实际的教学问题。协调阶段随后审查并细化这些标注,以确保一致性并遵守分配的预算。最终,细化的数据经过最终 JSON 编译,将结果组装成一个统一的结构,通过前端 UI 无缝地流式传输回客户端。

### 设计与架构

预处理器依赖 `fitz` 库(PyMuPDF)来提取原生文本并渲染代表每张幻灯片视觉布局的缩放 PNG 图像。

用户上传 PDF 或提供 URL
1. PDF 预处理
   提取文本 & 渲染 PNG
2. 窗口规划阶段
   将幻灯片分块成重叠窗口
   LLM 推断角色和预算
3. 幻灯片组综合阶段
   合并窗口规划
   推断幻灯片组级别主题和目标
   应用静态启发式方法
   清零完全重复的及标题幻灯片
4. 幻灯片标注阶段
   为符合条件的幻灯片生成问题
   使用幻灯片和幻灯片组上下文
5. 协调阶段
   评估覆盖率/搭建
   调整预算和行动
   行动需要重写/扩展/减少?
   重新运行标注
   生成调整后的问题
   编译最终 JSON 标注
   将 JSON 流式传输至客户端

图 1:slidesqaqa 应用程序的概念性 LLM 流水线数据流。

LLM 生成流水线进行四次主要遍历:1. **窗口规划器**:分析幻灯片的重叠窗口,创建联系表图像以推断标题、摘要、模态、角色和暂定问题预算。2. **幻灯片组综合**:将窗口分析合并成一个连贯的幻灯片组计划。3. **幻灯片标注器**:根据幻灯片组计划分析需要问题的单张幻灯片,生成具体问题。4. **协调**:评估临时完整幻灯片组标注的冗余和不平衡覆盖。

核心数据结构使用 Pydantic 模型(`SlidePlan`,`SlideAnnotationModel`,`ReconciliationModel`)严格类型化。后端依赖带有流式端点的 Flask,前端使用原生 JavaScript。

### 实验设置

为了评估该系统,我们分析了专注于复杂主题(如自然语言处理和深度学习)的学术讲座幻灯片组。具体来说,我们使用了两个综合性幻灯片组:“Self-Attention and Transformers”(cs224n-2024-lecture08-transformers)¹¹² 和 “Neural Constituency Parsing”(cs288-sp23-neural-parsing)²²²。选择这些幻灯片组是因为它们既突出展示了结构性幻灯片(例如标题、议程),也包含了高度复杂、机制密集、依赖复杂图表的幻灯片(例如 LSTM 双向路由、均值池化聚合、跨度分类)。

我们从多阶段流水线日志中得出的三个关键指标来评估生成的问题集:**覆盖率**(与幻灯片内容和学习目标的一致性)、**保真度**(在视觉和文本证据上的准确性和基础性)、以及 **搭建**(问题在整组幻灯片上下文中的逻辑推进和教学相关性)。系统在生成过程中自动在 1-5 分范围内评估这些指标,总结于表 1 (https://arxiv.org/html/2605.26428#Sx2.T1)。

表 1:跨评估幻灯片组的实验结果定性总结。

## 结果

多阶段流水线可靠地过滤了结构性幻灯片,并将生成工作集中在核心教学材料上。例如,在“Self-Attention and Transformers”幻灯片组中,协调阶段正确地清零了行政和过渡幻灯片,减少了整体问题负荷,同时保持了叙事连贯性。在生成问题时,系统获得了较高的定量评分:在两个讲座幻灯片组中,问题始终获得保真度 5 分和覆盖率 4 到 5 分。搭建分数也保持较高(通常为 3 到 5 分),表明生成的项目作为扎实的基础检查点并逻辑渐进。

在定性方面,slidesqaqa 流水线成功解释了复杂的多模态图表。例如,在一张将均值池化作为通往注意力的概念踏脚石的幻灯片中,系统生成了一个询问“句子编码”如何计算的问题,正确识别答案为“取所有隐藏状态的逐元素最大值或平均值”(保真度:5,覆盖率:5)。类似地,在“Neural Constituency Parsing”幻灯片组中,当解释 LSTM 单元的视觉图表时,系统正确生成了关于双向路由如何工作的问题,准确引用“在框之间指向左和右的水平箭头”作为跨序列收集上下文的证据(保真度:5)。

## 讨论

实验结果有力地支持了如下假设:一个多阶段、布局感知的流水线对于从幻灯片组生成高质量教学问题是必要的。高保真度和覆盖率得分证明了窗口规划器和协调阶段的价值。slidesqaqa 识别并减少冗余或过渡幻灯片上问题预算的能力,直接解决了现有将所有幻灯片一视同仁的朴素 AQG 工具的一个主要局限性。

该系统的主要优势在于其对多模态信息的稳健处理。系统能够成功识别视觉线索,例如“水平箭头”,并将其映射到复杂的架构概念,如神经网络中的双向上下文收集。然而,我们也承认一些局限性。处理大型幻灯片组因多遍架构而产生了显著的 LLM 推理延迟和 API 成本。此外,对特定专有 LLM(Gemini)的依赖带来了关于可重复性和长期稳定性的潜在风险,如果底层 API 模型被更新或弃用。

## 结论

slidesqaqa 展示了一种复杂的自动多模态问题生成方法,将教学内容提取构建成一个有弹性的四阶段流水线。将幻灯片分块成视觉联系表并严格使用类型验证的 LLM 生成,显著提高了结构和教学分析的质量。未来的工作可能包括与人工编写问题集的全面评估、延迟优化,以及探索针对窗口规划阶段进行微调的较小模型。

## 披露

本研究未收到任何外部资助。作者声明无利益冲突。本研究中使用的数据为讲座幻灯片组。支持本文结论的数据集可在 https://pastebin.com/raw/5G0s2r2p 和 https://pastebin.com/raw/m15KdeVG 获取。作者在撰写本文时是……

相似文章

DeepSlide:从幻灯片制品到演讲交付

arXiv cs.AI

DeepSlide 是一个人机协同的多智能体系统,覆盖完整的演示流程,从需求获取、带时间预算的叙事规划,到基于证据的幻灯片-脚本生成以及排练支持。它引入了一个双记分板基准,将静态制品质量与动态交付卓越性清晰分离,并在叙事流畅性、节奏精准度和幻灯片-脚本协同方面取得了显著提升。

X+Slides:面向受众条件的幻灯片生成基准测试

arXiv cs.AI

X+Slides是一个新的基准,用于评估从源文档生成面向受众条件的幻灯片,它使用源基础探针和受众特定的效用权重。在DeepPresenter、SlideTailor和NotebookLM上的实验表明,当前系统能够恢复大量但不够完整的受众关键信息。

ArcDeck:叙事驱动的论文到幻灯片生成

Hugging Face Daily Papers

ArcDeck 是一个多智能体框架,通过话语树和迭代智能体优化来建模逻辑流程,从而从学术论文生成演示幻灯片,性能优于直接摘要方法。该论文还引入了 ArcBench,这是一个新的基准测试,用于评估论文到幻灯片生成,强调叙事连贯性和逻辑结构。