DeepSlide:从幻灯片制品到演讲交付
摘要
DeepSlide 是一个人机协同的多智能体系统,覆盖完整的演示流程,从需求获取、带时间预算的叙事规划,到基于证据的幻灯片-脚本生成以及排练支持。它引入了一个双记分板基准,将静态制品质量与动态交付卓越性清晰分离,并在叙事流畅性、节奏精准度和幻灯片-脚本协同方面取得了显著提升。
arXiv:2605.15202v1 公告类型:新版
摘要:演示是学术交流的主要媒介,然而大多数AI幻灯片生成器优化的是制品(视觉上合理的幻灯片组),却忽略了交付过程(节奏、叙事和演示准备)。我们提出了DeepSlide,一个人机协同的多智能体系统,支持完整的演示流程准备,包括需求获取、带时间预算的叙事规划、基于证据的幻灯片-脚本生成、注意力增强以及排练支持。DeepSlide集成了(i)带节点时间预算的可控逻辑链规划器,(ii)用于依据检索的轻量级内容树检索器,(iii)带风格继承的马尔可夫式序列渲染,以及(iv)确保可渲染性的沙盒执行与最小修复。我们进一步引入了一个双记分板基准,将静态制品质量与动态交付卓越性清晰分离。在20个领域和多种观众画像下,DeepSlide在制品质量上与强基线模型持平,同时在交付指标上持续获得更大增益,改善了叙事流畅性、节奏精准度、幻灯片-脚本协同以及更清晰的注意力引导。
查看缓存全文
缓存时间: 2026/05/18 06:30
# DeepSlide:从素材到演讲交付
**来源:** https://arxiv.org/html/2605.15202
**作者:** 杨铭,张志伟,李嘉航,刘浩森,蔡宇铮,郑卫国
**机构:** 复旦大学数据科学学院,上海,中国
**邮箱:** {yangm24, zwzhang25, jiahangli25, hsliu23, yuzhengcai21}@m.fudan.edu.cn, [email protected]
###### 摘要
演示文稿是学术交流的主要媒介,然而大多数AI幻灯片生成器优化的是**产物**(视觉上合理的幻灯片组),而未能充分优化**交付过程**(节奏、叙事和演讲准备)。我们提出了**DeepSlide**,一个人在环中的多智能体系统,支持准备完整的演示流程,从需求获取和时间预算驱动的叙事规划,到基于证据的幻灯片-脚本生成、注意力增强和排练支持。DeepSlide集成了(i)一个可控的逻辑链规划器,具有每个节点的时间预算;(ii)一个轻量级的内容树检索器用于依据获取;(iii)马尔可夫风格的顺序渲染与样式继承;(iv)沙箱执行与最小修复以确保可渲染性。我们进一步引入了一个双积分板基准,清晰地将静态产物质量与动态交付卓越性区分开来。在20个领域和多样化的受众画像中,DeepSlide在产物质量上与强基线模型持平,同时在交付指标上持续获得更大提升,改善了叙事流畅性、节奏精确性以及幻灯片-脚本协同性,并提供了更清晰的注意力引导。
请参见图注
**图1:** 在20个领域上的主要实验(左侧为交付积分板,右侧为产物积分板)。
## 1 引言
演示文稿是交流信息和想法的主要媒介,在学术交流中扮演着核心角色[17 (https://arxiv.org/html/2605.15202#bib.bib8)]。发表高质量的演讲通常不仅需要精心设计的幻灯片组,还需要连贯、节奏得当、与幻灯片对齐的叙事,以及大量的准备工作(例如,排练和规划与观众的互动)[2 (https://arxiv.org/html/2605.15202#bib.bib16)]。因此,准备演讲仍然耗时费力,涵盖内容创作和交付准备两个方面。
大型语言模型(LLMs)和多模态模型的最新进展已开始减轻这一负担[9 (https://arxiv.org/html/2605.15202#bib.bib11),23 (https://arxiv.org/html/2605.15202#bib.bib13),29 (https://arxiv.org/html/2605.15202#bib.bib15)],它们提升了文档理解和信息提取能力,并实现了越来越可靠的多模态合成。利用这些模型能力,智能体系统能够处理源材料、合成文本和视觉内容,并通过结构化决策(如大纲制定、重点强调、节奏控制)编排多步骤工作流。与此同时,LangChain[19 (https://arxiv.org/html/2605.15202#bib.bib17)]、AutoGPT[36 (https://arxiv.org/html/2605.15202#bib.bib19)]、AutoGen[28 (https://arxiv.org/html/2605.15202#bib.bib20)]、CAMEL[21 (https://arxiv.org/html/2605.15202#bib.bib21)]和MetaGPT[15 (https://arxiv.org/html/2605.15202#bib.bib22)]等工程框架进一步降低了工具使用和多智能体协调的实现成本。这些进步共同使得演示智能体变得实用且可产品化,例如Manus[24 (https://arxiv.org/html/2605.15202#bib.bib23)]、Gamma[8 (https://arxiv.org/html/2605.15202#bib.bib24)]、NotebookLM[12 (https://arxiv.org/html/2605.15202#bib.bib25)]、Qwen[34 (https://arxiv.org/html/2605.15202#bib.bib28)]、Coze[5 (https://arxiv.org/html/2605.15202#bib.bib27)]以及开源项目PPTAgent[41 (https://arxiv.org/html/2605.15202#bib.bib6)]。
这些系统已经能够快速生成视觉精美的幻灯片组,通常还支持编辑和优化。然而,先前的研究(例如[25 (https://arxiv.org/html/2605.15202#bib.bib1)])以及实际观察表明,一个好的演示不应该主要由材料在视觉上有多吸引人来定义。相反,它取决于信息是否以符合观众认知和注意力约束的方式被组织和交付——清晰的条理、适当的干扰控制,以及对观众注意力的持续引导。因此,即使这些系统能够生成精美且可编辑的幻灯片组,单凭产物质量也不足以等同于高质量的演示[17 (https://arxiv.org/html/2605.15202#bib.bib8)]。有效的演示交付是一个以人为中心的沟通问题,而不仅仅是幻灯片设计问题。
我们总结了现有幻灯片智能体的三个关键差距:
(1) **缺少叙事策略选择。** 大多数系统要么跳过显式的叙事规划,要么输出单一、通用的提纲,这些提纲通常是不可编辑且个性化不足的。更关键的是,它们很少将**叙事策略**视为一个可控的设计空间:用户无法选择多种叙事风格(例如,怀疑到信服的劝说、破解迷思的重新框架、权衡导航、或侦探式的消融揭示),也未被指导如何相应地分配时间预算来突出重点(哪些部分详述,哪些压缩)。
(2) **有限的交付时注意力策略。** 现有智能体主要交付静态的幻灯片组;对于长篇逻辑论证、复杂的实验结果或细节密集的图表,它们通常缺乏内容感知的机制来在交付过程中引导注意力(例如,逐步揭示、聚焦/缩放提示和定制化的视觉编码)。尽管某些智能体(如Qwen[34 (https://arxiv.org/html/2605.15202#bib.bib28)]、Coze[5 (https://arxiv.org/html/2605.15202#bib.bib27)])能够生成思维导图或数据可视化,但这些输出通常是静态的、模板驱动的,提供的**交付时**注意力引导有限,未能针对实际幻灯片内容进行调整;预定义的动画或基于模板的高亮(如果可用)也往往缺乏足够的内容感知能力,无法将注意力策略适应到密集的图表和复杂的结果上。
(3) **排练支持不足。** 大多数方法止步于生成幻灯片,对排练和交付准备的支持有限(例如,生成良好对齐、无冗余的脚本,预测现场可能出现的状况,并提供练习中的反馈),使得用户自行设计叙述、规划互动和进行排练。
总的来说,当前的幻灯片智能体主要降低了幻灯片组创作的代价,但并未完全减轻端到端的演示准备工作负载。
请参见图注
**图2:** 现有方法的局限性以及DeepSlide。
为了解决这些差距,我们提出了**DeepSlide**,一个四阶段(图3 (https://arxiv.org/html/2605.15202#S2.F3))的端到端演示智能体,它优化的是完整的演示交付,而不仅仅是静态材料。首先,它不生成通用、固定的提纲,而是通过自由形式的对话获取面向受众、时间和目标的特定需求,并生成多个带有时间预算的叙事逻辑链候选方案,使用户能够在幻灯片生成之前根据目标受众选择和优化合适的叙事策略。其次,它支持在**叙事节点级别**进行逻辑链编辑——用户可以重新排序/插入/删除/修改节点,调整每个节点的时间预算,并添加非线性的交叉引用——这样演讲者就能显式地控制宏观故事线和重点分配计划;每个节点在生成过程中可以被扩展为一页或多页幻灯片。一旦逻辑链确定,DeepSlide会从已索引的源材料中检索支持证据,为每个叙事节点的后续幻灯片生成提供依据。第三,为了更好地在交付过程中维持观众注意力,DeepSlide用内容感知、可选择的注意力控制工具(例如,基于叙事意图的图表缩放、表格到可视化的转换、以及文本到图表的具象化)来增强静态幻灯片组,同时提供交互式优化和一键布局调整。第四,它超越了幻灯片组的交付,还协同生成与叙事节点对齐的同步、非冗余的演讲者脚本,支持从观众视角进行排练(可选择音频),并提供带有可行修订建议的评估和基于幻灯片的模拟提问。这些设计共同降低了端到端的准备工作量:让演讲者锁定高层决策(叙事骨架、节奏/重点、以及面向受众的风格意图),而由DeepSlide处理基于证据的实现、交付时的注意力增强和排练时的反馈。
当前的基准[1 (https://arxiv.org/html/2605.15202#bib.bib4),41 (https://arxiv.org/html/2605.15202#bib.bib6),37 (https://arxiv.org/html/2605.15202#bib.bib7),4 (https://arxiv.org/html/2605.15202#bib.bib37),39 (https://arxiv.org/html/2605.15202#bib.bib41),31 (https://arxiv.org/html/2605.15202#bib.bib9),16 (https://arxiv.org/html/2605.15202#bib.bib39)]主要评估的是**幻灯片产物**本身,而侧重于交付的质量则未被充分衡量。因此,我们用包含**产物积分板**和**交付积分板**的**双积分板**基准来扩展传统的静态幻灯片评估。前者与以往实践一致,评估生成的幻灯片材料的质量;后者则评估交付导向的质量,包括叙事连贯性、节奏控制和观众注意力引导。
##### 贡献
总之,我们做出了以下贡献:
- • 我们提出了**DeepSlide**,一个四阶段、人在环中的多智能体系统,用于可交付的演示准备。
- • 我们引入了一个双积分板基准,将产物质量与交付质量分离开来,实现超越静态幻灯片的评估。
- • 我们开发了轻量级但原则性的机制,用于可控和可靠的生成,包括用于依据获取的树感知检索、带有节奏反馈的时间预算逻辑链编辑、马尔可夫风格的顺序渲染与样式继承,以及用于鲁棒渲染的浏览器沙箱验证。
- • 在20个研究领域和5种观众画像上的广泛评估表明,DeepSlide在产物积分板上与强基线模型持平,同时在交付积分板上显著提升,减少了准备开销和演讲者的现场负担。
## 2 DeepSlide
请参见图注
**图3:** 概览。*阶段1:* 需求获取和叙事提案;*阶段2:* 逻辑链编辑和基于证据的生成;*阶段3:* 交互式幻灯片优化和注意力导向增强;*阶段4:* 排练和双积分板评估。阶段3中的效果:请参见图注 图像聚焦,请参见图注 文本到图表,请参见图注 关键点,请参见图注 数据可视化,请参见图注 动态效果,请参见图注 背景,请参见图注 自动布局(以Qwen3.5[33 (https://arxiv.org/html/2605.15202#bib.bib18)]为例)。
### 2.1 概述
DeepSlide支持多种格式的多源输入,并针对完整的交付过程进行优化。材料上传后,它执行一个四阶段的流水线。
##### 阶段1:需求获取和叙事提案。
DeepSlide进行自由对话(文本或语音)以获取演示需求,包括目标受众、总时长、重点强调和偏好风格,同时为源材料构建一个轻量级的**内容树索引**,用于后续的证据检索。然后,它生成四个带有时间预算的**叙事逻辑链**候选方案,每个方案以平衡的方式分配总时长。
##### 阶段2:逻辑链编辑和基于证据的生成。
逻辑链是一个有序的叙事节点序列,概括了演讲的进程。DeepSlide支持逻辑链编辑(重新排序/插入/删除/修改节点,并调整时长)和**非线性叙事增强**,通过创建交叉引用来连接前后节点。一旦确定,系统遵循逻辑链,从内容树索引中检索支持证据块,并生成面向受众、时间一致的幻灯片以及对齐的同步脚本,两者设计为保持主题专注同时最小化冗余。
##### 阶段3:交互式幻灯片优化和注意力导向增强。
用户可以通过对话或语音优化幻灯片和脚本,并即时预览。DeepSlide提供一键布局/排版优化和多个可自由选择的AI工具用于交付时的**注意力控制**:它根据叙事意图识别复杂图表中的相应区域并自动放大;将静态表格转换为交互式可视化;将冗长文本转换为图表以提高可读性并降低认知负荷。它还支持文本关键点、动画,以及通过从对话语音中提取演讲者声音并使用TTS模型[42 (https://arxiv.org/html/2605.15202#bib.bib29)]合成叙述的音频预览。
##### 阶段4:排练和双积分板评估。
DeepSlide支持从观众视角进行排练(可选择排练音频)。它还提供双积分板评估,评估产物质量和交付质量,并根据评估结果、源材料和用户需求计算分数和提供修订建议。为了进一步减轻准备负担,它可以模拟可能的观众提问。最后,DeepSlide支持一键打包/导出。
### 2.2 阶段1:需求获取和叙事提案
请参见图注
**图4:** 需求获取和叙事提案(阶段1)。
本阶段将用户的演示意图与论文内容对齐,并在时间预算下,提出候选的叙事模式作为幻灯片生成的稳定骨架。在系统提示约束的引导下,智能体获取关键需求(受众、时长、重点和风格),并使用论文感知的追问,通过多轮对话收敛到一个完整的演示蓝图。对话产生两个产物:内容树和一组候选逻辑链,如图4 (https://arxiv.org/html/2605.15202#S2.F4)所示。
##### 内容树。
在每一步生成时都将完整论文传递给LLM,既浪费token又不精确:大块无差别的文本引入不相关的上下文,降低生成质量。向量数据库流水线可以避免这个问题,但对于单文档解析来说过于沉重。内容树占据中间地带:它是一个直接从源材料构建的、带类型的层次化索引,无需嵌入或近似搜索基础设施即可实现目标检索。构建过程分三个步骤。
**(i) 源材料规范化。** 混合上传的文件(LaTeX、Markdown、Word、PDF或嵌套压缩包)通过pandoc统一转换为LaTeX;定位根文件,并将所有`\input`/`\include`指令递归地展开为单一的流。
**(ii) 无损分段。** 结构性标题将流划分为带类型的片段;产物片段(类型∈{equation, figure, table, theorem, algorithm})从不与相邻文本合并,保持其作为原子检索单元的身份。每个片段被分配一个LLM生成的**摘要**,总结其自身内容。
**(iii) 层次化索引构建。** 每个片段成为一个ContentTreeNode ⟨id, title, level, type, abstract, content⟩,其中level遵循文档层次结构(l=1相似文章
ArcDeck:叙事驱动的论文到幻灯片生成
ArcDeck 是一个多智能体框架,通过话语树和迭代智能体优化来建模逻辑流程,从而从学术论文生成演示幻灯片,性能优于直接摘要方法。该论文还引入了 ArcBench,这是一个新的基准测试,用于评估论文到幻灯片生成,强调叙事连贯性和逻辑结构。
X+Slides:面向受众条件的幻灯片生成基准测试
X+Slides是一个新的基准,用于评估从源文档生成面向受众条件的幻灯片,它使用源基础探针和受众特定的效用权重。在DeepPresenter、SlideTailor和NotebookLM上的实验表明,当前系统能够恢复大量但不够完整的受众关键信息。
Slide Deck Q&A 质量保证应用:面向教学问题的多阶段生成流水线
本文介绍了 slidesqaqa,这是一个基于 Flask 的软件系统,能从 PDF 幻灯片中生成富有教学价值的问题。该系统采用四阶段大语言模型流水线,依次进行文本和图像提取、全幻灯片范围内的问题规划、幻灯片标注以及输出整合,在技术讲座幻灯片上展示了高保真的问题生成能力。
Slideshot
Slideshot 是一款用于录制产品演示视频的 AI 智能体。
个性化作为逆规划:通过结构去噪学习智能幻灯片生成的潜在设计意图
本文提出Spire框架,将幻灯片个性化建模为逆规划问题,利用结构去噪和强化学习来推断潜在的设计意图,无需依赖显式模板或冗长的指令。