ConvDeck:基于特定阶段用户反馈的对话式论文到幻灯片生成

arXiv cs.AI 论文

摘要

ConvDeck 提出了一种多智能体流程,用于对话式论文转幻灯片生成,用户能在流程的不同阶段通过特定反馈迭代优化演示文稿。

arXiv:2609.00226v1 公告类型:新 摘要:自动化学术论文到幻灯片的生成本质上是迭代的,因为创建有效的演示文稿需要多次生成、批评和修订的循环。最近的多智能体系统通过内部批评和修订循环部分承认了这一点,而对话方法允许用户通过对话优化生成的幻灯片。然而,这些优化过程要么对用户基本封闭,要么仅在完整幻灯片制作完成后才引入反馈,限制了用户参与叙事流、内容分配和演示重点的迭代优化能力。为解决这一问题,我们介绍了 ConvDeck,这是一种用于对话式论文到幻灯片生成的多智能体管道,它通过特定阶段的循环在管道中分配交互,允许用户在每种决策制定阶段迭代优化演示大纲和最终幻灯片。这些循环由一种优化机制驱动,其中智能体可以思考、说话和行动,使它们能够直接应用编辑或以对话方式响应以澄清用户反馈并讨论修订选项。我们的评估表明,特定阶段的对话反馈提高了用户目标满意度,同时保持了叙事连贯性、内容质量和视觉呈现。
查看原文
查看缓存全文

缓存时间: 2026/09/02 05:59

# 通过阶段性用户反馈实现对话式论文转幻灯片生成  
来源:https://arxiv.org/html/2609.00226  

## ConvDeck:通过阶段性用户反馈实现对话式论文转幻灯片生成  
Sachidanand VS*、Furkan Horoz*(隶属机构:Ozgur Kara、Dilek Hakkani‑Tür†、Junho Kim†、James M. Rehg†;隶属机构:伊利诺伊大学厄巴纳-香槟分校)  

###### 摘要  
学术论文到幻灯片的自动生成本质上是迭代的,因为创建有效的演示文稿需要反复生成、评估和修订。近期多智能体系统通过内部评估‑修订循环部分承认了这一点,而对话式方法则允许用户通过对话完善生成的幻灯片集。然而,这些修订过程要么在很大程度上对用户封闭,要么仅在完整幻灯片集生成后才引入反馈,限制了用户参与叙事流、内容分配和演示重点迭代修订的能力。为解决这一差距,我们推出了ConvDeck,这是一个用于对话式论文转幻灯片生成的多智能体流水线,通过阶段性循环在流水线中分配交互,允许用户在各类决策阶段迭代修订演示大纲和最终幻灯片集。这些循环由一个细化机制驱动,智能体可以在其中思考、发言和行动,使其能够直接应用编辑或通过对话响应以澄清用户反馈并讨论修订选项。我们的评估表明,阶段性对话反馈在保持叙事连贯性、内容质量和视觉呈现的同时,提升了用户目标满足度。代码库可在我们的项目网页(https://convdeck.github.io/)获取。  

††脚注文本:*等同贡献†通信作者  

## 1 引言  
学术论文到幻灯片生成旨在通过识别相关内容、将其组织成清晰的叙事、决定强调重点,并根据目标演示上下文调整细节层次,将研究论文转换为连贯的演示幻灯片集(即演示文稿)。这些决策并非仅由源论文决定:根据演示者的目标、受众、时间预算和偏好的叙事重点,同一论文可产生多种有效的幻灯片集,例如聚焦方法论、结果导向或教学型。早期幻灯片生成工作使用LLM单次生成演示文稿,但近期自动幻灯片生成系统将创作过程分解为多个专门组件(Zheng等,2025(https://arxiv.org/html/2609.00226#bib.bib6);Ge等,2025(https://arxiv.org/html/2609.00226#bib.bib4)),例如视觉设计(Liang等,2025(https://arxiv.org/html/2609.00226#bib.bib8);Pan等,2026(https://arxiv.org/html/2609.00226#bib.bib21))和叙事流(Ozden等,2026(https://arxiv.org/html/2609.00226#bib.bib12);Yu等,2026(https://arxiv.org/html/2609.00226#bib.bib18)),作为多阶段设计方法的一部分(参见图1(https://arxiv.org/html/2609.00226#S1.F1)(a))。近期方法的一个关键特性是整合了内部*评估‑修订循环*,以迭代方式打磨生成的幻灯片集(Xu等,2025(https://arxiv.org/html/2609.00226#bib.bib7);Zheng等,2026(https://arxiv.org/html/2609.00226#bib.bib15);Liu等,2026(https://arxiv.org/html/2609.00226#bib.bib20))。鉴于人类创作高质量文档也需要多次内容生成、评估和修订迭代,这是一种自然的方法。  

参见标题  
图1:与先前论文转幻灯片生成范式的比较。(a) 非对话方法在单次生成过程中从论文产生幻灯片集,无交互。(b) 后期编辑方法在幻灯片集生成*后*添加对话细化循环,因此所有用户反馈必须由单个后期编辑阶段吸收。(c) ConvDeck通过阶段性循环在流水线中分配交互。  

为了提供更大的用户对幻灯片生成的控制,近期工作通过人在环路细化引入了对话控制(Yang等,2025(https://arxiv.org/html/2609.00226#bib.bib13);Jang等,2026(https://arxiv.org/html/2609.00226#bib.bib14);Jung等,2025(https://arxiv.org/html/2609.00226#bib.bib19);Chen等,2025(https://arxiv.org/html/2609.00226#bib.bib29)),其中用户提供对*最终*生成幻灯片集的直接反馈(图1(https://arxiv.org/html/2609.00226#S1.F1)(b))。在此阶段提供反馈是合理的,因为用户需要查看完成的幻灯片才能进行评估。然而,通过对话直接修改生成的幻灯片复杂且笨拙,因为幻灯片集的许多细节由流水线中更早的决策塑造,包括大纲结构、内容分配和叙事顺序。通过基于表面语言的幻灯片内容控制来解决结构问题是低效且不可靠的。相反,评估‑修订循环中的评估智能体能够直接修改产生最终幻灯片内容的中间表示。然而,这些智能体永远无法完全捕捉用户的关键视角,因为它们缺乏用户独特的背景、经验以及对其目标的全面理解。为解决这一差距,我们推出了*ConvDeck*(图1(https://arxiv.org/html/2609.00226#S1.F1)(c)),一个用于对话式论文转幻灯片生成的多智能体流水线,通过阶段性循环*实现用户在生成流水线中的交互*,将每个细化步骤与最适合处理的组件对齐。  

ConvDeck在两个阶段整合交互:(i) 大纲生成,用户可在完整幻灯片集渲染前修订高层决策,如叙事流、章节重点、幻灯片顺序和内容覆盖;(ii) 幻灯片生成,用户可进一步细化幻灯片级内容、视觉组织、图表、布局和其他细节。在每个阶段,我们的对话智能体通过细化机制运作,使智能体能够推理、发言和行动,允许它们直接应用编辑或通过对话响应,以在用户反馈不明确或涉及模糊演示目标时请求澄清、解释细化选择并讨论替代修订。为评估此设计是否实际转化为与用户意图的更好对齐,我们的综合评估既衡量标准幻灯片质量维度,也衡量明确的用户目标满足度,研究阶段性对话反馈是否提高了系统整合用户请求的能力,同时保持叙事连贯性、内容质量和视觉呈现。  

总之,我们的主要贡献是:  
- •我们推出ConvDeck,一个用于对话式论文转幻灯片生成的多智能体流水线,通过大纲生成和幻灯片生成两个阶段的阶段性细化循环,赋予用户细粒度控制,并将每个细化步骤与最适合的流水线组件对齐。  
- •我们开发了一个细化机制,其中对话智能体思考、发言和行动,允许它们直接应用编辑或通过对话响应,以澄清用户反馈、解释修订决策,并在应用更改前讨论可能的细化。  
- •我们提出用于对话式论文转幻灯片生成的用户目标满足度评估,衡量阶段性对话反馈是否在保持标准幻灯片质量标准的同时,产生更好满足演示者特定要求的幻灯片集。  

参见标题  
图2:ConvDeck概览。给定论文PDF和可选用户输入,ConvDeck通过五个阶段产生最终幻灯片集:预处理、大纲生成、对话式大纲细化、幻灯片生成和对话式幻灯片细化。  

## 2 相关工作  

#### 多智能体论文转幻灯片生成。近期自动幻灯片生成系统采用代理式、多阶段流水线,将任务分解为规划、内容选择、幻灯片构建和视觉细化的专门组件。一条工作线将生成视为参考或模板驱动过程(Zheng等,2025(https://arxiv.org/html/2609.00226#bib.bib6);Ge等,2025(https://arxiv.org/html/2609.00226#bib.bib4);Tang等,2025(https://arxiv.org/html/2609.00226#bib.bib17)),而另一条则聚焦叙事或话语结构(Ozden等,2026(https://arxiv.org/html/2609.00226#bib.bib12);Liang等,2025(https://arxiv.org/html/2609.00226#bib.bib8);Yu等,2026(https://arxiv.org/html/2609.00226#bib.bib18))。第三条工作线引入流水线内部的细化循环,智能体在其中迭代评估和修订生成的工件(Xu等,2025(https://arxiv.org/html/2609.00226#bib.bib7);Zheng等,2026(https://arxiv.org/html/2609.00226#bib.bib15);Liu等,2026(https://arxiv.org/html/2609.00226#bib.bib20);Pan等,2026(https://arxiv.org/html/2609.00226#bib.bib21))。一个互补方向针对个性化和受众感知适应(Zeng等,2026(https://arxiv.org/html/2609.00226#bib.bib26);Liu等,2025(https://arxiv.org/html/2609.00226#bib.bib30))。相关代理系统将该范式扩展到学术海报(Pang等,2026(https://arxiv.org/html/2609.00226#bib.bib22);Zhang等,2026(https://arxiv.org/html/2609.00226#bib.bib23);Inadumi等,2026(https://arxiv.org/html/2609.00226#bib.bib24);Shi等,2026(https://arxiv.org/html/2609.00226#bib.bib27);Tang等,2026(https://arxiv.org/html/2609.00226#bib.bib28))和演示视频(Zhu等,2025(https://arxiv.org/html/2609.00226#bib.bib25))。尽管这些代理工作显著提升了幻灯片质量,但它们不允许用户在最终输出未满足所有要求时轻松修改幻灯片集。更根本的是,这种非交互方法与定义人类高质量文档创作的生成、评估和修订周期不兼容。  

#### 对话式论文转幻灯片生成。一个规模较小但不断增长的工作线创建交互界面,用户可在其中提供自然语言反馈以修订生成的幻灯片集(Yang等,2025(https://arxiv.org/html/2609.00226#bib.bib13);Jang等,2026(https://arxiv.org/html/2609.00226#bib.bib14);Jung等,2025(https://arxiv.org/html/2609.00226#bib.bib19);Chen等,2025(https://arxiv.org/html/2609.00226#bib.bib29))。这些系统共享一个共同设计:对话在完整幻灯片集生成*后*引入,用户的修订限于对最终幻灯片的后期编辑。这是一个费力且笨重的过程,因为最终幻灯片将表面属性(如字体大小)与更深层次的结构属性(如主题顺序)交织在一起。相反,ConvDeck在大纲生成和幻灯片生成两个阶段分配交互,将每个细化步骤与最适合处理的流水线组件对齐。先前工作使用幻灯片质量指标、与参考幻灯片集的相似性(Jang等,2026(https://arxiv.org/html/2609.00226#bib.bib14)),或用户通过幻灯片编辑学习底层内容的有效性(Yang等,2025(https://arxiv.org/html/2609.00226#bib.bib13))来评估幻灯片生成。除了标准幻灯片质量评估外,我们首次引入对幻灯片生成中用户目标满足度的明确评估,评估对话式幻灯片生成系统在满足随机抽样的演示者特定要求方面的表现。  

## 3 通过ConvDeck实现对话式论文转幻灯片生成  

### 3.1 ConvDeck概览  
如图2(https://arxiv.org/html/2609.00226#S1.F2)所示,ConvDeck以论文PDF作为输入,连同两个可选用户提供的输入:目标受众和演示时长。基于这些输入,它通过五阶段顺序流水线产生最终幻灯片集。预处理(阶段1)提取论文的结构化文本和资产表示;大纲生成(阶段2)通过话语感知规划构建初始大纲;对话式大纲细化(阶段3)基于用户反馈在渲染任何幻灯片之前迭代更新此大纲;幻灯片生成(阶段4)将细化的大纲转换为草稿幻灯片集;对话式幻灯片细化(阶段5)通过第二轮用户反馈进一步细化已渲染的幻灯片集。本节其余部分将详细描述每个阶段。  

### 3.2 ConvDeck流水线  
#### (阶段1)预处理。预处理阶段将输入论文解析为两种工件,为所有后续生成奠定基础:论文文本的Markdown表示和包含其图表及其标题的资产字典。我们使用Docling(Livathinos等,2025(https://arxiv.org/html/2609.00226#bib.bib10))进行解析和资产提取。Docling确定性地解析完整论文正文,保留信息供后续阶段使用。我们还分离参考文献部分,并构建引用键字典,下游阶段使用它保留文内引用;参考文献后出现的补充内容被丢弃。  

#### (阶段2)大纲生成。大纲生成阶段从Markdown表示生成初始幻灯片大纲。遵循ArcDeck(Ozden等,2026(https://arxiv.org/html/2609.00226#bib.bib12)),我们采用包含三个组件的叙事驱动设计:(i)话语解析器,构建基于RST的话语树以捕获段落之间的修辞关系;(ii)承诺构建器,消耗目标受众和演示时长以产生总结幻灯片集高层意图的全局承诺;(iii)叙事细化,通过幻灯片规划器/修订器和叙事评估器循环起草和修订大纲(详见附录D(https://arxiv.org/html/2609.00226#A4))。由于用户驱动的细化是我们的重点,我们仅运行此细化循环一次,并将细粒度大纲修订推迟到阶段3。  

参见标题  
图3:对话式细化概览。给定草稿大纲或幻灯片集,用户提供反馈。细化器对输入进行推理,通过工具与用户对话或行动,并返回更新的大纲或幻灯片集以进行迭代细化。  

#### (阶段3)对话式大纲细化。如图3(https://arxiv.org/html/2609.00226#S3.F3)所示,此阶段根据用户反馈更新初始大纲,允许在渲染任何幻灯片之前修订高层结构和叙事。用户审阅由幻灯片标题和总结幻灯片内容的讨论想法组成的预览。为支持更明智的反馈,用户还会获得论文的摘要版本。基于此反馈,大纲细化器通过编辑操作(如添加、编辑、拆分、合并、删除和重新排序幻灯片)应用请求的修改。为确保细化器忠实捕捉用户意图,我们采用受ReSpAct(Dongre等,2025(https://arxiv.org/html/2609.00226#bib)启发的*对话‑行动细化*。

相似文章

ArcDeck:叙事驱动的论文到幻灯片生成

Hugging Face Daily Papers

ArcDeck 是一个多智能体框架,通过话语树和迭代智能体优化来建模逻辑流程,从而从学术论文生成演示幻灯片,性能优于直接摘要方法。该论文还引入了 ArcBench,这是一个新的基准测试,用于评估论文到幻灯片生成,强调叙事连贯性和逻辑结构。

AskDeck

Product Hunt

AskDeck是一个AI驱动的工具,通过电话、短信、电子邮件、网络或与AI模型的集成,从简短输入中生成可编辑的PowerPoint演示文稿和带旁白的视频,提供免费预览和一次性购买。

DeepSlide:从幻灯片制品到演讲交付

arXiv cs.AI

DeepSlide 是一个人机协同的多智能体系统,覆盖完整的演示流程,从需求获取、带时间预算的叙事规划,到基于证据的幻灯片-脚本生成以及排练支持。它引入了一个双记分板基准,将静态制品质量与动态交付卓越性清晰分离,并在叙事流畅性、节奏精准度和幻灯片-脚本协同方面取得了显著提升。