个性化作为逆规划:通过结构去噪学习智能幻灯片生成的潜在设计意图

arXiv cs.AI 论文

摘要

本文提出Spire框架,将幻灯片个性化建模为逆规划问题,利用结构去噪和强化学习来推断潜在的设计意图,无需依赖显式模板或冗长的指令。

arXiv:2607.00407v1 Announce Type: new 摘要:幻灯片设计需要同时对整体主题和单页布局进行个性化。然而,当前基于AI智能体的方法在处理细粒度的页面级设计时存在困难。它们完全依赖预设模板或用户冗长的指令,无法捕捉潜在的设计意图,导致页面级幻灯片个性化(PSP)问题未能解决。为弥补这一差距,本文将PSP建模为逆规划问题。我们提出学习设计意图,而不假设了解所使用的具体执行工具(如PowerPoint、Beamer)。然而,放弃对这些工具的控制使得问题难以端到端优化。为此,我们提出SPIRE,一个原则性的框架来近似求解PSP。通过故意破坏干净幻灯片的视觉结构,SPIRE创建了一个可验证的去噪任务,其中两个智能体通过强化学习(RL)协作优化可执行的设计。我们证明了结构去噪是PSP的一致替代,且多智能体公式严格降低了RL中的策略梯度方差。大量实验证明了SPIRE的优越性。
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:40

# 个性化作为逆向规划:通过结构去噪学习幻灯片生成的潜在设计意图  
来源:https://arxiv.org/html/2607.00407  

11institutetext:普渡大学22institutetext:罗格斯大学33institutetext:奥尔巴尼大学44institutetext:微软  

Zihan Dong普渡大学 罗格斯大学 奥尔巴尼大学 微软  
Linjun Zhang普渡大学 罗格斯大学 奥尔巴尼大学 微软  
Haoyu Wang普渡大学 罗格斯大学 奥尔巴尼大学 微软  
Jing Gao普渡大学 罗格斯大学 奥尔巴尼大学 微软  
Emre Kıcıman普渡大学 罗格斯大学 奥尔巴尼大学 微软  
Ranveer Chandra普渡大学 罗格斯大学 奥尔巴尼大学 微软  
Wei- Ting Chen†普渡大学 罗格斯大学 奥尔巴尼大学 微软  

###### 摘要  

幻灯片设计需要个性化定制演示主题和页面布局。然而,当前基于AI智能体的方法在处理细粒度的页面级设计时存在困难。它们仅依赖预设模板或用户冗长的指令,未能捕捉到潜在的设计意图,导致页面级幻灯片个性化(PSP)问题仍未解决。为弥合这一差距,本文将PSP形式化为一个逆向规划问题。我们提出学习一种设计意图,而不假设对所使用的具体执行工具(例如PowerPoint、Beamer)有任何了解。然而,放弃对这些工具的控制使得端到端优化变得棘手。为了克服这一点,我们提出了Spire,一个用于近似解决PSP的框架。通过有意破坏干净幻灯片的视觉结构,Spire创建了一个可验证的去噪任务,其中两个智能体通过强化学习(RL)学习协作优化可执行的设计。我们证明结构去噪是PSP的一致替代目标,并且多智能体公式严格降低了RL中的策略梯度方差。大量实验证明了Spire的优越性。  

**脚注:** 工作是在微软实习期间完成的。  
††脚注:通讯作者。  

## 1 引言  

参考图说明  
图1:Spire的示意图。通过强化学习训练,Spire学习推断设计意图,而不是像现有方法那样使用预设的布局模板或冗长的用户指令[53,10],提供了理论和实证优势。  

幻灯片是学术界和工业界交流想法的主要媒介[34,13,40]。然而,制作高质量的幻灯片是一个设计密集型的过程。根据演示者和目标受众的不同,相同的内容可能需要不同的视觉处理。这些处理通常针对演讲者的惯用设计、实验室的视觉标识或组织的品牌准则进行个性化。简而言之,实际的幻灯片生成本质上是一项个性化任务。  

多模态大语言模型(MLLMs)的最新进展使得能够实现自动化幻灯片生成的智能体管道[38,9,26,10,53,45,30]。这些系统通常将幻灯片创建分解为模块化阶段,如大纲规划、资产提取、布局排列和迭代优化,从而通过模板选择、视觉反馈和多智能体协调提高演示级的一致性[53,50,30,42,16,15]。然而,它们在细粒度的页面级设计方面存在困难,这需要决定视觉层次、元素对齐、间距和样式选择。然而,现有的智能体系统被动地处理页面级布局和样式:一旦内容被指定,页面级设计在很大程度上被忽略,要么遵循通用的系统定义模板[24,53,42,15],要么需要冗长、明确的用户指令[10,30],而不是推断用户的潜在意图。因此,它们过于粗糙,无法实现令人满意的页面级幻灯片个性化(PSP)。  

为弥合这一差距,我们引入了智能体PSP的任务;该概念如图1所示。我们的公式受人类设计师在实践中教授幻灯片制作的方式启发:给定一个详细规划页面规范(如布局结构和视觉层次)的计划,一个具有一般能力的执行者(例如,一个不熟悉特定公司风格的经验丰富的设计师)可以通过逐步遵循计划可靠地再现高质量的个性化幻灯片视觉。但这类可操作的计划在实践中难以大规模收集。详细的意图标注在现实世界的幻灯片语料库中很少可用[10],使得直接监督训练不可行。因此,PSP需要主动推断作为潜在意图的计划,以积极指导生成过程。此外,这个计划自然依赖于上下文:(企业)用户通常根据其具体场景维护多组意图。幸运的是,这种上下文意图可以通过让用户提供少量参考幻灯片来很大程度上指定。为此,我们将PSP形式化为一个概率问题,将设计意图明确建模为潜在随机变量。给定(1)用户提供的页面资产和(2)一小套参考幻灯片,我们推断最终详细的计划,然后无缝传递给下游的视觉设计师执行。直观地说,我们公式化的PSP旨在推断一个计划,一旦由一个有能力、非个性化的执行者执行,该计划能够最可靠地再现用户参考所期望的个性化幻灯片。这种概率公式将设计意图视为潜在变量,为页面级幻灯片个性化提供了原则性基础。  

然而,这种潜在意图的PSP公式在计算上难以解决,原因有两个。首先,它根据计划是否使执行者能够再现期望的视觉来评估计划。这需要一个渲染似然,但缺乏清晰、可直接优化的目标。朴素的图像级相似性对于幻灯片质量是一种不可靠的估计,因为幻灯片质量由离散的、结构化的设计决策而非纯粹的像素级接近度决定[10,39,33,44]。其次,将计划转化为幻灯片的执行者实际上是一个黑盒,这进一步阻碍了使用标准数值方法优化PSP目标[35,17]。因此,需要一个有效的近似来使这个目标易于处理。我们在第2.1节中详细阐述了这一公式及其计算挑战。  

作为解决方案,本文提出了Spire(通过逆向结构重建的结构规划),一个将难以优化的幻灯片个性化目标转化为可验证的重建问题的结构去噪框架,该重建问题可作为良好的代理。我们的解决方案将现有的多智能体视觉生成框架[11,23,41,15,14]扩展为有原则的训练目标。利用前述PSP目标——学习一个以参考为条件的页面级计划——我们在一个提供语义反馈的评论者和一个相应更新其计划的规划者之间交替。关键思想是利用幻灯片离散的结构性质:我们不是扰动像素,而是故意通过应用随机的、元素级别的结构扰动(涉及布局、层次和样式)来破坏一个黄金幻灯片,并记录相应的差异。这产生了可扩展的自监督,其中需要改进的次优部分通过构造可知。基于结构扰动,Spire分别训练两个互补组件,基于这个共享信号。评论者学会读取被破坏的幻灯片和用户的参考,并生成结构化、可操作的反馈,将差异精确定位为语义编辑建议。规划者学会生成一个可执行、可编辑的计划,要么从头开始提出计划,要么在评论者反馈的指导下修改不完美的计划。由于两个组件都经过训练以从受控的结构破坏中恢复,评论者的反馈变得可验证,而规划者学会改进计划而无需依赖通过黑盒执行者的梯度,使得潜在意图PSP在实践中可行。我们采用强化学习[36,47]来训练这两个智能体。第2.2节详细介绍了所提出的Spire。我们在第2.3节中提供了其优越性的理论分析。这种有原则的方法及其理论优势是本文的主要技术贡献。  

本文组织如下。第2节形式化PSP并详细介绍了所提出的Spire。第3节中的大量实验证明了我们方法的有效性。在本文的其余部分,我们在第4节中回顾相关工作,并在第5节中总结全文。  

## 2 所提方法  

本节形式化基于参考的页面级幻灯片个性化(PSP)任务,由于上下文意图是潜在的,该任务涉及一个难以处理的优化问题。我们提出Spire作为一个原则性的近似解决方案。  

### 2.1 问题形式化  

假设一个(企业)用户指定一个关于幻灯片内容的高级指令 x(例如,文本内容和视觉元素)¹¹¹在本文中,我们将幻灯片上的页面级对象(例如文本框、图片、形状、图表和表格)统一称为视觉元素。文本框是一种包含文本内容的视觉元素。,并提供 K 个参考幻灯片 D_ref = {s_ref^(1), ..., s_ref^(K)},以示例其上下文偏好的样式。我们将PSP定义为生成一个目标幻灯片 s,该幻灯片能够准确反映用户未在口头 x 中详细说明的确切意图。为了反映创造性设计的需求,我们允许 D_ref 不覆盖 s 应使用的最佳布局。我们将此意图称为计划,并将其视为一个潜在变量,记为 z。直观地说,z 可以是一个逐步的可操作指令,包含丰富的页面级规范(例如布局坐标和元素样式)。遵循一个格式良好的 z,一个具有一般能力的执行者 E 可以被无歧义地引导生成一个高质量的视觉 s,该视觉个性化地满足用户的需求,即使 E 本身并未直接针对用户的偏好进行调整。从概率角度来看,这意味着视觉实现 s 在给定计划 z 的情况下与用户上下文条件独立: p(s | z, x, D_ref) = p(s | z)。这里的随机性是由使用黑盒 E 引起的,它可能是一个代码智能体[27,52,7,6,1,29,16]、一个图像生成器[46,8,22,28]或一个人类设计师。注意,有意将计划 z 和 E 解耦,这样 PS 就不需要每次引入新的执行者 E 时都重新进行。  

基于此定义,让 π_θ 表示一个多模态语言模型规划者,PSP 可以形式化为从个人语料库 D_tr = {(x^(1), (s*)^(1), D_ref^(1)), ..., (x^(J), (s*)^(J), D_ref^(J))} 学习 π_θ。这里 s* 表示 x 的黄金幻灯片。我们在补充材料中详细说明了 D_tr 的构建。给定 D_tr,PSP 的目标是最大化在给定 x, D_ref 条件下 s* 的边缘似然。这可以表示为以下优化目标:  

J(θ) = E_{(x, s*, D_ref) ∼ D_tr}[ log p_θ(s* | x, D_ref) ]  
= E_{(x, s*, D_ref) ∼ D_tr}[ log ∫ π_θ(z | x, D_ref) p(s* | z) dz ]. (1)  

通俗地说,方程 (1) 寻找能够生成计划的 π_θ,这些计划能够最大化黑盒 E 复现(生成)黄金 s* 的似然。不幸的是,优化方程 (1) 由于两个原因而难以实现。首先,似然 p(s* | z) 缺乏明确形式,使得目标难以处理。一种常见解决方案是在像素空间中近似优化 p(s* | z) ∝ -‖s* - E(z)‖_2,旨在推动生成的 s = E(z) 在像素级别上接近 s*。然而,最近的工作[10,39,44]表明将幻灯片视为纯图像

相似文章

DeepSlide:从幻灯片制品到演讲交付

arXiv cs.AI

DeepSlide 是一个人机协同的多智能体系统,覆盖完整的演示流程,从需求获取、带时间预算的叙事规划,到基于证据的幻灯片-脚本生成以及排练支持。它引入了一个双记分板基准,将静态制品质量与动态交付卓越性清晰分离,并在叙事流畅性、节奏精准度和幻灯片-脚本协同方面取得了显著提升。

基于稀疏查询特征梯度优化的导向生成

arXiv cs.LG

本文介绍了Prototype-Based Sparse Steering方法,该方法将稀疏自编码器应用于大语言模型的注意力查询激活,然后在推理过程中使用梯度优化来引导生成朝向目标行为。该方法在一个逻辑规划任务和一个风格化教育领域中得到了验证,展示了可解释且解耦的控制能力。

ArcDeck:叙事驱动的论文到幻灯片生成

Hugging Face Daily Papers

ArcDeck 是一个多智能体框架,通过话语树和迭代智能体优化来建模逻辑流程,从而从学术论文生成演示幻灯片,性能优于直接摘要方法。该论文还引入了 ArcBench,这是一个新的基准测试,用于评估论文到幻灯片生成,强调叙事连贯性和逻辑结构。