生成内容丰富化
摘要
本文提出了一种联合对抗框架,使用图卷积网络在生成语义更丰富的视觉内容之前丰富稀疏的场景图。该方法在表示层面显式地进行场景丰富,生成视觉上合理且结构连贯的图像。
查看缓存全文
缓存时间: 2026/07/06 18:38
论文页面 - 生成内容丰富化
来源:https://huggingface.co/papers/2405.03650
摘要
一个联合对抗框架利用图卷积网络对场景图进行丰富化,从稀疏的场景描述生成语义更丰富的视觉内容。
我们研究生成内容丰富化(Generated Contents Enrichment,GCE),这是一项条件图像生成任务,首先通过显式场景表示 (https://huggingface.co/papers?q=scene%20representation) 对稀疏场景描述进行丰富化,然后将其渲染为语义更丰富的视觉内容。传统图像生成系统可以从有限的场景描述中生成视觉逼真的输出,但新增的内容通常隐含在生成器中,而不是表示为可检查的中间结构。相比之下,GCE 的目标是在场景表示层面使场景丰富化显式化,同时在生成过程中观察其视觉后果,旨在鼓励生成的内容在视觉上合理、结构上连贯且比稀疏输入语义更丰富。为了实例化 GCE,我们提出了一个联合训练的对抗框架 (https://huggingface.co/papers?q=adversarial%20framework),该框架通过对物体语义和物体间关系进行建模来丰富场景图 (https://huggingface.co/papers?q=scene%20graph)。我们的方法首先将输入描述表示为场景图 (https://huggingface.co/papers?q=scene%20graph),其中节点对物体建模,边捕获物体间关系。该框架使用图卷积网络 (https://huggingface.co/papers?q=graph%20convolutional%20networks) 预测额外的物体及其与现有场景的关系。最后,将丰富后的场景图 (https://huggingface.co/papers?q=scene%20graph) 传递给下游图像生成管线 (https://huggingface.co/papers?q=image-generation%20pipeline),以生成相应的视觉内容。我们通过代理场景图 (https://huggingface.co/papers?q=scene%20graph) 丰富化指标、图像质量比较、定性示例以及在 Visual Genome 数据集上的用户研究来评估该框架。
查看 arXiv 页面 (https://arxiv.org/abs/2405.03650)查看 PDF (https://arxiv.org/pdf/2405.03650)GitHub0 (https://github.com/Mahdi-Naseri/GCE)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2405.03650)
在您的智能体中获取此论文:
hf papers read 2405.03650
还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接到此论文
请在模型 README.md 中引用 arxiv.org/abs/2405.03650,以在此页面建立链接。
引用此论文的数据集0
没有数据集链接到此论文
请在数据集 README.md 中引用 arxiv.org/abs/2405.03650,以在此页面建立链接。
引用此论文的 Space0
没有 Space 链接到此论文
请在 Space README.md 中引用 arxiv.org/abs/2405.03650,以在此页面建立链接。
包含此论文的收藏集0
没有收藏集包含此论文
请将此论文添加到收藏集 (https://huggingface.co/new-collection) 中以在此页面建立链接。
相似文章
用于检索和图卷积网络分类的上下文感知可解释表示
本文提出了一种无监督框架,结合流形学习和可解释图嵌入,以解决视觉表示中的几何和可解释性差距,提升图像检索和GCN分类任务的性能。
生成作为辅助监督:通过解耦嵌入预测以零推理开销增强视觉理解
GAS 引入了一种生成引导的训练框架,通过解耦的混合Transformer架构,使用辅助生成任务来提高多模态模型中的视觉理解,且无推理开销。
生成式语义场景补全
本文提出了一种生成式语义场景补全方法,具有校正后的性能指标和实时推理能力,并发布了代码、权重和PS3语料库以供重现性研究。
AGE:图检索增强生成中的自适应掩码图嵌入方法
介绍了自适应掩码图嵌入(AGE),这是一种基于Transformer的自监督学习方法,通过专注于预测非关键节点,解决了GraphRAG任务中LLM的图表示与文本表示之间的潜在特征不对齐问题。
针对文本和多媒体数据的有效图与排名上下文嵌入
本文介绍了GRaCE,这是一个无监督框架,用于通过基于排名的度量生成可解释的图嵌入,在文本和图像数据的检索、分类和聚类任务中优于现有方法。