IV-CoT: 隐式视觉思维链用于结构感知的文本到图像生成

Hugging Face Daily Papers 论文

摘要

IV-CoT 将视觉条件分解为结构和语义级联,以改进结构感知的图像生成,使用仅训练阶段的草图监督来指导结构查询。在 GenEval 和 T2I-CompBench 上达到了最先进的结果。

统一的多模态大语言模型(MLLMs)在文本到图像生成方面取得了强性能,但在遵循结构感知的提示时仍然存在困难,例如必须保持对象数量、空间关系、属性绑定和粗略布局。我们将这一局限性部分归因于结构规划和外观渲染在单一条件流中的纠缠。为了解决这个问题,我们提出了隐式视觉思维链(IV-CoT),一种用于查询条件图像生成的潜在视觉推理框架。IV-CoT 将视觉条件查询分解为结构到语义的级联,其中结构查询首先形成潜在视觉计划,语义查询然后在此计划条件下渲染外观。为了指导结构查询,我们引入了仅训练阶段的草图监督,这鼓励它们从草图中捕获结构,而无需在推理时进行草图提取或中间解码。IV-CoT 在一次前向传递中执行隐式 CoT 推理,并在 GenEval 和 T2I-CompBench 上取得了优越的结果。可视化和分析表明,学习到的结构和语义查询在结构感知生成中扮演互补角色。
查看原文
查看缓存全文

缓存时间: 2026/06/25 05:17

论文页面 - IV-CoT: 面向结构感知文本到图像生成的隐式视觉思维链

来源:https://huggingface.co/papers/2606.24849 作者:

摘要

隐式视觉思维链将视觉条件分解为结构级联和语义级联,通过草图监督实现更优的结构感知图像生成。

统一的 multi-modal large language models (MLLMs)(多模态大语言模型)在文本到图像生成质量上取得了强劲表现,但在结构感知提示跟随方面仍存在困难——对象数量、空间关系、属性绑定和粗略布局必须被准确保留。我们将这一局限性部分归因于结构规划和外观渲染在单一条件流中的纠缠。为解决该问题,我们提出 Implicit Visual Chain-of-Thought (IV-CoT)(隐式视觉思维链),这是一种用于查询条件图像生成的潜在视觉推理框架。IV-CoT 将视觉条件查询分解为结构到语义的级联:结构查询首先形成潜在视觉规划,语义查询再在此规划基础上渲染外观。为引导结构查询,我们引入仅训练阶段使用的草图监督,它在不依赖推理时草图提取或中间解码的情况下,鼓励结构查询从草图中捕获结构信息。IV-CoT 通过单次前向传播执行隐式思维链推理,在 GenEval 和 T2I-CompBench 上取得了优越结果。可视化与分析表明,所学习的结构查询和语义查询在结构感知生成中发挥了互补作用。

查看 arXiv 页面 (https://arxiv.org/abs/2606.24849)查看 PDF (https://arxiv.org/pdf/2606.24849)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.24849)

在您的智能体中获取此论文:

hf papers read 2606.24849

没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型 0

尚无模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.24849 以从此页面关联。

引用该论文的数据集 0

尚无数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2606.24849 以从此页面关联。

引用该论文的 Spaces 0

尚无 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2606.24849 以从此页面关联。

包含该论文的收藏 0

尚无收藏包含此论文

请将本论文添加到一个收藏 (https://huggingface.co/new-collection) 中以从此页面关联。

相似文章

通过闭环验证推理解锁复杂视觉生成

Hugging Face Daily Papers

介绍CLVR(闭环视觉推理),一种将文本到图像生成从单步过程重构为闭环多步视觉推理方法的框架,使用VLM控制器和扩散模型,在组合提示上实现了改进的性能。

J-CoT:J空间中的思维链

arXiv cs.CL

本文介绍了J-CoT,一种循环推理框架,它使用词汇索引系数(J-thoughts)作为中间接口,在数学、科学、编程和路径推理任务上实现改进的推理性能,而无需完全语言化或密集的隐藏状态循环。

多样本思维链上下文学习:让上下文学习真正学会

Hugging Face Daily Papers

本文研究了推理任务的多样本思维链上下文学习,揭示了标准扩展规则并不适用,并提出了Curvilinear Demonstration Selection (CDS)方法以改进示例排序,最高可获得5.42个百分点的性能提升。

CaVe-VLM-CoT:一个可解释的视觉-语言模型框架

arXiv cs.AI

CaVe-VLM-CoT是一个基于模块化反思的智能体RAG框架,专为视觉-语言模型设计,通过五阶段流水线强制执行基于证据的推理,在ScienceQA上达到87.1%的准确率,并提出了一套包含23项指标的评估体系。