通过闭环验证推理解锁复杂视觉生成

Hugging Face Daily Papers 论文

摘要

介绍CLVR(闭环视觉推理),一种将文本到图像生成从单步过程重构为闭环多步视觉推理方法的框架,使用VLM控制器和扩散模型,在组合提示上实现了改进的性能。

尽管进展迅速,当前文本到图像(T2I)模型主要依赖单步生成范式,难以处理复杂语义,且面临参数规模扩展带来的收益递减。 虽然近年来的多步推理方法展现出潜力,但它们受困于缺乏验证的无根据规划幻觉、整体式事后反思、长上下文优化不稳定性以及过高的推理延迟。为克服这些瓶颈,我们提出闭环视觉推理(CLVR)框架,这是一个深度融合视觉语言逻辑规划与像素级扩散生成的综合系统。CLVR引入了带有步骤级视觉验证的自动化数据引擎,用于合成可靠的推理轨迹,并提出了代理提示强化学习(PPRL),通过将交错的多模态历史蒸馏为显式奖励信号以解决长上下文优化不稳定性,从而实现准确的因果归因。此外,为缓解迭代去噪带来的严重延迟瓶颈,我们提出了Δ空间权重合并(DSWM),这是一种理论严谨的方法,将对齐权重与现成的蒸馏先验融合,将每步推理成本降低到仅4次NFE,且无需昂贵的再蒸馏。大量实验表明,CLVR在多个基准测试上优于现有的开源基线,并接近专有商业模型的性能,从而解锁了复杂视觉生成的通用测试时扩展能力。
查看原文
查看缓存全文

缓存时间: 2026/05/15 08:24

论文页面 - 通过闭环验证推理解锁复杂视觉生成

来源:https://huggingface.co/papers/2605.14876

当前的文本到图像模型仍然严重依赖“单步生成“范式:模型需要在一次去噪过程中满足所有语义约束。随着提示变得更具组合性,这常常导致计数失败、空间关系断裂、属性混淆和语义漂移。

在这项工作中,我们提出了CLVR(闭环视觉推理),这是一个将图像生成从一次性提示到图像的映射重塑为闭环、多步视觉推理过程的框架。

在每一步中,VLM控制器观察当前画布和累积轨迹,推理剩余的语义差距,并决定是否调用图像生成/编辑、执行验证或终止。扩散模型随后执行选定的视觉动作,更新后的画布被反馈到下一个推理步骤。

VLM不是一次性生成图像,而是持续检查当前画布、识别语义差距、规划下一步动作,并迭代编辑图像,直到满足用户目标。

为了实现这一点,我们构建了:

  • 一个经过验证的轨迹合成流程,包含步骤级和全局验证,
  • 代理提示强化学习(PPRL),用于稳定的长上下文多模态RL,
  • 以及Δ空间权重合并(DSWM),将推理推理从28×2 NFEs减少到仅4 NFEs,且无需昂贵的重新蒸馏。

我们的语义复杂性探测中的一个关键发现是,随着提示复杂性的增加,单步T2I模型表现出能力上限,而CLVR在高复杂性层级中保持了显著更强的性能。

在GenEval、PRISM、WiseBench等基准测试中,CLVR持续改进强大的开源基线,并缩小了与GPT-4o和Gemini等专有系统的差距。

相似文章

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。

视频模型可通过可验证奖励进行推理

Hugging Face Daily Papers

VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。

CogOmniControl: 基于推理的可控视频生成,通过创意意图认知

Hugging Face Daily Papers

CogOmniControl是一个基于推理的可控视频生成框架,它使用在动画制作数据上训练的专业视觉语言模型(CogVLM)从稀疏条件中推断创意意图,然后通过强化学习引导基于扩散的生成器,在新基准上取得最先进的结果。