通过闭环验证推理解锁复杂视觉生成
摘要
介绍CLVR(闭环视觉推理),一种将文本到图像生成从单步过程重构为闭环多步视觉推理方法的框架,使用VLM控制器和扩散模型,在组合提示上实现了改进的性能。
查看缓存全文
缓存时间: 2026/05/15 08:24
论文页面 - 通过闭环验证推理解锁复杂视觉生成
来源:https://huggingface.co/papers/2605.14876
当前的文本到图像模型仍然严重依赖“单步生成“范式:模型需要在一次去噪过程中满足所有语义约束。随着提示变得更具组合性,这常常导致计数失败、空间关系断裂、属性混淆和语义漂移。
在这项工作中,我们提出了CLVR(闭环视觉推理),这是一个将图像生成从一次性提示到图像的映射重塑为闭环、多步视觉推理过程的框架。
在每一步中,VLM控制器观察当前画布和累积轨迹,推理剩余的语义差距,并决定是否调用图像生成/编辑、执行验证或终止。扩散模型随后执行选定的视觉动作,更新后的画布被反馈到下一个推理步骤。
VLM不是一次性生成图像,而是持续检查当前画布、识别语义差距、规划下一步动作,并迭代编辑图像,直到满足用户目标。
为了实现这一点,我们构建了:
- 一个经过验证的轨迹合成流程,包含步骤级和全局验证,
- 代理提示强化学习(PPRL),用于稳定的长上下文多模态RL,
- 以及Δ空间权重合并(DSWM),将推理推理从28×2 NFEs减少到仅4 NFEs,且无需昂贵的重新蒸馏。
我们的语义复杂性探测中的一个关键发现是,随着提示复杂性的增加,单步T2I模型表现出能力上限,而CLVR在高复杂性层级中保持了显著更强的性能。
在GenEval、PRISM、WiseBench等基准测试中,CLVR持续改进强大的开源基线,并缩小了与GPT-4o和Gemini等专有系统的差距。
相似文章
CollabVR:基于视觉语言模型与视频生成模型的协作式视频推理
CollabVR 是一篇研究论文,提出了一种闭环框架,该框架通过协作整合视觉语言模型与视频生成模型,以改善视觉推理并实时纠正推理失败。
视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟
视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。
视频模型可通过可验证奖励进行推理
VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。
CogOmniControl: 基于推理的可控视频生成,通过创意意图认知
CogOmniControl是一个基于推理的可控视频生成框架,它使用在动画制作数据上训练的专业视觉语言模型(CogVLM)从稀疏条件中推断创意意图,然后通过强化学习引导基于扩散的生成器,在新基准上取得最先进的结果。
VLM是通过自适应测试时优化进行视频推理的优秀教师
本文提出一种新范式:视觉-语言模型(VLM)作为测试时教师,通过可微分奖励和LoRA优化引导视频生成模型(VGM),在视频推理基准测试上平均提升16.7个百分点。