CogOmniControl: 基于推理的可控视频生成,通过创意意图认知
摘要
CogOmniControl是一个基于推理的可控视频生成框架,它使用在动画制作数据上训练的专业视觉语言模型(CogVLM)从稀疏条件中推断创意意图,然后通过强化学习引导基于扩散的生成器,在新基准上取得最先进的结果。
查看缓存全文
缓存时间: 2026/05/20 06:37
论文页面 - CogOmniControl:通过创意意图认知的推理驱动可控视频生成
来源:https://huggingface.co/papers/2605.19995
摘要
应用于压缩图像空间的扩散模型能够以较低的计算成本生成高质量的图像,并支持文本或边界框等灵活输入。
最近的扩散模型在视频生成方面实现了强大的逼真度和流畅性,但在抽象、稀疏或复杂的条件下仍然脆弱,导致在专业制作流程(如故事板草图和白模渲染条件)中表现不佳。现有的视频生成模型要么通过适配器注入条件,要么在扩散主干中耦合通用视觉语言模型(VLM),留下了能力差距,无法生成符合用户创意意图的视频。我们提出CogOmniControl,这是一个推理驱动的框架,将可控视频生成分解为创意意图认知和生成。具体来说,我们使用真实的动漫制作数据训练专门的CogVLM。与通用VLM相比,它生成更专业、更清晰的输出,从稀疏和抽象的条件中准确认知用户的创意意图,并将这些线索调整成密集的推理输出。此外,CogOmniDiT通过上下文内生成统一来自各种条件的控制,并通过强化学习与CogVLM的推理输出对齐。此外,利用CogVLM在指导视频生成方面的强大能力,我们释放了其在规划特定评估器方面的潜力,并对生成的视频启用最佳N选1选择。这种集成将整个框架转变为闭环的“类似控制台”架构。我们进一步引入了CogReasonBench和CogControlBench,它们基于真实创意意图的专业工作流程数据构建,而非模拟数据。在两个基准上的实验表明,CogOmniControl超越了现有的开源模型。项目网站:https://um-lab.github.io/CogOmniControl/
查看arXiv页面 (https://arxiv.org/abs/2605.19995) 查看PDF (https://arxiv.org/pdf/2605.19995) 项目页面 (https://um-lab.github.io/CogOmniControl/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.19995)
在您的代理中获取此论文:
hf papers read 2605.19995
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型的README.md中引用arxiv.org/abs/2605.19995以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集的README.md中引用arxiv.org/abs/2605.19995以从此页面链接。
引用此论文的 Spaces0
没有Spaces链接此论文
在Spaces的README.md中引用arxiv.org/abs/2605.19995以从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将这篇论文添加到收藏 (https://huggingface.co/new-collection) 中以从此页面链接。
相似文章
MotiMotion:基于视觉推理的运动控制视频生成
MotiMotion提出了一种先推理后生成的框架,用于运动控制的视频生成。该框架利用视觉语言推理来优化运动轨迹,并采用置信度感知的控制方案来提高合理性,在新基准上优于现有方法。
OpenCoF:通过视频生成学习推理
OpenCoF 提出了一个推理视频数据集和一个微调的视频生成模型,通过多样化的监督和显式推理令牌来改进时间推理,在四个视频推理基准上取得了显著提升。
VideoCoCo:通过代理双引擎系统实现物理一致视频生成的代码即思维链框架
介绍了VideoCoCo,一种代理双引擎框架,使用可执行的Blender代码作为思维链中间表示,用于物理一致的视频生成,在PhyGenBench和VBench-2.0上取得了最先进的分数。
通过闭环验证推理解锁复杂视觉生成
介绍CLVR(闭环视觉推理),一种将文本到图像生成从单步过程重构为闭环多步视觉推理方法的框架,使用VLM控制器和扩散模型,在组合提示上实现了改进的性能。
LynnReal-Omni:面向智能体视觉工作流的原生多模态视频生成
LynnReal-Omni 是一个统一的多模态视频扩散框架,它将智能体视觉控制与高保真生成和实时加速相结合,以实现稳定、可控的视频创作。