CogOmniControl: 基于推理的可控视频生成,通过创意意图认知

Hugging Face Daily Papers 论文

摘要

CogOmniControl是一个基于推理的可控视频生成框架,它使用在动画制作数据上训练的专业视觉语言模型(CogVLM)从稀疏条件中推断创意意图,然后通过强化学习引导基于扩散的生成器,在新基准上取得最先进的结果。

最近的扩散模型在视频生成中实现了强烈的逼真度和流畅性,但在抽象、稀疏或复杂条件下仍然脆弱,导致在专业制作工作流(如故事板草图和黏土渲染条件)中表现不佳。现有的视频生成模型,要么通过适配器注入条件,要么在扩散骨架中耦合一个通用视觉语言模型(VLM),存在能力差距,无法生成与用户创意意图一致的视频。我们提出CogOmniControl,这是一个基于推理的框架,将可控视频生成分解为创意意图认知和生成。具体来说,我们使用真实的动画制作数据训练了一个专门的CogVLM。与通用VLM相比,它能生成更专业和清晰的输出,从稀疏和抽象条件中准确认知用户的创意意图,并将这些线索转化为密集的推理输出。此外,CogOmniDiT通过上下文生成统一了来自各种条件的控制,并通过强化学习与CogVLM的推理输出对齐。此外,利用CogVLM在指导视频生成方面的强大能力,我们释放了其在规划特定评估器方面的潜力,并为生成的视频启用了Best-of-N选择。这种集成将整个框架转变为一个闭环的“笼头式”架构。我们还引入了CogReasonBench和CogControlBench,它们基于专业工作流数据构建,携带真正的创意意图而非模拟的。在两个基准上的实验表明,CogOmniControl超越了现有的开源模型。项目网站:https://um-lab.github.io/CogOmniControl/
查看原文
查看缓存全文

缓存时间: 2026/05/20 06:37

论文页面 - CogOmniControl:通过创意意图认知的推理驱动可控视频生成

来源:https://huggingface.co/papers/2605.19995

摘要

应用于压缩图像空间的扩散模型能够以较低的计算成本生成高质量的图像,并支持文本或边界框等灵活输入。

最近的扩散模型在视频生成方面实现了强大的逼真度和流畅性,但在抽象、稀疏或复杂的条件下仍然脆弱,导致在专业制作流程(如故事板草图和白模渲染条件)中表现不佳。现有的视频生成模型要么通过适配器注入条件,要么在扩散主干中耦合通用视觉语言模型(VLM),留下了能力差距,无法生成符合用户创意意图的视频。我们提出CogOmniControl,这是一个推理驱动的框架,将可控视频生成分解为创意意图认知和生成。具体来说,我们使用真实的动漫制作数据训练专门的CogVLM。与通用VLM相比,它生成更专业、更清晰的输出,从稀疏和抽象的条件中准确认知用户的创意意图,并将这些线索调整成密集的推理输出。此外,CogOmniDiT通过上下文内生成统一来自各种条件的控制,并通过强化学习与CogVLM的推理输出对齐。此外,利用CogVLM在指导视频生成方面的强大能力,我们释放了其在规划特定评估器方面的潜力,并对生成的视频启用最佳N选1选择。这种集成将整个框架转变为闭环的“类似控制台”架构。我们进一步引入了CogReasonBench和CogControlBench,它们基于真实创意意图的专业工作流程数据构建,而非模拟数据。在两个基准上的实验表明,CogOmniControl超越了现有的开源模型。项目网站:https://um-lab.github.io/CogOmniControl/

查看arXiv页面 (https://arxiv.org/abs/2605.19995) 查看PDF (https://arxiv.org/pdf/2605.19995) 项目页面 (https://um-lab.github.io/CogOmniControl/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.19995)

在您的代理中获取此论文:

hf papers read 2605.19995

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型的README.md中引用arxiv.org/abs/2605.19995以从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集的README.md中引用arxiv.org/abs/2605.19995以从此页面链接。

引用此论文的 Spaces0

没有Spaces链接此论文

在Spaces的README.md中引用arxiv.org/abs/2605.19995以从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

将这篇论文添加到收藏 (https://huggingface.co/new-collection) 中以从此页面链接。

相似文章

MotiMotion:基于视觉推理的运动控制视频生成

Hugging Face Daily Papers

MotiMotion提出了一种先推理后生成的框架,用于运动控制的视频生成。该框架利用视觉语言推理来优化运动轨迹,并采用置信度感知的控制方案来提高合理性,在新基准上优于现有方法。

OpenCoF:通过视频生成学习推理

Hugging Face Daily Papers

OpenCoF 提出了一个推理视频数据集和一个微调的视频生成模型,通过多样化的监督和显式推理令牌来改进时间推理,在四个视频推理基准上取得了显著提升。

通过闭环验证推理解锁复杂视觉生成

Hugging Face Daily Papers

介绍CLVR(闭环视觉推理),一种将文本到图像生成从单步过程重构为闭环多步视觉推理方法的框架,使用VLM控制器和扩散模型,在组合提示上实现了改进的性能。