OpenCoF:通过视频生成学习推理
摘要
OpenCoF 提出了一个推理视频数据集和一个微调的视频生成模型,通过多样化的监督和显式推理令牌来改进时间推理,在四个视频推理基准上取得了显著提升。
查看缓存全文
缓存时间: 2026/07/10 06:17
论文页面 - OpenCoF:通过视频生成学习推理
来源:https://huggingface.co/papers/2607.08763
摘要
OpenCoF框架引入了一个推理视频数据集和模型,通过多样化的监督信号以及专为视觉和文本线索设计的显式推理标记,提升了时序推理能力。
推理已是大模型的核心能力,尤其在需要理解逻辑后果才能做出可靠决策的场景中。近期的视频生成模型(https://huggingface.co/papers?q=video%20generation%20models)提供了一条不同于传统思维链(CoT)的推理路径:推理可以通过时间上连贯的帧序列展开,这被称为帧链(https://huggingface.co/papers?q=Chain-of-Frame)(CoF)推理。然而,现有视频生成器主要是在通用视频语料上训练的,仍然缺乏多样化的监督信号以及针对CoF推理的专门设计。为解决这一差距,我们提出了OpenCoF框架,它包含OpenCoF-17K数据集(https://huggingface.co/papers?q=OpenCoF-17K%20dataset)(一个覆盖11个任务类别的推理视频数据集)和Wan-CoF(一个微调后的视频模型),用于研究多样化的时序监督(https://huggingface.co/papers?q=temporal%20supervision)是否能够改善CoF行为。在四个视频推理基准(https://huggingface.co/papers?q=video%20reasoning%20benchmarks)上,Wan-CoF相较于Wan2.2-I2V-A14B基线取得了显著提升。在此基础上,我们通过实验探索了更先进的CoF能力设计,即为模型配备视觉和文本推理标记(https://huggingface.co/papers?q=textual%20reasoning%20tokens)。这一机制分别捕捉底层视觉线索和高层语义先验,用于空间和时序推理。通过性能对比和注意力分析(https://huggingface.co/papers?q=attention%20analysis),我们考察了这些标记在模型深度、去噪步骤(https://huggingface.co/papers?q=denoising%20steps)以及时间和空间维度上的贡献。我们的结果表明,更强的视频推理既需要广泛的时序监督(https://huggingface.co/papers?q=temporal%20supervision),也需要用于组织中间推理状态的显式机制。我们开源了数据集、模型和代码,以促进未来面向推理的视频生成研究。
查看arXiv页面(https://arxiv.org/abs/2607.08763)查看PDF(https://arxiv.org/pdf/2607.08763)项目页面(https://opencof.github.io/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.08763)
在你的智能体中获取这篇论文:
hf papers read 2607\.08763
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
暂无模型关联此论文
请在模型的README.md中引用 arxiv.org/abs/2607.08763,以将其链接至此页面。
引用该论文的数据集0
暂无数据集关联此论文
请在数据集的README.md中引用 arxiv.org/abs/2607.08763,以将其链接至此页面。
引用该论文的Spaces0
暂无Space关联此论文
请在Space的README.md中引用 arxiv.org/abs/2607.08763,以将其链接至此页面。
包含该论文的收藏1
相似文章
VideoKR:面向知识和推理密集型视频理解
VideoKR 引入了一个大规模视频推理数据集和基准,旨在通过专家领域内容和人机协同的示例生成,增强知识密集型视频理解。该数据集包含 31.5万个视频推理示例,覆盖 14.5万个专家领域视频。
超大视频推理套件
本文介绍了超大视频推理(VBVR)数据集和基准,这是一个大规模资源,包含超过一百万个视频片段,涵盖200个推理任务,能够系统研究时空推理,并展示了早期出现的涌现泛化迹象。
CogOmniControl: 基于推理的可控视频生成,通过创意意图认知
CogOmniControl是一个基于推理的可控视频生成框架,它使用在动画制作数据上训练的专业视觉语言模型(CogVLM)从稀疏条件中推断创意意图,然后通过强化学习引导基于扩散的生成器,在新基准上取得最先进的结果。
ReaORE:大型推理模型驱动的推理引导渐进式开放关系抽取
提出了ReaORE,一个基于推理引导的开放关系抽取框架,通过从粗到细的推理逐步过滤和预测关系,在两个数据集上优于现有基线。
MotiMotion:基于视觉推理的运动控制视频生成
MotiMotion提出了一种先推理后生成的框架,用于运动控制的视频生成。该框架利用视觉语言推理来优化运动轨迹,并采用置信度感知的控制方案来提高合理性,在新基准上优于现有方法。