OpenCoF:通过视频生成学习推理

Hugging Face Daily Papers 论文

摘要

OpenCoF 提出了一个推理视频数据集和一个微调的视频生成模型,通过多样化的监督和显式推理令牌来改进时间推理,在四个视频推理基准上取得了显著提升。

推理已成为大型模型的核心能力,尤其在需要理解逻辑后果才能做出可靠决策时。最近的视频生成模型提供了一种不同于先前思维链(CoT)的推理路径:推理可以通过时间上连续的帧展开,称为帧链(CoF)推理。然而,现有的视频生成器主要是在通用视频语料上训练的,仍然缺乏多样化的监督和专门针对CoF推理的设计。为解决这一差距,我们提出了OpenCoF框架,包括OpenCoF-17K数据集(一个涵盖11个任务家族的推理视频数据集)和Wan-CoF(一个微调后的视频模型,用于研究多样化的时间监督是否能改善CoF行为)。在四个视频推理基准上,Wan-CoF相比Wan2.2-I2V-A14B基线取得了显著提升。在此基础上,我们通过实证探索了更先进的CoF能力设计,即为模型配备视觉和文本推理令牌。该机制分别捕获用于空间和时间推理的低级视觉线索和高级语义先验。通过性能比较和注意力分析,我们研究了这些令牌在模型深度、去噪步骤、空间和时间上的贡献。我们的结果表明,更强的视频推理需要广泛的时间监督和用于组织中间推理状态的显式机制。我们开源了数据集、模型和代码,以促进未来面向推理的视频生成研究。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:17

论文页面 - OpenCoF:通过视频生成学习推理

来源:https://huggingface.co/papers/2607.08763

摘要

OpenCoF框架引入了一个推理视频数据集和模型,通过多样化的监督信号以及专为视觉和文本线索设计的显式推理标记,提升了时序推理能力。

推理已是大模型的核心能力,尤其在需要理解逻辑后果才能做出可靠决策的场景中。近期的视频生成模型(https://huggingface.co/papers?q=video%20generation%20models)提供了一条不同于传统思维链(CoT)的推理路径:推理可以通过时间上连贯的帧序列展开,这被称为帧链(https://huggingface.co/papers?q=Chain-of-Frame)(CoF)推理。然而,现有视频生成器主要是在通用视频语料上训练的,仍然缺乏多样化的监督信号以及针对CoF推理的专门设计。为解决这一差距,我们提出了OpenCoF框架,它包含OpenCoF-17K数据集(https://huggingface.co/papers?q=OpenCoF-17K%20dataset)(一个覆盖11个任务类别的推理视频数据集)和Wan-CoF(一个微调后的视频模型),用于研究多样化的时序监督(https://huggingface.co/papers?q=temporal%20supervision)是否能够改善CoF行为。在四个视频推理基准(https://huggingface.co/papers?q=video%20reasoning%20benchmarks)上,Wan-CoF相较于Wan2.2-I2V-A14B基线取得了显著提升。在此基础上,我们通过实验探索了更先进的CoF能力设计,即为模型配备视觉和文本推理标记(https://huggingface.co/papers?q=textual%20reasoning%20tokens)。这一机制分别捕捉底层视觉线索和高层语义先验,用于空间和时序推理。通过性能对比和注意力分析(https://huggingface.co/papers?q=attention%20analysis),我们考察了这些标记在模型深度、去噪步骤(https://huggingface.co/papers?q=denoising%20steps)以及时间和空间维度上的贡献。我们的结果表明,更强的视频推理既需要广泛的时序监督(https://huggingface.co/papers?q=temporal%20supervision),也需要用于组织中间推理状态的显式机制。我们开源了数据集、模型和代码,以促进未来面向推理的视频生成研究。

查看arXiv页面(https://arxiv.org/abs/2607.08763)查看PDF(https://arxiv.org/pdf/2607.08763)项目页面(https://opencof.github.io/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.08763)

在你的智能体中获取这篇论文:

hf papers read 2607\.08763

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型0

暂无模型关联此论文

请在模型的README.md中引用 arxiv.org/abs/2607.08763,以将其链接至此页面。

引用该论文的数据集0

暂无数据集关联此论文

请在数据集的README.md中引用 arxiv.org/abs/2607.08763,以将其链接至此页面。

引用该论文的Spaces0

暂无Space关联此论文

请在Space的README.md中引用 arxiv.org/abs/2607.08763,以将其链接至此页面。

包含该论文的收藏1

相似文章

VideoKR:面向知识和推理密集型视频理解

Hugging Face Daily Papers

VideoKR 引入了一个大规模视频推理数据集和基准,旨在通过专家领域内容和人机协同的示例生成,增强知识密集型视频理解。该数据集包含 31.5万个视频推理示例,覆盖 14.5万个专家领域视频。

超大视频推理套件

Papers with Code Trending

本文介绍了超大视频推理(VBVR)数据集和基准,这是一个大规模资源,包含超过一百万个视频片段,涵盖200个推理任务,能够系统研究时空推理,并展示了早期出现的涌现泛化迹象。

CogOmniControl: 基于推理的可控视频生成,通过创意意图认知

Hugging Face Daily Papers

CogOmniControl是一个基于推理的可控视频生成框架,它使用在动画制作数据上训练的专业视觉语言模型(CogVLM)从稀疏条件中推断创意意图,然后通过强化学习引导基于扩散的生成器,在新基准上取得最先进的结果。

MotiMotion:基于视觉推理的运动控制视频生成

Hugging Face Daily Papers

MotiMotion提出了一种先推理后生成的框架,用于运动控制的视频生成。该框架利用视觉语言推理来优化运动轨迹,并采用置信度感知的控制方案来提高合理性,在新基准上优于现有方法。