VideoCoCo:通过代理双引擎系统实现物理一致视频生成的代码即思维链框架

Hugging Face Daily Papers 论文

摘要

介绍了VideoCoCo,一种代理双引擎框架,使用可执行的Blender代码作为思维链中间表示,用于物理一致的视频生成,在PhyGenBench和VBench-2.0上取得了最先进的分数。

文生视频模型已经取得了卓越的视觉质量,但仍然难以生成物理一致的动态效果,因为场景的时间演化必须从高度压缩的文本提示中隐式推断。现有的思维链方法引入了中间计划或视觉状态,但这些表示通常不可执行或时间上稀疏,限制了它们实例化和控制完整时空过程的能力。为了解决这一局限,我们提出了VideoCoCo,一种代理双引擎框架,其中可执行的Blender代码充当过程级思维链。给定文本提示,编码代理合成一个显式指定场景及其时间演化的Blender程序。可执行的仿真引擎运行该程序,生成确定性的时空草稿,随后由生成式视频引擎通过草稿条件编辑将其转换为逼真的视频。这种分解将过程级推理与高保真视觉实现分离开来。为了使视频编辑器适应仿真草稿,我们构建了VideoCoCo-3K,一个包含草稿-指令-目标三元组的精选数据集。VideoCoCo在PhyGenBench上将OmniWeaving基线从0.475提升到0.558,在VBench-2.0上从52.18提升到77.88,在两个基准上都取得了最佳平均分。这些结果表明,可执行代码为物理一致的视频生成提供了一种有效、可控且可检查的中间表示。
查看原文
查看缓存全文

缓存时间: 2026/07/31 05:53

论文页面 - VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

作者:

摘要

文生视频模型已取得了卓越的视觉质量,但它们仍然难以生成物理一致的动态效果,因为场景的时间演化必须从高度压缩的文本提示中隐式推断。现有的思维链方法引入了中间规划或视觉状态,但这些表示通常不可执行或时间上稀疏,限制了它们实例化和控制完整时空过程的能力。为了解决这一局限,我们提出了 VideoCoCo,一个智能体双引擎框架,其中可执行的 Blender 代码充当过程级思维链。给定文本提示后,一个编码智能体合成一个 Blender 程序,明确指定场景及其时间演化。可执行的模拟引擎运行该程序,生成确定性的时空草稿,随后由生成式视频引擎通过草稿条件编辑将其转换为照片级真实的视频。这种分解将过程级推理与高保真视觉实现分离开来。为了使视频编辑器适应模拟草稿,我们构建了 VideoCoCo-3K,一个包含草稿-指令-目标三元组的精选数据集。VideoCoCo 在 PhyGenBench 上将 OmniWeaving 基线从 0.475 提升至 0.558,在 VBench-2.0 上从 52.18 提升至 77.88,在两个基准上都取得了最佳平均分数。这些结果表明,可执行代码为物理一致的视频生成提供了一种有效、可控且可检查的中间表示。

查看 arXiv 页面 (https://arxiv.org/abs/2607.27380) 查看 PDF (https://arxiv.org/pdf/2607.27380) GitHub6 (https://github.com/micky-li-hd/VideoCoCo) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2607.27380)

将此论文获取到你的智能体:

hf papers read 2607.27380

还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2607.27380 即可从本页链接到它。

引用此论文的数据集 0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.27380 即可从本页链接到它。

引用此论文的 Spaces 0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2607.27380 即可从本页链接到它。

包含此论文的收藏集 0

没有收藏集包含此论文

将这篇论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接到它。

相似文章

CogOmniControl: 基于推理的可控视频生成,通过创意意图认知

Hugging Face Daily Papers

CogOmniControl是一个基于推理的可控视频生成框架,它使用在动画制作数据上训练的专业视觉语言模型(CogVLM)从稀疏条件中推断创意意图,然后通过强化学习引导基于扩散的生成器,在新基准上取得最先进的结果。

VideoGen-Agent:增强视频生成智能体

Hugging Face Daily Papers

本文提出了VideoGen-Agent,一种基于强化学习的多模态智能体,它协调工具进行视频生成,在新的VABench基准测试上显著提升了性能。

OpenCoF:通过视频生成学习推理

Hugging Face Daily Papers

OpenCoF 提出了一个推理视频数据集和一个微调的视频生成模型,通过多样化的监督和显式推理令牌来改进时间推理,在四个视频推理基准上取得了显著提升。