StateFlow:构建、演化与访问预可视化的三维世界状态

Hugging Face Daily Papers 论文

摘要

StateFlow 引入了一种以状态为中心的生成式预可视化框架,利用持久化的三维世界状态来支持电影和游戏设计中迭代式、可控制的场景与摄像机编辑。

预可视化是电影、游戏、建筑和城市设计中从创意到制作之间的中间层。它使创作者能够迭代地优化场景、动作、摄像机以及时空动态。然而,现有的生成方法依赖于简单的提示词,通过一次性图像或视频合成来联合控制所有这些因素,导致可控性较弱,对迭代编辑的支持也有限。从根本上说,一个世界由多个具有几何、外观和其他属性的元素以及摄像机组成。不同的帧是通过对这个共享状态进行局部修改或重新组合而生成的,而该状态在其他情况下大多会被复用。因此,我们认为缺失的组件是一个显式且持久的工作状态。为了解决这一问题,我们提出了 StateFlow,一个以状态为中心的生成式预可视化框架。StateFlow 不是一次性生成视频,而是使用一个可编辑的 3D 世界来组织场景结构、演化过程和摄像机,同时在需要更高保真度时,利用现成的视频模型来增强视觉质量。这个世界被维护为场景元素和摄像机配置的持久化结构化 3D 状态,作为预可视化的核心工作表示。基于这一洞察,StateFlow 包含三个阶段:构建、演化和访问世界状态。状态构建通过先验引导、冲突感知的双视图初始化,将生成的 2D 内容提升为一致的 3D 世界;状态演化则将用户意图转化为结构化的状态转换,同时保留世界记忆,避免每次编辑都重新生成整个场景。状态访问使用渲染反馈反射将摄像机方案细化为视觉上可行的轨迹,避免仅仅依赖 VLM 语义。实验表明,StateFlow 能够为视频创作和类游戏原型制作生成高质量的 3D 世界。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:34

论文页面 - StateFlow:构建、演化与访问3D世界状态以支持预可视化

来源:https://huggingface.co/papers/2608.12314 作者:

摘要

StateFlow 引入了一种持久化的 3D 世界状态,通过构建、演化并访问结构化的场景与相机表示,为电影和游戏设计实现迭代式、可控的预可视化。

预可视化(Previsualization,https://huggingface.co/papers?q=Previsualization)是电影、游戏、建筑和城市设计中连接创意与制作之间的中间层。它允许创作者迭代地细化场景、动作、相机以及时空动态。然而,现有的生成方法依赖简单提示词,通过一次性图像或视频合成(https://huggingface.co/papers?q=video%20synthesis)来联合控制所有这些因素,导致可控性较弱,且对迭代编辑的支持有限。从根本上说,一个世界由多个具有几何、外观及其他属性的元素以及相机共同组成。不同的帧是通过对共享状态进行局部修改或重新组合而产生的,而该共享状态在其他情况下大多被复用。因此,我们认为缺失的组件是一个显式且持久的工作状态。为了解决这一问题,我们提出了 StateFlow,一个以状态为中心的框架(state-centric framework,https://huggingface.co/papers?q=state-centric%20framework),用于生成式预可视化(generative previsualization,https://huggingface.co/papers?q=generative%20previsualization)。StateFlow 并非一次性生成视频,而是使用一个可编辑的 3D 世界来组织场景结构、演化和相机,同时借助现成的视频模型在需要更高保真度时增强视觉质量。这个 3D 世界以持久化的结构化状态来维护场景元素和相机配置,作为预可视化(previsualization,https://huggingface.co/papers?q=previsualization)的核心工作表示。基于这一洞察,StateFlow 包含三个阶段来构建、演化和访问世界状态。状态构建(State construction)通过先验引导、冲突感知的双视图初始化(dual-view initialization,https://huggingface.co/papers?q=dual-view%20initialization)将生成的 2D 内容提升为连贯的 3D 世界;状态演化(State evolution)在保留世界记忆的同时,将用户意图转化为结构化的状态转换(structured state transitions,https://huggingface.co/papers?q=structured%20state%20transitions),避免每次编辑都进行全场景重新生成;状态访问(State access)使用渲染反馈反射(render-feedback reflection,https://huggingface.co/papers?q=render-feedback%20reflection)将相机方案细化为视觉上可行的轨迹,避免仅依赖 VLM 语义。实验表明,StateFlow 能够为视频创作和类游戏原型设计生成高质量的 3D 世界。

查看 arXiv 页面(https://arxiv.org/abs/2608.12314)查看 PDF(https://arxiv.org/pdf/2608.12314)项目页面(https://yuyangyin.github.io/StateFlow/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.12314)

在您的 Agent 中获取此论文:

hf papers read 2608\.12314

没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.12314 即可从此页面链接到该模型。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.12314 即可从此页面链接到该数据集。

引用此论文的 Space0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.12314 即可从此页面链接到该 Space。

收录此论文的合集0

没有合集收录此论文

将此论文添加到合集(https://huggingface.co/new-collection)即可从此页面链接到该合集。

相似文章

CG-World:面向世界模型的大规模世界状态数据集与协议

arXiv cs.AI

CG-World 是一个从工业计算机图形学流水线中衍生的大规模世界状态数据集与协议,明确记录了多模态世界状态、干预和反事实分支,以支持世界模型研究。它展示了在几何条件视频生成、动作预测以及视觉-语言-动作策略的闭环迁移方面的改进。

Marionette:预测世界状态、渲染几何、描绘外观

Hugging Face Daily Papers

Marionette引入了一种世界模型,该模型显式预测用于交互式游戏的三维关节状态,通过零参数渲染器解耦几何渲染,并使用扩散模型进行外观合成,提高了可控性和长期一致性。

从像素到状态:重新思考作为游戏引擎的交互式世界模型

Hugging Face Daily Papers

本文通过考察四个关键维度——动作控制、状态动态、状态-观测持久性和实时生成——重新思考了交互式世界模型作为游戏引擎的角色,并介绍了为《黑神话:悟空》构建的可扩展数据引擎,包含超过90小时的游戏数据,以推进状态感知的游戏世界建模。