StateFlow:构建、演化与访问预可视化的三维世界状态
摘要
StateFlow 引入了一种以状态为中心的生成式预可视化框架,利用持久化的三维世界状态来支持电影和游戏设计中迭代式、可控制的场景与摄像机编辑。
查看缓存全文
缓存时间: 2026/08/13 15:34
论文页面 - StateFlow:构建、演化与访问3D世界状态以支持预可视化
来源:https://huggingface.co/papers/2608.12314 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
StateFlow 引入了一种持久化的 3D 世界状态,通过构建、演化并访问结构化的场景与相机表示,为电影和游戏设计实现迭代式、可控的预可视化。
预可视化(Previsualization,https://huggingface.co/papers?q=Previsualization)是电影、游戏、建筑和城市设计中连接创意与制作之间的中间层。它允许创作者迭代地细化场景、动作、相机以及时空动态。然而,现有的生成方法依赖简单提示词,通过一次性图像或视频合成(https://huggingface.co/papers?q=video%20synthesis)来联合控制所有这些因素,导致可控性较弱,且对迭代编辑的支持有限。从根本上说,一个世界由多个具有几何、外观及其他属性的元素以及相机共同组成。不同的帧是通过对共享状态进行局部修改或重新组合而产生的,而该共享状态在其他情况下大多被复用。因此,我们认为缺失的组件是一个显式且持久的工作状态。为了解决这一问题,我们提出了 StateFlow,一个以状态为中心的框架(state-centric framework,https://huggingface.co/papers?q=state-centric%20framework),用于生成式预可视化(generative previsualization,https://huggingface.co/papers?q=generative%20previsualization)。StateFlow 并非一次性生成视频,而是使用一个可编辑的 3D 世界来组织场景结构、演化和相机,同时借助现成的视频模型在需要更高保真度时增强视觉质量。这个 3D 世界以持久化的结构化状态来维护场景元素和相机配置,作为预可视化(previsualization,https://huggingface.co/papers?q=previsualization)的核心工作表示。基于这一洞察,StateFlow 包含三个阶段来构建、演化和访问世界状态。状态构建(State construction)通过先验引导、冲突感知的双视图初始化(dual-view initialization,https://huggingface.co/papers?q=dual-view%20initialization)将生成的 2D 内容提升为连贯的 3D 世界;状态演化(State evolution)在保留世界记忆的同时,将用户意图转化为结构化的状态转换(structured state transitions,https://huggingface.co/papers?q=structured%20state%20transitions),避免每次编辑都进行全场景重新生成;状态访问(State access)使用渲染反馈反射(render-feedback reflection,https://huggingface.co/papers?q=render-feedback%20reflection)将相机方案细化为视觉上可行的轨迹,避免仅依赖 VLM 语义。实验表明,StateFlow 能够为视频创作和类游戏原型设计生成高质量的 3D 世界。
查看 arXiv 页面(https://arxiv.org/abs/2608.12314)查看 PDF(https://arxiv.org/pdf/2608.12314)项目页面(https://yuyangyin.github.io/StateFlow/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.12314)
在您的 Agent 中获取此论文:
hf papers read 2608\.12314
没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.12314 即可从此页面链接到该模型。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.12314 即可从此页面链接到该数据集。
引用此论文的 Space0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.12314 即可从此页面链接到该 Space。
收录此论文的合集0
没有合集收录此论文
将此论文添加到合集(https://huggingface.co/new-collection)即可从此页面链接到该合集。
相似文章
StatePlay:状态感知游戏世界模型,用于机制一致生成
StatePlay 提出了一种状态感知游戏世界模型,该模型联合预测视觉内容和游戏状态,以生成机制一致的游戏推演,在机制保真度上提升了18.6%。
CG-World:面向世界模型的大规模世界状态数据集与协议
CG-World 是一个从工业计算机图形学流水线中衍生的大规模世界状态数据集与协议,明确记录了多模态世界状态、干预和反事实分支,以支持世界模型研究。它展示了在几何条件视频生成、动作预测以及视觉-语言-动作策略的闭环迁移方面的改进。
WorldDirector:构建具有持久动态内存的可控世界模拟器
WorldDirector 提出了一个可控视频世界模拟框架,该框架使用LLM协调3D轨迹和相机运动,将语义运动规划与视觉渲染解耦,实现持久对象内存和稳定外观,即使对象在重新进入场景后仍能保持。
Marionette:预测世界状态、渲染几何、描绘外观
Marionette引入了一种世界模型,该模型显式预测用于交互式游戏的三维关节状态,通过零参数渲染器解耦几何渲染,并使用扩散模型进行外观合成,提高了可控性和长期一致性。
从像素到状态:重新思考作为游戏引擎的交互式世界模型
本文通过考察四个关键维度——动作控制、状态动态、状态-观测持久性和实时生成——重新思考了交互式世界模型作为游戏引擎的角色,并介绍了为《黑神话:悟空》构建的可扩展数据引擎,包含超过90小时的游戏数据,以推进状态感知的游戏世界建模。