Marionette:预测世界状态、渲染几何、描绘外观

Hugging Face Daily Papers 论文

摘要

Marionette引入了一种世界模型,该模型显式预测用于交互式游戏的三维关节状态,通过零参数渲染器解耦几何渲染,并使用扩散模型进行外观合成,提高了可控性和长期一致性。

交互式游戏世界模型通常在像素或潜空间中自回归地直接预测视觉观察,迫使姿势、几何和遮挡等结构属性由相同的生成序列隐式维护。在长时间范围内,这些潜世界属性中的误差会累积,使一致性和可控性变得脆弱。我们显式建模不断演变的世界状态,将精确的几何计算委托给固定的零参数渲染器,并让神经模型合成外观。我们将这一想法实例化为Marionette,一个用于具有关节角色的交互式游戏的世界模型。首先,一个两阶段的自回归动力学模型预测一个显式且可解释的276维3D世界状态,包括多实体关节骨架、度量根轨迹和旋转。其次,一个零参数图形桥将预测的状态转换为姿势控制视频,以封闭形式计算世界空间几何和遮挡。第三,一个控制条件视频扩散观察模型从生成的结构控制中合成逼真的RGB观察。我们的实验确立了Marionette的两个特性。首先,预测的世界状态是直接可控的。强制不匹配的动作流在48个保留片段中改变了根对齐关节误差31%。其次,长期行为由状态决定,并可以在那里修复。如果不加约束,两个生成的角色漂移到21.2米远(录制会话保持在5米左右),三分之一的帧显示地面穿透。对显式状态施加的两条规则——地形碰撞器和分离上限——将穿透减少了66%,并保持配对参与,而无需更改观察模型。通过预测状态路由外观没有我们可检测到的保真度损失,FVD为831,与录制姿势的799相比。
查看原文
查看缓存全文

缓存时间: 2026/08/17 03:45

论文页面 - Marionette:预测世界状态、渲染几何、绘制外观

来源:https://huggingface.co/papers/2608.14530

摘要

Marionette 为互动游戏预测显式的三维关节世界状态,使用固定渲染器处理几何结构,并通过扩散模型合成视频,从而实现直接的层级控制与长程一致性修复。

互动游戏世界模型通常直接在像素或潜空间中自回归生成视觉观测,这使得姿态、几何和遮挡等结构属性不得不由同一个生成序列隐式地维护。在长程生成中,这些潜空间世界属性的误差会不断累积,导致一致性和可控性变得脆弱。我们显式地建模不断演化的世界状态,将精确的几何计算委托给一个固定的、零参数的渲染器(https://huggingface.co/papers?q=zero-parameter%20renderer),而让神经网络模型专注于合成外观。我们将此理念实例化为 Marionette,一个适用于包含关节角色互动游戏的世界模型。首先,一个两阶段的自回归动力学模型(https://huggingface.co/papers?q=autoregressive%20dynamics%20model)预测一个显式且可解释的 276 维三维世界状态(https://huggingface.co/papers?q=3D%20world%20state),该状态包含多实体的关节骨架(https://huggingface.co/papers?q=articulated%20skeletons)、度量单位的根轨迹和旋转。其次,一个零参数图形桥将预测的状态转换为姿态控制视频,以封闭形式计算世界空间的几何和遮挡。第三,一个经控制条件调制(https://huggingface.co/papers?q=control-conditioned)的视频扩散观测模型(https://huggingface.co/papers?q=video-diffusion%20observation%20model)从这些结构化控制信号中合成照片级真实的 RGB 观测。我们的实验确立了 Marionette 的两个特性。第一,预测的世界状态是直接可控的。在 48 个留出片段上强制施加不匹配的动作流,使得基于根关节对齐的误差变化了 31%。第二,长程行为在状态层决定,并可在此层级修复。当不加约束时,两个生成的角色会漂移到相距 21.2 米(录制的会话保持在 5 米左右),且三分之一的画面出现地面穿透。两个施加于显式状态的规则——地形碰撞器与分离上限——将穿透减少了 66%,并保持了角色的互动,无需修改观测模型。通过预测状态来处理外观,其代价是我们无法察觉的保真度损失,其 FVD(https://huggingface.co/papers?q=FVD)为 831,而使用录制姿态的 FVD 为 799。

查看 arXiv 页面 (https://arxiv.org/abs/2608.14530)查看 PDF (https://arxiv.org/pdf/2608.14530)项目页面 (https://alayalab.github.io/Marionette/)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.14530)

获取此论文的代理版本:

hf papers read 2608\.14530

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型关联此论文。 在模型的 README.md 中引用 arxiv.org/abs/2608.14530 即可从本页链接到它。

引用此论文的数据集0

没有数据集关联此论文。 在数据集的 README.md 中引用 arxiv.org/abs/2608.14530 即可从本页链接到它。

引用此论文的空间0

没有空间关联此论文。 在空间的 README.md 中引用 arxiv.org/abs/2608.14530 即可从本页链接到它。

包含此论文的收藏夹0

没有收藏夹包含此论文。 将此论文添加到收藏夹 (https://huggingface.co/new-collection) 即可从本页链接到它。

相似文章

CG-World:面向世界模型的大规模世界状态数据集与协议

arXiv cs.AI

CG-World 是一个从工业计算机图形学流水线中衍生的大规模世界状态数据集与协议,明确记录了多模态世界状态、干预和反事实分支,以支持世界模型研究。它展示了在几何条件视频生成、动作预测以及视觉-语言-动作策略的闭环迁移方面的改进。

从像素到状态:重新思考作为游戏引擎的交互式世界模型

Hugging Face Daily Papers

本文通过考察四个关键维度——动作控制、状态动态、状态-观测持久性和实时生成——重新思考了交互式世界模型作为游戏引擎的角色,并介绍了为《黑神话:悟空》构建的可扩展数据引擎,包含超过90小时的游戏数据,以推进状态感知的游戏世界建模。