Marionette:预测世界状态、渲染几何、描绘外观
摘要
Marionette引入了一种世界模型,该模型显式预测用于交互式游戏的三维关节状态,通过零参数渲染器解耦几何渲染,并使用扩散模型进行外观合成,提高了可控性和长期一致性。
查看缓存全文
缓存时间: 2026/08/17 03:45
论文页面 - Marionette:预测世界状态、渲染几何、绘制外观
来源:https://huggingface.co/papers/2608.14530
摘要
Marionette 为互动游戏预测显式的三维关节世界状态,使用固定渲染器处理几何结构,并通过扩散模型合成视频,从而实现直接的层级控制与长程一致性修复。
互动游戏世界模型通常直接在像素或潜空间中自回归生成视觉观测,这使得姿态、几何和遮挡等结构属性不得不由同一个生成序列隐式地维护。在长程生成中,这些潜空间世界属性的误差会不断累积,导致一致性和可控性变得脆弱。我们显式地建模不断演化的世界状态,将精确的几何计算委托给一个固定的、零参数的渲染器(https://huggingface.co/papers?q=zero-parameter%20renderer),而让神经网络模型专注于合成外观。我们将此理念实例化为 Marionette,一个适用于包含关节角色互动游戏的世界模型。首先,一个两阶段的自回归动力学模型(https://huggingface.co/papers?q=autoregressive%20dynamics%20model)预测一个显式且可解释的 276 维三维世界状态(https://huggingface.co/papers?q=3D%20world%20state),该状态包含多实体的关节骨架(https://huggingface.co/papers?q=articulated%20skeletons)、度量单位的根轨迹和旋转。其次,一个零参数图形桥将预测的状态转换为姿态控制视频,以封闭形式计算世界空间的几何和遮挡。第三,一个经控制条件调制(https://huggingface.co/papers?q=control-conditioned)的视频扩散观测模型(https://huggingface.co/papers?q=video-diffusion%20observation%20model)从这些结构化控制信号中合成照片级真实的 RGB 观测。我们的实验确立了 Marionette 的两个特性。第一,预测的世界状态是直接可控的。在 48 个留出片段上强制施加不匹配的动作流,使得基于根关节对齐的误差变化了 31%。第二,长程行为在状态层决定,并可在此层级修复。当不加约束时,两个生成的角色会漂移到相距 21.2 米(录制的会话保持在 5 米左右),且三分之一的画面出现地面穿透。两个施加于显式状态的规则——地形碰撞器与分离上限——将穿透减少了 66%,并保持了角色的互动,无需修改观测模型。通过预测状态来处理外观,其代价是我们无法察觉的保真度损失,其 FVD(https://huggingface.co/papers?q=FVD)为 831,而使用录制姿态的 FVD 为 799。
查看 arXiv 页面 (https://arxiv.org/abs/2608.14530)查看 PDF (https://arxiv.org/pdf/2608.14530)项目页面 (https://alayalab.github.io/Marionette/)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.14530)
获取此论文的代理版本:
hf papers read 2608\.14530
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型关联此论文。 在模型的 README.md 中引用 arxiv.org/abs/2608.14530 即可从本页链接到它。
引用此论文的数据集0
没有数据集关联此论文。 在数据集的 README.md 中引用 arxiv.org/abs/2608.14530 即可从本页链接到它。
引用此论文的空间0
没有空间关联此论文。 在空间的 README.md 中引用 arxiv.org/abs/2608.14530 即可从本页链接到它。
包含此论文的收藏夹0
没有收藏夹包含此论文。 将此论文添加到收藏夹 (https://huggingface.co/new-collection) 即可从本页链接到它。
相似文章
StatePlay:状态感知游戏世界模型,用于机制一致生成
StatePlay 提出了一种状态感知游戏世界模型,该模型联合预测视觉内容和游戏状态,以生成机制一致的游戏推演,在机制保真度上提升了18.6%。
CG-World:面向世界模型的大规模世界状态数据集与协议
CG-World 是一个从工业计算机图形学流水线中衍生的大规模世界状态数据集与协议,明确记录了多模态世界状态、干预和反事实分支,以支持世界模型研究。它展示了在几何条件视频生成、动作预测以及视觉-语言-动作策略的闭环迁移方面的改进。
PAIWorld: 面向机器人操作的三维一致世界基础模型
PAIWorld 通过几何感知和跨视图注意力机制增强扩散变换器世界模型,提升机器人操作任务中的多视图三维一致性,在基准测试上达到最优结果。
StateFlow:构建、演化与访问预可视化的三维世界状态
StateFlow 引入了一种以状态为中心的生成式预可视化框架,利用持久化的三维世界状态来支持电影和游戏设计中迭代式、可控制的场景与摄像机编辑。
从像素到状态:重新思考作为游戏引擎的交互式世界模型
本文通过考察四个关键维度——动作控制、状态动态、状态-观测持久性和实时生成——重新思考了交互式世界模型作为游戏引擎的角色,并介绍了为《黑神话:悟空》构建的可扩展数据引擎,包含超过90小时的游戏数据,以推进状态感知的游戏世界建模。