Matrix-Game 3.5:通过补丁记忆增强实时流式交互世界模型
摘要
Matrix-Game 3.5 通过几何感知记忆和实时生成能力推进交互世界模型,用于游戏和机器人等应用中的长时程模拟。
查看缓存全文
缓存时间: 2026/09/01 11:48
论文页面 - Matrix-Game 3.5:基于Patch记忆增强的实时流式交互世界模型
来源:https://huggingface.co/papers/2608.29910 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
Matrix-Game 3.5通过几何感知记忆、静态-动态解耦以及面向长时序实时模拟的渐进式蒸馏,改进了交互式世界生成。
交互式世界模型(https://huggingface.co/papers?q=Interactive%20world%20models)将视频生成(https://huggingface.co/papers?q=video%20generation)从离线片段合成扩展到对交互式虚拟世界的持续模拟,使其能够应用于游戏、机器人技术、具身智能体及XR领域。然而,实现稳定的长时序交互式生成仍然具有挑战性,因为模型必须在保持场景几何一致性、动态一致性和相机控制能力的同时,支持实时自回归生成。基于Matrix-Game 3.0,我们提出如图1所示的Matrix-Game 3.5,通过三项关键改进推动实时交互式世界生成向几何感知与长时序一致性模拟迈进。首先,我们提出了统一的几何感知记忆(https://huggingface.co/papers?q=geometry-aware%20memory)框架,其Patch记忆(https://huggingface.co/papers?q=patch-memory)和分块PRoPE(https://huggingface.co/papers?q=tiled-PRoPE)组件无需引入额外的可学习参数,通过结合显式的3D Patch检索与投射式相机条件控制(https://huggingface.co/papers?q=projective%20camera%20conditioning),实现几何一致的相机控制和可靠的长时序场景回忆。其次,我们引入静态-动态解耦的世界表征,分别对静态场景几何和动态主体进行建模,在长时序生成过程中同时保持几何一致性和主体身份特征。第三,我们开发了两阶段渐进式实时蒸馏框架,通过Perceptual Flow Matching(https://huggingface.co/papers?q=Perceptual%20Flow%20Matching)和基于课程的Self-Rollout DMD(https://huggingface.co/papers?q=Self-Rollout%20DMD)将双向扩散模型转换为少步因果生成器(https://huggingface.co/papers?q=causal%20generator),从而实现分钟级实时交互生成。大量实验表明,借助涵盖虚幻引擎模拟环境、开放世界游戏和网络视频的统一训练语料库,Matrix-Game 3.5在长时序场景回忆、精确相机控制、主体一致性、提示驱动的世界生成以及稳定的实时开放世界交互方面均表现出色。
查看arXiv页面(https://arxiv.org/abs/2608.29910)查看PDF(https://arxiv.org/pdf/2608.29910)项目页面(https://matrix-game-v3-5.github.io/)GitHub145(https://github.com/Riemann-Dynamics/Matrix-Game-3.5)添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2608.29910)
引用本文的模型0
无模型关联本文
在模型README.md中引用arxiv.org/abs/2608.29910以从本页链接到该模型。
引用本文的数据集0
无数据集关联本文
在数据集README.md中引用arxiv.org/abs/2608.29910以从本页链接到该数据集。
引用本文的Space0
无Space关联本文
在Space的README.md中引用arxiv.org/abs/2608.29910以从本页链接到该Space。
包含本文的收藏集0
无收藏集包含本文
将本文添加到收藏集(https://huggingface.co/new-collection)以从本页链接到该收藏集。
相似文章
ReWorld:一个具有长期记忆的交互式世界模型
ReWorld 提出了一个交互式世界模型,该模型使用混合注意力窗口和分布匹配的LoRA蒸馏,将短期控制与长期记忆解耦,实现了具有高动作保真度和回忆能力的实时视频生成。
ActWorld:从可探索到可交互的世界模型——基于动作感知记忆
ActWorld提出了一种分块自回归世界模型,具有层次化动作感知记忆,支持物体交互与导航,解决了现有交互世界模型中的数据和记忆瓶颈问题。
面向视频世界模型的可寻址记忆
本文介绍了WorldTrace,一种无需训练的记忆框架,用于长时程视频世界模型,使压缩缓存保持可寻址;同时引入了LoopBench,一个用于在长时间绕行后进行情景回想的基准测试。它在LoopBench上将时间一致性提升了+15.5%,情景回想提升了+19.5%。
MASS:具有权威共享状态的多玩家世界模型
本文介绍了MASS,一种多玩家世界模型方法,通过使用权威共享状态将世界动态与视图渲染解耦,从而实现可扩展且一致的多智能体模拟,支持多达1,024个并发玩家。
MBench:面向视频世界模型记忆能力的综合基准
本文介绍了MBench,一个用于评估视频世界模型在长时间跨度下对实体、环境和因果一致性记忆能力的基准。