用于视频世界模型的潜在空间记忆
摘要
本文介绍了用于视频世界模型的潜在空间记忆,将3D场景信息直接存储在扩散潜在空间中,以避免昂贵的像素空间重建。所提出的Mirage框架实现了高达10.57倍的生成加速和55倍的内存缩减,同时在WorldScore和RealEstate10K上取得了最先进的性能。
查看缓存全文
缓存时间: 2026/06/09 08:43
论文页面 - 面向视频世界模型的潜在空间记忆
来源:https://huggingface.co/papers/2606.09828
摘要
面向视频世界模型的潜在空间记忆将3D场景信息直接存储在扩散潜在空间中,消除了像素空间重建的开销,实现了更快的生成速度和更低的内存占用。
现有的视频世界模型(https://huggingface.co/papers?q=Video%20world%20models)为了在生成帧间保持3D空间一致性,通常依赖于在RGB空间(https://huggingface.co/papers?q=RGB%20space)中构建的显式点云记忆(https://huggingface.co/papers?q=point%20cloud%20memory)。这种设计不仅计算开销大(需要重复渲染和VAE编码),而且本质上是有损的,因为往返像素空间会丢弃学习到的潜在表示中的丰富特征。在本文中,我们引入了面向视频世界模型(https://huggingface.co/papers?q=video%20world%20models)的潜在空间记忆(https://huggingface.co/papers?q=latent%20spatial%20memory),它是一种持久化的3D缓存,将场景信息直接存储在扩散潜在空间(https://huggingface.co/papers?q=diffusion%20latent%20space)中,避免了像素空间重建。在此基础上,我们提出了Mirage,一个潜在空间记忆框架,它通过深度引导的反投影(https://huggingface.co/papers?q=depth-guided%20back-projection)将潜在token提升到3D来构建记忆,并通过直接潜在空间扭曲(https://huggingface.co/papers?q=latent-space%20warping)合成新视角来查询记忆。这种统一的公式消除了像素空间重建的信息损失,也避免了重复编码和渲染的计算负担。实验表明,与显式3D基线相比,潜在空间记忆(https://huggingface.co/papers?q=latent%20spatial%20memory)实现了高达10.57倍的端到端视频生成(https://huggingface.co/papers?q=end-to-end%20video%20generation)加速和55倍的内存占用(https://huggingface.co/papers?q=memory%20footprint)降低。利用扩散模型的几何先验,Mirage在WorldScore(https://huggingface.co/papers?q=WorldScore)上达到了最先进的性能,并在RealEstate10K(https://huggingface.co/papers?q=RealEstate10K)上展现了强大的重建质量。
查看arXiv页面(https://arxiv.org/abs/2606.09828)查看PDF(https://arxiv.org/pdf/2606.09828)项目页面(https://microsoft.github.io/LatentSpatialMemory/)GitHub14(https://github.com/microsoft/LatentSpatialMemory)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.09828)
在您的代理中获取此论文:
hf papers read 2606.09828
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接到此论文
在模型README.md中引用arxiv.org/abs/2606.09828,即可从本页链接到该模型。
引用此论文的数据集0
没有数据集链接到此论文
在数据集README.md中引用arxiv.org/abs/2606.09828,即可从本页链接到该数据集。
引用此论文的Space0
没有Space链接到此论文
在Space README.md中引用arxiv.org/abs/2606.09828,即可从本页链接到该Space。
包含此论文的收藏3
相似文章
@HuggingPapers: 微软研究院推出Mirage潜在空间记忆,直接将3D场景存储为潜在标记,跳过了昂贵的…
微软研究院推出Mirage,一种潜在空间记忆,直接将3D场景存储为潜在标记,实现视频生成速度提升高达10.57倍,内存使用降低55倍,并达到最先进的一致性。
面向视频世界模型的可寻址记忆
本文介绍了WorldTrace,一种无需训练的记忆框架,用于长时程视频世界模型,使压缩缓存保持可寻址;同时引入了LoopBench,一个用于在长时间绕行后进行情景回想的基准测试。它在LoopBench上将时间一致性提升了+15.5%,情景回想提升了+19.5%。
LOCI:面向流式世界模型的空间线性记忆
LOCI 面向流式视频世界模型提出了一种混合空间记忆架构,将键值缓存与一个以相机几何为条件的循环线性注意力记忆相结合。相比全 softmax 基线,它能更忠实地重现被重新观测到的内容,同时将峰值内存降低约 30%,并支持以恒定内存流式处理长视频。
视频世界模型中的记忆(6分钟阅读)
NVIDIA及其合作者的一项最佳论文研究引入了WorldTrace,这是一个无需训练的框架,通过分配固定的槽位秩位置,使自回归视频世界模型中的压缩记忆保持可寻址,从而实现连贯的长程生成和超越训练视野的长距离回忆。
超越像素:从视频先验到4D世界
本文介绍了Latent-to-4D,一种直接从视频扩散潜变量生成4D场景的方法,无需跨生成器重新训练,在几何和时间稳定性上优于级联方法。