用于视频世界模型的潜在空间记忆

Hugging Face Daily Papers 论文

摘要

本文介绍了用于视频世界模型的潜在空间记忆,将3D场景信息直接存储在扩散潜在空间中,以避免昂贵的像素空间重建。所提出的Mirage框架实现了高达10.57倍的生成加速和55倍的内存缩减,同时在WorldScore和RealEstate10K上取得了最先进的性能。

通常在生成的帧之间保持3D空间一致性的视频世界模型依赖于在RGB空间中构建的显式点云记忆。这种设计既计算成本高,需要重复渲染和VAE编码,又本质上是有损的,因为经过像素空间的往返过程会丢弃学习到的潜在表示的丰富特征。在本文中,我们引入了用于视频世界模型的潜在空间记忆,这是一种持久化的3D缓存,直接将场景信息存储在扩散潜在空间中,避免了像素空间重建。在此基础上,我们提出了Mirage,一个潜在空间记忆框架,通过深度引导的反投影将潜在标记提升到3D来构建记忆,并通过直接潜在空间变形合成新视图来查询该记忆。这种统一的表述消除了像素空间重建的信息损失以及重复编码和渲染的计算负担。实验表明,与显式3D基线相比,潜在空间记忆实现了高达10.57倍的端到端视频生成加速和55倍的内存占用减少。利用扩散模型的几何先验,Mirage在WorldScore上取得了最先进的性能,并在RealEstate10K上取得了强大的重建质量。
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:43

论文页面 - 面向视频世界模型的潜在空间记忆

来源:https://huggingface.co/papers/2606.09828

摘要

面向视频世界模型的潜在空间记忆将3D场景信息直接存储在扩散潜在空间中,消除了像素空间重建的开销,实现了更快的生成速度和更低的内存占用。

现有的视频世界模型(https://huggingface.co/papers?q=Video%20world%20models)为了在生成帧间保持3D空间一致性,通常依赖于在RGB空间(https://huggingface.co/papers?q=RGB%20space)中构建的显式点云记忆(https://huggingface.co/papers?q=point%20cloud%20memory)。这种设计不仅计算开销大(需要重复渲染和VAE编码),而且本质上是有损的,因为往返像素空间会丢弃学习到的潜在表示中的丰富特征。在本文中,我们引入了面向视频世界模型(https://huggingface.co/papers?q=video%20world%20models)的潜在空间记忆(https://huggingface.co/papers?q=latent%20spatial%20memory),它是一种持久化的3D缓存,将场景信息直接存储在扩散潜在空间(https://huggingface.co/papers?q=diffusion%20latent%20space)中,避免了像素空间重建。在此基础上,我们提出了Mirage,一个潜在空间记忆框架,它通过深度引导的反投影(https://huggingface.co/papers?q=depth-guided%20back-projection)将潜在token提升到3D来构建记忆,并通过直接潜在空间扭曲(https://huggingface.co/papers?q=latent-space%20warping)合成新视角来查询记忆。这种统一的公式消除了像素空间重建的信息损失,也避免了重复编码和渲染的计算负担。实验表明,与显式3D基线相比,潜在空间记忆(https://huggingface.co/papers?q=latent%20spatial%20memory)实现了高达10.57倍的端到端视频生成(https://huggingface.co/papers?q=end-to-end%20video%20generation)加速和55倍的内存占用(https://huggingface.co/papers?q=memory%20footprint)降低。利用扩散模型的几何先验,Mirage在WorldScore(https://huggingface.co/papers?q=WorldScore)上达到了最先进的性能,并在RealEstate10K(https://huggingface.co/papers?q=RealEstate10K)上展现了强大的重建质量。

查看arXiv页面(https://arxiv.org/abs/2606.09828)查看PDF(https://arxiv.org/pdf/2606.09828)项目页面(https://microsoft.github.io/LatentSpatialMemory/)GitHub14(https://github.com/microsoft/LatentSpatialMemory)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.09828)

在您的代理中获取此论文:

hf papers read 2606.09828

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接到此论文

在模型README.md中引用arxiv.org/abs/2606.09828,即可从本页链接到该模型。

引用此论文的数据集0

没有数据集链接到此论文

在数据集README.md中引用arxiv.org/abs/2606.09828,即可从本页链接到该数据集。

引用此论文的Space0

没有Space链接到此论文

在Space README.md中引用arxiv.org/abs/2606.09828,即可从本页链接到该Space。

包含此论文的收藏3

相似文章

面向视频世界模型的可寻址记忆

Hugging Face Daily Papers

本文介绍了WorldTrace,一种无需训练的记忆框架,用于长时程视频世界模型,使压缩缓存保持可寻址;同时引入了LoopBench,一个用于在长时间绕行后进行情景回想的基准测试。它在LoopBench上将时间一致性提升了+15.5%,情景回想提升了+19.5%。

LOCI:面向流式世界模型的空间线性记忆

Hugging Face Daily Papers

LOCI 面向流式视频世界模型提出了一种混合空间记忆架构,将键值缓存与一个以相机几何为条件的循环线性注意力记忆相结合。相比全 softmax 基线,它能更忠实地重现被重新观测到的内容,同时将峰值内存降低约 30%,并支持以恒定内存流式处理长视频。

视频世界模型中的记忆(6分钟阅读)

TLDR AI

NVIDIA及其合作者的一项最佳论文研究引入了WorldTrace,这是一个无需训练的框架,通过分配固定的槽位秩位置,使自回归视频世界模型中的压缩记忆保持可寻址,从而实现连贯的长程生成和超越训练视野的长距离回忆。

超越像素:从视频先验到4D世界

Hugging Face Daily Papers

本文介绍了Latent-to-4D,一种直接从视频扩散潜变量生成4D场景的方法,无需跨生成器重新训练,在几何和时间稳定性上优于级联方法。