空间记忆智能:为世界模型注入理解驱动的长期记忆

Hugging Face Daily Papers 论文

摘要

论文提出了空间记忆智能(Spatial Memory Intelligence, SMI)框架,它首次采用理解模型(MLLM)在长视频世界模型中系统化地管理空间记忆,具体通过四个原子操作实现:空间聚类、簇内稀疏化、动作感知检索以及可靠性感知过滤。实验表明,该方法在多种世界模型主干上均提升了记忆稀疏性、生成稳定性和空间一致性。

长视频生成与世界模型通过在用户动作和历史记忆条件下预测未来观测,在交互式娱乐与具身仿真方面展现出巨大潜力。然而,随着记忆序列不断变长、结构日益复杂,管理长程空间上下文变得愈发困难,这呼唤一种更加智能化、系统化的记忆管理策略。基于多模态大语言模型(MLMs)不断进步的空间推理能力以及统一模型的宏大愿景,我们提出了空间记忆智能(Spatial Memory Intelligence, SMI)框架,这是首个在长视频世界模型中系统地利用理解模型进行空间记忆管理的框架。SMI 引入了四个协同配合的原子操作:空间聚类(spatial clustering)、簇内稀疏化(within-cluster sparsification)、动作感知检索(action-aware retrieval)以及可靠性感知过滤(reliability-aware filtering)。在多个基线、基准和世界模型主干上开展的大量实验,验证了 SMI 的有效性与泛化能力,在记忆稀疏性、生成稳定性和空间一致性方面实现了全面提升。
查看原文
查看缓存全文

缓存时间: 2026/10/05 08:46

论文页面 - 空间记忆智能:为世界模型赋予理解驱动的长期记忆

来源:https://huggingface.co/papers/2610.02521

摘要

长视频生成与世界模型通过在用户操作和历史记忆条件下预测未来观测,在交互式娱乐和具身模拟方面展现出强大潜力。然而,随着记忆序列不断变长、结构日益复杂,管理大范围空间上下文变得越来越具有挑战性,这需要一种更智能、更系统的记忆管理策略。在多模态大语言模型(MLLMs)不断进步的空间推理能力以及统一模型的更广阔愿景基础上,我们提出了 Spatial Memory Intelligence(SMI),这是首个系统性地利用理解模型对长视频世界模型进行空间记忆管理的框架。SMI 引入了四个协同配合的原子操作:空间聚类、簇内稀疏化、动作感知检索和可靠性感知过滤。在多个基线方法、基准测试和世界模型骨干网络上的大量实验表明,SMI 具有有效性和泛化能力,在记忆稀疏性、生成稳定性和空间一致性方面均实现了全面的提升。

查看 arXiv 页面 · 查看 PDF · 项目页面 · GitHub · 添加到收藏

在你的智能体中获取这篇论文:

hf papers read 2610.02521

没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

没有模型关联到本文。

在模型的 README.md 中引用 arxiv.org/abs/2610.02521,即可从此页面链接该模型。

引用本文的数据集 0

没有数据集关联到本文。

在数据集的 README.md 中引用 arxiv.org/abs/2610.02521,即可从此页面链接该数据集。

引用本文的 Spaces 0

没有 Space 关联到本文。

在 Space 的 README.md 中引用 arxiv.org/abs/2610.02521,即可从此页面链接该 Space。

包含本文的合集 0

没有合集包含本文。

将本文添加到合集即可从此页面链接它。

相似文章

Spatial Memory Agent:基于经验的过程记忆用于空间智能

Hugging Face Daily Papers

本文介绍了 Spatial Memory Agent (SMA),一种运行时框架,通过验证器引导的反思和可复用记忆,在不进行参数更新或使用外部工具的情况下提升冻结视觉语言模型的空间推理能力,在五个基准和四个基础 VLM 上取得了强劲的结果。

用于视频世界模型的潜在空间记忆

Hugging Face Daily Papers

本文介绍了用于视频世界模型的潜在空间记忆,将3D场景信息直接存储在扩散潜在空间中,以避免昂贵的像素空间重建。所提出的Mirage框架实现了高达10.57倍的生成加速和55倍的内存缩减,同时在WorldScore和RealEstate10K上取得了最先进的性能。

心智世界建模

Hugging Face Daily Papers

本文介绍了心智世界建模(MWM),这是一个将隐藏的心理状态作为世界模型核心组件的框架,并提出了MENTIS,一个无需训练的基线。基于8个LLM世界模型的实验表明,显式的心智状态建模对于预测情境化场景中的人类决策至关重要。

用于扩散世界模型的记忆专家组合

arXiv cs.LG

一种新的基于扩散的世界模型框架,利用专门记忆专家(短期、长期情境和空间)的组合,实现更好的时间一致性和长上下文建模,且无二次成本。

当记忆说谎:VLM智能体空间记忆过时性的实证研究

Hugging Face Daily Papers

本文实证研究了视觉语言模型智能体中的空间记忆过时性问题,发现模型常常忽略矛盾的视觉证据,并且信任过时记忆会增加安全风险。作者提出了审计机制,但表明在记忆-观察冲突下的视觉接地仍是一个重大开放挑战。