当记忆说谎:VLM智能体空间记忆过时性的实证研究
摘要
本文实证研究了视觉语言模型智能体中的空间记忆过时性问题,发现模型常常忽略矛盾的视觉证据,并且信任过时记忆会增加安全风险。作者提出了审计机制,但表明在记忆-观察冲突下的视觉接地仍是一个重大开放挑战。
查看缓存全文
缓存时间: 2026/08/06 05:50
论文页面 - When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents
来源:https://huggingface.co/papers/2608.04574
摘要
记忆增强的VLM智能体依赖持久化的空间知识行事,但随着环境变化,这些知识会悄然过期。我们探究当智能体必须在确信的记忆主张与矛盾的观察之间进行调和时会发生什么,以及当前模型能否在冲突演变为与安全相关的错误之前发现它。我们使用一个动态Frozen Lake测试平台,将过期检测任务与下游导航任务配对,涉及三个闭源模型和三个开放权重VLM,同时使用文本和图像输入(1,800次检测运行,以及在共享50个种子的规模下,四个LLM导航器进行的12,000次文本模式导航回合)。我们发现了三个结果。首先,文本可解性并不意味视觉接地:能够可靠地从文本中标记过期条目的模型,在相同网格上的视觉F1分数却从0.887跨度到0.067,最弱的模型还会继续做出流畅、自信但忽视图像的决策。其次,在没有审计的情况下使用过期记忆是一种安全负担:在我们主要的GPT-4o设置中,信任原始记忆的智能体的死亡频率是不给任何记忆的同一智能体的两倍以上。第三,审计有帮助但并未弥合差距:一个透明的读取时过滤器在文本模式下消除了大部分安全成本,然而即使使用oracle过期标签,在当前网格大小上也没有带来进一步显著提升;而当视觉审计不可靠时,过滤无法带来一致的好处。这些结果共同将空间记忆过期界定为一种安全失败模式,并指出在记忆-观察冲突下实现可靠的视觉接地和动作选择,是记忆增强智能体所面临的核心开放性挑战。
查看arXiv页面 (https://arxiv.org/abs/2608.04574) 查看PDF (https://arxiv.org/pdf/2608.04574) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.04574)
在你的智能体中获取这篇论文:
hf papers read 2608.04574
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接到此论文
引用 arxiv.org/abs/2608.04574 在模型 README.md 中,即可从此页面链接到该模型。
引用此论文的数据集0
没有数据集链接到此论文
引用 arxiv.org/abs/2608.04574 在数据集 README.md 中,即可从此页面链接到该数据集。
引用此论文的Spaces0
没有Space链接到此论文
引用 arxiv.org/abs/2608.04574 在 Space README.md 中,即可从此页面链接到该Space。
包含此论文的集合0
没有包含此论文的集合
将此论文添加到集合 (https://huggingface.co/new-collection) 以从此页面链接到它。
相似文章
When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents
This paper empirically studies how VLM agents with persistent spatial memory fail when memory becomes stale, using a dynamic FrozenLake testbed. It finds that trusting stale memory can more than double death rates, and that read-time auditing helps but does not fully close the gap.
STALE:LLM智能体能否识别记忆何时失效?
本文识别了LLM智能体中的一个关键失效模式:当新证据与先前信念冲突时,它们无法更新个性化记忆。本文引入了STALE基准和一个三维探测框架,揭示了即使最佳模型也仅达到55.2%的准确率,并提出了CUPMem作为鲁棒记忆修正的原型。
空间记忆必须存储什么:遮挡作为语言代理记忆的测试
本文研究空间几何是否提升语言代理记忆回忆能力,证明几何必须主导回忆而非近因或重要性,并指出在3D体素世界中,射线追踪可见性谓词对于遮挡处理至关重要。
Spatial Memory Agent:基于经验的过程记忆用于空间智能
本文介绍了 Spatial Memory Agent (SMA),一种运行时框架,通过验证器引导的反思和可复用记忆,在不进行参数更新或使用外部工具的情况下提升冻结视觉语言模型的空间推理能力,在五个基准和四个基础 VLM 上取得了强劲的结果。
面向多智能体 VLM 系统的协作记忆
本文提出了一种面向多智能体视觉语言模型系统的协作记忆框架,以解决分布式感知问题,并提升共享视觉上下文和推理一致性。