Spatial Memory Agent:基于经验的过程记忆用于空间智能
摘要
本文介绍了 Spatial Memory Agent (SMA),一种运行时框架,通过验证器引导的反思和可复用记忆,在不进行参数更新或使用外部工具的情况下提升冻结视觉语言模型的空间推理能力,在五个基准和四个基础 VLM 上取得了强劲的结果。
查看缓存全文
缓存时间: 2026/08/14 03:25
论文页面 - Spatial Memory Agent:面向空间智能的基于经验的程序记忆
来源:https://huggingface.co/papers/2608.12743
摘要
冻结的视觉-语言模型通过已验证的经验、反思和可复用的记忆检索实现自我进化,从而提升空间推理能力,而无需参数更新或外部工具。
空间智能正成为具身智能体、机器人规划和多模态助手的基础。为了提高VLM智能体的空间推理能力,现有工作主要沿两条路线展开。一条路线使用后训练方法,如监督微调和强化学习。另一条路线采用智能体范式,模型调用外部空间工具(如深度估计和三维重建工具)来收集中间空间证据。我们研究了一条互补且尚未充分探索的路线:冻结的VLM智能体能否通过免参数更新的自我进化来提升其空间推理能力,而在推理时不依赖外部专家空间工具?我们提出了Spatial Memory Agent(SMA)——一个基于经验的运行时框架,将已验证的空间经验转化为可复用、可迁移的经验教训。在可验证的空间环境中,SMA查询冻结的VLM,获得预测答案和奖励,并使用验证器引导的反思从空间经验中提炼出紧凑的可迁移经验教训。SMA进一步为每条经验教训分配一个迁移可靠性分数(TRS),该分数初始化为均匀值,并根据后续检索中被访问时得到的结果进行校准,作为未来迁移可靠性的访问证据。在只读部署期间,SMA通过语义过滤和相似度-TRS组合排序来检索经验教训,使检索到的记忆能够指导冻结模型的推理。在五个代表性空间基准和四个基础VLM上,SMA在每个基础模型组中都取得了最高的宏平均性能,并在20项评估中的大多数方法中取得了最佳准确率,为所评估的冻结模型规模和环境中的空间自我进化建立了一条实用的免参数更新路径。
查看 arXiv 页面(https://arxiv.org/abs/2608.12743)查看 PDF(https://arxiv.org/pdf/2608.12743)项目页面(https://aim-uofa.github.io/SMA/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.12743)
在你的智能体中获取这篇论文:
hf papers read 2608\.12743
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.12743即可从本页链接到该模型。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.12743即可从本页链接到该数据集。
引用此论文的Space0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2608.12743即可从本页链接到该Space。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集即可从本页链接到它。
相似文章
当记忆说谎:VLM智能体空间记忆过时性的实证研究
本文实证研究了视觉语言模型智能体中的空间记忆过时性问题,发现模型常常忽略矛盾的视觉证据,并且信任过时记忆会增加安全风险。作者提出了审计机制,但表明在记忆-观察冲突下的视觉接地仍是一个重大开放挑战。
SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力
SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。
AdMem:面向任务求解智能体的高级记忆系统
本文介绍AdMem,一种面向基于LLM的智能体的统一记忆框架,整合语义记忆、情景记忆和程序性记忆,并采用双层短期与长期存储结构,通过多智能体架构实现自动记忆生成与自适应检索。实验表明,该方法在长程多轮任务中提升了鲁棒性和成功率。
SAM:面向长程推理智能体的状态自适应记忆
本文提出 SAM,一个状态自适应记忆框架,能够动态管理长程智能体推理中的交互历史,实现意图驱动的回忆,而无需重新训练基础模型。它在多个基准测试(如 BrowseComp 和 HLE)上优于强基线方法。
AtlasVA:面向无教师VLM Agent的自进化视觉技能记忆
AtlasVA是一个面向视觉语言模型Agent的无教师视觉技能记忆框架,它利用空间热图、视觉示例和符号文本技能来改善长时域任务中的空间决策,在多个基准测试中优于基线方法。