面向机器人操作的视觉-语言-动作模型中的双潜在记忆

Hugging Face Daily Papers 论文

摘要

LaMem-VLA提出了一种原生于潜在记忆的框架,将短期和长期历史经验直接整合到视觉-语言-动作推理中,从而在长周期机器人操作任务上实现更优性能。

主流的视觉-语言-动作(VLA)模型在马尔可夫假设下主要根据当前观测预测动作,因此在处理长周期、时间依赖的任务时表现不佳。现有的记忆增强VLA要么扩展观测窗口,要么从记忆库中检索历史信息作为辅助策略上下文。然而,这些方法将记忆置于VLA推理的原生潜在嵌入空间之外,导致历史经验无法与多模态推理和动作生成流畅交织。为此,我们提出LaMem-VLA,一个原生于潜在记忆的框架,将历史经验重建为潜在记忆标记,并直接与VLA推理交织。其核心是四个协调组件:(i)策展器(curator),将历史经验组织为互补的短期和长期记忆库;(ii)检索器(seeker),利用多模态认知查询两个记忆库以检索上下文相关的证据;(iii)压缩器(condenser),将检索到的证据重建为紧凑的短期和长期潜在记忆标记;(iv)编织器(weaver),将这些记忆标记与当前观测和指令注入到一个连续的嵌入序列中。通过在相同的连续潜在空间中表示、检索和消耗历史经验,LaMem-VLA使记忆能够直接参与VLA推理,并在有限上下文下指导动作生成。在SimplerEnv和LIBERO上的大量实验证明了我们LaMem-VLA的优越性。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:51

论文页面 - 双潜记忆在机器人操作视觉-语言-动作模型中的应用

来源:https://huggingface.co/papers/2607.07608

摘要

LaMem-VLA 提出了一种潜记忆原生框架,通过在同一潜空间中运行的协同记忆组件,将历史经验整合到视觉-语言-动作推理中。

主流视觉-语言-动作(VLA)模型主要基于马尔可夫假设(https://huggingface.co/papers?q=Markovian%20assumption),仅依据当前观测来预测动作,因此在面对长时域、时间依赖强的任务时表现不佳。现有的记忆增强型VLA(https://huggingface.co/papers?q=memory-augmented%20VLAs)要么扩展观测窗口,要么从记忆库中检索历史信息作为辅助策略侧上下文。然而,它们将记忆置于VLA推理的原生潜嵌入空间(https://huggingface.co/papers?q=latent%20embedding%20space)之外,无法使历史经验与多模态推理及动作生成流畅交织。为此,我们提出了LaMem-VLA,一种潜记忆原生框架,它将历史经验重构为潜记忆令牌(https://huggingface.co/papers?q=latent%20memory%20tokens),并直接与VLA推理交织。其核心包含四个协同组件:(i)策展人,将历史经验组织为互补的短期记忆库和长期记忆库(https://huggingface.co/papers?q=long-term%20memory%20vaults);(ii)探索者,利用多模态认知(https://huggingface.co/papers?q=multimodal%20cognition)查询两个记忆库,检索上下文相关证据(https://huggingface.co/papers?q=context-relevant%20evidence);(iii)压缩器,将检索到的证据重构为紧凑的短期和长期潜记忆令牌(https://huggingface.co/papers?q=latent%20memory%20tokens);(iv)编织者,将这些记忆令牌与当前观测和指令注入到一个连续的嵌入序列(https://huggingface.co/papers?q=continuous%20embedding%20sequence)中。通过在同一个连续潜空间中表示、检索和消费历史经验,LaMem-VLA使记忆能够直接参与VLA推理,并在有限上下文(https://huggingface.co/papers?q=bounded%20context)下引导动作生成。在SimplerEnv和LIBERO上的大量实验证明了我们LaMem-VLA的优越性。

查看arXiv页面(https://arxiv.org/abs/2607.07608)查看PDF(https://arxiv.org/pdf/2607.07608)GitHub0(https://github.com/quhongyu/LaMem-VLA)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.07608)

在您的代理中获取此论文:

hf papers read 2607\.07608

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2607.07608以从本页链接。

引用此论文的数据集1

cy0307/awesome-egocentric-atlas 查看器•更新约1小时前 • 816 • 1.21k • 5 (https://huggingface.co/datasets/cy0307/awesome-egocentric-atlas)

引用此论文的Space0

无Space链接此论文

在Space README.md中引用arxiv.org/abs/2607.07608以从本页链接。

包含此论文的集合0

无集合包含此论文

将此论文添加到集合(https://huggingface.co/new-collection)以从本页链接。

相似文章

IntentVLA: 针对混叠机器人操作的短期意图建模

Hugging Face Daily Papers

IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。