面向机器人操作的视觉-语言-动作模型中的双潜在记忆
摘要
LaMem-VLA提出了一种原生于潜在记忆的框架,将短期和长期历史经验直接整合到视觉-语言-动作推理中,从而在长周期机器人操作任务上实现更优性能。
查看缓存全文
缓存时间: 2026/07/09 07:51
论文页面 - 双潜记忆在机器人操作视觉-语言-动作模型中的应用
来源:https://huggingface.co/papers/2607.07608
摘要
LaMem-VLA 提出了一种潜记忆原生框架,通过在同一潜空间中运行的协同记忆组件,将历史经验整合到视觉-语言-动作推理中。
主流视觉-语言-动作(VLA)模型主要基于马尔可夫假设(https://huggingface.co/papers?q=Markovian%20assumption),仅依据当前观测来预测动作,因此在面对长时域、时间依赖强的任务时表现不佳。现有的记忆增强型VLA(https://huggingface.co/papers?q=memory-augmented%20VLAs)要么扩展观测窗口,要么从记忆库中检索历史信息作为辅助策略侧上下文。然而,它们将记忆置于VLA推理的原生潜嵌入空间(https://huggingface.co/papers?q=latent%20embedding%20space)之外,无法使历史经验与多模态推理及动作生成流畅交织。为此,我们提出了LaMem-VLA,一种潜记忆原生框架,它将历史经验重构为潜记忆令牌(https://huggingface.co/papers?q=latent%20memory%20tokens),并直接与VLA推理交织。其核心包含四个协同组件:(i)策展人,将历史经验组织为互补的短期记忆库和长期记忆库(https://huggingface.co/papers?q=long-term%20memory%20vaults);(ii)探索者,利用多模态认知(https://huggingface.co/papers?q=multimodal%20cognition)查询两个记忆库,检索上下文相关证据(https://huggingface.co/papers?q=context-relevant%20evidence);(iii)压缩器,将检索到的证据重构为紧凑的短期和长期潜记忆令牌(https://huggingface.co/papers?q=latent%20memory%20tokens);(iv)编织者,将这些记忆令牌与当前观测和指令注入到一个连续的嵌入序列(https://huggingface.co/papers?q=continuous%20embedding%20sequence)中。通过在同一个连续潜空间中表示、检索和消费历史经验,LaMem-VLA使记忆能够直接参与VLA推理,并在有限上下文(https://huggingface.co/papers?q=bounded%20context)下引导动作生成。在SimplerEnv和LIBERO上的大量实验证明了我们LaMem-VLA的优越性。
查看arXiv页面(https://arxiv.org/abs/2607.07608)查看PDF(https://arxiv.org/pdf/2607.07608)GitHub0(https://github.com/quhongyu/LaMem-VLA)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.07608)
在您的代理中获取此论文:
hf papers read 2607\.07608
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2607.07608以从本页链接。
引用此论文的数据集1
cy0307/awesome-egocentric-atlas 查看器•更新约1小时前 • 816 • 1.21k • 5 (https://huggingface.co/datasets/cy0307/awesome-egocentric-atlas)
引用此论文的Space0
无Space链接此论文
在Space README.md中引用arxiv.org/abs/2607.07608以从本页链接。
包含此论文的集合0
无集合包含此论文
将此论文添加到集合(https://huggingface.co/new-collection)以从本页链接。
相似文章
SimpleMemVLA:一种简单但有效的视觉-语言-动作模型原生视频记忆
SimpleMemVLA为视觉-语言-动作模型引入了一种简单的记忆机制,通过将完整的时间戳视频历史馈送到预训练的VLM骨干网络中,在长期操作任务中实现了最先进的结果,无需专用记忆模块。
EventVLA: 事件驱动的视觉证据记忆用于长时域视觉-语言-动作策略
EventVLA 提出了一种稀疏视觉证据记忆框架用于长时域机器人操作,相较于最先进的记忆增强型VLA,平均成功率提升了40%。
AtlasVLA:视觉-语言-动作模型的持久世界-自我状态建模
AtlasVLA 引入了具有持久世界-自我状态建模的双记忆架构,以克服视觉-语言-动作模型中的感知遗忘和任务进度遗忘问题,仅通过单个腕部相机即可实现最先进的长时程操作。
BridgeVLA++:面向三维操作的数据高效、可泛化且记忆增强的视觉-语言-动作框架
BridgeVLA++ 是一个用于三维机器人操作的记忆增强视觉-语言-动作框架,它在 BridgeVLA 的基础上增加了时空记忆,在记忆依赖的操作基准上取得了最先进的成果,同时保持了数据效率和泛化能力。
IntentVLA: 针对混叠机器人操作的短期意图建模
IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。