MemBodied:用于视觉-语言-动作模型的循环联想记忆
摘要
MemBodied 引入了一种具有联想状态和情节锚点的固定大小情景记忆,旨在增强视觉-语言-动作模型在历史依赖型操作任务中的能力,并显著超越了基线方法的性能。
查看缓存全文
缓存时间: 2026/09/24 03:37
论文页面 - MemBodied:面向视觉-语言-动作模型的循环联想记忆
来源:https://huggingface.co/papers/2609.28256
摘要
视觉-语言-动作模型为通用机器人控制提供了强大基础,但绝大多数策略并未保存或利用当前观测之外的片段级信息。这种局限在需要依赖仅在过去观测中可用信息的、依赖历史的操作任务中尤为关键。虽然在上下文中保留历史观测有助于恢复此类信息,但代价是上下文无限增长、变得臃肿,并导致推理延迟增加。因此我们引入了MemBodied,一种固定大小的片段记忆,包含两个互补组件:记录策略调用间交互的联想状态,以及作为参考保留初始场景紧凑表示的片段锚点。在每次策略调用时,模型基于当前输入和记忆组件(而非直接使用历史观测)来调节动作生成。在需要记忆的五个RMBench评测任务中,MemBodied的平均成功率是无记忆策略的7.81倍,是基础循环记忆的2.98倍,同时在添加参数量减少10倍的情况下,性能超过最强记忆增强基线1.3倍。在完全可观测的LIBERO-Long测试套件中,它达到了90.6%的成功率,比无记忆的π_0策略提升了5.4%。这些发现证实了MemBodied是扩展策略上下文以实现历史依赖操作的一种实用替代方案。
查看arXiv页面 (https://arxiv.org/abs/2609.28256) 查看PDF (https://arxiv.org/pdf/2609.28256) 项目页面 (https://declare-lab.github.io/MemBodied/) GitHub1 (https://github.com/declare-lab/MemBodied) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.28256)
在您的代理中获取此论文:
hf papers read 2609.28256
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型链接此论文
在模型README.md中引用 arxiv.org/abs/2609.28256 以将其从此页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集README.md中引用 arxiv.org/abs/2609.28256 以将其从此页面链接。
引用此论文的Spaces0
无Space链接此论文
在Space README.md中引用 arxiv.org/abs/2609.28256 以将其从此页面链接。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以将其从此页面链接。
相似文章
面向机器人操作的视觉-语言-动作模型中的双潜在记忆
LaMem-VLA提出了一种原生于潜在记忆的框架,将短期和长期历史经验直接整合到视觉-语言-动作推理中,从而在长周期机器人操作任务上实现更优性能。
SimpleMemVLA:一种简单但有效的视觉-语言-动作模型原生视频记忆
SimpleMemVLA为视觉-语言-动作模型引入了一种简单的记忆机制,通过将完整的时间戳视频历史馈送到预训练的VLM骨干网络中,在长期操作任务中实现了最先进的结果,无需专用记忆模块。
AtlasVLA:视觉-语言-动作模型的持久世界-自我状态建模
AtlasVLA 引入了具有持久世界-自我状态建模的双记忆架构,以克服视觉-语言-动作模型中的感知遗忘和任务进度遗忘问题,仅通过单个腕部相机即可实现最先进的长时程操作。
MemLens:大规模视觉-语言模型中多模态长期记忆的基准测试
MemLens是一个新的基准测试,通过多轮对话评估大规模视觉-语言模型的记忆能力。它比较了长上下文和记忆增强方法,揭示了二者的局限性,并推动了混合架构的发展。
ComMem: 用于视觉语言模型测试时自适应的互补记忆系统
ComMem 提出了受生物记忆启发的互补记忆系统,以改进视觉语言模型的测试时自适应,在15个基准测试上超越了现有最先进方法。