MemBodied:用于视觉-语言-动作模型的循环联想记忆

Hugging Face Daily Papers 论文

摘要

MemBodied 引入了一种具有联想状态和情节锚点的固定大小情景记忆,旨在增强视觉-语言-动作模型在历史依赖型操作任务中的能力,并显著超越了基线方法的性能。

视觉-语言-动作模型为通用机器人控制奠定了坚实基础,但绝大多数策略并不保留和利用当前观测之外的情节级信息。这一局限在依赖仅能从过往观测中获取信息的历史依赖型操作任务中影响重大。保留过往观测于上下文中虽能帮助恢复这些信息,但代价是上下文不断膨胀以及推理延迟的显著增加。因此,我们引入了 MemBodied,一种具有两个互补组件的固定大小情景记忆:一个记录跨策略调用交互的联想状态,以及一个保存初始场景紧凑表示作为参考的情节锚点。在每次策略调用时,模型基于当前输入和记忆组件来生成动作,而非直接使用过往观测。在需要记忆的五项 RMBench 评估任务中,MemBodied 的平均成功率达到了无记忆策略的 7.81 倍和标准循环记忆的 2.98 倍,同时以少 10 倍的附加参数量,超越了最强记忆增强基线 1.3 倍。在完全可观测的 LIBERO-Long 套件中,其达到了 90.6% 的成功率,比无记忆的 π_0 策略提高了 5.4%。这些发现支持 MemBodied 作为扩展策略上下文以处理历史依赖型操作任务的一种实用替代方案。
查看原文
查看缓存全文

缓存时间: 2026/09/24 03:37

论文页面 - MemBodied:面向视觉-语言-动作模型的循环联想记忆

来源:https://huggingface.co/papers/2609.28256

摘要

视觉-语言-动作模型为通用机器人控制提供了强大基础,但绝大多数策略并未保存或利用当前观测之外的片段级信息。这种局限在需要依赖仅在过去观测中可用信息的、依赖历史的操作任务中尤为关键。虽然在上下文中保留历史观测有助于恢复此类信息,但代价是上下文无限增长、变得臃肿,并导致推理延迟增加。因此我们引入了MemBodied,一种固定大小的片段记忆,包含两个互补组件:记录策略调用间交互的联想状态,以及作为参考保留初始场景紧凑表示的片段锚点。在每次策略调用时,模型基于当前输入和记忆组件(而非直接使用历史观测)来调节动作生成。在需要记忆的五个RMBench评测任务中,MemBodied的平均成功率是无记忆策略的7.81倍,是基础循环记忆的2.98倍,同时在添加参数量减少10倍的情况下,性能超过最强记忆增强基线1.3倍。在完全可观测的LIBERO-Long测试套件中,它达到了90.6%的成功率,比无记忆的π_0策略提升了5.4%。这些发现证实了MemBodied是扩展策略上下文以实现历史依赖操作的一种实用替代方案。

查看arXiv页面 (https://arxiv.org/abs/2609.28256) 查看PDF (https://arxiv.org/pdf/2609.28256) 项目页面 (https://declare-lab.github.io/MemBodied/) GitHub1 (https://github.com/declare-lab/MemBodied) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.28256)

在您的代理中获取此论文:

hf papers read 2609.28256

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用 arxiv.org/abs/2609.28256 以将其从此页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用 arxiv.org/abs/2609.28256 以将其从此页面链接。

引用此论文的Spaces0

无Space链接此论文

在Space README.md中引用 arxiv.org/abs/2609.28256 以将其从此页面链接。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以将其从此页面链接。

相似文章