SimpleMemVLA:一种简单但有效的视觉-语言-动作模型原生视频记忆
摘要
SimpleMemVLA为视觉-语言-动作模型引入了一种简单的记忆机制,通过将完整的时间戳视频历史馈送到预训练的VLM骨干网络中,在长期操作任务中实现了最先进的结果,无需专用记忆模块。
查看缓存全文
缓存时间: 2026/09/09 04:31
论文页面 - SimpleMemVLA:面向视觉-语言-动作模型的简单但高效的原生视频记忆模块
来源:https://huggingface.co/papers/2609.05533 作者:
,
,
,
,
,
,
,
,
,
,
摘要
SimpleMemVLA 通过将带有时间戳的完整视频历史记录直接输入预训练的视觉语言模型骨干网络,并利用隐藏状态来指导基于流匹配的动作预测头,从而实现了长期操作任务的处理,性能优于专用的记忆模块。
长期操作任务具有部分可观测性:选择下一步动作所需的信息可能仅出现在数分钟前的观测中。现有的记忆机制——如检索库、学习式压缩器或循环状态——必须在已知未来决策需求之前,就决定保留哪些历史信息。这种设计源于一个假设:分钟级历史数据量过大,无法直接处理,而现代视觉语言模型骨干网络已不再受限于这一前提。本文提出了 SimpleMemVLA(https://huggingface.co/papers?q=VLA),一种不包含专用记忆模块的 VLA(https://huggingface.co/papers?q=VLA)架构。它将采样得到的历史记录保持完整,并以骨干网络预训练时所擅长处理的带时间戳视频(https://huggingface.co/papers?q=timestamped%20video)格式传递给骨干网络;生成的子任务的隐藏状态(https://huggingface.co/papers?q=hidden%20states)构成了从历史信息到标准基于流匹配的动作预测头(https://huggingface.co/papers?q=flow-matching%20action%20head)的唯一通道。由于连续决策共享大部分历史记录,在执行动作时预先填充共享前缀,可使延迟接近单帧 VLA(https://huggingface.co/papers?q=VLA)。SimpleMemVLA(https://huggingface.co/papers?q=VLA)在四个记忆基准测试(https://huggingface.co/papers?q=memory%20benchmarks)上均达到了新的性能水平,且在通用控制任务上没有性能损失。在固定骨干网络和训练设置的前提下,它显著优于检索、压缩和循环状态机制,并且因果干预(https://huggingface.co/papers?q=causal%20interventions)实验证实,该策略确实有效利用了历史信息。代码开源地址:https://github.com/wadeKeith/SimpleMemVLA(https://huggingface.co/papers?q=VLA)
查看 arXiv 页面 (https://arxiv.org/abs/2609.05533)查看 PDF (https://arxiv.org/pdf/2609.05533)项目主页 (https://huggingface.co/collections/yinchenghust/simplememvla)GitHub1 (https://github.com/wadeKeith/SimpleMemVLA)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.05533)
在您的智能体中获取本文:
hf papers read 2609\.05533
还没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有模型链接本文
在模型 README.md 中引用 arxiv.org/abs/2609.05533 即可从此页面链接至该模型。
引用本文的数据集0
没有数据集链接本文
在数据集 README.md 中引用 arxiv.org/abs/2609.05533 即可从此页面链接至该数据集。
引用本文的 Space0
没有 Space 链接本文
在 Space README.md 中引用 arxiv.org/abs/2609.05533 即可从此页面链接至该 Space。
包含本文的收藏夹1
相似文章
面向机器人操作的视觉-语言-动作模型中的双潜在记忆
LaMem-VLA提出了一种原生于潜在记忆的框架,将短期和长期历史经验直接整合到视觉-语言-动作推理中,从而在长周期机器人操作任务上实现更优性能。
EventVLA: 事件驱动的视觉证据记忆用于长时域视觉-语言-动作策略
EventVLA 提出了一种稀疏视觉证据记忆框架用于长时域机器人操作,相较于最先进的记忆增强型VLA,平均成功率提升了40%。
AtlasVLA:视觉-语言-动作模型的持久世界-自我状态建模
AtlasVLA 引入了具有持久世界-自我状态建模的双记忆架构,以克服视觉-语言-动作模型中的感知遗忘和任务进度遗忘问题,仅通过单个腕部相机即可实现最先进的长时程操作。
BridgeVLA++:面向三维操作的数据高效、可泛化且记忆增强的视觉-语言-动作框架
BridgeVLA++ 是一个用于三维机器人操作的记忆增强视觉-语言-动作框架,它在 BridgeVLA 的基础上增加了时空记忆,在记忆依赖的操作基准上取得了最先进的成果,同时保持了数据效率和泛化能力。
AR-VLA: 面向视觉-语言-动作模型的真正自回归动作专家
提出了AR-VLA,一个自回归动作专家,它通过长期记忆生成连续的、具有上下文感知能力的机器人策略训练的动作序列,相比反应式VLA模型,提高了轨迹平滑度和任务成功率。