EventVLA: 事件驱动的视觉证据记忆用于长时域视觉-语言-动作策略
摘要
EventVLA 提出了一种稀疏视觉证据记忆框架用于长时域机器人操作,相较于最先进的记忆增强型VLA,平均成功率提升了40%。
查看缓存全文
缓存时间: 2026/06/24 09:47
论文页面 - EventVLA: 基于事件驱动的视觉证据记忆用于长时程视觉-语言-动作策略
来源: https://huggingface.co/papers/2606.20092 作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
EventVLA通过引入一种稀疏视觉证据记忆框架,该框架包含视觉锚点和动态关键帧证据记忆模块,以应对长时程机器人操控挑战,从而提升任务性能。
记忆仍然是长时程机器人操控的关键瓶颈,因为标准的视觉-语言-动作 (VLA) 策略在任务相关线索随时间被遮挡或无法观察时常常失败。虽然现有的记忆增强方法利用了历史上下文,但它们要么遭受严重的信息瓶颈,要么通过解耦的双系统引入高延迟,要么依赖无选择性缓冲,积累大量视觉冗余。为了解决这些限制,我们引入了 EventVLA,这是一个端到端框架,基于稀疏视觉证据记忆的概念,由两个核心组件构成:用于保留初始和短期上下文的基础视觉锚点,以及一个动态关键帧证据记忆 (KEM) 模块。具体来说,KEM 直接从 VLA 的潜在嵌入中预测未来关键帧概率,以自主捕获和存储稀疏的任务关键视觉事件。这种前瞻性驱动机制使策略能够动态评估当前观察的未来因果效用,在瞬态视觉证据变得不可观察之前将其保留。此外,我们提出了 RoboTwin-MeM,一个专门设计的诊断基准,用于评估具有交互式视觉证据的非马尔可夫操控任务。广泛评估表明,在 17 个需要记忆的模拟任务和 4 个真实世界双臂任务中,EventVLA 相较于最先进的记忆增强 VLA,平均成功率提升了 +40%。
查看 arXiv 页面 (https://arxiv.org/abs/2606.20092) 查看 PDF (https://arxiv.org/pdf/2606.20092) 项目页面 (https://ganlin-yang.github.io/EventVLA.github.io/) GitHub14 (https://github.com/InternRobotics/EventVLA) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.20092)
在您的智能体中获取此论文:
hf papers read 2606.20092
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接到此论文
在模型的 README.md 中引用 arxiv.org/abs/2606.20092 即可从此页面链接。
引用此论文的数据集0
没有数据集链接到此论文
在数据集的 README.md 中引用 arxiv.org/abs/2606.20092 即可从此页面链接。
引用此论文的 Spaces0
没有 Space 链接到此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2606.20092 即可从此页面链接。
包含此论文的集合0
没有集合包含此论文
将这篇论文添加到一个集合 (https://huggingface.co/new-collection) 中即可从此页面链接。
相似文章
AR-VLA: 面向视觉-语言-动作模型的真正自回归动作专家
提出了AR-VLA,一个自回归动作专家,它通过长期记忆生成连续的、具有上下文感知能力的机器人策略训练的动作序列,相比反应式VLA模型,提高了轨迹平滑度和任务成功率。
视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟
视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。
BridgeVLA++:面向三维操作的数据高效、可泛化且记忆增强的视觉-语言-动作框架
BridgeVLA++ 是一个用于三维机器人操作的记忆增强视觉-语言-动作框架,它在 BridgeVLA 的基础上增加了时空记忆,在记忆依赖的操作基准上取得了最先进的成果,同时保持了数据效率和泛化能力。
面向机器人操作的视觉-语言-动作模型中的双潜在记忆
LaMem-VLA提出了一种原生于潜在记忆的框架,将短期和长期历史经验直接整合到视觉-语言-动作推理中,从而在长周期机器人操作任务上实现更优性能。
IntentVLA: 针对混叠机器人操作的短期意图建模
IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。