EventVLA: 事件驱动的视觉证据记忆用于长时域视觉-语言-动作策略

Hugging Face Daily Papers 论文

摘要

EventVLA 提出了一种稀疏视觉证据记忆框架用于长时域机器人操作,相较于最先进的记忆增强型VLA,平均成功率提升了40%。

记忆仍然是长时域机器人操作的关键瓶颈,因为标准的视觉-语言-动作(VLA)策略在任务相关线索随时间变得遮挡或不可观察时往往会失败。尽管现有的记忆增强方法利用了历史上下文,但它们要么遭受严重的信息瓶颈,通过解耦的双系统产生高延迟,要么依赖不加选择的缓冲区,累积大量视觉冗余。为了解决这些限制,我们引入了EventVLA,这是一个基于稀疏视觉证据记忆概念构建的端到端框架,包含两个核心组件:保留初始和短期上下文的基础视觉锚点,以及动态的关键帧证据记忆(KEM)模块。具体来说,KEM直接从VLA的潜在嵌入中预测未来的关键帧概率,从而自主捕获并存储稀疏的、任务关键的视觉事件。这种前瞻驱动机制使策略能够动态评估当前观测的未来因果效用,在瞬时视觉证据变得不可观察之前将其保留。此外,我们提出了RoboTwin-MeM,这是一个专门设计的诊断基准,用于评估具有交互式视觉证据的非马尔可夫操纵任务。大量评估表明,在17个需要记忆的模拟任务和4个真实世界的双臂任务中,EventVLA相较于最先进的记忆增强型VLA,平均成功率提升了40%。
查看原文
查看缓存全文

缓存时间: 2026/06/24 09:47

论文页面 - EventVLA: 基于事件驱动的视觉证据记忆用于长时程视觉-语言-动作策略

来源: https://huggingface.co/papers/2606.20092 作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

EventVLA通过引入一种稀疏视觉证据记忆框架,该框架包含视觉锚点和动态关键帧证据记忆模块,以应对长时程机器人操控挑战,从而提升任务性能。

记忆仍然是长时程机器人操控的关键瓶颈,因为标准的视觉-语言-动作 (VLA) 策略在任务相关线索随时间被遮挡或无法观察时常常失败。虽然现有的记忆增强方法利用了历史上下文,但它们要么遭受严重的信息瓶颈,要么通过解耦的双系统引入高延迟,要么依赖无选择性缓冲,积累大量视觉冗余。为了解决这些限制,我们引入了 EventVLA,这是一个端到端框架,基于稀疏视觉证据记忆的概念,由两个核心组件构成:用于保留初始和短期上下文的基础视觉锚点,以及一个动态关键帧证据记忆 (KEM) 模块。具体来说,KEM 直接从 VLA 的潜在嵌入中预测未来关键帧概率,以自主捕获和存储稀疏的任务关键视觉事件。这种前瞻性驱动机制使策略能够动态评估当前观察的未来因果效用,在瞬态视觉证据变得不可观察之前将其保留。此外,我们提出了 RoboTwin-MeM,一个专门设计的诊断基准,用于评估具有交互式视觉证据的非马尔可夫操控任务。广泛评估表明,在 17 个需要记忆的模拟任务和 4 个真实世界双臂任务中,EventVLA 相较于最先进的记忆增强 VLA,平均成功率提升了 +40%。

查看 arXiv 页面 (https://arxiv.org/abs/2606.20092) 查看 PDF (https://arxiv.org/pdf/2606.20092) 项目页面 (https://ganlin-yang.github.io/EventVLA.github.io/) GitHub14 (https://github.com/InternRobotics/EventVLA) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.20092)

在您的智能体中获取此论文:

hf papers read 2606.20092

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接到此论文

在模型的 README.md 中引用 arxiv.org/abs/2606.20092 即可从此页面链接。

引用此论文的数据集0

没有数据集链接到此论文

在数据集的 README.md 中引用 arxiv.org/abs/2606.20092 即可从此页面链接。

引用此论文的 Spaces0

没有 Space 链接到此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2606.20092 即可从此页面链接。

包含此论文的集合0

没有集合包含此论文

将这篇论文添加到一个集合 (https://huggingface.co/new-collection) 中即可从此页面链接。

相似文章

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。

IntentVLA: 针对混叠机器人操作的短期意图建模

Hugging Face Daily Papers

IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。