AtlasVLA:视觉-语言-动作模型的持久世界-自我状态建模
摘要
AtlasVLA 引入了具有持久世界-自我状态建模的双记忆架构,以克服视觉-语言-动作模型中的感知遗忘和任务进度遗忘问题,仅通过单个腕部相机即可实现最先进的长时程操作。
查看缓存全文
缓存时间: 2026/08/13 15:33
论文页面 - AtlasVLA:面向视觉-语言-动作模型的持久世界-自我状态建模
来源:https://huggingface.co/papers/2608.06729 发布于 8月7日
·
由 https://huggingface.co/CASIA-IVAer 提交
ltguo (https://huggingface.co/CASIA-IVAer) 于 8月13日提交
摘要
AtlasVLA 通过持久世界-自我记忆将反应式控制转变为主动推理,从而提升具身智能体能力,使其能够在仅使用单个腕部相机的情况下实现稳健的长时程操作。
尽管视觉-语言-动作(VLA)模型推动了具身智能的发展,但其根本上的反应式范式在部分可观测和长时程任务中严重限制了性能。当仅限于单个腕戴相机时,随着物体离开视野,模型不可避免地遭受感知遗忘,并在多步执行过程中出现时间性任务进度遗忘。为克服这些瓶颈,我们提出 AtlasVLA,一种新颖的框架,通过持久世界-自我状态(world-ego state)从直接反应式操作转向主动推理。AtlasVLA 采用双记忆架构:一个4D持久世界状态记忆(4D Persistent World State Memory),将瞬时的 2D 观测提升为全局更新的、基于体素哈希的空间状态(voxel-hashed spatial state),以解决视觉盲区问题;以及一个自我工作状态记忆(Ego-Working State Memory),用于跟踪历史自我状态和任务进度。通过在这种联合世界-自我状态(World-Ego state)上条件化扩散变换器(DiT),AtlasVLA 实现了稳健的空间推理。在 LIBERO、RLBench 以及真实世界基准上的大量评估表明,AtlasVLA 仅使用腕部相机即可达到最先进的性能。值得注意的是,它显著优于多视角基线,在 LIBERO-Long 上取得了 9.4% 的绝对成功率提升,在真实世界长时程任务中取得了 17.5% 的提升。
查看 arXiv 页面 (https://arxiv.org/abs/2608.06729)查看 PDF (https://arxiv.org/pdf/2608.06729)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.06729)
在你的 agent 中获取这篇论文:
hf papers read 2608\.06729
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到这篇论文
在模型 README.md 中引用 arxiv.org/abs/2608.06729 即可从此页面链接到该模型。
引用此论文的数据集0
没有数据集链接到这篇论文
在数据集 README.md 中引用 arxiv.org/abs/2608.06729 即可从此页面链接到该数据集。
引用此论文的 Spaces0
没有 Space 链接到这篇论文
在 Space README.md 中引用 arxiv.org/abs/2608.06729 即可从此页面链接到该 Space。
包含此论文的收藏集1
相似文章
EventVLA: 事件驱动的视觉证据记忆用于长时域视觉-语言-动作策略
EventVLA 提出了一种稀疏视觉证据记忆框架用于长时域机器人操作,相较于最先进的记忆增强型VLA,平均成功率提升了40%。
AtlasVA:面向无教师VLM Agent的自进化视觉技能记忆
AtlasVA是一个面向视觉语言模型Agent的无教师视觉技能记忆框架,它利用空间热图、视觉示例和符号文本技能来改善长时域任务中的空间决策,在多个基准测试中优于基线方法。
面向机器人操作的视觉-语言-动作模型中的双潜在记忆
LaMem-VLA提出了一种原生于潜在记忆的框架,将短期和长期历史经验直接整合到视觉-语言-动作推理中,从而在长周期机器人操作任务上实现更优性能。
BridgeVLA++:面向三维操作的数据高效、可泛化且记忆增强的视觉-语言-动作框架
BridgeVLA++ 是一个用于三维机器人操作的记忆增强视觉-语言-动作框架,它在 BridgeVLA 的基础上增加了时空记忆,在记忆依赖的操作基准上取得了最先进的成果,同时保持了数据效率和泛化能力。
AR-VLA: 面向视觉-语言-动作模型的真正自回归动作专家
提出了AR-VLA,一个自回归动作专家,它通过长期记忆生成连续的、具有上下文感知能力的机器人策略训练的动作序列,相比反应式VLA模型,提高了轨迹平滑度和任务成功率。