AtlasVLA:视觉-语言-动作模型的持久世界-自我状态建模

Hugging Face Daily Papers 论文

摘要

AtlasVLA 引入了具有持久世界-自我状态建模的双记忆架构,以克服视觉-语言-动作模型中的感知遗忘和任务进度遗忘问题,仅通过单个腕部相机即可实现最先进的长时程操作。

尽管视觉-语言-动作(VLA)模型推动了具身智能的发展,但其根本上反应式的范式在部分可观测和长时程任务中严重限制了性能。当仅使用单个腕部相机时,随着物体离开视野,模型不可避免地遭受感知遗忘,并在多步执行过程中出现时间性任务进度遗忘}。为克服这些瓶颈,我们提出 AtlasVLA,一种新颖的框架,通过持久的 world-ego 状态从直接反应式操作转变为主动推理。AtlasVLA 采用双记忆架构:4D 持久世界状态记忆将瞬时的 2D 观测提升为全局更新、体素哈希的空间状态,以解决视觉盲区;自我工作状态记忆跟踪历史自我状态和任务进度。通过将扩散 Transformer(DiT)基于这种联合的 world-ego 状态进行条件化,AtlasVLA 实现了稳健的空间推理。在 LIBERO、RLBench 和真实世界基准上的广泛评估表明,AtlasVLA 仅使用腕部相机即可达到最先进的性能。值得注意的是,它显著超越了多视角基线,在 LIBERO-Long 上实现了 9.4% 的绝对成功率提升,在真实世界长时程任务中实现了 17.5% 的提升。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:33

论文页面 - AtlasVLA:面向视觉-语言-动作模型的持久世界-自我状态建模

来源:https://huggingface.co/papers/2608.06729 发布于 8月7日

·

由 https://huggingface.co/CASIA-IVAer 提交

ltguo (https://huggingface.co/CASIA-IVAer) 于 8月13日提交

摘要

AtlasVLA 通过持久世界-自我记忆将反应式控制转变为主动推理,从而提升具身智能体能力,使其能够在仅使用单个腕部相机的情况下实现稳健的长时程操作。

尽管视觉-语言-动作(VLA)模型推动了具身智能的发展,但其根本上的反应式范式在部分可观测和长时程任务中严重限制了性能。当仅限于单个腕戴相机时,随着物体离开视野,模型不可避免地遭受感知遗忘,并在多步执行过程中出现时间性任务进度遗忘。为克服这些瓶颈,我们提出 AtlasVLA,一种新颖的框架,通过持久世界-自我状态(world-ego state)从直接反应式操作转向主动推理。AtlasVLA 采用双记忆架构:一个4D持久世界状态记忆(4D Persistent World State Memory),将瞬时的 2D 观测提升为全局更新的、基于体素哈希的空间状态(voxel-hashed spatial state),以解决视觉盲区问题;以及一个自我工作状态记忆(Ego-Working State Memory),用于跟踪历史自我状态和任务进度。通过在这种联合世界-自我状态(World-Ego state)上条件化扩散变换器(DiT),AtlasVLA 实现了稳健的空间推理。在 LIBERO、RLBench 以及真实世界基准上的大量评估表明,AtlasVLA 仅使用腕部相机即可达到最先进的性能。值得注意的是,它显著优于多视角基线,在 LIBERO-Long 上取得了 9.4% 的绝对成功率提升,在真实世界长时程任务中取得了 17.5% 的提升。

查看 arXiv 页面 (https://arxiv.org/abs/2608.06729)查看 PDF (https://arxiv.org/pdf/2608.06729)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.06729)

在你的 agent 中获取这篇论文:

hf papers read 2608\.06729

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到这篇论文

在模型 README.md 中引用 arxiv.org/abs/2608.06729 即可从此页面链接到该模型。

引用此论文的数据集0

没有数据集链接到这篇论文

在数据集 README.md 中引用 arxiv.org/abs/2608.06729 即可从此页面链接到该数据集。

引用此论文的 Spaces0

没有 Space 链接到这篇论文

在 Space README.md 中引用 arxiv.org/abs/2608.06729 即可从此页面链接到该 Space。

包含此论文的收藏集1

相似文章

AtlasVA:面向无教师VLM Agent的自进化视觉技能记忆

Hugging Face Daily Papers

AtlasVA是一个面向视觉语言模型Agent的无教师视觉技能记忆框架,它利用空间热图、视觉示例和符号文本技能来改善长时域任务中的空间决策,在多个基准测试中优于基线方法。