Rolling-WAM:具有滚动想象的世界动作模型

Hugging Face Daily Papers 论文

摘要

Rolling-WAM 引入了一种方法,将去噪过程分布在用于机器人操作的世界动作模型的重规划周期中,在重规划中实现了4.5倍的速度提升,同时保持了竞争性能。

世界动作模型(WAMs)将动作生成与未来视觉预测耦合,用于机器人操作。然而,在每个重规划周期中完成联合视频-动作去噪过程会带来显著的延迟,延迟动作更新并限制闭环响应性。我们提出了Rolling-WAM,一种将联合去噪分布在连续重规划周期中的公式。我们的方法维护一个滑动窗口,其中包含以交错噪声水平组织的视频-动作块。在每一步中,一个滚动噪声计划完全去噪即将执行的动作块,同时部分细化更远未来的块。随着窗口随新摄像头观测推进,保留的未来块继续其去噪过程。这随时间分布计算成本,同时在块边界上携带演化的视觉-动作上下文。在LIBERO、RoboTwin和现实世界的Unitree G1人形机器人上的评估表明,Rolling-WAM实现了竞争性的操作性能。通过消除从头开始去噪整个预测范围的需要,它相对于标准的联合WAMs提供了4.5倍的稳态重规划速度提升。
查看原文
查看缓存全文

缓存时间: 2026/09/29 04:09

论文页面 - Rolling-WAM:基于滚动想象的视觉动作世界模型

来源:https://huggingface.co/papers/2609.30247 作者:

,

,

,

,

,

,

,

,

,

摘要

视觉动作世界模型(WAM)将动作生成与未来视觉预测相结合,以应用于机器人操作任务。然而,在每个重规划周期内完成联合视频-动作去噪过程会产生较大延迟,从而减慢动作更新速度并限制闭环响应性。我们提出Rolling-WAM,一种将联合去噪过程分散到连续重规划周期中的建模方法。该方法维护一个处于不同噪声水平的视频-动作块滑动窗口。在每个步骤中,滚动噪声调度会完全去噪当前即将执行的动作块,同时部分优化更远未来的动作块。随着窗口随新的相机观测数据向前推进,保留的未来块会持续其去噪过程。这种方法将计算成本分摊到时间维度上,并在块边界之间传递动态演变的视觉-动作上下文信息。在LIBERO、RoboTwin仿真环境以及真实世界的Unitree G1人形机器人上的评估表明,Rolling-WAM取得了具有竞争力的操作性能。通过消除从头去噪整个预测时域的需求,相比标准联合WAM模型,该方法实现了4.5倍的稳态重规划加速比。

查看arXiv页面 (https://arxiv.org/abs/2609.30247)查看PDF (https://arxiv.org/pdf/2609.30247)项目主页 (https://rolling-wam.github.io/)GitHub4 (https://github.com/zyinghua/Rolling-WAM)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.30247)

通过代理获取此论文:

hf papers read 2609\.30247

没有最新CLI?请执行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

暂无模型链接此论文

在模型README.md中引用 arxiv.org/abs/2609.30247 以从本页面建立链接。

引用本文的数据集0

暂无数据集链接此论文

在数据集README.md中引用 arxiv.org/abs/2609.30247 以从本页面建立链接。

引用本文的Spaces0

暂无Space链接此论文

在Space的README.md中引用 arxiv.org/abs/2609.30247 以从本页面建立链接。

包含本文的合集0

暂无合集收录本文

将本文添加到合集 (https://huggingface.co/new-collection)以从本页面建立链接。

相似文章

AHA-WAM:异步视野自适应世界动作建模与观测引导上下文路由

Hugging Face Daily Papers

AHA-WAM是一种异步世界动作模型,采用双扩散Transformer将世界预测与动作执行解耦,实现了高效的长视野规划和实时控制。它在机器人操作任务上达到了最先进的性能,在RoboTwin上成功率达92.8%,在现实世界任务中达78.3%,同时实现了24.17 Hz的闭环控制。