Rolling-WAM:具有滚动想象的世界动作模型
摘要
Rolling-WAM 引入了一种方法,将去噪过程分布在用于机器人操作的世界动作模型的重规划周期中,在重规划中实现了4.5倍的速度提升,同时保持了竞争性能。
查看缓存全文
缓存时间: 2026/09/29 04:09
论文页面 - Rolling-WAM:基于滚动想象的视觉动作世界模型
来源:https://huggingface.co/papers/2609.30247 作者:
,
,
,
,
,
,
,
,
,
摘要
视觉动作世界模型(WAM)将动作生成与未来视觉预测相结合,以应用于机器人操作任务。然而,在每个重规划周期内完成联合视频-动作去噪过程会产生较大延迟,从而减慢动作更新速度并限制闭环响应性。我们提出Rolling-WAM,一种将联合去噪过程分散到连续重规划周期中的建模方法。该方法维护一个处于不同噪声水平的视频-动作块滑动窗口。在每个步骤中,滚动噪声调度会完全去噪当前即将执行的动作块,同时部分优化更远未来的动作块。随着窗口随新的相机观测数据向前推进,保留的未来块会持续其去噪过程。这种方法将计算成本分摊到时间维度上,并在块边界之间传递动态演变的视觉-动作上下文信息。在LIBERO、RoboTwin仿真环境以及真实世界的Unitree G1人形机器人上的评估表明,Rolling-WAM取得了具有竞争力的操作性能。通过消除从头去噪整个预测时域的需求,相比标准联合WAM模型,该方法实现了4.5倍的稳态重规划加速比。
查看arXiv页面 (https://arxiv.org/abs/2609.30247)查看PDF (https://arxiv.org/pdf/2609.30247)项目主页 (https://rolling-wam.github.io/)GitHub4 (https://github.com/zyinghua/Rolling-WAM)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.30247)
通过代理获取此论文:
hf papers read 2609\.30247
没有最新CLI?请执行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
暂无模型链接此论文
在模型README.md中引用 arxiv.org/abs/2609.30247 以从本页面建立链接。
引用本文的数据集0
暂无数据集链接此论文
在数据集README.md中引用 arxiv.org/abs/2609.30247 以从本页面建立链接。
引用本文的Spaces0
暂无Space链接此论文
在Space的README.md中引用 arxiv.org/abs/2609.30247 以从本页面建立链接。
包含本文的合集0
暂无合集收录本文
将本文添加到合集 (https://huggingface.co/new-collection)以从本页面建立链接。
相似文章
AHA-WAM:异步视野自适应世界动作建模与观测引导上下文路由
AHA-WAM是一种异步世界动作模型,采用双扩散Transformer将世界预测与动作执行解耦,实现了高效的长视野规划和实时控制。它在机器人操作任务上达到了最先进的性能,在RoboTwin上成功率达92.8%,在现实世界任务中达78.3%,同时实现了24.17 Hz的闭环控制。
ST-WAM:面向视觉分布偏移下鲁棒操作的语义-时间世界动作模型
ST-WAM提出了一种语义-时间世界动作模型,使用DINOv3特征作为共享语义表示,以提高视觉分布偏移下机器人操作的鲁棒性,在LIBERO上达到98.7%,在RoboTwin 2.0上达到92.8%,在零样本设置下相较于Fast-WAM有显著提升。
Light-WAM:基于状态融合动作解码的高效世界动作模型
Light-WAM是一种轻量级世界动作模型,用于高效机器人操作。它采用紧凑视频骨干网络和降采样潜在空间进行未来视频监督,在保持低推理延迟的同时实现了高性能。
AnyStep-WAM: 预算对齐蒸馏与自适应推理的世界动作模型
AnyStep-WAM 引入了一个框架,用于世界动作模型中的可调预算预测和自适应推理,在机器人操作任务中显著减少去噪步数的同时保持任务成功率。
World Action Agent:通过世界动作预演利用VLMs进行机器人操作
本文提出了World Action Agent(WAA),一个多智能体系统,利用视觉语言模型(VLMs)通过具有接触视图、动作预演和视图内校正的视觉动作工作空间进行机器人操作,在基准测试中取得了最先进的结果。