WEAVER:更好、更快、更长 —— 一种有效的机器人操作世界模型
摘要
WEAVER是一种用于机器人操作的多视角世界模型,通过流匹配损失实现了高保真度、一致性和效率,在策略评估、策略改进和测试时规划中表现出色,并在真实世界中取得了显著改进。
查看缓存全文
缓存时间: 2026/06/12 02:51
论文页面 - WEAVER: 更优秀、更快速、更持久:一种用于机器人操作的有效世界模型
来源:https://huggingface.co/papers/2606.13672
摘要
WEAVER 是一种多视角世界模型架构,通过流匹配损失在机器人操作任务中实现了高保真度、一致性和效率,并在策略评估、策略改进和测试时规划中展现出卓越性能。
世界模型(WM,即学习模拟器)对机器人的潜在影响深远——包括策略评估、策略改进和测试时规划——所有这些都仅需有限的真实世界交互。为了释放这些下游能力,世界模型需要同时满足三个必要条件:(i) 保真度(即生成与现实相关的模拟轨迹),(ii) 一致性(即生成的模拟轨迹在长时间跨度内保持连贯),(iii) 效率(即快速生成模拟轨迹)。我们提出 WEAVER(World Estimation Across Views for Embodied Reasoning,用于具身推理的多视角世界估计):一种同时满足上述三个条件的世界模型架构,在机器人操作任务中取得最先进成果。WEAVER 是一种多视角世界模型,通过流匹配损失训练来预测未来隐变量和奖励值。我们提炼了模型架构、记忆和预测目标中的关键设计决策,这些决策是解锁以往世界建模方法所难以处理的长时间动态操作任务所必需的。我们将 WEAVER 应用于机器人硬件,验证了其在策略评估(与真实世界成功率的相关性 ρ=0.870)、策略改进(在 π_{0.5} 机器人基础模型之上实现 38% 的真实世界成功率提升)和测试时规划(相比以往世界模型,真实世界成功率提升 14%,速度提升 5–10 倍)方面的有效性。WEAVER 在分布外场景评估中也表现出优于以往世界模型的性能。代码、模型和视频参见:https://arnavkj1995.github.io/WEAVER/
查看 arXiv 页面 (https://arxiv.org/abs/2606.13672) | 查看 PDF (https://arxiv.org/pdf/2606.13672) | 项目页面 (https://arnavkj1995.github.io/WEAVER/) | GitHub (https://github.com/arnavkj1995/WEAVER) | 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.13672)
在您的智能体中获取此论文:
hf papers read 2606.13672
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
暂无模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.13672 以在此页面建立链接。
引用此论文的数据集0
暂无数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.13672 以在此页面建立链接。
引用此论文的 Spaces0
暂无 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.13672 以在此页面建立链接。
包含此论文的收藏0
暂无收藏包含此论文
请将此论文添加到收藏 (https://huggingface.co/new-collection) 以在此页面建立链接。
相似文章
用于机器人操作的 World Value Models
本文提出了World Value Model (WVM),一种通用机器人价值模型,它将世界模型与价值估计相结合,以准确评估任务进展,并从混合质量数据中改进机器人策略学习,在标准基准和新的次优数据基准上取得了最先进的结果。
τ_0-WM: 用于机器人操作的统一视频-动作世界模型
τ_0-WM是一个统一的视频-动作世界模型,用于机器人操作,它通过共享的视频扩散主干集成了策略学习、视频预测和动作评估。在具有挑战性的长周期和细粒度任务上表现出卓越性能。
PAIWorld: 面向机器人操作的三维一致世界基础模型
PAIWorld 通过几何感知和跨视图注意力机制增强扩散变换器世界模型,提升机器人操作任务中的多视图三维一致性,在基准测试上达到最优结果。
ST-WAM:面向视觉分布偏移下鲁棒操作的语义-时间世界动作模型
ST-WAM提出了一种语义-时间世界动作模型,使用DINOv3特征作为共享语义表示,以提高视觉分布偏移下机器人操作的鲁棒性,在LIBERO上达到98.7%,在RoboTwin 2.0上达到92.8%,在零样本设置下相较于Fast-WAM有显著提升。
Light-WAM:基于状态融合动作解码的高效世界动作模型
Light-WAM是一种轻量级世界动作模型,用于高效机器人操作。它采用紧凑视频骨干网络和降采样潜在空间进行未来视频监督,在保持低推理延迟的同时实现了高性能。