通过残差潜在动作学习基于视觉特征的世界模型
摘要
本文介绍了 RLA-WM,一种基于视觉特征的世界模型,该模型利用残差潜在动作与流匹配技术高效预测未来视觉状态。该方法性能优于现有的视频扩散与特征基方法,同时支持从离线、无动作演示视频中探索新型机器人学习技术。
查看缓存全文
缓存时间: 2026/05/11 18:55
论文页面 - 通过残差潜在动作学习基于视觉特征的世界模型
来源:https://huggingface.co/papers/2605.07079
摘要
通过残差潜在动作表示预测未来视觉特征的视觉世界模型,在性能和效率上均优于现有方法,并催生了新颖的机器人学习方法。
世界模型 (https://huggingface.co/papers?q=World%20models) 根据观察和动作预测未来状态转移。现有工作大多仅专注于图像生成。而基于视觉特征的世界模型 (https://huggingface.co/papers?q=world%20models) 预测未来的视觉特征而非原始视频像素,提供了一种更高效且不易产生幻觉的替代方案。然而,当前基于特征的方法依赖直接回归,导致在复杂交互中预测结果模糊或崩溃,而在高维特征空间中进行生成建模仍具挑战。本工作中,我们发现一种新型潜在动作表示 (https://huggingface.co/papers?q=latent%20action%20representation),我们称之为 残差潜在动作 (https://huggingface.co/papers?q=Residual%20Latent%20Action) (RLA),可以轻易从 DINO 残差 (https://huggingface.co/papers?q=DINO%20residuals) 中学到。我们还证明 RLA 具有预测性、泛化性,并能编码时序推进过程。在此基础上,我们提出 RLA 世界模型 (https://huggingface.co/papers?q=RLA%20Latent%20Action) (RLA-WM),它通过流匹配 (https://huggingface.co/papers?q=flow%20matching) 预测 RLA 值。RLA-WM 在模拟和真实世界数据集上,性能均优于最先进的基于特征的世界模型和视频扩散世界模型 (https://huggingface.co/papers?q=video-diffusion%20world%20models),且速度比视频扩散快数个量级。此外,我们开发了两种机器人学习技术,利用 RLA-WM 改进策略学习 (https://huggingface.co/papers?q=policy%20learning)。第一种是极简的世界动作模型,使用 RLA 从无动作示范视频 (https://huggingface.co/papers?q=actionless%20demonstration%20videos) 中学习。第二种是首个完全在仅由离线视频学到的世界模型内部训练的视觉强化学习框架 (https://huggingface.co/papers?q=visual%20RL%20framework),它使用视频对齐奖励 (https://huggingface.co/papers?q=video-aligned%20reward),无需在线交互或手工设计奖励。项目页面:https://mlzxy.github.io/rla-wm
查看 arXiv 页面 (https://arxiv.org/abs/2605.07079) 查看 PDF (https://arxiv.org/pdf/2605.07079) 项目页面 (https://mlzxy.github.io/rla-wm) GitHub9 (https://github.com/mlzxy/rla-wm) 添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2605.07079)
在您的 agent 中获取这篇论文:
hf papers read 2605.07079
没有最新的命令行工具?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 1
xyzhang368/RLA-WM 机器人学 • 更新于约 5 小时前 (https://huggingface.co/xyzhang368/RLA-WM)
引用此论文的数据集 1
xyzhang368/RLA-WM 更新于约 5 小时前 • 37 (https://huggingface.co/datasets/xyzhang368/RLA-WM)
引用此论文的空间 0
目前没有空间链接此论文
在空间的 README.md 中引用 arxiv.org/abs/2605.07079,即可在此页面建立链接。
包含此论文的合集 0
目前没有合集包含此论文
将此论文添加到合集 (https://huggingface.co/new-collection) 以在此页面建立链接。
相似文章
Light-WAM:基于状态融合动作解码的高效世界动作模型
Light-WAM是一种轻量级世界动作模型,用于高效机器人操作。它采用紧凑视频骨干网络和降采样潜在空间进行未来视频监督,在保持低推理延迟的同时实现了高性能。
LaWAM:面向高效动力学感知机器人策略的潜在世界动作模型
LaWAM通过预测紧凑的潜在视觉子目标而非昂贵的视频生成,实现了高效的机器人控制,相比像素空间世界动作模型,成功率可达最先进水平,同时延迟降低高达24倍。
World-Language-Action模型:统一世界建模、语言推理与动作合成
本文介绍了World-Language-Action(WLA)模型,这是一种具身基础模型,能够从文本、图像和机器人状态中联合预测文本子任务、子目标图像和机器人动作,在模拟和真实环境中实现了最先进的多任务与长周期学习能力。
WCM:一种用于视觉-语言-行动强化学习的世界评论模型
介绍了WCM,一种世界评论模型,它联合预测未来的潜在状态并估计价值,以改进视觉-语言-行动强化学习的时间建模,在多个机器人操作基准上取得了最先进的结果。
AR-VLA: 面向视觉-语言-动作模型的真正自回归动作专家
提出了AR-VLA,一个自回归动作专家,它通过长期记忆生成连续的、具有上下文感知能力的机器人策略训练的动作序列,相比反应式VLA模型,提高了轨迹平滑度和任务成功率。